{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/101","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":101,"pages_in_order":152,"rows_per_page":100,"rows":[10001,10100],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/100","next":"/task/reinforcement-learning-1/papers/102","papers":[{"url":null,"slug":"an-elementary-proof-that-q-learning-converges","title":"An Elementary Proof that Q-learning Converges Almost Surely","date":"2021-08-05","arxiv_id":"2108.02827","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-no-regret-instance-dependent-pac","title":"Beyond No Regret: Instance-Dependent PAC Reinforcement Learning","date":"2021-08-05","arxiv_id":"2108.02717","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-continuous","title":"Deep Reinforcement Learning for Continuous Docking Control of Autonomous Underwater Vehicles: A Benchmarking Study","date":"2021-08-05","arxiv_id":"2108.02665","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilling-neuron-spike-with-high-temperature","title":"Distilling Neuron Spike with High Temperature in Reinforcement Learning Agents","date":"2021-08-05","arxiv_id":"2108.10078","repositories_listed":0,"syntology":null},{"url":null,"slug":"drl-based-slice-placement-under-non","title":"DRL-based Slice Placement Under Non-Stationary Conditions","date":"2021-08-05","arxiv_id":"2108.02495","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensemble-consensus-based-representation-deep","title":"Ensemble Consensus-based Representation Deep Reinforcement Learning for Hybrid FSO/RF Communication Systems","date":"2021-08-05","arxiv_id":"2108.02551","repositories_listed":0,"syntology":null},{"url":null,"slug":"lyapunov-robust-constrained-mdps-soft","title":"Lyapunov Robust Constrained-MDPs: Soft-Constrained Robustly Stable Policy Optimization under Model Uncertainty","date":"2021-08-05","arxiv_id":"2108.02701","repositories_listed":0,"syntology":null},{"url":null,"slug":"mean-field-multi-agent-reinforcement-learning-1","title":"Mean-Field Multi-Agent Reinforcement Learning: A Decentralized Network Approach","date":"2021-08-05","arxiv_id":"2108.02731","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-robustness-of-controlled-deep","title":"On the Robustness of Controlled Deep Reinforcement Learning for Slice Placement","date":"2021-08-05","arxiv_id":"2108.02505","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-model-free-reinforcement-learning-for","title":"Online Model-Free Reinforcement Learning for the Automatic Control of a Flexible Wing Aircraft","date":"2021-08-05","arxiv_id":"2108.02393","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-intelligent","title":"Reinforcement Learning for Intelligent Healthcare Systems: A Comprehensive Survey","date":"2021-08-05","arxiv_id":"2108.04087","repositories_listed":0,"syntology":null},{"url":null,"slug":"responding-to-illegal-activities-along-the","title":"Responding to Illegal Activities Along the Canadian Coastlines Using Reinforcement Learning","date":"2021-08-05","arxiv_id":"2108.03169","repositories_listed":0,"syntology":null},{"url":null,"slug":"ris-assisted-uav-communications-for-iot-with","title":"RIS-assisted UAV Communications for IoT with Wireless Power Transfer Using Deep Reinforcement Learning","date":"2021-08-05","arxiv_id":"2108.02889","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-decentralized-multi-agent","title":"Offline Decentralized Multi-Agent Reinforcement Learning","date":"2021-08-04","arxiv_id":"2108.01832","repositories_listed":0,"syntology":null},{"url":null,"slug":"parallelized-reverse-curriculum-generation","title":"Parallelized Reverse Curriculum Generation","date":"2021-08-04","arxiv_id":"2108.02128","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradients-incorporating-the-future","title":"Policy Gradients Incorporating the Future","date":"2021-08-04","arxiv_id":"2108.02096","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-the-convergence-of-human-in-the","title":"Accelerating the Learning of TAMER with Counterfactual Explanations","date":"2021-08-03","arxiv_id":"2108.01358","repositories_listed":0,"syntology":null},{"url":null,"slug":"controlled-deep-reinforcement-learning-for","title":"Controlled Deep Reinforcement Learning for Optimized Slice Placement","date":"2021-08-03","arxiv_id":"2108.01544","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-networked","title":"Deep Reinforcement Learning Based Networked Control with Network Delays for Signal Temporal Logic Specifications","date":"2021-08-03","arxiv_id":"2108.01317","repositories_listed":0,"syntology":null},{"url":null,"slug":"factor-representation-and-decision-making-in","title":"Factor Representation and Decision Making in Stock Markets Using Deep Reinforcement Learning","date":"2021-08-03","arxiv_id":"2108.01758","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-management-of-the-peak-power-penalty","title":"Optimal Management of the Peak Power Penalty for Smart Grids Using MPC-based Reinforcement Learning","date":"2021-08-03","arxiv_id":"2108.01459","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-against-deep","title":"Adversarial Attacks Against Deep Reinforcement Learning Framework in Internet of Vehicles","date":"2021-08-02","arxiv_id":"2108.00833","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-proposal-interactively-learning-to","title":"A Proposal: Interactively Learning to Summarise Timelines by Reinforcement Learning","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-5","title":"A Reinforcement Learning Approach for Scheduling in mmWave Networks","date":"2021-08-01","arxiv_id":"2108.00548","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-monte-carlo-methods-for-noisy-and","title":"A survey of Monte Carlo methods for noisy and costly densities with application to reinforcement learning and ABC","date":"2021-08-01","arxiv_id":"2108.00490","repositories_listed":0,"syntology":null},{"url":null,"slug":"better-chinese-sentence-segmentation-with","title":"Better Chinese Sentence Segmentation with Reinforcement Learning","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-text-based-reinforcement-learning","title":"Efficient Text-based Reinforcement Learning by Jointly Leveraging State and Commonsense Graph Representations","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-reinforcement-learning-for-table","title":"Interactive Reinforcement Learning for Table Balancing Robot","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-based-general-action-template-for","title":"Language-based General Action Template for Reinforcement Learning Agents","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"low-resource-machine-translation-based-on","title":"Low-Resource Machine Translation based on Asynchronous Dynamic Programming","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-for-mastering","title":"Meta-Reinforcement Learning for Mastering Multiple Skills and Generalizing across Environments in Text-based Games","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rule-aware-reinforcement-learning-for","title":"Rule-Aware Reinforcement Learning for Knowledge Graph Reasoning","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uav-trajectory-planning-in-wireless-sensor","title":"UAV Trajectory Planning in Wireless Sensor Networks for Energy Consumption Minimization by Deep Reinforcement Learning","date":"2021-08-01","arxiv_id":"2108.00354","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-intelligent-energy-management-framework","title":"An Intelligent Energy Management Framework for Hybrid-Electric Propulsion Systems Using Deep Reinforcement Learning","date":"2021-07-31","arxiv_id":"2108.00256","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-for-strategy","title":"Inverse Reinforcement Learning for Strategy Identification","date":"2021-07-31","arxiv_id":"2108.00293","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-control-direct-current-motor-for","title":"Learning to Control DC Motor for Micromobility in Real Time with Reinforcement Learning","date":"2021-07-31","arxiv_id":"2108.00138","repositories_listed":0,"syntology":null},{"url":null,"slug":"physics-informed-dyna-style-model-based-deep","title":"Physics-informed Dyna-Style Model-Based Deep Reinforcement Learning for Dynamic Control","date":"2021-07-31","arxiv_id":"2108.00128","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-entropy-dueling-network-architecture","title":"Maximum Entropy Dueling Network Architecture in Atari Domain","date":"2021-07-30","arxiv_id":"2107.14457","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-network-based-model-predictive-control","title":"Neural Network Based Model Predictive Control for an Autonomous Vehicle","date":"2021-07-30","arxiv_id":"2107.14573","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporation-of-deep-neural-network","title":"Incorporation of Deep Neural Network & Reinforcement Learning with Domain Knowledge","date":"2021-07-29","arxiv_id":"2107.14613","repositories_listed":0,"syntology":null},{"url":null,"slug":"lyapunov-based-uncertainty-aware-safe","title":"Lyapunov-based uncertainty-aware safe reinforcement learning","date":"2021-07-29","arxiv_id":"2107.13944","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-markovian-reinforcement-learning-using","title":"Non-Markovian Reinforcement Learning using Fractional Dynamics","date":"2021-07-29","arxiv_id":"2107.13790","repositories_listed":0,"syntology":null},{"url":null,"slug":"rso-a-novel-reinforced-swarm-optimization","title":"RSO: A Novel Reinforced Swarm Optimization Algorithm for Feature Selection","date":"2021-07-29","arxiv_id":"2107.14199","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-recent-multi-agent-reinforcement","title":"Survey of Recent Multi-Agent Reinforcement Learning Algorithms Utilizing Centralized Training","date":"2021-07-29","arxiv_id":"2107.14316","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-graph-reinforcement-learning-model-for","title":"A Deep Graph Reinforcement Learning Model for Improving User Experience in Live Video Streaming","date":"2021-07-28","arxiv_id":"2107.13619","repositories_listed":0,"syntology":null},{"url":null,"slug":"packet-routing-with-graph-attention-multi","title":"Packet Routing with Graph Attention Multi-agent Reinforcement Learning","date":"2021-07-28","arxiv_id":"2107.13181","repositories_listed":0,"syntology":null},{"url":null,"slug":"relmm-practical-rl-for-learning-mobile","title":"Fully Autonomous Real-World Reinforcement Learning with Applications to Mobile Manipulation","date":"2021-07-28","arxiv_id":"2107.13545","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-based-reinforcement-learning-for","title":"Value-Based Reinforcement Learning for Continuous Control Robotic Manipulation in Multi-Task Sparse Reward Settings","date":"2021-07-28","arxiv_id":"2107.13356","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-l3-slice","title":"Deep Reinforcement Learning for L3 Slice Localization in Sarcopenia Assessment","date":"2021-07-27","arxiv_id":"2107.12800","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-level-reinforcement-learning-through","title":"Human-Level Reinforcement Learning through Theory-Based Modeling, Exploration, and Planning","date":"2021-07-27","arxiv_id":"2107.12544","repositories_listed":0,"syntology":null},{"url":null,"slug":"persistent-reinforcement-learning-via-subgoal","title":"Autonomous Reinforcement Learning via Subgoal Curricula","date":"2021-07-27","arxiv_id":"2107.12931","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-formal","title":"Reinforcement Learning with Formal Performance Metrics for Quadcopter Attitude Control under Non-nominal Contexts","date":"2021-07-27","arxiv_id":"2107.12942","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-distributed-reinforcement","title":"Asynchronous Distributed Reinforcement Learning for LQR Control via Zeroth-Order Block Coordinate Descent","date":"2021-07-26","arxiv_id":"2107.12416","repositories_listed":0,"syntology":null},{"url":null,"slug":"playtesting-what-is-beyond-personas","title":"Playtesting: What is Beyond Personas","date":"2021-07-26","arxiv_id":"2107.11965","repositories_listed":0,"syntology":null},{"url":null,"slug":"dr2l-surfacing-corner-cases-to-robustify","title":"DR2L: Surfacing Corner Cases to Robustify Autonomous Driving via Domain Randomization Reinforcement Learning","date":"2021-07-25","arxiv_id":"2107.11762","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-imitation-learning-by-free-energy","title":"Reinforced Imitation Learning by Free Energy Principle","date":"2021-07-25","arxiv_id":"2107.11811","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-exploration-for-multi-agent-deep","title":"Cooperative Exploration for Multi-Agent Deep Reinforcement Learning","date":"2021-07-23","arxiv_id":"2107.11444","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-quadruped-locomotion-policies-with","title":"Learning Quadruped Locomotion Policies using Logical Rules","date":"2021-07-23","arxiv_id":"2107.10969","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-resource","title":"A reinforcement learning approach to resource allocation in genomic selection","date":"2021-07-22","arxiv_id":"2107.10901","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-for-7","title":"A Deep Reinforcement Learning Approach for Fair Traffic Signal Control","date":"2021-07-21","arxiv_id":"2107.10146","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-controller-fusion-leveraging-control","title":"Bayesian Controller Fusion: Leveraging Control Priors in Deep Reinforcement Learning for Robotics","date":"2021-07-21","arxiv_id":"2107.09822","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-agent-training-with","title":"Reinforcement Learning Agent Training with Goals for Real World Tasks","date":"2021-07-21","arxiv_id":"2107.10390","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-altruistic-behaviours-in","title":"Learning Altruistic Behaviours in Reinforcement Learning without External Rewards","date":"2021-07-20","arxiv_id":"2107.09598","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-1","title":"Improved Reinforcement Learning in Cooperative Multi-agent Environments Using Knowledge Transfer","date":"2021-07-20","arxiv_id":"2107.09807","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-optimization-for-tracking","title":"Proximal Policy Optimization for Tracking Control Exploiting Future Reference Information","date":"2021-07-20","arxiv_id":"2107.09647","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-analysis-of-reinforcement-learning-for","title":"An Analysis of Reinforcement Learning for Malaria Control","date":"2021-07-19","arxiv_id":"2107.08988","repositories_listed":0,"syntology":null},{"url":null,"slug":"constraints-penalized-q-learning-for-safe","title":"Constraints Penalized Q-learning for Safe Offline Reinforcement Learning","date":"2021-07-19","arxiv_id":"2107.09003","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-reward-shaping-for-efficient","title":"Multimodal Reward Shaping for Efficient Exploration in Reinforcement Learning","date":"2021-07-19","arxiv_id":"2107.08888","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-multi-task-reinforcement","title":"Provably Efficient Multi-Task Reinforcement Learning with Model Transfer","date":"2021-07-19","arxiv_id":"2107.08622","repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-world-belief-for-reinforcement","title":"Structured World Belief for Reinforcement Learning in POMDP","date":"2021-07-19","arxiv_id":"2107.08577","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-representation-of-successor-features","title":"A New Representation of Successor Features for Transfer across Dissimilar Environments","date":"2021-07-18","arxiv_id":"2107.08426","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-accuracy-model-based-reinforcement","title":"High-Accuracy Model-Based Reinforcement Learning, a Survey","date":"2021-07-17","arxiv_id":"2107.08241","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-robustness-of-deep-reinforcement","title":"On the Robustness of Deep Reinforcement Learning in IRS-Aided Wireless Communications Systems","date":"2021-07-17","arxiv_id":"2107.08293","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-the-convergence-of-reinforcement","title":"Boosting the Convergence of Reinforcement Learning-based Auto-pruning Using Historical Data","date":"2021-07-16","arxiv_id":"2107.08815","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-multi-agent-reinforcement-2","title":"Decentralized Multi-Agent Reinforcement Learning for Task Offloading Under Uncertainty","date":"2021-07-16","arxiv_id":"2107.08114","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-loop-invariant-synthesis-via","title":"Learning Heuristics for Template-based CEGIS of Loop Invariants with Reinforcement Learning","date":"2021-07-16","arxiv_id":"2107.09766","repositories_listed":0,"syntology":null},{"url":null,"slug":"geometric-value-iteration-dynamic-error-aware","title":"Geometric Value Iteration: Dynamic Error-Aware KL Regularization for Reinforcement Learning","date":"2021-07-16","arxiv_id":"2107.07659","repositories_listed":0,"syntology":null},{"url":null,"slug":"modrl-d-el-multiobjective-deep-reinforcement","title":"MODRL/D-EL: Multiobjective Deep Reinforcement Learning with Evolutionary Learning for Multiobjective Optimization","date":"2021-07-16","arxiv_id":"2107.07961","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-risk-sensitive-reinforcement-learning","title":"Robust Risk-Sensitive Reinforcement Learning Agents for Trading Markets","date":"2021-07-16","arxiv_id":"2107.08083","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-dynamic-2","title":"Deep Reinforcement Learning based Dynamic Optimization of Bus Timetable","date":"2021-07-15","arxiv_id":"2107.07066","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluation-of-human-ai-teams-for-learned-and","title":"Evaluation of Human-AI Teams for Learned and Rule-Based Agents in Hanabi","date":"2021-07-15","arxiv_id":"2107.07630","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-level-decisions-from-a-safe-maneuver","title":"High-level Decisions from a Safe Maneuver Catalog with Reinforcement Learning for Safe and Cooperative Automated Merging","date":"2021-07-15","arxiv_id":"2107.07413","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimizing-safety-interference-for-safe-and","title":"Minimizing Safety Interference for Safe and Comfortable Automated Driving with Distributional Reinforcement Learning","date":"2021-07-15","arxiv_id":"2107.07316","repositories_listed":0,"syntology":null},{"url":null,"slug":"mural-meta-learning-uncertainty-aware-rewards","title":"MURAL: Meta-Learning Uncertainty-Aware Rewards for Outcome-Driven Reinforcement Learning","date":"2021-07-15","arxiv_id":"2107.07184","repositories_listed":0,"syntology":null},{"url":null,"slug":"neusaver-neural-adaptive-power-consumption","title":"NeuSaver: Neural Adaptive Power Consumption Optimization for Mobile Video Streaming","date":"2021-07-15","arxiv_id":"2107.07127","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-education","title":"Reinforcement Learning for Education: Opportunities and Challenges","date":"2021-07-15","arxiv_id":"2107.08828","repositories_listed":0,"syntology":null},{"url":null,"slug":"experimental-evidence-that-empowerment-may","title":"Experimental Evidence that Empowerment May Drive Exploration in Sparse-Reward Environments","date":"2021-07-14","arxiv_id":"2107.07031","repositories_listed":0,"syntology":null},{"url":null,"slug":"going-beyond-linear-rl-sample-efficient","title":"Going Beyond Linear RL: Sample Efficient Neural Function Approximation","date":"2021-07-14","arxiv_id":"2107.06466","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixing-human-demonstrations-with-self","title":"Mixing Human Demonstrations with Self-Exploration in Experience Replay for Deep Reinforcement Learning","date":"2021-07-14","arxiv_id":"2107.06840","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-reinforcement-learning-for-robust","title":"Model-free Reinforcement Learning for Robust Locomotion using Demonstrations from Trajectory Optimization","date":"2021-07-14","arxiv_id":"2107.06629","repositories_listed":0,"syntology":null},{"url":null,"slug":"plan-based-relaxed-reward-shaping-for-goal","title":"Plan-Based Relaxed Reward Shaping for Goal-Directed Tasks","date":"2021-07-14","arxiv_id":"2107.06661","repositories_listed":0,"syntology":null},{"url":null,"slug":"qos-aware-scheduling-in-new-radio-using-deep","title":"QoS-Aware Scheduling in New Radio Using Deep Reinforcement Learning","date":"2021-07-14","arxiv_id":"2107.06570","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-evaluation-of-multi-agent","title":"Scalable Evaluation of Multi-Agent Reinforcement Learning with Melting Pot","date":"2021-07-14","arxiv_id":"2107.06857","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-for-6","title":"A Deep Reinforcement Learning Approach for Traffic Signal Control Optimization","date":"2021-07-13","arxiv_id":"2107.06115","repositories_listed":0,"syntology":null},{"url":null,"slug":"cautious-policy-programming-exploiting-kl","title":"Cautious Policy Programming: Exploiting KL Regularization in Monotonic Policy Improvement for Reinforcement Learning","date":"2021-07-13","arxiv_id":"2107.05798","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-selection-with-near-optimal-rates-for","title":"Model Selection for Generic Reinforcement Learning","date":"2021-07-13","arxiv_id":"2107.05849","repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimistic-model-based-offline-rl-pac-bounds","title":"Pessimistic Model-based Offline Reinforcement Learning under Partial Coverage","date":"2021-07-13","arxiv_id":"2107.06226","repositories_listed":0,"syntology":null},{"url":null,"slug":"why-generalization-in-rl-is-difficult","title":"Why Generalization in RL is Difficult: Epistemic POMDPs and Implicit Partial Observability","date":"2021-07-13","arxiv_id":"2107.06277","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-reward-free-approach-to-constrained","title":"A Simple Reward-free Approach to Constrained Reinforcement Learning","date":"2021-07-12","arxiv_id":"2107.05216","repositories_listed":0,"syntology":null},{"url":null,"slug":"polynomial-time-reinforcement-learning-in","title":"Polynomial Time Reinforcement Learning in Factored State MDPs with Linear Value Functions","date":"2021-07-12","arxiv_id":"2107.05187","repositories_listed":0,"syntology":null}],"record_sha256":"76262f2803a1821543dd28781429501087ff7e3c7ce74139d3a657dadf686845","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}