{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/92","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":92,"pages_in_order":135,"rows_per_page":100,"rows":[9101,9200],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/91","next":"/task/reinforcement-learning-2/papers/93","papers":[{"url":null,"slug":"introduction-to-quantum-reinforcement","title":"Introduction to Quantum Reinforcement Learning: Theory and PennyLane-based Implementation","date":"2021-08-16","arxiv_id":"2108.06849","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-to-tree-policy-distillation-with","title":"Neural-to-Tree Policy Distillation with Policy Improvement Criterion","date":"2021-08-16","arxiv_id":"2108.06898","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-emergence-of-wireless-mac-protocols-with","title":"The Emergence of Wireless MAC Protocols with Multi-Agent Reinforcement Learning","date":"2021-08-16","arxiv_id":"2108.07144","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-cyber-terrain-in-reinforcement-learning","title":"Using Cyber Terrain in Reinforcement Learning for Penetration Testing","date":"2021-08-16","arxiv_id":"2108.07124","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-scheduling-of-isolated-microgrids","title":"Optimal Scheduling of Isolated Microgrids Using Automated Reinforcement Learning-based Multi-period Forecasting","date":"2021-08-15","arxiv_id":"2108.06764","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-selection-of-informative-path","title":"Adaptive Selection of Informative Path Planning Strategies via Reinforcement Learning","date":"2021-08-14","arxiv_id":"2108.06618","repositories_listed":0,"syntology":null},{"url":null,"slug":"fractional-transfer-learning-for-deep-model","title":"Fractional Transfer Learning for Deep Model-Based Reinforcement Learning","date":"2021-08-14","arxiv_id":"2108.06526","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-assign-towards-fair-task","title":"Learning to Assign: Towards Fair Task Assignment in Large-Scale Ride Hailing","date":"2021-08-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-online-reinforcement-learning-for","title":"Offline-Online Reinforcement Learning for Energy Pricing in Office Demand Response: Lowering Energy and Data Costs","date":"2021-08-14","arxiv_id":"2108.06594","repositories_listed":0,"syntology":null},{"url":null,"slug":"hac-explore-accelerating-exploration-with","title":"HAC Explore: Accelerating Exploration with Hierarchical Reinforcement Learning","date":"2021-08-12","arxiv_id":"2108.05872","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-approach-to-active","title":"Reinforcement Learning Approach to Active Learning for Image Classification","date":"2021-08-12","arxiv_id":"2108.05595","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-explicit-prediction-matter-in-energy","title":"Does Explicit Prediction Matter in Deep Reinforcement Learning-Based Energy Management?","date":"2021-08-11","arxiv_id":"2108.05099","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-process-design-and-control-using","title":"Integrating process design and control using reinforcement learning","date":"2021-08-11","arxiv_id":"2108.05242","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-level-pose-control-of-tilting-multirotor","title":"Low-level Pose Control of Tilting Multirotor for Wall Perching Tasks Using Reinforcement Learning","date":"2021-08-11","arxiv_id":"2108.05457","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-deep-reinforcement-learning-for-1","title":"A Survey on Deep Reinforcement Learning for Data Processing and Analytics","date":"2021-08-10","arxiv_id":"2108.04526","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-quality-related-search-query-suggestions","title":"High Quality Related Search Query Suggestions using Deep Reinforcement Learning","date":"2021-08-10","arxiv_id":"2108.04452","repositories_listed":0,"syntology":null},{"url":null,"slug":"bob-and-alice-go-to-a-bar-reasoning-about","title":"Bob and Alice Go to a Bar: Reasoning About Future With Probabilistic Programs","date":"2021-08-09","arxiv_id":"2108.03834","repositories_listed":0,"syntology":null},{"url":null,"slug":"mis-spoke-or-mis-lead-achieving-robustness-in","title":"Mis-spoke or mis-lead: Achieving Robustness in Multi-Agent Communicative Reinforcement Learning","date":"2021-08-09","arxiv_id":"2108.03803","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-proxemic-behavior-using","title":"Learning Proxemic Behavior Using Reinforcement Learning with Cognitive Agents","date":"2021-08-08","arxiv_id":"2108.03730","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-difficulty-of-generalizing","title":"On the Difficulty of Generalizing Reinforcement Learning Framework for Combinatorial Optimization","date":"2021-08-08","arxiv_id":"2108.03713","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-bootstrap-inference-for-policy","title":"Online Bootstrap Inference For Policy Evaluation in Reinforcement Learning","date":"2021-08-08","arxiv_id":"2108.03706","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-representation-for-electric-vehicle","title":"Efficient Representation for Electric Vehicle Charging Station Operations using Reinforcement Learning","date":"2021-08-07","arxiv_id":"2108.03236","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-on-dense-and-sparse-visual-rewards-in","title":"A Study on Dense and Sparse (Visual) Rewards in Robot Policy Learning","date":"2021-08-06","arxiv_id":"2108.03222","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-intelligent-3","title":"Deep Reinforcement Learning for Intelligent Reflecting Surface-assisted D2D Communications","date":"2021-08-06","arxiv_id":"2108.02892","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-tracklets-an-object-centric","title":"Semantic Tracklets: An Object-Centric Representation for Visual Multi-Agent Reinforcement Learning","date":"2021-08-06","arxiv_id":"2108.03319","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-reinforcement-learning-over-mdps","title":"Active Reinforcement Learning over MDPs","date":"2021-08-05","arxiv_id":"2108.02323","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-elementary-proof-that-q-learning-converges","title":"An Elementary Proof that Q-learning Converges Almost Surely","date":"2021-08-05","arxiv_id":"2108.02827","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-no-regret-instance-dependent-pac","title":"Beyond No Regret: Instance-Dependent PAC Reinforcement Learning","date":"2021-08-05","arxiv_id":"2108.02717","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilling-neuron-spike-with-high-temperature","title":"Distilling Neuron Spike with High Temperature in Reinforcement Learning Agents","date":"2021-08-05","arxiv_id":"2108.10078","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensemble-consensus-based-representation-deep","title":"Ensemble Consensus-based Representation Deep Reinforcement Learning for Hybrid FSO/RF Communication Systems","date":"2021-08-05","arxiv_id":"2108.02551","repositories_listed":0,"syntology":null},{"url":null,"slug":"lyapunov-robust-constrained-mdps-soft","title":"Lyapunov Robust Constrained-MDPs: Soft-Constrained Robustly Stable Policy Optimization under Model Uncertainty","date":"2021-08-05","arxiv_id":"2108.02701","repositories_listed":0,"syntology":null},{"url":null,"slug":"mean-field-multi-agent-reinforcement-learning-1","title":"Mean-Field Multi-Agent Reinforcement Learning: A Decentralized Network Approach","date":"2021-08-05","arxiv_id":"2108.02731","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-robustness-of-controlled-deep","title":"On the Robustness of Controlled Deep Reinforcement Learning for Slice Placement","date":"2021-08-05","arxiv_id":"2108.02505","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-model-free-reinforcement-learning-for","title":"Online Model-Free Reinforcement Learning for the Automatic Control of a Flexible Wing Aircraft","date":"2021-08-05","arxiv_id":"2108.02393","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-intelligent","title":"Reinforcement Learning for Intelligent Healthcare Systems: A Comprehensive Survey","date":"2021-08-05","arxiv_id":"2108.04087","repositories_listed":0,"syntology":null},{"url":null,"slug":"responding-to-illegal-activities-along-the","title":"Responding to Illegal Activities Along the Canadian Coastlines Using Reinforcement Learning","date":"2021-08-05","arxiv_id":"2108.03169","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-decentralized-multi-agent","title":"Offline Decentralized Multi-Agent Reinforcement Learning","date":"2021-08-04","arxiv_id":"2108.01832","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-the-convergence-of-human-in-the","title":"Accelerating the Learning of TAMER with Counterfactual Explanations","date":"2021-08-03","arxiv_id":"2108.01358","repositories_listed":0,"syntology":null},{"url":null,"slug":"controlled-deep-reinforcement-learning-for","title":"Controlled Deep Reinforcement Learning for Optimized Slice Placement","date":"2021-08-03","arxiv_id":"2108.01544","repositories_listed":0,"syntology":null},{"url":null,"slug":"factor-representation-and-decision-making-in","title":"Factor Representation and Decision Making in Stock Markets Using Deep Reinforcement Learning","date":"2021-08-03","arxiv_id":"2108.01758","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-against-deep","title":"Adversarial Attacks Against Deep Reinforcement Learning Framework in Internet of Vehicles","date":"2021-08-02","arxiv_id":"2108.00833","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-proposal-interactively-learning-to","title":"A Proposal: Interactively Learning to Summarise Timelines by Reinforcement Learning","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-5","title":"A Reinforcement Learning Approach for Scheduling in mmWave Networks","date":"2021-08-01","arxiv_id":"2108.00548","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-monte-carlo-methods-for-noisy-and","title":"A survey of Monte Carlo methods for noisy and costly densities with application to reinforcement learning and ABC","date":"2021-08-01","arxiv_id":"2108.00490","repositories_listed":0,"syntology":null},{"url":null,"slug":"better-chinese-sentence-segmentation-with","title":"Better Chinese Sentence Segmentation with Reinforcement Learning","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-reinforcement-learning-for-table","title":"Interactive Reinforcement Learning for Table Balancing Robot","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-based-general-action-template-for","title":"Language-based General Action Template for Reinforcement Learning Agents","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"low-resource-machine-translation-based-on","title":"Low-Resource Machine Translation based on Asynchronous Dynamic Programming","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-for-mastering","title":"Meta-Reinforcement Learning for Mastering Multiple Skills and Generalizing across Environments in Text-based Games","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rule-aware-reinforcement-learning-for","title":"Rule-Aware Reinforcement Learning for Knowledge Graph Reasoning","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-for-strategy","title":"Inverse Reinforcement Learning for Strategy Identification","date":"2021-07-31","arxiv_id":"2108.00293","repositories_listed":0,"syntology":null},{"url":null,"slug":"physics-informed-dyna-style-model-based-deep","title":"Physics-informed Dyna-Style Model-Based Deep Reinforcement Learning for Dynamic Control","date":"2021-07-31","arxiv_id":"2108.00128","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-entropy-dueling-network-architecture","title":"Maximum Entropy Dueling Network Architecture in Atari Domain","date":"2021-07-30","arxiv_id":"2107.14457","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-network-based-model-predictive-control","title":"Neural Network Based Model Predictive Control for an Autonomous Vehicle","date":"2021-07-30","arxiv_id":"2107.14573","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporation-of-deep-neural-network","title":"Incorporation of Deep Neural Network & Reinforcement Learning with Domain Knowledge","date":"2021-07-29","arxiv_id":"2107.14613","repositories_listed":0,"syntology":null},{"url":null,"slug":"lyapunov-based-uncertainty-aware-safe","title":"Lyapunov-based uncertainty-aware safe reinforcement learning","date":"2021-07-29","arxiv_id":"2107.13944","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-markovian-reinforcement-learning-using","title":"Non-Markovian Reinforcement Learning using Fractional Dynamics","date":"2021-07-29","arxiv_id":"2107.13790","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-recent-multi-agent-reinforcement","title":"Survey of Recent Multi-Agent Reinforcement Learning Algorithms Utilizing Centralized Training","date":"2021-07-29","arxiv_id":"2107.14316","repositories_listed":0,"syntology":null},{"url":null,"slug":"packet-routing-with-graph-attention-multi","title":"Packet Routing with Graph Attention Multi-agent Reinforcement Learning","date":"2021-07-28","arxiv_id":"2107.13181","repositories_listed":0,"syntology":null},{"url":null,"slug":"relmm-practical-rl-for-learning-mobile","title":"Fully Autonomous Real-World Reinforcement Learning with Applications to Mobile Manipulation","date":"2021-07-28","arxiv_id":"2107.13545","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-based-reinforcement-learning-for","title":"Value-Based Reinforcement Learning for Continuous Control Robotic Manipulation in Multi-Task Sparse Reward Settings","date":"2021-07-28","arxiv_id":"2107.13356","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-l3-slice","title":"Deep Reinforcement Learning for L3 Slice Localization in Sarcopenia Assessment","date":"2021-07-27","arxiv_id":"2107.12800","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-level-reinforcement-learning-through","title":"Human-Level Reinforcement Learning through Theory-Based Modeling, Exploration, and Planning","date":"2021-07-27","arxiv_id":"2107.12544","repositories_listed":0,"syntology":null},{"url":null,"slug":"persistent-reinforcement-learning-via-subgoal","title":"Autonomous Reinforcement Learning via Subgoal Curricula","date":"2021-07-27","arxiv_id":"2107.12931","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-formal","title":"Reinforcement Learning with Formal Performance Metrics for Quadcopter Attitude Control under Non-nominal Contexts","date":"2021-07-27","arxiv_id":"2107.12942","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-distributed-reinforcement","title":"Asynchronous Distributed Reinforcement Learning for LQR Control via Zeroth-Order Block Coordinate Descent","date":"2021-07-26","arxiv_id":"2107.12416","repositories_listed":0,"syntology":null},{"url":null,"slug":"dr2l-surfacing-corner-cases-to-robustify","title":"DR2L: Surfacing Corner Cases to Robustify Autonomous Driving via Domain Randomization Reinforcement Learning","date":"2021-07-25","arxiv_id":"2107.11762","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-exploration-for-multi-agent-deep","title":"Cooperative Exploration for Multi-Agent Deep Reinforcement Learning","date":"2021-07-23","arxiv_id":"2107.11444","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-resource","title":"A reinforcement learning approach to resource allocation in genomic selection","date":"2021-07-22","arxiv_id":"2107.10901","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-for-7","title":"A Deep Reinforcement Learning Approach for Fair Traffic Signal Control","date":"2021-07-21","arxiv_id":"2107.10146","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-controller-fusion-leveraging-control","title":"Bayesian Controller Fusion: Leveraging Control Priors in Deep Reinforcement Learning for Robotics","date":"2021-07-21","arxiv_id":"2107.09822","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-agent-training-with","title":"Reinforcement Learning Agent Training with Goals for Real World Tasks","date":"2021-07-21","arxiv_id":"2107.10390","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-altruistic-behaviours-in","title":"Learning Altruistic Behaviours in Reinforcement Learning without External Rewards","date":"2021-07-20","arxiv_id":"2107.09598","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-1","title":"Improved Reinforcement Learning in Cooperative Multi-agent Environments Using Knowledge Transfer","date":"2021-07-20","arxiv_id":"2107.09807","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-optimization-for-tracking","title":"Proximal Policy Optimization for Tracking Control Exploiting Future Reference Information","date":"2021-07-20","arxiv_id":"2107.09647","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-autonomously","title":"Using reinforcement learning to autonomously identify sources of error for agents in group missions","date":"2021-07-20","arxiv_id":"2107.09232","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-analysis-of-reinforcement-learning-for","title":"An Analysis of Reinforcement Learning for Malaria Control","date":"2021-07-19","arxiv_id":"2107.08988","repositories_listed":0,"syntology":null},{"url":null,"slug":"constraints-penalized-q-learning-for-safe","title":"Constraints Penalized Q-learning for Safe Offline Reinforcement Learning","date":"2021-07-19","arxiv_id":"2107.09003","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-reward-shaping-for-efficient","title":"Multimodal Reward Shaping for Efficient Exploration in Reinforcement Learning","date":"2021-07-19","arxiv_id":"2107.08888","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-multi-task-reinforcement","title":"Provably Efficient Multi-Task Reinforcement Learning with Model Transfer","date":"2021-07-19","arxiv_id":"2107.08622","repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-world-belief-for-reinforcement","title":"Structured World Belief for Reinforcement Learning in POMDP","date":"2021-07-19","arxiv_id":"2107.08577","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-accuracy-model-based-reinforcement","title":"High-Accuracy Model-Based Reinforcement Learning, a Survey","date":"2021-07-17","arxiv_id":"2107.08241","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-robustness-of-deep-reinforcement","title":"On the Robustness of Deep Reinforcement Learning in IRS-Aided Wireless Communications Systems","date":"2021-07-17","arxiv_id":"2107.08293","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-the-convergence-of-reinforcement","title":"Boosting the Convergence of Reinforcement Learning-based Auto-pruning Using Historical Data","date":"2021-07-16","arxiv_id":"2107.08815","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-multi-agent-reinforcement-2","title":"Decentralized Multi-Agent Reinforcement Learning for Task Offloading Under Uncertainty","date":"2021-07-16","arxiv_id":"2107.08114","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-loop-invariant-synthesis-via","title":"Learning Heuristics for Template-based CEGIS of Loop Invariants with Reinforcement Learning","date":"2021-07-16","arxiv_id":"2107.09766","repositories_listed":0,"syntology":null},{"url":null,"slug":"geometric-value-iteration-dynamic-error-aware","title":"Geometric Value Iteration: Dynamic Error-Aware KL Regularization for Reinforcement Learning","date":"2021-07-16","arxiv_id":"2107.07659","repositories_listed":0,"syntology":null},{"url":null,"slug":"modrl-d-el-multiobjective-deep-reinforcement","title":"MODRL/D-EL: Multiobjective Deep Reinforcement Learning with Evolutionary Learning for Multiobjective Optimization","date":"2021-07-16","arxiv_id":"2107.07961","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-risk-sensitive-reinforcement-learning","title":"Robust Risk-Sensitive Reinforcement Learning Agents for Trading Markets","date":"2021-07-16","arxiv_id":"2107.08083","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-dynamic-2","title":"Deep Reinforcement Learning based Dynamic Optimization of Bus Timetable","date":"2021-07-15","arxiv_id":"2107.07066","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluation-of-human-ai-teams-for-learned-and","title":"Evaluation of Human-AI Teams for Learned and Rule-Based Agents in Hanabi","date":"2021-07-15","arxiv_id":"2107.07630","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimizing-safety-interference-for-safe-and","title":"Minimizing Safety Interference for Safe and Comfortable Automated Driving with Distributional Reinforcement Learning","date":"2021-07-15","arxiv_id":"2107.07316","repositories_listed":0,"syntology":null},{"url":null,"slug":"mural-meta-learning-uncertainty-aware-rewards","title":"MURAL: Meta-Learning Uncertainty-Aware Rewards for Outcome-Driven Reinforcement Learning","date":"2021-07-15","arxiv_id":"2107.07184","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-education","title":"Reinforcement Learning for Education: Opportunities and Challenges","date":"2021-07-15","arxiv_id":"2107.08828","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixing-human-demonstrations-with-self","title":"Mixing Human Demonstrations with Self-Exploration in Experience Replay for Deep Reinforcement Learning","date":"2021-07-14","arxiv_id":"2107.06840","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-reinforcement-learning-for-robust","title":"Model-free Reinforcement Learning for Robust Locomotion using Demonstrations from Trajectory Optimization","date":"2021-07-14","arxiv_id":"2107.06629","repositories_listed":0,"syntology":null},{"url":null,"slug":"qos-aware-scheduling-in-new-radio-using-deep","title":"QoS-Aware Scheduling in New Radio Using Deep Reinforcement Learning","date":"2021-07-14","arxiv_id":"2107.06570","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-evaluation-of-multi-agent","title":"Scalable Evaluation of Multi-Agent Reinforcement Learning with Melting Pot","date":"2021-07-14","arxiv_id":"2107.06857","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-for-6","title":"A Deep Reinforcement Learning Approach for Traffic Signal Control Optimization","date":"2021-07-13","arxiv_id":"2107.06115","repositories_listed":0,"syntology":null},{"url":null,"slug":"cautious-policy-programming-exploiting-kl","title":"Cautious Policy Programming: Exploiting KL Regularization in Monotonic Policy Improvement for Reinforcement Learning","date":"2021-07-13","arxiv_id":"2107.05798","repositories_listed":0,"syntology":null}],"record_sha256":"a92c05a2b776469963b515b57d99d992e5df16629a517ebe8861de76902c8769","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}