{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/82","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":82,"pages_in_order":132,"rows_per_page":100,"rows":[8101,8200],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/81","next":"/task/reinforcement-learning/papers/83","papers":[{"url":null,"slug":"mis-spoke-or-mis-lead-achieving-robustness-in","title":"Mis-spoke or mis-lead: Achieving Robustness in Multi-Agent Communicative Reinforcement Learning","date":"2021-08-09","arxiv_id":"2108.03803","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-proxemic-behavior-using","title":"Learning Proxemic Behavior Using Reinforcement Learning with Cognitive Agents","date":"2021-08-08","arxiv_id":"2108.03730","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-bootstrap-inference-for-policy","title":"Online Bootstrap Inference For Policy Evaluation in Reinforcement Learning","date":"2021-08-08","arxiv_id":"2108.03706","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-on-dense-and-sparse-visual-rewards-in","title":"A Study on Dense and Sparse (Visual) Rewards in Robot Policy Learning","date":"2021-08-06","arxiv_id":"2108.03222","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-intelligent-3","title":"Deep Reinforcement Learning for Intelligent Reflecting Surface-assisted D2D Communications","date":"2021-08-06","arxiv_id":"2108.02892","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-tracklets-an-object-centric","title":"Semantic Tracklets: An Object-Centric Representation for Visual Multi-Agent Reinforcement Learning","date":"2021-08-06","arxiv_id":"2108.03319","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-reinforcement-learning-over-mdps","title":"Active Reinforcement Learning over MDPs","date":"2021-08-05","arxiv_id":"2108.02323","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-elementary-proof-that-q-learning-converges","title":"An Elementary Proof that Q-learning Converges Almost Surely","date":"2021-08-05","arxiv_id":"2108.02827","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-no-regret-instance-dependent-pac","title":"Beyond No Regret: Instance-Dependent PAC Reinforcement Learning","date":"2021-08-05","arxiv_id":"2108.02717","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilling-neuron-spike-with-high-temperature","title":"Distilling Neuron Spike with High Temperature in Reinforcement Learning Agents","date":"2021-08-05","arxiv_id":"2108.10078","repositories_listed":0,"syntology":null},{"url":null,"slug":"mean-field-multi-agent-reinforcement-learning-1","title":"Mean-Field Multi-Agent Reinforcement Learning: A Decentralized Network Approach","date":"2021-08-05","arxiv_id":"2108.02731","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-model-free-reinforcement-learning-for","title":"Online Model-Free Reinforcement Learning for the Automatic Control of a Flexible Wing Aircraft","date":"2021-08-05","arxiv_id":"2108.02393","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-intelligent","title":"Reinforcement Learning for Intelligent Healthcare Systems: A Comprehensive Survey","date":"2021-08-05","arxiv_id":"2108.04087","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-decentralized-multi-agent","title":"Offline Decentralized Multi-Agent Reinforcement Learning","date":"2021-08-04","arxiv_id":"2108.01832","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-the-convergence-of-human-in-the","title":"Accelerating the Learning of TAMER with Counterfactual Explanations","date":"2021-08-03","arxiv_id":"2108.01358","repositories_listed":0,"syntology":null},{"url":null,"slug":"controlled-deep-reinforcement-learning-for","title":"Controlled Deep Reinforcement Learning for Optimized Slice Placement","date":"2021-08-03","arxiv_id":"2108.01544","repositories_listed":0,"syntology":null},{"url":null,"slug":"factor-representation-and-decision-making-in","title":"Factor Representation and Decision Making in Stock Markets Using Deep Reinforcement Learning","date":"2021-08-03","arxiv_id":"2108.01758","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-proposal-interactively-learning-to","title":"A Proposal: Interactively Learning to Summarise Timelines by Reinforcement Learning","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-5","title":"A Reinforcement Learning Approach for Scheduling in mmWave Networks","date":"2021-08-01","arxiv_id":"2108.00548","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-monte-carlo-methods-for-noisy-and","title":"A survey of Monte Carlo methods for noisy and costly densities with application to reinforcement learning and ABC","date":"2021-08-01","arxiv_id":"2108.00490","repositories_listed":0,"syntology":null},{"url":null,"slug":"better-chinese-sentence-segmentation-with","title":"Better Chinese Sentence Segmentation with Reinforcement Learning","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-reinforcement-learning-for-table","title":"Interactive Reinforcement Learning for Table Balancing Robot","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-based-general-action-template-for","title":"Language-based General Action Template for Reinforcement Learning Agents","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"low-resource-machine-translation-based-on","title":"Low-Resource Machine Translation based on Asynchronous Dynamic Programming","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-for-mastering","title":"Meta-Reinforcement Learning for Mastering Multiple Skills and Generalizing across Environments in Text-based Games","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rule-aware-reinforcement-learning-for","title":"Rule-Aware Reinforcement Learning for Knowledge Graph Reasoning","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-for-strategy","title":"Inverse Reinforcement Learning for Strategy Identification","date":"2021-07-31","arxiv_id":"2108.00293","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporation-of-deep-neural-network","title":"Incorporation of Deep Neural Network & Reinforcement Learning with Domain Knowledge","date":"2021-07-29","arxiv_id":"2107.14613","repositories_listed":0,"syntology":null},{"url":null,"slug":"lyapunov-based-uncertainty-aware-safe","title":"Lyapunov-based uncertainty-aware safe reinforcement learning","date":"2021-07-29","arxiv_id":"2107.13944","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-markovian-reinforcement-learning-using","title":"Non-Markovian Reinforcement Learning using Fractional Dynamics","date":"2021-07-29","arxiv_id":"2107.13790","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-recent-multi-agent-reinforcement","title":"Survey of Recent Multi-Agent Reinforcement Learning Algorithms Utilizing Centralized Training","date":"2021-07-29","arxiv_id":"2107.14316","repositories_listed":0,"syntology":null},{"url":null,"slug":"packet-routing-with-graph-attention-multi","title":"Packet Routing with Graph Attention Multi-agent Reinforcement Learning","date":"2021-07-28","arxiv_id":"2107.13181","repositories_listed":0,"syntology":null},{"url":null,"slug":"relmm-practical-rl-for-learning-mobile","title":"Fully Autonomous Real-World Reinforcement Learning with Applications to Mobile Manipulation","date":"2021-07-28","arxiv_id":"2107.13545","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-l3-slice","title":"Deep Reinforcement Learning for L3 Slice Localization in Sarcopenia Assessment","date":"2021-07-27","arxiv_id":"2107.12800","repositories_listed":0,"syntology":null},{"url":null,"slug":"persistent-reinforcement-learning-via-subgoal","title":"Autonomous Reinforcement Learning via Subgoal Curricula","date":"2021-07-27","arxiv_id":"2107.12931","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-formal","title":"Reinforcement Learning with Formal Performance Metrics for Quadcopter Attitude Control under Non-nominal Contexts","date":"2021-07-27","arxiv_id":"2107.12942","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-exploration-for-multi-agent-deep","title":"Cooperative Exploration for Multi-Agent Deep Reinforcement Learning","date":"2021-07-23","arxiv_id":"2107.11444","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-resource","title":"A reinforcement learning approach to resource allocation in genomic selection","date":"2021-07-22","arxiv_id":"2107.10901","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-for-7","title":"A Deep Reinforcement Learning Approach for Fair Traffic Signal Control","date":"2021-07-21","arxiv_id":"2107.10146","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-agent-training-with","title":"Reinforcement Learning Agent Training with Goals for Real World Tasks","date":"2021-07-21","arxiv_id":"2107.10390","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-altruistic-behaviours-in","title":"Learning Altruistic Behaviours in Reinforcement Learning without External Rewards","date":"2021-07-20","arxiv_id":"2107.09598","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-optimization-for-tracking","title":"Proximal Policy Optimization for Tracking Control Exploiting Future Reference Information","date":"2021-07-20","arxiv_id":"2107.09647","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-autonomously","title":"Using reinforcement learning to autonomously identify sources of error for agents in group missions","date":"2021-07-20","arxiv_id":"2107.09232","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-analysis-of-reinforcement-learning-for","title":"An Analysis of Reinforcement Learning for Malaria Control","date":"2021-07-19","arxiv_id":"2107.08988","repositories_listed":0,"syntology":null},{"url":null,"slug":"constraints-penalized-q-learning-for-safe","title":"Constraints Penalized Q-learning for Safe Offline Reinforcement Learning","date":"2021-07-19","arxiv_id":"2107.09003","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-reward-shaping-for-efficient","title":"Multimodal Reward Shaping for Efficient Exploration in Reinforcement Learning","date":"2021-07-19","arxiv_id":"2107.08888","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-multi-task-reinforcement","title":"Provably Efficient Multi-Task Reinforcement Learning with Model Transfer","date":"2021-07-19","arxiv_id":"2107.08622","repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-world-belief-for-reinforcement","title":"Structured World Belief for Reinforcement Learning in POMDP","date":"2021-07-19","arxiv_id":"2107.08577","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-accuracy-model-based-reinforcement","title":"High-Accuracy Model-Based Reinforcement Learning, a Survey","date":"2021-07-17","arxiv_id":"2107.08241","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-multi-agent-reinforcement-2","title":"Decentralized Multi-Agent Reinforcement Learning for Task Offloading Under Uncertainty","date":"2021-07-16","arxiv_id":"2107.08114","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-risk-sensitive-reinforcement-learning","title":"Robust Risk-Sensitive Reinforcement Learning Agents for Trading Markets","date":"2021-07-16","arxiv_id":"2107.08083","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-dynamic-2","title":"Deep Reinforcement Learning based Dynamic Optimization of Bus Timetable","date":"2021-07-15","arxiv_id":"2107.07066","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluation-of-human-ai-teams-for-learned-and","title":"Evaluation of Human-AI Teams for Learned and Rule-Based Agents in Hanabi","date":"2021-07-15","arxiv_id":"2107.07630","repositories_listed":0,"syntology":null},{"url":null,"slug":"mural-meta-learning-uncertainty-aware-rewards","title":"MURAL: Meta-Learning Uncertainty-Aware Rewards for Outcome-Driven Reinforcement Learning","date":"2021-07-15","arxiv_id":"2107.07184","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-education","title":"Reinforcement Learning for Education: Opportunities and Challenges","date":"2021-07-15","arxiv_id":"2107.08828","repositories_listed":0,"syntology":null},{"url":null,"slug":"qos-aware-scheduling-in-new-radio-using-deep","title":"QoS-Aware Scheduling in New Radio Using Deep Reinforcement Learning","date":"2021-07-14","arxiv_id":"2107.06570","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-evaluation-of-multi-agent","title":"Scalable Evaluation of Multi-Agent Reinforcement Learning with Melting Pot","date":"2021-07-14","arxiv_id":"2107.06857","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-for-6","title":"A Deep Reinforcement Learning Approach for Traffic Signal Control Optimization","date":"2021-07-13","arxiv_id":"2107.06115","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-selection-with-near-optimal-rates-for","title":"Model Selection for Generic Reinforcement Learning","date":"2021-07-13","arxiv_id":"2107.05849","repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimistic-model-based-offline-rl-pac-bounds","title":"Pessimistic Model-based Offline Reinforcement Learning under Partial Coverage","date":"2021-07-13","arxiv_id":"2107.06226","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-reward-free-approach-to-constrained","title":"A Simple Reward-free Approach to Constrained Reinforcement Learning","date":"2021-07-12","arxiv_id":"2107.05216","repositories_listed":0,"syntology":null},{"url":"/paper/r3l-connecting-deep-reinforcement-learning-to","slug":"r3l-connecting-deep-reinforcement-learning-to","title":"R3L: Connecting Deep Reinforcement Learning to Recurrent Neural Networks for Image Denoising via Residual Recovery","date":"2021-07-12","arxiv_id":"2107.05318","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-stable-molecules-using-imitation","title":"Generating stable molecules using imitation and reinforcement learning","date":"2021-07-11","arxiv_id":"2107.05007","repositories_listed":0,"syntology":null},{"url":null,"slug":"attend2pack-bin-packing-through-deep","title":"Attend2Pack: Bin Packing through Deep Reinforcement Learning with Attention","date":"2021-07-09","arxiv_id":"2107.04333","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-probabilistic-reward-machines-from","title":"Inferring Probabilistic Reward Machines from Non-Markovian Reward Processes for Reinforcement Learning","date":"2021-07-09","arxiv_id":"2107.04633","repositories_listed":0,"syntology":null},{"url":null,"slug":"nvcell-standard-cell-layout-in-advanced","title":"NVCell: Standard Cell Layout in Advanced Technology Nodes with Reinforcement Learning","date":"2021-07-09","arxiv_id":"2107.07044","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-1","title":"Offline reinforcement learning with uncertainty for treatment strategies in sepsis","date":"2021-07-09","arxiv_id":"2107.04491","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-hybrid-genetic-algorithm-for-the","title":"Reinforced Hybrid Genetic Algorithm for the Traveling Salesman Problem","date":"2021-07-09","arxiv_id":"2107.06870","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptation-of-quadruped-robot-locomotion-with","title":"Adaptation of Quadruped Robot Locomotion with Meta-Learning","date":"2021-07-08","arxiv_id":"2107.03741","repositories_listed":0,"syntology":null},{"url":null,"slug":"claim-curriculum-learning-policy-for","title":"CLAIM: Curriculum Learning Policy for Influence Maximization in Unknown Social Networks","date":"2021-07-08","arxiv_id":"2107.03603","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-model-based-multi-agent-mean-field","title":"Efficient Model-Based Multi-Agent Mean-Field Reinforcement Learning","date":"2021-07-08","arxiv_id":"2107.04050","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-autonomous-pipeline-inspection-with","title":"Towards Autonomous Pipeline Inspection with Hierarchical Reinforcement Learning","date":"2021-07-08","arxiv_id":"2107.03685","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-model-search-via-reinforcement","title":"Federated Model Search via Reinforcement Learning","date":"2021-07-07","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pseudo-model-free-hedging-for-variable","title":"Pseudo-Model-Free Hedging for Variable Annuities via Deep Reinforcement Learning","date":"2021-07-07","arxiv_id":"2107.03340","repositories_listed":0,"syntology":null},{"url":null,"slug":"quadruped-locomotion-on-non-rigid-terrain","title":"Quadruped Locomotion on Non-Rigid Terrain using Reinforcement Learning","date":"2021-07-07","arxiv_id":"2107.02955","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-short-note-on-the-relationship-of","title":"A Short Note on the Relationship of Information Gain and Eluder Dimension","date":"2021-07-06","arxiv_id":"2107.02377","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-for-heuristic","title":"Meta-Reinforcement Learning for Heuristic Planning","date":"2021-07-06","arxiv_id":"2107.02603","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-of-rough-terrain-vehicles-using-deep","title":"Control of rough terrain vehicles using deep reinforcement learning","date":"2021-07-05","arxiv_id":"2107.01867","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-least-restriction-for-offline","title":"The Least Restriction for Offline Reinforcement Learning","date":"2021-07-05","arxiv_id":"2107.01757","repositories_listed":0,"syntology":null},{"url":null,"slug":"winning-at-any-cost-infringing-the-cartel","title":"Winning at Any Cost -- Infringing the Cartel Prohibition With Reinforcement Learning","date":"2021-07-05","arxiv_id":"2107.01856","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-dimensional-state-and-action","title":"Low-Dimensional State and Action Representation Learning with MDP Homomorphism Metrics","date":"2021-07-04","arxiv_id":"2107.01677","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-dimensional-state-representation-learning-1","title":"Low Dimensional State Representation Learning with Robotics Priors in Continuous Action Spaces","date":"2021-07-04","arxiv_id":"2107.01667","repositories_listed":0,"syntology":null},{"url":null,"slug":"examining-average-and-discounted-reward","title":"Examining average and discounted reward optimality criteria in reinforcement learning","date":"2021-07-03","arxiv_id":"2107.01348","repositories_listed":0,"syntology":null},{"url":null,"slug":"traffic-signal-control-with-communicative","title":"Traffic Signal Control with Communicative Deep Reinforcement Learning Agents: a Case Study","date":"2021-07-03","arxiv_id":"2107.01347","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-deep-reinforcement-learning-based","title":"A Novel Deep Reinforcement Learning Based Stock Direction Prediction using Knowledge Graph and Community Aware Sentiments","date":"2021-07-02","arxiv_id":"2107.00931","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-feedback-enabled","title":"Reinforcement Learning for Feedback-Enabled Cyber Resilience","date":"2021-07-02","arxiv_id":"2107.00783","repositories_listed":0,"syntology":null},{"url":null,"slug":"socialai-benchmarking-socio-cognitive","title":"SocialAI: Benchmarking Socio-Cognitive Abilities in Deep Reinforcement Learning Agents","date":"2021-07-02","arxiv_id":"2107.00956","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-conditioned-reinforcement-learning-with","title":"Goal-Conditioned Reinforcement Learning with Imagined Subgoals","date":"2021-07-01","arxiv_id":"2107.00541","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-based","title":"Inverse Reinforcement Learning Based Stochastic Driver Behavior Learning","date":"2021-07-01","arxiv_id":"2107.06344","repositories_listed":0,"syntology":null},{"url":null,"slug":"mher-model-based-hindsight-experience-replay","title":"MHER: Model-based Hindsight Experience Replay","date":"2021-07-01","arxiv_id":"2107.00306","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-disease","title":"Reinforcement Learning based Disease Progression Model for Alzheimer's Disease","date":"2021-06-30","arxiv_id":"2106.16187","repositories_listed":0,"syntology":null},{"url":null,"slug":"drill-deep-reinforcement-learning-for","title":"DRILL-- Deep Reinforcement Learning for Refinement Operators in $\\mathcal{ALC}$","date":"2021-06-29","arxiv_id":"2106.15373","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-of-reinforcement-learning-with","title":"Generalization of Reinforcement Learning with Policy-Aware Adversarial Data Augmentation","date":"2021-06-29","arxiv_id":"2106.15587","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiagent-deep-reinforcement-learning","title":"Deep Multiagent Reinforcement Learning: Challenges and Directions","date":"2021-06-29","arxiv_id":"2106.15691","repositories_listed":0,"syntology":null},{"url":null,"slug":"expert-q-learning-deep-q-learning-with-state","title":"Expert Q-learning: Deep Reinforcement Learning with Coarse State Values from Offline Expert Examples","date":"2021-06-28","arxiv_id":"2106.14642","repositories_listed":0,"syntology":null},{"url":null,"slug":"modularity-in-reinforcement-learning-via","title":"Modularity in Reinforcement Learning via Algorithmic Independence in Credit Assignment","date":"2021-06-28","arxiv_id":"2106.14993","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-4","title":"A Reinforcement Learning Approach for Sequential Spatial Transformer Networks","date":"2021-06-27","arxiv_id":"2106.14295","repositories_listed":0,"syntology":null},{"url":null,"slug":"concentration-of-contractive-stochastic","title":"Concentration of Contractive Stochastic Approximation and Reinforcement Learning","date":"2021-06-27","arxiv_id":"2106.14308","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-control-with-deep-reinforcement-1","title":"Continuous Control with Deep Reinforcement Learning for Autonomous Vessels","date":"2021-06-27","arxiv_id":"2106.14130","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-analysis-in-deterministic","title":"Regret Analysis in Deterministic Reinforcement Learning","date":"2021-06-27","arxiv_id":"2106.14338","repositories_listed":0,"syntology":null}],"record_sha256":"1e2e28702d42cfd614afe295bcd3359fa4cf43baa3a2e5c8417e875a1794eec5","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}