{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/96","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":96,"pages_in_order":132,"rows_per_page":100,"rows":[9501,9600],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/95","next":"/task/reinforcement-learning/papers/97","papers":[{"url":null,"slug":"multi-agent-reinforcement-learning-for-1","title":"Multi-Agent Reinforcement Learning for Problems with Combined Individual and Team Reward","date":"2020-03-24","arxiv_id":"2003.10598","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-in-regularized-mean-field-games","title":"Q-Learning in Regularized Mean-field Games","date":"2020-03-24","arxiv_id":"2003.12151","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-recent-advancements-in-model-based-deep-1","title":"Importance of using appropriate baselines for evaluation of data-efficiency in deep reinforcement learning for Atari","date":"2020-03-23","arxiv_id":"2003.10181","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-relational-background-knowledge","title":"Incorporating Relational Background Knowledge into Reinforcement Learning via Differentiable Inductive Logic Programming","date":"2020-03-23","arxiv_id":"2003.10386","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-walk-spike-based-reinforcement","title":"Learning to Walk: Spike Based Reinforcement Learning for Hexapod Robot Central Pattern Generation","date":"2020-03-22","arxiv_id":"2003.10026","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-economics-and","title":"Reinforcement Learning in Economics and Finance","date":"2020-03-22","arxiv_id":"2003.10014","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-deep-reinforcement-learning-with","title":"Accelerating Deep Reinforcement Learning With the Aid of Partial Model: Energy-Efficient Predictive Video Streaming","date":"2020-03-21","arxiv_id":"2003.09708","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-uav-navigation-a-ddpg-based-deep","title":"Autonomous UAV Navigation: A DDPG-based Deep Reinforcement Learning Approach","date":"2020-03-21","arxiv_id":"2003.10923","repositories_listed":0,"syntology":null},{"url":null,"slug":"comprehensive-review-of-deep-reinforcement","title":"Comprehensive Review of Deep Reinforcement Learning Methods and Applications in Economics","date":"2020-03-21","arxiv_id":"2004.01509","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-smooth","title":"Deep Reinforcement Learning with Robust and Smooth Policy","date":"2020-03-21","arxiv_id":"2003.09534","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-reinforcement-learning-for-1","title":"Distributed Reinforcement Learning for Cooperative Multi-Robot Object Manipulation","date":"2020-03-21","arxiv_id":"2003.09540","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-weighted-q","title":"Deep Reinforcement Learning with Weighted Q-Learning","date":"2020-03-20","arxiv_id":"2003.09280","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-sets-for-generalization-in-rl","title":"Deep Sets for Generalization in RL","date":"2020-03-20","arxiv_id":"2003.09443","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-multi-time-scale-constraints-in","title":"Deep Constrained Q-learning","date":"2020-03-20","arxiv_id":"2003.09398","repositories_listed":0,"syntology":null},{"url":null,"slug":"exchangeable-input-representations-for","title":"Exchangeable Input Representations for Reinforcement Learning","date":"2020-03-19","arxiv_id":"2003.09022","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-enabled-cooperative","title":"Reinforcement learning enabled cooperative spectrum sensing in cognitive radio networks","date":"2020-03-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-cognitive-routing-based-on-deep","title":"Towards Cognitive Routing based on Deep Reinforcement Learning","date":"2020-03-19","arxiv_id":"2003.12439","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-graph-classification-with-model","title":"Adaptive-Step Graph Meta-Learner for Few-Shot Graph Classification","date":"2020-03-18","arxiv_id":"2003.08246","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-socially-acceptable-perturbations","title":"Generating Socially Acceptable Perturbations for Efficient Evaluation of Autonomous Vehicles","date":"2020-03-18","arxiv_id":"2003.08034","repositories_listed":0,"syntology":null},{"url":null,"slug":"placement-optimization-with-deep","title":"Placement Optimization with Deep Reinforcement Learning","date":"2020-03-18","arxiv_id":"2003.08445","repositories_listed":0,"syntology":null},{"url":null,"slug":"viewport-aware-deep-reinforcement-learning","title":"Viewport-Aware Deep Reinforcement Learning Approach for 360$^o$ Video Caching","date":"2020-03-18","arxiv_id":"2003.08473","repositories_listed":0,"syntology":null},{"url":null,"slug":"watch-your-back-backdoor-attacks-in-deep","title":"Stop-and-Go: Exploring Backdoor Attacks on Deep Reinforcement Learning-based Traffic Congestion Control Systems","date":"2020-03-17","arxiv_id":"2003.07859","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-performance-in-reinforcement","title":"Improving Performance in Reinforcement Learning by Breaking Generalization in Neural Networks","date":"2020-03-16","arxiv_id":"2003.07417","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-electricity","title":"Reinforcement Learning for Electricity Network Operation","date":"2020-03-16","arxiv_id":"2003.07339","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-variance-minimization-for-learning","title":"Value Variance Minimization for Learning Approximate Equilibrium in Aggregation Systems","date":"2020-03-16","arxiv_id":"2003.07088","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-perception-and-representation-for","title":"Active Perception and Representation for Robotic Manipulation","date":"2020-03-15","arxiv_id":"2003.06734","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperation-without-coordination-hierarchical","title":"Model-based Reinforcement Learning for Decentralized Multiagent Rendezvous","date":"2020-03-15","arxiv_id":"2003.06906","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-general-framework-for-learning-mean-field","title":"A General Framework for Learning Mean-Field Games","date":"2020-03-13","arxiv_id":"2003.06069","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-deep-q-network-in-portfolio","title":"Application of Deep Q-Network in Portfolio Management","date":"2020-03-13","arxiv_id":"2003.06365","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-medical-treatment-for-sepsis-in","title":"Optimizing Medical Treatment for Sepsis in Intensive Care: from Reinforcement Learning to Pre-Trial Evaluation","date":"2020-03-13","arxiv_id":"2003.06474","repositories_listed":0,"syntology":null},{"url":"/paper/taylor-expansion-policy-optimization","slug":"taylor-expansion-policy-optimization","title":"Taylor Expansion Policy Optimization","date":"2020-03-13","arxiv_id":"2003.06259","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-hyper-parameters-for-small-games","title":"Analysis of Hyper-Parameters for Small Games: Iterations or Epochs in Self-Play?","date":"2020-03-12","arxiv_id":"2003.05988","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-visual-representations-in-embodied","title":"Analyzing Visual Representations in Embodied Navigation Tasks","date":"2020-03-12","arxiv_id":"2003.05993","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-relational-reasoning-in","title":"Heterogeneous Relational Reasoning in Knowledge Graphs with Reinforcement Learning","date":"2020-03-12","arxiv_id":"2003.06050","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-bound-of-adaptive-control-in-linear","title":"Adaptive Control and Regret Minimization in Linear Quadratic Gaussian (LQG) Setting","date":"2020-03-12","arxiv_id":"2003.05999","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-curriculum-learning-for-deep-rl-a","title":"Automatic Curriculum Learning For Deep RL: A Short Survey","date":"2020-03-10","arxiv_id":"2003.04664","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-learning-for-reinforcement","title":"Curriculum Learning for Reinforcement Learning Domains: A Framework and Survey","date":"2020-03-10","arxiv_id":"2003.04960","repositories_listed":0,"syntology":null},{"url":null,"slug":"indirect-and-direct-training-of-spiking","title":"Indirect and Direct Training of Spiking Neural Networks for End-to-End Control of a Lane-Keeping Vehicle","date":"2020-03-10","arxiv_id":"2003.04603","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-be-global-optimizer","title":"Learning to be Global Optimizer","date":"2020-03-10","arxiv_id":"2003.04521","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-cost-management-in-smart-meters-using","title":"Privacy-Cost Management in Smart Meters Using Deep Reinforcement Learning","date":"2020-03-10","arxiv_id":"2003.04946","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-mitigating","title":"Reinforcement Learning for Mitigating Intermittent Interference in Terahertz Communication Networks","date":"2020-03-10","arxiv_id":"2003.04832","repositories_listed":0,"syntology":null},{"url":null,"slug":"squirl-robust-and-efficient-learning-from","title":"SQUIRL: Robust and Efficient Learning from Video Demonstration of Long-Horizon Robotic Manipulation Tasks","date":"2020-03-10","arxiv_id":"2003.04956","repositories_listed":0,"syntology":null},{"url":"/paper/the-minerl-competition-on-sample-efficient-1","slug":"the-minerl-competition-on-sample-efficient-1","title":"Retrospective Analysis of the 2019 MineRL Competition on Sample Efficient Reinforcement Learning","date":"2020-03-10","arxiv_id":"2003.05012","repositories_listed":0,"syntology":{"n":7,"n_ran":6,"n_constructed":0,"n_ran_checked":6,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":6,"n_pointer_only":3,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/the-minerl-competition-on-sample-efficient-1#ran","syntology_url":"https://syntology.ai/paper/2003.05012","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2003.05012"}},"official":null}},{"url":null,"slug":"advancing-renewable-electricity-consumption","title":"Advancing Renewable Electricity Consumption With Reinforcement Learning","date":"2020-03-09","arxiv_id":"2003.04310","repositories_listed":0,"syntology":null},{"url":null,"slug":"behavior-planning-for-connected-autonomous","title":"A Multi-Agent Reinforcement Learning Approach For Safe and Efficient Behavior Planning Of Connected Autonomous Vehicles","date":"2020-03-09","arxiv_id":"2003.04371","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficiency-and-equity-are-both-essential-a","title":"Efficiency and Equity are Both Essential: A Generalized Traffic Signal Controller with Deep Reinforcement Learning","date":"2020-03-09","arxiv_id":"2003.04046","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-ai-interaction-loop-training-new","title":"Human AI interaction loop training: New approach for interactive reinforcement learning","date":"2020-03-09","arxiv_id":"2003.04203","repositories_listed":0,"syntology":null},{"url":null,"slug":"qstar-approximation-schemes-for-batch","title":"Q* Approximation Schemes for Batch Reinforcement Learning: A Theoretical Comparison","date":"2020-03-09","arxiv_id":"2003.03924","repositories_listed":0,"syntology":null},{"url":null,"slug":"software-level-accuracy-using-stochastic","title":"Software-Level Accuracy Using Stochastic Computing With Charge-Trap-Flash Based Weight Matrix","date":"2020-03-09","arxiv_id":"2004.11120","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-reinforcement-learning-under","title":"Transfer Reinforcement Learning under Unobserved Contextual Information","date":"2020-03-09","arxiv_id":"2003.04427","repositories_listed":0,"syntology":null},{"url":null,"slug":"zooming-for-efficient-model-free","title":"Zooming for Efficient Model-Free Reinforcement Learning in Metric Spaces","date":"2020-03-09","arxiv_id":"2003.04069","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-adversarial-reinforcement-learning-for","title":"Deep Adversarial Reinforcement Learning for Object Disentangling","date":"2020-03-08","arxiv_id":"2003.03779","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-adversarial-imitation-learning-2","title":"Generative Adversarial Imitation Learning with Neural Networks: Global Optimality and Convergence Rate","date":"2020-03-08","arxiv_id":"2003.03709","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-cooperative","title":"Reinforcement Learning Based Cooperative Coded Caching under Dynamic Popularities in Ultra-Dense Networks","date":"2020-03-08","arxiv_id":"2003.03758","repositories_listed":0,"syntology":null},{"url":null,"slug":"convergence-of-q-value-in-case-of-gaussian","title":"Convergence of Q-value in case of Gaussian rewards","date":"2020-03-07","arxiv_id":"2003.03526","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-combinatorial","title":"Reinforcement Learning for Combinatorial Optimization: A Survey","date":"2020-03-07","arxiv_id":"2003.03600","repositories_listed":0,"syntology":null},{"url":null,"slug":"cost-sensitive-portfolio-selection-via-deep","title":"Cost-Sensitive Portfolio Selection via Deep Reinforcement Learning","date":"2020-03-06","arxiv_id":"2003.03051","repositories_listed":0,"syntology":null},{"url":null,"slug":"lane-merging-using-policy-based-reinforcement","title":"Lane-Merging Using Policy-based Reinforcement Learning and Post-Optimization","date":"2020-03-06","arxiv_id":"2003.03168","repositories_listed":0,"syntology":null},{"url":null,"slug":"smart-train-operation-algorithms-based-on","title":"Smart Train Operation Algorithms based on Expert Knowledge and Reinforcement Learning","date":"2020-03-06","arxiv_id":"2003.03327","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-geometric-perspective-on-visual-imitation","title":"A Geometric Perspective on Visual Imitation Learning","date":"2020-03-05","arxiv_id":"2003.02768","repositories_listed":0,"syntology":null},{"url":null,"slug":"balance-between-efficient-and-effective","title":"Balance Between Efficient and Effective Learning: Dense2Sparse Reward Shaping for Robot Manipulation with Environment Uncertainty","date":"2020-03-05","arxiv_id":"2003.02740","repositories_listed":0,"syntology":null},{"url":null,"slug":"bert-as-a-teacher-contextual-embeddings-for","title":"BERT as a Teacher: Contextual Embeddings for Sequence-Level Reward","date":"2020-03-05","arxiv_id":"2003.02738","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-robust","title":"Deep Reinforcement Learning-BasedRobust Protection in DER-Rich Distribution Grids","date":"2020-03-05","arxiv_id":"2003.02422","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-robustness-and-regularization","title":"Distributional Robustness and Regularization in Reinforcement Learning","date":"2020-03-05","arxiv_id":"2003.02894","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-and-effective-similar-subtrajectory","title":"Efficient and Effective Similar Subtrajectory Search with Deep Reinforcement Learning","date":"2020-03-05","arxiv_id":"2003.02542","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-design-in-cooperative-multi-agent-1","title":"Reward Design in Cooperative Multi-agent Reinforcement Learning for Packet Routing","date":"2020-03-05","arxiv_id":"2003.03433","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-experience-replay","title":"Dynamic Experience Replay","date":"2020-03-04","arxiv_id":"2003.02372","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-statistical-validation-with-edge","title":"Efficient statistical validation with edge cases to evaluate Highly Automated Vehicles","date":"2020-03-04","arxiv_id":"2003.01886","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-network-heuristics-for-adaptive","title":"Neural-Network Heuristics for Adaptive Bayesian Quantum Estimation","date":"2020-03-04","arxiv_id":"2003.02183","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-hyper-parameter-tuning-for-stochastic","title":"On Hyper-parameter Tuning for Stochastic Optimization Algorithms","date":"2020-03-04","arxiv_id":"2003.02038","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-aware-time-series-data-sharing-with","title":"Privacy-Aware Time-Series Data Sharing with Deep Reinforcement Learning","date":"2020-03-04","arxiv_id":"2003.02685","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-qos","title":"Deep Reinforcement Learning for QoS-Constrained Resource Allocation in Multiservice Networks","date":"2020-03-03","arxiv_id":"2003.02643","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-in-constrained","title":"Efficient Exploration in Constrained Environments with Goal-Oriented Reference Path","date":"2020-03-03","arxiv_id":"2003.01641","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-context-aware-task-reasoning-for","title":"Learning Context-aware Task Reasoning for Efficient Meta-reinforcement Learning","date":"2020-03-03","arxiv_id":"2003.01373","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-for-autonomous","title":"Safe Reinforcement Learning for Autonomous Vehicles through Parallel Constrained Policy Optimization","date":"2020-03-03","arxiv_id":"2003.01303","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-object-level-deep","title":"Relevance-Guided Modeling of Object Dynamics for Reinforcement Learning","date":"2020-03-03","arxiv_id":"2003.01384","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-structural-hyper-parameter","title":"Adaptive Structural Hyper-Parameter Configuration by Q-Learning","date":"2020-03-02","arxiv_id":"2003.00863","repositories_listed":0,"syntology":null},{"url":null,"slug":"cluster-based-social-reinforcement-learning","title":"Cluster-Based Social Reinforcement Learning","date":"2020-03-02","arxiv_id":"2003.00627","repositories_listed":0,"syntology":null},{"url":null,"slug":"formal-controller-synthesis-for-continuous","title":"Formal Controller Synthesis for Continuous-Space MDPs via Model-Free Reinforcement Learning","date":"2020-03-02","arxiv_id":"2003.00712","repositories_listed":0,"syntology":null},{"url":null,"slug":"gaussian-process-policy-optimization","title":"Gaussian Process Policy Optimization","date":"2020-03-02","arxiv_id":"2003.01074","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-contact-rich-manipulation-tasks-with","title":"Learning Force Control for Contact-rich Manipulation Tasks with Rigid Position-controlled Robots","date":"2020-03-02","arxiv_id":"2003.00628","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-world-human-robot-collaborative","title":"Real-World Human-Robot Collaborative Reinforcement Learning","date":"2020-03-02","arxiv_id":"2003.01156","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-averse-learning-by-temporal-difference","title":"Risk-Averse Learning by Temporal Difference Methods","date":"2020-03-02","arxiv_id":"2003.00780","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-up-multiagent-reinforcement-learning","title":"Scaling Up Multiagent Reinforcement Learning for Robotic Systems: Learn an Adaptive Sparse Communication Graph","date":"2020-03-02","arxiv_id":"2003.01040","repositories_listed":0,"syntology":null},{"url":null,"slug":"upper-confidence-primal-dual-optimization","title":"Upper Confidence Primal-Dual Reinforcement Learning for CMDP with Adversarial Loss","date":"2020-03-02","arxiv_id":"2003.00660","repositories_listed":0,"syntology":null},{"url":null,"slug":"v2i-connectivity-based-dynamic-queue-jumper","title":"Dynamic Queue-Jump Lane for Emergency Vehicles under Partially Connected Settings: A Multi-Agent Deep Reinforcement Learning Approach","date":"2020-03-02","arxiv_id":"2003.01025","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-policy-evaluation-in-distributed","title":"Fully Asynchronous Policy Evaluation in Distributed Reinforcement Learning over Networks","date":"2020-03-01","arxiv_id":"2003.00433","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-task-first-or-learn-human-partner-first","title":"Learn Task First or Learn Human Partner First: A Hierarchical Task Decomposition Method for Human-Robot Cooperation","date":"2020-03-01","arxiv_id":"2003.00400","repositories_listed":0,"syntology":null},{"url":null,"slug":"planet-of-the-bayesians-reconsidering-and","title":"PlaNet of the Bayesians: Reconsidering and Improving Deep Planning Network by Incorporating Bayesian Inference","date":"2020-03-01","arxiv_id":"2003.00370","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-safe-exploration-via","title":"Provably Efficient Safe Exploration via Primal-Dual Policy Optimization","date":"2020-03-01","arxiv_id":"2003.00534","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-policy-reuse-using-deep-mixture","title":"Contextual Policy Transfer in Reinforcement Learning Domains via Deep Mixtures-of-Experts","date":"2020-02-29","arxiv_id":"2003.00203","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-near-optimal-policies-with-low","title":"Learning Near Optimal Policies with Low Inherent Bellman Error","date":"2020-02-29","arxiv_id":"2003.00153","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-optimization-methods-in-deep-learning","title":"Do optimization methods in deep learning applications matter?","date":"2020-02-28","arxiv_id":"2002.12642","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficiently-guiding-imitation-learning","title":"Efficiently Guiding Imitation Learning Agents with Human Gaze","date":"2020-02-28","arxiv_id":"2002.12500","repositories_listed":0,"syntology":null},{"url":null,"slug":"jointly-learning-to-recommend-and-advertise","title":"Jointly Learning to Recommend and Advertise","date":"2020-02-28","arxiv_id":"2003.00097","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixed-reinforcement-learning-with-additive","title":"Mixed Reinforcement Learning with Additive Stochastic Uncertainty","date":"2020-02-28","arxiv_id":"2003.00848","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-flipit","title":"Deep Reinforcement Learning for FlipIt Security Game","date":"2020-02-28","arxiv_id":"2002.12909","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-through-active","title":"Reinforcement Learning through Active Inference","date":"2020-02-28","arxiv_id":"2002.12636","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-tuning-deep-reinforcement-learning","title":"A Self-Tuning Actor-Critic Algorithm","date":"2020-02-28","arxiv_id":"2002.12928","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-visual-communication-map-for-multi-agent","title":"A Visual Communication Map for Multi-Agent Deep Reinforcement Learning","date":"2020-02-27","arxiv_id":"2002.11882","repositories_listed":0,"syntology":null}],"record_sha256":"b61fa911356a68864fd5c9d11b0f0d947644194e8c4cea4e24b01b892ee1074d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}