{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/atari-games/papers/5","list_of":"/task/atari-games","task":"Atari Games","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":5,"pages_in_order":7,"rows_per_page":100,"rows":[401,500],"of":625,"counts":{"archive_papers_tagged":625,"with_a_code_link":313,"where_syntology_ran_a_sample":118,"not_listed_spam_title":0,"listed":625,"listed_where_code_ran":118,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":97,"every_run_a_failure_of_syntologys_instrument":21,"listed_with_a_run_with_no_instrument_failure":97,"listed_every_run_a_failure_of_syntologys_instrument":21,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/atari-games","prev":"/task/atari-games/papers/4","next":"/task/atari-games/papers/6","papers":[{"url":null,"slug":"a-review-for-deep-reinforcement-learning-in-1","title":"A Review for Deep Reinforcement Learning in Atari:Benchmarks, Challenges, and Solutions","date":"2021-12-08","arxiv_id":"2112.04145","repositories_listed":0,"syntology":null},{"url":null,"slug":"target-entropy-annealing-for-discrete-soft","title":"Target Entropy Annealing for Discrete Soft Actor-Critic","date":"2021-12-06","arxiv_id":"2112.02852","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-experience-replay-with-successor","title":"Improving Experience Replay with Successor Representation","date":"2021-11-29","arxiv_id":"2111.14331","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-for-deep-reinforcement-learning-in","title":"A Review for Deep Reinforcement Learning in Atari: Benchmarks, Challenges, and Solutions","date":"2021-11-24","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/gdi-rethinking-what-makes-reinforcement-1","slug":"gdi-rethinking-what-makes-reinforcement-1","title":"GDI: Rethinking What Makes Reinforcement Learning Different from Supervised Learning","date":"2021-11-24","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"effects-of-different-optimization","title":"Effects of Different Optimization Formulations in Evolutionary Reinforcement Learning on Diverse Behavior Generation","date":"2021-10-15","arxiv_id":"2110.08122","repositories_listed":0,"syntology":null},{"url":null,"slug":"explaining-deep-reinforcement-learning-agents","title":"Explaining Deep Reinforcement Learning Agents In The Atari Domain through a Surrogate Model","date":"2021-10-07","arxiv_id":"2110.03184","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-understanding-distributional","title":"The Benefits of Being Categorical Distributional: Uncertainty-aware Regularized Exploration in Reinforcement Learning","date":"2021-10-07","arxiv_id":"2110.03155","repositories_listed":0,"syntology":null},{"url":null,"slug":"crowdplay-crowdsourcing-human-demonstration","title":"CrowdPlay: Crowdsourcing human demonstration data for offline learning in Atari games","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-of-intrinsically-motivated","title":"Deep Learning of Intrinsically Motivated Options in the Arcade Learning Environment","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-perturbation-for-efficient","title":"Distributional Perturbation for Efficient Exploration in Distributional Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"eqr-equivariant-representations-for-data","title":"EqR: Equivariant Representations for Data-Efficient Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-reinforcement-learning-with-value","title":"Faster Reinforcement Learning with Value Target Lower Bounding","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"maximizing-ensemble-diversity-in-deep","title":"Maximizing Ensemble Diversity in Deep Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"p4o-efficient-deep-reinforcement-learning","title":"P4O: Efficient Deep Reinforcement Learning with Predictive Processing Proximal Policy Optimization","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-structured-representations","title":"Self-Supervised Structured Representations for Deep Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"should-i-run-offline-reinforcement-learning","title":"Should I Run Offline Reinforcement Learning or Behavioral Cloning?","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-understanding-distributional-1","title":"Towards Understanding Distributional Reinforcement Learning: Regularization, Optimization, Acceleration and Sinkhorn Algorithm","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"training-with-worst-case-distributional-shift","title":"Training with Worst-Case Distributional Shift causes Overestimation and Inaccuracies in State-Action Value Functions","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-bonus-based-exploration-methods-in-the-1","title":"On Bonus-Based Exploration Methods in the Arcade Learning Environment","date":"2021-09-22","arxiv_id":"2109.11052","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-unified-framework-for-anomaly","title":"A Distance-based Anomaly Detection Framework for Deep Reinforcement Learning","date":"2021-09-21","arxiv_id":"2109.09889","repositories_listed":0,"syntology":null},{"url":null,"slug":"wad-a-deep-reinforcement-learning-agent-for","title":"WAD: A Deep Reinforcement Learning Agent for Urban Autonomous Driving","date":"2021-08-27","arxiv_id":"2108.12134","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-approach-to-partial-observability-in-games","title":"An Approach to Partial Observability in Games: Learning to Both Act and Observe","date":"2021-08-11","arxiv_id":"2108.05701","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-performance-across-two-atari-paddle","title":"High Performance Across Two Atari Paddle Games Using the Same Perceptual Control Architecture Without Training","date":"2021-08-04","arxiv_id":"2108.01895","repositories_listed":0,"syntology":null},{"url":null,"slug":"cautious-policy-programming-exploiting-kl","title":"Cautious Policy Programming: Exploiting KL Regularization in Monotonic Policy Improvement for Reinforcement Learning","date":"2021-07-13","arxiv_id":"2107.05798","repositories_listed":0,"syntology":null},{"url":null,"slug":"width-based-lookaheads-with-learnt-base","title":"Width-based Lookaheads with Learnt Base Policies and Heuristics Over the Atari-2600 Benchmark","date":"2021-06-23","arxiv_id":"2106.12151","repositories_listed":0,"syntology":null},{"url":null,"slug":"emphatic-algorithms-for-deep-reinforcement","title":"Emphatic Algorithms for Deep Reinforcement Learning","date":"2021-06-21","arxiv_id":"2106.11779","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-robust-feature-mapping-in-deep","title":"Non-Robust Feature Mapping in Deep Reinforcement Learning","date":"2021-06-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-in-1","title":"Sample Efficient Reinforcement Learning In Continuous State Spaces: A Perspective Beyond Linearity","date":"2021-06-15","arxiv_id":"2106.07814","repositories_listed":0,"syntology":null},{"url":"/paper/gdi-rethinking-what-makes-reinforcement","slug":"gdi-rethinking-what-makes-reinforcement","title":"GDI: Rethinking What Makes Reinforcement Learning Different From Supervised Learning","date":"2021-06-11","arxiv_id":"2106.06232","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-practical-credit-assignment-for-deep","title":"Towards Practical Credit Assignment for Deep Reinforcement Learning","date":"2021-06-08","arxiv_id":"2106.04499","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-entropy-regularization-free-mechanism-for","title":"An Entropy Regularization Free Mechanism for Policy-based Reinforcement Learning","date":"2021-06-01","arxiv_id":"2106.00707","repositories_listed":0,"syntology":null},{"url":null,"slug":"gmac-a-distributional-perspective-on-actor","title":"GMAC: A Distributional Perspective on Actor-Critic Framework","date":"2021-05-24","arxiv_id":"2105.11366","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparsity-prior-regularized-q-learning-for","title":"Reinforcement Learning With Sparse-Executing Actions via Sparsity Regularization","date":"2021-05-18","arxiv_id":"2105.08666","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-decreasing-quantile-function-network-with-1","title":"Non-decreasing Quantile Function Network with Efficient Exploration for Distributional Reinforcement Learning","date":"2021-05-14","arxiv_id":"2105.06696","repositories_listed":0,"syntology":null},{"url":null,"slug":"return-based-scaling-yet-another","title":"Return-based Scaling: Yet Another Normalisation Trick for Deep RL","date":"2021-05-11","arxiv_id":"2105.05347","repositories_listed":0,"syntology":null},{"url":null,"slug":"casa-b-a-unified-framework-of-model-free","title":"CASA: Bridging the Gap between Policy Improvement and Policy Evaluation with Conflict Averse Policy Iteration","date":"2021-05-09","arxiv_id":"2105.03923","repositories_listed":0,"syntology":null},{"url":null,"slug":"backdoorl-backdoor-attack-against-competitive","title":"BACKDOORL: Backdoor Attack against Competitive Reinforcement Learning","date":"2021-05-02","arxiv_id":"2105.00579","repositories_listed":0,"syntology":null},{"url":null,"slug":"infernet-for-delayed-reinforcement-tasks","title":"InferNet for Delayed Reinforcement Tasks: Addressing the Temporal Credit Assignment Problem","date":"2021-05-02","arxiv_id":"2105.00568","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-distributional-policy-gradients","title":"Bayesian Distributional Policy Gradients","date":"2021-03-20","arxiv_id":"2103.11265","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-based-mobile-robotics-obstacle","title":"Vision-Based Mobile Robotics Obstacle Avoidance With Deep Reinforcement Learning","date":"2021-03-08","arxiv_id":"2103.04727","repositories_listed":0,"syntology":null},{"url":null,"slug":"addressing-action-oscillations-through","title":"Addressing Action Oscillations through Learning Policy Inertia","date":"2021-03-03","arxiv_id":"2103.02287","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensemble-bootstrapping-for-q-learning","title":"Ensemble Bootstrapping for Q-Learning","date":"2021-02-28","arxiv_id":"2103.00445","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-off-and-on-policy-training-in-model","title":"Combining Off and On-Policy Training in Model-Based Reinforcement Learning","date":"2021-02-24","arxiv_id":"2102.12194","repositories_listed":0,"syntology":null},{"url":null,"slug":"return-based-contrastive-representation-1","title":"Return-Based Contrastive Representation Learning for Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.10960","repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-progress-in-deep-reinforcement-1","title":"Measuring Progress in Deep Reinforcement Learning Sample Efficiency","date":"2021-02-09","arxiv_id":"2102.04881","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-advantage-actor-critic-algorithm-for","title":"An advantage actor-critic algorithm for robotic motion planning in dense and dynamic scenarios","date":"2021-02-05","arxiv_id":"2102.03138","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-quantum","title":"Deep Reinforcement Learning with Quantum-inspired Experience Replay","date":"2021-01-06","arxiv_id":"2101.02034","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-n-step-bootstrapping-with-off-policy","title":"Adaptive N-step Bootstrapping with Off-policy Data","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"compute-and-memory-efficient-reinforcement","title":"Compute- and Memory-Efficient Reinforcement Learning with Latent Experience Replay","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-with-low-switching-cost","title":"Deep Q-Learning with Low Switching Cost","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-efficient-planning-based-rewards-for","title":"Learning Efficient Planning-based Rewards for Imitation Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-exploration-with-backward","title":"Optimistic Exploration with Backward Bootstrapped Bonus for Deep Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-active-pre-training-for","title":"Unsupervised Active Pre-Training for Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-advantage-actor-critic-non-1","title":"Towards Understanding Asynchronous Advantage Actor-critic: Convergence and Linear Speedup","date":"2020-12-31","arxiv_id":"2012.15511","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-imitation-advantage-learning","title":"Self-Imitation Advantage Learning","date":"2020-12-22","arxiv_id":"2012.11989","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-stop-dynamic-simulation-monte","title":"Learning to Stop: Dynamic Simulation Monte-Carlo Tree Search","date":"2020-12-14","arxiv_id":"2012.07910","repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-eye-gaze-augmentation-to-enhance","title":"Selective Eye-gaze Augmentation To Enhance Imitation Learning In Atari Games","date":"2020-12-05","arxiv_id":"2012.03145","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-crossing-quantile-regression-for","title":"Non-Crossing Quantile Regression for Distributional Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"predictive-per-balancing-priority-and","title":"Predictive PER: Balancing Priority and Diversity towards Stable Deep Reinforcement Learning","date":"2020-11-26","arxiv_id":"2011.13093","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-the-variance-of-return-sequences-1","title":"Leveraging the Variance of Return Sequences for Exploration Policy","date":"2020-11-17","arxiv_id":"2011.08649","repositories_listed":0,"syntology":null},{"url":null,"slug":"perturbation-based-exploration-methods-in","title":"Perturbation-based exploration methods in deep reinforcement learning","date":"2020-11-10","arxiv_id":"2011.05446","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-versus-machine-attention-in-deep","title":"Machine versus Human Attention in Deep Reinforcement Learning Tasks","date":"2020-10-29","arxiv_id":"2010.15942","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualhints-a-visual-lingual-environment-for","title":"VisualHints: A Visual-Lingual Environment for Multimodal Reinforcement Learning","date":"2020-10-26","arxiv_id":"2010.13839","repositories_listed":0,"syntology":null},{"url":null,"slug":"explanation-augmented-feedback-in-human-in-1","title":"Explanation Augmented Feedback in Human-in-the-Loop Reinforcement Learning","date":"2020-10-15","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/discrete-latent-space-world-models-for","slug":"discrete-latent-space-world-models-for","title":"Smaller World Models for Reinforcement Learning","date":"2020-10-12","arxiv_id":"2010.05767","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategy-and-benchmark-for-converting-deep-q","title":"Strategy and Benchmark for Converting Deep Q-Networks to Event-Driven Spiking Neural Networks","date":"2020-09-30","arxiv_id":"2009.14456","repositories_listed":0,"syntology":null},{"url":null,"slug":"population-guided-imitation-learning","title":"Population-Guided Imitation Learning","date":"2020-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multiplayer-support-for-the-arcade-learning","title":"Multiplayer Support for the Arcade Learning Environment","date":"2020-09-20","arxiv_id":"2009.09341","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-behavior-level-explanation-for-deep","title":"Reconstructing Actions To Explain Deep Reinforcement Learning","date":"2020-09-17","arxiv_id":"2009.08507","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-reinforcement-learning-via","title":"Evolutionary Reinforcement Learning via Cooperative Coevolutionary Negatively Correlated Search","date":"2020-09-08","arxiv_id":"2009.03603","repositories_listed":0,"syntology":null},{"url":"/paper/model-free-episodic-control-with-state","slug":"model-free-episodic-control-with-state","title":"Model-Free Episodic Control with State Aggregation","date":"2020-08-21","arxiv_id":"2008.09685","repositories_listed":0,"syntology":null},{"url":null,"slug":"defending-adversarial-attacks-without","title":"Adversary Agnostic Robust Deep Reinforcement Learning","date":"2020-08-14","arxiv_id":"2008.06199","repositories_listed":0,"syntology":null},{"url":null,"slug":"noisy-agents-self-supervised-exploration-by","title":"Noisy Agents: Self-supervised Exploration by Predicting Auditory Events","date":"2020-07-27","arxiv_id":"2007.13729","repositories_listed":0,"syntology":null},{"url":null,"slug":"slot-contrastive-networks-a-contrastive","title":"Slot Contrastive Networks: A Contrastive Approach for Representing Objects","date":"2020-07-18","arxiv_id":"2007.09294","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-q-learning-with-adaptation-and","title":"Analysis of Q-learning with Adaptation and Momentum Restart for Gradient Descent","date":"2020-07-15","arxiv_id":"2007.07422","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-or-memory-neurointerpretable-agents","title":"Attention or memory? Neurointerpretable agents in space and time","date":"2020-07-09","arxiv_id":"2007.04862","repositories_listed":0,"syntology":null},{"url":null,"slug":"double-prioritized-state-recycled-experience","title":"Double Prioritized State Recycled Experience Replay","date":"2020-07-08","arxiv_id":"2007.03961","repositories_listed":0,"syntology":null},{"url":null,"slug":"convex-regularization-in-monte-carlo-tree","title":"Convex Regularization in Monte-Carlo Tree Search","date":"2020-07-01","arxiv_id":"2007.00391","repositories_listed":0,"syntology":null},{"url":null,"slug":"psychological-and-neural-evidence-for","title":"Reinforcement Learning and its Connections with Neuroscience and Psychology","date":"2020-06-25","arxiv_id":"2007.01099","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-effective-parallelization-of-monte-carlo","title":"On Effective Parallelization of Monte Carlo Tree Search","date":"2020-06-15","arxiv_id":"2006.08785","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-decentralized-policy-gradient-approach-to","title":"A Decentralized Policy Gradient Approach to Multi-task Reinforcement Learning","date":"2020-06-08","arxiv_id":"2006.04338","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-value-improvement-path-towards-better","title":"The Value-Improvement Path: Towards Better Representations for Reinforcement Learning","date":"2020-06-03","arxiv_id":"2006.02243","repositories_listed":0,"syntology":null},{"url":null,"slug":"gradient-monitored-reinforcement-learning","title":"Gradient Monitored Reinforcement Learning","date":"2020-05-25","arxiv_id":"2005.12108","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-imitation-learning-method-via","title":"A Simple Imitation Learning Method via Contrastive Regularization","date":"2020-05-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-deep-neuroevolution-on","title":"Accelerating Deep Neuroevolution on Distributed FPGAs for Reinforcement Learning Problems","date":"2020-05-10","arxiv_id":"2005.04536","repositories_listed":0,"syntology":null},{"url":null,"slug":"episodic-reinforcement-learning-with","title":"Episodic Reinforcement Learning with Associative Memory","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-atari-1","title":"Model Based Reinforcement Learning for Atari","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dialog-policies-from-weak","title":"Learning Dialog Policies from Weak Demonstrations","date":"2020-04-23","arxiv_id":"2004.11054","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-generative-adversarial-nets-on-atari","title":"Using Generative Adversarial Nets on Atari Games for Feature Extraction in Deep Reinforcement Learning","date":"2020-04-06","arxiv_id":"2004.02762","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-object-level-deep","title":"Relevance-Guided Modeling of Object Dynamics for Reinforcement Learning","date":"2020-03-03","arxiv_id":"2003.01384","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficiently-guiding-imitation-learning","title":"Efficiently Guiding Imitation Learning Agents with Human Gaze","date":"2020-02-28","arxiv_id":"2002.12500","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-tuning-deep-reinforcement-learning","title":"A Self-Tuning Actor-Critic Algorithm","date":"2020-02-28","arxiv_id":"2002.12928","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-controllable-object-through","title":"Disentangling Controllable Object through Video Prediction Improves Visual Reinforcement Learning","date":"2020-02-21","arxiv_id":"2002.09136","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-driven-hindsight-modelling-1","title":"Value-driven Hindsight Modelling","date":"2020-02-19","arxiv_id":"2002.08329","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-training-for-reinforcement","title":"Data Efficient Training for Reinforcement Learning with Adaptive Behavior Policy Sharing","date":"2020-02-12","arxiv_id":"2002.05229","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-adaptive-hierarchical-reinforcement","title":"Temporal-adaptive Hierarchical Reinforcement Learning","date":"2020-02-06","arxiv_id":"2002.02080","repositories_listed":0,"syntology":null},{"url":null,"slug":"fresh-interactive-reward-shaping-in-high","title":"FRESH: Interactive Reward Shaping in High-Dimensional State Spaces using Human Feedback","date":"2020-01-19","arxiv_id":"2001.06781","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-past-and-present-of-imitation-learning-a","title":"The Past and Present of Imitation Learning: A Citation Chain Study","date":"2020-01-08","arxiv_id":"2001.02328","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-implicit","title":"Deep Reinforcement Learning with Implicit Human Feedback","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"a5954492e95b452ecb8764352277e7ee97c852d0af57412007f61021c924a3ab","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}