{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/atari-games/papers/6","list_of":"/task/atari-games","task":"Atari Games","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":6,"pages_in_order":7,"rows_per_page":100,"rows":[501,600],"of":625,"counts":{"archive_papers_tagged":625,"with_a_code_link":313,"where_syntology_ran_a_sample":118,"not_listed_spam_title":0,"listed":625,"listed_where_code_ran":118,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":97,"every_run_a_failure_of_syntologys_instrument":21,"listed_with_a_run_with_no_instrument_failure":97,"listed_every_run_a_failure_of_syntologys_instrument":21,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/atari-games","prev":"/task/atari-games/papers/5","next":"/task/atari-games/papers/7","papers":[{"url":null,"slug":"on-bonus-based-exploration-methods-in-the","title":"On Bonus Based Exploration Methods In The Arcade Learning Environment","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-role-of-weight-sharing-during-deep","title":"On the Role of Weight Sharing During Deep Option Learning","date":"2019-12-31","arxiv_id":"1912.13408","repositories_listed":0,"syntology":null},{"url":null,"slug":"speeding-up-reinforcement-learning-by","title":"Speeding up reinforcement learning by combining attention and agency features","date":"2019-12-29","arxiv_id":"1912.12623","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-behaviour-for-learning-progress-1","title":"Adapting Behaviour for Learning Progress","date":"2019-12-14","arxiv_id":"1912.06910","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-bayesian-reward-learning-from","title":"Deep Bayesian Reward Learning from Preferences","date":"2019-12-10","arxiv_id":"1912.04472","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-regret-exploration-in-goal-oriented","title":"No-Regret Exploration in Goal-Oriented Reinforcement Learning","date":"2019-12-07","arxiv_id":"1912.03517","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversary-a3c-for-robust-reinforcement-1","title":"Adversary A3C for Robust Reinforcement Learning","date":"2019-12-01","arxiv_id":"1912.00330","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-entropy-monte-carlo-planning","title":"Maximum Entropy Monte-Carlo Planning","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"grim-repr-prioritising-generating-important","title":"GRIm-RePR: Prioritising Generating Important Features for Pseudo-Rehearsal","date":"2019-11-27","arxiv_id":"1911.11988","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-decorrelation-of-features-using","title":"Efficient decorrelation of features using Gramian in Reinforcement Learning","date":"2019-11-19","arxiv_id":"1911.08610","repositories_listed":0,"syntology":null},{"url":null,"slug":"atari-fying-the-vehicle-routing-problem-with","title":"Gamifying the Vehicle Routing Problem with Stochastic Requests","date":"2019-11-14","arxiv_id":"1911.05922","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimalistic-attacks-how-little-it-takes-to","title":"Minimalistic Attacks: How Little it Takes to Fool a Deep Reinforcement Learning Policy","date":"2019-11-10","arxiv_id":"1911.03849","repositories_listed":0,"syntology":null},{"url":null,"slug":"momentum-in-reinforcement-learning","title":"Momentum in Reinforcement Learning","date":"2019-10-21","arxiv_id":"1910.09322","repositories_listed":0,"syntology":null},{"url":null,"slug":"negatively-correlated-search-as-a-parallel","title":"Parallel Exploration via Negatively Correlated Search","date":"2019-10-16","arxiv_id":"1910.07151","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-structured-1","title":"Reinforcement Learning with Structured Hierarchical Grammar Representations of Actions","date":"2019-10-07","arxiv_id":"1910.02876","repositories_listed":0,"syntology":null},{"url":null,"slug":"playing-atari-ball-games-with-hierarchical","title":"Playing Atari Ball Games with Hierarchical Reinforcement Learning","date":"2019-09-27","arxiv_id":"1909.12465","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-altq-learn-faster-experiments-and-theory","title":"CAN ALTQ LEARN FASTER: EXPERIMENTS AND THEORY","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-key-steps-to-attack-deep","title":"Learning Key Steps to Attack Deep Reinforcement Learning Agents","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/off-policy-actor-critic-with-shared-1","slug":"off-policy-actor-critic-with-shared-1","title":"Off-Policy Actor-Critic with Shared Experience Replay","date":"2019-09-25","arxiv_id":"1909.11583","repositories_listed":0,"syntology":null},{"url":null,"slug":"regulatory-focus-promotion-and-prevention","title":"Regulatory Focus: Promotion and Prevention Inclinations in Policy Search","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"striving-for-simplicity-in-off-policy-deep-1","title":"Striving for Simplicity in Off-Policy Deep Reinforcement Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"biased-estimates-of-advantages-over-path","title":"Biased Estimates of Advantages over Path Ensembles","date":"2019-09-15","arxiv_id":"1909.06851","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-and-video-games","title":"Reinforcement Learning and Video Games","date":"2019-09-10","arxiv_id":"1909.04751","repositories_listed":0,"syntology":null},{"url":null,"slug":"ledeepchef-deep-reinforcement-learning-agent","title":"LeDeepChef: Deep Reinforcement Learning Agent for Families of Text-Based Games","date":"2019-09-04","arxiv_id":"1909.01646","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-bonus-based-exploration-methods","title":"Benchmarking Bonus-Based Exploration Methods on the Arcade Learning Environment","date":"2019-08-06","arxiv_id":"1908.02388","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-with-self-imitation","title":"Memory Based Trajectory-conditioned Policies for Learning from Sparse Rewards","date":"2019-07-24","arxiv_id":"1907.10247","repositories_listed":0,"syntology":null},{"url":null,"slug":"terminal-prediction-as-an-auxiliary-task-for","title":"Terminal Prediction as an Auxiliary Task for Deep Reinforcement Learning","date":"2019-07-24","arxiv_id":"1907.10827","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-conservative-policy-iteration","title":"Deep Conservative Policy Iteration","date":"2019-06-24","arxiv_id":"1906.09784","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-hindsight-a-smooth-reward-for-steady","title":"In Hindsight: A Smooth Reward for Steady Exploration","date":"2019-06-24","arxiv_id":"1906.09781","repositories_listed":0,"syntology":null},{"url":null,"slug":"qxplore-q-learning-exploration-by-maximizing","title":"Reward Prediction Error as an Exploration Objective in Deep RL","date":"2019-06-19","arxiv_id":"1906.08189","repositories_listed":0,"syntology":null},{"url":null,"slug":"clustered-reinforcement-learning","title":"Clustered Reinforcement Learning","date":"2019-06-06","arxiv_id":"1906.02457","repositories_listed":0,"syntology":null},{"url":null,"slug":"targeted-attacks-on-deep-reinforcement","title":"CopyCAT: Taking Control of Neural Policies with Constant Attacks","date":"2019-05-29","arxiv_id":"1905.12282","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-exponentially-discounted-sum-automatic","title":"Beyond Exponentially Discounted Sum: Automatic Learning of Return Function","date":"2019-05-28","arxiv_id":"1905.11591","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-reinforcement-learning-for","title":"Distributional Reinforcement Learning for Efficient Exploration","date":"2019-05-13","arxiv_id":"1905.06125","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-target-updates-for-q-learning","title":"Accelerated Target Updates for Q-learning","date":"2019-05-07","arxiv_id":"1905.02841","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-abstract-models-for-long-horizon","title":"Learning Abstract Models for Long-Horizon Exploration","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-control-visual-abstractions-for","title":"Learning to Control Visual Abstractions for Structured Exploration in Deep Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-consistent-performance-on-atari-using","title":"Towards Consistent Performance on Atari using Expert Demonstrations","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"compression-and-localization-in-reinforcement","title":"Compression and Localization in Reinforcement Learning for ATARI Games","date":"2019-04-20","arxiv_id":"1904.09489","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-attention-that","title":"Reinforcement Learning with Attention that Works: A Self-Supervised Approach","date":"2019-04-06","arxiv_id":"1904.03367","repositories_listed":0,"syntology":null},{"url":null,"slug":"dqn-with-model-based-exploration-efficient","title":"DQN with model-based exploration: efficient learning on environments with sparse rewards","date":"2019-03-22","arxiv_id":"1903.09295","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-automatic-construction-of-multi","title":"Towards automatic construction of multi-network models for heterogeneous multi-task learning","date":"2019-03-21","arxiv_id":"1903.09171","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with","title":"Deep Reinforcement Learning with Decorrelation","date":"2019-03-18","arxiv_id":"1903.07765","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-self-game-play-agents-for","title":"Learning Self-Game-Play Agents for Combinatorial Optimization Problems","date":"2019-03-08","arxiv_id":"1903.03674","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-world-models-for-pseudo-rehearsal-in","title":"Continual Learning Using World Models for Pseudo-Rehearsal","date":"2019-03-06","arxiv_id":"1903.02647","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-potential-based-reward-shaping-for","title":"A new Potential-Based Reward Shaping for Reinforcement Learning Agent","date":"2019-02-17","arxiv_id":"1902.06239","repositories_listed":0,"syntology":null},{"url":null,"slug":"metaoptimization-on-a-distributed-system-for","title":"Metaoptimization on a Distributed System for Deep Reinforcement Learning","date":"2019-02-07","arxiv_id":"1902.02725","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-rationalizations-in-deep-reinforcement","title":"Visual Rationalizations in Deep Reinforcement Learning for Atari Games","date":"2019-02-01","arxiv_id":"1902.00566","repositories_listed":0,"syntology":null},{"url":null,"slug":"modularization-of-end-to-end-learning-case","title":"Modularization of End-to-End Learning: Case Study in Arcade Games","date":"2019-01-27","arxiv_id":"1901.09895","repositories_listed":0,"syntology":null},{"url":null,"slug":"escape-room-a-configurable-testbed-for","title":"Escape Room: A Configurable Testbed for Hierarchical Reinforcement Learning","date":"2018-12-22","arxiv_id":"1812.09521","repositories_listed":0,"syntology":null},{"url":null,"slug":"kf-lax-kronecker-factored-curvature","title":"KF-LAX: Kronecker-factored curvature estimation for control variate optimization in reinforcement learning","date":"2018-12-11","arxiv_id":"1812.04181","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-finite-state-representations-of","title":"Learning Finite State Representations of Recurrent Policy Networks","date":"2018-11-29","arxiv_id":"1811.12530","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysing-results-from-ai-benchmarks-key","title":"Analysing Results from AI Benchmarks: Key Indicators and How to Obtain Them","date":"2018-11-20","arxiv_id":"1811.08186","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-with-model-based","title":"Policy Optimization with Model-based Explorations","date":"2018-11-18","arxiv_id":"1811.07350","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-initial-attempt-of-combining-visual","title":"An initial attempt of combining visual selective attention with deep reinforcement learning","date":"2018-11-11","arxiv_id":"1811.04407","repositories_listed":0,"syntology":null},{"url":null,"slug":"quasi-newton-optimization-in-deep-q-learning","title":"Deep Reinforcement Learning via L-BFGS Optimization","date":"2018-11-06","arxiv_id":"1811.02693","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-continual-learning-in-medical-imaging","title":"Towards continual learning in medical imaging","date":"2018-11-06","arxiv_id":"1811.02496","repositories_listed":0,"syntology":null},{"url":"/paper/contingency-aware-exploration-in","slug":"contingency-aware-exploration-in","title":"Contingency-Aware Exploration in Reinforcement Learning","date":"2018-11-05","arxiv_id":"1811.01483","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-shared-dynamics-with-meta-world","title":"Learning Shared Dynamics with Meta-World Models","date":"2018-11-05","arxiv_id":"1811.01741","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-convergent-variant-of-the-boltzmann-softmax","title":"A Convergent Variant of the Boltzmann Softmax Operator in Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-value-iteration-via-anderson","title":"Accelerated Value Iteration via Anderson Mixing","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"constraining-action-sequences-with-formal","title":"Constraining Action Sequences with Formal Languages for Deep Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-by-uncertainty-in-reward-space","title":"Exploration by Uncertainty in Reward Space","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"expressiveness-in-deep-reinforcement-learning","title":"Expressiveness in Deep Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mimicking-actions-is-a-good-strategy-for","title":"Mimicking actions is a good strategy for beginners: Fast Reinforcement Learning with Expert Action Sequences","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-deep-neuroevolution-in-low","title":"Sample Efficient Deep Neuroevolution in Low Dimensional Latent Space","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"low-precision-policy-distillation-with","title":"Low Precision Policy Distillation with Application to Low-Power, Real-time Sensation-Cognition-Action Loop with Neuromorphic Computing","date":"2018-09-25","arxiv_id":"1809.09260","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-sensitive-deep-reinforcement-learning","title":"Object-sensitive Deep Reinforcement Learning","date":"2018-09-17","arxiv_id":"1809.06064","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-on-policy-learning-with-statistical","title":"Improving On-policy Learning with Statistical Reward Accumulation","date":"2018-09-07","arxiv_id":"1809.02387","repositories_listed":0,"syntology":null},{"url":null,"slug":"monte-carlo-tree-search-with-scalable","title":"Monte Carlo Tree Search with Scalable Simulation Periods for Continuously Running Tasks","date":"2018-09-07","arxiv_id":"1809.02378","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-deep-reinforcement-learning-with","title":"Transferring Deep Reinforcement Learning with Adversarial Objective and Augmentation","date":"2018-09-04","arxiv_id":"1809.00770","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-analogies-between-atari-games-for","title":"Visual Analogies between Atari Games for Studying Transfer Learning in RL","date":"2018-07-29","arxiv_id":"1807.11074","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-doom-using","title":"Deep Reinforcement Learning for Doom using Unsupervised Auxiliary Tasks","date":"2018-07-05","arxiv_id":"1807.01960","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-nlp","title":"Deep Reinforcement Learning for NLP","date":"2018-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-width-based-planning-with-compact","title":"Improving width-based planning with compact policies","date":"2018-06-15","arxiv_id":"1806.05898","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-time-value-function-approximation","title":"Continuous-time Value Function Approximation in Reproducing Kernel Hilbert Spaces","date":"2018-06-08","arxiv_id":"1806.02985","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-effect-of-planning-shape-on-dyna-style","title":"The Effect of Planning Shape on Dyna-style Planning in High-dimensional State Spaces","date":"2018-06-05","arxiv_id":"1806.01825","repositories_listed":0,"syntology":null},{"url":null,"slug":"accounting-for-the-neglected-dimensions-of-ai","title":"Between Progress and Potential Impact of AI: the Neglected Dimensions","date":"2018-06-02","arxiv_id":"1806.00610","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-entropy-for-policy-gradient-with","title":"Efficient Entropy for Policy Gradient with Multidimensional Action Space","date":"2018-06-02","arxiv_id":"1806.00589","repositories_listed":0,"syntology":null},{"url":null,"slug":"agil-learning-attention-from-human-for","title":"AGIL: Learning Attention from Human for Visuomotor Tasks","date":"2018-06-01","arxiv_id":"1806.03960","repositories_listed":0,"syntology":null},{"url":null,"slug":"observe-and-look-further-achieving-consistent","title":"Observe and Look Further: Achieving Consistent Performance on Atari","date":"2018-05-29","arxiv_id":"1805.11593","repositories_listed":0,"syntology":null},{"url":null,"slug":"episodic-memory-deep-q-networks","title":"Episodic Memory Deep Q-Networks","date":"2018-05-19","arxiv_id":"1805.07603","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-retinomorphic-event-stream-for-video","title":"Fast Retinomorphic Event Stream for Video Recognition and Reinforcement Learning","date":"2018-05-16","arxiv_id":"1805.06374","repositories_listed":0,"syntology":null},{"url":null,"slug":"metatrace-online-step-size-tuning-by-meta","title":"Metatrace Actor-Critic: Online Step-size Tuning by Meta-gradient Descent for Reinforcement Learning Control","date":"2018-05-10","arxiv_id":"1805.04514","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-distribution-aware-sampling-for-deep-q","title":"State Distribution-aware Sampling for Deep Q-learning","date":"2018-04-23","arxiv_id":"1804.08619","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-improving-deep-reinforcement-learning-for-1","title":"On Improving Deep Reinforcement Learning for POMDPs","date":"2018-04-17","arxiv_id":"1804.06309","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-human-mixed-strategy-approach-to-deep","title":"A Human Mixed Strategy Approach to Deep Reinforcement Learning","date":"2018-04-05","arxiv_id":"1804.01874","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-and-querying-fast-generative-models","title":"Learning and Querying Fast Generative Models for Reinforcement Learning","date":"2018-02-08","arxiv_id":"1802.03006","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-1","title":"Sample-Efficient Reinforcement Learning through Transfer and Architectural Priors","date":"2018-01-07","arxiv_id":"1801.02268","repositories_listed":0,"syntology":null},{"url":null,"slug":"avoiding-catastrophic-states-with-intrinsic","title":"Avoiding Catastrophic States with Intrinsic Fear","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-forward-model-for-real-time-strategy","title":"Latent forward model for Real-time Strategy game planning with incomplete information","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dynamic-state-abstractions-for-model","title":"Learning Dynamic State Abstractions for Model-Based Reinforcement Learning","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-objects-from-pixels","title":"Learning objects from pixels","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-play-slot-cars-and-atari-2600","title":"Learning to play slot cars and Atari 2600 games in just minutes","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-for-multidimensional-action","title":"Policy Gradient For Multidimensional Action Spaces: Action Sampling and Entropy Bonus","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-boosted-by","title":"Deep Reinforcement Learning Boosted by External Knowledge","date":"2017-12-12","arxiv_id":"1712.04101","repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-value-approximators-learning-when-to","title":"Natural Value Approximators: Learning when to Trust Past Estimates","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"shared-learning-enhancing-reinforcement-in-q","title":"Shared Learning : Enhancing Reinforcement in $Q$-Ensembles","date":"2017-09-14","arxiv_id":"1709.04909","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-neural-networks-with-human","title":"Pre-training Neural Networks with Human Demonstrations for Deep Reinforcement Learning","date":"2017-09-12","arxiv_id":"1709.04083","repositories_listed":0,"syntology":null},{"url":null,"slug":"shallow-updates-for-deep-reinforcement","title":"Shallow Updates for Deep Reinforcement Learning","date":"2017-05-21","arxiv_id":"1705.07461","repositories_listed":0,"syntology":null}],"record_sha256":"7f28a050b12052828c2f760c9a7fdf092ad1efff5e8af75b640d83a5e8ea4db4","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}