{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/continuous-control/papers/11","list_of":"/task/continuous-control","task":"Continuous Control","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":11,"pages_in_order":12,"rows_per_page":100,"rows":[1001,1100],"of":1161,"counts":{"archive_papers_tagged":1161,"with_a_code_link":494,"where_syntology_ran_a_sample":193,"not_listed_spam_title":0,"listed":1161,"listed_where_code_ran":193,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":161,"every_run_a_failure_of_syntologys_instrument":32,"listed_with_a_run_with_no_instrument_failure":161,"listed_every_run_a_failure_of_syntologys_instrument":32,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/continuous-control","prev":"/task/continuous-control/papers/10","next":"/task/continuous-control/papers/12","papers":[{"url":null,"slug":"inferring-dqn-structure-for-high-dimensional","title":"Inferring DQN structure for high-dimensional continuous control","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-replay-memory-in-reinforcement","title":"Augmented Replay Memory in Reinforcement Learning With Continuous Control","date":"2019-12-29","arxiv_id":"1912.12719","repositories_listed":0,"syntology":null},{"url":null,"slug":"crowdfunding-dynamics-tracking-a","title":"Crowdfunding Dynamics Tracking: A Reinforcement Learning Approach","date":"2019-12-27","arxiv_id":"1912.12016","repositories_listed":0,"syntology":null},{"url":null,"slug":"quasi-newton-trust-region-policy-optimization","title":"Quasi-Newton Trust Region Policy Optimization","date":"2019-12-26","arxiv_id":"1912.11912","repositories_listed":0,"syntology":null},{"url":null,"slug":"taming-an-autonomous-surface-vehicle-for-path","title":"Taming an autonomous surface vehicle for path following and collision avoidance using deep reinforcement learning","date":"2019-12-18","arxiv_id":"1912.08578","repositories_listed":0,"syntology":null},{"url":null,"slug":"recruitment-imitation-mechanism-for","title":"Recruitment-imitation Mechanism for Evolutionary Reinforcement Learning","date":"2019-12-13","arxiv_id":"1912.06310","repositories_listed":0,"syntology":null},{"url":null,"slug":"doubly-robust-off-policy-actor-critic","title":"Doubly Robust Off-Policy Actor-Critic Algorithms for Reinforcement Learning","date":"2019-12-11","arxiv_id":"1912.05109","repositories_listed":0,"syntology":null},{"url":null,"slug":"marginalized-state-distribution-entropy","title":"Marginalized State Distribution Entropy Regularization in Policy Optimization","date":"2019-12-11","arxiv_id":"1912.05128","repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-cyberattacks-in-industrial-control-1","title":"Detecting Cyberattacks in Industrial Control Systems Using Online Learning Algorithms","date":"2019-12-08","arxiv_id":"1912.03589","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-policy-reinforcement-learning-with-entropy","title":"Policy Optimization Reinforcement Learning with Entropy Regularization","date":"2019-12-02","arxiv_id":"1912.01557","repositories_listed":0,"syntology":null},{"url":null,"slug":"impact-importance-weighted-asynchronous-1","title":"IMPACT: Importance Weighted Asynchronous Architectures with Clipped Target Networks","date":"2019-11-30","arxiv_id":"1912.00167","repositories_listed":0,"syntology":null},{"url":null,"slug":"quadratic-q-network-for-learning-continuous","title":"Quadratic Q-network for Learning Continuous Control for Autonomous Vehicles","date":"2019-11-29","arxiv_id":"1912.00074","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-random-search-for-quadcopter","title":"Augmented Random Search for Quadcopter Control: An alternative to Reinforcement Learning","date":"2019-11-28","arxiv_id":"1911.12553","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-observables-for-continuous-control-of","title":"Quantum Observables for continuous control of the Quantum Approximate Optimization Algorithm via Reinforcement Learning","date":"2019-11-21","arxiv_id":"1911.09682","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-policy-gradient-algorithms-by","title":"Off-Policy Policy Gradient Algorithms by Constraining the State Distribution Shift","date":"2019-11-16","arxiv_id":"1911.06970","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-exploration-through-latent","title":"Improved Exploration through Latent Trajectory Optimization in Deep Deterministic Policy Gradient","date":"2019-11-15","arxiv_id":"1911.06833","repositories_listed":0,"syntology":null},{"url":null,"slug":"challenging-on-car-racing-problem-from-openai","title":"Challenging On Car Racing Problem from OpenAI gym","date":"2019-11-02","arxiv_id":"1911.04868","repositories_listed":0,"syntology":null},{"url":null,"slug":"vase-variational-assorted-surprise","title":"VASE: Variational Assorted Surprise Exploration for Reinforcement Learning","date":"2019-10-31","arxiv_id":"1910.14351","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-control-with-contexts-provably-1","title":"Continuous Control with Contexts, Provably","date":"2019-10-30","arxiv_id":"1910.13614","repositories_listed":0,"syntology":null},{"url":null,"slug":"better-exploration-with-optimistic-actor","title":"Better Exploration with Optimistic Actor-Critic","date":"2019-10-28","arxiv_id":"1910.12807","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-architecture-evolution-in-deep","title":"Neural Architecture Evolution in Deep Reinforcement Learning for Continuous Control","date":"2019-10-28","arxiv_id":"1910.12824","repositories_listed":0,"syntology":null},{"url":null,"slug":"all-action-policy-gradient-methods-a","title":"All-Action Policy Gradient Methods: A Numerical Integration Approach","date":"2019-10-21","arxiv_id":"1910.09093","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularizing-model-based-planning-with-energy","title":"Regularizing Model-Based Planning with Energy-Based Models","date":"2019-10-12","arxiv_id":"1910.05527","repositories_listed":0,"syntology":null},{"url":null,"slug":"ctrl-z-recovering-from-instability-in","title":"Ctrl-Z: Recovering from Instability in Reinforcement Learning","date":"2019-10-09","arxiv_id":"1910.03732","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-step-greedy-policies-in-model-free-deep-1","title":"Multi-step Greedy Reinforcement Learning Algorithms","date":"2019-10-07","arxiv_id":"1910.02919","repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-off-policy-reinforcement-learning","title":"Never Worse, Mostly Better: Stable Policy Improvement in Deep Reinforcement Learning","date":"2019-10-02","arxiv_id":"1910.01062","repositories_listed":0,"syntology":null},{"url":null,"slug":"caql-continuous-action-q-learning","title":"CAQL: Continuous Action Q-Learning","date":"2019-09-26","arxiv_id":"1909.12397","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-dimensional-control-using-generalized","title":"MERL: Multi-Head Reinforcement Learning","date":"2019-09-26","arxiv_id":"1909.11939","repositories_listed":0,"syntology":null},{"url":null,"slug":"advantage-weighted-regression-simple-and-1","title":"Advantage Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"capacity-limited-reinforcement-learning","title":"CAPACITY-LIMITED REINFORCEMENT LEARNING: APPLICATIONS IN DEEP ACTOR-CRITIC METHODS FOR CONTINUOUS CONTROL","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-functionally-decomposed-hierarchies","title":"Learning Functionally Decomposed Hierarchies for Continuous Navigation Tasks","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-learning-control-of-nonlinear","title":"Model-free Learning Control of Nonlinear Stochastic Systems with Stability Guarantee","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-step-greedy-policies-in-model-free-deep","title":"Multi-step Greedy Policies in Model-Free Deep Reinforcement Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-in-the-face-of","title":"Policy Optimization In the Face of Uncertainty","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"qxplore-q-learning-exploration-by-maximizing-1","title":"QXplore: Q-Learning Exploration by Maximizing Temporal Difference Error","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"regulatory-focus-promotion-and-prevention","title":"Regulatory Focus: Promotion and Prevention Inclinations in Policy Search","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-policy-learning-for-continuous-control","title":"Safe Policy Learning for Continuous Control","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"samples-are-useful-not-always-denoising","title":"Samples Are Useful? Not Always: denoising policy gradient updates using variance explained","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-simplicity-in-deep-reinforcement","title":"Towards Simplicity in Deep Reinforcement Learning: Streamlined Off-Policy Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"how-much-do-unstated-problem-constraints","title":"How Much Do Unstated Problem Constraints Limit Deep Robotic Reinforcement Learning?","date":"2019-09-20","arxiv_id":"1909.09282","repositories_listed":0,"syntology":null},{"url":null,"slug":"attraction-repulsion-actor-critic-for","title":"Attraction-Repulsion Actor-Critic for Continuous Control Reinforcement Learning","date":"2019-09-17","arxiv_id":"1909.07543","repositories_listed":0,"syntology":null},{"url":null,"slug":"biased-estimates-of-advantages-over-path","title":"Biased Estimates of Advantages over Path Ensembles","date":"2019-09-15","arxiv_id":"1909.06851","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-prediction-network-model-free-behavior","title":"Policy Prediction Network: Model-Free Behavior Policy with Model-Based Learning in Continuous Action Space","date":"2019-09-15","arxiv_id":"1909.07373","repositories_listed":0,"syntology":null},{"url":null,"slug":"vild-variational-imitation-learning-with","title":"VILD: Variational Imitation Learning with Diverse-quality Demonstrations","date":"2019-09-15","arxiv_id":"1909.06769","repositories_listed":0,"syntology":null},{"url":null,"slug":"deterministic-value-policy-gradients","title":"Deterministic Value-Policy Gradients","date":"2019-09-09","arxiv_id":"1909.03939","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-in-transfer-learning","title":"Generalization in Transfer Learning","date":"2019-09-03","arxiv_id":"1909.01331","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-lookahead-reinforcement-learning","title":"Model-based Lookahead Reinforcement Learning","date":"2019-08-15","arxiv_id":"1908.06012","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-control-for-high-dimensional-state","title":"Continuous Control for High-Dimensional State Spaces: An Interactive Learning Approach","date":"2019-08-14","arxiv_id":"1908.05256","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-rational-control-with-partially","title":"Inverse Rational Control with Partially Observable Continuous Nonlinear Dynamics","date":"2019-08-13","arxiv_id":"1908.04696","repositories_listed":0,"syntology":null},{"url":null,"slug":"promoting-coordination-through-policy","title":"Promoting Coordination through Policy Regularization in Multi-Agent Deep Reinforcement Learning","date":"2019-08-06","arxiv_id":"1908.02269","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-simplex-architecture","title":"Neural Simplex Architecture","date":"2019-08-01","arxiv_id":"1908.00528","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-model-based-approach-for-sample-efficient","title":"A Model-based Approach for Sample-efficient Multi-task Reinforcement Learning","date":"2019-07-11","arxiv_id":"1907.04964","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-projected-policy-gradient-for","title":"Imitation-Projected Programmatic Reinforcement Learning","date":"2019-07-11","arxiv_id":"1907.05431","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-policy-robot-imitation-learning-from-a","title":"On-Policy Robot Imitation Learning from a Converging Supervisor","date":"2019-07-08","arxiv_id":"1907.03423","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-inductive-biases-in-deep-reinforcement","title":"On Inductive Biases in Deep Reinforcement Learning","date":"2019-07-05","arxiv_id":"1907.02908","repositories_listed":0,"syntology":null},{"url":null,"slug":"fidi-rl-incorporating-deep-reinforcement","title":"FiDi-RL: Incorporating Deep Reinforcement Learning with Finite-Difference Policy Search for Efficient Learning of Continuous Control","date":"2019-07-01","arxiv_id":"1907.00526","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-with-stochastic-mirror","title":"Policy Optimization with Stochastic Mirror Descent","date":"2019-06-25","arxiv_id":"1906.10462","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-model-based-policy","title":"Uncertainty-aware Model-based Policy Optimization","date":"2019-06-25","arxiv_id":"1906.10717","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-reinforcement-learning-with","title":"Continual Reinforcement Learning with Diversity Exploration and Adversarial Self-Correction","date":"2019-06-21","arxiv_id":"1906.09205","repositories_listed":0,"syntology":null},{"url":null,"slug":"max-plus-matching-pursuit-for-deterministic","title":"Max-Plus Matching Pursuit for Deterministic Markov Decision Processes","date":"2019-06-20","arxiv_id":"1906.08524","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-replay-optimization","title":"Experience Replay Optimization","date":"2019-06-19","arxiv_id":"1906.08387","repositories_listed":0,"syntology":null},{"url":null,"slug":"qxplore-q-learning-exploration-by-maximizing","title":"Reward Prediction Error as an Exploration Objective in Deep RL","date":"2019-06-19","arxiv_id":"1906.08189","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-for-continuous","title":"Robust Reinforcement Learning for Continuous Control with Model Misspecification","date":"2019-06-18","arxiv_id":"1906.07516","repositories_listed":0,"syntology":null},{"url":null,"slug":"jacobian-policy-optimizations","title":"Conditioning of Reinforcement Learning Agents and its Policy Regularization Application","date":"2019-06-13","arxiv_id":"1906.05437","repositories_listed":0,"syntology":null},{"url":null,"slug":"clustered-reinforcement-learning","title":"Clustered Reinforcement Learning","date":"2019-06-06","arxiv_id":"1906.02457","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-control-for-automated-lane-change","title":"Continuous Control for Automated Lane Change Behavior Based on Deep Deterministic Policy Gradient Algorithm","date":"2019-06-05","arxiv_id":"1906.02275","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-analysis-of-approximate-policy","title":"Finite-time Analysis of Approximate Policy Iteration for the Linear Quadratic Regulator","date":"2019-05-30","arxiv_id":"1905.12842","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-dynamics-and-returns-value","title":"Disentangling Dynamics and Returns: Value Function Decomposition with Future Prediction","date":"2019-05-27","arxiv_id":"1905.11100","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-search-by-target-distribution-learning","title":"Policy Search by Target Distribution Learning for Continuous Control","date":"2019-05-27","arxiv_id":"1905.11041","repositories_listed":0,"syntology":null},{"url":null,"slug":"combine-ppo-with-nes-to-improve-exploration","title":"Combine PPO with NES to Improve Exploration","date":"2019-05-23","arxiv_id":"1905.09492","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-value-functions","title":"Recurrent Value Functions","date":"2019-05-23","arxiv_id":"1905.09562","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolving-rewards-to-automate-reinforcement","title":"Evolving Rewards to Automate Reinforcement Learning","date":"2019-05-18","arxiv_id":"1905.07628","repositories_listed":0,"syntology":null},{"url":null,"slug":"curious-meta-controller-adaptive-alternation","title":"Curious Meta-Controller: Adaptive Alternation between Model-Based and Model-Free Control in Deep Reinforcement Learning","date":"2019-05-05","arxiv_id":"1905.01718","repositories_listed":0,"syntology":null},{"url":null,"slug":"composing-complex-skills-by-learning","title":"Composing Complex Skills by Learning Transition Policies with Proximity Reward Induction","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-planning-with-sequential-monte","title":"Probabilistic Planning with Sequential Monte Carlo methods","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-imitation-learning-for","title":"Sample Efficient Imitation Learning for Continuous Control","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"trajectory-vae-for-multi-modal-imitation","title":"Trajectory VAE for multi-modal imitation","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"how-you-act-tells-a-lot-privacy-leakage","title":"How You Act Tells a Lot: Privacy-Leakage Attack on Deep Reinforcement Learning","date":"2019-04-24","arxiv_id":"1904.11082","repositories_listed":0,"syntology":null},{"url":null,"slug":"simion-zoo-a-workbench-for-distributed","title":"Simion Zoo: A Workbench for Distributed Experimentation with Reinforcement Learning for Continuous Control Tasks","date":"2019-04-16","arxiv_id":"1904.07817","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-trajectory-prediction-with","title":"Energy-Based Continuous Inverse Optimal Control","date":"2019-04-10","arxiv_id":"1904.05453","repositories_listed":0,"syntology":null},{"url":null,"slug":"samples-are-not-all-useful-denoising-policy","title":"Only Relevant Information Matters: Filtering Out Noisy Samples to Boost RL","date":"2019-04-08","arxiv_id":"1904.04025","repositories_listed":0,"syntology":null},{"url":null,"slug":"guided-meta-policy-search","title":"Guided Meta-Policy Search","date":"2019-04-01","arxiv_id":"1904.00956","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-relation-between-maximum","title":"Understanding the Relation Between Maximum-Entropy Inverse Reinforcement Learning and Behaviour Cloning","date":"2019-03-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-characterizing-divergence-in-deep-q","title":"Towards Characterizing Divergence in Deep Q-Learning","date":"2019-03-21","arxiv_id":"1903.08894","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-hierarchy-for-learning-and","title":"Exploiting Hierarchy for Learning and Transfer in KL-regularized RL","date":"2019-03-18","arxiv_id":"1903.07438","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-gaussian-policies-from-corrective","title":"Learning Gaussian Policies from Corrective Human Feedback","date":"2019-03-12","arxiv_id":"1903.05216","repositories_listed":0,"syntology":null},{"url":null,"slug":"rloc-neurobiologically-inspired-hierarchical","title":"RLOC: Neurobiologically Inspired Hierarchical Reinforcement Learning Algorithm for Continuous Control of Nonlinear Dynamical Systems","date":"2019-03-07","arxiv_id":"1903.03064","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributionally-robust-reinforcement","title":"Distributionally Robust Reinforcement Learning","date":"2019-02-23","arxiv_id":"1902.08708","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergent-coordination-through-competition","title":"Emergent Coordination Through Competition","date":"2019-02-19","arxiv_id":"1902.07151","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-in-pomdps-with","title":"Robust Reinforcement Learning in POMDPs with Incomplete and Noisy Observations","date":"2019-02-15","arxiv_id":"1902.05795","repositories_listed":0,"syntology":null},{"url":null,"slug":"compatible-natural-gradient-policy-search","title":"Compatible Natural Gradient Policy Search","date":"2019-02-07","arxiv_id":"1902.02823","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-multi","title":"Multi-Agent Reinforcement Learning with Multi-Step Generative Models","date":"2019-01-29","arxiv_id":"1901.10251","repositories_listed":0,"syntology":null},{"url":null,"slug":"reneg-and-backseat-driver-learning-from","title":"ReNeg and Backseat Driver: Learning from Demonstration with Continuous Human Feedback","date":"2019-01-16","arxiv_id":"1901.05101","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-perception-in-reinforcement-learning","title":"Motion Perception in Reinforcement Learning with Dynamic Objects","date":"2019-01-10","arxiv_id":"1901.03162","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-active-learning-framework-for-efficient","title":"An Active Learning Framework for Efficient Robust Policy Search","date":"2019-01-01","arxiv_id":"1901.00117","repositories_listed":0,"syntology":null},{"url":null,"slug":"nadpex-an-on-policy-temporally-consistent","title":"NADPEx: An on-policy temporally consistent exploration method for deep reinforcement learning","date":"2018-12-21","arxiv_id":"1812.09028","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adaptation-for-reinforcement-learning","title":"Domain Adaptation for Reinforcement Learning on the Atari","date":"2018-12-18","arxiv_id":"1812.07452","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-gap-between-model-based-and-model-free","title":"The Gap Between Model-Based and Model-Free Methods on the Linear Quadratic Regulator: An Asymptotic Viewpoint","date":"2018-12-09","arxiv_id":"1812.03565","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-transfer-learning-and-online","title":"Efficient transfer learning and online adaptation with latent variable models for continuous control","date":"2018-12-08","arxiv_id":"1812.03399","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropic-policy-composition-with-generalized","title":"Composing Entropic Policies using Divergence Correction","date":"2018-12-05","arxiv_id":"1812.02216","repositories_listed":0,"syntology":null}],"record_sha256":"7982418f5640b6da144e387869015ecd26a5a3fb4260c1182a6fbf14559c5e77","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}