{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/continuous-control/papers/10","list_of":"/task/continuous-control","task":"Continuous Control","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":10,"pages_in_order":12,"rows_per_page":100,"rows":[901,1000],"of":1161,"counts":{"archive_papers_tagged":1161,"with_a_code_link":494,"where_syntology_ran_a_sample":193,"not_listed_spam_title":0,"listed":1161,"listed_where_code_ran":193,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":161,"every_run_a_failure_of_syntologys_instrument":32,"listed_with_a_run_with_no_instrument_failure":161,"listed_every_run_a_failure_of_syntologys_instrument":32,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/continuous-control","prev":"/task/continuous-control/papers/9","next":"/task/continuous-control/papers/11","papers":[{"url":null,"slug":"genetic-soft-updates-for-policy-evolution-in","title":"Genetic Soft Updates for Policy Evolution in Deep Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-efficient-planning-based-rewards-for","title":"Learning Efficient Planning-based Rewards for Imitation Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-latent-landmarks-for-generalizable","title":"Learning Latent Landmarks for Generalizable Planning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-subgoal-representations-with-slow","title":"Learning Subgoal Representations with Slow Dynamics","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-policy-optimization-with-variance","title":"Offline Policy Optimization with Variance Regularization","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-offline-reinforcement-learning-from","title":"Robust Offline Reinforcement Learning from Low-Quality Data","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-quality-diversity-for-neural","title":"Sample efficient Quality Diversity for neural continuous control","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-continuous-control-without","title":"Self-Supervised Continuous Control without Policy Gradient","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unbiased-learning-with-state-conditioned","title":"Unbiased learning with State-Conditioned Rewards in Adversarial Imitation Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"what-matters-for-on-policy-deep-actor-critic","title":"What Matters for On-Policy Deep Actor-Critic Methods? A Large-Scale Study","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-manifold-search-for-improving","title":"Policy Manifold Search for Improving Diversity-based Neuroevolution","date":"2020-12-15","arxiv_id":"2012.08676","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-as-online-learning-with","title":"Policy Optimization as Online Learning with Mediator Feedback","date":"2020-12-15","arxiv_id":"2012.08225","repositories_listed":0,"syntology":null},{"url":null,"slug":"opac-opportunistic-actor-critic","title":"OPAC: Opportunistic Actor-Critic","date":"2020-12-11","arxiv_id":"2012.06555","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-domain-randomised-reinforcement","title":"Robust Domain Randomised Reinforcement Learning through Peer-to-Peer Distillation","date":"2020-12-09","arxiv_id":"2012.04839","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-optimization-smoothed","title":"Proximal Policy Optimization Smoothed Algorithm","date":"2020-12-04","arxiv_id":"2012.02439","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-stability-and-convergence-of-robust","title":"On the Stability and Convergence of Robust Adversarial Reinforcement Learning: A Case Study on Linear Quadratic Systems","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"promoting-stochasticity-for-expressive","title":"Promoting Stochasticity for Expressive Policies via a Simple and Efficient Regularization Method","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-control-with-1","title":"Reinforcement Learning for Control with Multiple Frequencies","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-learning-from-demonstrations-and","title":"Offline Learning from Demonstrations and Unlabeled Experience","date":"2020-11-27","arxiv_id":"2011.13885","repositories_listed":0,"syntology":null},{"url":null,"slug":"consolidation-via-policy-information","title":"Consolidation via Policy Information Regularization in Deep RL for Multi-Agent Games","date":"2020-11-23","arxiv_id":"2011.11517","repositories_listed":0,"syntology":null},{"url":null,"slug":"nested-mixture-of-experts-cooperative-and","title":"Nested Mixture of Experts: Cooperative and Competitive Learning of Hybrid Dynamical System","date":"2020-11-20","arxiv_id":"2011.10605","repositories_listed":0,"syntology":null},{"url":null,"slug":"critic-pi2-master-continuous-planning-via","title":"Critic PI2: Master Continuous Planning via Policy Improvement with Path Integrals and Deep Actor-Critic Reinforcement Learning","date":"2020-11-13","arxiv_id":"2011.06752","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-control-of-constrained","title":"Reinforcement Learning Control of Constrained Dynamic Systems with Uniformly Ultimate Boundedness Stability Guarantee","date":"2020-11-13","arxiv_id":"2011.06882","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-optimization-via-enhanced","title":"Proximal Policy Optimization via Enhanced Exploration Efficiency","date":"2020-11-11","arxiv_id":"2011.05525","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-heterogeneous-deep-reinforcement","title":"Cooperative Heterogeneous Deep Reinforcement Learning","date":"2020-11-02","arxiv_id":"2011.00791","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-using","title":"Sample-efficient reinforcement learning using deep Gaussian processes","date":"2020-11-02","arxiv_id":"2011.01226","repositories_listed":0,"syntology":null},{"url":null,"slug":"behavior-priors-for-efficient-reinforcement","title":"Behavior Priors for Efficient Reinforcement Learning","date":"2020-10-27","arxiv_id":"2010.14274","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-reinforcement-learning-for-continuous","title":"Can Reinforcement Learning for Continuous Control Generalize Across Physics Engines?","date":"2020-10-27","arxiv_id":"2010.14444","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-with-exploration-addressing-dynamics","title":"Planning with Exploration: Addressing Dynamics Bottleneck in Model-based Reinforcement Learning","date":"2020-10-24","arxiv_id":"2010.12914","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-constrained-reinforcement-learning-for-1","title":"Robust Constrained Reinforcement Learning for Continuous Control with Model Misspecification","date":"2020-10-20","arxiv_id":"2010.10644","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-search-for-policy-iteration-in","title":"Local Search for Policy Iteration in Continuous Control","date":"2020-10-12","arxiv_id":"2010.05545","repositories_listed":0,"syntology":null},{"url":null,"slug":"trust-the-model-when-it-is-confident-masked","title":"Trust the Model When It Is Confident: Masked Model-based Actor-Critic","date":"2020-10-10","arxiv_id":"2010.04893","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-rl-with-information-constrained-policies","title":"Deep RL With Information Constrained Policies: Generalization in Continuous Control","date":"2020-10-09","arxiv_id":"2010.04646","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-standard-deviation-the-new-standard","title":"Learning Value Functions in Deep Policy Gradients using Residual Variance","date":"2020-10-09","arxiv_id":"2010.04440","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-the-linear-quadratic-regulator-from","title":"Learning the Linear Quadratic Regulator from Nonlinear Observations","date":"2020-10-08","arxiv_id":"2010.03799","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-many-body-ground","title":"Reinforcement Learning for Many-Body Ground-State Preparation Inspired by Counterdiabatic Driving","date":"2020-10-07","arxiv_id":"2010.03655","repositories_listed":0,"syntology":null},{"url":null,"slug":"heteroscedastic-bayesian-optimisation-for","title":"Heteroscedastic Bayesian Optimisation for Stochastic Model Predictive Control","date":"2020-10-01","arxiv_id":"2010.00202","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-the-gap-between-markowitz-planning","title":"Bridging the gap between Markowitz planning and deep reinforcement learning","date":"2020-09-30","arxiv_id":"2010.09108","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-discretization-for-continuous","title":"Adaptive Discretization for Continuous Control using Particle Filtering Policy Network","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-lyapunov-model-predictive-control","title":"Neural Lyapunov Model Predictive Control","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"what-about-taking-policy-as-input-of-value","title":"What About Taking Policy as Input of Value Function: Policy-extended Value Function Approximator","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-learning-of-features-for-control","title":"Autonomous Learning of Features for Control: Experiments with Embodied and Situated Agents","date":"2020-09-15","arxiv_id":"2009.07132","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-in-cournot","title":"Multi-Agent Reinforcement Learning in Cournot Games","date":"2020-09-14","arxiv_id":"2009.06224","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualizing-the-loss-landscape-of-actor","title":"Visualizing the Loss Landscape of Actor Critic Methods with Applications in Inventory Optimization","date":"2020-09-04","arxiv_id":"2009.02391","repositories_listed":0,"syntology":null},{"url":null,"slug":"relmogen-leveraging-motion-generation-in","title":"ReLMoGen: Leveraging Motion Generation in Reinforcement Learning for Mobile Manipulation","date":"2020-08-18","arxiv_id":"2008.07792","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-model-bias-for-robust-offline-deep","title":"Overcoming Model Bias for Robust Offline Deep Reinforcement Learning","date":"2020-08-12","arxiv_id":"2008.05533","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-deterministic-policy-gradient","title":"Proximal Deterministic Policy Gradient","date":"2020-08-03","arxiv_id":"2008.00759","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-compositional-neural-programs-for","title":"Learning Compositional Neural Programs for Continuous Control","date":"2020-07-27","arxiv_id":"2007.13363","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-bootstrapping-for-uncertainty","title":"Statistical Bootstrapping for Uncertainty Estimation in Off-Policy Evaluation","date":"2020-07-27","arxiv_id":"2007.13609","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-as-hybrid-inference","title":"Control as Hybrid Inference","date":"2020-07-11","arxiv_id":"2007.05838","repositories_listed":0,"syntology":null},{"url":null,"slug":"ddpg-striving-for-simplicity-in-continuous","title":"DDPG++: Striving for Simplicity in Continuous-control Off-Policy Reinforcement Learning","date":"2020-06-26","arxiv_id":"2006.15199","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-optimism-in-model-based-reinforcement","title":"Towards Tractable Optimism in Model-Based Reinforcement Learning","date":"2020-06-21","arxiv_id":"2006.11911","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-estimation-bias-via-weighted-delayed","title":"WD3: Taming the Estimation Bias in Deep Reinforcement Learning","date":"2020-06-18","arxiv_id":"2006.12622","repositories_listed":0,"syntology":null},{"url":null,"slug":"reparameterized-variational-divergence-1","title":"Reparameterized Variational Divergence Minimization for Stable Imitation","date":"2020-06-18","arxiv_id":"2006.10810","repositories_listed":0,"syntology":null},{"url":null,"slug":"colreg-compliant-collision-avoidance-for","title":"COLREG-Compliant Collision Avoidance for Unmanned Surface Vehicle using Deep Reinforcement Learning","date":"2020-06-16","arxiv_id":"2006.09540","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-control-with-learned-dynamics","title":"Data Driven Control with Learned Dynamics: Model-Based versus Model-Free Approach","date":"2020-06-16","arxiv_id":"2006.09543","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-model-based-policy","title":"Provably Efficient Model-based Policy Adaptation","date":"2020-06-14","arxiv_id":"2006.08051","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-hyper-parameter-tuning-in-off-policy","title":"Online Hyper-parameter Tuning in Off-policy Learning via Evolutionary Strategies","date":"2020-06-13","arxiv_id":"2006.07554","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-control-for-searching-and-planning","title":"Continuous Control for Searching and Planning with a Learned Model","date":"2020-06-12","arxiv_id":"2006.07430","repositories_listed":0,"syntology":null},{"url":null,"slug":"decorrelated-double-q-learning","title":"Decorrelated Double Q-learning","date":"2020-06-12","arxiv_id":"2006.06956","repositories_listed":0,"syntology":null},{"url":null,"slug":"lifelong-learning-of-factored-policies-via","title":"Lifelong Learning of Factored Policies via Policy Gradients","date":"2020-06-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/self-imitation-learning-via-generalized-lower","slug":"self-imitation-learning-via-generalized-lower","title":"Self-Imitation Learning via Generalized Lower Bound Q-learning","date":"2020-06-12","arxiv_id":"2006.07442","repositories_listed":0,"syntology":{"n":20,"n_ran":16,"n_constructed":4,"n_ran_checked":13,"n_instrument":3,"n_unverified":4,"n_honours":0,"n_violates":2,"n_no_contract":11,"n_pointer_only":11,"phrase":"16 ran (of which 4 constructed an object rather than computing a result; 13 with no instrument failure: 0 honoured, 2 violated, 11 with no contract checked; 3 where Syntology's instrument failed) · 4 unverified","sample_list":"/paper/self-imitation-learning-via-generalized-lower#ran","syntology_url":"https://syntology.ai/paper/2006.07442","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2006.07442"}},"official":null}},{"url":null,"slug":"skill-discovery-for-exploration-and-planning","title":"Skill Discovery for Exploration and Planning using Deep Skill Graphs","date":"2020-06-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"robustness-to-adversarial-attacks-in-learning","title":"Robustness to Adversarial Attacks in Learning-Enabled Controllers","date":"2020-06-11","arxiv_id":"2006.06861","repositories_listed":0,"syntology":null},{"url":null,"slug":"zeroth-order-supervised-policy-improvement","title":"Zeroth-Order Supervised Policy Improvement","date":"2020-06-11","arxiv_id":"2006.06600","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-model-based-policy-optimization","title":"Variational Model-based Policy Optimization","date":"2020-06-09","arxiv_id":"2006.05443","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-model-based-meta-policy-optimization","title":"Meta-Model-Based Meta-Policy Optimization","date":"2020-06-04","arxiv_id":"2006.02608","repositories_listed":0,"syntology":null},{"url":null,"slug":"refined-continuous-control-of-ddpg-actors-via","title":"Refined Continuous Control of DDPG Actors via Parametrised Activation","date":"2020-06-04","arxiv_id":"2006.02818","repositories_listed":0,"syntology":null},{"url":null,"slug":"gradient-monitored-reinforcement-learning","title":"Gradient Monitored Reinforcement Learning","date":"2020-05-25","arxiv_id":"2005.12108","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounding-language-in-play","title":"Language Conditioned Imitation Learning over Unstructured Data","date":"2020-05-15","arxiv_id":"2005.07648","repositories_listed":0,"syntology":null},{"url":null,"slug":"unbiased-deep-reinforcement-learning-a","title":"Unbiased Deep Reinforcement Learning: A General Training Framework for Existing and Future Algorithms","date":"2020-05-12","arxiv_id":"2005.07782","repositories_listed":0,"syntology":null},{"url":null,"slug":"keep-doing-what-worked-behavior-modelling","title":"Keep Doing What Worked: Behavior Modelling Priors for Offline Reinforcement Learning","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-evaluating-robustness-of-deep","title":"Toward Evaluating Robustness of Deep Reinforcement Learning with Continuous Control","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-soft-actor-critic-for-risk","title":"DSAC: Distributional Soft Actor Critic for Risk-Sensitive Reinforcement Learning","date":"2020-04-30","arxiv_id":"2004.14547","repositories_listed":0,"syntology":null},{"url":null,"slug":"conservation-voltage-reduction-cvr-via-two","title":"Conservation Voltage Reduction (CVR) via Two-Timescale Control in Unbalanced Power Distribution Systems","date":"2020-04-24","arxiv_id":"2004.11879","repositories_listed":0,"syntology":null},{"url":null,"slug":"pbcs-efficient-exploration-and-exploitation","title":"PBCS : Efficient Exploration and Exploitation Using a Synergy between Reinforcement Learning and Motion Planning","date":"2020-04-24","arxiv_id":"2004.11667","repositories_listed":0,"syntology":null},{"url":null,"slug":"divide-and-conquer-monte-carlo-tree-search","title":"Divide-and-Conquer Monte Carlo Tree Search For Goal-Directed Planning","date":"2020-04-23","arxiv_id":"2004.11410","repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsic-exploration-as-multi-objective-rl","title":"Intrinsic Exploration as Multi-Objective RL","date":"2020-04-06","arxiv_id":"2004.02380","repositories_listed":0,"syntology":null},{"url":null,"slug":"uniform-state-abstraction-for-reinforcement","title":"Uniform State Abstraction For Reinforcement Learning","date":"2020-04-06","arxiv_id":"2004.02919","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-reinforcement-learning-for","title":"Weakly-Supervised Reinforcement Learning for Controllable Behavior","date":"2020-04-06","arxiv_id":"2004.02860","repositories_listed":0,"syntology":null},{"url":null,"slug":"abc-lmpc-safe-sample-based-learning-mpc-for","title":"ABC-LMPC: Safe Sample-Based Learning MPC for Stochastic Nonlinear Dynamical Systems with Adjustable Boundary Conditions","date":"2020-03-03","arxiv_id":"2003.01410","repositories_listed":0,"syntology":null},{"url":null,"slug":"planet-of-the-bayesians-reconsidering-and","title":"PlaNet of the Bayesians: Reconsidering and Improving Deep Planning Network by Incorporating Bayesian Inference","date":"2020-03-01","arxiv_id":"2003.00370","repositories_listed":0,"syntology":null},{"url":null,"slug":"200210451","title":"Neural Lyapunov Model Predictive Control: Learning Safe Global Controllers from Sub-optimal Examples","date":"2020-02-21","arxiv_id":"2002.10451","repositories_listed":0,"syntology":null},{"url":null,"slug":"oirl-robust-adversarial-inverse-reinforcement","title":"oIRL: Robust Adversarial Inverse Reinforcement Learning with Temporally Extended Actions","date":"2020-02-20","arxiv_id":"2002.09043","repositories_listed":0,"syntology":null},{"url":null,"slug":"keep-doing-what-worked-behavioral-modelling","title":"Keep Doing What Worked: Behavioral Modelling Priors for Offline Reinforcement Learning","date":"2020-02-19","arxiv_id":"2002.08396","repositories_listed":0,"syntology":null},{"url":null,"slug":"kogun-accelerating-deep-reinforcement","title":"KoGuN: Accelerating Deep Reinforcement Learning via Integrating Human Suboptimal Knowledge","date":"2020-02-18","arxiv_id":"2002.07418","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-issue-bargaining-with-deep","title":"Multi-Issue Bargaining With Deep Reinforcement Learning","date":"2020-02-18","arxiv_id":"2002.07788","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-experience-selection-for-policy","title":"Adaptive Experience Selection for Policy Gradient","date":"2020-02-17","arxiv_id":"2002.06946","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-functionally-decomposed-hierarchies-1","title":"Learning Functionally Decomposed Hierarchies for Continuous Control Tasks with Path Planning","date":"2020-02-14","arxiv_id":"2002.05954","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximizing-the-total-reward-via-reward","title":"Reward Tweaking: Maximizing the Total Reward While Planning for Short Horizons","date":"2020-02-09","arxiv_id":"2002.03327","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-maximum-entropy-reinforcement","title":"Off-policy Maximum Entropy Reinforcement Learning : Soft Actor-Critic with Advantage Weighted Mixture Policy(SAC-AWMP)","date":"2020-02-07","arxiv_id":"2002.02829","repositories_listed":0,"syntology":null},{"url":null,"slug":"ready-policy-one-world-building-through","title":"Ready Policy One: World Building Through Active Learning","date":"2020-02-07","arxiv_id":"2002.02693","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-rbf-value-functions-for-continuous","title":"Deep Radial-Basis Value Functions for Continuous Control","date":"2020-02-05","arxiv_id":"2002.01883","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adversarial-and-conditional-state","title":"Domain-Adversarial and Conditional State Space Model for Imitation Learning","date":"2020-01-31","arxiv_id":"2001.11628","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-in-enormous-action-spaces-via","title":"Q-Learning in enormous action spaces via amortized approximate maximization","date":"2020-01-22","arxiv_id":"2001.08116","repositories_listed":0,"syntology":null},{"url":null,"slug":"seerl-sample-efficient-ensemble-reinforcement-1","title":"SEERL: Sample Efficient Ensemble Reinforcement Learning","date":"2020-01-15","arxiv_id":"2001.05209","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-tracking-control-for","title":"Reinforcement Learning Tracking Control for Robotic Manipulator With Kernel-Based Dynamic Model","date":"2020-01-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-game-theoretic-perspective-on-model-based","title":"A Game Theoretic Perspective on Model-Based Reinforcement Learning","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-reinforcement-learning-with","title":"Batch Reinforcement Learning with Hyperparameter Gradients","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"comic-co-training-and-mimicry-for-reusable","title":"CoMic: Co-Training and Mimicry for Reusable Skills","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"1392447f9a0c1a903ae749d524d805229a7c30ef00f3bf60116af82f98159d9c","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}