{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/mujoco/papers/7","list_of":"/task/mujoco","task":"MuJoCo","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":7,"pages_in_order":7,"rows_per_page":100,"rows":[601,677],"of":677,"counts":{"archive_papers_tagged":677,"with_a_code_link":293,"where_syntology_ran_a_sample":115,"not_listed_spam_title":0,"listed":677,"listed_where_code_ran":115,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":103,"every_run_a_failure_of_syntologys_instrument":12,"listed_with_a_run_with_no_instrument_failure":103,"listed_every_run_a_failure_of_syntologys_instrument":12,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/mujoco","prev":"/task/mujoco/papers/6","next":null,"papers":[{"url":null,"slug":"stealthy-and-efficient-adversarial-attacks","title":"Stealthy and Efficient Adversarial Attacks against Deep Reinforcement Learning","date":"2020-05-14","arxiv_id":"2005.07099","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-evaluating-robustness-of-deep","title":"Toward Evaluating Robustness of Deep Reinforcement Learning with Continuous Control","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-object-level-deep","title":"Relevance-Guided Modeling of Object Dynamics for Reinforcement Learning","date":"2020-03-03","arxiv_id":"2003.01384","repositories_listed":0,"syntology":null},{"url":null,"slug":"gaussian-process-policy-optimization","title":"Gaussian Process Policy Optimization","date":"2020-03-02","arxiv_id":"2003.01074","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-hidden-parameter-mdps","title":"Generalized Hidden Parameter MDPs Transferable Model-based RL in a Handful of Trials","date":"2020-02-08","arxiv_id":"2002.03072","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-reinforcement-learning-with-a","title":"Multi-task Reinforcement Learning with a Planning Quasi-Metric","date":"2020-02-08","arxiv_id":"2002.03240","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-adaptive-hierarchical-reinforcement","title":"Temporal-adaptive Hierarchical Reinforcement Learning","date":"2020-02-06","arxiv_id":"2002.02080","repositories_listed":0,"syntology":null},{"url":null,"slug":"lyceum-an-efficient-and-scalable-ecosystem-1","title":"Lyceum: An efficient and scalable ecosystem for robot learning","date":"2020-01-21","arxiv_id":"2001.07343","repositories_listed":0,"syntology":null},{"url":null,"slug":"effects-of-sparse-rewards-of-different","title":"Effects of sparse rewards of different magnitudes in the speed of learning of model-based actor critic methods","date":"2020-01-18","arxiv_id":"2001.06725","repositories_listed":0,"syntology":null},{"url":null,"slug":"seerl-sample-efficient-ensemble-reinforcement-1","title":"SEERL: Sample Efficient Ensemble Reinforcement Learning","date":"2020-01-15","arxiv_id":"2001.05209","repositories_listed":0,"syntology":null},{"url":null,"slug":"universal-successor-features-for-transfer-1","title":"Universal Successor Features for Transfer Reinforcement Learning","date":"2020-01-05","arxiv_id":"2001.04025","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-adaptation-to-new-environments-via","title":"Fast Adaptation to New Environments via Policy-Dynamics Value Functions","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"inferring-dqn-structure-for-high-dimensional","title":"Inferring DQN structure for high-dimensional continuous control","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"recruitment-imitation-mechanism-for","title":"Recruitment-imitation Mechanism for Evolutionary Reinforcement Learning","date":"2019-12-13","arxiv_id":"1912.06310","repositories_listed":0,"syntology":null},{"url":null,"slug":"parareal-with-a-learned-coarse-model-for","title":"Parareal with a Learned Coarse Model for Robotic Manipulation","date":"2019-12-12","arxiv_id":"1912.05958","repositories_listed":0,"syntology":null},{"url":null,"slug":"manga-method-agnostic-neural-policy","title":"MANGA: Method Agnostic Neural-policy Generalization and Adaptation","date":"2019-11-19","arxiv_id":"1911.08444","repositories_listed":0,"syntology":null},{"url":null,"slug":"gradientless-descent-high-dimensional-zeroth-1","title":"Gradientless Descent: High-Dimensional Zeroth-Order Optimization","date":"2019-11-14","arxiv_id":"1911.06317","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-path-policy-optimization","title":"Multi-Path Policy Optimization","date":"2019-11-11","arxiv_id":"1911.04207","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-step-greedy-policies-in-model-free-deep-1","title":"Multi-step Greedy Reinforcement Learning Algorithms","date":"2019-10-07","arxiv_id":"1910.02919","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-observations-using-a-single","title":"Learning from Observations Using a Single Video Demonstration and Human Feedback","date":"2019-09-29","arxiv_id":"1909.13392","repositories_listed":0,"syntology":null},{"url":null,"slug":"relationship-explainable-multi-objective","title":"Relationship Explainable Multi-objective Reinforcement Learning with Semantic Explainability Generation","date":"2019-09-26","arxiv_id":"1909.12268","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-inter-agent-knowledge","title":"Collaborative Inter-agent Knowledge Distillation for Reinforcement Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"crossnorm-on-normalization-for-off-policy","title":"CrossNorm: On Normalization for Off-Policy Reinforcement Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-exploration-by-novelty-pursuit-with","title":"Deep exploration by novelty-pursuit with maximum state entropy","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-latent-representations-for-inverse","title":"Learning Latent Representations for Inverse Dynamics using Generalized Experiences","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-tree-network","title":"Policy Tree Network","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-as-batch-meta-reinforcement","title":"Multi-task Batch Reinforcement Learning with Metric Learning","date":"2019-09-25","arxiv_id":"1909.11373","repositories_listed":0,"syntology":null},{"url":null,"slug":"regulatory-focus-promotion-and-prevention","title":"Regulatory Focus: Promotion and Prevention Inclinations in Policy Search","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-averse-value-expansion-for-sample","title":"Risk Averse Value Expansion for Sample Efficient and Robust Policy Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-policy-learning-for-continuous-control","title":"Safe Policy Learning for Continuous Control","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-off-policy-reinforcement-learning-1","title":"Stabilizing Off-Policy Reinforcement Learning with Conservative Policy Gradients","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-simplicity-in-deep-reinforcement","title":"Towards Simplicity in Deep Reinforcement Learning: Streamlined Off-Policy Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"attraction-repulsion-actor-critic-for","title":"Attraction-Repulsion Actor-Critic for Continuous Control Reinforcement Learning","date":"2019-09-17","arxiv_id":"1909.07543","repositories_listed":0,"syntology":null},{"url":null,"slug":"biased-estimates-of-advantages-over-path","title":"Biased Estimates of Advantages over Path Ensembles","date":"2019-09-15","arxiv_id":"1909.06851","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-prediction-network-model-free-behavior","title":"Policy Prediction Network: Model-Free Behavior Policy with Model-Based Learning in Continuous Action Space","date":"2019-09-15","arxiv_id":"1909.07373","repositories_listed":0,"syntology":null},{"url":null,"slug":"mutual-information-regularization-in-markov","title":"Mutual-Information Regularization in Markov Decision Processes and Actor-Critic Learning","date":"2019-09-11","arxiv_id":"1909.05950","repositories_listed":0,"syntology":null},{"url":null,"slug":"skill-transfer-in-deep-reinforcement-learning","title":"Skill Transfer in Deep Reinforcement Learning under Morphological Heterogeneity","date":"2019-08-14","arxiv_id":"1908.05265","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-bellman-optimality-principle","title":"A Unified Bellman Optimality Principle Combining Reward Maximization and Empowerment","date":"2019-07-26","arxiv_id":"1907.12392","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantile-regression-deep-reinforcement","title":"Learning Policies through Quantile Regression","date":"2019-06-27","arxiv_id":"1906.11941","repositories_listed":0,"syntology":null},{"url":null,"slug":"qxplore-q-learning-exploration-by-maximizing","title":"Reward Prediction Error as an Exploration Objective in Deep RL","date":"2019-06-19","arxiv_id":"1906.08189","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-for-continuous","title":"Robust Reinforcement Learning for Continuous Control with Model Misspecification","date":"2019-06-18","arxiv_id":"1906.07516","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-efficient-and-effective-exploration","title":"Learning Efficient and Effective Exploration Policies with Counterfactual Meta Policy","date":"2019-05-28","arxiv_id":"1905.11583","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-dynamics-and-returns-value","title":"Disentangling Dynamics and Returns: Value Function Decomposition with Future Prediction","date":"2019-05-27","arxiv_id":"1905.11100","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-search-by-target-distribution-learning","title":"Policy Search by Target Distribution Learning for Continuous Control","date":"2019-05-27","arxiv_id":"1905.11041","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-learning-from-video-by-leveraging","title":"Imitation Learning from Video by Leveraging Proprioception","date":"2019-05-22","arxiv_id":"1905.09335","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolving-rewards-to-automate-reinforcement","title":"Evolving Rewards to Automate Reinforcement Learning","date":"2019-05-18","arxiv_id":"1905.07628","repositories_listed":0,"syntology":null},{"url":null,"slug":"composing-complex-skills-by-learning","title":"Composing Complex Skills by Learning Transition Policies with Proximity Reward Induction","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-rl-using-an-ensemble-of","title":"Hierarchical RL Using an Ensemble of Proprioceptive Periodic Policies","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dot-to-dot-achieving-structured-robotic","title":"Dot-to-Dot: Explainable Hierarchical Reinforcement Learning for Robotic Manipulation","date":"2019-04-14","arxiv_id":"1904.06703","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-characterizing-divergence-in-deep-q","title":"Towards Characterizing Divergence in Deep Q-Learning","date":"2019-03-21","arxiv_id":"1903.08894","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-random-search-is-not-enough-sample","title":"Provably Robust Blackbox Optimization for Reinforcement Learning","date":"2019-03-07","arxiv_id":"1903.02993","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-a-prior-for-rhea-for-better-online","title":"Learn a Prior for RHEA for Better Online Planning","date":"2019-02-14","arxiv_id":"1902.05284","repositories_listed":0,"syntology":null},{"url":null,"slug":"tsallis-reinforcement-learning-a-unified","title":"Tsallis Reinforcement Learning: A Unified Framework for Maximum Entropy Reinforcement Learning","date":"2019-01-31","arxiv_id":"1902.00137","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-with-distribution","title":"Meta Reinforcement Learning with Distribution of Exploration Parameters Learned by Evolution Strategies","date":"2018-12-29","arxiv_id":"1812.11314","repositories_listed":0,"syntology":null},{"url":null,"slug":"nadpex-an-on-policy-temporally-consistent","title":"NADPEx: An on-policy temporally consistent exploration method for deep reinforcement learning","date":"2018-12-21","arxiv_id":"1812.09028","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-logarithmic-barrier-method-for-proximal","title":"A Logarithmic Barrier Method For Proximal Policy Optimization","date":"2018-12-16","arxiv_id":"1812.06502","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-adversarial-self-imitation","title":"Generative Adversarial Self-Imitation Learning","date":"2018-12-03","arxiv_id":"1812.00950","repositories_listed":0,"syntology":null},{"url":null,"slug":"blockpuzzle-a-challenge-in-physical-reasoning","title":"BlockPuzzle - A Challenge in Physical Reasoning and Generalization for Robot Learning","date":"2018-11-30","arxiv_id":"1812.00091","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-asymptotic-performance-of","title":"Understanding the Asymptotic Performance of Model-Based RL Methods","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-on-policy-learning-with-statistical","title":"Improving On-policy Learning with Statistical Reward Accumulation","date":"2018-09-07","arxiv_id":"1809.02387","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-generative-adversarial","title":"Risk-Sensitive Generative Adversarial Imitation Learning","date":"2018-08-13","arxiv_id":"1808.04468","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensembledagger-a-bayesian-approach-to-safe","title":"EnsembleDAgger: A Bayesian Approach to Safe Imitation Learning","date":"2018-07-22","arxiv_id":"1807.08364","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduction-for-reinforcement-learning","title":"Variance Reduction for Reinforcement Learning in Input-Driven Environments","date":"2018-07-06","arxiv_id":"1807.02264","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-self-imitating-diverse-policies","title":"Learning Self-Imitating Diverse Policies","date":"2018-05-25","arxiv_id":"1805.10309","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-analysis-of-proximal-policy","title":"An Empirical Analysis of Proximal Policy Optimization with Kronecker-factored Natural Gradients","date":"2018-01-17","arxiv_id":"1801.05566","repositories_listed":0,"syntology":null},{"url":null,"slug":"combination-of-supervised-and-reinforcement","title":"Combination of Supervised and Reinforcement Learning For Vision-Based Autonomous Control","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-model-based-and-model-free-rl-via","title":"Combining Model-based and Model-free RL via Multi-step Control Variates","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-by-genetic-distillation","title":"Policy Optimization by Genetic Distillation","date":"2017-11-03","arxiv_id":"1711.01012","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-variance-reduction-for-policy","title":"Stochastic Variance Reduction for Policy Gradient Estimation","date":"2017-10-17","arxiv_id":"1710.06034","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-dexterous","title":"Deep Reinforcement Learning for Dexterous Manipulation with Concept Networks","date":"2017-09-20","arxiv_id":"1709.06977","repositories_listed":0,"syntology":null},{"url":null,"slug":"dropoutdagger-a-bayesian-approach-to-safe","title":"DropoutDAgger: A Bayesian Approach to Safe Imitation Learning","date":"2017-09-18","arxiv_id":"1709.06166","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-intentional-unintentional-agent-learning","title":"The Intentional Unintentional Agent: Learning to Solve Many Continuous Control Tasks Simultaneously","date":"2017-07-11","arxiv_id":"1707.03300","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-imitation-of-diverse-behaviors","title":"Robust Imitation of Diverse Behaviors","date":"2017-07-10","arxiv_id":"1707.02747","repositories_listed":0,"syntology":null},{"url":null,"slug":"expected-policy-gradients","title":"Expected Policy Gradients","date":"2017-06-15","arxiv_id":"1706.05374","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-repeat-fine-grained-action","title":"Learning to Repeat: Fine Grained Action Repetition for Deep Reinforcement Learning","date":"2017-02-20","arxiv_id":"1702.06054","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-k-fold-method-for-baseline-estimation-in","title":"A K-fold Method for Baseline Estimation in Policy Gradient Algorithms","date":"2017-01-03","arxiv_id":"1701.00867","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-adversarial-imitation-learning","title":"Model-based Adversarial Imitation Learning","date":"2016-12-07","arxiv_id":"1612.02179","repositories_listed":0,"syntology":null}],"record_sha256":"3f689092c5437a538c485a687e7ac5df46bea9db98d79d2c07cb4848c9a80c23","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}