{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/mujoco/papers/6","list_of":"/task/mujoco","task":"MuJoCo","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":6,"pages_in_order":7,"rows_per_page":100,"rows":[501,600],"of":677,"counts":{"archive_papers_tagged":677,"with_a_code_link":293,"where_syntology_ran_a_sample":115,"not_listed_spam_title":0,"listed":677,"listed_where_code_ran":115,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":103,"every_run_a_failure_of_syntologys_instrument":12,"listed_with_a_run_with_no_instrument_failure":103,"listed_every_run_a_failure_of_syntologys_instrument":12,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/mujoco","prev":"/task/mujoco/papers/5","next":"/task/mujoco/papers/7","papers":[{"url":null,"slug":"continuously-discovering-novel-strategies-via-1","title":"Continuously Discovering Novel Strategies via Reward-Switching Policy Optimization","date":"2022-04-04","arxiv_id":"2204.02246","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-of","title":"Hierarchical Reinforcement Learning of Locomotion Policies in Response to Approaching Objects: A Preliminary Study","date":"2022-03-20","arxiv_id":"2203.10616","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-adaptation-in-multiagent-competition","title":"Safe adaptation in multiagent competition","date":"2022-03-14","arxiv_id":"2203.07562","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-is-everything-implicit-identification","title":"Context is Everything: Implicit Identification for Dynamics Adaptation","date":"2022-03-10","arxiv_id":"2203.05549","repositories_listed":0,"syntology":null},{"url":null,"slug":"autodime-automatic-design-of-interesting","title":"AutoDIME: Automatic Design of Interesting Multi-Agent Environments","date":"2022-03-04","arxiv_id":"2203.02481","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-recurrent-differentiable-engine-for","title":"A Recurrent Differentiable Engine for Modeling Tensegrity Robots Trainable with Low-Frequency Data","date":"2022-02-28","arxiv_id":"2203.00041","repositories_listed":0,"syntology":null},{"url":null,"slug":"user-oriented-robust-reinforcement-learning","title":"User-Oriented Robust Reinforcement Learning","date":"2022-02-15","arxiv_id":"2202.07301","repositories_listed":0,"syntology":null},{"url":null,"slug":"tops-transition-based-volatility-controlled","title":"STOPS: Short-Term-based Volatility-controlled Policy Search and its Global Convergence","date":"2022-01-24","arxiv_id":"2201.09857","repositories_listed":0,"syntology":null},{"url":null,"slug":"recursive-least-squares-advantage-actor","title":"Recursive Least Squares Advantage Actor-Critic Algorithms","date":"2022-01-15","arxiv_id":"2201.05918","repositories_listed":0,"syntology":null},{"url":null,"slug":"2112-13937","title":"Multiagent Model-based Credit Assignment for Continuous Control","date":"2021-12-27","arxiv_id":"2112.13937","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-low-rank-q-matrix","title":"Uncertainty-aware Low-Rank Q-Matrix Estimation for Deep Reinforcement Learning","date":"2021-11-19","arxiv_id":"2111.10103","repositories_listed":0,"syntology":null},{"url":null,"slug":"aggressive-q-learning-with-ensembles-1","title":"Aggressive Q-Learning with Ensembles: Achieving Both High Sample Efficiency and High Asymptotic Performance","date":"2021-11-17","arxiv_id":"2111.09159","repositories_listed":0,"syntology":null},{"url":"/paper/gri-general-reinforced-imitation-and-its","slug":"gri-general-reinforced-imitation-and-its","title":"GRI: General Reinforced Imitation and its Application to Vision-Based Autonomous Driving","date":"2021-11-16","arxiv_id":"2111.08575","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-learning-from-demonstrations-by-1","title":"Improving Learning from Demonstrations by Learning from Experience","date":"2021-11-16","arxiv_id":"2111.08156","repositories_listed":0,"syntology":null},{"url":null,"slug":"v-mao-generative-modeling-for-multi-arm","title":"V-MAO: Generative Modeling for Multi-Arm Manipulation of Articulated Objects","date":"2021-11-07","arxiv_id":"2111.03987","repositories_listed":0,"syntology":null},{"url":null,"slug":"smooth-imitation-learning-via-smooth-costs","title":"Smooth Imitation Learning via Smooth Costs and Smooth Policies","date":"2021-11-03","arxiv_id":"2111.02354","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-search-using-dynamic-mirror-descent","title":"Policy Search using Dynamic Mirror Descent MPC for Model Free Off Policy RL","date":"2021-10-23","arxiv_id":"2110.12239","repositories_listed":0,"syntology":null},{"url":null,"slug":"cim-ppo-proximal-policy-optimization-with-liu","title":"CIM-PPO:Proximal Policy Optimization with Liu-Correntropy Induced Metric","date":"2021-10-20","arxiv_id":"2110.10522","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-policy-model-errors-in-reinforcement-1","title":"On-Policy Model Errors in Reinforcement Learning","date":"2021-10-15","arxiv_id":"2110.07985","repositories_listed":0,"syntology":null},{"url":null,"slug":"wasserstein-unsupervised-reinforcement","title":"Wasserstein Unsupervised Reinforcement Learning","date":"2021-10-15","arxiv_id":"2110.07940","repositories_listed":0,"syntology":null},{"url":null,"slug":"theoretically-principled-deep-rl-acceleration","title":"Theoretically Principled Deep RL Acceleration via Nearest Neighbor Function Approximation","date":"2021-10-09","arxiv_id":"2110.04422","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-encoding-inverse-reinforcement-learning","title":"Auto-Encoding Inverse Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-decision-transformer-for","title":"Distributional Decision Transformer for Hindsight Information Matching","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"diverse-imitation-learning-via-self","title":"Diverse Imitation Learning via Self-OrganizingGenerative Models","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-robustness-of-cooperative-marl","title":"Evaluating Robustness of Cooperative MARL","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fight-fire-with-fire-countering-bad-shortcuts","title":"Fight fire with fire: countering bad shortcuts in imitation learning with good shortcuts","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-maximum-entropy-reinforcement","title":"Generalized Maximum Entropy Reinforcement Learning via Reward Shaping","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hypothesis-driven-coordinate-ascent-for","title":"Hypothesis Driven Coordinate Ascent for Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"maximizing-ensemble-diversity-in-deep","title":"Maximizing Ensemble Diversity in Deep Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ovd-explorer-a-general-information-theoretic","title":"OVD-Explorer: A General Information-theoretic Exploration Approach for Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"spp-rl-state-planning-policy-reinforcement","title":"SPP-RL: State Planning Policy Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"efficiently-training-on-policy-actor-critic","title":"Efficiently Training On-Policy Actor-Critic Networks in Robotic Deep Reinforcement Learning with Demonstration-like Sampled Exploration","date":"2021-09-27","arxiv_id":"2109.13005","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-soft-actor-critic-mixing-prioritized","title":"Improved Soft Actor-Critic: Mixing Prioritized Off-Policy Samples with On-Policy Experience","date":"2021-09-24","arxiv_id":"2109.11767","repositories_listed":0,"syntology":null},{"url":null,"slug":"where-did-you-learn-that-from-surprising","title":"Membership Inference Attacks Against Temporally Correlated Data in Deep Reinforcement Learning","date":"2021-09-08","arxiv_id":"2109.03975","repositories_listed":0,"syntology":null},{"url":null,"slug":"hindsight-reward-tweaking-via-conditional","title":"Hindsight Reward Tweaking via Conditional Deep Reinforcement Learning","date":"2021-09-06","arxiv_id":"2109.02332","repositories_listed":0,"syntology":null},{"url":null,"slug":"prior-is-all-you-need-to-improve-the","title":"Improved Robustness and Safety for Pre-Adaptation of Meta Reinforcement Learning with Prior Regularization","date":"2021-08-19","arxiv_id":"2108.08448","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-generative-adversarial-imitation","title":"On the Benefits of Inducing Local Lipschitzness for Robust Generative Adversarial Imitation Learning","date":"2021-06-30","arxiv_id":"2107.00116","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparsedice-imitation-learning-for-temporally","title":"SparseDice: Imitation Learning for Temporally Sparse Data via Regularization","date":"2021-06-13","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"keyframe-focused-visual-imitation-learning","title":"Keyframe-Focused Visual Imitation Learning","date":"2021-06-11","arxiv_id":"2106.06452","repositories_listed":0,"syntology":null},{"url":null,"slug":"average-reward-reinforcement-learning-with-2","title":"Average-Reward Reinforcement Learning with Trust Region Methods","date":"2021-06-07","arxiv_id":"2106.03442","repositories_listed":0,"syntology":null},{"url":null,"slug":"distop-discovering-a-topological","title":"DisTop: Discovering a Topological representation to learn diverse and rewarding skills","date":"2021-06-06","arxiv_id":"2106.03853","repositories_listed":0,"syntology":null},{"url":null,"slug":"softdice-for-imitation-learning-rethinking","title":"SoftDICE for Imitation Learning: Rethinking Off-policy Distribution Matching","date":"2021-06-06","arxiv_id":"2106.03155","repositories_listed":0,"syntology":null},{"url":null,"slug":"estimating-disentangled-belief-about-hidden","title":"Estimating Disentangled Belief about Hidden State and Hidden Task for Meta-RL","date":"2021-05-14","arxiv_id":"2105.06660","repositories_listed":0,"syntology":null},{"url":null,"slug":"autoregressive-dynamics-models-for-offline-1","title":"Autoregressive Dynamics Models for Offline Policy Evaluation and Optimization","date":"2021-04-28","arxiv_id":"2104.13877","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-using-guided","title":"Reinforcement Learning using Guided Observability","date":"2021-04-22","arxiv_id":"2104.10986","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-function-shape-exploration-in","title":"Reward function shape exploration in adversarial imitation learning: an empirical study","date":"2021-04-14","arxiv_id":"2104.06687","repositories_listed":0,"syntology":null},{"url":null,"slug":"hamiltonian-policy-optimization-in","title":"Hamiltonian Policy Optimization in Reinforcement Learning","date":"2021-03-23","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-actor-critic-reinforcement-learning","title":"Improving Actor-Critic Reinforcement Learning via Hamiltonian Monte Carlo Method","date":"2021-03-22","arxiv_id":"2103.12020","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-distributional-policy-gradients","title":"Bayesian Distributional Policy Gradients","date":"2021-03-20","arxiv_id":"2103.11265","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-context-based-meta-reinforcement","title":"Improving Context-Based Meta-Reinforcement Learning with Self-Supervised Trajectory Contrastive Learning","date":"2021-03-10","arxiv_id":"2103.06386","repositories_listed":0,"syntology":null},{"url":null,"slug":"hamiltonian-policy-optimization","title":"Hamiltonian Policy Optimization","date":"2021-02-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"action-redundancy-in-reinforcement-learning","title":"Action Redundancy in Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.11329","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-proximal-policy-optimization-s-heavy-1","title":"On Proximal Policy Optimization's Heavy-tailed Gradients","date":"2021-02-20","arxiv_id":"2102.10264","repositories_listed":0,"syntology":null},{"url":null,"slug":"cknet-a-convolutional-neural-network-based-on","title":"CKNet: A Convolutional Neural Network Based on Koopman Operator for Modeling Latent Dynamics from Pixels","date":"2021-02-19","arxiv_id":"2102.10205","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-invariant-state-abstractions-for-model","title":"Model-Invariant State Abstractions for Model-Based Reinforcement Learning","date":"2021-02-19","arxiv_id":"2102.09850","repositories_listed":0,"syntology":null},{"url":null,"slug":"gst-group-sparse-training-for-accelerating","title":"GST: Group-Sparse Training for Accelerating Deep Reinforcement Learning","date":"2021-01-24","arxiv_id":"2101.09650","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-n-step-bootstrapping-with-off-policy","title":"Adaptive N-step Bootstrapping with Off-policy Data","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"addressing-distribution-shift-in-online","title":"Addressing Distribution Shift in Online Reinforcement Learning with Offline Datasets","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cat-sac-soft-actor-critic-with-curiosity","title":"CAT-SAC: Soft Actor-Critic with Curiosity-Aware Entropy Temperature","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-offline-reinforcement-learning","title":"Fine-Tuning Offline Reinforcement Learning with Model-Based Policy Optimization","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"formal-language-constrained-markov-decision","title":"Formal Language Constrained Markov Decision Processes","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hellinger-distance-constrained-regression","title":"Hellinger Distance Constrained Regression","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsically-guided-exploration-in-meta","title":"Intrinsically Guided Exploration in Meta Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"invariant-representations-for-reinforcement","title":"Invariant Representations for Reinforcement Learning without Reconstruction","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mqes-max-q-entropy-search-for-efficient","title":"MQES: Max-Q Entropy Search for Efficient Exploration in Continuous Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pgps-coupling-policy-gradient-with-population","title":"PGPS : Coupling Policy Gradient with Population-based Search","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"practical-marginalized-importance-sampling","title":"Practical Marginalized Importance Sampling with the Successor Representation","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-continuous-control-without","title":"Self-Supervised Continuous Control without Policy Gradient","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"opac-opportunistic-actor-critic","title":"OPAC: Opportunistic Actor-Critic","date":"2020-12-11","arxiv_id":"2012.06555","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-imitation-learning-with-a","title":"Offline Imitation Learning with a Misspecified Simulator","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"weighted-entropy-modification-for-soft-actor","title":"Weighted Entropy Modification for Soft Actor-Critic","date":"2020-11-18","arxiv_id":"2011.09083","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-optimization-via-enhanced","title":"Proximal Policy Optimization via Enhanced Exploration Efficiency","date":"2020-11-11","arxiv_id":"2011.05525","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-end-to-end-differentiable-but-explainable","title":"Sim2Sim Evaluation of a Novel Data-Efficient Differentiable Physics Engine for Tensegrity Robots","date":"2020-11-10","arxiv_id":"2011.04929","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-utilize-shaping-rewards-a-new","title":"Learning to Utilize Shaping Rewards: A New Approach of Reward Shaping","date":"2020-11-05","arxiv_id":"2011.02669","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-heterogeneous-deep-reinforcement","title":"Cooperative Heterogeneous Deep Reinforcement Learning","date":"2020-11-02","arxiv_id":"2011.00791","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-reinforcement-learning-for-continuous","title":"Can Reinforcement Learning for Continuous Control Generalize Across Physics Engines?","date":"2020-10-27","arxiv_id":"2010.14444","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-constrained-reinforcement-learning-for-1","title":"Robust Constrained Reinforcement Learning for Continuous Control with Model Misspecification","date":"2020-10-20","arxiv_id":"2010.10644","repositories_listed":0,"syntology":null},{"url":null,"slug":"balancing-constraints-and-rewards-with-meta-1","title":"Balancing Constraints and Rewards with Meta-Gradient D4PG","date":"2020-10-13","arxiv_id":"2010.06324","repositories_listed":0,"syntology":null},{"url":null,"slug":"hindsight-experience-replay-with-kronecker","title":"Hindsight Experience Replay with Kronecker Product Approximate Curvature","date":"2020-10-09","arxiv_id":"2010.06142","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-intrinsic-symbolic-rewards-in-1","title":"Learning Intrinsic Symbolic Rewards in Reinforcement Learning","date":"2020-10-08","arxiv_id":"2010.03694","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-about-taking-policy-as-input-of-value","title":"What About Taking Policy as Input of Value Function: Policy-extended Value Function Approximator","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"population-guided-imitation-learning","title":"Population-Guided Imitation Learning","date":"2020-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-policy-optimization-using-dual-track","title":"Soft policy optimization using dual-track advantage estimator","date":"2020-09-15","arxiv_id":"2009.06858","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-markov-decision-processes-via","title":"Constrained Markov Decision Processes via Backward Value Functions","date":"2020-08-26","arxiv_id":"2008.11811","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-imitation-learning-via-random","title":"Adversarial Imitation Learning via Random Search","date":"2020-08-21","arxiv_id":"2008.09450","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-learning-based-on-entropy","title":"Forward and inverse reinforcement learning sharing network weights and hyperparameters","date":"2020-08-17","arxiv_id":"2008.07284","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-model-bias-for-robust-offline-deep","title":"Overcoming Model Bias for Robust Offline Deep Reinforcement Learning","date":"2020-08-12","arxiv_id":"2008.05533","repositories_listed":0,"syntology":null},{"url":null,"slug":"follow-the-object-curriculum-learning-for","title":"Follow the Object: Curriculum Learning for Manipulation Tasks with Imagined Goals","date":"2020-08-05","arxiv_id":"2008.02066","repositories_listed":0,"syntology":null},{"url":null,"slug":"cones-convex-natural-evolutionary-strategies","title":"CoNES: Convex Natural Evolutionary Strategies","date":"2020-07-16","arxiv_id":"2007.08601","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-from-a","title":"Inverse Reinforcement Learning from a Gradient-based Learner","date":"2020-07-15","arxiv_id":"2007.07812","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularly-updated-deterministic-policy","title":"Regularly Updated Deterministic Policy Gradient Algorithm","date":"2020-07-01","arxiv_id":"2007.00169","repositories_listed":0,"syntology":null},{"url":null,"slug":"ddpg-striving-for-simplicity-in-continuous","title":"DDPG++: Striving for Simplicity in Continuous-control Off-Policy Reinforcement Learning","date":"2020-06-26","arxiv_id":"2006.15199","repositories_listed":0,"syntology":null},{"url":null,"slug":"soac-the-soft-option-actor-critic","title":"SOAC: The Soft Option Actor-Critic Architecture","date":"2020-06-25","arxiv_id":"2006.14363","repositories_listed":0,"syntology":null},{"url":null,"slug":"elsim-end-to-end-learning-of-reusable-skills","title":"ELSIM: End-to-end learning of reusable skills through intrinsic motivation","date":"2020-06-23","arxiv_id":"2006.12903","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-local-policy-optimization-via-diversity","title":"Non-local Policy Optimization via Diversity-regularized Collaborative Exploration","date":"2020-06-14","arxiv_id":"2006.07781","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-control-for-searching-and-planning","title":"Continuous Control for Searching and Planning with a Learned Model","date":"2020-06-12","arxiv_id":"2006.07430","repositories_listed":0,"syntology":null},{"url":null,"slug":"decorrelated-double-q-learning","title":"Decorrelated Double Q-learning","date":"2020-06-12","arxiv_id":"2006.06956","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-proprioception-to-long-horizon-planning","title":"From proprioception to long-horizon planning in novel environments: A hierarchical RL model","date":"2020-06-11","arxiv_id":"2006.06620","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-domain-imitation-learning-with-a-dual","title":"Cross-Domain Imitation Learning with a Dual Structure","date":"2020-06-02","arxiv_id":"2006.01494","repositories_listed":0,"syntology":null},{"url":null,"slug":"gradient-monitored-reinforcement-learning","title":"Gradient Monitored Reinforcement Learning","date":"2020-05-25","arxiv_id":"2005.12108","repositories_listed":0,"syntology":null}],"record_sha256":"b04dbb68bb841e5bcbd8542fe5e384c34962c079d59594f6e72cf559110673d3","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}