{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/mujoco/papers/4","list_of":"/task/mujoco","task":"MuJoCo","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":4,"pages_in_order":7,"rows_per_page":100,"rows":[301,400],"of":677,"counts":{"archive_papers_tagged":677,"with_a_code_link":293,"where_syntology_ran_a_sample":115,"not_listed_spam_title":0,"listed":677,"listed_where_code_ran":115,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":103,"every_run_a_failure_of_syntologys_instrument":12,"listed_with_a_run_with_no_instrument_failure":103,"listed_every_run_a_failure_of_syntologys_instrument":12,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/mujoco","prev":"/task/mujoco/papers/3","next":"/task/mujoco/papers/5","papers":[{"url":"/paper/the-courage-to-stop-overcoming-sunk-cost","slug":"the-courage-to-stop-overcoming-sunk-cost","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","date":"2025-06-16","arxiv_id":"2506.13672","repositories_listed":0,"syntology":{"n":4,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":4,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/the-courage-to-stop-overcoming-sunk-cost#ran","syntology_url":"https://syntology.ai/paper/2506.13672","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2506.13672"}},"official":null}},{"url":null,"slug":"2506-10167","title":"Wasserstein Barycenter Soft Actor-Critic","date":"2025-06-11","arxiv_id":"2506.10167","repositories_listed":0,"syntology":null},{"url":null,"slug":"2506-08630","title":"Modular Recurrence in Contextual MDPs for Universal Morphology Control","date":"2025-06-10","arxiv_id":"2506.08630","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-diffusion-models-in-offline-rl","title":"Accelerating Diffusion Models in Offline RL via Reward-Aware Consistency Trajectory Distillation","date":"2025-06-09","arxiv_id":"2506.07822","repositories_listed":0,"syntology":null},{"url":null,"slug":"adg-ambient-diffusion-guided-dataset-recovery","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","date":"2025-05-29","arxiv_id":"2505.23871","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-dacer-algorithm-with-high-diffusion","title":"Enhanced DACER Algorithm with High Diffusion Efficiency","date":"2025-05-29","arxiv_id":"2505.23426","repositories_listed":0,"syntology":null},{"url":null,"slug":"measure-gradients-not-activations-enhancing","title":"Measure gradients, not activations! Enhancing neuronal activity in deep reinforcement learning","date":"2025-05-29","arxiv_id":"2505.24061","repositories_listed":0,"syntology":null},{"url":null,"slug":"fasttd3-simple-fast-and-capable-reinforcement","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","date":"2025-05-28","arxiv_id":"2505.22642","repositories_listed":0,"syntology":null},{"url":null,"slug":"collision-and-reachability-aware-multi-robot","title":"Collision- and Reachability-Aware Multi-Robot Control with Grounded LLM Planners","date":"2025-05-26","arxiv_id":"2505.20573","repositories_listed":0,"syntology":null},{"url":null,"slug":"surrogate-assisted-evolutionary-reinforcement","title":"Surrogate-Assisted Evolutionary Reinforcement Learning Based on Autoencoder and Hyperbolic Neural Network","date":"2025-05-26","arxiv_id":"2505.19423","repositories_listed":0,"syntology":null},{"url":null,"slug":"llm-explorer-a-plug-in-reinforcement-learning","title":"LLM-Explorer: A Plug-in Reinforcement Learning Policy Exploration Enhancement Driven by Large Language Models","date":"2025-05-21","arxiv_id":"2505.15293","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-driven-world-model-adaptation-for","title":"Policy-Driven World Model Adaptation for Robust Offline Model-based Reinforcement Learning","date":"2025-05-19","arxiv_id":"2505.13709","repositories_listed":0,"syntology":null},{"url":null,"slug":"cache-efficient-posterior-sampling-for","title":"Cache-Efficient Posterior Sampling for Reinforcement Learning with LLM-Derived Priors Across Discrete and Continuous Domains","date":"2025-05-12","arxiv_id":"2505.07274","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-multi-agent-reinforcement-learning-3","title":"Offline Multi-agent Reinforcement Learning via Score Decomposition","date":"2025-05-09","arxiv_id":"2505.05968","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-ood-state-correction-for-offline","title":"Variational OOD State Correction for Offline Reinforcement Learning","date":"2025-05-01","arxiv_id":"2505.00503","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-to-decision-agent-learning-generalist","title":"Text-to-Decision Agent: Learning Generalist Policies from Natural Language Supervision","date":"2025-04-21","arxiv_id":"2504.15046","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-transferable-friction-models-and","title":"Learning Transferable Friction Models and LuGre Identification via Physics Informed Neural Networks","date":"2025-04-16","arxiv_id":"2504.12441","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-world-models-with-latent-state","title":"Adapting World Models with Latent-State Dynamics Residuals","date":"2025-04-03","arxiv_id":"2504.02252","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-non-expert-demonstrations-outcome","title":"Beyond Non-Expert Demonstrations: Outcome-Driven Action Constraint for Offline Reinforcement Learning","date":"2025-04-02","arxiv_id":"2504.01719","repositories_listed":0,"syntology":null},{"url":null,"slug":"adventurer-exploration-with-bigan-for-deep","title":"Adventurer: Exploration with BiGAN for Deep Reinforcement Learning","date":"2025-03-24","arxiv_id":"2503.18612","repositories_listed":0,"syntology":null},{"url":null,"slug":"cae-repurposing-the-critic-as-an-explorer-in","title":"CAE: Repurposing the Critic as an Explorer in Deep Reinforcement Learning","date":"2025-03-23","arxiv_id":"2503.18980","repositories_listed":0,"syntology":null},{"url":null,"slug":"likelihood-reward-redistribution","title":"Likelihood Reward Redistribution","date":"2025-03-20","arxiv_id":"2503.17409","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-policy-gradient-a-reward-view-of-kl","title":"Residual Policy Gradient: A Reward View of KL-regularized Objective","date":"2025-03-14","arxiv_id":"2503.11019","repositories_listed":0,"syntology":null},{"url":null,"slug":"2503-01458","title":"SrSv: Integrating Sequential Rollouts with Sequential Value Estimation for Multi-agent Reinforcement Learning","date":"2025-03-03","arxiv_id":"2503.01458","repositories_listed":0,"syntology":null},{"url":null,"slug":"avg-dice-stationary-distribution-correction","title":"AVG-DICE: Stationary Distribution Correction by Regression","date":"2025-03-03","arxiv_id":"2503.02125","repositories_listed":0,"syntology":null},{"url":null,"slug":"il-soar-imitation-learning-with-soft","title":"IL-SOAR : Imitation Learning with Soft Optimistic Actor cRitic","date":"2025-02-27","arxiv_id":"2502.19859","repositories_listed":0,"syntology":null},{"url":null,"slug":"yes-q-learning-helps-offline-in-context-rl","title":"Yes, Q-learning Helps Offline In-Context RL","date":"2025-02-24","arxiv_id":"2502.17666","repositories_listed":0,"syntology":null},{"url":null,"slug":"camel-continuous-action-masking-enabled-by","title":"CAMEL: Continuous Action Masking Enabled by Large Language Models for Reinforcement Learning","date":"2025-02-17","arxiv_id":"2502.11896","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unifying-framework-for-causal-imitation","title":"A Unifying Framework for Causal Imitation Learning with Hidden Confounders","date":"2025-02-11","arxiv_id":"2502.07656","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-rank-agent-specific-adaptation-lorasa-for","title":"Low-Rank Agent-Specific Adaptation (LoRASA) for Multi-Agent Policy Learning","date":"2025-02-08","arxiv_id":"2502.05573","repositories_listed":0,"syntology":null},{"url":null,"slug":"behavioral-entropy-guided-dataset-generation","title":"Behavioral Entropy-Guided Dataset Generation for Offline Reinforcement Learning","date":"2025-02-06","arxiv_id":"2502.04141","repositories_listed":0,"syntology":null},{"url":null,"slug":"iris-an-immersive-robot-interaction-system","title":"IRIS: An Immersive Robot Interaction System","date":"2025-02-05","arxiv_id":"2502.03297","repositories_listed":0,"syntology":null},{"url":null,"slug":"timrl-a-novel-meta-reinforcement-learning","title":"TIMRL: A Novel Meta-Reinforcement Learning Framework for Non-Stationary and Multi-Task Environments","date":"2025-01-13","arxiv_id":"2501.07146","repositories_listed":0,"syntology":null},{"url":null,"slug":"sale-based-offline-reinforcement-learning","title":"SALE-Based Offline Reinforcement Learning with Ensemble Q-Networks","date":"2025-01-07","arxiv_id":"2501.03676","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-subspaces-of-policies-for","title":"Hierarchical Subspaces of Policies for Continual Offline Reinforcement Learning","date":"2024-12-19","arxiv_id":"2412.14865","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-reinforcement-learning-strategies-for","title":"Active Reinforcement Learning Strategies for Offline Policy Improvement","date":"2024-12-17","arxiv_id":"2412.13106","repositories_listed":0,"syntology":null},{"url":null,"slug":"rat-adversarial-attacks-on-deep-reinforcement","title":"RAT: Adversarial Attacks on Deep Reinforcement Agents for Targeted Behaviors","date":"2024-12-14","arxiv_id":"2412.10713","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-delayed-reinforcement-learning","title":"Inverse Delayed Reinforcement Learning","date":"2024-12-04","arxiv_id":"2412.02931","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-prompt-decision-transformer","title":"Hierarchical Prompt Decision Transformer: Improving Few-Shot Policy Generalization with Global and Adaptive Guidance","date":"2024-12-01","arxiv_id":"2412.00979","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-convergence-of-softmax-policy-mirror","title":"Fast Convergence of Softmax Policy Mirror Ascent","date":"2024-11-18","arxiv_id":"2411.12042","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-from-diverse-behaviors-wasserstein","title":"Imitation from Diverse Behaviors: Wasserstein Quality Diversity Imitation Learning with Single-Step Archive Exploration","date":"2024-11-11","arxiv_id":"2411.06965","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-algorithms-for-learning-open","title":"Multi-Objective Algorithms for Learning Open-Ended Robotic Problems","date":"2024-11-11","arxiv_id":"2411.08070","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-loss-landscapes-in-preference","title":"Learning Loss Landscapes in Preference Optimization","date":"2024-11-10","arxiv_id":"2411.06568","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-minimum-cost-reach-avoid-using","title":"Solving Minimum-Cost Reach Avoid using Reinforcement Learning","date":"2024-10-29","arxiv_id":"2410.22600","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-diversity-based-experience-replay","title":"Efficient Diversity-based Experience Replay for Deep Reinforcement Learning","date":"2024-10-27","arxiv_id":"2410.20487","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuroplastic-expansion-in-deep-reinforcement","title":"Neuroplastic Expansion in Deep Reinforcement Learning","date":"2024-10-10","arxiv_id":"2410.07994","repositories_listed":0,"syntology":null},{"url":null,"slug":"quality-diversity-imitation-learning","title":"Quality Diversity Imitation Learning","date":"2024-10-08","arxiv_id":"2410.06151","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-model-based-reinforcement-learning-2","title":"Efficient Model-Based Reinforcement Learning Through Optimistic Thompson Sampling","date":"2024-10-07","arxiv_id":"2410.04988","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reward-shaping-for-adversarial","title":"Model-Based Reward Shaping for Adversarial Inverse Reinforcement Learning in Stochastic Environments","date":"2024-10-04","arxiv_id":"2410.03847","repositories_listed":0,"syntology":null},{"url":null,"slug":"comadice-offline-cooperative-multi-agent","title":"ComaDICE: Offline Cooperative Multi-Agent Reinforcement Learning with Stationary Distribution Shift Regularization","date":"2024-10-02","arxiv_id":"2410.01954","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-enhance-multi-legged-robot-on","title":"Learning to enhance multi-legged robot on rugged landscapes","date":"2024-09-14","arxiv_id":"2409.09473","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-space-energy-based-neural-odes","title":"Latent Space Energy-based Neural ODEs","date":"2024-09-05","arxiv_id":"2409.03845","repositories_listed":0,"syntology":null},{"url":null,"slug":"simultaneous-training-of-first-and-second","title":"Simultaneous Training of First- and Second-Order Optimizers in Population-Based Reinforcement Learning","date":"2024-08-27","arxiv_id":"2408.15421","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-exploration-exploitation-dilemma","title":"The Exploration-Exploitation Dilemma Revisited: An Entropy Perspective","date":"2024-08-19","arxiv_id":"2408.09974","repositories_listed":0,"syntology":null},{"url":null,"slug":"markov-balance-satisfaction-improves","title":"Markov Balance Satisfaction Improves Performance in Strictly Batch Offline Imitation Learning","date":"2024-08-17","arxiv_id":"2408.09125","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-deep-reinforcement-4","title":"Cooperative Multi-Agent Deep Reinforcement Learning in Content Ranking Optimization","date":"2024-08-08","arxiv_id":"2408.04251","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02165","title":"SelfBC: Self Behavior Cloning for Offline Reinforcement Learning","date":"2024-08-04","arxiv_id":"2408.02165","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-entropy-on-policy-actor-critic-via","title":"Maximum Entropy On-Policy Actor-Critic via Entropy Advantage Estimation","date":"2024-07-25","arxiv_id":"2407.18143","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-general-continuous-constraint-from","title":"Learning Constraint Network from Demonstrations via Positive-Unlabeled Learning with Memory Replay","date":"2024-07-23","arxiv_id":"2407.16485","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-abstraction-in-reinforcement-1","title":"Temporal Abstraction in Reinforcement Learning with Offline Data","date":"2024-07-21","arxiv_id":"2407.15241","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-nine-physics-engines-for","title":"A Review of Nine Physics Engines for Reinforcement Learning Research","date":"2024-07-11","arxiv_id":"2407.08590","repositories_listed":0,"syntology":null},{"url":null,"slug":"memory-sequence-length-of-data-sampling","title":"Memory Sequence Length of Data Sampling Impacts the Adaptation of Meta-Reinforcement Learning Agents","date":"2024-06-18","arxiv_id":"2406.12359","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-demonstration-and-preference-learning","title":"Learning Reward and Policy Jointly from Demonstration and Preference Improves Alignment","date":"2024-06-11","arxiv_id":"2406.06874","repositories_listed":0,"syntology":null},{"url":null,"slug":"deer-a-delay-resilient-framework-for","title":"DEER: A Delay-Resilient Framework for Reinforcement Learning with Variable Delays","date":"2024-06-05","arxiv_id":"2406.03102","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-improved-actor-critic-algorithms","title":"Value Improved Actor Critic Algorithms","date":"2024-06-03","arxiv_id":"2406.01423","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-pontryagin-perspective-on-reinforcement","title":"A Pontryagin Perspective on Reinforcement Learning","date":"2024-05-28","arxiv_id":"2405.18100","repositories_listed":0,"syntology":null},{"url":"/paper/adaptive-q-network-on-the-fly-target","slug":"adaptive-q-network-on-the-fly-target","title":"Adaptive $Q$-Network: On-the-fly Target Selection for Deep Reinforcement Learning","date":"2024-05-25","arxiv_id":"2405.16195","repositories_listed":0,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/adaptive-q-network-on-the-fly-target#ran","syntology_url":"https://syntology.ai/paper/2405.16195","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2405.16195"}},"official":null}},{"url":null,"slug":"learning-rigid-body-simulators-over-implicit","title":"Learning rigid-body simulators over implicit shapes for large-scale scenes and vision","date":"2024-05-22","arxiv_id":"2405.14045","repositories_listed":0,"syntology":null},{"url":null,"slug":"pure-planning-to-pure-policies-and-in-between","title":"Pure Planning to Pure Policies and In Between with a Recursive Tree Planner","date":"2024-05-21","arxiv_id":"2405.13130","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-oab-off-policy-policy-gradient-method","title":"Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline","date":"2024-05-04","arxiv_id":"2405.02572","repositories_listed":0,"syntology":null},{"url":null,"slug":"markov-flow-policy-deep-mc","title":"Markov flow policy -- deep MC","date":"2024-05-01","arxiv_id":"2405.00877","repositories_listed":0,"syntology":null},{"url":null,"slug":"mesa-cooperative-meta-exploration-in-multi","title":"MESA: Cooperative Meta-Exploration in Multi-Agent Learning through Exploiting State-Action Space Structure","date":"2024-05-01","arxiv_id":"2405.00902","repositories_listed":0,"syntology":null},{"url":null,"slug":"closed-loop-interactive-embodied-reasoning","title":"Closed Loop Interactive Embodied Reasoning for Robot Manipulation","date":"2024-04-23","arxiv_id":"2404.15194","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-federated-reinforcement-learning","title":"Asynchronous Federated Reinforcement Learning with Policy Gradient Updates: Algorithm Design and Convergence Analysis","date":"2024-04-09","arxiv_id":"2404.08003","repositories_listed":0,"syntology":null},{"url":null,"slug":"dida-denoised-imitation-learning-based-on","title":"DIDA: Denoised Imitation Learning based on Domain Adaptation","date":"2024-04-04","arxiv_id":"2404.03382","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-learning-of-dynamics-using-prior","title":"Active Learning of Dynamics Using Prior Domain Knowledge in the Sampling Process","date":"2024-03-25","arxiv_id":"2403.17233","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-model-based-reinforcement-learning","title":"Robust Model Based Reinforcement Learning Using $\\mathcal{L}_1$ Adaptive Control","date":"2024-03-21","arxiv_id":"2403.14860","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-mixture-policy-parameterization-for","title":"A Simple Mixture Policy Parameterization for Improving Sample Efficiency of CVaR Optimization","date":"2024-03-17","arxiv_id":"2403.11062","repositories_listed":0,"syntology":null},{"url":null,"slug":"phasic-diversity-optimization-for-population","title":"Phasic Diversity Optimization for Population-Based Reinforcement Learning","date":"2024-03-17","arxiv_id":"2403.11114","repositories_listed":0,"syntology":null},{"url":null,"slug":"symmetric-q-learning-reducing-skewness-of","title":"Symmetric Q-learning: Reducing Skewness of Bellman Error in Online Reinforcement Learning","date":"2024-03-12","arxiv_id":"2403.07704","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepsafempc-deep-learning-based-model","title":"DeepSafeMPC: Deep Learning-Based Model Predictive Control for Safe Multi-Agent Reinforcement Learning","date":"2024-03-11","arxiv_id":"2403.06397","repositories_listed":0,"syntology":null},{"url":null,"slug":"conservative-ddpg-pessimistic-rl-without","title":"Conservative DDPG -- Pessimistic RL without Ensemble","date":"2024-03-08","arxiv_id":"2403.05732","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterated-q-network-beyond-the-one-step","title":"Iterated $Q$-Network: Beyond One-Step Bellman Updates in Deep Reinforcement Learning","date":"2024-03-04","arxiv_id":"2403.02107","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-mean-zero-disagreement-regularized","title":"Continuous Mean-Zero Disagreement-Regularized Imitation Learning (CMZ-DRIL)","date":"2024-03-02","arxiv_id":"2403.01059","repositories_listed":0,"syntology":null},{"url":null,"slug":"c-gail-stabilizing-generative-adversarial","title":"C-GAIL: Stabilizing Generative Adversarial Imitation Learning with Control Theory","date":"2024-02-26","arxiv_id":"2402.16349","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-to-teach-improve-sample-efficiency-in","title":"Learn to Teach: Sample-Efficient Privileged Learning for Humanoid Locomotion over Diverse Terrains","date":"2024-02-09","arxiv_id":"2402.06783","repositories_listed":0,"syntology":null},{"url":null,"slug":"aloha-2-an-enhanced-low-cost-hardware-for","title":"ALOHA 2: An Enhanced Low-Cost Hardware for Bimanual Teleoperation","date":"2024-02-07","arxiv_id":"2405.02292","repositories_listed":0,"syntology":null},{"url":null,"slug":"compressing-deep-reinforcement-learning","title":"Compressing Deep Reinforcement Learning Networks with a Dynamic Structured Pruning Method for Autonomous Driving","date":"2024-02-07","arxiv_id":"2402.05146","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-inverse-reinforcement-learning","title":"Accelerating Inverse Reinforcement Learning with Expert Bootstrapping","date":"2024-02-04","arxiv_id":"2402.02608","repositories_listed":0,"syntology":null},{"url":null,"slug":"textit-minmaxmin-q-learning","title":"MinMaxMin $Q$-learning","date":"2024-02-03","arxiv_id":"2402.05951","repositories_listed":0,"syntology":null},{"url":null,"slug":"textit-sqt-textit-std-q-target","title":"SQT -- std $Q$-target","date":"2024-02-03","arxiv_id":"2402.05950","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-based-controller-to","title":"A Reinforcement Learning Based Controller to Minimize Forces on the Crutches of a Lower-Limb Exoskeleton","date":"2024-01-31","arxiv_id":"2402.00135","repositories_listed":0,"syntology":null},{"url":null,"slug":"extrinsicaly-rewarded-soft-q-imitation","title":"Extrinsicaly Rewarded Soft Q Imitation Learning with Discriminator","date":"2024-01-30","arxiv_id":"2401.16772","repositories_listed":0,"syntology":null},{"url":null,"slug":"episodic-reinforcement-learning-with-expanded","title":"Episodic Reinforcement Learning with Expanded State-reward Space","date":"2024-01-19","arxiv_id":"2401.10516","repositories_listed":0,"syntology":null},{"url":null,"slug":"agentmixer-multi-agent-correlated-policy","title":"AgentMixer: Multi-Agent Correlated Policy Factorization","date":"2024-01-16","arxiv_id":"2401.08728","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-population-learning-beyond-symmetric","title":"Neural Population Learning beyond Symmetric Zero-sum Games","date":"2024-01-10","arxiv_id":"2401.05133","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-of-natural-policy-gradient","title":"Global Convergence of Natural Policy Gradient with Hessian-aided Momentum Variance Reduction","date":"2024-01-02","arxiv_id":"2401.01084","repositories_listed":0,"syntology":null},{"url":null,"slug":"dexdlo-learning-goal-conditioned-dexterous","title":"DexDLO: Learning Goal-Conditioned Dexterous Policy for Dynamic Manipulation of Deformable Linear Objects","date":"2023-12-23","arxiv_id":"2312.15204","repositories_listed":0,"syntology":null},{"url":null,"slug":"ovd-explorer-optimism-should-not-be-the-sole","title":"OVD-Explorer: Optimism Should Not Be the Sole Pursuit of Exploration in Noisy Environments","date":"2023-12-19","arxiv_id":"2312.12145","repositories_listed":0,"syntology":null},{"url":null,"slug":"small-dataset-big-gains-enhancing","title":"Small Dataset, Big Gains: Enhancing Reinforcement Learning by Offline Pre-Training with Model Based Augmentation","date":"2023-12-15","arxiv_id":"2312.09844","repositories_listed":0,"syntology":null}],"record_sha256":"cbb9128f6e44c5073f2f73730c3a15091fa5d585c033e42725e346f85c3965f5","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}