{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/mujoco/papers/5","list_of":"/task/mujoco","task":"MuJoCo","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":5,"pages_in_order":7,"rows_per_page":100,"rows":[401,500],"of":677,"counts":{"archive_papers_tagged":677,"with_a_code_link":293,"where_syntology_ran_a_sample":115,"not_listed_spam_title":0,"listed":677,"listed_where_code_ran":115,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":103,"every_run_a_failure_of_syntologys_instrument":12,"listed_with_a_run_with_no_instrument_failure":103,"listed_every_run_a_failure_of_syntologys_instrument":12,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/mujoco","prev":"/task/mujoco/papers/4","next":"/task/mujoco/papers/6","papers":[{"url":null,"slug":"adaptive-proximal-policy-optimization-with","title":"A dynamical clipping approach with task feedback for Proximal Policy Optimization","date":"2023-12-12","arxiv_id":"2312.07624","repositories_listed":0,"syntology":null},{"url":null,"slug":"similarity-based-knowledge-transfer-for-cross","title":"Similarity-based Knowledge Transfer for Cross-Domain Reinforcement Learning","date":"2023-12-05","arxiv_id":"2312.03764","repositories_listed":0,"syntology":null},{"url":null,"slug":"supported-trust-region-optimization-for","title":"Supported Trust Region Optimization for Offline Reinforcement Learning","date":"2023-11-15","arxiv_id":"2311.08935","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-policy-policy-gradient-reinforcement","title":"On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling","date":"2023-11-14","arxiv_id":"2311.08290","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-intelligent-social-learning-based","title":"An Intelligent Social Learning-based Optimization Strategy for Black-box Robotic Control with Reinforcement Learning","date":"2023-11-11","arxiv_id":"2311.06576","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-adversarial-reinforcement-learning-via","title":"Robust Adversarial Reinforcement Learning via Bounded Rationality Curricula","date":"2023-11-03","arxiv_id":"2311.01642","repositories_listed":0,"syntology":null},{"url":null,"slug":"expressive-modeling-is-insufficient-for","title":"A Tractable Inference Perspective of Offline RL","date":"2023-10-31","arxiv_id":"2311.00094","repositories_listed":0,"syntology":null},{"url":null,"slug":"good-better-best-self-motivated-imitation","title":"Good Better Best: Self-Motivated Imitation Learning for noisy Demonstrations","date":"2023-10-24","arxiv_id":"2310.15815","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-with-kernel-quadrature","title":"Policy Gradient with Kernel Quadrature","date":"2023-10-23","arxiv_id":"2310.14768","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-primacy-bias-in-model-based-rl","title":"Mind the Model, Not the Agent: The Primacy Bias in Model-based RL","date":"2023-10-23","arxiv_id":"2310.15017","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-is-more-diverse-perspectives-within-a","title":"One is More: Diverse Perspectives within a Single Network for Efficient DRL","date":"2023-10-21","arxiv_id":"2310.14009","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-the-sim-to-real-gap-in-cloth","title":"Benchmarking the Sim-to-Real Gap in Cloth Manipulation","date":"2023-10-14","arxiv_id":"2310.09543","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-communication-efficiency-in","title":"Improved Communication Efficiency in Federated Natural Policy Gradient via ADMM-based Gradient Updates","date":"2023-10-09","arxiv_id":"2310.19807","repositories_listed":0,"syntology":null},{"url":null,"slug":"fp3o-enabling-proximal-policy-optimization-in","title":"FP3O: Enabling Proximal Policy Optimization in Multi-Agent Cooperation with Parameter-Sharing Versatility","date":"2023-10-08","arxiv_id":"2310.05053","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-representation-complexity-of-model-based","title":"On Representation Complexity of Model-based and Model-free Reinforcement Learning","date":"2023-10-03","arxiv_id":"2310.01706","repositories_listed":0,"syntology":null},{"url":null,"slug":"casil-cognizing-and-imitating-skills-via-a","title":"CasIL: Cognizing and Imitating Skills via a Dual Cognition-Action Architecture","date":"2023-09-28","arxiv_id":"2309.16299","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-double-q-learning-for-continuous","title":"Adapting Double Q-Learning for Continuous Reinforcement Learning","date":"2023-09-25","arxiv_id":"2309.14471","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-reachability-estimation-for-safe","title":"Iterative Reachability Estimation for Safe Reinforcement Learning","date":"2023-09-24","arxiv_id":"2309.13528","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributionally-robust-statistical","title":"Distributionally Robust Statistical Verification with Imprecise Neural Networks","date":"2023-08-28","arxiv_id":"2308.14815","repositories_listed":0,"syntology":null},{"url":null,"slug":"careful-at-estimation-and-bold-at-exploration","title":"Careful at Estimation and Bold at Exploration","date":"2023-08-22","arxiv_id":"2308.11348","repositories_listed":0,"syntology":null},{"url":null,"slug":"dmfc-graspnet-differentiable-multi-fingered","title":"DMFC-GraspNet: Differentiable Multi-Fingered Robotic Grasp Generation in Cluttered Scenes","date":"2023-08-01","arxiv_id":"2308.00456","repositories_listed":0,"syntology":null},{"url":null,"slug":"theoretically-guaranteed-policy-improvement","title":"Theoretically Guaranteed Policy Improvement Distilled from Model-Based Planning","date":"2023-07-24","arxiv_id":"2307.12933","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-multi-agent-skill-discovery-based-on","title":"Scalable Multi-agent Covering Option Discovery based on Kronecker Graphs","date":"2023-07-21","arxiv_id":"2307.11629","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-conservatism-diffusion-policies-in","title":"Beyond Conservatism: Diffusion Policies in Offline Multi-agent Reinforcement Learning","date":"2023-07-04","arxiv_id":"2307.01472","repositories_listed":0,"syntology":null},{"url":null,"slug":"ceil-generalized-contextual-imitation","title":"CEIL: Generalized Contextual Imitation Learning","date":"2023-06-26","arxiv_id":"2306.14534","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-ensemble-q-learning-minimizing-1","title":"Adaptive Ensemble Q-learning: Minimizing Estimation Bias via Error Feedback","date":"2023-06-20","arxiv_id":"2306.11918","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-strategy-guided-reinforcement","title":"Evolutionary Strategy Guided Reinforcement Learning via MultiBuffer Communication","date":"2023-06-20","arxiv_id":"2306.11535","repositories_listed":0,"syntology":null},{"url":null,"slug":"rm-prt-realistic-robotic-manipulation","title":"Surfer: Progressive Reasoning with World Models for Robotic Manipulation","date":"2023-06-20","arxiv_id":"2306.11335","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-to-rewards-for-robotic-skill","title":"Language to Rewards for Robotic Skill Synthesis","date":"2023-06-14","arxiv_id":"2306.08647","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-through","title":"Robust Reinforcement Learning through Efficient Adversarial Herding","date":"2023-06-12","arxiv_id":"2306.07408","repositories_listed":0,"syntology":null},{"url":null,"slug":"metadiffuser-diffusion-model-as-conditional","title":"MetaDiffuser: Diffusion Model as Conditional Planner for Offline Meta-RL","date":"2023-05-31","arxiv_id":"2305.19923","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-model-based-solution-to-the-offline-multi","title":"A Model-Based Solution to the Offline Multi-Agent Reinforcement Learning Coordination Problem","date":"2023-05-26","arxiv_id":"2305.17198","repositories_listed":0,"syntology":null},{"url":null,"slug":"2305-14608","title":"Inverse Reinforcement Learning with the Average Reward Criterion","date":"2023-05-24","arxiv_id":"2305.14608","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-experience-replay-for-continual","title":"OER: Offline Experience Replay for Continual Offline Reinforcement Learning","date":"2023-05-23","arxiv_id":"2305.13804","repositories_listed":0,"syntology":null},{"url":null,"slug":"tom-learning-policy-aware-models-for-model","title":"TOM: Learning Policy-Aware Models for Model-Based Reinforcement Learning via Transition Occupancy Matching","date":"2023-05-22","arxiv_id":"2305.12663","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-discovery-of-continuous-skills","title":"Unsupervised Discovery of Continuous Skills on a Sphere","date":"2023-05-21","arxiv_id":"2305.14377","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-reparameterization-of-reward","title":"Bayesian Reparameterization of Reward-Conditioned Reinforcement Learning with Energy-based Models","date":"2023-05-18","arxiv_id":"2305.11340","repositories_listed":0,"syntology":null},{"url":null,"slug":"coagent-networks-generalized-and-scaled","title":"Coagent Networks: Generalized and Scaled","date":"2023-05-16","arxiv_id":"2305.09838","repositories_listed":0,"syntology":null},{"url":null,"slug":"delay-adapted-policy-optimization-and","title":"Delay-Adapted Policy Optimization and Improved Regret for Adversarial MDP with Delayed Bandit Feedback","date":"2023-05-13","arxiv_id":"2305.07911","repositories_listed":0,"syntology":null},{"url":null,"slug":"defender-dtw-based-episode-filtering-using","title":"DEFENDER: DTW-Based Episode Filtering Using Demonstrations for Enhancing RL Safety","date":"2023-05-08","arxiv_id":"2305.04727","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-based-on-self","title":"Meta-Reinforcement Learning Based on Self-Supervised Task Representation Learning","date":"2023-04-29","arxiv_id":"2305.00286","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-complicated-manipulation-skills-via","title":"Learning Complicated Manipulation Skills via Deterministic Policy with Limited Demonstrations","date":"2023-03-29","arxiv_id":"2303.16469","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-adversarial-imitation-1","title":"Sample-efficient Adversarial Imitation Learning","date":"2023-03-14","arxiv_id":"2303.07846","repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-actor-critic-algorithm-with-truly","title":"Soft Actor-Critic Algorithm with Truly-satisfied Inequality Constraint","date":"2023-03-08","arxiv_id":"2303.04356","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-strategy-oriented-bayesian-soft-actor","title":"A Strategy-Oriented Bayesian Soft Actor-Critic Model","date":"2023-03-07","arxiv_id":"2303.04193","repositories_listed":0,"syntology":null},{"url":null,"slug":"wasserstein-actor-critic-directed-exploration","title":"Wasserstein Actor-Critic: Directed Exploration via Optimism for Continuous-Actions Control","date":"2023-03-04","arxiv_id":"2303.02378","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-ladder-in-chaos-a-simple-and-effective","title":"The Ladder in Chaos: A Simple and Effective Improvement to General DRL Algorithms by Policy Path Trimming and Boosting","date":"2023-03-02","arxiv_id":"2303.01391","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-via-exploratory","title":"Meta-Reinforcement Learning via Exploratory Task Clustering","date":"2023-02-15","arxiv_id":"2302.07958","repositories_listed":0,"syntology":null},{"url":null,"slug":"clare-conservative-model-based-reward","title":"CLARE: Conservative Model-Based Reward Learning for Offline Inverse Reinforcement Learning","date":"2023-02-09","arxiv_id":"2302.04782","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-physics-informed-neural-networks","title":"Bridging Physics-Informed Neural Networks with Reinforcement Learning: Hamilton-Jacobi-Bellman Proximal Policy Optimization (HJBPPO)","date":"2023-02-01","arxiv_id":"2302.00237","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-episodic-control-with-state","title":"Neural Episodic Control with State Abstraction","date":"2023-01-27","arxiv_id":"2301.11490","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-with-robustness","title":"Certifiably Robust Reinforcement Learning through Model-Based Abstract Interpretation","date":"2023-01-26","arxiv_id":"2301.11374","repositories_listed":0,"syntology":null},{"url":null,"slug":"actor-director-critic-a-novel-deep","title":"Actor-Director-Critic: A Novel Deep Reinforcement Learning Framework","date":"2023-01-10","arxiv_id":"2301.03887","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-conservative-q-learning-for","title":"Contextual Conservative Q-Learning for Offline Reinforcement Learning","date":"2023-01-03","arxiv_id":"2301.01298","repositories_listed":0,"syntology":null},{"url":null,"slug":"genetic-imitation-learning-by-reward","title":"Genetic Imitation Learning by Reward Extrapolation","date":"2023-01-03","arxiv_id":"2301.07182","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-geometry-of-reinforcement-learning-in","title":"On the Geometry of Reinforcement Learning in Continuous State and Action Spaces","date":"2022-12-29","arxiv_id":"2301.00009","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-robot-reinforcement-learning-with","title":"Offline Robot Reinforcement Learning with Uncertainty-Guided Human Expert Sampling","date":"2022-12-16","arxiv_id":"2212.08232","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-deep-reinforcement-learning-1","title":"Off-Policy Deep Reinforcement Learning Algorithms for Handling Various Robotic Manipulator Tasks","date":"2022-12-11","arxiv_id":"2212.05572","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-self-imitation-learning-from","title":"Accelerating Self-Imitation Learning from Demonstrations via Policy Constraints and Q-Ensemble","date":"2022-12-07","arxiv_id":"2212.03562","repositories_listed":0,"syntology":null},{"url":null,"slug":"first-go-then-post-explore-the-benefits-of","title":"First Go, then Post-Explore: the Benefits of Post-Exploration in Intrinsic Motivation","date":"2022-12-06","arxiv_id":"2212.03251","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-efficient-reward-learning-via-visually","title":"Time-Efficient Reward Learning via Visually Assisted Cluster Ranking","date":"2022-11-30","arxiv_id":"2212.00169","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-neural-algorithmic-planners","title":"Continuous Neural Algorithmic Planners","date":"2022-11-29","arxiv_id":"2211.15839","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-good-trajectories-in-offline","title":"Learning from Good Trajectories in Offline Multi-Agent Reinforcement Learning","date":"2022-11-28","arxiv_id":"2211.15612","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-transformer-for-offline-meta","title":"Contextual Transformer for Offline Meta Reinforcement Learning","date":"2022-11-15","arxiv_id":"2211.08016","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-transformer-robot-navigation-in","title":"Control Transformer: Robot Navigation in Unknown Environments through PRM-Guided Return-Conditioned Sequence Modeling","date":"2022-11-11","arxiv_id":"2211.06407","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitating-opponent-to-win-adversarial-policy","title":"Imitating Opponent to Win: Adversarial Policy Imitation Learning in Two-player Competitive Games","date":"2022-10-30","arxiv_id":"2210.16915","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-shaping-using-convolutional-neural","title":"Reward Shaping Using Convolutional Neural Network","date":"2022-10-30","arxiv_id":"2210.16956","repositories_listed":0,"syntology":null},{"url":null,"slug":"group-distributionally-robust-reinforcement","title":"Group Distributionally Robust Reinforcement Learning with Hierarchical Latent Variables","date":"2022-10-21","arxiv_id":"2210.12262","repositories_listed":0,"syntology":null},{"url":null,"slug":"simple-emergent-action-representations-from","title":"Simple Emergent Action Representations from Multi-Task Policy Training","date":"2022-10-18","arxiv_id":"2210.09566","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-with-serial-markov-chain","title":"Policy Gradient With Serial Markov Chain Reasoning","date":"2022-10-13","arxiv_id":"2210.06766","repositories_listed":0,"syntology":null},{"url":null,"slug":"mind-s-eye-grounded-language-model-reasoning","title":"Mind's Eye: Grounded Language Model Reasoning through Simulation","date":"2022-10-11","arxiv_id":"2210.05359","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-likelihood-inverse-reinforcement","title":"Maximum-Likelihood Inverse Reinforcement Learning with Finite-Time Guarantees","date":"2022-10-04","arxiv_id":"2210.01808","repositories_listed":0,"syntology":null},{"url":null,"slug":"structural-estimation-of-markov-decision","title":"Structural Estimation of Markov Decision Processes in High-Dimensional State Space with Finite-Time Guarantees","date":"2022-10-04","arxiv_id":"2210.01282","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-exploration-in-actor-critic","title":"Boosting Exploration in Actor-Critic Algorithms by Incentivizing Plausible Novel States","date":"2022-10-01","arxiv_id":"2210.00211","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-theory-of-meta","title":"On the Convergence Theory of Meta Reinforcement Learning with Personalized Policies","date":"2022-09-21","arxiv_id":"2209.10072","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-computational-model-of-learning-flexible","title":"A Computational Model of Learning Flexible Navigation in a Maze by Layout-Conforming Replay of Place Cells","date":"2022-09-18","arxiv_id":"2209.08572","repositories_listed":0,"syntology":null},{"url":null,"slug":"masked-imitation-learning-discovering","title":"Masked Imitation Learning: Discovering Environment-Invariant Modalities in Multimodal Demonstrations","date":"2022-09-16","arxiv_id":"2209.07682","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-summation-a-novel-scoring-function-for","title":"Value Summation: A Novel Scoring Function for MPC-based Model-based Reinforcement Learning","date":"2022-09-16","arxiv_id":"2209.08169","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-centralised-multi-agent-reinforcement","title":"Taming Multi-Agent Reinforcement Learning with Estimator Variance Reduction","date":"2022-09-02","arxiv_id":"2209.01054","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamics-adaptive-continual-reinforcement","title":"Dynamics-Adaptive Continual Reinforcement Learning via Progressive Contextualization","date":"2022-09-01","arxiv_id":"2209.00347","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-sample-efficiency-in-evolutionary","title":"Improving Sample Efficiency in Evolutionary RL Using Off-Policy Ranking","date":"2022-08-22","arxiv_id":"2208.10583","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropy-augmented-reinforcement-learning","title":"Entropy Augmented Reinforcement Learning","date":"2022-08-19","arxiv_id":"2208.09322","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-policy-optimization-for-continuous","title":"Unified Policy Optimization for Continuous-action Reinforcement Learning in Non-stationary Tasks and Games","date":"2022-08-19","arxiv_id":"2208.09452","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-game-theoretic-perspective-of","title":"A Game-Theoretic Perspective of Generalization in Reinforcement Learning","date":"2022-08-07","arxiv_id":"2208.03650","repositories_listed":0,"syntology":null},{"url":null,"slug":"backward-imitation-and-forward-reinforcement","title":"Backward Imitation and Forward Reinforcement Learning via Bi-directional Model Rollouts","date":"2022-08-04","arxiv_id":"2208.02434","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-agent-mirror-learning-a","title":"Heterogeneous-Agent Mirror Learning: A Continuum of Solutions to Cooperative MARL","date":"2022-08-02","arxiv_id":"2208.01682","repositories_listed":0,"syntology":null},{"url":null,"slug":"resolving-copycat-problems-in-visual","title":"Resolving Copycat Problems in Visual Imitation Learning via Residual Action Prediction","date":"2022-07-20","arxiv_id":"2207.09705","repositories_listed":0,"syntology":null},{"url":null,"slug":"feasible-adversarial-robust-reinforcement","title":"Feasible Adversarial Robust Reinforcement Learning for Underspecified Environments","date":"2022-07-19","arxiv_id":"2207.09597","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompting-decision-transformer-for-few-shot","title":"Prompting Decision Transformer for Few-Shot Policy Generalization","date":"2022-06-27","arxiv_id":"2206.13499","repositories_listed":0,"syntology":null},{"url":null,"slug":"fighting-fire-with-fire-avoiding-dnn","title":"Fighting Fire with Fire: Avoiding DNN Shortcuts through Priming","date":"2022-06-22","arxiv_id":"2206.10816","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-rewards-a-hierarchical-perspective-on","title":"Beyond Rewards: a Hierarchical Perspective on Offline Multiagent Behavioral Analysis","date":"2022-06-17","arxiv_id":"2206.09046","repositories_listed":0,"syntology":null},{"url":null,"slug":"mean-semivariance-policy-optimization-via","title":"Mean-Semivariance Policy Optimization via Risk-Averse Reinforcement Learning","date":"2022-06-15","arxiv_id":"2206.07376","repositories_listed":0,"syntology":null},{"url":null,"slug":"relative-policy-transition-optimization-for","title":"Relative Policy-Transition Optimization for Fast Policy Transfer","date":"2022-06-13","arxiv_id":"2206.06009","repositories_listed":0,"syntology":null},{"url":null,"slug":"dealing-with-sparse-rewards-in-continuous","title":"Dealing with Sparse Rewards in Continuous Control Robotics via Heavy-Tailed Policies","date":"2022-06-12","arxiv_id":"2206.05652","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-value-estimation-for-off-policy","title":"Hybrid Value Estimation for Off-policy Evaluation and Offline Reinforcement Learning","date":"2022-06-04","arxiv_id":"2206.02000","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-object-grasping-in-the-plane","title":"Multi-Object Grasping in the Plane","date":"2022-06-01","arxiv_id":"2206.00229","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferable-reward-learning-by-dynamics","title":"Transferable Reward Learning by Dynamics-Agnostic Discriminator Ensemble","date":"2022-06-01","arxiv_id":"2206.00238","repositories_listed":0,"syntology":null},{"url":null,"slug":"seren-knowing-when-to-explore-and-when-to","title":"SEREN: Knowing When to Explore and When to Exploit","date":"2022-05-30","arxiv_id":"2205.15064","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-valuation-for-offline-reinforcement","title":"Data Valuation for Offline Reinforcement Learning","date":"2022-05-19","arxiv_id":"2205.09550","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-computational-theory-of-learning-flexible","title":"A Computational Theory of Learning Flexible Reward-Seeking Behavior with Place Cells","date":"2022-04-22","arxiv_id":"2204.11843","repositories_listed":0,"syntology":null}],"record_sha256":"522108094ea3d70c6d2e8ad0c9d263c776ffe7db6c7b4c43e84f628051bc6f21","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}