{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/continuous-control/papers/7","list_of":"/task/continuous-control","task":"Continuous Control","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":7,"pages_in_order":12,"rows_per_page":100,"rows":[601,700],"of":1161,"counts":{"archive_papers_tagged":1161,"with_a_code_link":494,"where_syntology_ran_a_sample":193,"not_listed_spam_title":0,"listed":1161,"listed_where_code_ran":193,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":161,"every_run_a_failure_of_syntologys_instrument":32,"listed_with_a_run_with_no_instrument_failure":161,"listed_every_run_a_failure_of_syntologys_instrument":32,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/continuous-control","prev":"/task/continuous-control/papers/6","next":"/task/continuous-control/papers/8","papers":[{"url":null,"slug":"implicit-safe-set-algorithm-for-provably-safe","title":"Implicit Safe Set Algorithm for Provably Safe Reinforcement Learning","date":"2024-05-04","arxiv_id":"2405.02754","repositories_listed":0,"syntology":null},{"url":null,"slug":"explicit-lipschitz-value-estimation-enhances","title":"Explicit Lipschitz Value Estimation Enhances Policy Robustness Against Perturbation","date":"2024-04-22","arxiv_id":"2404.13879","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-stability-of-lipschitz-continuous","title":"On the stability of Lipschitz continuous control problems and its application to reinforcement learning","date":"2024-04-20","arxiv_id":"2404.13316","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-policy-optimization-with-temporal-logic","title":"LTL-Constrained Policy Optimization with Cycle Experience Replay","date":"2024-04-17","arxiv_id":"2404.11578","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-control-reinforcement-learning","title":"Continuous Control Reinforcement Learning: Distributed Distributional DrQ Algorithms","date":"2024-04-16","arxiv_id":"2404.10645","repositories_listed":0,"syntology":null},{"url":null,"slug":"noisenca-noisy-seed-improves-spatio-temporal","title":"NoiseNCA: Noisy Seed Improves Spatio-Temporal Continuity of Neural Cellular Automata","date":"2024-04-09","arxiv_id":"2404.06279","repositories_listed":0,"syntology":null},{"url":null,"slug":"growing-q-networks-solving-continuous-control","title":"Growing Q-Networks: Solving Continuous Control Tasks with Adaptive Control Resolution","date":"2024-04-05","arxiv_id":"2404.04253","repositories_listed":0,"syntology":null},{"url":null,"slug":"decision-transformer-as-a-foundation-model","title":"Decision Transformer as a Foundation Model for Partially Observable Continuous Control","date":"2024-04-03","arxiv_id":"2404.02407","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-off-policy-with-model-based","title":"Learning Off-policy with Model-based Intrinsic Motivation For Active Online Exploration","date":"2024-03-31","arxiv_id":"2404.00651","repositories_listed":0,"syntology":null},{"url":null,"slug":"demystifying-deep-reinforcement-learning","title":"Demystifying the Physics of Deep Reinforcement Learning-Based Autonomous Vehicle Decision-Making","date":"2024-03-18","arxiv_id":"2403.11432","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-policy-learning-from-offline","title":"Online Policy Learning from Offline Preferences","date":"2024-03-15","arxiv_id":"2403.10160","repositories_listed":0,"syntology":null},{"url":null,"slug":"symmetric-q-learning-reducing-skewness-of","title":"Symmetric Q-learning: Reducing Skewness of Bellman Error in Online Reinforcement Learning","date":"2024-03-12","arxiv_id":"2403.07704","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-optimal-zero-violation-safety-for","title":"Sample-Optimal Zero-Violation Safety For Continuous Control","date":"2024-03-09","arxiv_id":"2403.06045","repositories_listed":0,"syntology":null},{"url":null,"slug":"noisy-spiking-actor-network-for-exploration","title":"Noisy Spiking Actor Network for Exploration","date":"2024-03-07","arxiv_id":"2403.04162","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterated-q-network-beyond-the-one-step","title":"Iterated $Q$-Network: Beyond One-Step Bellman Updates in Deep Reinforcement Learning","date":"2024-03-04","arxiv_id":"2403.02107","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamite-rl-a-dynamic-model-for-improved","title":"DynaMITE-RL: A Dynamic Model for Improved Temporal Meta-Reinforcement Learning","date":"2024-02-25","arxiv_id":"2402.15957","repositories_listed":0,"syntology":null},{"url":null,"slug":"ace-off-policy-actor-critic-with-causality","title":"ACE : Off-Policy Actor-Critic with Causality-Aware Entropy Regularization","date":"2024-02-22","arxiv_id":"2402.14528","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-estimation-bias-in-deep-double-q","title":"Exploiting Estimation Bias in Clipped Double Q-Learning for Continous Control Reinforcement Learning Tasks","date":"2024-02-14","arxiv_id":"2402.09078","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentially-private-model-based-offline","title":"Differentially Private Deep Model-Based Reinforcement Learning","date":"2024-02-08","arxiv_id":"2402.05525","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-actor-critic-reinforcement-learning","title":"Offline Actor-Critic Reinforcement Learning Scales to Large Models","date":"2024-02-08","arxiv_id":"2402.05546","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-diverse-policies-with-soft-self","title":"Learning Diverse Policies with Soft Self-Generated Guidance","date":"2024-02-07","arxiv_id":"2402.04539","repositories_listed":0,"syntology":null},{"url":null,"slug":"frugal-actor-critic-sample-efficient-off","title":"Frugal Actor-Critic: Sample Efficient Off-Policy Deep Reinforcement Learning Using Unique Experiences","date":"2024-02-05","arxiv_id":"2402.05963","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-actor-critic-learning-to","title":"Deep Exploration with PAC-Bayes","date":"2024-02-05","arxiv_id":"2402.03055","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-what-affects-generalization-gap","title":"Understanding What Affects the Generalization Gap in Visual Reinforcement Learning: Theory and Empirical Evidence","date":"2024-02-05","arxiv_id":"2402.02701","repositories_listed":0,"syntology":null},{"url":null,"slug":"prepare-non-classical-collective-spin-state","title":"A Strategy for Preparing Quantum Squeezed States Using Reinforcement Learning","date":"2024-01-29","arxiv_id":"2401.16320","repositories_listed":0,"syntology":null},{"url":null,"slug":"pulse-width-modulation-method-applied-to","title":"Pulse Width Modulation Method Applied to Nonlinear Model Predictive Control on an Under-actuated Small Satellite","date":"2024-01-21","arxiv_id":"2401.11533","repositories_listed":0,"syntology":null},{"url":null,"slug":"identifying-policy-gradient-subspaces","title":"Identifying Policy Gradient Subspaces","date":"2024-01-12","arxiv_id":"2401.06604","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-minimaximalist-approach-to-reinforcement","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","date":"2024-01-08","arxiv_id":"2401.04056","repositories_listed":0,"syntology":null},{"url":null,"slug":"trajectory-oriented-policy-optimization-with","title":"Trajectory-Oriented Policy Optimization with Sparse Rewards","date":"2024-01-04","arxiv_id":"2401.02225","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarially-trained-actor-critic-for-1","title":"Adversarially Trained Weighted Actor-Critic for Safe Offline Reinforcement Learning","date":"2024-01-01","arxiv_id":"2401.00629","repositories_listed":0,"syntology":null},{"url":null,"slug":"rebel-a-regularization-based-solution-for","title":"REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback","date":"2023-12-22","arxiv_id":"2312.14436","repositories_listed":0,"syntology":null},{"url":null,"slug":"ovd-explorer-optimism-should-not-be-the-sole","title":"OVD-Explorer: Optimism Should Not Be the Sole Pursuit of Exploration in Noisy Environments","date":"2023-12-19","arxiv_id":"2312.12145","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-q-learning-approach-to-the-continuous","title":"A Q-learning approach to the continuous control problem of robot inverted pendulum balancing","date":"2023-12-05","arxiv_id":"2312.02649","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlif-interactive-imitation-learning-as","title":"RLIF: Interactive Imitation Learning as Reinforcement Learning","date":"2023-11-21","arxiv_id":"2311.12996","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-tracking-brain-computer-interface","title":"Visual tracking brain computer interface","date":"2023-11-21","arxiv_id":"2311.12592","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-advantage-based-policy-transfer-algorithm","title":"An advantage based policy transfer algorithm for reinforcement learning with measures of transferability","date":"2023-11-12","arxiv_id":"2311.06731","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-intelligent-social-learning-based","title":"An Intelligent Social Learning-based Optimization Strategy for Black-box Robotic Control with Reinforcement Learning","date":"2023-11-11","arxiv_id":"2311.06576","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-recurrent-reinforcement-learning","title":"Real-Time Recurrent Reinforcement Learning","date":"2023-11-08","arxiv_id":"2311.04830","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-efficient-reinforcement-learning-with","title":"Time-Efficient Reinforcement Learning with Stochastic Stateful Policies","date":"2023-11-07","arxiv_id":"2311.04082","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-bootstrapped-reinforcement-learning","title":"Imitation Bootstrapped Reinforcement Learning","date":"2023-11-03","arxiv_id":"2311.02198","repositories_listed":0,"syntology":null},{"url":null,"slug":"mix-me-quality-diversity-for-multi-agent","title":"Mix-ME: Quality-Diversity for Multi-Agent Learning","date":"2023-11-03","arxiv_id":"2311.01829","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-discover-skills-through-guidance","title":"Learning to Discover Skills through Guidance","date":"2023-10-31","arxiv_id":"2310.20178","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-primacy-bias-in-model-based-rl","title":"Mind the Model, Not the Agent: The Primacy Bias in Model-based RL","date":"2023-10-23","arxiv_id":"2310.15017","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-potential-flow-networks","title":"Analysis of potential flow networks: Variations in transport time with $discrete$, $continuous$, and $selfish$ operation","date":"2023-10-17","arxiv_id":"2310.10980","repositories_listed":0,"syntology":null},{"url":null,"slug":"butterfly-effects-of-sgd-noise-error","title":"Butterfly Effects of SGD Noise: Error Amplification in Behavior Cloning and Autoregression","date":"2023-10-17","arxiv_id":"2310.11428","repositories_listed":0,"syntology":null},{"url":null,"slug":"keep-various-trajectories-promoting","title":"Keep Various Trajectories: Promoting Exploration of Ensemble Policies in Continuous Control","date":"2023-10-17","arxiv_id":"2310.11138","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-episodic-curriculum-for-transformer","title":"Cross-Episodic Curriculum for Transformer Agents","date":"2023-10-12","arxiv_id":"2310.08549","repositories_listed":0,"syntology":null},{"url":null,"slug":"coplanner-plan-to-roll-out-conservatively-but","title":"COPlanner: Plan to Roll Out Conservatively but to Explore Optimistically for Model-Based RL","date":"2023-10-11","arxiv_id":"2310.07220","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-to-go-out-of-distribution-in-offline","title":"Planning to Go Out-of-Distribution in Offline-to-Online Reinforcement Learning","date":"2023-10-09","arxiv_id":"2310.05723","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparing-auxiliary-tasks-for-learning","title":"Improving Reinforcement Learning Efficiency with Auxiliary Tasks in Non-Visual Environments: A Comparison","date":"2023-10-06","arxiv_id":"2310.04241","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-learning-from-observation-through","title":"Imitation Learning from Observation through Optimal Transport","date":"2023-10-02","arxiv_id":"2310.01632","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-emotional-expression-and-cohesion","title":"Improving Emotional Expression and Cohesion in Image-Based Playlist Description and Music Topics: A Continuous Parameterization Approach","date":"2023-10-02","arxiv_id":"2310.01248","repositories_listed":0,"syntology":null},{"url":null,"slug":"ode-based-recurrent-model-free-reinforcement","title":"ODE-based Recurrent Model-free Reinforcement Learning for POMDPs","date":"2023-09-25","arxiv_id":"2309.14078","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergent-communication-in-multi-agent","title":"Emergent Communication in Multi-Agent Reinforcement Learning for Future Wireless Networks","date":"2023-09-12","arxiv_id":"2309.06021","repositories_listed":0,"syntology":null},{"url":null,"slug":"bearing-based-formation-with-disturbance","title":"Bearing-based Formation with Disturbance Rejection","date":"2023-08-29","arxiv_id":"2308.15260","repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-decomposed-policy-critic-bridging-the","title":"Soft Decomposed Policy-Critic: Bridging the Gap for Effective Continuous Control with Discrete RL","date":"2023-08-20","arxiv_id":"2308.10203","repositories_listed":0,"syntology":null},{"url":null,"slug":"theoretically-guaranteed-policy-improvement","title":"Theoretically Guaranteed Policy Improvement Distilled from Model-Based Planning","date":"2023-07-24","arxiv_id":"2307.12933","repositories_listed":0,"syntology":null},{"url":null,"slug":"game-theoretic-robust-reinforcement-learning","title":"Game-Theoretic Robust Reinforcement Learning Handles Temporally-Coupled Perturbations","date":"2023-07-22","arxiv_id":"2307.12062","repositories_listed":0,"syntology":null},{"url":null,"slug":"pottsmgnet-a-mathematical-explanation-of","title":"PottsMGNet: A Mathematical Explanation of Encoder-Decoder Based Neural Networks","date":"2023-07-18","arxiv_id":"2307.09039","repositories_listed":0,"syntology":null},{"url":null,"slug":"diagnosis-feedback-adaptation-a-human-in-the","title":"Diagnosis, Feedback, Adaptation: A Human-in-the-Loop Framework for Test-Time Policy Adaptation","date":"2023-07-12","arxiv_id":"2307.06333","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-policies-for-out-of-distribution","title":"Diffusion Policies for Out-of-Distribution Generalization in Offline Reinforcement Learning","date":"2023-07-10","arxiv_id":"2307.04726","repositories_listed":0,"syntology":null},{"url":null,"slug":"sar-generalization-of-physiological-agility","title":"SAR: Generalization of Physiological Agility and Dexterity via Synergistic Action Representation","date":"2023-07-07","arxiv_id":"2307.03716","repositories_listed":0,"syntology":null},{"url":null,"slug":"l-ac-learning-latent-decision-aware-models","title":"$λ$-models: Effective Decision-Aware Reinforcement Learning with Latent Models","date":"2023-06-30","arxiv_id":"2306.17366","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-convergent-policy-optimization-via","title":"Provably Convergent Policy Optimization via Metric-aware Trust Region Methods","date":"2023-06-25","arxiv_id":"2306.14133","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-with-dead-ends","title":"Safe Reinforcement Learning with Dead-Ends Avoidance and Recovery","date":"2023-06-24","arxiv_id":"2306.13944","repositories_listed":0,"syntology":null},{"url":null,"slug":"pacer-a-fully-push-forward-based","title":"PACER: A Fully Push-forward-based Distributional Reinforcement Learning Algorithm","date":"2023-06-11","arxiv_id":"2306.06637","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-function-estimation-using-conditional","title":"Value function estimation using conditional diffusion models for control","date":"2023-06-09","arxiv_id":"2306.07290","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-reinforcement-learning-with-6","title":"Distributional Reinforcement Learning with Dual Expectile-Quantile Regression","date":"2023-05-26","arxiv_id":"2305.16877","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-simple-sequence","title":"Reinforcement Learning with Simple Sequence Priors","date":"2023-05-26","arxiv_id":"2305.17109","repositories_listed":0,"syntology":null},{"url":null,"slug":"shape-based-pose-estimation-for-automatic","title":"Shape-based pose estimation for automatic standard views of the knee","date":"2023-05-26","arxiv_id":"2305.16717","repositories_listed":0,"syntology":null},{"url":null,"slug":"dive-into-the-power-of-neuronal-heterogeneity","title":"Dive into the Power of Neuronal Heterogeneity","date":"2023-05-19","arxiv_id":"2305.11484","repositories_listed":0,"syntology":null},{"url":null,"slug":"sense-imagine-act-multimodal-perception","title":"Sense, Imagine, Act: Multimodal Perception Improves Model-Based Reinforcement Learning for Head-to-Head Autonomous Racing","date":"2023-05-08","arxiv_id":"2305.04750","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-model-predictive-techno-economic","title":"Robust Model Predictive Techno-Economic Control of Active Distribution Networks","date":"2023-05-05","arxiv_id":"2305.03272","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-partial","title":"Reinforcement Learning with Partial Parametric Model Knowledge","date":"2023-04-26","arxiv_id":"2304.13223","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-policy-reciprocity-with","title":"Multi-agent Policy Reciprocity with Theoretical Guarantee","date":"2023-04-12","arxiv_id":"2304.05632","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-model-free-deep-reinforcement","title":"Real-Time Model-Free Deep Reinforcement Learning for Force Control of a Series Elastic Actuator","date":"2023-04-11","arxiv_id":"2304.04911","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-control-design-and-safety","title":"Distributed Safe Control Design and Probabilistic Safety Verification for Multi-Agent Systems","date":"2023-03-22","arxiv_id":"2303.12610","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-policy-learning-for-offline-to","title":"Adaptive Policy Learning for Offline-to-Online Reinforcement Learning","date":"2023-03-14","arxiv_id":"2303.07693","repositories_listed":0,"syntology":null},{"url":null,"slug":"re-move-an-adaptive-policy-design-approach","title":"RE-MOVE: An Adaptive Policy Design for Robotic Navigation Tasks in Dynamic Environments via Language-Based Feedback","date":"2023-03-14","arxiv_id":"2303.07622","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-strategy-oriented-bayesian-soft-actor","title":"A Strategy-Oriented Bayesian Soft Actor-Critic Model","date":"2023-03-07","arxiv_id":"2303.04193","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropy-environment-transformer-and-offline","title":"Environment Transformer and Policy Optimization for Model-Based Offline Reinforcement Learning","date":"2023-03-07","arxiv_id":"2303.03811","repositories_listed":0,"syntology":null},{"url":null,"slug":"maestro-open-ended-environment-design-for","title":"MAESTRO: Open-Ended Environment Design for Multi-Agent Reinforcement Learning","date":"2023-03-06","arxiv_id":"2303.03376","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-imitation-learning-with-suboptimal","title":"Offline Imitation Learning with Suboptimal Demonstrations via Relaxed Distribution Matching","date":"2023-03-05","arxiv_id":"2303.02569","repositories_listed":0,"syntology":null},{"url":null,"slug":"guarded-policy-optimization-with-imperfect","title":"Guarded Policy Optimization with Imperfect Online Demonstrations","date":"2023-03-03","arxiv_id":"2303.01728","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-and-control-of-uncertain-cooperative","title":"Planning and Control of Uncertain Cooperative Mobile Manipulator-Endowed Systems under Temporal-Logic Tasks","date":"2023-03-02","arxiv_id":"2303.01379","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-constrained-station-keeping-for","title":"Resource-Constrained Station-Keeping for Helium Balloons using Reinforcement Learning","date":"2023-03-02","arxiv_id":"2303.01173","repositories_listed":0,"syntology":null},{"url":null,"slug":"auxiliary-task-based-deep-reinforcement-1","title":"Auxiliary Task-based Deep Reinforcement Learning for Quantum Control","date":"2023-02-28","arxiv_id":"2302.14312","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-model-augmented-behavioral-cloning","title":"Diffusion Model-Augmented Behavioral Cloning","date":"2023-02-26","arxiv_id":"2302.13335","repositories_listed":0,"syntology":null},{"url":null,"slug":"to-the-noise-and-back-diffusion-for-shared","title":"To the Noise and Back: Diffusion for Shared Autonomy","date":"2023-02-23","arxiv_id":"2302.12244","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-deep-policy-gradients-with-value","title":"Improving Deep Policy Gradients with Value Function Search","date":"2023-02-20","arxiv_id":"2302.10145","repositories_listed":0,"syntology":null},{"url":null,"slug":"clare-conservative-model-based-reward","title":"CLARE: Conservative Model-Based Reward Learning for Offline Inverse Reinforcement Learning","date":"2023-02-09","arxiv_id":"2302.04782","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-sim2real-adaptation-across","title":"Zero-shot Sim2Real Adaptation Across Environments","date":"2023-02-08","arxiv_id":"2302.04013","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-strong-baseline-for-batch-imitation","title":"A Strong Baseline for Batch Imitation Learning","date":"2023-02-06","arxiv_id":"2302.02788","repositories_listed":0,"syntology":null},{"url":null,"slug":"reload-reinforcement-learning-with-optimistic","title":"ReLOAD: Reinforcement Learning with Optimistic Ascent-Descent for Last-Iterate Convergence in Constrained MDPs","date":"2023-02-02","arxiv_id":"2302.01275","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-estimation-bias-in-policy","title":"Revisiting Estimation Bias in Policy Gradients for Deep Reinforcement Learning","date":"2023-01-20","arxiv_id":"2301.08442","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-fragility-of-learned-reward-functions","title":"On The Fragility of Learned Reward Functions","date":"2023-01-09","arxiv_id":"2301.03652","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-learning-as-state-matching-via","title":"Imitation Learning As State Matching via Differentiable Physics","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"invariance-to-quantile-selection-in","title":"Invariance to Quantile Selection in Distributional Continuous Control","date":"2022-12-29","arxiv_id":"2212.14262","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-policy-optimization-in-rl-with","title":"Offline Policy Optimization in RL with Variance Regularizaton","date":"2022-12-29","arxiv_id":"2212.14405","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporally-layered-architecture-for-adaptive","title":"Temporally Layered Architecture for Adaptive, Distributed and Continuous Control","date":"2022-12-25","arxiv_id":"2301.00723","repositories_listed":0,"syntology":null}],"record_sha256":"b4f74ae563f29e25309f96941fe1a09bf1834bfc001f25fce0ef661736890b8f","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}