{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/continuous-control/papers/8","list_of":"/task/continuous-control","task":"Continuous Control","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":8,"pages_in_order":12,"rows_per_page":100,"rows":[701,800],"of":1161,"counts":{"archive_papers_tagged":1161,"with_a_code_link":494,"where_syntology_ran_a_sample":193,"not_listed_spam_title":0,"listed":1161,"listed_where_code_ran":193,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":161,"every_run_a_failure_of_syntologys_instrument":32,"listed_with_a_run_with_no_instrument_failure":161,"listed_every_run_a_failure_of_syntologys_instrument":32,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/continuous-control","prev":"/task/continuous-control/papers/7","next":"/task/continuous-control/papers/9","papers":[{"url":null,"slug":"variational-quantum-soft-actor-critic-for","title":"Variational Quantum Soft Actor-Critic for Robotic Arm Control","date":"2022-12-20","arxiv_id":"2212.11681","repositories_listed":0,"syntology":null},{"url":null,"slug":"managing-temporal-resolution-in-continuous","title":"Managing Temporal Resolution in Continuous Value Estimation: A Fundamental Trade-off","date":"2022-12-17","arxiv_id":"2212.08949","repositories_listed":0,"syntology":null},{"url":null,"slug":"ppo-ue-proximal-policy-optimization-via","title":"PPO-UE: Proximal Policy Optimization via Uncertainty-Aware Exploration","date":"2022-12-13","arxiv_id":"2212.06343","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-sensitivity-of-reward-inference-to","title":"On the Sensitivity of Reward Inference to Misspecified Human Models","date":"2022-12-09","arxiv_id":"2212.04717","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-self-imitation-learning-from","title":"Accelerating Self-Imitation Learning from Demonstrations via Policy Constraints and Q-Ensemble","date":"2022-12-07","arxiv_id":"2212.03562","repositories_listed":0,"syntology":null},{"url":null,"slug":"first-go-then-post-explore-the-benefits-of","title":"First Go, then Post-Explore: the Benefits of Post-Exploration in Intrinsic Motivation","date":"2022-12-06","arxiv_id":"2212.03251","repositories_listed":0,"syntology":null},{"url":null,"slug":"quadratic-programming-for-continuous-control","title":"Quadratic Programming for Continuous Control of Safety-Critical Multi-Agent Systems Under Uncertainty","date":"2022-11-30","arxiv_id":"2211.16720","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-neural-algorithmic-planners","title":"Continuous Neural Algorithmic Planners","date":"2022-11-29","arxiv_id":"2211.15839","repositories_listed":0,"syntology":null},{"url":null,"slug":"cim-constrained-intrinsic-motivation-for","title":"CIM: Constrained Intrinsic Motivation for Sparse-Reward Continuous Control","date":"2022-11-28","arxiv_id":"2211.15205","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-episodic-control","title":"Continuous Episodic Control","date":"2022-11-28","arxiv_id":"2211.15183","repositories_listed":0,"syntology":null},{"url":null,"slug":"hypernetworks-for-zero-shot-transfer-in","title":"Hypernetworks for Zero-shot Transfer in Reinforcement Learning","date":"2022-11-28","arxiv_id":"2211.15457","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-good-trajectories-in-offline","title":"Learning from Good Trajectories in Offline Multi-Agent Reinforcement Learning","date":"2022-11-28","arxiv_id":"2211.15612","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-using-data-driven","title":"Safe Reinforcement Learning using Data-Driven Predictive Control","date":"2022-11-20","arxiv_id":"2211.11027","repositories_listed":0,"syntology":null},{"url":null,"slug":"cacto-continuous-actor-critic-with-trajectory","title":"CACTO: Continuous Actor-Critic with Trajectory Optimization -- Towards global optimality","date":"2022-11-12","arxiv_id":"2211.06625","repositories_listed":0,"syntology":null},{"url":null,"slug":"c3po-learning-to-achieve-arbitrary-goals-via","title":"On the importance of data collection for training general goal-reaching policies","date":"2022-11-07","arxiv_id":"2211.03521","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-learning-history-based-policies-for","title":"On learning history based policies for controlling Markov decision processes","date":"2022-11-06","arxiv_id":"2211.03011","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-value-learning-implicit-models","title":"Contrastive Value Learning: Implicit Models for Simple Offline RL","date":"2022-11-03","arxiv_id":"2211.02100","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-control-by-iterative-inversion","title":"Learning Control by Iterative Inversion","date":"2022-11-03","arxiv_id":"2211.01724","repositories_listed":0,"syntology":null},{"url":null,"slug":"attitude-control-of-highly-maneuverable","title":"Attitude Control of Highly Maneuverable Aircraft Using an Improved Q-learning","date":"2022-10-22","arxiv_id":"2210.12317","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-robot-learning-with","title":"Sample Efficient Robot Learning with Structured World Models","date":"2022-10-21","arxiv_id":"2210.12278","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-of-direct-policy-search","title":"Global Convergence of Direct Policy Search for State-Feedback $\\mathcal{H}_\\infty$ Robust Control: A Revisit of Nonsmooth Synthesis with Goldstein Subdifferential","date":"2022-10-20","arxiv_id":"2210.11577","repositories_listed":0,"syntology":null},{"url":"/paper/trust-region-policy-optimization-with-optimal","slug":"trust-region-policy-optimization-with-optimal","title":"Trust Region Policy Optimization with Optimal Transport Discrepancies: Duality and Algorithm for Continuous Actions","date":"2022-10-20","arxiv_id":"2210.11137","repositories_listed":0,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"0 ran · 1 unverified","sample_list":"/paper/trust-region-policy-optimization-with-optimal#ran","syntology_url":"https://syntology.ai/paper/2210.11137","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2210.11137"}},"official":null}},{"url":null,"slug":"predicting-dense-and-context-aware-cost-maps","title":"Predicting Dense and Context-aware Cost Maps for Semantic Robot Navigation","date":"2022-10-17","arxiv_id":"2210.08952","repositories_listed":0,"syntology":null},{"url":"/paper/robust-imitation-of-a-few-demonstrations-with","slug":"robust-imitation-of-a-few-demonstrations-with","title":"Robust Imitation of a Few Demonstrations with a Backwards Model","date":"2022-10-17","arxiv_id":"2210.09337","repositories_listed":0,"syntology":{"n":5,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/robust-imitation-of-a-few-demonstrations-with#ran","syntology_url":"https://syntology.ai/paper/2210.09337","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2210.09337"}},"official":null}},{"url":null,"slug":"you-only-live-once-single-life-reinforcement","title":"You Only Live Once: Single-Life Reinforcement Learning","date":"2022-10-17","arxiv_id":"2210.08863","repositories_listed":0,"syntology":null},{"url":null,"slug":"monte-carlo-augmented-actor-critic-for-sparse","title":"Monte Carlo Augmented Actor-Critic for Sparse Reward Deep Reinforcement Learning from Suboptimal Demonstrations","date":"2022-10-14","arxiv_id":"2210.07432","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-n-step-surrogate-stage-reward-to-reduce","title":"Long N-step Surrogate Stage Reward to Reduce Variances of Deep Reinforcement Learning in Complex Problems","date":"2022-10-10","arxiv_id":"2210.04820","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-theoretical-foundation-of-policy","title":"Towards a Theoretical Foundation of Policy Optimization for Learning Control Policies","date":"2022-10-10","arxiv_id":"2210.04810","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-backtracking-teleoperation-a-data","title":"Visual Backtracking Teleoperation: A Data Collection Protocol for Offline Image-Based Reinforcement Learning","date":"2022-10-05","arxiv_id":"2210.02343","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-drift-correction-via-time-varying","title":"Time-Varying Propensity Score to Bridge the Gap between the Past and Present","date":"2022-10-04","arxiv_id":"2210.01422","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-minimally-violating-continuous","title":"Learning Minimally-Violating Continuous Control for Infeasible Linear Temporal Logic Specifications","date":"2022-10-03","arxiv_id":"2210.01162","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-exploration-in-actor-critic","title":"Boosting Exploration in Actor-Critic Algorithms by Incentivizing Plausible Novel States","date":"2022-10-01","arxiv_id":"2210.00211","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-transfer-in-continual","title":"Disentangling Transfer in Continual Reinforcement Learning","date":"2022-09-28","arxiv_id":"2209.13900","repositories_listed":0,"syntology":null},{"url":null,"slug":"guiding-safe-exploration-with-weakest","title":"Guiding Safe Exploration with Weakest Preconditions","date":"2022-09-28","arxiv_id":"2209.14148","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularized-soft-actor-critic-for-behavior","title":"Regularized Soft Actor-Critic for Behavior Transfer Learning","date":"2022-09-27","arxiv_id":"2209.13224","repositories_listed":0,"syntology":null},{"url":null,"slug":"switched-actuator-systems-with-setup-times","title":"Switched-Actuator Systems with Setup Times: Efficient Modeling, MPC, and Application to Hyperthermia Therapy","date":"2022-09-27","arxiv_id":"2209.13631","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-lifelong-adaptive-inverse-reinforcement","title":"Fast Lifelong Adaptive Inverse Reinforcement Learning from Demonstrations","date":"2022-09-24","arxiv_id":"2209.11908","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-theory-of-meta","title":"On the Convergence Theory of Meta Reinforcement Learning with Personalized Policies","date":"2022-09-21","arxiv_id":"2209.10072","repositories_listed":0,"syntology":null},{"url":null,"slug":"locally-constrained-representations-in","title":"Locally Constrained Representations in Reinforcement Learning","date":"2022-09-20","arxiv_id":"2209.09441","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-deep-reinforcement-learning","title":"Evolutionary Deep Reinforcement Learning Using Elite Buffer: A Novel Approach Towards DRL Combined with EA in Continuous Control Tasks","date":"2022-09-18","arxiv_id":"2209.08480","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-policies-for-continuous-control-via","title":"Learning Policies for Continuous Control via Transition Models","date":"2022-09-16","arxiv_id":"2209.08033","repositories_listed":0,"syntology":null},{"url":null,"slug":"mo2-model-based-offline-options","title":"MO2: Model-Based Offline Options","date":"2022-09-05","arxiv_id":"2209.01947","repositories_listed":0,"syntology":null},{"url":null,"slug":"normality-guided-distributional-reinforcement","title":"Normality-Guided Distributional Reinforcement Learning for Continuous Control","date":"2022-08-28","arxiv_id":"2208.13125","repositories_listed":0,"syntology":null},{"url":null,"slug":"improvement-of-sliding-mode-control-strategy","title":"Improvement of Sliding Mode Control Strategy Founded on Cascaded Doubly Fed Induction Generator Powered by a Matrix Converter","date":"2022-08-20","arxiv_id":"2208.11140","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-guidance-of-multiple-missiles-a","title":"Cooperative guidance of multiple missiles: a hybrid co-evolutionary approach","date":"2022-08-15","arxiv_id":"2208.07156","repositories_listed":0,"syntology":null},{"url":null,"slug":"ddx7-differentiable-fm-synthesis-of-musical","title":"DDX7: Differentiable FM Synthesis of Musical Instrument Sounds","date":"2022-08-12","arxiv_id":"2208.06169","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-with-successor","title":"Meta Reinforcement Learning with Successor Feature Based Context","date":"2022-07-29","arxiv_id":"2207.14723","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-actor-critic-ensemble-for","title":"Distributional Actor-Critic Ensemble for Uncertainty-Aware Continuous Control","date":"2022-07-27","arxiv_id":"2207.13730","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-continuously-act-discretely-hybrid","title":"Learn Continuously, Act Discretely: Hybrid Action-Space Reinforcement Learning For Optimal Execution","date":"2022-07-22","arxiv_id":"2207.11152","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimum-description-length-control","title":"Minimum Description Length Control","date":"2022-07-17","arxiv_id":"2207.08258","repositories_listed":0,"syntology":null},{"url":null,"slug":"compactly-restrictable-metric-policy","title":"Compactly Restrictable Metric Policy Optimization Problems","date":"2022-07-12","arxiv_id":"2207.05850","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-temporally-extended-skills-in","title":"Learning Temporally Extended Skills in Continuous Domains as Symbolic Actions for Planning","date":"2022-07-11","arxiv_id":"2207.05018","repositories_listed":0,"syntology":null},{"url":null,"slug":"depth-cuprl-depth-imaged-contrastive","title":"Depth-CUPRL: Depth-Imaged Contrastive Unsupervised Prioritized Representations in Reinforcement Learning for Mapless Navigation of Unmanned Aerial Vehicles","date":"2022-06-30","arxiv_id":"2206.15211","repositories_listed":0,"syntology":null},{"url":null,"slug":"walk-the-random-walk-learning-to-discover-and","title":"Walk the Random Walk: Learning to Discover and Reach Goals Without Supervision","date":"2022-06-23","arxiv_id":"2206.11733","repositories_listed":0,"syntology":null},{"url":null,"slug":"fighting-fire-with-fire-avoiding-dnn","title":"Fighting Fire with Fire: Avoiding DNN Shortcuts through Priming","date":"2022-06-22","arxiv_id":"2206.10816","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalised-policy-improvement-with-geometric","title":"Generalised Policy Improvement with Geometric Policy Composition","date":"2022-06-17","arxiv_id":"2206.08736","repositories_listed":0,"syntology":null},{"url":null,"slug":"mean-semivariance-policy-optimization-via","title":"Mean-Semivariance Policy Optimization via Risk-Averse Reinforcement Learning","date":"2022-06-15","arxiv_id":"2206.07376","repositories_listed":0,"syntology":null},{"url":null,"slug":"relative-policy-transition-optimization-for","title":"Relative Policy-Transition Optimization for Fast Policy Transfer","date":"2022-06-13","arxiv_id":"2206.06009","repositories_listed":0,"syntology":null},{"url":null,"slug":"dealing-with-sparse-rewards-in-continuous","title":"Dealing with Sparse Rewards in Continuous Control Robotics via Heavy-Tailed Policies","date":"2022-06-12","arxiv_id":"2206.05652","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-offline-imitation-learning-with","title":"Model-based Offline Imitation Learning with Non-expert Data","date":"2022-06-11","arxiv_id":"2206.05521","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-the-spectral-bias-of-neural-value-1","title":"Overcoming the Spectral Bias of Neural Value Approximation","date":"2022-06-09","arxiv_id":"2206.04672","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-noise-in-off-policy-deep-reinforcement","title":"Action Noise in Off-Policy Deep Reinforcement Learning: Impact on Exploration and Performance","date":"2022-06-08","arxiv_id":"2206.03787","repositories_listed":0,"syntology":null},{"url":null,"slug":"arc-actor-residual-critic-for-adversarial","title":"ARC -- Actor Residual Critic for Adversarial Imitation Learning","date":"2022-06-05","arxiv_id":"2206.02095","repositories_listed":0,"syntology":null},{"url":null,"slug":"posterior-coreset-construction-with","title":"Posterior Coreset Construction with Kernelized Stein Discrepancy for Model-Based Reinforcement Learning","date":"2022-06-02","arxiv_id":"2206.01162","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-gap-in-deep-reinforcement","title":"Frustratingly Easy Regularization on Representation Can Boost Deep Reinforcement Learning","date":"2022-05-29","arxiv_id":"2205.14557","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-source-transfer-learning-for-deep-model","title":"Multi-Source Transfer Learning for Deep Model-Based Reinforcement Learning","date":"2022-05-28","arxiv_id":"2205.14410","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporl-temporal-priors-for-exploration-in-1","title":"SFP: State-free Priors for Exploration in Off-Policy Reinforcement Learning","date":"2022-05-26","arxiv_id":"2205.13528","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforcement-learning-from","title":"Efficient Reinforcement Learning from Demonstration Using Local Ensemble and Reparameterization with Split and Merge of Expert Policies","date":"2022-05-23","arxiv_id":"2205.11019","repositories_listed":0,"syntology":null},{"url":null,"slug":"il-flow-imitation-learning-from-observation","title":"IL-flOw: Imitation Learning from Observation using Normalizing Flows","date":"2022-05-19","arxiv_id":"2205.09251","repositories_listed":0,"syntology":null},{"url":null,"slug":"reliable-offline-model-based-optimization-for","title":"A cGAN Ensemble-based Uncertainty-aware Surrogate Model for Offline Model-based Optimization in Industrial Control Problems","date":"2022-05-15","arxiv_id":"2205.07250","repositories_listed":0,"syntology":null},{"url":null,"slug":"skill-based-meta-reinforcement-learning-1","title":"Skill-based Meta-Reinforcement Learning","date":"2022-04-25","arxiv_id":"2204.11828","repositories_listed":0,"syntology":null},{"url":null,"slug":"saac-safe-reinforcement-learning-as-an","title":"SAAC: Safe Reinforcement Learning as an Adversarial Game of Actor-Critics","date":"2022-04-20","arxiv_id":"2204.09424","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-evolution-for-generalizable","title":"Evolving Pareto-Optimal Actor-Critic Algorithms for Generalizability and Stability","date":"2022-04-08","arxiv_id":"2204.04292","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuously-discovering-novel-strategies-via-1","title":"Continuously Discovering Novel Strategies via Reward-Switching Policy Optimization","date":"2022-04-04","arxiv_id":"2204.02246","repositories_listed":0,"syntology":null},{"url":null,"slug":"remember-and-forget-experience-replay-for","title":"Remember and Forget Experience Replay for Multi-Agent Reinforcement Learning","date":"2022-03-24","arxiv_id":"2203.13319","repositories_listed":0,"syntology":null},{"url":null,"slug":"lean-evolutionary-reinforcement-learning-by","title":"Multitask Neuroevolution for Reinforcement Learning with Long and Short Episodes","date":"2022-03-21","arxiv_id":"2203.10844","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-abstractions-augmented-temporally-1","title":"Temporal Abstractions-Augmented Temporally Contrastive Learning: An Alternative to the Laplacian in RL","date":"2022-03-21","arxiv_id":"2203.11369","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiscale-sensor-fusion-and-continuous","title":"Multiscale Sensor Fusion and Continuous Control with Neural CDEs","date":"2022-03-16","arxiv_id":"2203.08715","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-convergence-of-primal-dual","title":"Provably Efficient Convergence of Primal-Dual Actor-Critic with Nonlinear Function Approximation","date":"2022-02-28","arxiv_id":"2202.13863","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-learning-and-evaluation-with","title":"Policy Learning and Evaluation with Randomized Quasi-Monte Carlo","date":"2022-02-16","arxiv_id":"2202.07808","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategy-discovery-and-mixture-in-lifelong","title":"Strategy Discovery and Mixture in Lifelong Learning from Heterogeneous Demonstration","date":"2022-02-14","arxiv_id":"2202.07014","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-system-identification-with","title":"Uncertainty Aware System Identification with Universal Policies","date":"2022-02-11","arxiv_id":"2202.05844","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-with-multi-sample-target-values","title":"Exploration with Multi-Sample Target Values for Distributional Reinforcement Learning","date":"2022-02-06","arxiv_id":"2202.02693","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-imitation-learning-from-video","title":"Adversarial Imitation Learning from Video using a State Observer","date":"2022-02-01","arxiv_id":"2202.00243","repositories_listed":0,"syntology":null},{"url":null,"slug":"you-may-not-need-ratio-clipping-in-ppo","title":"You May Not Need Ratio Clipping in PPO","date":"2022-01-31","arxiv_id":"2202.00079","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-imitation-learning-from-corrupted-1","title":"Robust Imitation Learning from Corrupted Demonstrations","date":"2022-01-29","arxiv_id":"2201.12594","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-exploration-deep-reinforcement","title":"Overcoming Exploration: Deep Reinforcement Learning for Continuous Control in Cluttered Environments from Temporal Logic Specifications","date":"2022-01-28","arxiv_id":"2201.12231","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarially-guided-subgoal-generation-for","title":"State-Conditioned Adversarial Subgoal Generation","date":"2022-01-24","arxiv_id":"2201.09635","repositories_listed":0,"syntology":null},{"url":null,"slug":"recursive-least-squares-advantage-actor","title":"Recursive Least Squares Advantage Actor-Critic Algorithms","date":"2022-01-15","arxiv_id":"2201.05918","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-action-selection-for-gradient","title":"Evolutionary Action Selection for Gradient-based Policy Learning","date":"2022-01-12","arxiv_id":"2201.04286","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-surrogate-assisted-controller-for-expensive","title":"A Surrogate-Assisted Controller for Expensive Evolutionary Reinforcement Learning","date":"2022-01-01","arxiv_id":"2201.00129","repositories_listed":0,"syntology":null},{"url":null,"slug":"single-shot-pruning-for-offline-reinforcement","title":"Single-Shot Pruning for Offline Reinforcement Learning","date":"2021-12-31","arxiv_id":"2112.15579","repositories_listed":0,"syntology":null},{"url":null,"slug":"2112-13937","title":"Multiagent Model-based Credit Assignment for Continuous Control","date":"2021-12-27","arxiv_id":"2112.13937","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-safe-reinforcement-learning-with","title":"Model-Based Safe Reinforcement Learning with Time-Varying State and Control Constraints: An Application to Intelligent Vehicles","date":"2021-12-18","arxiv_id":"2112.11217","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-exploitation-gaussian-bare-bones-bat","title":"Dynamic Exploitation Gaussian Bare-Bones Bat Algorithm for Optimal Reactive Power Dispatch to Improve the Safety and Stability of Power System","date":"2021-12-13","arxiv_id":"2112.06382","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-control-for-free-image-synthesis-with","title":"More Control for Free! Image Synthesis with Semantic Diffusion Guidance","date":"2021-12-10","arxiv_id":"2112.05744","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-uncertainty-aware-deployment-of","title":"Zero-Shot Uncertainty-Aware Deployment of Simulation Trained Policies on Real-World Robots","date":"2021-12-10","arxiv_id":"2112.05299","repositories_listed":0,"syntology":null},{"url":null,"slug":"comps-continual-meta-policy-search-1","title":"CoMPS: Continual Meta Policy Search","date":"2021-12-08","arxiv_id":"2112.04467","repositories_listed":0,"syntology":null},{"url":null,"slug":"mesa-offline-meta-rl-for-safe-adaptation-and","title":"MESA: Offline Meta-RL for Safe Adaptation and Fault Tolerance","date":"2021-12-07","arxiv_id":"2112.03575","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-offline-imitating-learning","title":"Curriculum Offline Imitating Learning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"09f8b9a0f3d45f2a2b18c09b34e9f9513b9552b129171e0460786a94b30315d2","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}