{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/continuous-control/papers/6","list_of":"/task/continuous-control","task":"Continuous Control","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":6,"pages_in_order":12,"rows_per_page":100,"rows":[501,600],"of":1161,"counts":{"archive_papers_tagged":1161,"with_a_code_link":494,"where_syntology_ran_a_sample":193,"not_listed_spam_title":0,"listed":1161,"listed_where_code_ran":193,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":161,"every_run_a_failure_of_syntologys_instrument":32,"listed_with_a_run_with_no_instrument_failure":161,"listed_every_run_a_failure_of_syntologys_instrument":32,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/continuous-control","prev":"/task/continuous-control/papers/5","next":"/task/continuous-control/papers/7","papers":[{"url":null,"slug":"beast-efficient-tokenization-of-b-splines","title":"BEAST: Efficient Tokenization of B-Splines Encoded Action Sequences for Imitation Learning","date":"2025-06-06","arxiv_id":"2506.06072","repositories_listed":0,"syntology":null},{"url":null,"slug":"autoqd-automatic-discovery-of-diverse","title":"AutoQD: Automatic Discovery of Diverse Behaviors with Quality-Diversity Optimization","date":"2025-06-05","arxiv_id":"2506.05634","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-planning-and-policy-optimization-via","title":"Safe Planning and Policy Optimization via World Model Learning","date":"2025-06-05","arxiv_id":"2506.04828","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-composing-policies-for-scalable","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","date":"2025-06-04","arxiv_id":"2506.14811","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-meta-testing-with-conditional","title":"Unsupervised Meta-Testing with Conditional Neural Processes for Hybrid Meta-Reinforcement Learning","date":"2025-06-04","arxiv_id":"2506.04399","repositories_listed":0,"syntology":null},{"url":null,"slug":"proxy-target-bridging-the-gap-between","title":"Proxy Target: Bridging the Gap Between Discrete Spiking Neural Networks and Continuous Control","date":"2025-05-30","arxiv_id":"2505.24161","repositories_listed":0,"syntology":null},{"url":null,"slug":"datd3-depthwise-attention-twin-delayed-deep","title":"DATD3: Depthwise Attention Twin Delayed Deep Deterministic Policy Gradient For Model Free Reinforcement Learning Under Output Feedback Control","date":"2025-05-29","arxiv_id":"2505.23857","repositories_listed":0,"syntology":null},{"url":null,"slug":"equivalence-of-stochastic-and-deterministic","title":"Equivalence of stochastic and deterministic policy gradients","date":"2025-05-29","arxiv_id":"2505.23244","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-insulating-vision-language-action","title":"Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better","date":"2025-05-29","arxiv_id":"2505.23705","repositories_listed":0,"syntology":null},{"url":null,"slug":"am-ppo-advantage-alpha-modulation-with","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","date":"2025-05-21","arxiv_id":"2505.15514","repositories_listed":0,"syntology":null},{"url":null,"slug":"world-models-as-reference-trajectories-for","title":"World Models as Reference Trajectories for Rapid Motor Adaptation","date":"2025-05-21","arxiv_id":"2505.15589","repositories_listed":0,"syntology":null},{"url":null,"slug":"kippo-koopman-inspired-proximal-policy","title":"KIPPO: Koopman-Inspired Proximal Policy Optimization","date":"2025-05-20","arxiv_id":"2505.14566","repositories_listed":0,"syntology":null},{"url":null,"slug":"bi-level-policy-optimization-with-nystrom","title":"Bi-Level Policy Optimization with Nyström Hypergradients","date":"2025-05-16","arxiv_id":"2505.11714","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-diffusion-policy-optimization-for","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","date":"2025-05-13","arxiv_id":"2505.08376","repositories_listed":0,"syntology":null},{"url":null,"slug":"monte-carlo-beam-search-for-actor-critic","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","date":"2025-05-13","arxiv_id":"2505.09029","repositories_listed":0,"syntology":null},{"url":null,"slug":"cache-efficient-posterior-sampling-for","title":"Cache-Efficient Posterior Sampling for Reinforcement Learning with LLM-Derived Priors Across Discrete and Continuous Domains","date":"2025-05-12","arxiv_id":"2505.07274","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-multi-agent-reinforcement-learning-3","title":"Offline Multi-agent Reinforcement Learning via Score Decomposition","date":"2025-05-09","arxiv_id":"2505.05968","repositories_listed":0,"syntology":null},{"url":null,"slug":"clam-continuous-latent-action-models-for","title":"CLAM: Continuous Latent Action Models for Robot Learning from Unlabeled Demonstrations","date":"2025-05-08","arxiv_id":"2505.04999","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-labeled-preference-learning-is","title":"Policy-labeled Preference Learning: Is Preference Enough for RLHF?","date":"2025-05-06","arxiv_id":"2505.06273","repositories_listed":0,"syntology":null},{"url":null,"slug":"surrogate-fitness-metrics-for-interpretable","title":"Surrogate Fitness Metrics for Interpretable Reinforcement Learning","date":"2025-04-20","arxiv_id":"2504.14645","repositories_listed":0,"syntology":null},{"url":null,"slug":"traces-trajectory-based-credit-assignment","title":"TraCeS: Trajectory Based Credit Assignment From Sparse Safety Feedback","date":"2025-04-17","arxiv_id":"2504.12557","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-curriculum-learning-for-goal","title":"Probabilistic Curriculum Learning for Goal-Based Reinforcement Learning","date":"2025-04-02","arxiv_id":"2504.01459","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensuring-safe-and-smooth-control-in-safety","title":"Ensuring Safe and Smooth Control in Safety-Critical Systems via Filtered Control Barrier Functions","date":"2025-03-30","arxiv_id":"2503.23267","repositories_listed":0,"syntology":null},{"url":null,"slug":"kea-keeping-exploration-alive-by-proactively","title":"KEA: Keeping Exploration Alive by Proactively Coordinating Exploration Strategies","date":"2025-03-23","arxiv_id":"2503.18234","repositories_listed":0,"syntology":null},{"url":null,"slug":"varp-reinforcement-learning-from-vision","title":"VARP: Reinforcement Learning from Vision-Language Model Feedback with Agent Regularized Preferences","date":"2025-03-18","arxiv_id":"2503.13817","repositories_listed":0,"syntology":null},{"url":null,"slug":"consislora-enhancing-content-and-style","title":"ConsisLoRA: Enhancing Content and Style Consistency for LoRA-based Style Transfer","date":"2025-03-13","arxiv_id":"2503.10614","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-anomaly-recovery-for","title":"Adaptive Anomaly Recovery for Telemanipulation: A Diffusion Model Approach to Vision-Based Tracking","date":"2025-03-11","arxiv_id":"2503.09632","repositories_listed":0,"syntology":null},{"url":null,"slug":"closing-the-intent-to-reality-gap-via","title":"Closing the Intent-to-Behavior Gap via Fulfillment Priority Logic","date":"2025-03-04","arxiv_id":"2503.05818","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-plasticity-in-non-stationary","title":"Improving Plasticity in Non-stationary Reinforcement Learning with Evidential Proximal Policy Optimization","date":"2025-03-03","arxiv_id":"2503.01468","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-wrist-control-on-the-hannes","title":"Continuous Wrist Control on the Hannes Prosthesis: a Vision-based Shared Autonomy Framework","date":"2025-02-24","arxiv_id":"2502.17265","repositories_listed":0,"syntology":null},{"url":null,"slug":"automating-curriculum-learning-for","title":"Automating Curriculum Learning for Reinforcement Learning using a Skill-Based Bayesian Network","date":"2025-02-21","arxiv_id":"2502.15662","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-ppo-with-trajectory-aware-hybrid","title":"Enhancing PPO with Trajectory-Aware Hybrid Policies","date":"2025-02-21","arxiv_id":"2502.15968","repositories_listed":0,"syntology":null},{"url":"/paper/hyperspherical-normalization-for-scalable","slug":"hyperspherical-normalization-for-scalable","title":"Hyperspherical Normalization for Scalable Deep Reinforcement Learning","date":"2025-02-21","arxiv_id":"2502.15280","repositories_listed":0,"syntology":{"n":6,"n_ran":4,"n_constructed":2,"n_ran_checked":3,"n_instrument":1,"n_unverified":2,"n_honours":1,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"4 ran (of which 2 constructed an object rather than computing a result; 3 with no instrument failure: 1 honoured, 0 violated, 2 with no contract checked; 1 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/hyperspherical-normalization-for-scalable#ran","syntology_url":"https://syntology.ai/paper/2502.15280","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2502.15280"}},"official":null}},{"url":null,"slug":"spikerl-a-scalable-and-energy-efficient","title":"SpikeRL: A Scalable and Energy-efficient Framework for Deep Spiking Reinforcement Learning","date":"2025-02-21","arxiv_id":"2502.17496","repositories_listed":0,"syntology":null},{"url":null,"slug":"massively-scaling-explicit-policy-conditioned","title":"Massively Scaling Explicit Policy-conditioned Value Functions","date":"2025-02-17","arxiv_id":"2502.11949","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-information-prioritization-for","title":"Causal Information Prioritization for Efficient Reinforcement Learning","date":"2025-02-14","arxiv_id":"2502.10097","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-off-policy-reinforcement-learning","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","date":"2025-02-11","arxiv_id":"2502.07523","repositories_listed":0,"syntology":null},{"url":null,"slug":"select-before-act-spatially-decoupled-action","title":"Select before Act: Spatially Decoupled Action Repetition for Continuous Control","date":"2025-02-10","arxiv_id":"2502.06919","repositories_listed":0,"syntology":null},{"url":null,"slug":"behavior-regularized-diffusion-policy","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","date":"2025-02-07","arxiv_id":"2502.04778","repositories_listed":0,"syntology":null},{"url":null,"slug":"td-m-pc-2-improving-temporal-difference-mpc","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","date":"2025-02-05","arxiv_id":"2502.03550","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-concept-based-neuron-level","title":"Compositional Concept-Based Neuron-Level Interpretability for Deep Reinforcement Learning","date":"2025-02-02","arxiv_id":"2502.00684","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-suboptimal-data-in-continuous","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","date":"2025-02-01","arxiv_id":"2502.00288","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-prediction-error-prioritisation-in","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","date":"2025-01-30","arxiv_id":"2501.18093","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-mcts-with-free-energy-minimization","title":"Boosting MCTS with Free Energy Minimization","date":"2025-01-22","arxiv_id":"2501.13083","repositories_listed":0,"syntology":null},{"url":null,"slug":"logarithmic-regret-for-nonlinear-control","title":"Logarithmic Regret for Nonlinear Control","date":"2025-01-17","arxiv_id":"2501.10261","repositories_listed":0,"syntology":null},{"url":null,"slug":"speq-stabilization-phases-for-efficient-q","title":"SPEQ: Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","date":"2025-01-15","arxiv_id":"2501.08669","repositories_listed":0,"syntology":null},{"url":null,"slug":"dragin3d-image-editing-by-dragging-in-3d","title":"Dragin3D: Image Editing by Dragging in 3D Space","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"active-reinforcement-learning-strategies-for","title":"Active Reinforcement Learning Strategies for Offline Policy Improvement","date":"2024-12-17","arxiv_id":"2412.13106","repositories_listed":0,"syntology":null},{"url":null,"slug":"equivariant-action-sampling-for-reinforcement","title":"Equivariant Action Sampling for Reinforcement Learning and Planning","date":"2024-12-16","arxiv_id":"2412.12237","repositories_listed":0,"syntology":null},{"url":null,"slug":"edge-delayed-deep-deterministic-policy","title":"Edge Delayed Deep Deterministic Policy Gradient: efficient continuous control for edge scenarios","date":"2024-12-09","arxiv_id":"2412.06390","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-output-tracking-for-an-uncertain-and","title":"Robust Output Tracking for an Uncertain and Nonlinear 3D PDE-ODE System: Preventing Induced Seismicity in Underground Reservoirs","date":"2024-12-09","arxiv_id":"2412.06327","repositories_listed":0,"syntology":null},{"url":null,"slug":"dense-dynamics-aware-reward-synthesis","title":"Dense Dynamics-Aware Reward Synthesis: Integrating Prior Experience with Demonstrations","date":"2024-12-02","arxiv_id":"2412.01114","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-combinatorial-node-selection-and","title":"Joint Combinatorial Node Selection and Resource Allocations in the Lightning Network using Attention-based Reinforcement Learning","date":"2024-11-26","arxiv_id":"2411.17353","repositories_listed":0,"syntology":null},{"url":null,"slug":"broad-critic-deep-actor-reinforcement","title":"Broad Critic Deep Actor Reinforcement Learning for Continuous Control","date":"2024-11-24","arxiv_id":"2411.15806","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-multi-agent-reinforcement","title":"Adversarial Multi-Agent Reinforcement Learning for Proactive False Data Injection Detection","date":"2024-11-19","arxiv_id":"2411.12130","repositories_listed":0,"syntology":null},{"url":null,"slug":"skilltree-explainable-skill-based-deep","title":"SkillTree: Explainable Skill-Based Deep Reinforcement Learning for Long-Horizon Control Tasks","date":"2024-11-19","arxiv_id":"2411.12173","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-from-diverse-behaviors-wasserstein","title":"Imitation from Diverse Behaviors: Wasserstein Quality Diversity Imitation Learning with Single-Step Archive Exploration","date":"2024-11-11","arxiv_id":"2411.06965","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-equivariance-in-reinforcement","title":"Approximate Equivariance in Reinforcement Learning","date":"2024-11-06","arxiv_id":"2411.04225","repositories_listed":0,"syntology":null},{"url":null,"slug":"kernel-based-predictive-control-allocation","title":"KPCA for Thrust Vectoring Systems Exhibiting Singular Points","date":"2024-11-04","arxiv_id":"2411.01944","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-smoothness-and-reducing-high","title":"Benchmarking Smoothness and Reducing High-Frequency Oscillations in Continuous Control Policies","date":"2024-10-22","arxiv_id":"2410.16632","repositories_listed":0,"syntology":null},{"url":null,"slug":"corrected-soft-actor-critic-for-continuous","title":"Corrected Soft Actor Critic for Continuous Control","date":"2024-10-22","arxiv_id":"2410.16739","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-optimal-transport-in-offline","title":"Rethinking Optimal Transport in Offline Reinforcement Learning","date":"2024-10-17","arxiv_id":"2410.14069","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-robustness-in-deep-reinforcement","title":"Enhancing Robustness in Deep Reinforcement Learning: A Lyapunov Exponent Approach","date":"2024-10-14","arxiv_id":"2410.10674","repositories_listed":0,"syntology":null},{"url":null,"slug":"masked-generative-priors-improve-world-models","title":"Masked Generative Priors Improve World Models Sequence Modelling Capabilities","date":"2024-10-10","arxiv_id":"2410.07836","repositories_listed":0,"syntology":null},{"url":null,"slug":"quality-diversity-imitation-learning","title":"Quality Diversity Imitation Learning","date":"2024-10-08","arxiv_id":"2410.06151","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-imitation-from-observation","title":"Diffusion Imitation from Observation","date":"2024-10-07","arxiv_id":"2410.05429","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-model-based-reinforcement-learning-2","title":"Efficient Model-Based Reinforcement Learning Through Optimistic Thompson Sampling","date":"2024-10-07","arxiv_id":"2410.04988","repositories_listed":0,"syntology":null},{"url":null,"slug":"etgl-ddpg-a-deep-deterministic-policy","title":"ETGL-DDPG: A Deep Deterministic Policy Gradient Algorithm for Sparse Reward Continuous Control","date":"2024-10-07","arxiv_id":"2410.05225","repositories_listed":0,"syntology":null},{"url":null,"slug":"absolute-state-wise-constrained-policy","title":"Absolute State-wise Constrained Policy Optimization: High-Probability State-wise Constraints Satisfaction","date":"2024-10-02","arxiv_id":"2410.01212","repositories_listed":0,"syntology":null},{"url":null,"slug":"sampling-from-energy-based-policies-using","title":"Sampling from Energy-based Policies using Diffusion","date":"2024-10-02","arxiv_id":"2410.01312","repositories_listed":0,"syntology":null},{"url":null,"slug":"double-actor-critic-with-td-error-driven","title":"Double Actor-Critic with TD Error-Driven Regularization in Reinforcement Learning","date":"2024-09-28","arxiv_id":"2409.19231","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-the-impact-of-class-transitions-on","title":"Analyzing the Impact of Class Transitions on the Design of Pattern Recognition-based Myoelectric Control Schemes","date":"2024-09-21","arxiv_id":"2409.14172","repositories_listed":0,"syntology":null},{"url":null,"slug":"quasimetric-value-functions-with-dense","title":"Quasimetric Value Functions with Dense Rewards","date":"2024-09-13","arxiv_id":"2409.08724","repositories_listed":0,"syntology":null},{"url":null,"slug":"stacked-universal-successor-feature","title":"Stacked Universal Successor Feature Approximators for Safety in Reinforcement Learning","date":"2024-09-06","arxiv_id":"2409.04641","repositories_listed":0,"syntology":null},{"url":null,"slug":"research-advances-and-new-paradigms-for","title":"Research Advances and New Paradigms for Biology-inspired Spiking Neural Networks","date":"2024-08-26","arxiv_id":"2408.13996","repositories_listed":0,"syntology":null},{"url":null,"slug":"deterministic-policy-gradient-primal-dual","title":"Deterministic Policy Gradient Primal-Dual Methods for Continuous-Space Constrained MDPs","date":"2024-08-19","arxiv_id":"2408.10015","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-efficient-continuous-control-perspective","title":"An Efficient Continuous Control Perspective for Reinforcement-Learning-based Sequential Recommendation","date":"2024-08-15","arxiv_id":"2408.08047","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-03029","title":"Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning","date":"2024-08-06","arxiv_id":"2408.03029","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-based-deep-reinforcement-learning-with","title":"Image-Based Deep Reinforcement Learning with Intrinsically Motivated Stimuli: On the Execution of Complex Robotic Tasks","date":"2024-07-31","arxiv_id":"2407.21338","repositories_listed":0,"syntology":null},{"url":null,"slug":"qt-tdm-planning-with-transformer-dynamics","title":"QT-TDM: Planning With Transformer Dynamics Model and Autoregressive Q-Learning","date":"2024-07-26","arxiv_id":"2407.18841","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-cross-environment-hyperparameter-setting","title":"The Cross-environment Hyperparameter Setting Benchmark for Reinforcement Learning","date":"2024-07-26","arxiv_id":"2407.18840","repositories_listed":0,"syntology":null},{"url":null,"slug":"precisecontrol-enhancing-text-to-image","title":"PreciseControl: Enhancing Text-To-Image Diffusion Models with Fine-Grained Attribute Control","date":"2024-07-24","arxiv_id":"2408.05083","repositories_listed":0,"syntology":null},{"url":"/paper/last-iterate-global-convergence-of-policy","slug":"last-iterate-global-convergence-of-policy","title":"Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement Learning","date":"2024-07-15","arxiv_id":"2407.10775","repositories_listed":0,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/last-iterate-global-convergence-of-policy#ran","syntology_url":"https://syntology.ai/paper/2407.10775","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2407.10775"}},"official":null}},{"url":null,"slug":"continuous-control-with-coarse-to-fine","title":"Continuous Control with Coarse-to-fine Reinforcement Learning","date":"2024-07-10","arxiv_id":"2407.07787","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-bifurcation-method-for-observation","title":"A Novel Bifurcation Method for Observation Perturbation Attacks on Reinforcement Learning Agents: Load Altering Attacks on a Cyber Physical Power System","date":"2024-07-06","arxiv_id":"2407.05182","repositories_listed":0,"syntology":null},{"url":null,"slug":"pwm-policy-learning-with-large-world-models","title":"PWM: Policy Learning with Multi-Task World Models","date":"2024-07-02","arxiv_id":"2407.02466","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-energy-efficient-braking","title":"Optimizing Energy-Efficient Braking Trajectories with Anticipatory Road Data for Automated Vehicles","date":"2024-06-25","arxiv_id":"2406.17604","repositories_listed":0,"syntology":null},{"url":null,"slug":"memory-sequence-length-of-data-sampling","title":"Memory Sequence Length of Data Sampling Impacts the Adaptation of Meta-Reinforcement Learning Agents","date":"2024-06-18","arxiv_id":"2406.12359","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-modeling-and-control-for-an-offshore","title":"Dynamic Modeling and Control for an Offshore Semisubmersible Floating Wind Turbine","date":"2024-06-17","arxiv_id":"2406.11158","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-vision-tasks-with-simple","title":"Solving Vision Tasks with Simple Photoreceptors Instead of Cameras","date":"2024-06-17","arxiv_id":"2406.11769","repositories_listed":0,"syntology":null},{"url":null,"slug":"cuer-corrected-uniform-experience-replay-for","title":"CUER: Corrected Uniform Experience Replay for Off-Policy Continuous Deep Reinforcement Learning Algorithms","date":"2024-06-13","arxiv_id":"2406.09030","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-constrained-robust-mdps","title":"Time-Constrained Robust MDPs","date":"2024-06-12","arxiv_id":"2406.08395","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-pessimism-and-optimism-dynamics-in","title":"Exploring Pessimism and Optimism Dynamics in Deep Reinforcement Learning","date":"2024-06-06","arxiv_id":"2406.03890","repositories_listed":0,"syntology":null},{"url":null,"slug":"iqrl-implicitly-quantized-representations-for","title":"iQRL -- Implicitly Quantized Representations for Sample-efficient Reinforcement Learning","date":"2024-06-04","arxiv_id":"2406.02696","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-s-and-don-ts-learning-desirable-skills","title":"Do's and Don'ts: Learning Desirable Skills with Instruction Videos","date":"2024-06-01","arxiv_id":"2406.00324","repositories_listed":0,"syntology":null},{"url":null,"slug":"spectral-risk-safe-reinforcement-learning","title":"Spectral-Risk Safe Reinforcement Learning with Convergence Guarantees","date":"2024-05-29","arxiv_id":"2405.18698","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-horizon-actor-critic-for-policy","title":"Adaptive Horizon Actor-Critic for Policy Learning in Contact-Rich Differentiable Simulation","date":"2024-05-28","arxiv_id":"2405.17784","repositories_listed":0,"syntology":null},{"url":null,"slug":"mollification-effects-of-policy-gradient","title":"Mollification Effects of Policy Gradient Methods","date":"2024-05-28","arxiv_id":"2405.17832","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-the-impact-of-choice-on-deep","title":"Investigating the Impact of Choice on Deep Reinforcement Learning for Space Controls","date":"2024-05-20","arxiv_id":"2405.12355","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-future-representation-with-synthetic","title":"Learning Future Representation with Synthetic Observations for Sample-efficient Reinforcement Learning","date":"2024-05-20","arxiv_id":"2405.11740","repositories_listed":0,"syntology":null}],"record_sha256":"6d8b1b6733cbfd4e927d1f58fcd65a77c0a390cc18f4c85ace96ca252a07e192","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}