{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/58","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":58,"pages_in_order":152,"rows_per_page":100,"rows":[5701,5800],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/57","next":"/task/reinforcement-learning-1/papers/59","papers":[{"url":null,"slug":"learn-2-rage-experiencing-the-emotional","title":"Learn 2 Rage: Experiencing The Emotional Roller Coaster That Is Reinforcement Learning","date":"2024-10-24","arxiv_id":"2410.18462","repositories_listed":0,"syntology":null},{"url":null,"slug":"pointpatchrl-masked-reconstruction-improves","title":"PointPatchRL -- Masked Reconstruction Improves Reinforcement Learning on Point Clouds","date":"2024-10-24","arxiv_id":"2410.18800","repositories_listed":0,"syntology":null},{"url":null,"slug":"samg-state-action-aware-offline-to-online","title":"SAMG: State-Action-Aware Offline-to-Online Reinforcement Learning with Offline Model Guidance","date":"2024-10-24","arxiv_id":"2410.18626","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-swarm-intelligence-and-reinforcement","title":"The Hive Mind is a Single Reinforcement Learning Agent","date":"2024-10-23","arxiv_id":"2410.17517","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-spectrum-access-for-ambient","title":"Dynamic Spectrum Access for Ambient Backscatter Communication-assisted D2D Systems with Quantum Reinforcement Learning","date":"2024-10-23","arxiv_id":"2410.17971","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-load-scheduling-in-power-grids","title":"Optimizing Load Scheduling in Power Grids Using Reinforcement Learning and Markov Decision Processes","date":"2024-10-23","arxiv_id":"2410.17696","repositories_listed":0,"syntology":null},{"url":null,"slug":"primal-dual-spectral-representation-for-off","title":"Primal-Dual Spectral Representation for Off-policy Evaluation","date":"2024-10-23","arxiv_id":"2410.17538","repositories_listed":0,"syntology":null},{"url":null,"slug":"process-supervision-guided-policy","title":"Process Supervision-Guided Policy Optimization for Code Generation","date":"2024-10-23","arxiv_id":"2410.17621","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-smoothness-and-reducing-high","title":"Benchmarking Smoothness and Reducing High-Frequency Oscillations in Continuous Control Policies","date":"2024-10-22","arxiv_id":"2410.16632","repositories_listed":0,"syntology":null},{"url":null,"slug":"drop-distributional-and-regular-optimism-and","title":"DROP: Distributional and Regular Optimism and Pessimism for Reinforcement Learning","date":"2024-10-22","arxiv_id":"2410.17473","repositories_listed":0,"syntology":null},{"url":null,"slug":"dypnipp-predicting-environment-dynamics-for","title":"DyPNIPP: Predicting Environment Dynamics for RL-based Robust Informative Path Planning","date":"2024-10-22","arxiv_id":"2410.17186","repositories_listed":0,"syntology":null},{"url":null,"slug":"episodic-future-thinking-mechanism-for-multi","title":"Episodic Future Thinking Mechanism for Multi-agent Reinforcement Learning","date":"2024-10-22","arxiv_id":"2410.17373","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-stackelberg-game-robust-federated","title":"Meta Stackelberg Game: Robust Federated Learning against Adaptive and Mixed Poisoning Attacks","date":"2024-10-22","arxiv_id":"2410.17431","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-transformer-and-reinforcement","title":"Multi-Modal Transformer and Reinforcement Learning-based Beam Management","date":"2024-10-22","arxiv_id":"2410.19859","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-curriculum-reinforcement","title":"Curriculum Reinforcement Learning for Complex Reward Functions","date":"2024-10-22","arxiv_id":"2410.16790","repositories_listed":0,"syntology":null},{"url":null,"slug":"survival-of-the-fittest-evolutionary","title":"Survival of the Fittest: Evolutionary Adaptation of Policies for Environmental Shifts","date":"2024-10-22","arxiv_id":"2410.19852","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-for-job-shop","title":"Offline reinforcement learning for job-shop scheduling problems","date":"2024-10-21","arxiv_id":"2410.15714","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-language-models-to-critique-with","title":"Training Language Models to Critique With Multi-agent Feedback","date":"2024-10-20","arxiv_id":"2410.15287","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-reinforcement-learning-model-for-post","title":"A Novel Reinforcement Learning Model for Post-Incident Malware Investigations","date":"2024-10-19","arxiv_id":"2410.15028","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-abstractions-for-amortized-sampling","title":"Action abstractions for amortized sampling","date":"2024-10-19","arxiv_id":"2410.15184","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-lagrangian-based-safe-reinforcement","title":"Augmented Lagrangian-Based Safe Reinforcement Learning Approach for Distribution System Volt/VAR Control","date":"2024-10-19","arxiv_id":"2410.15188","repositories_listed":0,"syntology":null},{"url":null,"slug":"mentor-mixture-of-experts-network-with-task","title":"MENTOR: Mixture-of-Experts Network with Task-Oriented Perturbation for Visual Reinforcement Learning","date":"2024-10-19","arxiv_id":"2410.14972","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-large-language-model-driven-reward-design","title":"A Large Language Model-Driven Reward Design Framework via Dynamic Feedback for Reinforcement Learning","date":"2024-10-18","arxiv_id":"2410.14660","repositories_listed":0,"syntology":null},{"url":null,"slug":"harnessing-causality-in-reinforcement","title":"Harnessing Causality in Reinforcement Learning With Bagged Decision Times","date":"2024-10-18","arxiv_id":"2410.14659","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-end-to-end-neurosymbolic","title":"Interpretable end-to-end Neurosymbolic Reinforcement Learning agents","date":"2024-10-18","arxiv_id":"2410.14371","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-non-markov-market","title":"Reinforcement Learning in Non-Markov Market-Making","date":"2024-10-18","arxiv_id":"2410.14504","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-dispatch-of-energy-storage","title":"Coordinated Dispatch of Energy Storage Systems in the Active Distribution Network: A Complementary Reinforcement Learning and Optimization Approach","date":"2024-10-17","arxiv_id":"2410.13223","repositories_listed":0,"syntology":null},{"url":null,"slug":"guided-reinforcement-learning-for-robust","title":"Guided Reinforcement Learning for Robust Multi-Contact Loco-Manipulation","date":"2024-10-17","arxiv_id":"2410.13817","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-large-language-models-and","title":"Integrating Large Language Models and Reinforcement Learning for Non-Linear Reasoning","date":"2024-10-17","arxiv_id":"2410.13501","repositories_listed":0,"syntology":null},{"url":null,"slug":"marineformer-a-transformer-based-navigation","title":"MarineFormer: A Spatio-Temporal Attention Model for USV Navigation in Dynamic Marine Environments","date":"2024-10-17","arxiv_id":"2410.13973","repositories_listed":0,"syntology":null},{"url":null,"slug":"truncating-trajectories-in-monte-carlo-policy-1","title":"Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach","date":"2024-10-17","arxiv_id":"2410.13463","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-intelligence-in-smart-intersections","title":"Augmented Intelligence in Smart Intersections: Local Digital Twins-Assisted Hybrid Autonomous Driving","date":"2024-10-16","arxiv_id":"2410.12163","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-learning-rate-for-deep-reinforcement","title":"Dynamic Learning Rate for Deep Reinforcement Learning: A Bandit Approach","date":"2024-10-16","arxiv_id":"2410.12598","repositories_listed":0,"syntology":null},{"url":null,"slug":"edgerl-reinforcement-learning-driven-deep","title":"EdgeRL: Reinforcement Learning-driven Deep Learning Model Inference Optimization at Edge","date":"2024-10-16","arxiv_id":"2410.12221","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-based-control-for-cubesat-docking","title":"Neural-based Control for CubeSat Docking Maneuvers","date":"2024-10-16","arxiv_id":"2410.12703","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-dynamics-conditional-diffusion-planners","title":"Off-dynamics Conditional Diffusion Planners","date":"2024-10-16","arxiv_id":"2410.12238","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-ltl-and-o-regular","title":"Reinforcement Learning with LTL and $ω$-Regular Objectives via Optimality-Preserving Translation to Average Rewards","date":"2024-10-16","arxiv_id":"2410.12175","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-rl-with-llm-driven-data-synthesis-and","title":"Robust RL with LLM-Driven Data Synthesis and Policy Adaptation for Autonomous Driving","date":"2024-10-16","arxiv_id":"2410.12568","repositories_listed":0,"syntology":null},{"url":null,"slug":"sac-glam-improving-online-rl-for-llm-agents","title":"SAC-GLAM: Improving Online RL for LLM agents with Soft Actor-Critic and Hindsight Relabeling","date":"2024-10-16","arxiv_id":"2410.12481","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-to-trust-your-data-enhancing-dyna-style","title":"When to Trust Your Data: Enhancing Dyna-Style Model-Based Reinforcement Learning With Data Filter","date":"2024-10-16","arxiv_id":"2410.12160","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-based-offline-rl-for-improved","title":"Diffusion-Based Offline RL for Improved Decision-Making in Augmented ARC Task","date":"2024-10-15","arxiv_id":"2410.11324","repositories_listed":0,"syntology":null},{"url":null,"slug":"ilaeda-an-imitation-learning-based-approach","title":"ILAEDA: An Imitation Learning Based Approach for Automatic Exploratory Data Analysis","date":"2024-10-15","arxiv_id":"2410.11276","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-optimization-multi-auv","title":"Multi-Objective-Optimization Multi-AUV Assisted Data Collection Framework for IoUT Based on Offline Reinforcement Learning","date":"2024-10-15","arxiv_id":"2410.11282","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-reinforcement-learning-a-tool","title":"Multi-objective Reinforcement Learning: A Tool for Pluralistic Alignment","date":"2024-10-15","arxiv_id":"2410.11221","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-bidding","title":"Reinforcement Learning Based Bidding Framework with High-dimensional Bids in Power Markets","date":"2024-10-15","arxiv_id":"2410.11180","repositories_listed":0,"syntology":null},{"url":"/paper/action-gaps-and-advantages-in-continuous-time","slug":"action-gaps-and-advantages-in-continuous-time","title":"Action Gaps and Advantages in Continuous-Time Distributional Reinforcement Learning","date":"2024-10-14","arxiv_id":"2410.11022","repositories_listed":0,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/action-gaps-and-advantages-in-continuous-time#ran","syntology_url":"https://syntology.ai/paper/2410.11022","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2410.11022"}},"official":null}},{"url":null,"slug":"burning-red-unlocking-subtask-driven","title":"Burning RED: Unlocking Subtask-Driven Reinforcement Learning and Risk-Awareness in Average-Reward Markov Decision Processes","date":"2024-10-14","arxiv_id":"2410.10578","repositories_listed":0,"syntology":null},{"url":null,"slug":"dr-mpc-deep-residual-model-predictive-control","title":"DR-MPC: Deep Residual Model Predictive Control for Real-world Social Navigation","date":"2024-10-14","arxiv_id":"2410.10646","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-language-model-enhanced-reinforcement","title":"Large Language Model-Enhanced Reinforcement Learning for Generic Bus Holding Control Strategies","date":"2024-10-14","arxiv_id":"2410.10212","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-statistical-inference-for-time-varying","title":"Asymptotic Analysis of Sample-averaged Q-learning","date":"2024-10-14","arxiv_id":"2410.10737","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-of-compositional-tasks-with","title":"Generalization of Compositional Tasks with Logical Specification via Implicit Planning","date":"2024-10-13","arxiv_id":"2410.09686","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-reinforcement-learning-and-large","title":"Integrating Reinforcement Learning and Large Language Models for Crop Production Process Management Optimization and Control through A New Knowledge-Based Deep Learning Paradigm","date":"2024-10-13","arxiv_id":"2410.09680","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-with-universal","title":"Meta-Reinforcement Learning with Universal Policy Adaptation: Provable Near-Optimality under All-task Optimum Comparator","date":"2024-10-13","arxiv_id":"2410.09728","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformers-as-game-players-provable-in","title":"Transformers as Game Players: Provable In-context Game-playing Capabilities of Pre-trained Models","date":"2024-10-13","arxiv_id":"2410.09701","repositories_listed":0,"syntology":null},{"url":null,"slug":"actsafe-active-exploration-with-safety","title":"ActSafe: Active Exploration with Safety Constraints for Reinforcement Learning","date":"2024-10-12","arxiv_id":"2410.09486","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-hyperbolic-spaces","title":"Reinforcement Learning in Hyperbolic Spaces: Models and Experiments","date":"2024-10-12","arxiv_id":"2410.09466","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-we-hop-in-general-a-discussion-of","title":"Can we hop in general? A discussion of benchmark selection and design using the Hopper environment","date":"2024-10-11","arxiv_id":"2410.08870","repositories_listed":0,"syntology":null},{"url":null,"slug":"mad-td-model-augmented-data-stabilizes-high","title":"MAD-TD: Model-Augmented Data stabilizes High Update Ratio RL","date":"2024-10-11","arxiv_id":"2410.08896","repositories_listed":0,"syntology":null},{"url":null,"slug":"physical-simulation-for-multi-agent-multi","title":"Physical Simulation for Multi-agent Multi-machine Tending","date":"2024-10-11","arxiv_id":"2410.19761","repositories_listed":0,"syntology":null},{"url":null,"slug":"sold-reinforcement-learning-with-slot-object","title":"SOLD: Slot Object-Centric Latent Dynamics Models for Relational Manipulation Learning from Pixels","date":"2024-10-11","arxiv_id":"2410.08822","repositories_listed":0,"syntology":null},{"url":null,"slug":"words-as-beacons-guiding-rl-agents-with-high","title":"Words as Beacons: Guiding RL Agents with High-Level Language Prompts","date":"2024-10-11","arxiv_id":"2410.08632","repositories_listed":0,"syntology":null},{"url":null,"slug":"avoiding-mode-collapse-in-diffusion-models","title":"Avoiding mode collapse in diffusion models fine-tuned with reinforcement learning","date":"2024-10-10","arxiv_id":"2410.08315","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforcement-learning-with-large","title":"Efficient Reinforcement Learning with Large Language Model Priors","date":"2024-10-10","arxiv_id":"2410.07927","repositories_listed":0,"syntology":null},{"url":null,"slug":"masked-generative-priors-improve-world-models","title":"Masked Generative Priors Improve World Models Sequence Modelling Capabilities","date":"2024-10-10","arxiv_id":"2410.07836","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-hierarchical-reinforcement-learning","title":"Offline Hierarchical Reinforcement Learning via Inverse Optimization","date":"2024-10-10","arxiv_id":"2410.07933","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-inverse-constrained-reinforcement","title":"Offline Inverse Constrained Reinforcement Learning for Safe-Critical Decision Making in Healthcare","date":"2024-10-10","arxiv_id":"2410.07525","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-satisfaction-of-temporal-logic","title":"Probabilistic Satisfaction of Temporal Logic Constraints in Reinforcement Learning via Adaptive Policy-Switching","date":"2024-10-10","arxiv_id":"2410.08022","repositories_listed":0,"syntology":null},{"url":null,"slug":"rewarding-progress-scaling-automated-process","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","date":"2024-10-10","arxiv_id":"2410.08146","repositories_listed":0,"syntology":null},{"url":null,"slug":"verifierq-enhancing-llm-test-time-compute","title":"VerifierQ: Enhancing LLM Test Time Compute with Q-Learning-based Verifiers","date":"2024-10-10","arxiv_id":"2410.08048","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-safety-modulator-actor-critic-method-in","title":"A Safety Modulator Actor-Critic Method in Model-Free Safe Reinforcement Learning and Application in UAV Hovering","date":"2024-10-09","arxiv_id":"2410.06847","repositories_listed":0,"syntology":null},{"url":null,"slug":"flipping-based-policy-for-chance-constrained","title":"Flipping-based Policy for Chance-Constrained Markov Decision Processes","date":"2024-10-09","arxiv_id":"2410.06474","repositories_listed":0,"syntology":null},{"url":null,"slug":"motionrl-align-text-to-motion-generation-to","title":"MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning","date":"2024-10-09","arxiv_id":"2410.06513","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-wsl-leveraging-dynamic-programming-for","title":"Q-WSL: Optimizing Goal-Conditioned RL with Weighted Supervised Learning via Dynamic Programming","date":"2024-10-09","arxiv_id":"2410.06648","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-generalization-of-vision-based-rl","title":"Zero-Shot Generalization of Vision-Based RL Without Data Augmentation","date":"2024-10-09","arxiv_id":"2410.07441","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-modeling-capabilities-of-large","title":"On the Modeling Capabilities of Large Language Models for Sequential Decision Making","date":"2024-10-08","arxiv_id":"2410.05656","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-imperfect-1","title":"Reinforcement Learning From Imperfect Corrective Actions And Proxy Rewards","date":"2024-10-08","arxiv_id":"2410.05782","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-multi-goal-robotic-tasks-with","title":"Solving Multi-Goal Robotic Tasks with Decision Transformer","date":"2024-10-08","arxiv_id":"2410.06347","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-robust-mdps-as-a-sequence-of-static","title":"Solving robust MDPs as a sequence of static RL problems","date":"2024-10-08","arxiv_id":"2410.06212","repositories_listed":0,"syntology":null},{"url":null,"slug":"alpharouter-quantum-circuit-routing-with","title":"AlphaRouter: Quantum Circuit Routing with Reinforcement Learning and Tree Search","date":"2024-10-07","arxiv_id":"2410.05115","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-measuring-goal-directedness-in-ai","title":"Towards Measuring Goal-Directedness in AI Systems","date":"2024-10-07","arxiv_id":"2410.04683","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-using-reinforcement-learning-for","title":"Towards using Reinforcement Learning for Scaling and Data Replication in Cloud Systems","date":"2024-10-07","arxiv_id":"2410.11862","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-engine-with-reduced","title":"A Reinforcement Learning Engine with Reduced Action and State Space for Scalable Cyber-Physical Optimal Response","date":"2024-10-06","arxiv_id":"2410.04518","repositories_listed":0,"syntology":null},{"url":null,"slug":"adamemento-adaptive-memory-assisted-policy","title":"AdaMemento: Adaptive Memory-Assisted Policy Optimization for Reinforcement Learning","date":"2024-10-06","arxiv_id":"2410.04498","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-under-frequency-load-shedding","title":"Data-driven Under Frequency Load Shedding Using Reinforcement Learning","date":"2024-10-06","arxiv_id":"2410.04316","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepltl-learning-to-efficiently-satisfy","title":"DeepLTL: Learning to Efficiently Satisfy Complex LTL Specifications for Multi-Task RL","date":"2024-10-06","arxiv_id":"2410.04631","repositories_listed":0,"syntology":null},{"url":"/paper/spatial-aware-decision-making-with-ring","slug":"spatial-aware-decision-making-with-ring","title":"Spatial-aware decision-making with ring attractors in reinforcement learning systems","date":"2024-10-04","arxiv_id":"2410.03119","repositories_listed":0,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":2,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":3,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/spatial-aware-decision-making-with-ring#ran","syntology_url":"https://syntology.ai/paper/2410.03119","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2410.03119"}},"official":null}},{"url":null,"slug":"beyond-expected-returns-a-policy-gradient","title":"Beyond Expected Returns: A Policy Gradient Algorithm for Cumulative Prospect Theoretic Reinforcement Learning","date":"2024-10-03","arxiv_id":"2410.02605","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-embodiment-dexterous-grasping-with","title":"Cross-Embodiment Dexterous Grasping with Reinforcement Learning","date":"2024-10-03","arxiv_id":"2410.02479","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-active-learning-for-reinforcement","title":"Dual Active Learning for Reinforcement Learning from Human Feedback","date":"2024-10-03","arxiv_id":"2410.02504","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-residual-learning-with-mixture-of","title":"Efficient Residual Learning with Mixture-of-Experts for Universal Dexterous Grasping","date":"2024-10-03","arxiv_id":"2410.02475","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-driving-in-high-interaction","title":"End-to-end Driving in High-Interaction Traffic Scenarios with Reinforcement Learning","date":"2024-10-03","arxiv_id":"2410.02253","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-emergence-of-interaction-patterns","title":"Learning Emergence of Interaction Patterns across Independent RL Agents in Multi-Agent Environments","date":"2024-10-03","arxiv_id":"2410.02516","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-reach-avoid-stay-problems-using-deep","title":"Solving Reach-Avoid-Stay Problems Using Deep Deterministic Policy Gradients","date":"2024-10-03","arxiv_id":"2410.02898","repositories_listed":0,"syntology":null},{"url":null,"slug":"absolute-state-wise-constrained-policy","title":"Absolute State-wise Constrained Policy Optimization: High-Probability State-wise Constraints Satisfaction","date":"2024-10-02","arxiv_id":"2410.01212","repositories_listed":0,"syntology":null},{"url":null,"slug":"bellman-diffusion-generative-modeling-as","title":"Bellman Diffusion: Generative Modeling as Learning a Linear Operator in the Distribution Space","date":"2024-10-02","arxiv_id":"2410.01796","repositories_listed":0,"syntology":null},{"url":null,"slug":"comadice-offline-cooperative-multi-agent","title":"ComaDICE: Offline Cooperative Multi-Agent Reinforcement Learning with Stationary Distribution Shift Regularization","date":"2024-10-02","arxiv_id":"2410.01954","repositories_listed":0,"syntology":null},{"url":null,"slug":"don-t-flatten-tokenize-unlocking-the-key-to","title":"Don't flatten, tokenize! Unlocking the key to SoftMoE's efficacy in deep RL","date":"2024-10-02","arxiv_id":"2410.01930","repositories_listed":0,"syntology":null},{"url":null,"slug":"llm-augmented-symbolic-reinforcement-learning","title":"LLM-Augmented Symbolic Reinforcement Learning with Landmark-Based Task Decomposition","date":"2024-10-02","arxiv_id":"2410.01929","repositories_listed":0,"syntology":null},{"url":null,"slug":"prend-enhancing-intrinsic-motivation-in","title":"PreND: Enhancing Intrinsic Motivation in Reinforcement Learning through Pre-trained Network Distillation","date":"2024-10-02","arxiv_id":"2410.01745","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-world-data-and-calibrated-simulation","title":"The Smart Buildings Control Suite: A Diverse Open Source Benchmark to Evaluate and Scale HVAC Control Policies for Sustainability","date":"2024-10-02","arxiv_id":"2410.03756","repositories_listed":0,"syntology":null}],"record_sha256":"b1083aa92bd7605c030d04d7c61e8ba39ac8b9d78016fc7c5852dd55a7a339db","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}