Browse State-of-the-Art › reinforcement-learning › Papers, page 43
reinforcement-learning
Papers archive 2025-07-28
archive papers tagged: 13,427 · with a code link: 4,119 · where Syntology ran a sample: 1,165 (973 with a run with no instrument failure, 192 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (1,165 of 13,427 tagged: 973 with a run with no instrument failure, 192 where every run was a failure of Syntology's instrument)
Page 43 of 135: papers 4,201 to 4,300 of 13,427, in archive order: by repositories listed in the archive (most first), then newest first, not by stars (the archive holds no stars, so PwC's “Social” and “Latest” sorts cannot be reproduced). Papers that list no repository come after every paper that lists one.
Papers without a page here are shown as plain text. A Syntology line reads “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the figure “where Syntology's instrument failed” counts failures of Syntology's instrument, not of the code. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code); hover it for the repositories the samples that ran came from. Abstracts are on each paper's page.
-
Crowd-SFT: Crowdsourcing for LLM Alignment4 Jun 2025 0 repositories listed
-
Self-Composing Policies for Scalable Continual Reinforcement Learning4 Jun 2025 0 repositories listed
-
SGN-CIRL: Scene Graph-based Navigation with Curriculum, Imitation, and Reinforcement Learning4 Jun 2025 0 repositories listed
-
EDEN: Entorhinal Driven Egocentric Navigation Toward Robotic Deployment3 Jun 2025 0 repositories listed
-
Inverse Design in Distributed Circuits Using Single-Step Reinforcement Learning2 Jun 2025 0 repositories listed
-
Data-assimilated model-informed reinforcement learning2 Jun 2025 0 repositories listed
-
Interpretable reinforcement learning for heat pump control through asymmetric differentiable decision trees2 Jun 2025 0 repositories listed
-
Provably Safe Reinforcement Learning from Analytic Gradients2 Jun 2025 0 repositories listed
-
SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning2 Jun 2025 0 repositories listed
-
A Reinforcement Learning Approach for RIS-aided Fair Communications1 Jun 2025 0 repositories listed
-
Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning1 Jun 2025 0 repositories listed
-
HMPC-assisted Adversarial Inverse Reinforcement Learning for Smart Home Energy Management1 Jun 2025 0 repositories listed
-
Reinforcement Learning with Random Time Horizons1 Jun 2025 0 repositories listed
-
BASIL: Best-Action Symbolic Interpretable Learning for Evolving Compact RL Policies31 May 2025 0 repositories listed
-
Reinforcement Learning for Hanabi31 May 2025 0 repositories listed
-
RLAE: Reinforcement Learning-Assisted Ensemble for LLMs31 May 2025 0 repositories listed
-
Proactive Guidance of Multi-Turn Conversation in Industrial Search30 May 2025 0 repositories listed
-
Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning30 May 2025 0 repositories listed
-
Afterburner: Reinforcement Learning Facilitates Self-Improving Code Efficiency Optimization29 May 2025 0 repositories listed
-
Composite Flow Matching for Reinforcement Learning with Shifted-Dynamics Data29 May 2025 0 repositories listed
-
Contextual Integrity in LLMs via Reasoning and Reinforcement Learning29 May 2025 0 repositories listed
-
CURVE: CLIP-Utilized Reinforcement Learning for Visual Image Enhancement via Simple Image Processing29 May 2025 0 repositories listed
-
Hybrid Cross-domain Robust Reinforcement Learning29 May 2025 0 repositories listed
-
Learning coordinated badminton skills for legged manipulators29 May 2025 0 repositories listed
-
Learning to Search for Vehicle Routing with Multiple Time Windows29 May 2025 0 repositories listed
-
PixelThink: Towards Efficient Chain-of-Pixel Reasoning29 May 2025 0 repositories listed
-
Maximizing Confidence Alone Improves Reasoning28 May 2025 0 repositories listed
-
Reward-Independent Messaging for Decentralized Multi-Agent Reinforcement Learning28 May 2025 0 repositories listed
-
SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning28 May 2025 0 repositories listed
-
Scaling Offline RL via Efficient and Expressive Shortcut Models28 May 2025 0 repositories listed
-
A reinforcement learning agent for maintenance of deteriorating systems with increasingly imperfect repairs27 May 2025 0 repositories listed
-
Multi-Mode Process Control Using Multi-Task Inverse Reinforcement Learning27 May 2025 0 repositories listed
-
Rendering-Aware Reinforcement Learning for Vector Graphics Generation27 May 2025 0 repositories listed
-
Adaptive Deep Reasoning: Triggering Deep Thinking When Needed26 May 2025 0 repositories listed
-
Curriculum-RLAIF: Curriculum Alignment with Reinforcement Learning from AI Feedback26 May 2025 0 repositories listed
-
Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning26 May 2025 0 repositories listed
-
Interleaved Reasoning for Large Language Models via Reinforcement Learning26 May 2025 0 repositories listed
-
Outcome-Based Online Reinforcement Learning: Algorithms and Fundamental Limits26 May 2025 0 repositories listed
-
TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning26 May 2025 0 repositories listed
-
The challenge of hidden gifts in multi-agent reinforcement learning26 May 2025 0 repositories listed
-
VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection26 May 2025 0 repositories listed
-
Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning25 May 2025 0 repositories listed
-
Semi-pessimistic Reinforcement Learning25 May 2025 0 repositories listed
-
EdgeAgentX: A Novel Framework for Agentic AI at the Edge in Military Communication Networks24 May 2025 0 repositories listed
-
G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning24 May 2025 0 repositories listed
-
GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning24 May 2025 0 repositories listed
-
Pessimism Principle Can Be Effective: Towards a Framework for Zero-Shot Transfer Reinforcement Learning24 May 2025 0 repositories listed
-
Diffusion Self-Weighted Guidance for Offline Reinforcement Learning23 May 2025 0 repositories listed
-
Outcome-based Reinforcement Learning to Predict the Future23 May 2025 0 repositories listed
-
AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning22 May 2025 0 repositories listed
-
Backdoors in DRL: Four Environments Focusing on In-distribution Triggers22 May 2025 0 repositories listed
-
Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only22 May 2025 0 repositories listed
-
Incentivizing Dual Process Thinking for Efficient Large Language Model Reasoning22 May 2025 0 repositories listed
-
ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models22 May 2025 0 repositories listed
-
Meta-reinforcement learning with minimum attention22 May 2025 0 repositories listed
-
Offline Guarded Safe Reinforcement Learning for Medical Treatment Optimization Strategies22 May 2025 0 repositories listed
-
22 May 2025 0 repositories listed
-
Reinforcement Learning for Stock Transactions22 May 2025 0 repositories listed
-
Reward-Aware Proto-Representations in Reinforcement Learning22 May 2025 0 repositories listed
-
Risk-Averse Reinforcement Learning with Itakura-Saito Loss22 May 2025 0 repositories listed
-
AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization21 May 2025 0 repositories listed
-
Filtering Learning Histories Enhances In-Context Reinforcement Learning21 May 2025 0 repositories listed
-
Learning from Algorithm Feedback: One-Shot SAT Solver Guidance with GNNs21 May 2025 0 repositories listed
-
Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems21 May 2025 0 repositories listed
-
Reverse Engineering Human Preferences with Reinforcement Learning21 May 2025 0 repositories listed
-
World Models as Reference Trajectories for Rapid Motor Adaptation21 May 2025 0 repositories listed
-
Bellman operator convergence enhancements in reinforcement learning algorithms20 May 2025 0 repositories listed
-
Embedded Mean Field Reinforcement Learning for Perimeter-defense Game20 May 2025 0 repositories listed
-
Energy-Efficient Deep Reinforcement Learning with Spiking Transformers20 May 2025 0 repositories listed
-
FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning20 May 2025 0 repositories listed
-
Interpretable Reinforcement Learning for Load Balancing using Kolmogorov-Arnold Networks20 May 2025 0 repositories listed
-
Reinforcement Learning from User Feedback20 May 2025 0 repositories listed
-
SHARP: Synthesizing High-quality Aligned Reasoning Problems for Large Reasoning Models Reinforcement Learning20 May 2025 0 repositories listed
-
Normalized Cut with Reinforcement Learning in Constrained Action Space20 May 2025 0 repositories listed
-
Time Reversal Symmetry for Efficient Robotic Manipulations in Deep Reinforcement Learning20 May 2025 0 repositories listed
-
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning20 May 2025 0 repositories listed
-
Composing Dextrous Grasping and In-hand Manipulation via Scoring with a Reinforcement Learning Critic19 May 2025 0 repositories listed
-
Dynamic Sight Range Selection in Multi-Agent Reinforcement Learning19 May 2025 0 repositories listed
-
Multi-parameter Control for the (1+(λ,λ))-GA on OneMax via Deep Reinforcement Learning19 May 2025 0 repositories listed
-
When a Reinforcement Learning Agent Encounters Unknown Unknowns19 May 2025 0 repositories listed
-
A universal policy wrapper with guarantees18 May 2025 0 repositories listed
-
Imagination-Limited Q-Learning for Offline Reinforcement Learning18 May 2025 0 repositories listed
-
Table-R1: Region-based Reinforcement Learning for Table Understanding18 May 2025 0 repositories listed
-
Solver-Informed RL: Grounding Large Language Models for Authentic Optimization Modeling17 May 2025 0 repositories listed
-
Deep Symbolic Optimization: Reinforcement Learning for Symbolic Mathematics16 May 2025 0 repositories listed
-
Prior-Guided Diffusion Planning for Offline Reinforcement Learning16 May 2025 0 repositories listed
-
Improving Assembly Code Performance with Large Language Models via Reinforcement Learning16 May 2025 0 repositories listed
-
16 May 2025 0 repositories listed Syntology 2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified (of 2 harvested samples) · 2 pointer-only (licence)
-
Approximated Behavioral Metric-based State Projection for Federated Reinforcement Learning15 May 2025 0 repositories listed
-
Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change15 May 2025 0 repositories listed
-
Fixing Incomplete Value Function Decomposition for Multi-Agent Reinforcement Learning15 May 2025 0 repositories listed
-
Offline Reinforcement Learning for Microgrid Voltage Regulation15 May 2025 0 repositories listed
-
ORL-LDM: Offline Reinforcement Learning Guided Latent Diffusion Model Super-Resolution Reconstruction15 May 2025 0 repositories listed
-
Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning15 May 2025 0 repositories listed
-
Reinforcement Learning for Individual Optimal Policy from Heterogeneous Data14 May 2025 0 repositories listed
-
A Practical Introduction to Deep Reinforcement Learning13 May 2025 0 repositories listed
-
Adaptive Security Policy Management in Cloud Environments Using Reinforcement Learning13 May 2025 0 repositories listed
-
Deep Reinforcement Learning for Power Grid Multi-Stage Cascading Failure Mitigation13 May 2025 0 repositories listed
-
Enhancing Aerial Combat Tactics through Hierarchical Multi-Agent Reinforcement Learning13 May 2025 0 repositories listed
-
A Theoretical Framework for Explaining Reinforcement Learning with Shapley Values12 May 2025 0 repositories listed
Syntology lines on 1 of the papers shown; no Syntology record for the others (a paper without an arXiv id cannot be joined to the graph, and absence from the graph layer is not a recorded non-run). “Ran” means the sample executed on a synthesized fixture, not that the paper's result was reproduced; each line links to that paper's sample list. Syntology's record for this page has not changed since , the first build that kept a record date for it; when this build read Syntology's graph is in the build record. For agents: get_harvested_code_for_paper(arxiv_id) lists each paper's samples; how to connect.