Browse State-of-the-Art › Reinforcement Learning (RL) › Papers, page 50
Reinforcement Learning (RL)
Papers archive 2025-07-28
archive papers tagged: 15,113 · with a code link: 4,749 · where Syntology ran a sample: 1,416 (1,186 with a run with no instrument failure, 230 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (1,416 of 15,113 tagged: 1,186 with a run with no instrument failure, 230 where every run was a failure of Syntology's instrument)
Page 50 of 152: papers 4,901 to 5,000 of 15,113, in archive order: by repositories listed in the archive (most first), then newest first, not by stars (the archive holds no stars, so PwC's “Social” and “Latest” sorts cannot be reproduced). Papers that list no repository come after every paper that lists one.
Papers without a page here are shown as plain text. A Syntology line reads “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the figure “where Syntology's instrument failed” counts failures of Syntology's instrument, not of the code. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code); hover it for the repositories the samples that ran came from. Abstracts are on each paper's page.
-
Enhancing Study-Level Inference from Clinical Trial Papers via RL-based Numeric Reasoning28 May 2025 0 repositories listed
-
FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control28 May 2025 0 repositories listed
-
Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games28 May 2025 0 repositories listed
-
Maximizing Confidence Alone Improves Reasoning28 May 2025 0 repositories listed
-
ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning28 May 2025 0 repositories listed
-
SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning28 May 2025 0 repositories listed
-
Scaling Offline RL via Efficient and Expressive Shortcut Models28 May 2025 0 repositories listed
-
Breaking the Performance Ceiling in Complex Reinforcement Learning requires Inference Strategies27 May 2025 0 repositories listed
-
Interactive OT Gym: A Reinforcement Learning-Based Interactive Optical tweezer (OT)-Driven Microrobotics Simulation Platform27 May 2025 0 repositories listed
-
Learning optimal treatment strategies for intraoperative hypotension using deep reinforcement learning27 May 2025 0 repositories listed
-
Rendering-Aware Reinforcement Learning for Vector Graphics Generation27 May 2025 0 repositories listed
-
Curriculum-RLAIF: Curriculum Alignment with Reinforcement Learning from AI Feedback26 May 2025 0 repositories listed
-
Done Is Better than Perfect: Unlocking Efficient Reasoning by Structured Multi-Turn Decomposition26 May 2025 0 repositories listed
-
Fox in the Henhouse: Supply-Chain Backdoor Attacks Against Reinforcement Learning26 May 2025 0 repositories listed
-
Interleaved Reasoning for Large Language Models via Reinforcement Learning26 May 2025 0 repositories listed
-
MedDreamer: Model-Based Reinforcement Learning with Latent Imagination on Complex EHRs for Clinical Decision Support26 May 2025 0 repositories listed
-
MT³: Scaling MLLM-based Text Image Machine Translation via Multi-Task Reinforcement Learning26 May 2025 0 repositories listed
-
Surrogate-Assisted Evolutionary Reinforcement Learning Based on Autoencoder and Hyperbolic Neural Network26 May 2025 0 repositories listed
-
TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning26 May 2025 0 repositories listed
-
VLMLight: Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning26 May 2025 0 repositories listed
-
What Can RL Bring to VLA Generalization? An Empirical Study26 May 2025 0 repositories listed
-
FedORA: Resource Allocation for Federated Learning in ORAN using Radio Intelligent Controllers25 May 2025 0 repositories listed
-
Reduce Computational Cost In Deep Reinforcement Learning Via Randomized Policy Learning25 May 2025 0 repositories listed
-
Reinforced Latent Reasoning for LLM-based Recommendation25 May 2025 0 repositories listed
-
Semi-pessimistic Reinforcement Learning25 May 2025 0 repositories listed
-
TextDiffuser-RL: Efficient and Robust Text Layout Optimization for High-Fidelity Text-to-Image Synthesis25 May 2025 0 repositories listed
-
The Overthinker's DIET: Cutting Token Calories with DIfficulty-AwarE Training25 May 2025 0 repositories listed
-
G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning24 May 2025 0 repositories listed
-
GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning24 May 2025 0 repositories listed
-
Guided by Guardrails: Control Barrier Functions as Safety Instructors for Robotic Learning24 May 2025 0 repositories listed
-
On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization24 May 2025 0 repositories listed
-
One Policy but Many Worlds: A Scalable Unified Policy for Versatile Humanoid Locomotion24 May 2025 0 repositories listed
-
Steering LLM Reasoning Through Bias-Only Adaptation24 May 2025 0 repositories listed
-
Alignment and Safety of Diffusion Models via Reinforcement Learning and Reward Modeling: A Survey23 May 2025 0 repositories listed
-
Diffusion Self-Weighted Guidance for Offline Reinforcement Learning23 May 2025 0 repositories listed
-
One RL to See Them All: Visual Triple Unified Reinforcement Learning23 May 2025 0 repositories listed
-
Reinforcement Speculative Decoding for Fast Ranking23 May 2025 0 repositories listed
-
AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning22 May 2025 0 repositories listed
-
Backdoors in DRL: Four Environments Focusing on In-distribution Triggers22 May 2025 0 repositories listed
-
Control of Renewable Energy Communities using AI and Real-World Data22 May 2025 0 repositories listed
-
DeepRec: Towards a Deep Dive Into the Item Space with Large Language Model Based Recommendation22 May 2025 0 repositories listed
-
Distilling the Implicit Multi-Branch Structure in LLMs' Reasoning via Reinforcement Learning22 May 2025 0 repositories listed
-
Divide-Fuse-Conquer: Eliciting "Aha Moments" in Multi-Scenario Games22 May 2025 0 repositories listed
-
Dynamic Sampling that Adapts: Iterative DPO for Self-Aware Mathematical Reasoning22 May 2025 0 repositories listed
-
Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only22 May 2025 0 repositories listed
-
Find the Fruit: Designing a Zero-Shot Sim2Real Deep RL Planner for Occlusion Aware Plant Manipulation22 May 2025 0 repositories listed
-
LARES: Latent Reasoning for Sequential Recommendation22 May 2025 0 repositories listed
-
Mesh-RFT: Enhancing Mesh Generation via Fine-grained Reinforcement Fine-Tuning22 May 2025 0 repositories listed
-
Meta-reinforcement learning with minimum attention22 May 2025 0 repositories listed
-
Offline Guarded Safe Reinforcement Learning for Medical Treatment Optimization Strategies22 May 2025 0 repositories listed
-
RAP: Runtime-Adaptive Pruning for LLM Inference22 May 2025 0 repositories listed
-
22 May 2025 0 repositories listed
-
Reinforcement Learning for Stock Transactions22 May 2025 0 repositories listed
-
Reward-Aware Proto-Representations in Reinforcement Learning22 May 2025 0 repositories listed
-
Strategically Linked Decisions in Long-Term Planning and Reinforcement Learning22 May 2025 0 repositories listed
-
Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains22 May 2025 0 repositories listed
-
VL-SAFE: Vision-Language Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving22 May 2025 0 repositories listed
-
Average Reward Reinforcement Learning for Omega-Regular and Mean-Payoff Objectives21 May 2025 0 repositories listed
-
Chain-of-Focus: Adaptive Visual Search and Zooming for Multimodal Reasoning via RL21 May 2025 0 repositories listed
-
GRIT: Teaching MLLMs to Think with Images21 May 2025 0 repositories listed
-
HCRMP: A LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving21 May 2025 0 repositories listed
-
Learning-based Autonomous Oversteer Control and Collision Avoidance21 May 2025 0 repositories listed
-
LLM-Explorer: A Plug-in Reinforcement Learning Policy Exploration Enhancement Driven by Large Language Models21 May 2025 0 repositories listed
-
Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One21 May 2025 0 repositories listed
-
Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems21 May 2025 0 repositories listed
-
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning21 May 2025 0 repositories listed
-
Reward Is Enough: LLMs Are In-Context Reinforcement Learners21 May 2025 0 repositories listed
-
STAR-R1: Spacial TrAnsformation Reasoning by Reinforcing Multimodal LLMs21 May 2025 0 repositories listed
-
StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization21 May 2025 0 repositories listed
-
Thought-Augmented Policy Optimization: Bridging External Guidance and Internal Capabilities21 May 2025 0 repositories listed
-
VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL21 May 2025 0 repositories listed
-
VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models21 May 2025 0 repositories listed
-
ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning21 May 2025 0 repositories listed
-
When Can Large Reasoning Models Save Thinking? Mechanistic Analysis of Behavioral Divergence in Reasoning21 May 2025 0 repositories listed
-
AAPO: Enhance the Reasoning Capabilities of LLMs with Advantage Momentum20 May 2025 0 repositories listed
-
Bellman operator convergence enhancements in reinforcement learning algorithms20 May 2025 0 repositories listed
-
Context Reasoner: Incentivizing Reasoning Capability for Contextualized Privacy and Safety Compliance via Reinforcement Learning20 May 2025 0 repositories listed
-
Interpretable Reinforcement Learning for Load Balancing using Kolmogorov-Arnold Networks20 May 2025 0 repositories listed
-
KIPPO: Koopman-Inspired Proximal Policy Optimization20 May 2025 0 repositories listed
-
NavBench: A Unified Robotics Benchmark for Reinforcement Learning-Based Autonomous Navigation20 May 2025 0 repositories listed
-
RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning20 May 2025 0 repositories listed
-
Self-Evolving Curriculum for LLM Reasoning20 May 2025 0 repositories listed
-
Normalized Cut with Reinforcement Learning in Constrained Action Space20 May 2025 0 repositories listed
-
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models20 May 2025 0 repositories listed
-
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning20 May 2025 0 repositories listed
-
Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis19 May 2025 0 repositories listed
-
DGRO: Enhancing LLM Reasoning via Exploration-Exploitation Control and Reward Variance Management19 May 2025 0 repositories listed
-
Exploiting Symbolic Heuristics for the Synthesis of Domain-Specific Temporal Planning Guidance using Reinforcement Learning19 May 2025 0 repositories listed
-
J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization19 May 2025 0 repositories listed
-
On-Policy Optimization with Group Equivalent Preference for Multi-Programming Language Understanding19 May 2025 0 repositories listed
-
Policy-Driven World Model Adaptation for Robust Offline Model-based Reinforcement Learning19 May 2025 0 repositories listed
-
Power Allocation for Delay Optimization in Device-to-Device Networks: A Graph Reinforcement Learning Approach19 May 2025 0 repositories listed
-
Step-wise Adaptive Integration of Supervised Fine-tuning and Reinforcement Learning for Task-Specific LLMs19 May 2025 0 repositories listed
-
Temporal Distance-aware Transition Augmentation for Offline Model-based Reinforcement Learning19 May 2025 0 repositories listed
-
ToTRL: Unlock LLM Tree-of-Thoughts Reasoning Potential through Puzzles Solving19 May 2025 0 repositories listed
-
Your Offline Policy is Not Trustworthy: Bilevel Reinforcement Learning for Sequential Portfolio Optimization19 May 2025 0 repositories listed
-
A Finite-Sample Analysis of Distributionally Robust Average-Reward Reinforcement Learning18 May 2025 0 repositories listed
-
AbFlowNet: Optimizing Antibody-Antigen Binding Energy via Diffusion-GFlowNet Fusion18 May 2025 0 repositories listed
-
Distributional Soft Actor-Critic with Harmonic Gradient for Safe and Efficient Autonomous Driving in Multi-lane Scenarios18 May 2025 0 repositories listed
Syntology lines on 1 of the papers shown; no Syntology record for the others (a paper without an arXiv id cannot be joined to the graph, and absence from the graph layer is not a recorded non-run). “Ran” means the sample executed on a synthesized fixture, not that the paper's result was reproduced; each line links to that paper's sample list. Syntology's record for this page has not changed since , the first build that kept a record date for it; when this build read Syntology's graph is in the build record. For agents: get_harvested_code_for_paper(arxiv_id) lists each paper's samples; how to connect.