{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/43","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":43,"pages_in_order":132,"rows_per_page":100,"rows":[4201,4300],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/42","next":"/task/reinforcement-learning/papers/44","papers":[{"url":null,"slug":"artificial-generals-intelligence-mastering","title":"Artificial Generals Intelligence: Mastering Generals.io with Reinforcement Learning","date":"2025-07-09","arxiv_id":"2507.06825","repositories_listed":0,"syntology":null},{"url":null,"slug":"2048-reinforcement-learning-in-a-delayed","title":"2048: Reinforcement Learning in a Delayed Reward Environment","date":"2025-07-07","arxiv_id":"2507.05465","repositories_listed":0,"syntology":null},{"url":null,"slug":"epistemically-guided-forward-backward","title":"Epistemically-guided forward-backward exploration","date":"2025-07-07","arxiv_id":"2507.05477","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-globally-speak-locally-bridging-the","title":"Learn Globally, Speak Locally: Bridging the Gaps in Multilingual Reasoning","date":"2025-07-07","arxiv_id":"2507.05418","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-continual-reinforcement-learning","title":"A Survey of Continual Reinforcement Learning","date":"2025-06-27","arxiv_id":"2506.21872","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancements-and-challenges-in-continual","title":"Advancements and Challenges in Continual Reinforcement Learning: A Comprehensive Review","date":"2025-06-27","arxiv_id":"2506.21899","repositories_listed":0,"syntology":null},{"url":null,"slug":"layer-importance-for-mathematical-reasoning","title":"Layer Importance for Mathematical Reasoning is Forged in Pre-Training and Invariant after Post-Training","date":"2025-06-27","arxiv_id":"2506.22638","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-offline-and-online-reinforcement","title":"Bridging Offline and Online Reinforcement Learning for LLMs","date":"2025-06-26","arxiv_id":"2506.21495","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-ai-for-radar-resource-management","title":"Explainable AI for Radar Resource Management: Modified LIME in Deep Reinforcement Learning","date":"2025-06-26","arxiv_id":"2506.20916","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-reinforcement-learning-trading-agent","title":"Quantum Reinforcement Learning Trading Agent for Sector Rotation in the Taiwan Stock Market","date":"2025-06-26","arxiv_id":"2506.20930","repositories_listed":0,"syntology":null},{"url":null,"slug":"mobile-r1-towards-interactive-reinforcement","title":"Mobile-R1: Towards Interactive Reinforcement Learning for VLM-Based Mobile Agent via Task-Level Rewards","date":"2025-06-25","arxiv_id":"2506.20332","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-reinforcement-learning-for-6","title":"Multi-Objective Reinforcement Learning for Cognitive Radar Resource Management","date":"2025-06-25","arxiv_id":"2506.20853","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-principled-path-to-fitted-distributional","title":"A Principled Path to Fitted Distributional Evaluation","date":"2025-06-24","arxiv_id":"2506.20048","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-memories-to-maps-mechanisms-of-in","title":"From Memories to Maps: Mechanisms of In-Context Reinforcement Learning in Transformers","date":"2025-06-24","arxiv_id":"2506.19686","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-and-value","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","date":"2025-06-24","arxiv_id":"2506.20036","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-instruction-following-policies","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","date":"2025-06-24","arxiv_id":"2506.20061","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-goal-conditioned-reinforcement-2","title":"Offline Goal-Conditioned Reinforcement Learning with Projective Quasimetric Planning","date":"2025-06-23","arxiv_id":"2506.18847","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-residual-reinforcement-learning","title":"Accelerating Residual Reinforcement Learning with Uncertainty Estimation","date":"2025-06-21","arxiv_id":"2506.17564","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-free-lunch-rethinking-internal-feedback","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","date":"2025-06-20","arxiv_id":"2506.17219","repositories_listed":0,"syntology":null},{"url":null,"slug":"grpo-care-consistency-aware-reinforcement","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","date":"2025-06-19","arxiv_id":"2506.16141","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-lifelong-reinforcement-learning","title":"Multi-Task Lifelong Reinforcement Learning for Wireless Sensor Networks","date":"2025-06-19","arxiv_id":"2506.16254","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-28","title":"Multi-Agent Reinforcement Learning for Autonomous Multi-Satellite Earth Observation: A Realistic Case Study","date":"2025-06-18","arxiv_id":"2506.15207","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-policy","title":"Reinforcement Learning-Based Policy Optimisation For Heterogeneous Radio Access","date":"2025-06-18","arxiv_id":"2506.15273","repositories_listed":0,"syntology":null},{"url":null,"slug":"steering-your-diffusion-policy-with-latent","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","date":"2025-06-18","arxiv_id":"2506.15799","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comprehensive-survey-on-underwater-acoustic","title":"A Comprehensive Survey on Underwater Acoustic Target Positioning and Tracking: Progress, Challenges, and Perspectives","date":"2025-06-17","arxiv_id":"2506.14165","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-reinforcement-learning-for","title":"Adaptive Reinforcement Learning for Unobservable Random Delays","date":"2025-06-17","arxiv_id":"2506.14411","repositories_listed":0,"syntology":null},{"url":null,"slug":"hilight-a-hierarchical-reinforcement-learning","title":"HiLight: A Hierarchical Reinforcement Learning Framework with Global Adversarial Guidance for Large-Scale Traffic Signal Control","date":"2025-06-17","arxiv_id":"2506.14391","repositories_listed":0,"syntology":null},{"url":null,"slug":"perl-permutation-enhanced-reinforcement","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","date":"2025-06-17","arxiv_id":"2506.14907","repositories_listed":0,"syntology":null},{"url":null,"slug":"situational-constrained-sequential-resources","title":"Situational-Constrained Sequential Resources Allocation via Reinforcement Learning","date":"2025-06-17","arxiv_id":"2506.14125","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-guidance-accelerates-reinforcement","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","date":"2025-06-16","arxiv_id":"2506.13923","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovering-temporal-structure-an-overview-of","title":"Discovering Temporal Structure: An Overview of Hierarchical Reinforcement Learning","date":"2025-06-16","arxiv_id":"2506.14045","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-reinsurance-treaty-bidding-via-multi","title":"Dynamic Reinsurance Treaty Bidding via Multi-Agent Reinforcement Learning","date":"2025-06-16","arxiv_id":"2506.13113","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-medical-vie-via-reinforcement","title":"Efficient Medical VIE via Reinforcement Learning","date":"2025-06-16","arxiv_id":"2506.13363","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-algorithm-distillation-for-continuous","title":"Scaling Algorithm Distillation for Continuous Control with Mamba","date":"2025-06-16","arxiv_id":"2506.13892","repositories_listed":0,"syntology":null},{"url":null,"slug":"socratic-rl-a-novel-framework-for-efficient","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","date":"2025-06-16","arxiv_id":"2506.13358","repositories_listed":0,"syntology":null},{"url":null,"slug":"flow-based-policy-for-online-reinforcement","title":"Flow-Based Policy for Online Reinforcement Learning","date":"2025-06-15","arxiv_id":"2506.12811","repositories_listed":0,"syntology":null},{"url":null,"slug":"noise-tolerance-via-reinforcement-learning-a","title":"Noise tolerance via reinforcement: Learning a reinforced quantum dynamics","date":"2025-06-14","arxiv_id":"2506.12418","repositories_listed":0,"syntology":null},{"url":null,"slug":"relative-entropy-regularized-reinforcement","title":"Relative Entropy Regularized Reinforcement Learning for Efficient Encrypted Policy Synthesis","date":"2025-06-14","arxiv_id":"2506.12358","repositories_listed":0,"syntology":null},{"url":null,"slug":"wasserstein-barycenter-consensus-for","title":"Wasserstein-Barycenter Consensus for Cooperative Multi-Agent Reinforcement Learning","date":"2025-06-14","arxiv_id":"2506.12497","repositories_listed":0,"syntology":null},{"url":null,"slug":"reveal-self-evolving-code-agents-via","title":"ReVeal: Self-Evolving Code Agents via Iterative Generation-Verification","date":"2025-06-13","arxiv_id":"2506.11442","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-preference-based-reinforcement-2","title":"Efficient Preference-Based Reinforcement Learning: Randomized Exploration Meets Experimental Design","date":"2025-06-11","arxiv_id":"2506.09508","repositories_listed":0,"syntology":null},{"url":null,"slug":"moorl-a-framework-for-integrating-offline","title":"MOORL: A Framework for Integrating Offline-Online Reinforcement Learning","date":"2025-06-11","arxiv_id":"2506.09574","repositories_listed":0,"syntology":null},{"url":null,"slug":"synergizing-reinforcement-learning-and","title":"Synergizing Reinforcement Learning and Genetic Algorithms for Neural Combinatorial Optimization","date":"2025-06-11","arxiv_id":"2506.09404","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamical-system-optimization","title":"Dynamical System Optimization","date":"2025-06-10","arxiv_id":"2506.08340","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-based-trajectory-clustering-in-offline","title":"Policy-Based Trajectory Clustering in Offline Reinforcement Learning","date":"2025-06-10","arxiv_id":"2506.09202","repositories_listed":0,"syntology":null},{"url":null,"slug":"predictive-reinforcement-learning-based","title":"Predictive reinforcement learning based adaptive PID controller","date":"2025-06-10","arxiv_id":"2506.08509","repositories_listed":0,"syntology":null},{"url":"/paper/reinforcement-learning-teachers-of-test-time","slug":"reinforcement-learning-teachers-of-test-time","title":"Reinforcement Learning Teachers of Test Time Scaling","date":"2025-06-10","arxiv_id":"2506.08388","repositories_listed":0,"syntology":{"n":25,"n_ran":18,"n_constructed":0,"n_ran_checked":18,"n_instrument":0,"n_unverified":7,"n_honours":0,"n_violates":0,"n_no_contract":18,"n_pointer_only":0,"phrase":"18 ran (of which 0 constructed an object rather than computing a result; 18 with no instrument failure: 0 honoured, 0 violated, 18 with no contract checked; 0 where Syntology's instrument failed) · 7 unverified","sample_list":"/paper/reinforcement-learning-teachers-of-test-time#ran","syntology_url":"https://syntology.ai/paper/2506.08388","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2506.08388"}},"official":null}},{"url":null,"slug":"semi-gradient-dice-for-offline-constrained","title":"Semi-gradient DICE for Offline Constrained Reinforcement Learning","date":"2025-06-10","arxiv_id":"2506.08644","repositories_listed":0,"syntology":null},{"url":null,"slug":"tgrpo-fine-tuning-vision-language-action","title":"TGRPO :Fine-tuning Vision-Language-Action Model via Trajectory-wise Group Relative Policy Optimization","date":"2025-06-10","arxiv_id":"2506.08440","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-robust-deep-reinforcement-learning-1","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","date":"2025-06-10","arxiv_id":"2506.08961","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-intelligent-fault-self-healing-mechanism","title":"An Intelligent Fault Self-Healing Mechanism for Cloud AI Systems via Integration of Large Language Models and Deep Reinforcement Learning","date":"2025-06-09","arxiv_id":"2506.07411","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralizing-multi-agent-reinforcement","title":"Decentralizing Multi-Agent Reinforcement Learning with Temporal Causal Information","date":"2025-06-09","arxiv_id":"2506.07829","repositories_listed":0,"syntology":null},{"url":null,"slug":"fairdice-fairness-driven-offline-multi","title":"FairDICE: Fairness-Driven Offline Multi-Objective Reinforcement Learning","date":"2025-06-09","arxiv_id":"2506.08062","repositories_listed":0,"syntology":null},{"url":null,"slug":"proteinzero-self-improving-protein-generation","title":"ProteinZero: Self-Improving Protein Generation via Online Reinforcement Learning","date":"2025-06-09","arxiv_id":"2506.07459","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-via-implicit-imitation","title":"Reinforcement Learning via Implicit Imitation Guidance","date":"2025-06-09","arxiv_id":"2506.07505","repositories_listed":0,"syntology":null},{"url":null,"slug":"qforce-rl-quantized-fpga-optimized","title":"QForce-RL: Quantized FPGA-Optimized Reinforcement Learning Compute Engine","date":"2025-06-08","arxiv_id":"2506.07046","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-choice-model-specification-using","title":"Improving choice model specification using reinforcement learning","date":"2025-06-06","arxiv_id":"2506.06410","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-accuracy-dissecting-mathematical","title":"Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning","date":"2025-06-05","arxiv_id":"2506.04723","repositories_listed":0,"syntology":null},{"url":null,"slug":"confidence-is-all-you-need-few-shot-rl-fine","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","date":"2025-06-05","arxiv_id":"2506.06395","repositories_listed":0,"syntology":null},{"url":null,"slug":"customizing-speech-recognition-model-with","title":"Customizing Speech Recognition Model with Large Language Model Feedback","date":"2025-06-05","arxiv_id":"2506.11091","repositories_listed":0,"syntology":null},{"url":null,"slug":"discounting-and-drug-seeking-in-biological","title":"Discounting and Drug Seeking in Biological Hierarchical Reinforcement Learning","date":"2025-06-05","arxiv_id":"2506.04549","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-lyapunov-drift-plus-penalty-method-tailored","title":"A Lyapunov Drift-Plus-Penalty Method Tailored for Reinforcement Learning with Queue Stability","date":"2025-06-04","arxiv_id":"2506.04291","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-risk-aware-reinforcement-learning-reward","title":"A Risk-Aware Reinforcement Learning Reward for Financial Trading","date":"2025-06-04","arxiv_id":"2506.04358","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-vehicle-lateral-control-using-deep","title":"Autonomous Vehicle Lateral Control Using Deep Reinforcement Learning with MPC-PID Demonstration","date":"2025-06-04","arxiv_id":"2506.04040","repositories_listed":0,"syntology":null},{"url":null,"slug":"crowd-sft-crowdsourcing-for-llm-alignment","title":"Crowd-SFT: Crowdsourcing for LLM Alignment","date":"2025-06-04","arxiv_id":"2506.04063","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-composing-policies-for-scalable","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","date":"2025-06-04","arxiv_id":"2506.14811","repositories_listed":0,"syntology":null},{"url":null,"slug":"sgn-cirl-scene-graph-based-navigation-with","title":"SGN-CIRL: Scene Graph-based Navigation with Curriculum, Imitation, and Reinforcement Learning","date":"2025-06-04","arxiv_id":"2506.04505","repositories_listed":0,"syntology":null},{"url":null,"slug":"eden-entorhinal-driven-egocentric-navigation","title":"EDEN: Entorhinal Driven Egocentric Navigation Toward Robotic Deployment","date":"2025-06-03","arxiv_id":"2506.03046","repositories_listed":0,"syntology":null},{"url":null,"slug":"2506-08029","title":"Inverse Design in Distributed Circuits Using Single-Step Reinforcement Learning","date":"2025-06-02","arxiv_id":"2506.08029","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-assimilated-model-informed-reinforcement","title":"Data-assimilated model-informed reinforcement learning","date":"2025-06-02","arxiv_id":"2506.01755","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-reinforcement-learning-for-heat","title":"Interpretable reinforcement learning for heat pump control through asymmetric differentiable decision trees","date":"2025-06-02","arxiv_id":"2506.01641","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-safe-reinforcement-learning-from","title":"Provably Safe Reinforcement Learning from Analytic Gradients","date":"2025-06-02","arxiv_id":"2506.01665","repositories_listed":0,"syntology":null},{"url":null,"slug":"srpo-enhancing-multimodal-llm-reasoning-via","title":"SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning","date":"2025-06-02","arxiv_id":"2506.01713","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-ris","title":"A Reinforcement Learning Approach for RIS-aided Fair Communications","date":"2025-06-01","arxiv_id":"2506.06344","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-dependency-graphs-for-globally-optimal","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","date":"2025-06-01","arxiv_id":"2506.00797","repositories_listed":0,"syntology":null},{"url":null,"slug":"hmpc-assisted-adversarial-inverse","title":"HMPC-assisted Adversarial Inverse Reinforcement Learning for Smart Home Energy Management","date":"2025-06-01","arxiv_id":"2506.00898","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-random-time","title":"Reinforcement Learning with Random Time Horizons","date":"2025-06-01","arxiv_id":"2506.00962","repositories_listed":0,"syntology":null},{"url":null,"slug":"basil-best-action-symbolic-interpretable","title":"BASIL: Best-Action Symbolic Interpretable Learning for Evolving Compact RL Policies","date":"2025-05-31","arxiv_id":"2506.00328","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-hanabi","title":"Reinforcement Learning for Hanabi","date":"2025-05-31","arxiv_id":"2506.00458","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlae-reinforcement-learning-assisted-ensemble","title":"RLAE: Reinforcement Learning-Assisted Ensemble for LLMs","date":"2025-05-31","arxiv_id":"2506.00439","repositories_listed":0,"syntology":null},{"url":null,"slug":"proactive-guidance-of-multi-turn-conversation","title":"Proactive Guidance of Multi-Turn Conversation in Industrial Search","date":"2025-05-30","arxiv_id":"2505.24251","repositories_listed":0,"syntology":null},{"url":null,"slug":"reflect-retry-reward-self-improving-llms-via","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","date":"2025-05-30","arxiv_id":"2505.24726","repositories_listed":0,"syntology":null},{"url":null,"slug":"afterburner-reinforcement-learning","title":"Afterburner: Reinforcement Learning Facilitates Self-Improving Code Efficiency Optimization","date":"2025-05-29","arxiv_id":"2505.23387","repositories_listed":0,"syntology":null},{"url":null,"slug":"composite-flow-matching-for-reinforcement","title":"Composite Flow Matching for Reinforcement Learning with Shifted-Dynamics Data","date":"2025-05-29","arxiv_id":"2505.23062","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-integrity-in-llms-via-reasoning","title":"Contextual Integrity in LLMs via Reasoning and Reinforcement Learning","date":"2025-05-29","arxiv_id":"2506.04245","repositories_listed":0,"syntology":null},{"url":null,"slug":"curve-clip-utilized-reinforcement-learning","title":"CURVE: CLIP-Utilized Reinforcement Learning for Visual Image Enhancement via Simple Image Processing","date":"2025-05-29","arxiv_id":"2505.23102","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-cross-domain-robust-reinforcement","title":"Hybrid Cross-domain Robust Reinforcement Learning","date":"2025-05-29","arxiv_id":"2505.23003","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-coordinated-badminton-skills-for","title":"Learning coordinated badminton skills for legged manipulators","date":"2025-05-29","arxiv_id":"2505.22974","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-search-for-vehicle-routing-with","title":"Learning to Search for Vehicle Routing with Multiple Time Windows","date":"2025-05-29","arxiv_id":"2505.23098","repositories_listed":0,"syntology":null},{"url":null,"slug":"pixelthink-towards-efficient-chain-of-pixel","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","date":"2025-05-29","arxiv_id":"2505.23727","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximizing-confidence-alone-improves","title":"Maximizing Confidence Alone Improves Reasoning","date":"2025-05-28","arxiv_id":"2505.22660","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-independent-messaging-for","title":"Reward-Independent Messaging for Decentralized Multi-Agent Reinforcement Learning","date":"2025-05-28","arxiv_id":"2505.21985","repositories_listed":0,"syntology":null},{"url":null,"slug":"sam-r1-leveraging-sam-for-reward-feedback-in","title":"SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning","date":"2025-05-28","arxiv_id":"2505.22596","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-offline-rl-via-efficient-and","title":"Scaling Offline RL via Efficient and Expressive Shortcut Models","date":"2025-05-28","arxiv_id":"2505.22866","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-agent-for","title":"A reinforcement learning agent for maintenance of deteriorating systems with increasingly imperfect repairs","date":"2025-05-27","arxiv_id":"2505.20725","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-mode-process-control-using-multi-task","title":"Multi-Mode Process Control Using Multi-Task Inverse Reinforcement Learning","date":"2025-05-27","arxiv_id":"2505.21026","repositories_listed":0,"syntology":null},{"url":null,"slug":"rendering-aware-reinforcement-learning-for","title":"Rendering-Aware Reinforcement Learning for Vector Graphics Generation","date":"2025-05-27","arxiv_id":"2505.20793","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-deep-reasoning-triggering-deep","title":"Adaptive Deep Reasoning: Triggering Deep Thinking When Needed","date":"2025-05-26","arxiv_id":"2505.20101","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-rlaif-curriculum-alignment-with","title":"Curriculum-RLAIF: Curriculum Alignment with Reinforcement Learning from AI Feedback","date":"2025-05-26","arxiv_id":"2505.20075","repositories_listed":0,"syntology":null},{"url":null,"slug":"ground-r1-incentivizing-grounded-visual","title":"Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning","date":"2025-05-26","arxiv_id":"2505.20272","repositories_listed":0,"syntology":null}],"record_sha256":"eafc809674ca8a40a4ddce3965dac2f64a4b354658a601785217f7d83c72cec5","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}