{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/43","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":43,"pages_in_order":135,"rows_per_page":100,"rows":[4201,4300],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/42","next":"/task/reinforcement-learning-2/papers/44","papers":[{"url":null,"slug":"crowd-sft-crowdsourcing-for-llm-alignment","title":"Crowd-SFT: Crowdsourcing for LLM Alignment","date":"2025-06-04","arxiv_id":"2506.04063","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-composing-policies-for-scalable","title":"Self-Composing Policies for Scalable Continual Reinforcement Learning","date":"2025-06-04","arxiv_id":"2506.14811","repositories_listed":0,"syntology":null},{"url":null,"slug":"sgn-cirl-scene-graph-based-navigation-with","title":"SGN-CIRL: Scene Graph-based Navigation with Curriculum, Imitation, and Reinforcement Learning","date":"2025-06-04","arxiv_id":"2506.04505","repositories_listed":0,"syntology":null},{"url":null,"slug":"eden-entorhinal-driven-egocentric-navigation","title":"EDEN: Entorhinal Driven Egocentric Navigation Toward Robotic Deployment","date":"2025-06-03","arxiv_id":"2506.03046","repositories_listed":0,"syntology":null},{"url":null,"slug":"2506-08029","title":"Inverse Design in Distributed Circuits Using Single-Step Reinforcement Learning","date":"2025-06-02","arxiv_id":"2506.08029","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-assimilated-model-informed-reinforcement","title":"Data-assimilated model-informed reinforcement learning","date":"2025-06-02","arxiv_id":"2506.01755","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-reinforcement-learning-for-heat","title":"Interpretable reinforcement learning for heat pump control through asymmetric differentiable decision trees","date":"2025-06-02","arxiv_id":"2506.01641","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-safe-reinforcement-learning-from","title":"Provably Safe Reinforcement Learning from Analytic Gradients","date":"2025-06-02","arxiv_id":"2506.01665","repositories_listed":0,"syntology":null},{"url":null,"slug":"srpo-enhancing-multimodal-llm-reasoning-via","title":"SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning","date":"2025-06-02","arxiv_id":"2506.01713","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-ris","title":"A Reinforcement Learning Approach for RIS-aided Fair Communications","date":"2025-06-01","arxiv_id":"2506.06344","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-dependency-graphs-for-globally-optimal","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","date":"2025-06-01","arxiv_id":"2506.00797","repositories_listed":0,"syntology":null},{"url":null,"slug":"hmpc-assisted-adversarial-inverse","title":"HMPC-assisted Adversarial Inverse Reinforcement Learning for Smart Home Energy Management","date":"2025-06-01","arxiv_id":"2506.00898","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-random-time","title":"Reinforcement Learning with Random Time Horizons","date":"2025-06-01","arxiv_id":"2506.00962","repositories_listed":0,"syntology":null},{"url":null,"slug":"basil-best-action-symbolic-interpretable","title":"BASIL: Best-Action Symbolic Interpretable Learning for Evolving Compact RL Policies","date":"2025-05-31","arxiv_id":"2506.00328","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-hanabi","title":"Reinforcement Learning for Hanabi","date":"2025-05-31","arxiv_id":"2506.00458","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlae-reinforcement-learning-assisted-ensemble","title":"RLAE: Reinforcement Learning-Assisted Ensemble for LLMs","date":"2025-05-31","arxiv_id":"2506.00439","repositories_listed":0,"syntology":null},{"url":null,"slug":"proactive-guidance-of-multi-turn-conversation","title":"Proactive Guidance of Multi-Turn Conversation in Industrial Search","date":"2025-05-30","arxiv_id":"2505.24251","repositories_listed":0,"syntology":null},{"url":null,"slug":"reflect-retry-reward-self-improving-llms-via","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","date":"2025-05-30","arxiv_id":"2505.24726","repositories_listed":0,"syntology":null},{"url":null,"slug":"afterburner-reinforcement-learning","title":"Afterburner: Reinforcement Learning Facilitates Self-Improving Code Efficiency Optimization","date":"2025-05-29","arxiv_id":"2505.23387","repositories_listed":0,"syntology":null},{"url":null,"slug":"composite-flow-matching-for-reinforcement","title":"Composite Flow Matching for Reinforcement Learning with Shifted-Dynamics Data","date":"2025-05-29","arxiv_id":"2505.23062","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-integrity-in-llms-via-reasoning","title":"Contextual Integrity in LLMs via Reasoning and Reinforcement Learning","date":"2025-05-29","arxiv_id":"2506.04245","repositories_listed":0,"syntology":null},{"url":null,"slug":"curve-clip-utilized-reinforcement-learning","title":"CURVE: CLIP-Utilized Reinforcement Learning for Visual Image Enhancement via Simple Image Processing","date":"2025-05-29","arxiv_id":"2505.23102","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-cross-domain-robust-reinforcement","title":"Hybrid Cross-domain Robust Reinforcement Learning","date":"2025-05-29","arxiv_id":"2505.23003","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-coordinated-badminton-skills-for","title":"Learning coordinated badminton skills for legged manipulators","date":"2025-05-29","arxiv_id":"2505.22974","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-search-for-vehicle-routing-with","title":"Learning to Search for Vehicle Routing with Multiple Time Windows","date":"2025-05-29","arxiv_id":"2505.23098","repositories_listed":0,"syntology":null},{"url":null,"slug":"pixelthink-towards-efficient-chain-of-pixel","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","date":"2025-05-29","arxiv_id":"2505.23727","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximizing-confidence-alone-improves","title":"Maximizing Confidence Alone Improves Reasoning","date":"2025-05-28","arxiv_id":"2505.22660","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-independent-messaging-for","title":"Reward-Independent Messaging for Decentralized Multi-Agent Reinforcement Learning","date":"2025-05-28","arxiv_id":"2505.21985","repositories_listed":0,"syntology":null},{"url":null,"slug":"sam-r1-leveraging-sam-for-reward-feedback-in","title":"SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning","date":"2025-05-28","arxiv_id":"2505.22596","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-offline-rl-via-efficient-and","title":"Scaling Offline RL via Efficient and Expressive Shortcut Models","date":"2025-05-28","arxiv_id":"2505.22866","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-agent-for","title":"A reinforcement learning agent for maintenance of deteriorating systems with increasingly imperfect repairs","date":"2025-05-27","arxiv_id":"2505.20725","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-mode-process-control-using-multi-task","title":"Multi-Mode Process Control Using Multi-Task Inverse Reinforcement Learning","date":"2025-05-27","arxiv_id":"2505.21026","repositories_listed":0,"syntology":null},{"url":null,"slug":"rendering-aware-reinforcement-learning-for","title":"Rendering-Aware Reinforcement Learning for Vector Graphics Generation","date":"2025-05-27","arxiv_id":"2505.20793","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-deep-reasoning-triggering-deep","title":"Adaptive Deep Reasoning: Triggering Deep Thinking When Needed","date":"2025-05-26","arxiv_id":"2505.20101","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-rlaif-curriculum-alignment-with","title":"Curriculum-RLAIF: Curriculum Alignment with Reinforcement Learning from AI Feedback","date":"2025-05-26","arxiv_id":"2505.20075","repositories_listed":0,"syntology":null},{"url":null,"slug":"ground-r1-incentivizing-grounded-visual","title":"Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning","date":"2025-05-26","arxiv_id":"2505.20272","repositories_listed":0,"syntology":null},{"url":null,"slug":"interleaved-reasoning-for-large-language","title":"Interleaved Reasoning for Large Language Models via Reinforcement Learning","date":"2025-05-26","arxiv_id":"2505.19640","repositories_listed":0,"syntology":null},{"url":null,"slug":"outcome-based-online-reinforcement-learning","title":"Outcome-Based Online Reinforcement Learning: Algorithms and Fundamental Limits","date":"2025-05-26","arxiv_id":"2505.20268","repositories_listed":0,"syntology":null},{"url":null,"slug":"tevir-text-to-video-reward-with-diffusion","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","date":"2025-05-26","arxiv_id":"2505.19769","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-challenge-of-hidden-gifts-in-multi-agent","title":"The challenge of hidden gifts in multi-agent reinforcement learning","date":"2025-05-26","arxiv_id":"2505.20579","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualtoolagent-vista-a-reinforcement","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","date":"2025-05-26","arxiv_id":"2505.20289","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-medical-reasoning-with-curriculum","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","date":"2025-05-25","arxiv_id":"2505.19213","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-pessimistic-reinforcement-learning","title":"Semi-pessimistic Reinforcement Learning","date":"2025-05-25","arxiv_id":"2505.19002","repositories_listed":0,"syntology":null},{"url":null,"slug":"edgeagentx-a-novel-framework-for-agentic-ai","title":"EdgeAgentX: A Novel Framework for Agentic AI at the Edge in Military Communication Networks","date":"2025-05-24","arxiv_id":"2505.18457","repositories_listed":0,"syntology":null},{"url":null,"slug":"g1-teaching-llms-to-reason-on-graphs-with","title":"G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning","date":"2025-05-24","arxiv_id":"2505.18499","repositories_listed":0,"syntology":null},{"url":null,"slug":"genpo-generative-diffusion-models-meet-on","title":"GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning","date":"2025-05-24","arxiv_id":"2505.18763","repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimism-principle-can-be-effective-towards","title":"Pessimism Principle Can Be Effective: Towards a Framework for Zero-Shot Transfer Reinforcement Learning","date":"2025-05-24","arxiv_id":"2505.18447","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-self-weighted-guidance-for-offline","title":"Diffusion Self-Weighted Guidance for Offline Reinforcement Learning","date":"2025-05-23","arxiv_id":"2505.18345","repositories_listed":0,"syntology":null},{"url":null,"slug":"outcome-based-reinforcement-learning-to","title":"Outcome-based Reinforcement Learning to Predict the Future","date":"2025-05-23","arxiv_id":"2505.17989","repositories_listed":0,"syntology":null},{"url":null,"slug":"acereason-nemotron-advancing-math-and-code","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","date":"2025-05-22","arxiv_id":"2505.16400","repositories_listed":0,"syntology":null},{"url":null,"slug":"backdoors-in-drl-four-environments-focusing","title":"Backdoors in DRL: Four Environments Focusing on In-distribution Triggers","date":"2025-05-22","arxiv_id":"2505.17248","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-online-rl-fine-tuning-with-offline","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","date":"2025-05-22","arxiv_id":"2505.16856","repositories_listed":0,"syntology":null},{"url":null,"slug":"incentivizing-dual-process-thinking-for","title":"Incentivizing Dual Process Thinking for Efficient Large Language Model Reasoning","date":"2025-05-22","arxiv_id":"2505.16315","repositories_listed":0,"syntology":null},{"url":null,"slug":"maniplvm-r1-reinforcement-learning-for","title":"ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models","date":"2025-05-22","arxiv_id":"2505.16517","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-with-minimum","title":"Meta-reinforcement learning with minimum attention","date":"2025-05-22","arxiv_id":"2505.16741","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-guarded-safe-reinforcement-learning","title":"Offline Guarded Safe Reinforcement Learning for Medical Treatment Optimization Strategies","date":"2025-05-22","arxiv_id":"2505.16242","repositories_listed":0,"syntology":null},{"url":"/paper/raw2drive-reinforcement-learning-with-aligned","slug":"raw2drive-reinforcement-learning-with-aligned","title":"Raw2Drive: Reinforcement Learning with Aligned World Models for End-to-End Autonomous Driving (in CARLA v2)","date":"2025-05-22","arxiv_id":"2505.16394","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-stock-transactions","title":"Reinforcement Learning for Stock Transactions","date":"2025-05-22","arxiv_id":"2505.16099","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-aware-proto-representations-in","title":"Reward-Aware Proto-Representations in Reinforcement Learning","date":"2025-05-22","arxiv_id":"2505.16217","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-averse-reinforcement-learning-with","title":"Risk-Averse Reinforcement Learning with Itakura-Saito Loss","date":"2025-05-22","arxiv_id":"2505.16925","repositories_listed":0,"syntology":null},{"url":null,"slug":"am-ppo-advantage-alpha-modulation-with","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","date":"2025-05-21","arxiv_id":"2505.15514","repositories_listed":0,"syntology":null},{"url":null,"slug":"filtering-learning-histories-enhances-in","title":"Filtering Learning Histories Enhances In-Context Reinforcement Learning","date":"2025-05-21","arxiv_id":"2505.15143","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-algorithm-feedback-one-shot-sat","title":"Learning from Algorithm Feedback: One-Shot SAT Solver Guidance with GNNs","date":"2025-05-21","arxiv_id":"2505.16053","repositories_listed":0,"syntology":null},{"url":null,"slug":"pass-k-policy-optimization-solving-harder","title":"Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems","date":"2025-05-21","arxiv_id":"2505.15201","repositories_listed":0,"syntology":null},{"url":null,"slug":"reverse-engineering-human-preferences-with","title":"Reverse Engineering Human Preferences with Reinforcement Learning","date":"2025-05-21","arxiv_id":"2505.15795","repositories_listed":0,"syntology":null},{"url":null,"slug":"world-models-as-reference-trajectories-for","title":"World Models as Reference Trajectories for Rapid Motor Adaptation","date":"2025-05-21","arxiv_id":"2505.15589","repositories_listed":0,"syntology":null},{"url":null,"slug":"bellman-operator-convergence-enhancements-in","title":"Bellman operator convergence enhancements in reinforcement learning algorithms","date":"2025-05-20","arxiv_id":"2505.14564","repositories_listed":0,"syntology":null},{"url":null,"slug":"embedded-mean-field-reinforcement-learning","title":"Embedded Mean Field Reinforcement Learning for Perimeter-defense Game","date":"2025-05-20","arxiv_id":"2505.14209","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-efficient-deep-reinforcement-learning","title":"Energy-Efficient Deep Reinforcement Learning with Spiking Transformers","date":"2025-05-20","arxiv_id":"2505.14533","repositories_listed":0,"syntology":null},{"url":null,"slug":"flowq-energy-guided-flow-policies-for-offline","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","date":"2025-05-20","arxiv_id":"2505.14139","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-reinforcement-learning-for-load","title":"Interpretable Reinforcement Learning for Load Balancing using Kolmogorov-Arnold Networks","date":"2025-05-20","arxiv_id":"2505.14459","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-user-feedback","title":"Reinforcement Learning from User Feedback","date":"2025-05-20","arxiv_id":"2505.14946","repositories_listed":0,"syntology":null},{"url":null,"slug":"sharp-synthesizing-high-quality-aligned","title":"SHARP: Synthesizing High-quality Aligned Reasoning Problems for Large Reasoning Models Reinforcement Learning","date":"2025-05-20","arxiv_id":"2505.14147","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-normalized-cut-problem-with","title":"Normalized Cut with Reinforcement Learning in Constrained Action Space","date":"2025-05-20","arxiv_id":"2505.13986","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-reversal-symmetry-for-efficient-robotic","title":"Time Reversal Symmetry for Efficient Robotic Manipulations in Deep Reinforcement Learning","date":"2025-05-20","arxiv_id":"2505.13925","repositories_listed":0,"syntology":null},{"url":null,"slug":"visionary-r1-mitigating-shortcuts-in-visual","title":"Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning","date":"2025-05-20","arxiv_id":"2505.14677","repositories_listed":0,"syntology":null},{"url":null,"slug":"composing-dextrous-grasping-and-in-hand","title":"Composing Dextrous Grasping and In-hand Manipulation via Scoring with a Reinforcement Learning Critic","date":"2025-05-19","arxiv_id":"2505.13253","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-sight-range-selection-in-multi-agent","title":"Dynamic Sight Range Selection in Multi-Agent Reinforcement Learning","date":"2025-05-19","arxiv_id":"2505.12811","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-parameter-control-for-the-1-l-l-ga-on","title":"Multi-parameter Control for the (1+($λ$,$λ$))-GA on OneMax via Deep Reinforcement Learning","date":"2025-05-19","arxiv_id":"2505.12982","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-a-reinforcement-learning-agent","title":"When a Reinforcement Learning Agent Encounters Unknown Unknowns","date":"2025-05-19","arxiv_id":"2505.13188","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-universal-policy-wrapper-with-guarantees","title":"A universal policy wrapper with guarantees","date":"2025-05-18","arxiv_id":"2505.12354","repositories_listed":0,"syntology":null},{"url":null,"slug":"imagination-limited-q-learning-for-offline","title":"Imagination-Limited Q-Learning for Offline Reinforcement Learning","date":"2025-05-18","arxiv_id":"2505.12211","repositories_listed":0,"syntology":null},{"url":null,"slug":"table-r1-region-based-reinforcement-learning","title":"Table-R1: Region-based Reinforcement Learning for Table Understanding","date":"2025-05-18","arxiv_id":"2505.12415","repositories_listed":0,"syntology":null},{"url":null,"slug":"solver-informed-rl-grounding-large-language","title":"Solver-Informed RL: Grounding Large Language Models for Authentic Optimization Modeling","date":"2025-05-17","arxiv_id":"2505.11792","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-10762","title":"Deep Symbolic Optimization: Reinforcement Learning for Symbolic Mathematics","date":"2025-05-16","arxiv_id":"2505.10762","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-10881","title":"Prior-Guided Diffusion Planning for Offline Reinforcement Learning","date":"2025-05-16","arxiv_id":"2505.10881","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-11480","title":"Improving Assembly Code Performance with Large Language Models via Reinforcement Learning","date":"2025-05-16","arxiv_id":"2505.11480","repositories_listed":0,"syntology":null},{"url":"/paper/reinforcement-learning-finetunes-small","slug":"reinforcement-learning-finetunes-small","title":"Reinforcement Learning Finetunes Small Subnetworks in Large Language Models","date":"2025-05-16","arxiv_id":"2505.11711","repositories_listed":0,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":0,"n_instrument":2,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":2,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/reinforcement-learning-finetunes-small#ran","syntology_url":"https://syntology.ai/paper/2505.11711","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2505.11711"}},"official":null}},{"url":null,"slug":"approximated-behavioral-metric-based-state","title":"Approximated Behavioral Metric-based State Projection for Federated Reinforcement Learning","date":"2025-05-15","arxiv_id":"2505.09959","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-adaptation-of-reinforcement","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","date":"2025-05-15","arxiv_id":"2505.10330","repositories_listed":0,"syntology":null},{"url":null,"slug":"fixing-incomplete-value-function","title":"Fixing Incomplete Value Function Decomposition for Multi-Agent Reinforcement Learning","date":"2025-05-15","arxiv_id":"2505.10484","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-for-microgrid","title":"Offline Reinforcement Learning for Microgrid Voltage Regulation","date":"2025-05-15","arxiv_id":"2505.09920","repositories_listed":0,"syntology":null},{"url":null,"slug":"orl-ldm-offline-reinforcement-learning-guided","title":"ORL-LDM: Offline Reinforcement Learning Guided Latent Diffusion Model Super-Resolution Reconstruction","date":"2025-05-15","arxiv_id":"2505.10027","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-complexity-of-distributionally-robust","title":"Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning","date":"2025-05-15","arxiv_id":"2505.10007","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-individual-optimal","title":"Reinforcement Learning for Individual Optimal Policy from Heterogeneous Data","date":"2025-05-14","arxiv_id":"2505.09496","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-practical-introduction-to-deep","title":"A Practical Introduction to Deep Reinforcement Learning","date":"2025-05-13","arxiv_id":"2505.08295","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-security-policy-management-in-cloud","title":"Adaptive Security Policy Management in Cloud Environments Using Reinforcement Learning","date":"2025-05-13","arxiv_id":"2505.08837","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-power-grid","title":"Deep Reinforcement Learning for Power Grid Multi-Stage Cascading Failure Mitigation","date":"2025-05-13","arxiv_id":"2505.09012","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-aerial-combat-tactics-through","title":"Enhancing Aerial Combat Tactics through Hierarchical Multi-Agent Reinforcement Learning","date":"2025-05-13","arxiv_id":"2505.08995","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-theoretical-framework-for-explaining","title":"A Theoretical Framework for Explaining Reinforcement Learning with Shapley Values","date":"2025-05-12","arxiv_id":"2505.07797","repositories_listed":0,"syntology":null}],"record_sha256":"d21bae8534411a4a8a13275cccb478107c78532c23a065a807e1148c96b98626","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}