{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/51","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":51,"pages_in_order":152,"rows_per_page":100,"rows":[5001,5100],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/50","next":"/task/reinforcement-learning-1/papers/52","papers":[{"url":null,"slug":"of-mice-and-machines-a-comparison-of-learning","title":"Of Mice and Machines: A Comparison of Learning Between Real World Mice and RL Agents","date":"2025-05-18","arxiv_id":"2505.12204","repositories_listed":0,"syntology":null},{"url":null,"slug":"resolving-latency-and-inventory-risk-in","title":"Resolving Latency and Inventory Risk in Market Making with Reinforcement Learning","date":"2025-05-18","arxiv_id":"2505.12465","repositories_listed":0,"syntology":null},{"url":null,"slug":"uishift-enhancing-vlm-based-gui-agents","title":"UIShift: Enhancing VLM-based GUI Agents through Self-supervised Reinforcement Learning","date":"2025-05-18","arxiv_id":"2505.12493","repositories_listed":0,"syntology":null},{"url":null,"slug":"adacot-pareto-optimal-adaptive-chain-of","title":"AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning","date":"2025-05-17","arxiv_id":"2505.11896","repositories_listed":0,"syntology":null},{"url":null,"slug":"j1-exploring-simple-test-time-scaling-for-llm","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","date":"2025-05-17","arxiv_id":"2505.11875","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-iterative-self-alignment-for-radiology","title":"Online Iterative Self-Alignment for Radiology Report Generation","date":"2025-05-17","arxiv_id":"2505.11983","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-policy-quantum-enhanced-policy-evaluation","title":"Q-Policy: Quantum-Enhanced Policy Evaluation for Scalable Reinforcement Learning","date":"2025-05-17","arxiv_id":"2505.11862","repositories_listed":0,"syntology":null},{"url":null,"slug":"solver-informed-rl-grounding-large-language","title":"Solver-Informed RL: Grounding Large Language Models for Authentic Optimization Modeling","date":"2025-05-17","arxiv_id":"2505.11792","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-10803","title":"Developing and Integrating Trust Modeling into Multi-Objective Reinforcement Learning for Intelligent Agricultural Management","date":"2025-05-16","arxiv_id":"2505.10803","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-10947","title":"Certifying Stability of Reinforcement Learning Policies using Generalized Lyapunov Functions","date":"2025-05-16","arxiv_id":"2505.10947","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-11081","title":"ShiQ: Bringing back Bellman to LLMs","date":"2025-05-16","arxiv_id":"2505.11081","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-11153","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","date":"2025-05-16","arxiv_id":"2505.11153","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-11227","title":"Is PRM Necessary? Problem-Solving RL Implicitly Induces PRM Capability in LLMs","date":"2025-05-16","arxiv_id":"2505.11227","repositories_listed":0,"syntology":null},{"url":"/paper/reinforcement-learning-finetunes-small","slug":"reinforcement-learning-finetunes-small","title":"Reinforcement Learning Finetunes Small Subnetworks in Large Language Models","date":"2025-05-16","arxiv_id":"2505.11711","repositories_listed":0,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":0,"n_instrument":2,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":2,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/reinforcement-learning-finetunes-small#ran","syntology_url":"https://syntology.ai/paper/2505.11711","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2505.11711"}},"official":null}},{"url":null,"slug":"reinforcement-learning-for-amr-charging","title":"Reinforcement Learning for AMR Charging Decisions: The Impact of Reward and Action Space Design","date":"2025-05-16","arxiv_id":"2505.11136","repositories_listed":0,"syntology":null},{"url":null,"slug":"spectral-policy-optimization-coloring-your","title":"Spectral Policy Optimization: Coloring your Incorrect Reasoning in GRPO","date":"2025-05-16","arxiv_id":"2505.11595","repositories_listed":0,"syntology":null},{"url":null,"slug":"unveiling-the-black-box-a-multi-layer","title":"Unveiling the Black Box: A Multi-Layer Framework for Explaining Reinforcement Learning-Based Cyber Agents","date":"2025-05-16","arxiv_id":"2505.11708","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-adaptation-of-reinforcement","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","date":"2025-05-15","arxiv_id":"2505.10330","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-diffusion-policies-with","title":"Fine-tuning Diffusion Policies with Backpropagation Through Diffusion Timesteps","date":"2025-05-15","arxiv_id":"2505.10482","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-ril-interleaved-reinforcement-and","title":"IN-RIL: Interleaved Reinforcement and Imitation Learning for Policy Fine-Tuning","date":"2025-05-15","arxiv_id":"2505.10442","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-capture-adaptation-and-composition","title":"Knowledge capture, adaptation and composition (KCAC): A framework for cross-task curriculum learning in robotic manipulation","date":"2025-05-15","arxiv_id":"2505.10522","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcing-the-diffusion-chain-of-lateral","title":"Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models","date":"2025-05-15","arxiv_id":"2505.10446","repositories_listed":0,"syntology":null},{"url":null,"slug":"cec-zero-chinese-error-correction-solution","title":"CEC-Zero: Chinese Error Correction Solution Based on LLM","date":"2025-05-14","arxiv_id":"2505.09082","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-individual-optimal","title":"Reinforcement Learning for Individual Optimal Policy from Heterogeneous Data","date":"2025-05-14","arxiv_id":"2505.09496","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-aware-safe-reinforcement-learning-for","title":"Risk-Aware Safe Reinforcement Learning for Control of Stochastic Linear Systems","date":"2025-05-14","arxiv_id":"2505.09734","repositories_listed":0,"syntology":null},{"url":"/paper/tensorrl-qas-reinforcement-learning-with","slug":"tensorrl-qas-reinforcement-learning-with","title":"TensorRL-QAS: Reinforcement learning with tensor networks for scalable quantum architecture search","date":"2025-05-14","arxiv_id":"2505.09371","repositories_listed":0,"syntology":{"n":9,"n_ran":7,"n_constructed":0,"n_ran_checked":7,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":7,"n_pointer_only":1,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 0 violated, 7 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/tensorrl-qas-reinforcement-learning-with#ran","syntology_url":"https://syntology.ai/paper/2505.09371","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2505.09371"}},"official":null}},{"url":null,"slug":"adaptive-diffusion-policy-optimization-for","title":"Adaptive Diffusion Policy Optimization for Robotic Manipulation","date":"2025-05-13","arxiv_id":"2505.08376","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-security-policy-management-in-cloud","title":"Adaptive Security Policy Management in Cloud Environments Using Reinforcement Learning","date":"2025-05-13","arxiv_id":"2505.08837","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-curriculum-learning-for-driving","title":"Automatic Curriculum Learning for Driving Scenarios: Towards Robust and Efficient Reinforcement Learning","date":"2025-05-13","arxiv_id":"2505.08264","repositories_listed":0,"syntology":null},{"url":null,"slug":"dsadf-thinking-fast-and-slow-for-decision","title":"DSADF: Thinking Fast and Slow for Decision Making","date":"2025-05-13","arxiv_id":"2505.08189","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-in-monitored-markov-decision","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","date":"2025-05-13","arxiv_id":"2505.08988","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-unseen-environments-with-language","title":"Modeling Unseen Environments with Language-guided Composable Causal Components in Reinforcement Learning","date":"2025-05-13","arxiv_id":"2505.08361","repositories_listed":0,"syntology":null},{"url":null,"slug":"preference-optimization-for-combinatorial","title":"Preference Optimization for Combinatorial Optimization Problems","date":"2025-05-13","arxiv_id":"2505.08735","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-fault-tolerant","title":"Reinforcement Learning-based Fault-Tolerant Control for Quadrotor with Online Transformer Adaptation","date":"2025-05-13","arxiv_id":"2505.08223","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-multi-agent-reinforcement-learning-1","title":"Scaling Multi Agent Reinforcement Learning for Underwater Acoustic Tracking via Autonomous Vehicles","date":"2025-05-13","arxiv_id":"2505.08222","repositories_listed":0,"syntology":null},{"url":null,"slug":"cache-efficient-posterior-sampling-for","title":"Cache-Efficient Posterior Sampling for Reinforcement Learning with LLM-Derived Priors Across Discrete and Continuous Domains","date":"2025-05-12","arxiv_id":"2505.07274","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-bayesian-inference-and","title":"Combining Bayesian Inference and Reinforcement Learning for Agent Decision Making: A Review","date":"2025-05-12","arxiv_id":"2505.07911","repositories_listed":0,"syntology":null},{"url":null,"slug":"darlr-dual-agent-offline-reinforcement","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","date":"2025-05-12","arxiv_id":"2505.07257","repositories_listed":0,"syntology":null},{"url":null,"slug":"discrete-visual-tokens-of-autoregression-by","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","date":"2025-05-12","arxiv_id":"2505.07538","repositories_listed":0,"syntology":null},{"url":null,"slug":"intellect-2-a-reasoning-model-trained-through","title":"INTELLECT-2: A Reasoning Model Trained Through Globally Decentralized Reinforcement Learning","date":"2025-05-12","arxiv_id":"2505.07291","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-exploratory-multi-asset-mean-variance","title":"The Exploratory Multi-Asset Mean-Variance Portfolio Selection using Reinforcement Learning","date":"2025-05-12","arxiv_id":"2505.07537","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-and-experimental-test-of-datatic","title":"Design and Experimental Test of Datatic Approximate Optimal Filter in Nonlinear Dynamic Systems","date":"2025-05-11","arxiv_id":"2505.07043","repositories_listed":0,"syntology":null},{"url":null,"slug":"facet-force-adaptive-control-via-impedance","title":"FACET: Force-Adaptive Control via Impedance Reference Tracking for Legged Robots","date":"2025-05-11","arxiv_id":"2505.06883","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-value-of-information-towards-joint","title":"Learning Value of Information towards Joint Communication and Control in 6G V2X","date":"2025-05-11","arxiv_id":"2505.06978","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-rl-meets-urban-climate","title":"Reinforcement Learning (RL) Meets Urban Climate Modeling: Investigating the Efficacy and Impacts of RL-Based HVAC Control","date":"2025-05-11","arxiv_id":"2505.07045","repositories_listed":0,"syntology":null},{"url":null,"slug":"x-sim-cross-embodiment-learning-via-real-to","title":"X-Sim: Cross-Embodiment Learning via Real-to-Sim-to-Real","date":"2025-05-11","arxiv_id":"2505.07096","repositories_listed":0,"syntology":null},{"url":null,"slug":"balancing-progress-and-safety-a-novel-risk","title":"Balancing Progress and Safety: A Novel Risk-Aware Objective for RL in Autonomous Driving","date":"2025-05-10","arxiv_id":"2505.06737","repositories_listed":0,"syntology":null},{"url":null,"slug":"refine-af-a-task-agnostic-framework-to-align","title":"REFINE-AF: A Task-Agnostic Framework to Align Language Models via Self-Generated Instructions using Reinforcement Learning from Automated Feedback","date":"2025-05-10","arxiv_id":"2505.06548","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-enhanced-offline-reinforcement-learning","title":"Video-Enhanced Offline Reinforcement Learning: A Model-Based Approach","date":"2025-05-10","arxiv_id":"2505.06482","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-perception-for-tactile-sensing-a-task","title":"Active Perception for Tactile Sensing: A Task-Agnostic Attention-Based Approach","date":"2025-05-09","arxiv_id":"2505.06182","repositories_listed":0,"syntology":null},{"url":null,"slug":"interaction-aware-parameter-privacy","title":"Interaction-Aware Parameter Privacy-Preserving Data Sharing in Coupled Systems via Particle Filter Reinforcement Learning","date":"2025-05-09","arxiv_id":"2505.06122","repositories_listed":0,"syntology":null},{"url":null,"slug":"pretraining-a-shared-q-network-for-data","title":"Pretraining a Shared Q-Network for Data-Efficient Offline Reinforcement Learning","date":"2025-05-09","arxiv_id":"2505.05701","repositories_listed":0,"syntology":null},{"url":null,"slug":"remote-rowhammer-attack-using-adversarial","title":"Remote Rowhammer Attack using Adversarial Observations on Federated Learning Clients","date":"2025-05-09","arxiv_id":"2505.06335","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-reinforcement-learning-for-the","title":"Enhancing Reinforcement Learning for the Floorplanning of Analog ICs with Beam Search","date":"2025-05-08","arxiv_id":"2505.05059","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-embodied-ai-advances-and-future","title":"Multi-agent Embodied AI: Advances and Future Directions","date":"2025-05-08","arxiv_id":"2505.05108","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-corruption-robustness-in-performative","title":"On Corruption-Robustness in Performative Reinforcement Learning","date":"2025-05-08","arxiv_id":"2505.05609","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-game-theoretic","title":"Reinforcement Learning for Game-Theoretic Resource Allocation on Graphs","date":"2025-05-08","arxiv_id":"2505.06319","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-daunce-reinforcement-learning-driven-data","title":"RL-DAUNCE: Reinforcement Learning-Driven Data Assimilation with Uncertainty-Aware Constrained Ensembles","date":"2025-05-08","arxiv_id":"2505.05452","repositories_listed":0,"syntology":null},{"url":null,"slug":"taming-ood-actions-for-offline-reinforcement","title":"Taming OOD Actions for Offline Reinforcement Learning: An Advantage-Based Approach","date":"2025-05-08","arxiv_id":"2505.05126","repositories_listed":0,"syntology":null},{"url":null,"slug":"uspr-learning-a-unified-solver-for-profiled","title":"USPR: Learning a Unified Solver for Profiled Routing","date":"2025-05-08","arxiv_id":"2505.05119","repositories_listed":0,"syntology":null},{"url":null,"slug":"extending-a-quantum-reinforcement-learning","title":"Extending a Quantum Reinforcement Learning Exploration Policy with Flags to Connect Four","date":"2025-05-07","arxiv_id":"2505.04371","repositories_listed":0,"syntology":null},{"url":null,"slug":"fight-fire-with-fire-defending-against","title":"Fight Fire with Fire: Defending Against Malicious RL Fine-Tuning via Reward Neutralization","date":"2025-05-07","arxiv_id":"2505.04578","repositories_listed":0,"syntology":null},{"url":null,"slug":"putting-the-value-back-in-rl-better-test-time","title":"Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers","date":"2025-05-07","arxiv_id":"2505.04842","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-reinforcement-learning-based","title":"Risk-sensitive Reinforcement Learning Based on Convex Scoring Functions","date":"2025-05-07","arxiv_id":"2505.04553","repositories_listed":0,"syntology":null},{"url":null,"slug":"actor-critics-can-achieve-optimal-sample","title":"Actor-Critics Can Achieve Optimal Sample Efficiency","date":"2025-05-06","arxiv_id":"2505.03710","repositories_listed":0,"syntology":null},{"url":null,"slug":"amo-adaptive-motion-optimization-for-hyper","title":"AMO: Adaptive Motion Optimization for Hyper-Dexterous Humanoid Whole-Body Control","date":"2025-05-06","arxiv_id":"2505.03738","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-distributed-proximal-policy","title":"Decentralized Distributed Proximal Policy Optimization (DD-PPO) for High Performance Computing Scheduling on Multi-User Systems","date":"2025-05-06","arxiv_id":"2505.03946","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-network-dqn-multi-agent-reinforcement","title":"Deep Q-Network (DQN) multi-agent reinforcement learning (MARL) for Stock Trading","date":"2025-05-06","arxiv_id":"2505.03949","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-steganographic-potentials-of-language","title":"The Steganographic Potentials of Language Models","date":"2025-05-06","arxiv_id":"2505.03439","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlm-q-learning-aligning-vision-language","title":"VLM Q-Learning: Aligning Vision-Language Models for Interactive Decision-Making","date":"2025-05-06","arxiv_id":"2505.03181","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-hybrid-reward-scheduling-via-large","title":"Automated Hybrid Reward Scheduling via Large Language Models for Robotic Skill Learning","date":"2025-05-05","arxiv_id":"2505.02483","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-phase-estimation-of-human-oscillatory","title":"Online Phase Estimation of Human Oscillatory Motions using Deep Learning","date":"2025-05-05","arxiv_id":"2505.02668","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-potential-of-offline-rl-for","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","date":"2025-05-04","arxiv_id":"2505.02142","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-responsive-object-retrieval-with","title":"Prompt-responsive Object Retrieval with Memory-augmented Student-Teacher Learning","date":"2025-05-04","arxiv_id":"2505.02232","repositories_listed":0,"syntology":null},{"url":null,"slug":"analytic-energy-guided-policy-optimization","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","date":"2025-05-03","arxiv_id":"2505.01822","repositories_listed":0,"syntology":null},{"url":null,"slug":"world-model-based-learning-for-long-term-age","title":"World Model-Based Learning for Long-Term Age of Information Minimization in Vehicular Networks","date":"2025-05-03","arxiv_id":"2505.01712","repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-temporal-difference-learning-via","title":"Stabilizing Temporal Difference Learning via Implicit Stochastic Recursion","date":"2025-05-02","arxiv_id":"2505.01361","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-general-approach-of-automated-environment","title":"A General Approach of Automated Environment Design for Learning the Optimal Power Flow","date":"2025-05-01","arxiv_id":"2505.07832","repositories_listed":0,"syntology":null},{"url":null,"slug":"implicit-neural-representation-learning-for-1","title":"Implicit Neural-Representation Learning for Elastic Deformable-Object Manipulations","date":"2025-05-01","arxiv_id":"2505.00500","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-partial-smiles-validation-scheme","title":"Leveraging Partial SMILES Validation Scheme for Enhanced Drug Design in Reinforcement Learning Frameworks","date":"2025-05-01","arxiv_id":"2505.00530","repositories_listed":0,"syntology":null},{"url":null,"slug":"mule-multi-terrain-and-unknown-load","title":"MULE: Multi-terrain and Unknown Load Adaptation for Effective Quadrupedal Locomotion","date":"2025-05-01","arxiv_id":"2505.00488","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-3d-ui-placement-in-mixed-reality","title":"Adaptive 3D UI Placement in Mixed Reality Using Deep Reinforcement Learning","date":"2025-04-30","arxiv_id":"2504.21731","repositories_listed":0,"syntology":null},{"url":null,"slug":"phi-4-mini-reasoning-exploring-the-limits-of","title":"Phi-4-Mini-Reasoning: Exploring the Limits of Small Reasoning Language Models in Math","date":"2025-04-30","arxiv_id":"2504.21233","repositories_listed":0,"syntology":null},{"url":null,"slug":"phi-4-reasoning-technical-report","title":"Phi-4-reasoning Technical Report","date":"2025-04-30","arxiv_id":"2504.21318","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-mllm-a-survey-on-rl-based","title":"Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models","date":"2025-04-30","arxiv_id":"2504.21277","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-gui-agents-with-foundation-models","title":"A Survey on GUI Agents with Foundation Models Enhanced by Reinforcement Learning","date":"2025-04-29","arxiv_id":"2504.20464","repositories_listed":0,"syntology":null},{"url":null,"slug":"prism-projection-based-reward-integration-for","title":"PRISM: Projection-based Reward Integration for Scene-Aware Real-to-Sim-to-Real Transfer with Few Demonstrations","date":"2025-04-29","arxiv_id":"2504.20520","repositories_listed":0,"syntology":null},{"url":null,"slug":"token-efficient-rl-for-llm-reasoning","title":"Token-Efficient RL for LLM Reasoning","date":"2025-04-29","arxiv_id":"2504.20834","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-recommendation-systems-for-lane-changing","title":"AI Recommendation Systems for Lane-Changing Using Adherence-Aware Reinforcement Learning","date":"2025-04-28","arxiv_id":"2504.20187","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-automated-reinforcement-learning-reward","title":"An Automated Reinforcement Learning Reward Design Framework with Large Language Model for Cooperative Platoon Coordination","date":"2025-04-28","arxiv_id":"2504.19480","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-double-deep-q-network-integrating","title":"Interactive Double Deep Q-network: Integrating Human Interventions and Evaluative Predictions in Reinforcement Learning of Autonomous Driving","date":"2025-04-28","arxiv_id":"2505.01440","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-heterogeneous","title":"Reinforcement Learning-Based Heterogeneous Multi-Task Optimization in Semantic Broadcast Communications","date":"2025-04-28","arxiv_id":"2504.19806","repositories_listed":0,"syntology":null},{"url":null,"slug":"llms-for-engineering-teaching-models-to","title":"LLMs for Engineering: Teaching Models to Design High Powered Rockets","date":"2025-04-27","arxiv_id":"2504.19394","repositories_listed":0,"syntology":null},{"url":null,"slug":"depth-constrained-asv-navigation-with-deep-rl","title":"Depth-Constrained ASV Navigation with Deep RL and Limited Sensing","date":"2025-04-25","arxiv_id":"2504.18253","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-ai-for-uav-mobility-management-a","title":"Explainable AI for UAV Mobility Management: A Deep Q-Network Approach for Handover Minimization","date":"2025-04-25","arxiv_id":"2504.18371","repositories_listed":0,"syntology":null},{"url":null,"slug":"llm-guided-open-ran-empowering-hierarchical","title":"LLM-hRIC: LLM-empowered Hierarchical RAN Intelligent Control for O-RAN","date":"2025-04-25","arxiv_id":"2504.18062","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-learning-based-manipulation-and","title":"Integrating Learning-Based Manipulation and Physics-Based Locomotion for Whole-Body Badminton Robot Control","date":"2025-04-24","arxiv_id":"2504.17771","repositories_listed":0,"syntology":null},{"url":null,"slug":"sapo-rl-sequential-actuator-placement","title":"SAPO-RL: Sequential Actuator Placement Optimization for Fuselage Assembly via Reinforcement Learning","date":"2025-04-24","arxiv_id":"2504.17603","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-large-language-models-to-reason-via","title":"Training Large Language Models to Reason via EM Policy Gradient","date":"2025-04-24","arxiv_id":"2504.18587","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-assimilated-model-based-reinforcement","title":"Data-Assimilated Model-Based Reinforcement Learning for Partially Observed Chaotic Flows","date":"2025-04-23","arxiv_id":"2504.16588","repositories_listed":0,"syntology":null}],"record_sha256":"ccd28d35b3130a2fffa765d5af3cbf4e7b3653117307fac638a68bda280c19b4","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}