{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/55","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":55,"pages_in_order":152,"rows_per_page":100,"rows":[5401,5500],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/54","next":"/task/reinforcement-learning-1/papers/56","papers":[{"url":null,"slug":"rapid-robust-and-agile-planner-using-inverse","title":"RAPID: Robust and Agile Planner Using Inverse Reinforcement Learning for Vision-Based Drone Navigation","date":"2025-02-04","arxiv_id":"2502.02054","repositories_listed":0,"syntology":null},{"url":null,"slug":"volleybots-a-testbed-for-multi-drone","title":"VolleyBots: A Testbed for Multi-Drone Volleyball Game Combining Motion Control and Strategic Play","date":"2025-02-04","arxiv_id":"2502.01932","repositories_listed":0,"syntology":null},{"url":null,"slug":"acecoder-acing-coder-rl-via-automated-test","title":"ACECODER: Acing Coder RL via Automated Test-Case Synthesis","date":"2025-02-03","arxiv_id":"2502.01718","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-object-goal-pushing-with-mobile","title":"Dynamic object goal pushing with mobile manipulators through model-free constrained reinforcement learning","date":"2025-02-03","arxiv_id":"2502.01546","repositories_listed":0,"syntology":null},{"url":null,"slug":"preference-vlm-leveraging-vlms-for-scalable","title":"Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning","date":"2025-02-03","arxiv_id":"2502.01616","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-long-horizon","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","date":"2025-02-03","arxiv_id":"2502.01600","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-segment-feedback","title":"Reinforcement Learning with Segment Feedback","date":"2025-02-03","arxiv_id":"2502.01876","repositories_listed":0,"syntology":null},{"url":null,"slug":"resilient-uav-trajectory-planning-via-few","title":"Resilient UAV Trajectory Planning via Few-Shot Meta-Offline Reinforcement Learning","date":"2025-02-03","arxiv_id":"2502.01268","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-differences-between-direct-alignment","title":"The Differences Between Direct Alignment Algorithms are a Blur","date":"2025-02-03","arxiv_id":"2502.01237","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-task-generalization-via-memory","title":"Toward Task Generalization via Memory Augmentation in Meta-Reinforcement Learning","date":"2025-02-03","arxiv_id":"2502.01521","repositories_listed":0,"syntology":null},{"url":null,"slug":"zeroth-order-informed-fine-tuning-for","title":"Zeroth-order Informed Fine-Tuning for Diffusion Model: A Recursive Likelihood Ratio Optimizer","date":"2025-02-02","arxiv_id":"2502.00639","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-differentiated-reward-method-for","title":"A Differentiated Reward Method for Reinforcement Learning based Multi-Vehicle Cooperative Decision-Making Algorithms","date":"2025-02-01","arxiv_id":"2502.00352","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-suboptimal-data-in-continuous","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","date":"2025-02-01","arxiv_id":"2502.00288","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-predictive-control-introductory","title":"Model-Free Predictive Control: Introductory Algebraic Calculations, and a Comparison with HEOL and ANNs","date":"2025-02-01","arxiv_id":"2502.00443","repositories_listed":0,"syntology":null},{"url":null,"slug":"decorrelated-soft-actor-critic-for-efficient","title":"Decorrelated Soft Actor-Critic for Efficient Deep Reinforcement Learning","date":"2025-01-31","arxiv_id":"2501.19133","repositories_listed":0,"syntology":null},{"url":null,"slug":"o-mapl-offline-multi-agent-preference","title":"O-MAPL: Offline Multi-agent Preference Learning","date":"2025-01-31","arxiv_id":"2501.18944","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-job-allocation-using-reinforcement","title":"Optimizing Job Allocation using Reinforcement Learning with Graph Neural Networks","date":"2025-01-31","arxiv_id":"2501.19063","repositories_listed":0,"syntology":null},{"url":null,"slug":"rls3-rl-based-synthetic-sample-selection-to","title":"RLS3: RL-Based Synthetic Sample Selection to Enhance Spatial Reasoning in Vision-Language Models for Indoor Autonomous Perception","date":"2025-01-31","arxiv_id":"2501.18880","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-physiologically-sensible-predictions","title":"Towards Physiologically Sensible Predictions via the Rule-based Reinforcement Learning Layer","date":"2025-01-31","arxiv_id":"2501.19055","repositories_listed":0,"syntology":null},{"url":null,"slug":"b3c-a-minimalist-approach-to-offline-multi","title":"B3C: A Minimalist Approach to Offline Multi-Agent Reinforcement Learning","date":"2025-01-30","arxiv_id":"2501.18138","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-rl-agents-demonstrate-system-1","title":"Model-Free RL Agents Demonstrate System 1-Like Intentionality","date":"2025-01-30","arxiv_id":"2501.18299","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dual-agent-adversarial-framework-for-robust","title":"A Dual-Agent Adversarial Framework for Robust Generalization in Deep Reinforcement Learning","date":"2025-01-29","arxiv_id":"2501.17384","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-sparse-to-dense-toddler-inspired-reward","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","date":"2025-01-29","arxiv_id":"2501.17842","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-portfolio-allocation","title":"Reinforcement-Learning Portfolio Allocation with Dynamic Embedding of Market Information","date":"2025-01-29","arxiv_id":"2501.17992","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-based-query-rewriting-with-distilled-llm","title":"RL-based Query Rewriting with Distilled LLM for online E-Commerce Systems","date":"2025-01-29","arxiv_id":"2501.18056","repositories_listed":0,"syntology":null},{"url":null,"slug":"challenges-in-ensuring-ai-safety-in-deepseek","title":"Challenges in Ensuring AI Safety in DeepSeek-R1 Models: The Shortcomings of Reinforcement Learning Strategies","date":"2025-01-28","arxiv_id":"2501.17030","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploratory-mean-variance-portfolio","title":"Exploratory Mean-Variance Portfolio Optimization with Regime-Switching Market Dynamics","date":"2025-01-28","arxiv_id":"2501.16659","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneity-aware-personalized-federated","title":"Heterogeneity-aware Personalized Federated Learning via Adaptive Dual-Agent Reinforcement Learning","date":"2025-01-28","arxiv_id":"2501.16966","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-vision-language-action-model-with","title":"Improving Vision-Language-Action Model with Online Reinforcement Learning","date":"2025-01-28","arxiv_id":"2501.16664","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-reinforcement-learning-and-ai","title":"Integrating Reinforcement Learning and AI Agents for Adaptive Robotic Interaction and Assistance in Dementia Care","date":"2025-01-28","arxiv_id":"2501.17206","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-for-real-world","title":"Safe Reinforcement Learning for Real-World Engine Control","date":"2025-01-28","arxiv_id":"2501.16613","repositories_listed":0,"syntology":null},{"url":null,"slug":"sft-memorizes-rl-generalizes-a-comparative","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","date":"2025-01-28","arxiv_id":"2501.17161","repositories_listed":0,"syntology":null},{"url":null,"slug":"flexible-blood-glucose-control-offline","title":"Flexible Blood Glucose Control: Offline Reinforcement Learning from Human Feedback","date":"2025-01-27","arxiv_id":"2501.15972","repositories_listed":0,"syntology":null},{"url":null,"slug":"fuzzylight-a-robust-two-stage-fuzzy-approach","title":"FuzzyLight: A Robust Two-Stage Fuzzy Approach for Traffic Signal Control Works in Real Cities","date":"2025-01-27","arxiv_id":"2501.15820","repositories_listed":0,"syntology":null},{"url":null,"slug":"mpc4rl-a-software-package-for-reinforcement","title":"MPC4RL -- A Software Package for Reinforcement Learning based on Model Predictive Control","date":"2025-01-27","arxiv_id":"2501.15897","repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-experience-sharing-in-reinforcement","title":"Selective Experience Sharing in Reinforcement Learning Enhances Interference Management","date":"2025-01-27","arxiv_id":"2501.15735","repositories_listed":0,"syntology":null},{"url":"/paper/towards-general-purpose-model-free","slug":"towards-general-purpose-model-free","title":"Towards General-Purpose Model-Free Reinforcement Learning","date":"2025-01-27","arxiv_id":"2501.16142","repositories_listed":0,"syntology":{"n":9,"n_ran":5,"n_constructed":4,"n_ran_checked":4,"n_instrument":1,"n_unverified":4,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":4,"phrase":"5 ran (of which 4 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 1 where Syntology's instrument failed) · 4 unverified","sample_list":"/paper/towards-general-purpose-model-free#ran","syntology_url":"https://syntology.ai/paper/2501.16142","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2501.16142"}},"official":null}},{"url":null,"slug":"learning-enhanced-safeguard-control-for-high","title":"Learning-Enhanced Safeguard Control for High-Relative-Degree Systems: Robust Optimization under Disturbances and Faults","date":"2025-01-26","arxiv_id":"2501.15373","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-center-cooling-system-optimization-using","title":"Data Center Cooling System Optimization Using Offline Reinforcement Learning","date":"2025-01-25","arxiv_id":"2501.15085","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-machine-translation-ensembling-with","title":"Faster Machine Translation Ensembling with Reinforcement Learning and Competitive Correction","date":"2025-01-25","arxiv_id":"2501.15219","repositories_listed":0,"syntology":null},{"url":null,"slug":"age-and-power-minimization-via-meta-deep","title":"Age and Power Minimization via Meta-Deep Reinforcement Learning in UAV Networks","date":"2025-01-24","arxiv_id":"2501.14603","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinating-ride-pooling-with-public-transit","title":"Coordinating Ride-Pooling with Public Transit using Reward-Guided Conservative Q-Learning: An Offline Training and Online Fine-Tuning Reinforcement Learning Framework","date":"2025-01-24","arxiv_id":"2501.14199","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-efficient-multi-objective","title":"Towards Efficient Multi-Objective Optimisation for Real-World Power Grid Topology Control","date":"2025-01-24","arxiv_id":"2502.00034","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-language-model-driven-policy","title":"Large Language Model driven Policy Exploration for Recommender Systems","date":"2025-01-23","arxiv_id":"2501.13816","repositories_listed":0,"syntology":null},{"url":null,"slug":"adawm-adaptive-world-model-based-planning-for","title":"AdaWM: Adaptive World Model based Planning for Autonomous Driving","date":"2025-01-22","arxiv_id":"2501.13072","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-hybrid","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","date":"2025-01-22","arxiv_id":"2501.12627","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolution-and-the-knightian-blindspot-of","title":"Evolution and The Knightian Blindspot of Machine Learning","date":"2025-01-22","arxiv_id":"2501.13075","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-technology-landscape-through","title":"Exploring the Technology Landscape through Topic Modeling, Expert Involvement, and Reinforcement Learning","date":"2025-01-22","arxiv_id":"2501.13252","repositories_listed":0,"syntology":null},{"url":null,"slug":"mona-myopic-optimization-with-non-myopic","title":"MONA: Myopic Optimization with Non-myopic Approval Can Mitigate Multi-step Reward Hacking","date":"2025-01-22","arxiv_id":"2501.13011","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-generalization-and-distributional-update","title":"On Generalization and Distributional Update for Mimicking Observations with Adequate Exploration","date":"2025-01-22","arxiv_id":"2501.12785","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-automated-design","title":"Reinforcement learning Based Automated Design of Differential Evolution Algorithm for Black-box Optimization","date":"2025-01-22","arxiv_id":"2501.12881","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-combinatorial-generalization-in","title":"State Combinatorial Generalization In Decision Making With Conditional Diffusion Models","date":"2025-01-22","arxiv_id":"2501.13241","repositories_listed":0,"syntology":null},{"url":null,"slug":"extend-adversarial-policy-against-neural","title":"Extend Adversarial Policy Against Neural Machine Translation via Unknown Token","date":"2025-01-21","arxiv_id":"2501.12183","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-constrained-beam","title":"Reinforcement Learning Constrained Beam Search for Parameter Optimization of Paper Drying Under Flexible Constraints","date":"2025-01-21","arxiv_id":"2501.12542","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-rc-dot-a-block-level-rl-agent-for-task","title":"RL-RC-DoT: A Block-level RL agent for Task-Aware Video Compression","date":"2025-01-21","arxiv_id":"2501.12216","repositories_listed":0,"syntology":null},{"url":null,"slug":"redstar-does-scaling-long-cot-data-unlock","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","date":"2025-01-20","arxiv_id":"2501.11284","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-finite-horizon-mdps-via-low-rank","title":"Solving Finite-Horizon MDPs via Low-Rank Tensors","date":"2025-01-17","arxiv_id":"2501.10598","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-explainability-to-interpretability","title":"From Explainability to Interpretability: Interpretable Policies in Reinforcement Learning Via Model Explanation","date":"2025-01-16","arxiv_id":"2501.09858","repositories_listed":0,"syntology":null},{"url":null,"slug":"re-pose-synergizing-reinforcement-learning","title":"RE-POSE: Synergizing Reinforcement Learning-Based Partitioning and Offloading for Edge Object Detection","date":"2025-01-16","arxiv_id":"2501.09465","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-large-reasoning-models-a-survey-of","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","date":"2025-01-16","arxiv_id":"2501.09686","repositories_listed":0,"syntology":null},{"url":null,"slug":"average-reward-reinforcement-learning-with-3","title":"Average-Reward Reinforcement Learning with Entropy Regularization","date":"2025-01-15","arxiv_id":"2501.09080","repositories_listed":0,"syntology":null},{"url":null,"slug":"projection-implicit-q-learning-with-support","title":"Projection Implicit Q-Learning with Support Constraint for Offline Reinforcement Learning","date":"2025-01-15","arxiv_id":"2501.08907","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-enhanced-procedural","title":"Reinforcement Learning-Enhanced Procedural Generation for Dynamic Narrative-Driven AR Experiences","date":"2025-01-15","arxiv_id":"2501.08552","repositories_listed":0,"syntology":null},{"url":null,"slug":"decision-transformers-for-ris-assisted","title":"Decision Transformers for RIS-Assisted Systems with Diffusion Model-Based Channel Acquisition","date":"2025-01-14","arxiv_id":"2501.08007","repositories_listed":0,"syntology":null},{"url":null,"slug":"fdpp-fine-tune-diffusion-policy-with-human","title":"FDPP: Fine-tune Diffusion Policy with Human Preference","date":"2025-01-14","arxiv_id":"2501.08259","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-action-based-reinforcement-learning","title":"Hybrid Action Based Reinforcement Learning for Multi-Objective Compatible Autonomous Driving","date":"2025-01-14","arxiv_id":"2501.08096","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-llm-decision-and-rl-action","title":"Combining LLM decision and RL action selection to improve RL policy for adaptive interventions","date":"2025-01-13","arxiv_id":"2501.06980","repositories_listed":0,"syntology":null},{"url":null,"slug":"future-conditioned-recommendations-with-multi","title":"Future-Conditioned Recommendations with Multi-Objective Controllable Decision Transformer","date":"2025-01-13","arxiv_id":"2501.07212","repositories_listed":0,"syntology":null},{"url":null,"slug":"rbrl2-0-integrated-reward-and-policy-learning","title":"RbRL2.0: Integrated Reward and Policy Learning for Rating-based Reinforcement Learning","date":"2025-01-13","arxiv_id":"2501.07502","repositories_listed":0,"syntology":null},{"url":null,"slug":"average-reward-reinforcement-learning-for","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","date":"2025-01-12","arxiv_id":"2501.06700","repositories_listed":0,"syntology":null},{"url":null,"slug":"drdt3-diffusion-refined-decision-test-time","title":"DRDT3: Diffusion-Refined Decision Test-Time Training Model","date":"2025-01-12","arxiv_id":"2501.06718","repositories_listed":0,"syntology":null},{"url":null,"slug":"pareto-set-learning-for-multi-objective","title":"Pareto Set Learning for Multi-Objective Reinforcement Learning","date":"2025-01-12","arxiv_id":"2501.06773","repositories_listed":0,"syntology":null},{"url":null,"slug":"algopilot-fully-autonomous-program-synthesis","title":"AlgoPilot: Fully Autonomous Program Synthesis Without Human-Written Programs","date":"2025-01-11","arxiv_id":"2501.06423","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-for-11","title":"Hierarchical Reinforcement Learning for Optimal Agent Grouping in Cooperative Systems","date":"2025-01-11","arxiv_id":"2501.06554","repositories_listed":0,"syntology":null},{"url":null,"slug":"counterfactually-fair-reinforcement-learning","title":"Counterfactually Fair Reinforcement Learning via Sequential Data Preprocessing","date":"2025-01-10","arxiv_id":"2501.06366","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-models-for-smarter-uavs-decision","title":"Diffusion Models for Smarter UAVs: Decision-Making and Modeling","date":"2025-01-10","arxiv_id":"2501.05819","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-the-impact-of-observation-space","title":"Investigating the Impact of Observation Space Design Choices On Training Reinforcement Learning Solutions for Spacecraft Problems","date":"2025-01-10","arxiv_id":"2501.06016","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-integrated-dispatching-and-idle","title":"Real-Time Integrated Dispatching and Idle Fleet Steering with Deep Reinforcement Learning for A Meal Delivery Platform","date":"2025-01-10","arxiv_id":"2501.05808","repositories_listed":0,"syntology":null},{"url":null,"slug":"learningflow-automated-policy-learning","title":"LearningFlow: Automated Policy Learning Workflow for Urban Driving with Large Language Models","date":"2025-01-09","arxiv_id":"2501.05057","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-transfer-q-learning-for-offline-non","title":"Deep Transfer $Q$-Learning for Offline Non-Stationary Reinforcement Learning","date":"2025-01-08","arxiv_id":"2501.04870","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-averse-policies-for-natural-gas-futures","title":"Risk-averse policies for natural gas futures trading using distributional reinforcement learning","date":"2025-01-08","arxiv_id":"2501.04421","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-with-minimal","title":"Safe Reinforcement Learning with Minimal Supervision","date":"2025-01-08","arxiv_id":"2501.04481","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-reinforcement-learning-via","title":"Explainable Reinforcement Learning via Temporal Policy Decomposition","date":"2025-01-07","arxiv_id":"2501.03902","repositories_listed":0,"syntology":null},{"url":null,"slug":"run-and-tumble-chemotaxis-using-reinforcement","title":"Run-and-tumble chemotaxis using reinforcement learning","date":"2025-01-07","arxiv_id":"2501.03687","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-recognition-of-fused-magnesium","title":"Interpretable Recognition of Fused Magnesium Furnace Working Conditions with Deep Convolutional Stochastic Configuration Networks","date":"2025-01-06","arxiv_id":"2501.02740","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-a-flexible-exploration-model-for","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","date":"2025-01-06","arxiv_id":"2501.02774","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-interpretation-of-the-certainty","title":"A New Interpretation of the Certainty-Equivalence Approach for PAC Reinforcement Learning with a Generative Model","date":"2025-01-05","arxiv_id":"2501.02652","repositories_listed":0,"syntology":null},{"url":null,"slug":"amm-adaptive-modularized-reinforcement-model","title":"AMM: Adaptive Modularized Reinforcement Model for Multi-city Traffic Signal Control","date":"2025-01-05","arxiv_id":"2501.02548","repositories_listed":0,"syntology":null},{"url":null,"slug":"sr-reward-taking-the-path-more-traveled","title":"SR-Reward: Taking The Path More Traveled","date":"2025-01-04","arxiv_id":"2501.02330","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-statistical-complexity-for-offline-and","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","date":"2025-01-03","arxiv_id":"2501.02089","repositories_listed":0,"syntology":null},{"url":null,"slug":"proposing-hierarchical-goal-conditioned","title":"Proposing Hierarchical Goal-Conditioned Policy Planning in Multi-Goal Reinforcement Learning","date":"2025-01-03","arxiv_id":"2501.01727","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-graphical-approach-to-state-variable","title":"A Graphical Approach to State Variable Selection in Off-policy Learning","date":"2025-01-01","arxiv_id":"2501.00854","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-motion-simulator-pushing-the-limit-of-1","title":"Neural Motion Simulator Pushing the Limit of World Models in Reinforcement Learning","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rass-improving-denoising-diffusion-samplers","title":"RaSS: Improving Denoising Diffusion Samplers with Reinforced Active Sampling Scheduler","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"texttt-form-learning-expressive-and","title":"FORM: Learning Expressive and Transferable First-Order Logic Reward Machines","date":"2024-12-31","arxiv_id":"2501.00364","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-unraveling-and-improving","title":"Towards Unraveling and Improving Generalization in World Models","date":"2024-12-31","arxiv_id":"2501.00195","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-unsupervised-anomaly-detection-in","title":"An Unsupervised Anomaly Detection in Electricity Consumption Using Reinforcement Learning and Time Series Forest Based Framework","date":"2024-12-30","arxiv_id":"2501.00107","repositories_listed":0,"syntology":null},{"url":null,"slug":"isoperimetry-is-all-we-need-langevin","title":"Isoperimetry is All We Need: Langevin Posterior Sampling for RL with Sublinear Regret","date":"2024-12-30","arxiv_id":"2412.20824","repositories_listed":0,"syntology":null},{"url":null,"slug":"unrealzoo-enriching-photo-realistic-virtual","title":"UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI","date":"2024-12-30","arxiv_id":"2412.20977","repositories_listed":0,"syntology":null},{"url":null,"slug":"weber-fechner-law-in-temporal-difference","title":"Weber-Fechner Law in Temporal Difference learning derived from Control as Inference","date":"2024-12-30","arxiv_id":"2412.21004","repositories_listed":0,"syntology":null}],"record_sha256":"9c7c118da0481bcbfce7b4b05194a48dff46b26f5aec0e79e1964b9721909c68","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}