{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/49","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":49,"pages_in_order":132,"rows_per_page":100,"rows":[4801,4900],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/48","next":"/task/reinforcement-learning/papers/50","papers":[{"url":null,"slug":"explore-reinforced-equilibrium-approximation","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","date":"2024-12-02","arxiv_id":"2412.02016","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-adaptation-of-reinforcement-learning","title":"Task Adaptation of Reinforcement Learning-based NAS Agents through Transfer Learning","date":"2024-12-02","arxiv_id":"2412.01420","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-type-agnostic-cyber-defense-agents","title":"Towards Type Agnostic Cyber Defense Agents","date":"2024-12-02","arxiv_id":"2412.01542","repositories_listed":0,"syntology":null},{"url":null,"slug":"bilinear-convolution-decomposition-for-causal","title":"Bilinear Convolution Decomposition for Causal RL Interpretability","date":"2024-12-01","arxiv_id":"2412.00944","repositories_listed":0,"syntology":null},{"url":null,"slug":"mean-field-sampling-for-cooperative-multi","title":"Mean-Field Sampling for Cooperative Multi-Agent Reinforcement Learning","date":"2024-12-01","arxiv_id":"2412.00661","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-poisoning-attack-against-reinforcement","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","date":"2024-12-01","arxiv_id":"2412.00797","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-partially-observable-reinforcement","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","date":"2024-12-01","arxiv_id":"2412.00985","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-of-robot-locomotion","title":"Improving generalization of robot locomotion policies via Sharpness-Aware Reinforcement Learning","date":"2024-11-29","arxiv_id":"2411.19732","repositories_listed":0,"syntology":null},{"url":null,"slug":"proto-successor-measure-representing-the","title":"Proto Successor Measure: Representing the Space of All Possible Solutions of Reinforcement Learning","date":"2024-11-29","arxiv_id":"2411.19418","repositories_listed":0,"syntology":null},{"url":null,"slug":"comprehensive-survey-of-reinforcement","title":"A Comprehensive Survey of Reinforcement Learning: From Algorithms to Practical Challenges","date":"2024-11-28","arxiv_id":"2411.18892","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-soft-actor-critic-algorithms","title":"Application of Soft Actor-Critic Algorithms in Optimizing Wastewater Treatment with Time Delays Integration","date":"2024-11-27","arxiv_id":"2411.18305","repositories_listed":0,"syntology":null},{"url":null,"slug":"dependency-aware-cav-task-scheduling-via","title":"Dependency-Aware CAV Task Scheduling via Diffusion-Based Reinforcement Learning","date":"2024-11-27","arxiv_id":"2411.18230","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-non-prehensile-object-transport-via","title":"Dynamic Non-Prehensile Object Transport via Model-Predictive Reinforcement Learning","date":"2024-11-27","arxiv_id":"2412.00086","repositories_listed":0,"syntology":null},{"url":null,"slug":"elemental-interactive-learning-from","title":"ELEMENTAL: Interactive Learning from Demonstrations and Vision-Language Models for Reward Design in Robotics","date":"2024-11-27","arxiv_id":"2411.18825","repositories_listed":0,"syntology":null},{"url":null,"slug":"bpp-search-enhancing-tree-of-thought","title":"BPP-Search: Enhancing Tree of Thought Reasoning for Mathematical Modeling Problem Solving","date":"2024-11-26","arxiv_id":"2411.17404","repositories_listed":0,"syntology":null},{"url":null,"slug":"crash-challenging-reinforcement-learning","title":"CRASH: Challenging Reinforcement-Learning Based Adversarial Scenarios For Safety Hardening","date":"2024-11-26","arxiv_id":"2411.16996","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensuring-safety-in-target-pursuit-control-a","title":"Ensuring Safety in Target Pursuit Control: A CBF-Safe Reinforcement Learning Approach","date":"2024-11-26","arxiv_id":"2411.17552","repositories_listed":0,"syntology":null},{"url":null,"slug":"broad-critic-deep-actor-reinforcement","title":"Broad Critic Deep Actor Reinforcement Learning for Continuous Control","date":"2024-11-24","arxiv_id":"2411.15806","repositories_listed":0,"syntology":null},{"url":null,"slug":"partial-identifiability-and-misspecification","title":"Partial Identifiability and Misspecification in Inverse Reinforcement Learning","date":"2024-11-24","arxiv_id":"2411.15951","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-enhanced-genetic","title":"Reinforcement learning-enhanced genetic algorithm for wind farm layout optimization","date":"2024-11-24","arxiv_id":"2412.06803","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-molecular-design-through-graph","title":"Enhancing Molecular Design through Graph-based Topological Reinforcement Learning","date":"2024-11-22","arxiv_id":"2411.14726","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-multi-agent-inverse-reinforcement-learning","title":"On Multi-Agent Inverse Reinforcement Learning","date":"2024-11-22","arxiv_id":"2411.15046","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-prediction-models-with","title":"Enhancing Prediction Models with Reinforcement Learning","date":"2024-11-21","arxiv_id":"2412.06791","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-action-manipulation-attack","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","date":"2024-11-20","arxiv_id":"2411.13116","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-collusion-and-the-folk","title":"Reinforcement Learning, Collusion, and the Folk Theorem","date":"2024-11-19","arxiv_id":"2411.12725","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-action-sequence","title":"Coarse-to-fine Q-Network with Action Sequence for Data-Efficient Robot Learning","date":"2024-11-19","arxiv_id":"2411.12155","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-and-optimization-of-multi-rendezvous","title":"Design And Optimization Of Multi-rendezvous Manoeuvres Based On Reinforcement Learning And Convex Optimization","date":"2024-11-18","arxiv_id":"2411.11778","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-regret-exploration-in-shuffle-private","title":"No-regret Exploration in Shuffle Private Reinforcement Learning","date":"2024-11-18","arxiv_id":"2411.11647","repositories_listed":0,"syntology":null},{"url":null,"slug":"preserving-expert-level-privacy-in-offline","title":"Preserving Expert-Level Privacy in Offline Reinforcement Learning","date":"2024-11-18","arxiv_id":"2411.13598","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-free-reinforcement-learning-for-ltl","title":"Regret-Free Reinforcement Learning for LTL Specifications","date":"2024-11-18","arxiv_id":"2411.12019","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-under-diffusion","title":"Robust Reinforcement Learning under Diffusion Models for Data with Jumps","date":"2024-11-18","arxiv_id":"2411.11697","repositories_listed":0,"syntology":null},{"url":null,"slug":"theoretical-corrections-and-the-leveraging-of","title":"Theoretical Corrections and the Leveraging of Reinforcement Learning to Enhance Triangle Attack","date":"2024-11-18","arxiv_id":"2411.12071","repositories_listed":0,"syntology":null},{"url":null,"slug":"upside-down-reinforcement-learning-for-more","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","date":"2024-11-18","arxiv_id":"2411.11457","repositories_listed":0,"syntology":null},{"url":null,"slug":"financial-news-driven-llm-reinforcement","title":"Financial News-Driven LLM Reinforcement Learning for Portfolio Management","date":"2024-11-17","arxiv_id":"2411.11059","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-relative-over-generalization-in","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","date":"2024-11-17","arxiv_id":"2411.11099","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-low-regret-online-reinforcement","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","date":"2024-11-16","arxiv_id":"2411.10906","repositories_listed":0,"syntology":null},{"url":null,"slug":"stable-continual-reinforcement-learning-via","title":"Stable Continual Reinforcement Learning via Diffusion-based Trajectory Replay","date":"2024-11-16","arxiv_id":"2411.10809","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-risk-sensitive-contract-unified","title":"A Risk Sensitive Contract-unified Reinforcement Learning Approach for Option Hedging","date":"2024-11-14","arxiv_id":"2411.09659","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-reinforcement-learning-for","title":"Enhancing reinforcement learning for population setpoint tracking in co-cultures","date":"2024-11-14","arxiv_id":"2411.09177","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-batch-reinforcement-learning-via","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","date":"2024-11-14","arxiv_id":"2411.09722","repositories_listed":0,"syntology":null},{"url":null,"slug":"rationality-based-innate-values-driven","title":"Innate-Values-driven Reinforcement Learning based Cognitive Modeling","date":"2024-11-14","arxiv_id":"2411.09160","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-disentanglers-on-random-unitary","title":"Reinforced Disentanglers on Random Unitary Circuits","date":"2024-11-14","arxiv_id":"2411.09784","repositories_listed":0,"syntology":null},{"url":null,"slug":"bamax-backtrack-assisted-multi-agent","title":"BAMAX: Backtrack Assisted Multi-Agent Exploration using Reinforcement Learning","date":"2024-11-13","arxiv_id":"2411.08400","repositories_listed":0,"syntology":null},{"url":null,"slug":"code-mixed-llm-improve-large-language-models","title":"Code-mixed LLM: Improve Large Language Models' Capability to Handle Code-Mixing through Reinforcement Learning from AI Feedback","date":"2024-11-13","arxiv_id":"2411.09073","repositories_listed":0,"syntology":null},{"url":null,"slug":"liner-shipping-network-design-with","title":"Liner Shipping Network Design with Reinforcement Learning","date":"2024-11-13","arxiv_id":"2411.09068","repositories_listed":0,"syntology":null},{"url":null,"slug":"r3hf-reward-redistribution-for-enhancing","title":"R3HF: Reward Redistribution for Enhancing Reinforcement Learning from Human Feedback","date":"2024-11-13","arxiv_id":"2411.08302","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlinspect-an-interactive-visual-approach-to","title":"RLInspect: An Interactive Visual Approach to Assess Reinforcement Learning Algorithm","date":"2024-11-13","arxiv_id":"2411.08392","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-multi-agent-reinforcement-learning","title":"Exploring Multi-Agent Reinforcement Learning for Unrelated Parallel Machine Scheduling","date":"2024-11-12","arxiv_id":"2411.07634","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-framework-for-1","title":"Reinforcement Learning Framework for Quantitative Trading","date":"2024-11-12","arxiv_id":"2411.07585","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-offline-reinforcement-learning-for-non","title":"Robust Offline Reinforcement Learning for Non-Markovian Decision Processes","date":"2024-11-12","arxiv_id":"2411.07514","repositories_listed":0,"syntology":null},{"url":null,"slug":"identifying-differential-patient-care-through","title":"Identifying Differential Patient Care Through Inverse Intent Inference","date":"2024-11-11","arxiv_id":"2411.07372","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-hop-upstream-preemptive-traffic-signal","title":"Multi-hop Upstream Anticipatory Traffic Signal Control with Deep Reinforcement Learning","date":"2024-11-10","arxiv_id":"2411.07271","repositories_listed":0,"syntology":null},{"url":null,"slug":"offlight-an-offline-multi-agent-reinforcement","title":"OffLight: An Offline Multi-Agent Reinforcement Learning Framework for Traffic Signal Control","date":"2024-11-10","arxiv_id":"2411.06601","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-execution-with-reinforcement-learning","title":"Optimal Execution with Reinforcement Learning","date":"2024-11-10","arxiv_id":"2411.06389","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-digital-twin","title":"Deep Reinforcement Learning for Digital Twin-Oriented Complex Networked Systems","date":"2024-11-09","arxiv_id":"2411.06148","repositories_listed":0,"syntology":null},{"url":null,"slug":"acceleration-for-deep-reinforcement-learning","title":"Acceleration for Deep Reinforcement Learning using Parallel and Distributed Computing: A Survey","date":"2024-11-08","arxiv_id":"2411.05614","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-world-offline-reinforcement-learning-1","title":"Real-World Offline Reinforcement Learning from Vision Language Model Feedback","date":"2024-11-08","arxiv_id":"2411.05273","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-adaptive-resource","title":"Reinforcement Learning for Adaptive Resource Scheduling in Complex System Environments","date":"2024-11-08","arxiv_id":"2411.05346","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-active-flow-control-strategies","title":"Towards Active Flow Control Strategies Through Deep Reinforcement Learning","date":"2024-11-08","arxiv_id":"2411.05536","repositories_listed":0,"syntology":null},{"url":null,"slug":"tract-rlformer-a-tract-specific-rl-policy","title":"Tract-RLFormer: A Tract-Specific RL policy based Decoder-only Transformer Network","date":"2024-11-08","arxiv_id":"2411.05757","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-robustness-of-reinforcement","title":"Evaluating Robustness of Reinforcement Learning Algorithms for Autonomous Shipping","date":"2024-11-07","arxiv_id":"2411.04915","repositories_listed":0,"syntology":null},{"url":null,"slug":"harnessing-the-power-of-gradient-based","title":"Harnessing the Power of Gradient-Based Simulations for Multi-Objective Optimization in Particle Accelerators","date":"2024-11-07","arxiv_id":"2411.04817","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-dialogue-agents-via-reinforcement","title":"Interactive Dialogue Agents via Reinforcement Learning on Hindsight Regenerations","date":"2024-11-07","arxiv_id":"2411.05194","repositories_listed":0,"syntology":null},{"url":null,"slug":"performative-reinforcement-learning-with","title":"Performative Reinforcement Learning with Linear Markov Decision Process","date":"2024-11-07","arxiv_id":"2411.05234","repositories_listed":0,"syntology":null},{"url":null,"slug":"plasticity-loss-in-deep-reinforcement","title":"Plasticity Loss in Deep Reinforcement Learning: A Survey","date":"2024-11-07","arxiv_id":"2411.04832","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-equivariance-in-reinforcement","title":"Approximate Equivariance in Reinforcement Learning","date":"2024-11-06","arxiv_id":"2411.04225","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-novice-to-expert-llm-agent-policy","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning","date":"2024-11-06","arxiv_id":"2411.03817","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-stationary-learning-of-neural-networks","title":"Non-Stationary Learning of Neural Networks with Automatic Soft Parameter Reset","date":"2024-11-06","arxiv_id":"2411.04034","repositories_listed":0,"syntology":null},{"url":null,"slug":"opportunities-of-reinforcement-learning-in","title":"Opportunities of Reinforcement Learning in South Africa's Just Transition","date":"2024-11-06","arxiv_id":"2411.15145","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-task-generalisation-with-multi","title":"Accelerating Task Generalisation with Multi-Level Skill Hierarchies","date":"2024-11-05","arxiv_id":"2411.02998","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-decision-making-for-uav","title":"Autonomous Decision Making for UAV Cooperative Pursuit-Evasion Game with Reinforcement Learning","date":"2024-11-05","arxiv_id":"2411.02983","repositories_listed":0,"syntology":null},{"url":"/paper/hierarchical-orchestra-of-policies","slug":"hierarchical-orchestra-of-policies","title":"Hierarchical Orchestra of Policies","date":"2024-11-05","arxiv_id":"2411.03008","repositories_listed":0,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/hierarchical-orchestra-of-policies#ran","syntology_url":"https://syntology.ai/paper/2411.03008","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2411.03008"}},"official":null}},{"url":null,"slug":"when-to-localize-a-risk-constrained","title":"When to Localize? A Risk-Constrained Reinforcement Learning Approach","date":"2024-11-05","arxiv_id":"2411.02788","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-hidden-subgoals-under-temporal","title":"Learning Hidden Subgoals under Temporal Ordering Constraints in Reinforcement Learning","date":"2024-11-03","arxiv_id":"2411.01425","repositories_listed":0,"syntology":null},{"url":null,"slug":"teaching-models-to-improve-on-tape","title":"Teaching Models to Improve on Tape","date":"2024-11-03","arxiv_id":"2411.01483","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-reinforcement-learning-in","title":"A Review of Reinforcement Learning in Financial Applications","date":"2024-11-01","arxiv_id":"2411.12746","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-ml-model-versioning-in-edge","title":"Effective ML Model Versioning in Edge Networks","date":"2024-11-01","arxiv_id":"2411.01078","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-adaptive-mixed-criticality","title":"Enhancing Adaptive Mixed-Criticality Scheduling with Deep Reinforcement Learning","date":"2024-11-01","arxiv_id":"2411.00572","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-imitation-learning-based-optimal-energy","title":"Safe Imitation Learning-based Optimal Energy Storage Systems Dispatch in Distribution Networks","date":"2024-11-01","arxiv_id":"2411.00995","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-guarantees-for-lifelong","title":"Statistical Guarantees for Lifelong Reinforcement Learning using PAC-Bayes Theory","date":"2024-11-01","arxiv_id":"2411.00401","repositories_listed":0,"syntology":null},{"url":null,"slug":"anytime-constrained-multi-agent-reinforcement","title":"Anytime-Constrained Equilibria in Polynomial Time","date":"2024-10-31","arxiv_id":"2410.23637","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-automata-embeddings-for-goal","title":"Compositional Automata Embeddings for Goal-Conditioned Reinforcement Learning","date":"2024-10-31","arxiv_id":"2411.00205","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-entropy-hindsight-experience-replay","title":"Maximum Entropy Hindsight Experience Replay","date":"2024-10-31","arxiv_id":"2410.24016","repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-safeguards-for-safe-and-model","title":"Progressive Safeguards for Safe and Model-Agnostic Reinforcement Learning","date":"2024-10-31","arxiv_id":"2410.24096","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-star-theoretical-analysis-of-reinforcement","title":"RL-STaR: Theoretical Analysis of Reinforcement Learning Frameworks for Self-Taught Reasoner","date":"2024-10-31","arxiv_id":"2410.23912","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounding-by-trying-llms-with-reinforcement","title":"Grounding by Trying: LLMs with Reinforcement Learning-Enhanced Retrieval","date":"2024-10-30","arxiv_id":"2410.23214","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-governance-in-networked-systems-via","title":"Resource Governance in Networked Systems via Integrated Variational Autoencoders and Reinforcement Learning","date":"2024-10-30","arxiv_id":"2410.23393","repositories_listed":0,"syntology":null},{"url":null,"slug":"return-augmented-decision-transformer-for-off","title":"Return Augmented Decision Transformer for Off-Dynamics Reinforcement Learning","date":"2024-10-30","arxiv_id":"2410.23450","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-driving-car-racing-application-of-deep","title":"Self-Driving Car Racing: Application of Deep Reinforcement Learning","date":"2024-10-30","arxiv_id":"2410.22766","repositories_listed":0,"syntology":null},{"url":null,"slug":"stepping-out-of-the-shadows-reinforcement","title":"Stepping Out of the Shadows: Reinforcement Learning in Shadow Mode","date":"2024-10-30","arxiv_id":"2410.23419","repositories_listed":0,"syntology":null},{"url":null,"slug":"hindsight-experience-replay-accelerates","title":"Hindsight Experience Replay Accelerates Proximal Policy Optimization","date":"2024-10-29","arxiv_id":"2410.22524","repositories_listed":0,"syntology":null},{"url":null,"slug":"prefpaint-aligning-image-inpainting-diffusion","title":"PrefPaint: Aligning Image Inpainting Diffusion Model with Human Preference","date":"2024-10-29","arxiv_id":"2410.21966","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-minimum-cost-reach-avoid-using","title":"Solving Minimum-Cost Reach Avoid using Reinforcement Learning","date":"2024-10-29","arxiv_id":"2410.22600","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multi-agent-reinforcement-learning-testbed","title":"A Multi-Agent Reinforcement Learning Testbed for Cognitive Radio Applications","date":"2024-10-28","arxiv_id":"2410.21521","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-legibility-in-multiagent-reinforcement","title":"Active Legibility in Multiagent Reinforcement Learning","date":"2024-10-28","arxiv_id":"2410.20954","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-constrained-policy-optimization","title":"Adversarial Constrained Policy Optimization: Improving Constrained Reinforcement Learning by Adapting Budgets","date":"2024-10-28","arxiv_id":"2410.20786","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-agent-deep-reinforcement-learning-for-1","title":"Dual-Agent Deep Reinforcement Learning for Dynamic Pricing and Replenishment","date":"2024-10-28","arxiv_id":"2410.21109","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-reinforcement-learning-for-incident","title":"Exploring reinforcement learning for incident response in autonomous military vehicles","date":"2024-10-28","arxiv_id":"2410.21407","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-9","title":"Offline Reinforcement Learning With Combinatorial Action Spaces","date":"2024-10-28","arxiv_id":"2410.21151","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-reinforcement-learning-based-two","title":"Quantum Reinforcement Learning-Based Two-Stage Unit Commitment Framework for Enhanced Power Systems Robustness","date":"2024-10-28","arxiv_id":"2410.21240","repositories_listed":0,"syntology":null}],"record_sha256":"76d751636af1e27b00183acf3a5be6c195b16b7bf40d7721df99875bf5e2b796","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}