{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/51","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":51,"pages_in_order":135,"rows_per_page":100,"rows":[5001,5100],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/50","next":"/task/reinforcement-learning-2/papers/52","papers":[{"url":null,"slug":"the-unknotting-number-hard-unknot-diagrams","title":"The unknotting number, hard unknot diagrams, and reinforcement learning","date":"2024-09-13","arxiv_id":"2409.09032","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-causally-invariant-reward-functions","title":"Learning Causally Invariant Reward Functions from Diverse Demonstrations","date":"2024-09-12","arxiv_id":"2409.08012","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-value-regularized-decision-convformer-for","title":"Q-value Regularized Decision ConvFormer for Offline Reinforcement Learning","date":"2024-09-12","arxiv_id":"2409.08062","repositories_listed":0,"syntology":null},{"url":null,"slug":"scores-as-actions-a-framework-of-fine-tuning","title":"Scores as Actions: a framework of fine-tuning diffusion models by continuous-time reinforcement learning","date":"2024-09-12","arxiv_id":"2409.08400","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-reinforcement-learning-with","title":"Stochastic Reinforcement Learning with Stability Guarantees for Control of Unknown Nonlinear Systems","date":"2024-09-12","arxiv_id":"2409.08382","repositories_listed":0,"syntology":null},{"url":null,"slug":"tidal-merza-combining-affective-modelling-and","title":"Tidal MerzA: Combining affective modelling and autonomous code generation through Reinforcement Learning","date":"2024-09-12","arxiv_id":"2409.07918","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-for-10","title":"Hierarchical Reinforcement Learning for Temporal Abstraction of Listwise Recommendation","date":"2024-09-11","arxiv_id":"2409.07416","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-efficient-recursive-numeral-systems","title":"Learning Efficient Recursive Numeral Systems via Reinforcement Learning","date":"2024-09-11","arxiv_id":"2409.07170","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-introduction-to-quantum-reinforcement","title":"An Introduction to Quantum Reinforcement Learning (QRL)","date":"2024-09-09","arxiv_id":"2409.05846","repositories_listed":0,"syntology":null},{"url":null,"slug":"betterbodies-reinforcement-learning-guided","title":"BetterBodies: Reinforcement Learning guided Diffusion for Antibody Sequence Design","date":"2024-09-09","arxiv_id":"2409.16298","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-variational","title":"Reinforcement Learning for Variational Quantum Circuits Design","date":"2024-09-09","arxiv_id":"2409.05475","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-novelty-guided-action-persistence-in","title":"State-Novelty Guided Action Persistence in Deep Reinforcement Learning","date":"2024-09-09","arxiv_id":"2409.05433","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-fast-rates-for-federated-and-multi","title":"Towards Fast Rates for Federated and Multi-Task Reinforcement Learning","date":"2024-09-09","arxiv_id":"2409.05291","repositories_listed":0,"syntology":null},{"url":null,"slug":"causality-driven-reinforcement-learning-for","title":"Causality-Driven Reinforcement Learning for Joint Communication and Sensing","date":"2024-09-07","arxiv_id":"2409.15329","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-adaptive-load","title":"Reinforcement Learning-Based Adaptive Load Balancing for Dynamic Cloud Environments","date":"2024-09-07","arxiv_id":"2409.04896","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-rate-maximization","title":"Reinforcement Learning for Rate Maximization in IRS-aided OWC Networks","date":"2024-09-07","arxiv_id":"2409.04842","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-based-personality-profiling","title":"Prompt-based Personality Profiling: Reinforcement Learning for Relevance Filtering","date":"2024-09-06","arxiv_id":"2409.04122","repositories_listed":0,"syntology":null},{"url":null,"slug":"stacked-universal-successor-feature","title":"Stacked Universal Successor Feature Approximators for Safety in Reinforcement Learning","date":"2024-09-06","arxiv_id":"2409.04641","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-stochastic-approximation-and","title":"Asynchronous Stochastic Approximation and Average-Reward Reinforcement Learning","date":"2024-09-05","arxiv_id":"2409.03915","repositories_listed":0,"syntology":null},{"url":null,"slug":"chirps-change-induced-regret-proxy-metrics","title":"CHIRPs: Change-Induced Regret Proxy metrics for Lifelong Reinforcement Learning","date":"2024-09-05","arxiv_id":"2409.03577","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-synchronization-and-policy-adaptation","title":"Robust synchronization and policy adaptation for networked heterogeneous agents","date":"2024-09-05","arxiv_id":"2409.03273","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-emergent-language","title":"Emergent Language: A Survey and Taxonomy","date":"2024-09-04","arxiv_id":"2409.02645","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-joint-1","title":"Multi-Agent Reinforcement Learning for Joint Police Patrol and Dispatch","date":"2024-09-03","arxiv_id":"2409.02246","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-and-action-factorization-in-power-grids","title":"State and Action Factorization in Power Grids","date":"2024-09-03","arxiv_id":"2409.04467","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitating-language-via-scalable-inverse","title":"Imitating Language via Scalable Inverse Reinforcement Learning","date":"2024-09-02","arxiv_id":"2409.01369","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-safe-exploration-in-safe","title":"Revisiting Safe Exploration in Safe Reinforcement learning","date":"2024-09-02","arxiv_id":"2409.01245","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-augmentation-in-reinforcement-learning","title":"Reward Augmentation in Reinforcement Learning for Testing Distributed Systems","date":"2024-09-02","arxiv_id":"2409.02137","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-path-planning-with-asynchronous","title":"Cooperative Path Planning with Asynchronous Multiagent Reinforcement Learning","date":"2024-09-01","arxiv_id":"2409.00754","repositories_listed":0,"syntology":null},{"url":null,"slug":"foundations-of-multivariate-distributional","title":"Foundations of Multivariate Distributional Reinforcement Learning","date":"2024-08-31","arxiv_id":"2409.00328","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-off-policy-reinforcement-learning-via","title":"Robust off-policy Reinforcement Learning via Soft Constrained Adversary","date":"2024-08-31","arxiv_id":"2409.00418","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-quantum-solved-deep-boltzmann-machines","title":"Using Quantum Solved Deep Boltzmann Machines to Increase the Data Efficiency of RL Agents","date":"2024-08-30","arxiv_id":"2408.17240","repositories_listed":0,"syntology":null},{"url":null,"slug":"phase-optimization-and-relay-selection-for","title":"Phase Optimization and Relay Selection for Joint Relay and IRS-Assisted Communication","date":"2024-08-29","arxiv_id":"2408.16399","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-without-human-feedback","title":"Reinforcement Learning without Human Feedback for Last Mile Fine-Tuning of Large Language Models","date":"2024-08-29","arxiv_id":"2408.16753","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-traffic-signal-control-using","title":"Reinforcement Learning for Adaptive Traffic Signal Control: Turn-Based and Time-Based Approaches to Reduce Congestion","date":"2024-08-28","arxiv_id":"2408.15751","repositories_listed":0,"syntology":null},{"url":null,"slug":"skills-regularized-task-decomposition-for","title":"Skills Regularized Task Decomposition for Multi-task Offline Reinforcement Learning","date":"2024-08-28","arxiv_id":"2408.15593","repositories_listed":0,"syntology":null},{"url":null,"slug":"structural-optimization-of-lightweight","title":"Structural Optimization of Lightweight Bipedal Robot via SERL","date":"2024-08-28","arxiv_id":"2408.15632","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-approximate-symmetry-for-efficient","title":"Exploiting Approximate Symmetry for Efficient Multi-Agent Reinforcement Learning","date":"2024-08-27","arxiv_id":"2408.15173","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-q-token-level-reinforcement-learning","title":"Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data","date":"2024-08-27","arxiv_id":"2408.14874","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-stateful-value-factorization-in-multi","title":"On Stateful Value Factorization in Multi-Agent Reinforcement Learning","date":"2024-08-27","arxiv_id":"2408.15381","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimization-solution-functions-as","title":"Optimization Solution Functions as Deterministic Policies for Offline Reinforcement Learning","date":"2024-08-27","arxiv_id":"2408.15368","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-to-online-reinforcement-learning","title":"Unsupervised-to-Online Reinforcement Learning","date":"2024-08-27","arxiv_id":"2408.14785","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-reinforcement-learning","title":"A Survey on Reinforcement Learning Applications in SLAM","date":"2024-08-26","arxiv_id":"2408.14518","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-the-gap-between-learning-to-plan","title":"Bridging the gap between Learning-to-plan, Motion Primitives and Safe Reinforcement Learning","date":"2024-08-26","arxiv_id":"2408.14063","repositories_listed":0,"syntology":null},{"url":null,"slug":"equivariant-reinforcement-learning-under","title":"Equivariant Reinforcement Learning under Partial Observability","date":"2024-08-26","arxiv_id":"2408.14336","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-9","title":"Model-Based Reinforcement Learning for Control of Strongly-Disturbed Unsteady Aerodynamic Flows","date":"2024-08-26","arxiv_id":"2408.14685","repositories_listed":0,"syntology":null},{"url":null,"slug":"relexs-reinforcement-learning-explanations","title":"ReLExS: Reinforcement Learning Explanations for Stackelberg No-Regret Learners","date":"2024-08-26","arxiv_id":"2408.14086","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforced-dag-learning-without","title":"Reinforcement Learning for Causal Discovery without Acyclicity Constraints","date":"2024-08-24","arxiv_id":"2408.13448","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-state-disentanglement-in-causal","title":"Rethinking State Disentanglement in Causal Reinforcement Learning","date":"2024-08-24","arxiv_id":"2408.13498","repositories_listed":0,"syntology":null},{"url":null,"slug":"thresholded-lexicographic-ordered","title":"Thresholded Lexicographic Ordered Multiobjective Reinforcement Learning","date":"2024-08-24","arxiv_id":"2408.13493","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-based-episodes-augmentation-for","title":"Diffusion-based Episodes Augmentation for Offline Multi-Agent Reinforcement Learning","date":"2024-08-23","arxiv_id":"2408.13092","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-context-learning-with-reinforcement","title":"In-Context Learning with Reinforcement Learning for Incomplete Utterance Rewriting","date":"2024-08-23","arxiv_id":"2408.13028","repositories_listed":0,"syntology":null},{"url":null,"slug":"mastering-the-digital-art-of-war-developing","title":"Mastering the Digital Art of War: Developing Intelligent Combat Simulation Agents for Wargaming Using Hierarchical Reinforcement Learning","date":"2024-08-23","arxiv_id":"2408.13333","repositories_listed":0,"syntology":null},{"url":null,"slug":"reduce-reuse-recycle-categories-for","title":"Reduce, Reuse, Recycle: Categories for Compositional Reinforcement Learning","date":"2024-08-23","arxiv_id":"2408.13376","repositories_listed":0,"syntology":null},{"url":null,"slug":"sambo-rl-shifts-aware-model-based-offline","title":"SAMBO-RL: Shifts-aware Model-based Offline Reinforcement Learning","date":"2024-08-23","arxiv_id":"2408.12830","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-safe-and-efficient-self-evolving-algorithm","title":"A Safe and Efficient Self-evolving Algorithm for Decision-making and Control of Autonomous Driving Systems","date":"2024-08-22","arxiv_id":"2408.12187","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adaptation-for-offline-reinforcement","title":"Domain Adaptation for Offline Reinforcement Learning with Limited Samples","date":"2024-08-22","arxiv_id":"2408.12136","repositories_listed":0,"syntology":null},{"url":null,"slug":"pareto-inverse-reinforcement-learning-for","title":"Pareto Inverse Reinforcement Learning for Diverse Expert Policy Generation","date":"2024-08-22","arxiv_id":"2408.12110","repositories_listed":0,"syntology":null},{"url":null,"slug":"pcgrl-scaling-control-and-generalization-in","title":"PCGRL+: Scaling, Control and Generalization in Reinforcement Learning Level Generators","date":"2024-08-22","arxiv_id":"2408.12525","repositories_listed":0,"syntology":null},{"url":null,"slug":"advances-in-preference-based-reinforcement","title":"Advances in Preference-based Reinforcement Learning: A Review","date":"2024-08-21","arxiv_id":"2408.11943","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-and-discriminative","title":"Efficient Exploration and Discriminative World Model Learning with an Object-Centric Abstraction","date":"2024-08-21","arxiv_id":"2408.11816","repositories_listed":0,"syntology":null},{"url":null,"slug":"measurement-based-fast-quantum-state","title":"Fast State Stabilization using Deep Reinforcement Learning for Measurement-based Quantum Feedback Control","date":"2024-08-21","arxiv_id":"2408.11328","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-part-based-representations-for","title":"Using Part-based Representations for Explainable Deep Reinforcement Learning","date":"2024-08-21","arxiv_id":"2408.11455","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-model-based-reinforcement-learning","title":"Offline Model-Based Reinforcement Learning with Anti-Exploration","date":"2024-08-20","arxiv_id":"2408.10713","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-evolution-of-reinforcement-learning-in","title":"The Evolution of Reinforcement Learning in Quantitative Finance: A Survey","date":"2024-08-20","arxiv_id":"2408.10932","repositories_listed":0,"syntology":null},{"url":null,"slug":"demystifying-reinforcement-learning-in","title":"Demystifying Reinforcement Learning in Production Scheduling via Explainable AI","date":"2024-08-19","arxiv_id":"2408.09841","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-in-deep-reinforcement","title":"Efficient Exploration in Deep Reinforcement Learning: A Novel Bayesian Actor-Critic Algorithm","date":"2024-08-19","arxiv_id":"2408.10055","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforcement-learning-in-1","title":"Efficient Reinforcement Learning in Probabilistic Reward Machines","date":"2024-08-19","arxiv_id":"2408.10381","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-reinforcement-learning-through","title":"Enhancing Reinforcement Learning Through Guided Search","date":"2024-08-19","arxiv_id":"2408.10113","repositories_listed":0,"syntology":null},{"url":null,"slug":"gpt-augmented-reinforcement-learning-with","title":"GARLIC: GPT-Augmented Reinforcement Learning with Intelligent Control for Vehicle Dispatching","date":"2024-08-19","arxiv_id":"2408.10286","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalizing-reinforcement-learning-from","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","date":"2024-08-19","arxiv_id":"2408.10075","repositories_listed":0,"syntology":null},{"url":null,"slug":"world-models-increase-autonomy-in","title":"World Models Increase Autonomy in Reinforcement Learning","date":"2024-08-19","arxiv_id":"2408.09807","repositories_listed":0,"syntology":null},{"url":null,"slug":"ancestral-reinforcement-learning-unifying","title":"Ancestral Reinforcement Learning: Unifying Zeroth-Order Optimization and Genetic Algorithms for Reinforcement Learning","date":"2024-08-18","arxiv_id":"2408.09493","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-local-views-global-state-inference","title":"Beyond Local Views: Global State Inference with Diffusion Models for Cooperative Multi-Agent Reinforcement Learning","date":"2024-08-18","arxiv_id":"2408.09501","repositories_listed":0,"syntology":null},{"url":null,"slug":"directed-exploration-in-reinforcement","title":"Directed Exploration in Reinforcement Learning from Linear Temporal Logic","date":"2024-08-18","arxiv_id":"2408.09495","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploratory-optimal-stopping-a-singular","title":"Exploratory Optimal Stopping: A Singular Control Formulation","date":"2024-08-18","arxiv_id":"2408.09335","repositories_listed":0,"syntology":null},{"url":null,"slug":"refine-lm-mitigating-language-model","title":"REFINE-LM: Mitigating Language Model Stereotypes via Reinforcement Learning","date":"2024-08-18","arxiv_id":"2408.09489","repositories_listed":0,"syntology":null},{"url":null,"slug":"qedcartographer-automating-formal","title":"QEDCartographer: Automating Formal Verification Using Reward-Free Reinforcement Learning","date":"2024-08-17","arxiv_id":"2408.09237","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-adaptive-speed","title":"Reinforcement learning-based adaptive speed controllers in mixed autonomy condition","date":"2024-08-17","arxiv_id":"2408.09145","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-verifiably-robust-agents-using-set","title":"Training Verifiably Robust Agents Using Set-Based Reinforcement Learning","date":"2024-08-17","arxiv_id":"2408.09112","repositories_listed":0,"syntology":null},{"url":null,"slug":"cat-caution-aware-transfer-in-reinforcement","title":"CAT: Caution Aware Transfer in Reinforcement Learning via Distributional Risk","date":"2024-08-16","arxiv_id":"2408.08812","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-multi-intentional-inverse-reinforcement","title":"Deep multi-intentional inverse reinforcement learning for cognitive multi-function radar inverse cognition","date":"2024-08-16","arxiv_id":"2408.08478","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-multi-policy-evaluation-for","title":"Efficient Multi-Policy Evaluation for Reinforcement Learning","date":"2024-08-16","arxiv_id":"2408.08706","repositories_listed":0,"syntology":null},{"url":null,"slug":"d5rl-diverse-datasets-for-data-driven-deep","title":"D5RL: Diverse Datasets for Data-Driven Deep Reinforcement Learning","date":"2024-08-15","arxiv_id":"2408.08441","repositories_listed":0,"syntology":null},{"url":null,"slug":"lifelong-reinforcement-learning-via","title":"Lifelong Reinforcement Learning via Neuromodulation","date":"2024-08-15","arxiv_id":"2408.08446","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-nested-graph-reinforcement-learning-based","title":"A Nested Graph Reinforcement Learning-based Decision-making Strategy for Eco-platooning","date":"2024-08-14","arxiv_id":"2408.07578","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-behavioral-ai-reinforcement-learning","title":"Adaptive Behavioral AI: Reinforcement Learning to Enhance Pharmacy Services","date":"2024-08-14","arxiv_id":"2408.07647","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-reinforcement-learning-with-high","title":"Off-Policy Reinforcement Learning with High Dimensional Reward","date":"2024-08-14","arxiv_id":"2408.07660","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-deep-reinforcement-learning-for","title":"Residual Deep Reinforcement Learning for Inverter-based Volt-Var Control","date":"2024-08-13","arxiv_id":"2408.06790","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-in-context-reinforcement","title":"Retrieval-Augmented Hierarchical in-Context Reinforcement Learning and Hindsight Modular Reflections for Task Planning with LLMs","date":"2024-08-12","arxiv_id":"2408.06520","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-optimization-of-curriculum-learning","title":"Online Optimization of Curriculum Learning Schedules using Evolutionary Optimization","date":"2024-08-12","arxiv_id":"2408.06068","repositories_listed":0,"syntology":null},{"url":null,"slug":"curling-the-dream-contrastive-representations","title":"CURLing the Dream: Contrastive Representations for World Modeling in Reinforcement Learning","date":"2024-08-11","arxiv_id":"2408.05781","repositories_listed":0,"syntology":null},{"url":null,"slug":"root-cause-attribution-of-delivery-risks-via","title":"Root Cause Attribution of Delivery Risks via Causal Discovery with Reinforcement Learning","date":"2024-08-11","arxiv_id":"2408.05860","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-deep-reinforcement-4","title":"Cooperative Multi-Agent Deep Reinforcement Learning in Content Ranking Optimization","date":"2024-08-08","arxiv_id":"2408.04251","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-reinforcement-learning-breaks-sample","title":"Hybrid Reinforcement Learning Breaks Sample Size Barriers in Linear MDPs","date":"2024-08-08","arxiv_id":"2408.04526","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowpc-knowledge-driven-programmatic","title":"KnowPC: Knowledge-Driven Programmatic Reinforcement Learning for Zero-shot Coordination","date":"2024-08-08","arxiv_id":"2408.04336","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-driven-approach-for-sustainable-extraction","title":"AI-Driven approach for sustainable extraction of earth's subsurface renewable energy while minimizing seismic activity","date":"2024-08-07","arxiv_id":"2408.03664","repositories_listed":0,"syntology":null},{"url":null,"slug":"navinact-combining-navigation-and-imitation","title":"PLANRL: A Motion Planning and Imitation Learning Framework to Bootstrap Reinforcement Learning","date":"2024-08-07","arxiv_id":"2408.04054","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-03029","title":"Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning","date":"2024-08-06","arxiv_id":"2408.03029","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-03084","title":"Research on Autonomous Driving Decision-making Strategies based Deep Reinforcement Learning","date":"2024-08-06","arxiv_id":"2408.03084","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-03088","title":"QADQN: Quantum Attention Deep Q-Network for Financial Market Prediction","date":"2024-08-06","arxiv_id":"2408.03088","repositories_listed":0,"syntology":null}],"record_sha256":"975e00b6854719865d9c2011956c931d9f8592b92fc808d1b1241c0ba77e9c55","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}