{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/65","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":65,"pages_in_order":132,"rows_per_page":100,"rows":[6401,6500],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/64","next":"/task/reinforcement-learning/papers/66","papers":[{"url":null,"slug":"multi-agent-reinforcement-learning-for-17","title":"Multi-Agent Reinforcement Learning for Network Routing in Integrated Access Backhaul Networks","date":"2023-05-12","arxiv_id":"2305.16170","repositories_listed":0,"syntology":null},{"url":"/paper/towards-generalizable-reinforcement-learning","slug":"towards-generalizable-reinforcement-learning","title":"Towards Generalizable Reinforcement Learning for Trade Execution","date":"2023-05-12","arxiv_id":"2307.11685","repositories_listed":0,"syntology":{"n":1,"n_ran":1,"n_constructed":1,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":1,"phrase":"1 ran (of which 1 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified; the one sample that ran constructed an object rather than computing a result","sample_list":"/paper/towards-generalizable-reinforcement-learning#ran","syntology_url":"https://syntology.ai/paper/2307.11685","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2307.11685"}},"official":null}},{"url":null,"slug":"deep-reinforcement-learning-for-interference","title":"Deep Reinforcement Learning for Interference Management in UAV-based 3D Networks: Potentials and Challenges","date":"2023-05-11","arxiv_id":"2305.07069","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-memory-mapping-using-deep","title":"Optimizing Memory Mapping Using Deep Reinforcement Learning","date":"2023-05-11","arxiv_id":"2305.07440","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-theoretical-understanding-of-data","title":"Towards Theoretical Understanding of Data-Driven Policy Refinement","date":"2023-05-11","arxiv_id":"2305.06796","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-proof-of-convergence-of-inverse","title":"A proof of convergence of inverse reinforcement learning for multi-objective optimization","date":"2023-05-10","arxiv_id":"2305.06137","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-option-dependent-analysis-of-regret","title":"An Option-Dependent Analysis of Regret Minimization Algorithms in Finite-Horizon Semi-Markov Decision Processes","date":"2023-05-10","arxiv_id":"2305.06936","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovery-of-optimal-quantum-error-correcting","title":"Discovery of Optimal Quantum Error Correcting Codes via Reinforcement Learning","date":"2023-05-10","arxiv_id":"2305.06378","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixture-of-personality-improved-spiking-actor","title":"Mixture of personality improved Spiking actor network for efficient multi-agent cooperation","date":"2023-05-10","arxiv_id":"2305.05898","repositories_listed":0,"syntology":null},{"url":null,"slug":"supplementing-gradient-based-reinforcement","title":"Supplementing Gradient-Based Reinforcement Learning with Simple Evolutionary Ideas","date":"2023-05-10","arxiv_id":"2305.07571","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-language-models-with-generative","title":"Fine-tuning Language Models with Generative Adversarial Reward Modelling","date":"2023-05-09","arxiv_id":"2305.06176","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlocator-reinforcement-learning-for-bug","title":"RLocator: Reinforcement Learning for Bug Localization","date":"2023-05-09","arxiv_id":"2305.05586","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-oriented-inference-of-environment-from","title":"Goal-oriented inference of environment from redundant observations","date":"2023-05-08","arxiv_id":"2305.04432","repositories_listed":0,"syntology":null},{"url":null,"slug":"truncating-trajectories-in-monte-carlo","title":"Truncating Trajectories in Monte Carlo Reinforcement Learning","date":"2023-05-07","arxiv_id":"2305.04361","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-offline-model-based-reinforcement","title":"A Survey on Offline Model-Based Reinforcement Learning","date":"2023-05-05","arxiv_id":"2305.03360","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-reinforcement-learning-with-limited","title":"Bayesian Reinforcement Learning with Limited Cognitive Load","date":"2023-05-05","arxiv_id":"2305.03263","repositories_listed":0,"syntology":null},{"url":null,"slug":"biophysical-cybernetics-of-directed-evolution","title":"Reinforcement Learning for Control of Evolutionary and Ecological Processes","date":"2023-05-05","arxiv_id":"2305.03340","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-real-time-bidding-in-online","title":"Improving Real-Time Bidding in Online Advertising Using Markov Decision Processes and Machine Learning Techniques","date":"2023-05-05","arxiv_id":"2305.04889","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-causal-entropy-inverse-constrained","title":"Maximum Causal Entropy Inverse Constrained Reinforcement Learning","date":"2023-05-04","arxiv_id":"2305.02857","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-delayed-composite","title":"Reinforcement Learning with Delayed, Composite, and Partially Anonymous Reward","date":"2023-05-04","arxiv_id":"2305.02527","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-population-assisted-off-policy","title":"Rethinking Population-assisted Off-policy Reinforcement Learning","date":"2023-05-04","arxiv_id":"2305.02949","repositories_listed":0,"syntology":null},{"url":null,"slug":"gym-precice-reinforcement-learning","title":"Gym-preCICE: Reinforcement Learning Environments for Active Flow Control","date":"2023-05-03","arxiv_id":"2305.02033","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-machine-co-adaption-interface-via","title":"Human Machine Co-adaption Interface via Cooperation Markov Decision Process System","date":"2023-05-03","arxiv_id":"2305.02058","repositories_listed":0,"syntology":null},{"url":null,"slug":"relbot-a-transfer-learning-approach-to","title":"A Transfer Learning Approach to Minimize Reinforcement Learning Risks in Energy Optimization for Smart Buildings","date":"2023-04-30","arxiv_id":"2305.00365","repositories_listed":0,"syntology":null},{"url":null,"slug":"srl-assisted-afm-generating-planar","title":"SRL-Assisted AFM: Generating Planar Unstructured Quadrilateral Meshes with Supervised and Reinforcement Learning-Assisted Advancing Front Method","date":"2023-04-30","arxiv_id":"2305.00540","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-based-on-self","title":"Meta-Reinforcement Learning Based on Self-Supervised Task Representation Learning","date":"2023-04-29","arxiv_id":"2305.00286","repositories_listed":0,"syntology":null},{"url":null,"slug":"systematic-review-on-reinforcement-learning","title":"Systematic Review on Reinforcement Learning in the Field of Fintech","date":"2023-04-29","arxiv_id":"2305.07466","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-federated-reinforcement-learning-framework","title":"A Federated Reinforcement Learning Framework for Link Activation in Multi-link Wi-Fi Networks","date":"2023-04-28","arxiv_id":"2304.14720","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-reinforcement-learning-for","title":"Active Reinforcement Learning for Personalized Stress Monitoring in Everyday Settings","date":"2023-04-28","arxiv_id":"2305.00111","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-policy-optimization-in-deep","title":"Adversarial Policy Optimization in Deep Reinforcement Learning","date":"2023-04-27","arxiv_id":"2304.14533","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-flavor-structure-of-quarks-and","title":"Exploring the flavor structure of quarks and leptons with reinforcement learning","date":"2023-04-27","arxiv_id":"2304.14176","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-step-distributional-reinforcement","title":"One-Step Distributional Reinforcement Learning","date":"2023-04-27","arxiv_id":"2304.14421","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-criteria-hardware-trojan-detection-a","title":"Multi-criteria Hardware Trojan Detection: A Reinforcement Learning Approach","date":"2023-04-26","arxiv_id":"2304.13232","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-partial","title":"Reinforcement Learning with Partial Parametric Model Knowledge","date":"2023-04-26","arxiv_id":"2304.13223","repositories_listed":0,"syntology":null},{"url":null,"slug":"fulfilling-formal-specifications-asap-by","title":"Fulfilling Formal Specifications ASAP by Model-free Reinforcement Learning","date":"2023-04-25","arxiv_id":"2304.12508","repositories_listed":0,"syntology":null},{"url":null,"slug":"loss-and-reward-weighing-for-increased","title":"Loss- and Reward-Weighting for Efficient Distributed Reinforcement Learning","date":"2023-04-25","arxiv_id":"2304.12778","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-extraction-attacks-against","title":"Model Extraction Attacks Against Reinforcement Learning Based Controllers","date":"2023-04-25","arxiv_id":"2304.13090","repositories_listed":0,"syntology":null},{"url":null,"slug":"sea-a-spatially-explicit-architecture-for","title":"SEA: A Spatially Explicit Architecture for Multi-Agent Reinforcement Learning","date":"2023-04-25","arxiv_id":"2304.12532","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-theoretical-understanding-of-inverse","title":"Towards Theoretical Understanding of Inverse Reinforcement Learning","date":"2023-04-25","arxiv_id":"2304.12966","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-halftoning-via-deep-reinforcement","title":"Efficient Halftoning via Deep Reinforcement Learning","date":"2023-04-24","arxiv_id":"2304.12152","repositories_listed":0,"syntology":null},{"url":null,"slug":"instance-optimality-in-interactive-decision","title":"Instance-Optimality in Interactive Decision Making: Toward a Non-Asymptotic Theory","date":"2023-04-24","arxiv_id":"2304.12466","repositories_listed":0,"syntology":null},{"url":null,"slug":"parallel-bootstrap-based-on-policy-deep","title":"Parallel bootstrap-based on-policy deep reinforcement learning for continuous flow control applications","date":"2023-04-24","arxiv_id":"2304.12330","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-resilience-to-environment-poisoning","title":"Policy Resilience to Environment Poisoning Attacks on Reinforcement Learning","date":"2023-04-24","arxiv_id":"2304.12151","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-knowledge","title":"Reinforcement Learning with Knowledge Representation and Reasoning: A Brief Survey","date":"2023-04-24","arxiv_id":"2304.12090","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-an-abrupt-model","title":"Reinforcement Learning with an Abrupt Model Change","date":"2023-04-22","arxiv_id":"2304.11460","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-cubic-regularized-policy-newton-algorithm","title":"A Cubic-regularized Policy Newton Algorithm for Reinforcement Learning","date":"2023-04-21","arxiv_id":"2304.10951","repositories_listed":0,"syntology":null},{"url":null,"slug":"amp-in-the-wild-learning-robust-agile-natural","title":"Learning Robust, Agile, Natural Legged Locomotion Skills in the Wild","date":"2023-04-21","arxiv_id":"2304.10888","repositories_listed":0,"syntology":null},{"url":null,"slug":"aiding-reinforcement-learning-for-set-point","title":"Aiding reinforcement learning for set point control","date":"2023-04-20","arxiv_id":"2304.10289","repositories_listed":0,"syntology":null},{"url":"/paper/efficient-deep-reinforcement-learning","slug":"efficient-deep-reinforcement-learning","title":"Efficient Deep Reinforcement Learning Requires Regulating Overfitting","date":"2023-04-20","arxiv_id":"2304.10466","repositories_listed":0,"syntology":{"n":15,"n_ran":9,"n_constructed":0,"n_ran_checked":9,"n_instrument":0,"n_unverified":6,"n_honours":0,"n_violates":0,"n_no_contract":9,"n_pointer_only":0,"phrase":"9 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 0 honoured, 0 violated, 9 with no contract checked; 0 where Syntology's instrument failed) · 6 unverified","sample_list":"/paper/efficient-deep-reinforcement-learning#ran","syntology_url":"https://syntology.ai/paper/2304.10466","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2304.10466"}},"official":null}},{"url":null,"slug":"interpretability-for-conditional-coordinated","title":"Interpretability for Conditional Coordinated Behavior in Multi-Agent Reinforcement Learning","date":"2023-04-20","arxiv_id":"2304.10375","repositories_listed":0,"syntology":null},{"url":null,"slug":"observer-feedback-feedforward-controller","title":"Observer-Feedback-Feedforward Controller Structures in Reinforcement Learning","date":"2023-04-20","arxiv_id":"2304.10276","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-nonlinear-set-point-control-with","title":"Robust nonlinear set-point control with reinforcement learning","date":"2023-04-20","arxiv_id":"2304.10277","repositories_listed":0,"syntology":null},{"url":null,"slug":"topological-guided-actor-critic-modular","title":"Topological Guided Actor-Critic Modular Learning of Continuous Systems with Temporal Objectives","date":"2023-04-20","arxiv_id":"2304.10041","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-memory-reinforcement-learning","title":"Two-Memory Reinforcement Learning","date":"2023-04-20","arxiv_id":"2304.10098","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-term-fairness-with-unknown-dynamics","title":"Long-Term Fairness with Unknown Dynamics","date":"2023-04-19","arxiv_id":"2304.09362","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-6","title":"Model Based Reinforcement Learning for Personalized Heparin Dosing","date":"2023-04-19","arxiv_id":"2304.10000","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-deep-q-learning-with-distributed","title":"Quantum deep Q learning with distributed prioritized experience replay","date":"2023-04-19","arxiv_id":"2304.09648","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-reinforcement-6","title":"Cooperative Multi-Agent Reinforcement Learning for Inventory Management","date":"2023-04-18","arxiv_id":"2304.08769","repositories_listed":0,"syntology":null},{"url":null,"slug":"feasible-policy-iteration","title":"Feasible Policy Iteration for Safe Reinforcement Learning","date":"2023-04-18","arxiv_id":"2304.08845","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-bounds-for-adaptive-inverse","title":"Finite-Sample Bounds for Adaptive Inverse Reinforcement Learning using Passive Langevin Dynamics","date":"2023-04-18","arxiv_id":"2304.09123","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-feedback-efficient-reinforcement","title":"Provably Feedback-Efficient Reinforcement Learning via Active Reward Learning","date":"2023-04-18","arxiv_id":"2304.08944","repositories_listed":0,"syntology":null},{"url":null,"slug":"searching-for-ribbons-with-machine-learning","title":"Searching for ribbons with machine learning","date":"2023-04-18","arxiv_id":"2304.09304","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-on-a-q-learning-algorithm-application","title":"A study on a Q-Learning algorithm application to a manufacturing assembly problem","date":"2023-04-17","arxiv_id":"2304.08375","repositories_listed":0,"syntology":null},{"url":null,"slug":"alzheimers-disease-diagnosis-using-machine","title":"Alzheimers Disease Diagnosis using Machine Learning: A Review","date":"2023-04-17","arxiv_id":"2304.09178","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-decision-transformer-for-recommender","title":"Causal Decision Transformer for Recommender Systems via Offline Reinforcement Learning","date":"2023-04-17","arxiv_id":"2304.07920","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-explainable-relational-reinforcement","title":"Deep Explainable Relational Reinforcement Learning: A Neuro-Symbolic Approach","date":"2023-04-17","arxiv_id":"2304.08349","repositories_listed":0,"syntology":null},{"url":null,"slug":"integration-of-reinforcement-learning-based","title":"Integration of Reinforcement Learning Based Behavior Planning With Sampling Based Motion Planning for Automated Driving","date":"2023-04-17","arxiv_id":"2304.08280","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-automated-defense-strategies-using","title":"Training Automated Defense Strategies Using Graph-based Cyber Attack Simulations","date":"2023-04-17","arxiv_id":"2304.11084","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-on-longitudinal-car-following-model","title":"Car-Following Models: A Multidisciplinary Review","date":"2023-04-14","arxiv_id":"2304.07143","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-optimal-reward-agnostic-exploration","title":"Minimax-Optimal Reward-Agnostic Exploration in Reinforcement Learning","date":"2023-04-14","arxiv_id":"2304.07278","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-applied-to-an","title":"Deep reinforcement learning applied to an assembly sequence planning problem with user preferences","date":"2023-04-13","arxiv_id":"2304.06567","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-dynamic-shielding-for-safe-and","title":"Model-based Dynamic Shielding for Safe and Efficient Multi-Agent Reinforcement Learning","date":"2023-04-13","arxiv_id":"2304.06281","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-symmetry-and-heuristic","title":"Exploiting Symmetry and Heuristic Demonstrations in Off-policy Reinforcement Learning for Robotic Manipulation","date":"2023-04-12","arxiv_id":"2304.06055","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-tale-of-sampling-and-estimation-in","title":"A Tale of Sampling and Estimation in Discounted Reinforcement Learning","date":"2023-04-11","arxiv_id":"2304.05073","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-tutor-better-supported","title":"Reinforcement Learning Tutor Better Supported Lower Performers in a Math Task","date":"2023-04-11","arxiv_id":"2304.04933","repositories_listed":0,"syntology":null},{"url":null,"slug":"dream-adaptive-reinforcement-learning-based","title":"DREAM: Adaptive Reinforcement Learning based on Attention Mechanism for Temporal Knowledge Graph Reasoning","date":"2023-04-08","arxiv_id":"2304.03984","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-modular-framework-for-stabilizing-deep","title":"A modular framework for stabilizing deep reinforcement learning control","date":"2023-04-07","arxiv_id":"2304.03422","repositories_listed":0,"syntology":null},{"url":null,"slug":"crisp-curriculum-inducing-primitive-informed","title":"CRISP: Curriculum Inducing Primitive Informed Subgoal Prediction for Hierarchical Reinforcement Learning","date":"2023-04-07","arxiv_id":"2304.03535","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-optimal-1","title":"Deep Reinforcement Learning Based Optimal Infinite-Horizon Control of Probabilistic Boolean Control Networks","date":"2023-04-07","arxiv_id":"2304.03489","repositories_listed":0,"syntology":null},{"url":null,"slug":"full-gradient-deep-reinforcement-learning-for","title":"Full Gradient Deep Reinforcement Learning for Average-Reward Criterion","date":"2023-04-07","arxiv_id":"2304.03729","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-decision-focused-learning-for-reward","title":"Decision-Focused Model-based Reinforcement Learning for Reward Transfer","date":"2023-04-06","arxiv_id":"2304.03365","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-exploration-in-reinforcement","title":"Constrained Exploration in Reinforcement Learning with Optimality Preservation","date":"2023-04-05","arxiv_id":"2304.03104","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-action-anticipation-in-multi-agent","title":"Off-Policy Action Anticipation in Multi-Agent Reinforcement Learning","date":"2023-04-04","arxiv_id":"2304.01447","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-irrigation-efficiency-using-deep","title":"Optimizing Irrigation Efficiency using Deep Reinforcement Learning in the Field","date":"2023-04-04","arxiv_id":"2304.01435","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularization-of-the-policy-updates-for","title":"Regularization of the policy updates for stabilizing Mean Field Games","date":"2023-04-04","arxiv_id":"2304.01547","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-aware-distributed-multi-agent","title":"Risk-Aware Distributed Multi-Agent Reinforcement Learning","date":"2023-04-04","arxiv_id":"2304.02005","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-tutorial-introduction-to-reinforcement","title":"A Tutorial Introduction to Reinforcement Learning","date":"2023-04-03","arxiv_id":"2304.00803","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-pick-up-in-dynamic-action-space","title":"Action Pick-up in Dynamic Action Space Reinforcement Learning","date":"2023-04-03","arxiv_id":"2304.00873","repositories_listed":0,"syntology":null},{"url":null,"slug":"empirical-design-in-reinforcement-learning","title":"Empirical Design in Reinforcement Learning","date":"2023-04-03","arxiv_id":"2304.01315","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantitative-trading-using-deep-q-learning","title":"Quantitative Trading using Deep Q Learning","date":"2023-04-03","arxiv_id":"2304.06037","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-and-robust-model-based","title":"Risk-Sensitive and Robust Model-Based Reinforcement Learning and Planning","date":"2023-04-02","arxiv_id":"2304.00573","repositories_listed":0,"syntology":null},{"url":null,"slug":"mastering-pair-trading-with-risk-aware","title":"Mastering Pair Trading with Risk-Aware Recurrent Reinforcement Learning","date":"2023-04-01","arxiv_id":"2304.00364","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-microgrid-collaborative-optimization","title":"Multi-Microgrid Collaborative Optimization Scheduling Using an Improved Multi-Agent Soft Actor-Critic Algorithm","date":"2023-04-01","arxiv_id":"2304.01223","repositories_listed":0,"syntology":null},{"url":null,"slug":"reduce-reuse-recycle-selective-reincarnation","title":"Selective Reincarnation: Offline-to-Online Multi-Agent Reinforcement Learning","date":"2023-03-31","arxiv_id":"2304.00977","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-complicated-manipulation-skills-via","title":"Learning Complicated Manipulation Skills via Deterministic Policy with Limited Demonstrations","date":"2023-03-29","arxiv_id":"2303.16469","repositories_listed":0,"syntology":null},{"url":null,"slug":"physical-deep-reinforcement-learning-towards","title":"Physical Deep Reinforcement Learning Towards Safety Guarantee","date":"2023-03-29","arxiv_id":"2303.16860","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-deep-hedging","title":"Quantum Deep Hedging","date":"2023-03-29","arxiv_id":"2303.16585","repositories_listed":0,"syntology":null},{"url":null,"slug":"bc-irl-learning-generalizable-reward","title":"BC-IRL: Learning Generalizable Reward Functions from Demonstrations","date":"2023-03-28","arxiv_id":"2303.16194","repositories_listed":0,"syntology":null},{"url":null,"slug":"bi-manual-block-assembly-via-sim-to-real","title":"Bi-Manual Block Assembly via Sim-to-Real Reinforcement Learning","date":"2023-03-27","arxiv_id":"2303.14870","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-novel-quality-diversity-methods-for","title":"Exploring Novel Quality Diversity Methods For Generalization in Reinforcement Learning","date":"2023-03-26","arxiv_id":"2303.14592","repositories_listed":0,"syntology":null}],"record_sha256":"3cee96308dccbe6841a517fd8e2382dc68e9d95dd6b944928b69e62f22d503e5","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}