{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/87","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":87,"pages_in_order":152,"rows_per_page":100,"rows":[8601,8700],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/86","next":"/task/reinforcement-learning-1/papers/88","papers":[{"url":null,"slug":"provably-safe-reinforcement-learning-a","title":"Provably Safe Reinforcement Learning: Conceptual Analysis, Survey, and Benchmarking","date":"2022-05-13","arxiv_id":"2205.06750","repositories_listed":0,"syntology":null},{"url":null,"slug":"accounting-for-the-sequential-nature-of","title":"Accounting for the Sequential Nature of States to Learn Features for Reinforcement Learning","date":"2022-05-12","arxiv_id":"2205.06000","repositories_listed":0,"syntology":null},{"url":null,"slug":"contingency-constrained-economic-dispatch","title":"Contingency-constrained economic dispatch with safe reinforcement learning","date":"2022-05-12","arxiv_id":"2205.06212","repositories_listed":0,"syntology":null},{"url":null,"slug":"controlling-chaotic-itinerancy-in-laser","title":"Controlling chaotic itinerancy in laser dynamics for reinforcement learning","date":"2022-05-12","arxiv_id":"2205.05987","repositories_listed":0,"syntology":null},{"url":null,"slug":"economical-precise-manipulation-and-auto-eye","title":"Economical Precise Manipulation and Auto Eye-Hand Coordination with Binocular Visual Reinforcement Learning","date":"2022-05-12","arxiv_id":"2205.05963","repositories_listed":0,"syntology":null},{"url":null,"slug":"feature-and-instance-joint-selection-a","title":"Feature and Instance Joint Selection: A Reinforcement Learning Perspective","date":"2022-05-12","arxiv_id":"2205.07867","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-safe-deep-reinforcement-learning-for","title":"Provably Safe Deep Reinforcement Learning for Robotic Manipulation in Human Environments","date":"2022-05-12","arxiv_id":"2205.06311","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-model-based-safety-and-model-free","title":"Bridging Model-based Safety and Model-free Reinforcement Learning through System Identification of Low Dimensional Linear Models","date":"2022-05-11","arxiv_id":"2205.05787","repositories_listed":0,"syntology":null},{"url":null,"slug":"characterizing-the-action-generalization-gap","title":"Characterizing the Action-Generalization Gap in Deep Q-Learning","date":"2022-05-11","arxiv_id":"2205.05588","repositories_listed":0,"syntology":null},{"url":null,"slug":"delayed-reinforcement-learning-by-imitation","title":"Delayed Reinforcement Learning by Imitation","date":"2022-05-11","arxiv_id":"2205.05569","repositories_listed":0,"syntology":null},{"url":null,"slug":"developing-cooperative-policies-for-multi-1","title":"Developing cooperative policies for multi-stage reinforcement learning tasks","date":"2022-05-11","arxiv_id":"2205.05230","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-distributed-framework-for","title":"Efficient Distributed Framework for Collaborative Multi-Agent Reinforcement Learning","date":"2022-05-11","arxiv_id":"2205.05248","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-analysis-of-constant-step-size-q","title":"Final Iteration Convergence Bound of Q-Learning: Switching System Approach","date":"2022-05-11","arxiv_id":"2205.05455","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-guide-multiple-heterogeneous","title":"Learning to Guide Multiple Heterogeneous Actors from a Single Human Demonstration via Automatic Curriculum Learning in StarCraft II","date":"2022-05-11","arxiv_id":"2205.05784","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-reinforcement-learning-for-star-riss-a","title":"Hybrid Reinforcement Learning for STAR-RISs: A Coupled Phase-Shift Model Based Beamformer","date":"2022-05-10","arxiv_id":"2205.05029","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-verge-of-solving-rocket-league-using","title":"On the Verge of Solving Rocket League using Deep Reinforcement Learning and Sim-to-sim Transfer","date":"2022-05-10","arxiv_id":"2205.05061","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-reinforcement-learning-for-1","title":"Accelerated Reinforcement Learning for Temporal Logic Control Objectives","date":"2022-05-09","arxiv_id":"2205.04424","repositories_listed":0,"syntology":null},{"url":null,"slug":"introduction-to-soar","title":"Introduction to Soar","date":"2022-05-08","arxiv_id":"2205.03854","repositories_listed":0,"syntology":null},{"url":null,"slug":"applications-of-reinforcement-learning-in","title":"Applications of Reinforcement Learning in Deregulated Power Market: A Comprehensive Review","date":"2022-05-07","arxiv_id":"2205.08369","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-adaptive-1","title":"Deep Reinforcement Learning-Based Adaptive IRS Control with Limited Feedback Codebooks","date":"2022-05-07","arxiv_id":"2205.03636","repositories_listed":0,"syntology":null},{"url":null,"slug":"search-based-testing-of-reinforcement","title":"Search-Based Testing of Reinforcement Learning","date":"2022-05-07","arxiv_id":"2205.04887","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-based-sliding","title":"A Deep Reinforcement Learning-based Sliding Mode Control Design for Partially-known Nonlinear Systems","date":"2022-05-06","arxiv_id":"2205.02975","repositories_listed":0,"syntology":null},{"url":null,"slug":"alternating-good-for-mdp-automata","title":"Alternating Good-for-MDP Automata","date":"2022-05-06","arxiv_id":"2205.03243","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamically-writing-coupled-memories-using-a","title":"Dynamically writing coupled memories using a reinforcement learning agent, meeting physical bounds","date":"2022-05-06","arxiv_id":"2205.03471","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-oriented-next-best-activity","title":"Goal-Oriented Next Best Activity Recommendation using Reinforcement Learning","date":"2022-05-06","arxiv_id":"2205.03219","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-spend-your-robot-time-bridging","title":"How to Spend Your Robot Time: Bridging Kickstarting and Offline Reinforcement Learning for Vision-based Robotic Manipulation","date":"2022-05-06","arxiv_id":"2205.03353","repositories_listed":0,"syntology":null},{"url":null,"slug":"juno-jump-start-reinforcement-learning-based","title":"JUNO: Jump-Start Reinforcement Learning-based Node Selection for UWB Indoor Localization","date":"2022-05-06","arxiv_id":"2205.08422","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-approach-to-estimation","title":"Reinforcement Learning Approach to Estimation in Linear Systems","date":"2022-05-06","arxiv_id":"2205.03504","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-framework-for-5","title":"A Deep Reinforcement Learning Framework for Rapid Diagnosis of Whole Slide Pathological Images","date":"2022-05-05","arxiv_id":"2205.02850","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-temporal-pattern-backdoor-attack-to-deep","title":"A Temporal-Pattern Backdoor Attack to Deep Reinforcement Learning","date":"2022-05-05","arxiv_id":"2205.02589","repositories_listed":0,"syntology":null},{"url":null,"slug":"general-sum-stochastic-games-with-networked","title":"General sum stochastic games with networked information flows","date":"2022-05-05","arxiv_id":"2205.02760","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-methods-for-sampling-transition","title":"Generative methods for sampling transition paths in molecular dynamics","date":"2022-05-05","arxiv_id":"2205.02818","repositories_listed":0,"syntology":null},{"url":null,"slug":"ldsa-learning-dynamic-subtask-assignment-in","title":"LDSA: Learning Dynamic Subtask Assignment in Cooperative Multi-Agent Reinforcement Learning","date":"2022-05-05","arxiv_id":"2205.02561","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-in","title":"Multi-Agent Deep Reinforcement Learning in Vehicular OCC","date":"2022-05-05","arxiv_id":"2205.02672","repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimism-meets-vcg-learning-dynamic","title":"Pessimism meets VCG: Learning Dynamic Mechanism Design via Offline Reinforcement Learning","date":"2022-05-05","arxiv_id":"2205.02450","repositories_listed":0,"syntology":null},{"url":null,"slug":"rapid-locomotion-via-reinforcement-learning","title":"Rapid Locomotion via Reinforcement Learning","date":"2022-05-05","arxiv_id":"2205.02824","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-benefits-of-teams-in-multiagent","title":"Exploring the Benefits of Teams in Multiagent Learning","date":"2022-05-04","arxiv_id":"2205.02328","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-subgoal-robot-navigation-in-crowds-with","title":"Multi-subgoal Robot Navigation in Crowds with History Information and Interactions","date":"2022-05-04","arxiv_id":"2205.02003","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-representation-learning-for-goal","title":"State Representation Learning for Goal-Conditioned Reinforcement Learning","date":"2022-05-04","arxiv_id":"2205.01965","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-deep-reinforcement-learning-to-solve","title":"Using Deep Reinforcement Learning to solve Optimal Power Flow problem with generator failures","date":"2022-05-04","arxiv_id":"2205.02108","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-cognition-an-inverse-inverse","title":"Meta-Cognition. An Inverse-Inverse Reinforcement Learning Approach for Cognitive Radars","date":"2022-05-03","arxiv_id":"2205.01794","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-attack-over-the-deep-reinforcement","title":"Deep-Attack over the Deep Reinforcement Learning","date":"2022-05-02","arxiv_id":"2205.00807","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-in-deep-reinforcement-learning-a-1","title":"Exploration in Deep Reinforcement Learning: A Survey","date":"2022-05-02","arxiv_id":"2205.00824","repositories_listed":0,"syntology":null},{"url":null,"slug":"triangular-dropout-variable-network-width-1","title":"Triangular Dropout: Variable Network Width without Retraining","date":"2022-05-02","arxiv_id":"2205.01235","repositories_listed":0,"syntology":null},{"url":null,"slug":"caspi-causal-aware-safe-policy-improvement","title":"[CASPI] Causal-aware Safe Policy Improvement for Task-oriented Dialogue","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-control-of-spatiotemporal-chaos","title":"Data-driven control of spatiotemporal chaos with reduced-order neural ODE-based models and reinforcement learning","date":"2022-05-01","arxiv_id":"2205.00579","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-question-rewrites-in","title":"Integrating Question Rewrites in Conversational Question Answering: A Reinforcement Learning Approach","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-user-defined-sub-goals-using-memory","title":"Learning user-defined sub-goals using memory editing in reinforcement learning","date":"2022-05-01","arxiv_id":"2205.00399","repositories_listed":0,"syntology":null},{"url":null,"slug":"processing-network-controls-via-deep","title":"Processing Network Controls via Deep Reinforcement Learning","date":"2022-05-01","arxiv_id":"2205.02119","repositories_listed":0,"syntology":null},{"url":null,"slug":"rewarding-semantic-similarity-under-optimized","title":"Rewarding Semantic Similarity under Optimized Alignments for AMR-to-Text Generation","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stable-reinforcement-learning-for-optimal","title":"Stable Reinforcement Learning for Optimal Frequency Control: A Distributed Averaging-Based Integral Approach","date":"2022-05-01","arxiv_id":"2205.00411","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-reinforcement-learning-for","title":"Unsupervised Reinforcement Learning for Transferable Manipulation Skill Discovery","date":"2022-04-29","arxiv_id":"2204.13906","repositories_listed":0,"syntology":null},{"url":null,"slug":"actor-critic-scheduling-for-path-aware-air-to","title":"Actor-Critic Scheduling for Path-Aware Air-to-Ground Multipath Multimedia Delivery","date":"2022-04-28","arxiv_id":"2204.13343","repositories_listed":0,"syntology":null},{"url":null,"slug":"riscless-a-reinforcement-learning-strategy-to","title":"RISCLESS: A Reinforcement Learning Strategy to Exploit Unused Cloud Resources","date":"2022-04-28","arxiv_id":"2205.08350","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-compositional-generalization-in-object","title":"Toward Compositional Generalization in Object-Oriented World Modeling","date":"2022-04-28","arxiv_id":"2204.13661","repositories_listed":0,"syntology":null},{"url":null,"slug":"bisimulation-makes-analogies-in-goal","title":"Bisimulation Makes Analogies in Goal-Conditioned Reinforcement Learning","date":"2022-04-27","arxiv_id":"2204.13060","repositories_listed":0,"syntology":null},{"url":null,"slug":"relational-abstractions-for-generalized","title":"Relational Abstractions for Generalized Reinforcement Learning on Symbolic Problems","date":"2022-04-27","arxiv_id":"2204.12665","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-efficient-dynamic-sampling-policy-for","title":"An Efficient Dynamic Sampling Policy For Monte Carlo Tree Search","date":"2022-04-26","arxiv_id":"2204.12043","repositories_listed":0,"syntology":null},{"url":null,"slug":"bats-best-action-trajectory-stitching","title":"BATS: Best Action Trajectory Stitching","date":"2022-04-26","arxiv_id":"2204.12026","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-eco-driving-strategies-at-signalized","title":"Learning Eco-Driving Strategies at Signalized Intersections","date":"2022-04-26","arxiv_id":"2204.12561","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-online-3","title":"Deep Reinforcement Learning for Online Routing of Unmanned Aerial Vehicles with Wireless Power Transfer","date":"2022-04-25","arxiv_id":"2204.11477","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-orienteering","title":"Deep Reinforcement Learning for Orienteering Problems Based on Decomposition","date":"2022-04-25","arxiv_id":"2204.11575","repositories_listed":0,"syntology":null},{"url":null,"slug":"skill-based-meta-reinforcement-learning-1","title":"Skill-based Meta-Reinforcement Learning","date":"2022-04-25","arxiv_id":"2204.11828","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-induced-representation-learning-1","title":"Task-Induced Representation Learning","date":"2022-04-25","arxiv_id":"2204.11827","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-radio","title":"Deep Reinforcement Learning-based Radio Resource Allocation and Beam Management under Location Uncertainty in 5G mmWave Networks","date":"2022-04-23","arxiv_id":"2204.10984","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-neural-network-based-agent-in-google","title":"Graph Neural Network based Agent in Google Research Football","date":"2022-04-23","arxiv_id":"2204.11142","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-temporal-difference-learning","title":"Finite-Time Analysis of Temporal Difference Learning: Discrete-Time Linear System Perspective","date":"2022-04-22","arxiv_id":"2204.10479","repositories_listed":0,"syntology":null},{"url":null,"slug":"tasac-a-twin-actor-reinforcement-learning","title":"TASAC: a twin-actor reinforcement learning framework with stochastic policy for batch process control","date":"2022-04-22","arxiv_id":"2204.10685","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-how-to-interact-with-a-complex","title":"Learning how to Interact with a Complex Interface using Hierarchical Reinforcement Learning","date":"2022-04-21","arxiv_id":"2204.10374","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-nitrogen-management-with-deep","title":"Optimizing Nitrogen Management with Deep Reinforcement Learning and Crop Simulations","date":"2022-04-21","arxiv_id":"2204.10394","repositories_listed":0,"syntology":null},{"url":null,"slug":"resilient-robot-teams-a-review-integrating","title":"Resilient robot teams: a review integrating decentralised control, change-detection, and learning","date":"2022-04-21","arxiv_id":"2204.10063","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hierarchical-bayesian-approach-to-inverse-1","title":"A Hierarchical Bayesian Approach to Inverse Reinforcement Learning with Symbolic Reward Machines","date":"2022-04-20","arxiv_id":"2204.09772","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-learning-for-distributed-energy","title":"Federated Learning for Distributed Energy-Efficient Resource Allocation","date":"2022-04-20","arxiv_id":"2204.09602","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-learning-of-reward-machines-and","title":"Joint Learning of Reward Machines and Policies in Environments with Partially Known Semantics","date":"2022-04-20","arxiv_id":"2204.11833","repositories_listed":0,"syntology":null},{"url":null,"slug":"mingling-foresight-with-imagination-model","title":"Mingling Foresight with Imagination: Model-Based Cooperative Multi-Agent Reinforcement Learning","date":"2022-04-20","arxiv_id":"2204.09418","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-intrinsic","title":"Reinforcement Learning with Intrinsic Affinity for Personalized Prosperity Management","date":"2022-04-20","arxiv_id":"2204.09218","repositories_listed":0,"syntology":null},{"url":null,"slug":"saac-safe-reinforcement-learning-as-an","title":"SAAC: Safe Reinforcement Learning as an Adversarial Game of Actor-Critics","date":"2022-04-20","arxiv_id":"2204.09424","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-for-1","title":"Reinforcement Learning from Partial Observation: Linear Function Approximation with Provable Sample Efficiency","date":"2022-04-20","arxiv_id":"2204.09787","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-and-preventing-capacity-loss-in-1","title":"Understanding and Preventing Capacity Loss in Reinforcement Learning","date":"2022-04-20","arxiv_id":"2204.09560","repositories_listed":0,"syntology":null},{"url":null,"slug":"network-topology-optimization-via-deep","title":"Network Topology Optimization via Deep Reinforcement Learning","date":"2022-04-19","arxiv_id":"2204.14133","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-is-partially-observable-reinforcement","title":"When Is Partially Observable Reinforcement Learning Not Scary?","date":"2022-04-19","arxiv_id":"2204.08967","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-prioritization-through-1","title":"INFOrmation Prioritization through EmPOWERment in Visual Model-Based RL","date":"2022-04-18","arxiv_id":"2204.08585","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-tensor-network-contraction-using","title":"Optimizing Tensor Network Contraction Using Reinforcement Learning","date":"2022-04-18","arxiv_id":"2204.09052","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-and-evaluation-of-deep-policies","title":"Training and Evaluation of Deep Policies using Reinforcement Learning and Generative Models","date":"2022-04-18","arxiv_id":"2204.08573","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-transfer-role-assignment-across","title":"Learning to Transfer Role Assignment Across Team Sizes","date":"2022-04-17","arxiv_id":"2204.12937","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-charging-power-forecast-of-evcs","title":"Probabilistic Charging Power Forecast of EVCS: Reinforcement Learning Assisted Deep Learning Approach","date":"2022-04-17","arxiv_id":"2204.07905","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-comprehensive-testing-on-the","title":"Towards Comprehensive Testing on the Robustness of Cooperative Multi-agent Reinforcement Learning","date":"2022-04-17","arxiv_id":"2204.07932","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-bayesian-policy-reuse-with-a","title":"Efficient Bayesian Policy Reuse with a Scalable Observation Model in Deep Reinforcement Learning","date":"2022-04-16","arxiv_id":"2204.07729","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforcement-learning-for","title":"Efficient Reinforcement Learning for Unsupervised Controlled Text Generation","date":"2022-04-16","arxiv_id":"2204.07696","repositories_listed":0,"syntology":null},{"url":null,"slug":"cryorl-reinforcement-learning-enables","title":"CryoRL: Reinforcement Learning Enables Efficient Cryo-EM Data Collection","date":"2022-04-15","arxiv_id":"2204.07543","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-importance-of-credo-in-multiagent","title":"The Importance of Credo in Multiagent Learning","date":"2022-04-15","arxiv_id":"2204.07471","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-and-practical-quantum-compiler","title":"Efficient and practical quantum compiler towards multi-qubit systems with deep reinforcement learning","date":"2022-04-14","arxiv_id":"2204.06904","repositories_listed":0,"syntology":null},{"url":null,"slug":"methodical-advice-collection-and-reuse-in","title":"Methodical Advice Collection and Reuse in Deep Reinforcement Learning","date":"2022-04-14","arxiv_id":"2204.07254","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-policy-recommendation","title":"Reinforcement Learning Policy Recommendation for Interbank Network Stability","date":"2022-04-14","arxiv_id":"2204.07134","repositories_listed":0,"syntology":null},{"url":null,"slug":"flexible-multiple-objective-reinforcement","title":"Flexible Multiple-Objective Reinforcement Learning for Chip Placement","date":"2022-04-13","arxiv_id":"2204.06407","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-adaptability-to-new-environments","title":"Improving generalization to new environments and removing catastrophic forgetting in Reinforcement Learning by using an eco-system of agents","date":"2022-04-13","arxiv_id":"2204.06550","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-feature-swapping-for-generalization-in-1","title":"Local Feature Swapping for Generalization in Reinforcement Learning","date":"2022-04-13","arxiv_id":"2204.06355","repositories_listed":0,"syntology":null},{"url":null,"slug":"modularity-benefits-reinforcement-learning","title":"Modularity benefits reinforcement learning agents with competing homeostatic drives","date":"2022-04-13","arxiv_id":"2204.06608","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-critical-sequence-training-for-automatic","title":"Self-critical Sequence Training for Automatic Speech Recognition","date":"2022-04-13","arxiv_id":"2204.06260","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-6","title":"A Reinforcement Learning Approach for Electric Vehicle Routing Problem with Vehicle-to-Grid Supply","date":"2022-04-12","arxiv_id":"2204.05545","repositories_listed":0,"syntology":null}],"record_sha256":"dca2b19615147e02d60709546ad29f90387d59bb3fe552bc37089bd257b69330","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}