{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/81","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":81,"pages_in_order":135,"rows_per_page":100,"rows":[8001,8100],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/80","next":"/task/reinforcement-learning-2/papers/82","papers":[{"url":null,"slug":"q-munchausen-reinforcement-learning","title":"$q$-Munchausen Reinforcement Learning","date":"2022-05-16","arxiv_id":"2205.07467","repositories_listed":0,"syntology":null},{"url":null,"slug":"qualitative-differences-between-evolutionary","title":"Qualitative Differences Between Evolutionary Strategies and Reinforcement Learning Methods for Control of Autonomous Agents","date":"2022-05-16","arxiv_id":"2205.07592","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-reinforcement-learning-based-logic","title":"Rethinking Reinforcement Learning based Logic Synthesis","date":"2022-05-16","arxiv_id":"2205.07614","repositories_listed":0,"syntology":null},{"url":null,"slug":"taming-continuous-posteriors-for-latent","title":"Taming Continuous Posteriors for Latent Variational Dialogue Policies","date":"2022-05-16","arxiv_id":"2205.07633","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-on-sky-adaptive-optics-control-using","title":"Towards on-sky adaptive optics control using reinforcement learning","date":"2022-05-16","arxiv_id":"2205.07554","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-method-for-robust","title":"Policy Gradient Method For Robust Reinforcement Learning","date":"2022-05-15","arxiv_id":"2205.07344","repositories_listed":0,"syntology":null},{"url":null,"slug":"romfac-a-robust-mean-field-actor-critic","title":"RoMFAC: A robust mean-field actor-critic reinforcement learning against adversarial perturbations on states","date":"2022-05-15","arxiv_id":"2205.07229","repositories_listed":0,"syntology":null},{"url":"/paper/cliff-diving-exploring-reward-surfaces-in","slug":"cliff-diving-exploring-reward-surfaces-in","title":"Cliff Diving: Exploring Reward Surfaces in Reinforcement Learning Environments","date":"2022-05-14","arxiv_id":"2205.07015","repositories_listed":0,"syntology":{"n":4,"n_ran":2,"n_constructed":0,"n_ran_checked":1,"n_instrument":1,"n_unverified":2,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/cliff-diving-exploring-reward-surfaces-in#ran","syntology_url":"https://syntology.ai/paper/2205.07015","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2205.07015"}},"official":null}},{"url":null,"slug":"prefixrl-optimization-of-parallel-prefix","title":"PrefixRL: Optimization of Parallel Prefix Circuits using Deep Reinforcement Learning","date":"2022-05-14","arxiv_id":"2205.07000","repositories_listed":0,"syntology":null},{"url":null,"slug":"qhd-a-brain-inspired-hyperdimensional","title":"Efficient Off-Policy Reinforcement Learning via Brain-Inspired Computing","date":"2022-05-14","arxiv_id":"2205.06978","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-in-mmw-noma-joint","title":"Deep Reinforcement Learning in mmW-NOMA: Joint Power Allocation and Hybrid Beamforming","date":"2022-05-13","arxiv_id":"2205.06814","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergent-bartering-behaviour-in-multi-agent","title":"Emergent Bartering Behaviour in Multi-Agent Reinforcement Learning","date":"2022-05-13","arxiv_id":"2205.06760","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-safe-reinforcement-learning-a","title":"Provably Safe Reinforcement Learning: Conceptual Analysis, Survey, and Benchmarking","date":"2022-05-13","arxiv_id":"2205.06750","repositories_listed":0,"syntology":null},{"url":null,"slug":"contingency-constrained-economic-dispatch","title":"Contingency-constrained economic dispatch with safe reinforcement learning","date":"2022-05-12","arxiv_id":"2205.06212","repositories_listed":0,"syntology":null},{"url":null,"slug":"controlling-chaotic-itinerancy-in-laser","title":"Controlling chaotic itinerancy in laser dynamics for reinforcement learning","date":"2022-05-12","arxiv_id":"2205.05987","repositories_listed":0,"syntology":null},{"url":null,"slug":"economical-precise-manipulation-and-auto-eye","title":"Economical Precise Manipulation and Auto Eye-Hand Coordination with Binocular Visual Reinforcement Learning","date":"2022-05-12","arxiv_id":"2205.05963","repositories_listed":0,"syntology":null},{"url":null,"slug":"feature-and-instance-joint-selection-a","title":"Feature and Instance Joint Selection: A Reinforcement Learning Perspective","date":"2022-05-12","arxiv_id":"2205.07867","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-safe-deep-reinforcement-learning-for","title":"Provably Safe Deep Reinforcement Learning for Robotic Manipulation in Human Environments","date":"2022-05-12","arxiv_id":"2205.06311","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-model-based-safety-and-model-free","title":"Bridging Model-based Safety and Model-free Reinforcement Learning through System Identification of Low Dimensional Linear Models","date":"2022-05-11","arxiv_id":"2205.05787","repositories_listed":0,"syntology":null},{"url":null,"slug":"delayed-reinforcement-learning-by-imitation","title":"Delayed Reinforcement Learning by Imitation","date":"2022-05-11","arxiv_id":"2205.05569","repositories_listed":0,"syntology":null},{"url":null,"slug":"developing-cooperative-policies-for-multi-1","title":"Developing cooperative policies for multi-stage reinforcement learning tasks","date":"2022-05-11","arxiv_id":"2205.05230","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-distributed-framework-for","title":"Efficient Distributed Framework for Collaborative Multi-Agent Reinforcement Learning","date":"2022-05-11","arxiv_id":"2205.05248","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-analysis-of-constant-step-size-q","title":"Final Iteration Convergence Bound of Q-Learning: Switching System Approach","date":"2022-05-11","arxiv_id":"2205.05455","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-guide-multiple-heterogeneous","title":"Learning to Guide Multiple Heterogeneous Actors from a Single Human Demonstration via Automatic Curriculum Learning in StarCraft II","date":"2022-05-11","arxiv_id":"2205.05784","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-reinforcement-learning-for-star-riss-a","title":"Hybrid Reinforcement Learning for STAR-RISs: A Coupled Phase-Shift Model Based Beamformer","date":"2022-05-10","arxiv_id":"2205.05029","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-reinforcement-learning-for-1","title":"Accelerated Reinforcement Learning for Temporal Logic Control Objectives","date":"2022-05-09","arxiv_id":"2205.04424","repositories_listed":0,"syntology":null},{"url":null,"slug":"applications-of-reinforcement-learning-in","title":"Applications of Reinforcement Learning in Deregulated Power Market: A Comprehensive Review","date":"2022-05-07","arxiv_id":"2205.08369","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-adaptive-1","title":"Deep Reinforcement Learning-Based Adaptive IRS Control with Limited Feedback Codebooks","date":"2022-05-07","arxiv_id":"2205.03636","repositories_listed":0,"syntology":null},{"url":null,"slug":"search-based-testing-of-reinforcement","title":"Search-Based Testing of Reinforcement Learning","date":"2022-05-07","arxiv_id":"2205.04887","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamically-writing-coupled-memories-using-a","title":"Dynamically writing coupled memories using a reinforcement learning agent, meeting physical bounds","date":"2022-05-06","arxiv_id":"2205.03471","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-oriented-next-best-activity","title":"Goal-Oriented Next Best Activity Recommendation using Reinforcement Learning","date":"2022-05-06","arxiv_id":"2205.03219","repositories_listed":0,"syntology":null},{"url":null,"slug":"juno-jump-start-reinforcement-learning-based","title":"JUNO: Jump-Start Reinforcement Learning-based Node Selection for UWB Indoor Localization","date":"2022-05-06","arxiv_id":"2205.08422","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-approach-to-estimation","title":"Reinforcement Learning Approach to Estimation in Linear Systems","date":"2022-05-06","arxiv_id":"2205.03504","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-framework-for-5","title":"A Deep Reinforcement Learning Framework for Rapid Diagnosis of Whole Slide Pathological Images","date":"2022-05-05","arxiv_id":"2205.02850","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-temporal-pattern-backdoor-attack-to-deep","title":"A Temporal-Pattern Backdoor Attack to Deep Reinforcement Learning","date":"2022-05-05","arxiv_id":"2205.02589","repositories_listed":0,"syntology":null},{"url":null,"slug":"general-sum-stochastic-games-with-networked","title":"General sum stochastic games with networked information flows","date":"2022-05-05","arxiv_id":"2205.02760","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-methods-for-sampling-transition","title":"Generative methods for sampling transition paths in molecular dynamics","date":"2022-05-05","arxiv_id":"2205.02818","repositories_listed":0,"syntology":null},{"url":null,"slug":"ldsa-learning-dynamic-subtask-assignment-in","title":"LDSA: Learning Dynamic Subtask Assignment in Cooperative Multi-Agent Reinforcement Learning","date":"2022-05-05","arxiv_id":"2205.02561","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-in","title":"Multi-Agent Deep Reinforcement Learning in Vehicular OCC","date":"2022-05-05","arxiv_id":"2205.02672","repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimism-meets-vcg-learning-dynamic","title":"Pessimism meets VCG: Learning Dynamic Mechanism Design via Offline Reinforcement Learning","date":"2022-05-05","arxiv_id":"2205.02450","repositories_listed":0,"syntology":null},{"url":null,"slug":"rapid-locomotion-via-reinforcement-learning","title":"Rapid Locomotion via Reinforcement Learning","date":"2022-05-05","arxiv_id":"2205.02824","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-subgoal-robot-navigation-in-crowds-with","title":"Multi-subgoal Robot Navigation in Crowds with History Information and Interactions","date":"2022-05-04","arxiv_id":"2205.02003","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-representation-learning-for-goal","title":"State Representation Learning for Goal-Conditioned Reinforcement Learning","date":"2022-05-04","arxiv_id":"2205.01965","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-deep-reinforcement-learning-to-solve","title":"Using Deep Reinforcement Learning to solve Optimal Power Flow problem with generator failures","date":"2022-05-04","arxiv_id":"2205.02108","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-cognition-an-inverse-inverse","title":"Meta-Cognition. An Inverse-Inverse Reinforcement Learning Approach for Cognitive Radars","date":"2022-05-03","arxiv_id":"2205.01794","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-attack-over-the-deep-reinforcement","title":"Deep-Attack over the Deep Reinforcement Learning","date":"2022-05-02","arxiv_id":"2205.00807","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-in-deep-reinforcement-learning-a-1","title":"Exploration in Deep Reinforcement Learning: A Survey","date":"2022-05-02","arxiv_id":"2205.00824","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-question-rewrites-in","title":"Integrating Question Rewrites in Conversational Question Answering: A Reinforcement Learning Approach","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-user-defined-sub-goals-using-memory","title":"Learning user-defined sub-goals using memory editing in reinforcement learning","date":"2022-05-01","arxiv_id":"2205.00399","repositories_listed":0,"syntology":null},{"url":null,"slug":"processing-network-controls-via-deep","title":"Processing Network Controls via Deep Reinforcement Learning","date":"2022-05-01","arxiv_id":"2205.02119","repositories_listed":0,"syntology":null},{"url":null,"slug":"stable-reinforcement-learning-for-optimal","title":"Stable Reinforcement Learning for Optimal Frequency Control: A Distributed Averaging-Based Integral Approach","date":"2022-05-01","arxiv_id":"2205.00411","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-reinforcement-learning-for","title":"Unsupervised Reinforcement Learning for Transferable Manipulation Skill Discovery","date":"2022-04-29","arxiv_id":"2204.13906","repositories_listed":0,"syntology":null},{"url":null,"slug":"riscless-a-reinforcement-learning-strategy-to","title":"RISCLESS: A Reinforcement Learning Strategy to Exploit Unused Cloud Resources","date":"2022-04-28","arxiv_id":"2205.08350","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-compositional-generalization-in-object","title":"Toward Compositional Generalization in Object-Oriented World Modeling","date":"2022-04-28","arxiv_id":"2204.13661","repositories_listed":0,"syntology":null},{"url":null,"slug":"bisimulation-makes-analogies-in-goal","title":"Bisimulation Makes Analogies in Goal-Conditioned Reinforcement Learning","date":"2022-04-27","arxiv_id":"2204.13060","repositories_listed":0,"syntology":null},{"url":null,"slug":"relational-abstractions-for-generalized","title":"Relational Abstractions for Generalized Reinforcement Learning on Symbolic Problems","date":"2022-04-27","arxiv_id":"2204.12665","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-efficient-dynamic-sampling-policy-for","title":"An Efficient Dynamic Sampling Policy For Monte Carlo Tree Search","date":"2022-04-26","arxiv_id":"2204.12043","repositories_listed":0,"syntology":null},{"url":null,"slug":"bats-best-action-trajectory-stitching","title":"BATS: Best Action Trajectory Stitching","date":"2022-04-26","arxiv_id":"2204.12026","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-online-3","title":"Deep Reinforcement Learning for Online Routing of Unmanned Aerial Vehicles with Wireless Power Transfer","date":"2022-04-25","arxiv_id":"2204.11477","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-orienteering","title":"Deep Reinforcement Learning for Orienteering Problems Based on Decomposition","date":"2022-04-25","arxiv_id":"2204.11575","repositories_listed":0,"syntology":null},{"url":null,"slug":"skill-based-meta-reinforcement-learning-1","title":"Skill-based Meta-Reinforcement Learning","date":"2022-04-25","arxiv_id":"2204.11828","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-radio","title":"Deep Reinforcement Learning-based Radio Resource Allocation and Beam Management under Location Uncertainty in 5G mmWave Networks","date":"2022-04-23","arxiv_id":"2204.10984","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-neural-network-based-agent-in-google","title":"Graph Neural Network based Agent in Google Research Football","date":"2022-04-23","arxiv_id":"2204.11142","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-how-to-interact-with-a-complex","title":"Learning how to Interact with a Complex Interface using Hierarchical Reinforcement Learning","date":"2022-04-21","arxiv_id":"2204.10374","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-nitrogen-management-with-deep","title":"Optimizing Nitrogen Management with Deep Reinforcement Learning and Crop Simulations","date":"2022-04-21","arxiv_id":"2204.10394","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hierarchical-bayesian-approach-to-inverse-1","title":"A Hierarchical Bayesian Approach to Inverse Reinforcement Learning with Symbolic Reward Machines","date":"2022-04-20","arxiv_id":"2204.09772","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-learning-for-distributed-energy","title":"Federated Learning for Distributed Energy-Efficient Resource Allocation","date":"2022-04-20","arxiv_id":"2204.09602","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-learning-of-reward-machines-and","title":"Joint Learning of Reward Machines and Policies in Environments with Partially Known Semantics","date":"2022-04-20","arxiv_id":"2204.11833","repositories_listed":0,"syntology":null},{"url":null,"slug":"mingling-foresight-with-imagination-model","title":"Mingling Foresight with Imagination: Model-Based Cooperative Multi-Agent Reinforcement Learning","date":"2022-04-20","arxiv_id":"2204.09418","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-intrinsic","title":"Reinforcement Learning with Intrinsic Affinity for Personalized Prosperity Management","date":"2022-04-20","arxiv_id":"2204.09218","repositories_listed":0,"syntology":null},{"url":null,"slug":"saac-safe-reinforcement-learning-as-an","title":"SAAC: Safe Reinforcement Learning as an Adversarial Game of Actor-Critics","date":"2022-04-20","arxiv_id":"2204.09424","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-for-1","title":"Reinforcement Learning from Partial Observation: Linear Function Approximation with Provable Sample Efficiency","date":"2022-04-20","arxiv_id":"2204.09787","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-and-preventing-capacity-loss-in-1","title":"Understanding and Preventing Capacity Loss in Reinforcement Learning","date":"2022-04-20","arxiv_id":"2204.09560","repositories_listed":0,"syntology":null},{"url":null,"slug":"network-topology-optimization-via-deep","title":"Network Topology Optimization via Deep Reinforcement Learning","date":"2022-04-19","arxiv_id":"2204.14133","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-is-partially-observable-reinforcement","title":"When Is Partially Observable Reinforcement Learning Not Scary?","date":"2022-04-19","arxiv_id":"2204.08967","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-tensor-network-contraction-using","title":"Optimizing Tensor Network Contraction Using Reinforcement Learning","date":"2022-04-18","arxiv_id":"2204.09052","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-and-evaluation-of-deep-policies","title":"Training and Evaluation of Deep Policies using Reinforcement Learning and Generative Models","date":"2022-04-18","arxiv_id":"2204.08573","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-transfer-role-assignment-across","title":"Learning to Transfer Role Assignment Across Team Sizes","date":"2022-04-17","arxiv_id":"2204.12937","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-charging-power-forecast-of-evcs","title":"Probabilistic Charging Power Forecast of EVCS: Reinforcement Learning Assisted Deep Learning Approach","date":"2022-04-17","arxiv_id":"2204.07905","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-comprehensive-testing-on-the","title":"Towards Comprehensive Testing on the Robustness of Cooperative Multi-agent Reinforcement Learning","date":"2022-04-17","arxiv_id":"2204.07932","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-bayesian-policy-reuse-with-a","title":"Efficient Bayesian Policy Reuse with a Scalable Observation Model in Deep Reinforcement Learning","date":"2022-04-16","arxiv_id":"2204.07729","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforcement-learning-for","title":"Efficient Reinforcement Learning for Unsupervised Controlled Text Generation","date":"2022-04-16","arxiv_id":"2204.07696","repositories_listed":0,"syntology":null},{"url":null,"slug":"cryorl-reinforcement-learning-enables","title":"CryoRL: Reinforcement Learning Enables Efficient Cryo-EM Data Collection","date":"2022-04-15","arxiv_id":"2204.07543","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-importance-of-credo-in-multiagent","title":"The Importance of Credo in Multiagent Learning","date":"2022-04-15","arxiv_id":"2204.07471","repositories_listed":0,"syntology":null},{"url":null,"slug":"d3pg-dirichlet-ddpg-for-task-partitioning-and","title":"D3PG: Dirichlet DDPG for Task Partitioning and Offloading With Constrained Hybrid Action Space in Mobile-Edge Computing","date":"2022-04-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-and-practical-quantum-compiler","title":"Efficient and practical quantum compiler towards multi-qubit systems with deep reinforcement learning","date":"2022-04-14","arxiv_id":"2204.06904","repositories_listed":0,"syntology":null},{"url":null,"slug":"methodical-advice-collection-and-reuse-in","title":"Methodical Advice Collection and Reuse in Deep Reinforcement Learning","date":"2022-04-14","arxiv_id":"2204.07254","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-policy-recommendation","title":"Reinforcement Learning Policy Recommendation for Interbank Network Stability","date":"2022-04-14","arxiv_id":"2204.07134","repositories_listed":0,"syntology":null},{"url":null,"slug":"flexible-multiple-objective-reinforcement","title":"Flexible Multiple-Objective Reinforcement Learning for Chip Placement","date":"2022-04-13","arxiv_id":"2204.06407","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-adaptability-to-new-environments","title":"Improving generalization to new environments and removing catastrophic forgetting in Reinforcement Learning by using an eco-system of agents","date":"2022-04-13","arxiv_id":"2204.06550","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-feature-swapping-for-generalization-in-1","title":"Local Feature Swapping for Generalization in Reinforcement Learning","date":"2022-04-13","arxiv_id":"2204.06355","repositories_listed":0,"syntology":null},{"url":null,"slug":"modularity-benefits-reinforcement-learning","title":"Modularity benefits reinforcement learning agents with competing homeostatic drives","date":"2022-04-13","arxiv_id":"2204.06608","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-analysis-of-discretization-methods-for","title":"An Analysis of Discretization Methods for Communication Learning with Multi-Agent Reinforcement Learning","date":"2022-04-12","arxiv_id":"2204.05669","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-dialogue-policy-transformer-for","title":"Dynamic Dialogue Policy for Continual Reinforcement Learning","date":"2022-04-12","arxiv_id":"2204.05928","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-coseg-a-novel-image-co-segmentation","title":"RL-CoSeg : A Novel Image Co-Segmentation Algorithm with Deep Reinforcement Learning","date":"2022-04-12","arxiv_id":"2204.05951","repositories_listed":0,"syntology":null},{"url":null,"slug":"smart-interference-management-xapp-using-deep","title":"Smart Interference Management xApp using Deep Reinforcement Learning","date":"2022-04-12","arxiv_id":"2204.09707","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-should-we-prefer-offline-reinforcement","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?","date":"2022-04-12","arxiv_id":"2204.05618","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-semi","title":"Deep Reinforcement Learning Based Semi-Autonomous Control for Robotic Surgery","date":"2022-04-11","arxiv_id":"2204.05433","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-vision-transformer-methods-for","title":"Evaluating Vision Transformer Methods for Deep Reinforcement Learning from Pixels","date":"2022-04-11","arxiv_id":"2204.04905","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-pareto-front-of-multi-objective","title":"Exploring the Pareto front of multi-objective COVID-19 mitigation policies using reinforcement learning","date":"2022-04-11","arxiv_id":"2204.05027","repositories_listed":0,"syntology":null}],"record_sha256":"bcf45a0f13a5cb03e8d77067c0209243e85da52d2586c5153662f02498ff3ac9","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}