{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/73","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":73,"pages_in_order":152,"rows_per_page":100,"rows":[7201,7300],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/72","next":"/task/reinforcement-learning-1/papers/74","papers":[{"url":null,"slug":"look-ahead-ac-optimal-power-flow-a-model","title":"Look-Ahead AC Optimal Power Flow: A Model-Informed Reinforcement Learning Approach","date":"2023-03-04","arxiv_id":"2303.02306","repositories_listed":0,"syntology":null},{"url":null,"slug":"wasserstein-actor-critic-directed-exploration","title":"Wasserstein Actor-Critic: Directed Exploration via Optimism for Continuous-Actions Control","date":"2023-03-04","arxiv_id":"2303.02378","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximating-energy-market-clearing-and","title":"Approximating Energy Market Clearing and Bidding With Model-Based Reinforcement Learning","date":"2023-03-03","arxiv_id":"2303.01772","repositories_listed":0,"syntology":null},{"url":null,"slug":"guarded-policy-optimization-with-imperfect","title":"Guarded Policy Optimization with Imperfect Online Demonstrations","date":"2023-03-03","arxiv_id":"2303.01728","repositories_listed":0,"syntology":null},{"url":null,"slug":"hindsight-states-blending-sim-and-real-task","title":"Hindsight States: Blending Sim and Real Task Elements for Efficient Reinforcement Learning","date":"2023-03-03","arxiv_id":"2303.02234","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-o-ran-traffic-steering-for-urllc","title":"Intelligent O-RAN Traffic Steering for URLLC Through Deep Reinforcement Learning","date":"2023-03-03","arxiv_id":"2303.01960","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-influence-human-behavior-with","title":"Learning to Influence Human Behavior with Offline Reinforcement Learning","date":"2023-03-03","arxiv_id":"2303.02265","repositories_listed":0,"syntology":null},{"url":null,"slug":"reprem-representation-pre-training-with","title":"RePreM: Representation Pre-training with Masked Model for Reinforcement Learning","date":"2023-03-03","arxiv_id":"2303.01668","repositories_listed":0,"syntology":null},{"url":null,"slug":"tile-networks-learning-optimal-geometric","title":"Tile Networks: Learning Optimal Geometric Layout for Whole-page Recommendation","date":"2023-03-03","arxiv_id":"2303.01671","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-risk-based-optimistic-exploration-for","title":"Toward Risk-based Optimistic Exploration for Cooperative Multi-Agent Reinforcement Learning","date":"2023-03-03","arxiv_id":"2303.01768","repositories_listed":0,"syntology":null},{"url":null,"slug":"co-learning-planning-and-control-policies","title":"Co-learning Planning and Control Policies Constrained by Differentiable Logic Specifications","date":"2023-03-02","arxiv_id":"2303.01346","repositories_listed":0,"syntology":null},{"url":null,"slug":"compensating-for-sensing-failures-via","title":"Compensating for Sensing Failures via Delegation in Human-AI Hybrid Systems","date":"2023-03-02","arxiv_id":"2303.01300","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-explainable-and-safe-payload","title":"Data-efficient, Explainable and Safe Box Manipulation: Illustrating the Advantages of Physical Priors in Model-Predictive Control","date":"2023-03-02","arxiv_id":"2303.01563","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adaptation-of-reinforcement-learning","title":"Domain Adaptation of Reinforcement Learning Agents based on Network Service Proximity","date":"2023-03-02","arxiv_id":"2303.01013","repositories_listed":0,"syntology":null},{"url":null,"slug":"expert-free-online-transfer-learning-in-multi","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","date":"2023-03-02","arxiv_id":"2303.01170","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-start-team-orienteering-problem-for-uas","title":"Multi-Start Team Orienteering Problem for UAS Mission Re-Planning with Data-Efficient Deep Reinforcement Learning","date":"2023-03-02","arxiv_id":"2303.01963","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-sharing-with-network-pruning-for","title":"Parameter Sharing with Network Pruning for Scalable Multi-Agent Deep Reinforcement Learning","date":"2023-03-02","arxiv_id":"2303.00912","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-labels-multi-agent-deep","title":"Reinforced Labels: Multi-Agent Deep Reinforcement Learning for Point-Feature Label Placement","date":"2023-03-02","arxiv_id":"2303.01388","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-constrained-station-keeping-for","title":"Resource-Constrained Station-Keeping for Helium Balloons using Reinforcement Learning","date":"2023-03-02","arxiv_id":"2303.01173","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-improving-robots-end-to-end-autonomous","title":"Self-Improving Robots: End-to-End Autonomous Visuomotor Reinforcement Learning","date":"2023-03-02","arxiv_id":"2303.01488","repositories_listed":0,"syntology":null},{"url":null,"slug":"t-cell-receptor-optimization-with","title":"T-Cell Receptor Optimization with Reinforcement Learning and Mutation Policies for Precesion Immunotherapy","date":"2023-03-02","arxiv_id":"2303.02162","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-ladder-in-chaos-a-simple-and-effective","title":"The Ladder in Chaos: A Simple and Effective Improvement to General DRL Algorithms by Policy Path Trimming and Boosting","date":"2023-03-02","arxiv_id":"2303.01391","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-trader-without","title":"A Deep Reinforcement Learning Trader without Offline Training","date":"2023-03-01","arxiv_id":"2303.00356","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-variational-approach-to-mutual-information","title":"A Variational Approach to Mutual Information-Based Coordination for Multi-Agent Reinforcement Learning","date":"2023-03-01","arxiv_id":"2303.00451","repositories_listed":0,"syntology":null},{"url":null,"slug":"ar3n-a-reinforcement-learning-based-assist-as","title":"AR3n: A Reinforcement Learning-based Assist-As-Needed Controller for Robotic Rehabilitation","date":"2023-02-28","arxiv_id":"2303.00085","repositories_listed":0,"syntology":null},{"url":null,"slug":"auxiliary-task-based-deep-reinforcement-1","title":"Auxiliary Task-based Deep Reinforcement Learning for Quantum Control","date":"2023-02-28","arxiv_id":"2302.14312","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-using-extra-safety","title":"Efficient Exploration Using Extra Safety Budget in Constrained Policy Optimization","date":"2023-02-28","arxiv_id":"2302.14339","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-reinforcement-learning-for-operator","title":"Graph Reinforcement Learning for Operator Selection in the ALNS Metaheuristic","date":"2023-02-28","arxiv_id":"2302.14678","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-in","title":"Hierarchical Reinforcement Learning in Complex 3D Environments","date":"2023-02-28","arxiv_id":"2302.14451","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimizing-the-outage-probability-in-a-markov","title":"Minimizing the Outage Probability in a Markov Decision Process","date":"2023-02-28","arxiv_id":"2302.14714","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-15","title":"Multi-Agent Reinforcement Learning for Pragmatic Communication and Control","date":"2023-02-28","arxiv_id":"2302.14399","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-optimization-of-llc-converter-with","title":"Parameter Optimization of LLC-Converter with multiple operation points using Reinforcement Learning","date":"2023-02-28","arxiv_id":"2303.00004","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-7","title":"A Reinforcement Learning Approach for Scheduling Problems With Improved Generalization Through Order Swapping","date":"2023-02-27","arxiv_id":"2302.13941","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-method-for-risk-averse","title":"Distributional Method for Risk Averse Reinforcement Learning","date":"2023-02-27","arxiv_id":"2302.14109","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-resource-allocation-for-metaverse","title":"Dynamic Resource Allocation for Metaverse Applications with Deep Reinforcement Learning","date":"2023-02-27","arxiv_id":"2302.13445","repositories_listed":0,"syntology":null},{"url":null,"slug":"exposure-based-multi-agent-inspection-of-a","title":"Exposure-Based Multi-Agent Inspection of a Tumbling Target Using Deep Reinforcement Learning","date":"2023-02-27","arxiv_id":"2302.14188","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-depreciating","title":"Reinforcement Learning with Depreciating Assets","date":"2023-02-27","arxiv_id":"2302.14176","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-provable-benefits-of-unsupervised-data","title":"The Provable Benefits of Unsupervised Data Sharing for Offline Reinforcement Learning","date":"2023-02-27","arxiv_id":"2302.13493","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-cogni-an-integrated-causal-reinforcement","title":"Q-Cogni: An Integrated Causal Reinforcement Learning Framework","date":"2023-02-26","arxiv_id":"2302.13240","repositories_listed":0,"syntology":null},{"url":null,"slug":"revolutionizing-genomics-with-reinforcement","title":"Revolutionizing Genomics with Reinforcement Learning Techniques","date":"2023-02-26","arxiv_id":"2302.13268","repositories_listed":0,"syntology":null},{"url":null,"slug":"sim-and-real-reinforcement-learning-for","title":"Sim-and-Real Reinforcement Learning for Manipulation: A Consensus-based Approach","date":"2023-02-26","arxiv_id":"2302.13423","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-human-centered-safe-robot-reinforcement","title":"A Human-Centered Safe Robot Reinforcement Learning Framework with Interactive Behaviors","date":"2023-02-25","arxiv_id":"2302.13137","repositories_listed":0,"syntology":null},{"url":null,"slug":"exponential-hardness-of-reinforcement","title":"Exponential Hardness of Reinforcement Learning with Linear Function Approximation","date":"2023-02-25","arxiv_id":"2302.12940","repositories_listed":0,"syntology":null},{"url":null,"slug":"limited-query-graph-connectivity-test","title":"Limited Query Graph Connectivity Test","date":"2023-02-25","arxiv_id":"2302.13036","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-bellman-s-principle-of-optimality-and","title":"On Bellman's principle of optimality and Reinforcement learning for safety-constrained Markov decision process","date":"2023-02-25","arxiv_id":"2302.13152","repositories_listed":0,"syntology":null},{"url":null,"slug":"ac2c-adaptively-controlled-two-hop","title":"AC2C: Adaptively Controlled Two-Hop Communication for Multi-Agent Reinforcement Learning","date":"2023-02-24","arxiv_id":"2302.12515","repositories_listed":0,"syntology":null},{"url":null,"slug":"finding-regularized-competitive-equilibria-of","title":"Finding Regularized Competitive Equilibria of Heterogeneous Agent Macroeconomic Models with Reinforcement Learning","date":"2023-02-24","arxiv_id":"2303.04833","repositories_listed":0,"syntology":null},{"url":null,"slug":"graphsr-a-data-augmentation-algorithm-for","title":"GraphSR: A Data Augmentation Algorithm for Imbalanced Node Classification","date":"2023-02-24","arxiv_id":"2302.12814","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-jumpy-models-for-planning-and-fast","title":"Leveraging Jumpy Models for Planning and Fast Learning in Robotic Domains","date":"2023-02-24","arxiv_id":"2302.12617","repositories_listed":0,"syntology":null},{"url":null,"slug":"logarithmic-switching-cost-in-reinforcement","title":"Logarithmic Switching Cost in Reinforcement Learning beyond Linear MDPs","date":"2023-02-24","arxiv_id":"2302.12456","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-5","title":"Multi-Agent Reinforcement Learning with Common Policy for Antenna Tilt Optimization","date":"2023-02-24","arxiv_id":"2302.12899","repositories_listed":0,"syntology":null},{"url":null,"slug":"concept-learning-for-interpretable-multi","title":"Concept Learning for Interpretable Multi-Agent Reinforcement Learning","date":"2023-02-23","arxiv_id":"2302.12232","repositories_listed":0,"syntology":null},{"url":null,"slug":"to-the-noise-and-back-diffusion-for-shared","title":"To the Noise and Back: Diffusion for Shared Autonomy","date":"2023-02-23","arxiv_id":"2302.12244","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-reinforcement-learning-via","title":"Provably Efficient Reinforcement Learning via Surprise Bound","date":"2023-02-22","arxiv_id":"2302.11634","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-decentralized-predictive-quality-of","title":"Towards Decentralized Predictive Quality of Service in Next-Generation Vehicular Networks","date":"2023-02-22","arxiv_id":"2302.11268","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-framework-for-online","title":"A Reinforcement Learning Framework for Online Speaker Diarization","date":"2023-02-21","arxiv_id":"2302.10924","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-model-for-offline-reinforcement","title":"Adversarial Model for Offline Reinforcement Learning","date":"2023-02-21","arxiv_id":"2302.11048","repositories_listed":0,"syntology":null},{"url":null,"slug":"badgpt-exploring-security-vulnerabilities-of","title":"BadGPT: Exploring Security Vulnerabilities of ChatGPT via Backdoor Attacks to InstructGPT","date":"2023-02-21","arxiv_id":"2304.12298","repositories_listed":0,"syntology":null},{"url":null,"slug":"conditioning-hierarchical-reinforcement","title":"Handling Long and Richly Constrained Tasks through Constrained Hierarchical Reinforcement Learning","date":"2023-02-21","arxiv_id":"2302.10639","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-reinforcement-learning-for-3","title":"Constrained Reinforcement Learning for Predictive Control in Real-Time Stochastic Dynamic Optimal Power Flow","date":"2023-02-21","arxiv_id":"2302.10382","repositories_listed":0,"syntology":null},{"url":null,"slug":"curiosity-driven-exploration-in-sparse-reward","title":"Curiosity-driven Exploration in Sparse-reward Multi-agent Reinforcement Learning","date":"2023-02-21","arxiv_id":"2302.10825","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-robotic-2","title":"Deep Reinforcement Learning for Robotic Pushing and Picking in Cluttered Environment","date":"2023-02-21","arxiv_id":"2302.10717","repositories_listed":0,"syntology":null},{"url":null,"slug":"kernel-based-distributed-q-learning-a","title":"Kernel-Based Distributed Q-Learning: A Scalable Reinforcement Learning Approach for Dynamic Treatment Regimes","date":"2023-02-21","arxiv_id":"2302.10434","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-for-mixture-of","title":"Offline Reinforcement Learning for Mixture-of-Expert Dialogue Management","date":"2023-02-21","arxiv_id":"2302.10850","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-exploration-in-quantum","title":"Provably Efficient Exploration in Quantum Reinforcement Learning with Logarithmic Worst-Case Regret","date":"2023-02-21","arxiv_id":"2302.10796","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-control-of-3","title":"Reinforcement Learning-based Control of Nonlinear Systems using Carleman Approximation: Structured and Unstructured Designs","date":"2023-02-21","arxiv_id":"2302.10864","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-block","title":"Reinforcement Learning for Block Decomposition of CAD Models","date":"2023-02-21","arxiv_id":"2302.11066","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-a-birth-and-death","title":"Reinforcement Learning in a Birth and Death Process: Breaking the Dependence on the State Space","date":"2023-02-21","arxiv_id":"2302.10667","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-auto-landing-control-of-an-agile","title":"Robust Auto-landing Control of an agile Regional Jet Using Fuzzy Q-learning","date":"2023-02-21","arxiv_id":"2302.10997","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-sustainable-internet-of-underwater","title":"Towards a Sustainable Internet-of-Underwater-Things based on AUVs, SWIPT, and Reinforcement Learning","date":"2023-02-21","arxiv_id":"2302.10368","repositories_listed":0,"syntology":null},{"url":null,"slug":"uav-path-planning-employing-mpc-reinforcement","title":"UAV Path Planning Employing MPC- Reinforcement Learning Method Considering Collision Avoidance","date":"2023-02-21","arxiv_id":"2302.10669","repositories_listed":0,"syntology":null},{"url":null,"slug":"backstepping-temporal-difference-learning","title":"Backstepping Temporal Difference Learning","date":"2023-02-20","arxiv_id":"2302.09875","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentiable-arbitrating-in-zero-sum-markov","title":"Differentiable Arbitrating in Zero-sum Markov Games","date":"2023-02-20","arxiv_id":"2302.10058","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-function","title":"Reinforcement Learning with Function Approximation: From Linear to Nonlinear","date":"2023-02-20","arxiv_id":"2302.09703","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-deep-reinforcement-learning-by-verifying","title":"Safe Deep Reinforcement Learning by Verifying Task-Level Properties","date":"2023-02-20","arxiv_id":"2302.10030","repositories_listed":0,"syntology":null},{"url":null,"slug":"autodoviz-human-centered-automation-for","title":"AutoDOViz: Human-Centered Automation for Decision Optimization","date":"2023-02-19","arxiv_id":"2302.09688","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositionality-and-bounds-for-optimal-value","title":"Compositionality and Bounds for Optimal Value Functions in Reinforcement Learning","date":"2023-02-19","arxiv_id":"2302.09676","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-video-corpus-moment-retrieval","title":"Interactive Video Corpus Moment Retrieval using Reinforcement Learning","date":"2023-02-19","arxiv_id":"2302.09522","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-and-versatile-bipedal-jumping-control","title":"Robust and Versatile Bipedal Jumping Control through Reinforcement Learning","date":"2023-02-19","arxiv_id":"2302.09450","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-multimodal-reinforcement-learning","title":"Effective Multimodal Reinforcement Learning with Modality Alignment and Importance Enhancement","date":"2023-02-18","arxiv_id":"2302.09318","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-via-epistemic-risk","title":"Efficient Exploration via Epistemic-Risk-Seeking Policy Optimization","date":"2023-02-18","arxiv_id":"2302.09339","repositories_listed":0,"syntology":null},{"url":null,"slug":"hope-human-centric-off-policy-evaluation-for","title":"HOPE: Human-Centric Off-Policy Evaluation for E-Learning and Healthcare","date":"2023-02-18","arxiv_id":"2302.09212","repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-language-conditioned-reinforcement","title":"Natural Language-conditioned Reinforcement Learning with Inside-out Task Language Development and Translation","date":"2023-02-18","arxiv_id":"2302.09368","repositories_listed":0,"syntology":null},{"url":null,"slug":"promoting-cooperation-in-multi-agent","title":"Promoting Cooperation in Multi-Agent Reinforcement Learning via Mutual Help","date":"2023-02-18","arxiv_id":"2302.09277","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-the-wild-with","title":"Reinforcement Learning in the Wild with Maximum Likelihood-based Model Transfer","date":"2023-02-18","arxiv_id":"2302.09273","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-state-augmentation-based-approach-to","title":"A State Augmentation based approach to Reinforcement Learning from Human Preferences","date":"2023-02-17","arxiv_id":"2302.08734","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-reward-initialization-for","title":"Data Driven Reward Initialization for Preference based Reinforcement Learning","date":"2023-02-17","arxiv_id":"2302.08733","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-mmwave","title":"Deep Reinforcement Learning for mmWave Initial Beam Alignment","date":"2023-02-17","arxiv_id":"2302.08969","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-unlabeled-data-for-feedback","title":"Exploiting Unlabeled Data for Feedback Efficient Human Preference based Reinforcement Learning","date":"2023-02-17","arxiv_id":"2302.08738","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-traffic-control-and-coordination-from","title":"Mixed Traffic Control and Coordination from Pixels","date":"2023-02-17","arxiv_id":"2302.09167","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-forecast-aleatoric-and-epistemic","title":"Learning to Forecast Aleatoric and Epistemic Uncertainties over Long Horizon Trajectories","date":"2023-02-17","arxiv_id":"2302.08669","repositories_listed":0,"syntology":null},{"url":null,"slug":"robot-path-planning-using-deep-reinforcement","title":"Robot path planning using deep reinforcement learning","date":"2023-02-17","arxiv_id":"2302.09120","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-computing-provides-exponential-regret","title":"Quantum Computing Provides Exponential Regret Improvement in Episodic Reinforcement Learning","date":"2023-02-16","arxiv_id":"2302.08617","repositories_listed":0,"syntology":null},{"url":null,"slug":"ceril-continuous-event-based-reinforcement","title":"CERiL: Continuous Event-based Reinforcement Learning","date":"2023-02-15","arxiv_id":"2302.07667","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-offline-reinforcement-learning-for-real","title":"Deep Offline Reinforcement Learning for Real-world Treatment Optimization Applications","date":"2023-02-15","arxiv_id":"2302.07549","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-via-exploratory","title":"Meta-Reinforcement Learning via Exploratory Task Clustering","date":"2023-02-15","arxiv_id":"2302.07958","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-sample-complexity-of-reinforcement","title":"Optimal Sample Complexity of Reinforcement Learning for Mixing Discounted Markov Decision Processes","date":"2023-02-15","arxiv_id":"2302.07477","repositories_listed":0,"syntology":null},{"url":null,"slug":"prioritized-offline-goal-swapping-experience","title":"Prioritized offline Goal-swapping Experience Replay","date":"2023-02-15","arxiv_id":"2302.07741","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-power-grid-day","title":"Reinforcement Learning Based Power Grid Day-Ahead Planning and AI-Assisted Control","date":"2023-02-15","arxiv_id":"2302.07654","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-multi-agent-reinforcement-learning-4","title":"Scalable Multi-Agent Reinforcement Learning with General Utilities","date":"2023-02-15","arxiv_id":"2302.07938","repositories_listed":0,"syntology":null}],"record_sha256":"e7b1e08e5995676b5c33be06cc850e48c94405d3bd8cd2bf21ecfe1fefc4bb0b","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}