{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/89","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":89,"pages_in_order":152,"rows_per_page":100,"rows":[8801,8900],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/88","next":"/task/reinforcement-learning-1/papers/90","papers":[{"url":null,"slug":"model-based-multi-agent-reinforcement-2","title":"Model-based Multi-agent Reinforcement Learning: Recent Progress and Prospects","date":"2022-03-20","arxiv_id":"2203.10603","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-reward-function-in","title":"Reinforcement learning reward function in unmanned aerial vehicle control tasks","date":"2022-03-20","arxiv_id":"2203.10519","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-quantum-policy-gradients-with-an","title":"Policy Gradients using Variational Quantum Circuits","date":"2022-03-20","arxiv_id":"2203.10591","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-on-asymmetric-a-stable","title":"Thompson Sampling on Asymmetric $α$-Stable Bandits","date":"2022-03-19","arxiv_id":"2203.10214","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-guided-graph","title":"Deep reinforcement learning guided graph neural networks for brain network analysis","date":"2022-03-18","arxiv_id":"2203.10093","repositories_listed":0,"syntology":null},{"url":null,"slug":"infinite-horizon-reach-avoid-zero-sum-games","title":"Infinite-Horizon Reach-Avoid Zero-Sum Games via Deep Reinforcement Learning","date":"2022-03-18","arxiv_id":"2203.10142","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-preserving-reinforcement-learning","title":"Privacy-Preserving Reinforcement Learning Beyond Expectation","date":"2022-03-18","arxiv_id":"2203.10165","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-bayesian-games-for-multi-agent","title":"Risk-Sensitive Bayesian Games for Multi-Agent Reinforcement Learning under Policy Uncertainty","date":"2022-03-18","arxiv_id":"2203.10045","repositories_listed":0,"syntology":null},{"url":null,"slug":"surf-semi-supervised-reward-learning-with-1","title":"SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning","date":"2022-03-18","arxiv_id":"2203.10050","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-for-adaptive-2","title":"Meta-Reinforcement Learning for the Tuning of PI Controllers: An Offline Approach","date":"2022-03-17","arxiv_id":"2203.09661","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-instance-optimal-pac-reinforcement","title":"Near Instance-Optimal PAC Reinforcement Learning for Deterministic MDPs","date":"2022-03-17","arxiv_id":"2203.09251","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategic-maneuver-and-disruption-with","title":"Strategic Maneuver and Disruption with Reinforcement Learning Approaches for Multi-Agent Coordination","date":"2022-03-17","arxiv_id":"2203.09565","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-frost-hollow-experiments-pavlovian","title":"The Frost Hollow Experiments: Pavlovian Signalling as a Path to Coordination and Communication Between Agents","date":"2022-03-17","arxiv_id":"2203.09498","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-based-caching","title":"A Deep Reinforcement Learning-Based Caching Strategy for IoT Networks with Transient Data","date":"2022-03-16","arxiv_id":"2203.12674","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-multi-agent-reinforcement","title":"A Survey of Multi-Agent Deep Reinforcement Learning with Communication","date":"2022-03-16","arxiv_id":"2203.08975","repositories_listed":0,"syntology":null},{"url":null,"slug":"backpropagation-through-time-and-space","title":"Backpropagation through Time and Space: Learning Numerical Methods with Multi-Agent Reinforcement Learning","date":"2022-03-16","arxiv_id":"2203.08937","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-learn-from-risk-explicit-risk-utility","title":"How to Learn from Risk: Explicit Risk-Utility Reinforcement Learning for Efficient and Safe Driving Strategies","date":"2022-03-16","arxiv_id":"2203.08409","repositories_listed":0,"syntology":null},{"url":null,"slug":"lazy-mdps-towards-interpretable-reinforcement","title":"Lazy-MDPs: Towards Interpretable Reinforcement Learning by Learning When to Act","date":"2022-03-16","arxiv_id":"2203.08542","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-differentiable-approach-to-combinatorial","title":"A Differentiable Approach to Combinatorial Optimization using Dataless Neural Networks","date":"2022-03-15","arxiv_id":"2203.08209","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-introduction-to-multi-agent-reinforcement","title":"An Introduction to Multi-Agent Reinforcement Learning and Review of its Application to Autonomous Mobility","date":"2022-03-15","arxiv_id":"2203.07676","repositories_listed":0,"syntology":null},{"url":null,"slug":"bi-manual-manipulation-and-attachment-via-sim","title":"Bi-Manual Manipulation and Attachment via Sim-to-Real Reinforcement Learning","date":"2022-03-15","arxiv_id":"2203.08277","repositories_listed":0,"syntology":null},{"url":null,"slug":"blocks-assemble-learning-to-assemble-with","title":"Blocks Assemble! Learning to Assemble with Large-Scale Structured Reinforcement Learning","date":"2022-03-15","arxiv_id":"2203.13733","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-view-dreaming-multi-view-world-model","title":"Multi-View Dreaming: Multi-View World Model with Contrastive Learning","date":"2022-03-15","arxiv_id":"2203.11024","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-linear-reinforcement-learning-in-large","title":"Non-Linear Reinforcement Learning in Large Action Spaces: Structural Conditions and Sample-efficiency of Posterior Sampling","date":"2022-03-15","arxiv_id":"2203.08248","repositories_listed":0,"syntology":null},{"url":null,"slug":"calibration-of-derivative-pricing-models-a","title":"Calibration of Derivative Pricing Models: a Multi-Agent Reinforcement Learning Perspective","date":"2022-03-14","arxiv_id":"2203.06865","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-model-based-multi-agent","title":"Efficient Model-based Multi-agent Reinforcement Learning via Optimistic Equilibrium Computation","date":"2022-03-14","arxiv_id":"2203.07322","repositories_listed":0,"syntology":null},{"url":null,"slug":"frl-fi-transient-fault-analysis-for-federated","title":"FRL-FI: Transient Fault Analysis for Federated Reinforcement Learning-Based Navigation Systems","date":"2022-03-14","arxiv_id":"2203.07276","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-optimal-control-of","title":"Reinforcement Learning for Optimal Control of a District Cooling Energy Plant","date":"2022-03-14","arxiv_id":"2203.07500","repositories_listed":0,"syntology":null},{"url":null,"slug":"switch-trajectory-transformer-with","title":"Switch Trajectory Transformer with Distributional Value Approximation for Multi-Task Reinforcement Learning","date":"2022-03-14","arxiv_id":"2203.07413","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-multi-agent-pickup-and-delivery-problem","title":"The Multi-Agent Pickup and Delivery Problem: MAPF, MARL and Its Warehouse Applications","date":"2022-03-14","arxiv_id":"2203.07092","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-estimation-for-language-reward","title":"Uncertainty Estimation for Language Reward Models","date":"2022-03-14","arxiv_id":"2203.07472","repositories_listed":0,"syntology":null},{"url":null,"slug":"dara-dynamics-aware-reward-augmentation-in-1","title":"DARA: Dynamics-Aware Reward Augmentation in Offline Reinforcement Learning","date":"2022-03-13","arxiv_id":"2203.06662","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-fedrl-federated-hyperparameter","title":"Auto-FedRL: Federated Hyperparameter Optimization for Multi-institutional Medical Image Segmentation","date":"2022-03-12","arxiv_id":"2203.06338","repositories_listed":0,"syntology":null},{"url":null,"slug":"concentration-network-for-reinforcement","title":"Concentration Network for Reinforcement Learning of Large-Scale Multi-Agent Systems","date":"2022-03-12","arxiv_id":"2203.06416","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-machine-learning-approach-for-prosumer","title":"A Machine Learning Approach for Prosumer Management in Intraday Electricity Markets","date":"2022-03-11","arxiv_id":"2203.06053","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-phase-encode-selection-for-slice","title":"Active Phase-Encode Selection for Slice-Specific Fast MR Scanning Using a Transformer-Based Deep Reinforcement Learning Framework","date":"2022-03-11","arxiv_id":"2203.05756","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-binary-reinforcement-learning-for","title":"Deep Binary Reinforcement Learning for Scalable Verification","date":"2022-03-11","arxiv_id":"2203.05704","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-neural-networks-for-relational","title":"Graph Neural Networks for Relational Inductive Bias in Vision-based Deep Reinforcement Learning of Robot Control","date":"2022-03-11","arxiv_id":"2203.05985","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-offline-reinforcement-learning-2","title":"Near-optimal Offline Reinforcement Learning with Linear Representation: Leveraging Variance Information with Pessimism","date":"2022-03-11","arxiv_id":"2203.05804","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-linear-quadratic","title":"Reinforcement Learning for Linear Quadratic Control is Vulnerable Under Cost Manipulation","date":"2022-03-11","arxiv_id":"2203.05774","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-constrained-reinforcement-learning-for","title":"Action-Constrained Reinforcement Learning for Frame-Level Bit Allocation in HEVC/H.265 through Frank-Wolfe Policy Optimization","date":"2022-03-10","arxiv_id":"2203.05127","repositories_listed":0,"syntology":null},{"url":null,"slug":"api-boosting-multi-agent-reinforcement","title":"Breaking the Curse of Dimensionality in Multiagent State Space: A Unified Agent Permutation Framework","date":"2022-03-10","arxiv_id":"2203.05285","repositories_listed":0,"syntology":null},{"url":null,"slug":"artificial-intelligence-in-vehicular-wireless","title":"Artificial Intelligence in Vehicular Wireless Networks: A Case Study Using ns-3","date":"2022-03-10","arxiv_id":"2203.05449","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-torque-control-for-quadrupedal","title":"Learning Torque Control for Quadrupedal Locomotion","date":"2022-03-10","arxiv_id":"2203.05194","repositories_listed":0,"syntology":null},{"url":null,"slug":"random-ensemble-reinforcement-learning-for","title":"Random Ensemble Reinforcement Learning for Traffic Signal Control","date":"2022-03-10","arxiv_id":"2203.05961","repositories_listed":0,"syntology":null},{"url":null,"slug":"gym-saturation-an-openai-gym-environment-for","title":"Gym-saturation: an OpenAI Gym environment for saturation provers","date":"2022-03-09","arxiv_id":"2203.04699","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigation-of-factorized-optical-flows-as","title":"Investigation of Factorized Optical Flows as Mid-Level Representations","date":"2022-03-09","arxiv_id":"2203.04927","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-robot-cooperative-pursuit-via-potential","title":"Multi-robot Cooperative Pursuit via Potential Field-Enhanced Reinforcement Learning","date":"2022-03-09","arxiv_id":"2203.04700","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-sharp-characterization-of-linear-estimators","title":"A Complete Characterization of Linear Estimators for Offline Policy Evaluation","date":"2022-03-08","arxiv_id":"2203.04236","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-control-using-reinforcement","title":"Distributed Control using Reinforcement Learning with Temporal-Logic-Based Reward Shaping","date":"2022-03-08","arxiv_id":"2203.04172","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-based-reinforcement-learning-meets","title":"Graph-based Reinforcement Learning meets Mixed Integer Programs: An application to 3D robot assembly discovery","date":"2022-03-08","arxiv_id":"2203.04120","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-reinforcement-learning-for-predictive","title":"Designing Heterogeneous GNNs with Desired Permutation Properties for Wireless Resource Allocation","date":"2022-03-08","arxiv_id":"2203.03906","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-broad-reinforcement-learning-for","title":"Multi-Agent Broad Reinforcement Learning for Intelligent Traffic Light Control","date":"2022-03-08","arxiv_id":"2203.04310","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-based-bayesian-experimental-design-for","title":"Policy-Based Bayesian Experimental Design for Non-Differentiable Implicit Models","date":"2022-03-08","arxiv_id":"2203.04272","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-moocs-concept-recommendation-in","title":"Reinforced MOOCs Concept Recommendation in Heterogeneous Information Networks","date":"2022-03-08","arxiv_id":"2203.11011","repositories_listed":0,"syntology":null},{"url":null,"slug":"renyi-state-entropy-for-exploration","title":"Rényi State Entropy for Exploration Acceleration in Reinforcement Learning","date":"2022-03-08","arxiv_id":"2203.04297","repositories_listed":0,"syntology":null},{"url":null,"slug":"robot-learning-of-mobile-manipulation-with","title":"Robot Learning of Mobile Manipulation with Reachability Behavior Priors","date":"2022-03-08","arxiv_id":"2203.04051","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-reinforcement-learning-methods-in","title":"A Survey on Reinforcement Learning Methods in Character Animation","date":"2022-03-07","arxiv_id":"2203.04735","repositories_listed":0,"syntology":null},{"url":null,"slug":"cascaded-gaps-towards-gap-dependent-regret","title":"Cascaded Gaps: Towards Gap-Dependent Regret for Risk-Sensitive Reinforcement Learning","date":"2022-03-07","arxiv_id":"2203.03110","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-cooperation-strategy-generation-in","title":"Efficient Policy Generation in Multi-Agent Systems via Hypergraph Neural Network","date":"2022-03-07","arxiv_id":"2203.03265","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-and-data-efficient-reinforcement","title":"Fast and Data Efficient Reinforcement Learning from Pixels via Non-Parametric Value Approximation","date":"2022-03-07","arxiv_id":"2203.03078","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-neural-networks-for-image","title":"Graph Neural Networks for Image Classification and Reinforcement Learning using Graph representations","date":"2022-03-07","arxiv_id":"2203.03457","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-transfer-in-deep-reinforcement","title":"Knowledge Transfer in Deep Reinforcement Learning for Slice-Aware Mobility Robustness Optimization","date":"2022-03-07","arxiv_id":"2203.03227","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-to-match-with-no-regret-reinforcement","title":"Learn to Match with No Regret: Reinforcement Learning in Markov Matching Markets","date":"2022-03-07","arxiv_id":"2203.03684","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-location-aware","title":"Reinforcement Learning for Location-Aware Scheduling","date":"2022-03-07","arxiv_id":"2203.03480","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-verification-of-autonomous-systems-a","title":"Black-Box Safety Validation of Autonomous Systems: A Multi-Fidelity Reinforcement Learning Approach","date":"2022-03-07","arxiv_id":"2203.03451","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-multi-agent-reinforcement-learning-1","title":"Scalable multi-agent reinforcement learning for distributed control of residential energy flexibility","date":"2022-03-07","arxiv_id":"2203.03417","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-model-free","title":"Deep Reinforcement Learning based Model-free On-line Dynamic Multi-Microgrid Formation to Enhance Resilience","date":"2022-03-06","arxiv_id":"2203.03030","repositories_listed":0,"syntology":null},{"url":null,"slug":"depthwise-convolution-for-multi-agent","title":"Depthwise Convolution for Multi-Agent Communication with Enhanced Mean-Field Approximation","date":"2022-03-06","arxiv_id":"2203.02896","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchically-structured-scheduling-and","title":"Hierarchically Structured Scheduling and Execution of Tasks in a Multi-Agent Environment","date":"2022-03-06","arxiv_id":"2203.03021","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-reward-gradients-for-reinforcement","title":"Leveraging Reward Gradients For Reinforcement Learning in Differentiable Physics Simulations","date":"2022-03-06","arxiv_id":"2203.02857","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-deep-reinforcement-learning-for","title":"Offline Deep Reinforcement Learning for Dynamic Pricing of Consumer Credit","date":"2022-03-06","arxiv_id":"2203.03003","repositories_listed":0,"syntology":null},{"url":null,"slug":"recursive-reasoning-graph-for-multi-agent","title":"Recursive Reasoning Graph for Multi-Agent Reinforcement Learning","date":"2022-03-06","arxiv_id":"2203.02844","repositories_listed":0,"syntology":null},{"url":null,"slug":"watch-from-sky-machine-learning-based-multi","title":"Watch from sky: machine-learning-based multi-UAV network for predictive police surveillance","date":"2022-03-06","arxiv_id":"2203.02892","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-for-legged","title":"Safe Reinforcement Learning for Legged Locomotion","date":"2022-03-05","arxiv_id":"2203.02638","repositories_listed":0,"syntology":null},{"url":null,"slug":"target-network-and-truncation-overcome-the","title":"Target Network and Truncation Overcome The Deadly Triad in $Q$-Learning","date":"2022-03-05","arxiv_id":"2203.02628","repositories_listed":0,"syntology":null},{"url":null,"slug":"cloud-edge-training-architecture-for-sim-to","title":"Cloud-Edge Training Architecture for Sim-to-Real Deep Reinforcement Learning","date":"2022-03-04","arxiv_id":"2203.02230","repositories_listed":0,"syntology":null},{"url":null,"slug":"grasparl-dynamic-grasping-via-adversarial","title":"GraspARL: Dynamic Grasping via Adversarial Reinforcement Learning","date":"2022-03-04","arxiv_id":"2203.02119","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-modern","title":"Reinforcement Learning in Modern Biostatistics: Constructing Optimal Adaptive Interventions","date":"2022-03-04","arxiv_id":"2203.02605","repositories_listed":0,"syntology":null},{"url":null,"slug":"bilateral-deep-reinforcement-learning","title":"Bilateral Deep Reinforcement Learning Approach for Better-than-human Car Following Model","date":"2022-03-03","arxiv_id":"2203.04749","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-network-using-reservoir-computing-with","title":"Deep Q-network using reservoir computing with multi-layered readout","date":"2022-03-03","arxiv_id":"2203.01465","repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsically-motivated-reinforcement-1","title":"Intrinsically-Motivated Reinforcement Learning: A Brief Introduction","date":"2022-03-03","arxiv_id":"2203.02298","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimized-cost-function-for-demand-response","title":"Optimized cost function for demand response coordination of multiple EV charging stations using reinforcement learning","date":"2022-03-03","arxiv_id":"2203.01654","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-reinforcement-learning-via-policy","title":"Quantum Reinforcement Learning via Policy Iteration","date":"2022-03-03","arxiv_id":"2203.01889","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-best-of-both-worlds-reinforcement","title":"The Best of Both Worlds: Reinforcement Learning with Logarithmic Regret and Policy Switches","date":"2022-03-03","arxiv_id":"2203.01491","repositories_listed":0,"syntology":null},{"url":null,"slug":"follow-your-nose-using-general-value","title":"Follow your Nose: Using General Value Functions for Directed Exploration in Reinforcement Learning","date":"2022-03-02","arxiv_id":"2203.00874","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-in-sparse-rewards-settings-through","title":"Learning in Sparse Rewards settings through Quality-Diversity algorithms","date":"2022-03-02","arxiv_id":"2203.01027","repositories_listed":0,"syntology":null},{"url":null,"slug":"pareto-frontier-approximation-network-pa-net-1","title":"Pareto Frontier Approximation Network (PA-Net) to Solve Bi-objective TSP","date":"2022-03-02","arxiv_id":"2203.01298","repositories_listed":0,"syntology":null},{"url":null,"slug":"reliable-validation-of-reinforcement-learning","title":"Reliable validation of Reinforcement Learning Benchmarks","date":"2022-03-02","arxiv_id":"2203.01075","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-theory-of-abstraction-in-reinforcement","title":"A Theory of Abstraction in Reinforcement Learning","date":"2022-03-01","arxiv_id":"2203.00397","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximating-a-deep-reinforcement-learning","title":"Approximating a deep reinforcement learning docking agent using linear model trees","date":"2022-03-01","arxiv_id":"2203.00369","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-reinforcement-learning-for-5","title":"Distributional Reinforcement Learning for Scheduling of Chemical Production Processes","date":"2022-03-01","arxiv_id":"2203.00636","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamingv2-reinforcement-learning-with","title":"DreamingV2: Reinforcement Learning with Discrete World Models without Reconstruction","date":"2022-03-01","arxiv_id":"2203.00494","repositories_listed":0,"syntology":null},{"url":null,"slug":"explaining-a-deep-reinforcement-learning","title":"Explaining a Deep Reinforcement Learning Docking Agent Using Linear Model Trees with User Adapted Visualization","date":"2022-03-01","arxiv_id":"2203.00368","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-recent-advances-and-challenges-in","title":"A Survey on Recent Advances and Challenges in Reinforcement Learning Methods for Task-Oriented Dialogue Policy Learning","date":"2022-02-28","arxiv_id":"2202.13675","repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimistic-q-learning-for-offline","title":"Pessimistic Q-Learning for Offline Reinforcement Learning: Towards Optimal Sample Complexity","date":"2022-02-28","arxiv_id":"2202.13890","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-convergence-of-primal-dual","title":"Provably Efficient Convergence of Primal-Dual Actor-Critic with Nonlinear Function Approximation","date":"2022-02-28","arxiv_id":"2202.13863","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-disentangled-representation","title":"Weakly Supervised Disentangled Representation for Goal-conditioned Reinforcement Learning","date":"2022-02-28","arxiv_id":"2202.13624","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-progressive-hedging-enforcing","title":"Neural-Progressive Hedging: Enforcing Constraints in Reinforcement Learning with Stochastic Programming","date":"2022-02-27","arxiv_id":"2202.13436","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-scalable-graph-theoretic-distributed","title":"Distributed Multi-Agent Reinforcement Learning Based on Graph-Induced Local Value Functions","date":"2022-02-26","arxiv_id":"2202.13046","repositories_listed":0,"syntology":null}],"record_sha256":"22d47eab5a1df64425b7b04886ca62133e111bdf0a21ed121663fdebb454956d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}