{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/115","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":115,"pages_in_order":152,"rows_per_page":100,"rows":[11401,11500],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/114","next":"/task/reinforcement-learning-1/papers/116","papers":[{"url":null,"slug":"option-hedging-with-risk-averse-reinforcement","title":"Option Hedging with Risk Averse Reinforcement Learning","date":"2020-10-23","arxiv_id":"2010.12245","repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-transformer-based-action-sequence","title":"Stabilizing Transformer-Based Action Sequence Generation For Q-Learning","date":"2020-10-23","arxiv_id":"2010.12698","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-inverse-reinforcement-learning-1","title":"Stochastic Inverse Reinforcement Learning","date":"2020-10-23","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-on-deep-algorithmic","title":"Adversarial Attacks on Deep Algorithmic Trading Policies","date":"2020-10-22","arxiv_id":"2010.11388","repositories_listed":0,"syntology":null},{"url":null,"slug":"coindice-off-policy-confidence-interval","title":"CoinDICE: Off-Policy Confidence Interval Estimation","date":"2020-10-22","arxiv_id":"2010.11652","repositories_listed":0,"syntology":null},{"url":null,"slug":"error-bounds-of-imitating-policies-and","title":"Error Bounds of Imitating Policies and Environments","date":"2020-10-22","arxiv_id":"2010.11876","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-stylistic-lexical-preferences","title":"Incorporating Stylistic Lexical Preferences in Generative Language Models","date":"2020-10-22","arxiv_id":"2010.11553","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-planner-augmented-reinforcement","title":"Motion Planner Augmented Reinforcement Learning for Robot Manipulation in Obstructed Environments","date":"2020-10-22","arxiv_id":"2010.11940","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimising-stochastic-routing-for-taxi-fleets","title":"Optimising Stochastic Routing for Taxi Fleets with Model Enhanced Reinforcement Learning","date":"2020-10-22","arxiv_id":"2010.11738","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-coverage-and-capacity-in-cellular","title":"Optimizing Coverage and Capacity in Cellular Networks using Machine Learning","date":"2020-10-22","arxiv_id":"2010.13710","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-with-1","title":"Sample Efficient Reinforcement Learning with REINFORCE","date":"2020-10-22","arxiv_id":"2010.11364","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-are-the-statistical-limits-of-offline-rl","title":"What are the Statistical Limits of Offline RL with Linear Function Approximation?","date":"2020-10-22","arxiv_id":"2010.11895","repositories_listed":0,"syntology":null},{"url":null,"slug":"logistic-q-learning","title":"Logistic Q-Learning","date":"2020-10-21","arxiv_id":"2010.11151","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-information-asymmetry-in-competitive-multi","title":"On Information Asymmetry in Competitive Multi-Agent Reinforcement Learning: Convergence and Optimality","date":"2020-10-21","arxiv_id":"2010.10901","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-using-deep-q-networks","title":"Reinforcement learning using Deep Q Networks and Q learning accurately localizes brain tumors on MRI with very small training sets","date":"2020-10-21","arxiv_id":"2010.10763","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-verification-of-model-based-1","title":"Safety Verification of Model Based Reinforcement Learning Controllers","date":"2020-10-21","arxiv_id":"2010.10740","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-in-lane-merge","title":"Deep Reinforcement Learning in Lane Merge Coordination for Connected Vehicles","date":"2020-10-20","arxiv_id":"2010.10567","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-leo-satellites-and-multi-uav","title":"Integrating LEO Satellites and Multi-UAV Reinforcement Learning for Hybrid FSO/RF Non-Terrestrial Networks","date":"2020-10-20","arxiv_id":"2010.10138","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-inference-with-multi-head-automata","title":"Language Inference with Multi-head Automata through Reinforcement Learning","date":"2020-10-20","arxiv_id":"2010.10141","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-radar-tracking-optimization-for","title":"Multi-Radar Tracking Optimization for Collaborative Combat","date":"2020-10-20","arxiv_id":"2010.11733","repositories_listed":0,"syntology":null},{"url":null,"slug":"negotiating-team-formation-using-deep-1","title":"Negotiating Team Formation Using Deep Reinforcement Learning","date":"2020-10-20","arxiv_id":"2010.10380","repositories_listed":0,"syntology":null},{"url":null,"slug":"quality-of-service-based-radar-resource","title":"Quality of service based radar resource management using deep reinforcement learning","date":"2020-10-20","arxiv_id":"2010.10210","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-constrained-reinforcement-learning-for-1","title":"Robust Constrained Reinforcement Learning for Continuous Control with Model Misspecification","date":"2020-10-20","arxiv_id":"2010.10644","repositories_listed":0,"syntology":null},{"url":null,"slug":"runtime-safety-assurance-using-reinforcement","title":"Runtime Safety Assurance Using Reinforcement Learning","date":"2020-10-20","arxiv_id":"2010.10618","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-case-for-new-neural-networks-smoothness","title":"A case for new neural networks smoothness constraints","date":"2020-10-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-health","title":"A Reinforcement Learning Approach to Health Aware Control Strategy","date":"2020-10-19","arxiv_id":"2010.09269","repositories_listed":0,"syntology":null},{"url":null,"slug":"chance-constrained-control-with-lexicographic","title":"Chance-Constrained Control with Lexicographic Deep Reinforcement Learning","date":"2020-10-19","arxiv_id":"2010.09468","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-the-safety-of-deep-reinforcement","title":"Evaluating the Safety of Deep Reinforcement Learning Models using Semi-Formal Verification","date":"2020-10-19","arxiv_id":"2010.09387","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-with-neural-density-models-1","title":"Imitation with Neural Density Models","date":"2020-10-19","arxiv_id":"2010.09808","repositories_listed":0,"syntology":null},{"url":null,"slug":"average-reward-model-free-reinforcement","title":"Average-reward model-free reinforcement learning: a systematic review and literature mapping","date":"2020-10-18","arxiv_id":"2010.08920","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-inverse-reinforcement-learning","title":"Model-Based Inverse Reinforcement Learning from Visual Demonstrations","date":"2020-10-18","arxiv_id":"2010.09034","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-in-noma","title":"Multi-Agent Reinforcement Learning in NOMA-aided UAV Networks for Cellular Offloading","date":"2020-10-18","arxiv_id":"2010.09094","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessment-of-reward-functions-in","title":"Assessment of Reward Functions in Reinforcement Learning for Multi-Modal Urban Traffic Control under Real-World limitations","date":"2020-10-17","arxiv_id":"2010.08819","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-elimination-ordering-for-tree","title":"Learning Elimination Ordering for Tree Decomposition Problem","date":"2020-10-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-lower-bounds-for-graph-exploration","title":"Learning Lower Bounds for Graph Exploration With Reinforcement Learning","date":"2020-10-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-algorithms-for-graph-navigation","title":"Neural Algorithms for Graph Navigation","date":"2020-10-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-evolution-strategies-pipeline-for","title":"Scalable Evolution Strategies Pipeline for Solving the Vehicle Routing Problem","date":"2020-10-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-dynamic-for-self-supervised","title":"Variational Dynamic for Self-Supervised Exploration in Deep Reinforcement Learning","date":"2020-10-17","arxiv_id":"2010.08755","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-control-of-a-particle-accelerator","title":"Autonomous Control of a Particle Accelerator using Deep Reinforcement Learning","date":"2020-10-16","arxiv_id":"2010.08141","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-training-of-gans-in-continuous","title":"Collaborative Training of GANs in Continuous and Discrete Spaces for Text Generation","date":"2020-10-16","arxiv_id":"2010.08213","repositories_listed":0,"syntology":null},{"url":null,"slug":"doom-a-novel-adversarial-drl-based-op-code","title":"DOOM: A Novel Adversarial-DRL-Based Op-Code Level Metamorphic Malware Obfuscator for the Enhancement of IDS","date":"2020-10-16","arxiv_id":"2010.08608","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-robotic-object-search-via-hiem","title":"Efficient Robotic Object Search via HIEM: Hierarchical Policy Learning with Intrinsic-Extrinsic Modeling","date":"2020-10-16","arxiv_id":"2010.08596","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-model-based-adaptation-in-noisy","title":"Few-shot model-based adaptation in noisy conditions","date":"2020-10-16","arxiv_id":"2010.08397","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-for-2","title":"Decomposability and Parallel Computation of Multi-Agent LQR","date":"2020-10-16","arxiv_id":"2010.08615","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-disease-prediction-based-on","title":"Interpretable Disease Prediction based on Reinforcement Path Reasoning over Knowledge Graphs","date":"2020-10-16","arxiv_id":"2010.08300","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-efficient-and","title":"Reinforcement Learning for Efficient and Tuning-Free Link Adaptation","date":"2020-10-16","arxiv_id":"2010.08651","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-contact-safe-model-based","title":"Uncertainty-aware Contact-safe Model-based Reinforcement Learning","date":"2020-10-16","arxiv_id":"2010.08169","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-nesterov-s-accelerated-quasi-newton-method","title":"A Nesterov's Accelerated quasi-Newton method for Global Routing using Deep Reinforcement Learning","date":"2020-10-15","arxiv_id":"2010.09465","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empowerment-based-solution-to-robotic","title":"An Empowerment-based Solution to Robotic Manipulation Tasks with Sparse Rewards","date":"2020-10-15","arxiv_id":"2010.07986","repositories_listed":0,"syntology":null},{"url":null,"slug":"applicability-and-challenges-of-deep","title":"Applicability and Challenges of Deep Reinforcement Learning for Satellite Frequency Plan Design","date":"2020-10-15","arxiv_id":"2010.08015","repositories_listed":0,"syntology":null},{"url":null,"slug":"blending-search-and-discovery-tag-based-query","title":"Blending Search and Discovery: Tag-Based Query Refinement with Contextual Reinforcement Learning","date":"2020-10-15","arxiv_id":"2010.09495","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-competitive-reinforcement","title":"Cooperative-Competitive Reinforcement Learning with History-Dependent Rewards","date":"2020-10-15","arxiv_id":"2010.08030","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-of-koopman-representation-for","title":"Deep Learning of Koopman Representation for Control","date":"2020-10-15","arxiv_id":"2010.07546","repositories_listed":0,"syntology":null},{"url":null,"slug":"explanation-augmented-feedback-in-human-in-1","title":"Explanation Augmented Feedback in Human-in-the-Loop Reinforcement Learning","date":"2020-10-15","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"local-differentially-private-regret","title":"Local Differential Privacy for Regret Minimization in Reinforcement Learning","date":"2020-10-15","arxiv_id":"2010.07778","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-dispatch-in-emergency-service-system","title":"Optimal Dispatch in Emergency Service System via Reinforcement Learning","date":"2020-10-15","arxiv_id":"2010.07513","repositories_listed":0,"syntology":null},{"url":null,"slug":"average-cost-optimal-control-of-stochastic","title":"Average Cost Optimal Control of Stochastic Systems Using Reinforcement Learning","date":"2020-10-13","arxiv_id":"2010.06236","repositories_listed":0,"syntology":null},{"url":null,"slug":"balancing-constraints-and-rewards-with-meta-1","title":"Balancing Constraints and Rewards with Meta-Gradient D4PG","date":"2020-10-13","arxiv_id":"2010.06324","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-and","title":"Deep Reinforcement Learning and Transportation Research: A Comprehensive Review","date":"2020-10-13","arxiv_id":"2010.06187","repositories_listed":0,"syntology":null},{"url":null,"slug":"grid-interactive-multi-zone-building-control","title":"Grid-Interactive Multi-Zone Building Control Using Reinforcement Learning with Global-Local Policy Search","date":"2020-10-13","arxiv_id":"2010.06718","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-type","title":"Model-Based Reinforcement Learning for Type 1Diabetes Blood Glucose Control","date":"2020-10-13","arxiv_id":"2010.06266","repositories_listed":0,"syntology":null},{"url":null,"slug":"random-network-distillation-as-a-diversity-1","title":"Random Network Distillation as a Diversity Metric for Both Image and Text Generation","date":"2020-10-13","arxiv_id":"2010.06715","repositories_listed":0,"syntology":null},{"url":null,"slug":"attendlight-universal-attention-based","title":"AttendLight: Universal Attention-Based Reinforcement Learning Model for Traffic Signal Control","date":"2020-10-12","arxiv_id":"2010.05772","repositories_listed":0,"syntology":null},{"url":"/paper/discrete-latent-space-world-models-for","slug":"discrete-latent-space-world-models-for","title":"Smaller World Models for Reinforcement Learning","date":"2020-10-12","arxiv_id":"2010.05767","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-plug-in-solver-sample-efficient-for","title":"Is Plug-in Solver Sample-Efficient for Feature-based Reinforcement Learning?","date":"2020-10-12","arxiv_id":"2010.05673","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-search-for-policy-iteration-in","title":"Local Search for Policy Iteration in Continuous Control","date":"2020-10-12","arxiv_id":"2010.05545","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearly-minimax-optimal-reward-free","title":"Nearly Minimax Optimal Reward-free Reinforcement Learning","date":"2020-10-12","arxiv_id":"2010.05901","repositories_listed":0,"syntology":null},{"url":null,"slug":"remote-electrical-tilt-optimization-via-safe","title":"Remote Electrical Tilt Optimization via Safe Reinforcement Learning","date":"2020-10-12","arxiv_id":"2010.05842","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-greatest-teacher-failure-is-using","title":"The Greatest Teacher, Failure is: Using Reinforcement Learning for SFC Placement Based on Availability and Energy Consumption","date":"2020-10-12","arxiv_id":"2010.05711","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-scheduling","title":"Deep-Reinforcement-Learning-Based Scheduling with Contiguous Resource Allocation for Next-Generation Cellular Systems","date":"2020-10-11","arxiv_id":"2010.11269","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-stop-epidemics-controlling-graph","title":"Controlling Graph Dynamics with Reinforcement Learning and Graph Neural Networks","date":"2020-10-11","arxiv_id":"2010.05313","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-with-natural-1","title":"Safe Reinforcement Learning with Natural Language Constraints","date":"2020-10-11","arxiv_id":"2010.05150","repositories_listed":0,"syntology":null},{"url":null,"slug":"ms-ranker-accumulating-evidence-from","title":"MS-Ranker: Accumulating Evidence from Potentially Correct Candidates for Answer Selection","date":"2020-10-10","arxiv_id":"2010.04970","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-on-computational","title":"Reinforcement Learning on Computational Resource Allocation of Cloud-based Wireless Networks","date":"2020-10-10","arxiv_id":"2010.05024","repositories_listed":0,"syntology":null},{"url":null,"slug":"trust-the-model-when-it-is-confident-masked","title":"Trust the Model When It Is Confident: Masked Model-based Actor-Critic","date":"2020-10-10","arxiv_id":"2010.04893","repositories_listed":0,"syntology":null},{"url":null,"slug":"characterizing-policy-divergence-for","title":"Characterizing Policy Divergence for Personalized Meta-Reinforcement Learning","date":"2020-10-09","arxiv_id":"2010.04816","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-asset","title":"Deep Reinforcement Learning for Asset Allocation in US Equities","date":"2020-10-09","arxiv_id":"2010.04404","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-rl-with-information-constrained-policies","title":"Deep RL With Information Constrained Policies: Generalization in Continuous Control","date":"2020-10-09","arxiv_id":"2010.04646","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-context-selection-for-document-level","title":"Dynamic Context Selection for Document-level Neural Machine Translation via Reinforcement Learning","date":"2020-10-09","arxiv_id":"2010.04314","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-state-action-embedding-for-efficient-1","title":"Jointly-Learned State-Action Embedding for Efficient Reinforcement Learning","date":"2020-10-09","arxiv_id":"2010.04444","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-locomote-understanding-how","title":"Learning to Locomote: Understanding How Environment Design Matters for Deep Reinforcement Learning","date":"2020-10-09","arxiv_id":"2010.04304","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameterized-reinforcement-learning-for","title":"Parameterized Reinforcement Learning for Optical System Optimization","date":"2020-10-09","arxiv_id":"2010.05769","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-intrinsic-symbolic-rewards-in-1","title":"Learning Intrinsic Symbolic Rewards in Reinforcement Learning","date":"2020-10-08","arxiv_id":"2010.03694","repositories_listed":0,"syntology":null},{"url":null,"slug":"nonstationary-reinforcement-learning-with","title":"Nonstationary Reinforcement Learning with Linear Function Approximation","date":"2020-10-08","arxiv_id":"2010.04244","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-fictitious-play-for-general-mean-1","title":"Provable Fictitious Play for General Mean-Field Games","date":"2020-10-08","arxiv_id":"2010.04211","repositories_listed":0,"syntology":null},{"url":null,"slug":"actor-critic-algorithm-for-high-dimensional","title":"Actor-Critic Algorithm for High-dimensional Partial Differential Equations","date":"2020-10-07","arxiv_id":"2010.03647","repositories_listed":0,"syntology":null},{"url":null,"slug":"episodic-reinforcement-learning-in-finite","title":"Episodic Reinforcement Learning in Finite MDPs: Minimax Lower Bounds Revisited","date":"2020-10-07","arxiv_id":"2010.03531","repositories_listed":0,"syntology":null},{"url":null,"slug":"instance-dependent-complexity-of-contextual","title":"Instance-Dependent Complexity of Contextual Bandits and Reinforcement Learning: A Disagreement-Based Perspective","date":"2020-10-07","arxiv_id":"2010.03104","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-regret-bounds-for-model-free-rl-1","title":"Model-Free Non-Stationary RL: Near-Optimal Regret and Applications in Multi-Agent RL and Inventory Control","date":"2020-10-07","arxiv_id":"2010.03161","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-safety-assurance-for-deep","title":"Online Safety Assurance for Deep Reinforcement Learning","date":"2020-10-07","arxiv_id":"2010.03625","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularized-inverse-reinforcement-learning-1","title":"Regularized Inverse Reinforcement Learning","date":"2020-10-07","arxiv_id":"2010.03691","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-many-body-ground","title":"Reinforcement Learning for Many-Body Ground-State Preparation Inspired by Counterdiabatic Driving","date":"2020-10-07","arxiv_id":"2010.03655","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-intrinsic-control-revisited-1","title":"Variational Intrinsic Control Revisited","date":"2020-10-07","arxiv_id":"2010.03281","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-multi-agent-reinforcement","title":"Heterogeneous Multi-Agent Reinforcement Learning for Unknown Environment Mapping","date":"2020-10-06","arxiv_id":"2010.02663","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-aware-reinforcement-learning-sarl-1","title":"Safety Aware Reinforcement Learning (SARL)","date":"2020-10-06","arxiv_id":"2010.02846","repositories_listed":0,"syntology":null},{"url":null,"slug":"uneven-universal-value-exploration-for-multi-1","title":"UneVEn: Universal Value Exploration for Multi-Agent Reinforcement Learning","date":"2020-10-06","arxiv_id":"2010.02974","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-distributed-model-free-ride-sharing","title":"A Distributed Model-Free Ride-Sharing Approach for Joint Matching, Pricing, and Dispatching using Deep Reinforcement Learning","date":"2020-10-05","arxiv_id":"2010.01755","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-collaborative","title":"Deep Reinforcement Learning for Collaborative Edge Computing in Vehicular Networks","date":"2020-10-05","arxiv_id":"2010.01722","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-electric-1","title":"Deep Reinforcement Learning for Electric Vehicle Routing Problem with Time Windows","date":"2020-10-05","arxiv_id":"2010.02068","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-directed-generation-of-discrete","title":"Goal-directed Generation of Discrete Structures with Conditional Generative Models","date":"2020-10-05","arxiv_id":"2010.02311","repositories_listed":0,"syntology":null}],"record_sha256":"ff3b6fee3a7cc6b6f02731cdf6f09612aab613d1039f4cf458f40cd6efe51661","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}