{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/92","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":92,"pages_in_order":132,"rows_per_page":100,"rows":[9101,9200],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/91","next":"/task/reinforcement-learning/papers/93","papers":[{"url":null,"slug":"dynamics-generalization-via-information","title":"Dynamics Generalization via Information Bottleneck in Deep Reinforcement Learning","date":"2020-08-03","arxiv_id":"2008.00614","repositories_listed":0,"syntology":null},{"url":null,"slug":"fully-decentralized-reinforcement-learning","title":"Fully Decentralized Reinforcement Learning-based Control of Photovoltaics in Distribution Grids for Joint Provision of Real and Reactive Power","date":"2020-08-03","arxiv_id":"2008.01231","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-play-two-player-perfect","title":"Learning to Play Two-Player Perfect-Information Games without Knowledge","date":"2020-08-03","arxiv_id":"2008.01188","repositories_listed":0,"syntology":null},{"url":null,"slug":"tracking-the-race-between-deep-reinforcement","title":"Tracking the Race Between Deep Reinforcement Learning and Imitation Learning -- Extended Version","date":"2020-08-03","arxiv_id":"2008.00766","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-mobile-edge","title":"Deep Reinforcement Learning Based Mobile Edge Computing for Intelligent Internet of Things","date":"2020-08-01","arxiv_id":"2008.00250","repositories_listed":0,"syntology":null},{"url":null,"slug":"ergodic-annealing","title":"Ergodic Annealing","date":"2020-08-01","arxiv_id":"2008.00234","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-using-cyclical","title":"Deep Reinforcement Learning using Cyclical Learning Rates","date":"2020-07-31","arxiv_id":"2008.01171","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligentpooling-practical-thompson","title":"IntelligentPooling: Practical Thompson Sampling for mHealth","date":"2020-07-31","arxiv_id":"2008.01571","repositories_listed":0,"syntology":null},{"url":null,"slug":"mapper-multi-agent-path-planning-with","title":"MAPPER: Multi-Agent Path Planning with Evolutionary Reinforcement Learning in Mixed Dynamic Environments","date":"2020-07-30","arxiv_id":"2007.15724","repositories_listed":0,"syntology":null},{"url":null,"slug":"moody-learners-explaining-competitive","title":"Moody Learners -- Explaining Competitive Behaviour of Reinforcement Learning Agents","date":"2020-07-30","arxiv_id":"2007.16045","repositories_listed":0,"syntology":null},{"url":null,"slug":"compare-and-select-video-summarization-with","title":"Compare and Select: Video Summarization with Multi-Agent Reinforcement Learning","date":"2020-07-29","arxiv_id":"2007.14552","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreaming-model-based-reinforcement-learning","title":"Dreaming: Model-based Reinforcement Learning by Latent Imagination without Reconstruction","date":"2020-07-29","arxiv_id":"2007.14535","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantity-vs-quality-on-hyperparameter","title":"Quantity vs. Quality: On Hyperparameter Optimization for Deep Reinforcement Learning","date":"2020-07-29","arxiv_id":"2007.14604","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-control-of-multi-agent-systems","title":"Hierarchical Control of Multi-Agent Systems using Online Reinforcement Learning","date":"2020-07-28","arxiv_id":"2007.14186","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-active-learning-for-pure-exploration-in","title":"Fast active learning for pure exploration in reinforcement learning","date":"2020-07-27","arxiv_id":"2007.13442","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-trajectory-planning-in-uav","title":"Intelligent Trajectory Planning in UAV-mounted Wireless Networks: A Quantum-Inspired Reinforcement Learning Perspective","date":"2020-07-27","arxiv_id":"2007.13418","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-database-indexing-using-model-free","title":"Automated Database Indexing using Model-free Reinforcement Learning","date":"2020-07-25","arxiv_id":"2007.14244","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduction-for-deep-q-learning-using","title":"Variance Reduction for Deep Q-Learning using Stochastic Recursive Gradient","date":"2020-07-25","arxiv_id":"2007.12817","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-safety-aware-model-based-reinforcement","title":"Safe Model-Based Reinforcement Learning for Systems with Parametric Uncertainties","date":"2020-07-24","arxiv_id":"2007.12666","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-energy-management-for-real-driving","title":"Adaptive Energy Management for Real Driving Conditions via Transfer Reinforcement Learning","date":"2020-07-24","arxiv_id":"2007.12560","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrated-longitudinal-speed-decision-making","title":"Integrated Longitudinal Speed Decision-Making and Energy Efficiency Control for Connected Electrified Vehicles","date":"2020-07-24","arxiv_id":"2007.12565","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-the-imitation-gap-by-adaptive","title":"Bridging the Imitation Gap by Adaptive Insubordination","date":"2020-07-23","arxiv_id":"2007.12173","repositories_listed":0,"syntology":null},{"url":null,"slug":"explore-more-and-improve-regret-in-linear","title":"Reinforcement Learning with Fast Stabilization in Linear Dynamical Systems","date":"2020-07-23","arxiv_id":"2007.12291","repositories_listed":0,"syntology":null},{"url":null,"slug":"buffer-pool-aware-query-scheduling-via-deep","title":"Buffer Pool Aware Query Scheduling via Deep Reinforcement Learning","date":"2020-07-21","arxiv_id":"2007.10568","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-control-by-reinforcement","title":"Interpretable Control by Reinforcement Learning","date":"2020-07-20","arxiv_id":"2007.09964","repositories_listed":0,"syntology":null},{"url":null,"slug":"lagrangian-duality-in-reinforcement-learning","title":"Lagrangian Duality in Reinforcement Learning","date":"2020-07-20","arxiv_id":"2007.09998","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-overview-of-natural-language-state","title":"An Overview of Natural Language State Representation for Reinforcement Learning","date":"2020-07-19","arxiv_id":"2007.09774","repositories_listed":0,"syntology":null},{"url":"/paper/catch-context-based-meta-reinforcement","slug":"catch-context-based-meta-reinforcement","title":"CATCH: Context-based Meta Reinforcement Learning for Transferrable Architecture Search","date":"2020-07-18","arxiv_id":"2007.09380","repositories_listed":0,"syntology":null},{"url":null,"slug":"quick-question-interrupting-users-for","title":"Quick Question: Interrupting Users for Microtasks with Reinforcement Learning","date":"2020-07-18","arxiv_id":"2007.09515","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperparameter-selection-for-offline","title":"Hyperparameter Selection for Offline Reinforcement Learning","date":"2020-07-17","arxiv_id":"2007.09055","repositories_listed":0,"syntology":null},{"url":null,"slug":"drift-deep-reinforcement-learning-for","title":"DRIFT: Deep Reinforcement Learning for Functional Software Testing","date":"2020-07-16","arxiv_id":"2007.08220","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-like-energy-management-based-on-deep","title":"Human-like Energy Management Based on Deep Reinforcement Learning and Historical Driving Experiences","date":"2020-07-16","arxiv_id":"2007.10126","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-gradient-reinforcement-learning-with-an","title":"Meta-Gradient Reinforcement Learning with an Objective Discovered Online","date":"2020-07-16","arxiv_id":"2007.08433","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferred-energy-management-strategies-for","title":"Transferred Energy Management Strategies for Hybrid Electric Vehicles Based on Driving Conditions Recognition","date":"2020-07-16","arxiv_id":"2007.08337","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-from-a","title":"Inverse Reinforcement Learning from a Gradient-based Learner","date":"2020-07-15","arxiv_id":"2007.07812","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-memory-placement-using","title":"Optimizing Memory Placement using Evolutionary Graph Reinforcement Learning","date":"2020-07-14","arxiv_id":"2007.07298","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustifying-reinforcement-learning-agents","title":"Robustifying Reinforcement Learning Agents via Action Space Adversarial Training","date":"2020-07-14","arxiv_id":"2007.07176","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-provably-efficient-sample-collection","title":"A Provably Efficient Sample Collection Strategy for Reinforcement Learning","date":"2020-07-13","arxiv_id":"2007.06437","repositories_listed":0,"syntology":null},{"url":null,"slug":"aircaprl-autonomous-aerial-human-motion","title":"AirCapRL: Autonomous Aerial Human Motion Capture using Deep Reinforcement Learning","date":"2020-07-13","arxiv_id":"2007.06343","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigation-of-sentiment-controllable","title":"Investigation of Sentiment Controllable Chatbot","date":"2020-07-11","arxiv_id":"2007.07196","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulating-multi-exit-evacuation-using-deep","title":"Simulating multi-exit evacuation using deep reinforcement learning","date":"2020-07-11","arxiv_id":"2007.05783","repositories_listed":0,"syntology":null},{"url":null,"slug":"maps-multi-agent-reinforcement-learning-based","title":"MAPS: Multi-agent Reinforcement Learning-based Portfolio Management System","date":"2020-07-10","arxiv_id":"2007.05402","repositories_listed":0,"syntology":null},{"url":null,"slug":"representations-for-stable-off-policy","title":"Representations for Stable Off-Policy Reinforcement Learning","date":"2020-07-10","arxiv_id":"2007.05520","repositories_listed":0,"syntology":null},{"url":null,"slug":"vizarel-a-system-to-help-better-understand-rl","title":"Vizarel: A System to Help Better Understand RL Agents","date":"2020-07-10","arxiv_id":"2007.05577","repositories_listed":0,"syntology":null},{"url":null,"slug":"evo-rl-evolutionary-driven-reinforcement","title":"EVO-RL: Evolutionary-Driven Reinforcement Learning","date":"2020-07-09","arxiv_id":"2007.04725","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-prune-deep-neural-networks-via-2","title":"Learning to Prune Deep Neural Networks via Reinforcement Learning","date":"2020-07-09","arxiv_id":"2007.04756","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-dose-ct-denoising-via-joint-bilateral","title":"Low Dose CT Denoising via Joint Bilateral Filtering and Intelligent Parameter Optimization","date":"2020-07-09","arxiv_id":"2007.04768","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakness-analysis-of-cyberspace-configuration","title":"Weakness Analysis of Cyberspace Configuration Based on Reinforcement Learning","date":"2020-07-09","arxiv_id":"2007.04614","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-natural-actor-critic-algorithm-with","title":"A Natural Actor-Critic Algorithm with Downside Risk Constraints","date":"2020-07-08","arxiv_id":"2007.04203","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-map-a-dqn-framework-for-exploring","title":"Auto-MAP: A DQN Framework for Exploring Distributed Execution Plans for DNN Workloads","date":"2020-07-08","arxiv_id":"2007.04069","repositories_listed":0,"syntology":null},{"url":null,"slug":"responsive-safety-in-reinforcement-learning","title":"Responsive Safety in Reinforcement Learning by PID Lagrangian Methods","date":"2020-07-08","arxiv_id":"2007.03964","repositories_listed":0,"syntology":null},{"url":null,"slug":"cognitive-radio-network-throughput","title":"Cognitive Radio Network Throughput Maximization with Deep Reinforcement Learning","date":"2020-07-07","arxiv_id":"2007.03165","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-and-its","title":"Deep Reinforcement Learning and its Neuroscientific Implications","date":"2020-07-07","arxiv_id":"2007.03750","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-interactive","title":"Deep Reinforcement Learning with Interactive Feedback in a Human-Robot Environment","date":"2020-07-07","arxiv_id":"2007.03363","repositories_listed":0,"syntology":null},{"url":null,"slug":"sharp-analysis-of-smoothed-bellman-error","title":"Sharp Analysis of Smoothed Bellman Error Embedding","date":"2020-07-07","arxiv_id":"2007.03749","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-practical-measure-of-interference","title":"Towards a practical measure of interference for reinforcement learning","date":"2020-07-07","arxiv_id":"2007.03807","repositories_listed":0,"syntology":null},{"url":null,"slug":"consensus-multi-agent-reinforcement-learning","title":"Consensus Multi-Agent Reinforcement Learning for Volt-VAR Control in Power Distribution Networks","date":"2020-07-06","arxiv_id":"2007.02991","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-reinforcement-learning-global","title":"Decentralized Reinforcement Learning: Global Decision-Making via Local Economic Transactions","date":"2020-07-05","arxiv_id":"2007.02382","repositories_listed":0,"syntology":null},{"url":null,"slug":"mission-schedule-of-agile-satellites-based-on","title":"Mission schedule of agile satellites based on Proximal Policy Optimization Algorithm","date":"2020-07-05","arxiv_id":"2007.02352","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-paraphrasing-via-deep","title":"Unsupervised Paraphrasing via Deep Reinforcement Learning","date":"2020-07-05","arxiv_id":"2007.02244","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-policy-gradient-method-for","title":"Variational Policy Gradient Method for Reinforcement Learning with General Utilities","date":"2020-07-04","arxiv_id":"2007.02151","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-conceptual-framework-for-externally","title":"A Conceptual Framework for Externally-influenced Agents: An Assisted Reinforcement Learning Review","date":"2020-07-03","arxiv_id":"2007.01544","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unifying-view-of-optimism-in-episodic","title":"A Unifying View of Optimism in Episodic Reinforcement Learning","date":"2020-07-03","arxiv_id":"2007.01891","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-logic-based-reward-shaping-for","title":"Temporal-Logic-Based Reward Shaping for Continuing Reinforcement Learning Tasks","date":"2020-07-03","arxiv_id":"2007.01498","repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-inverse-reinforcement-learning-using","title":"Learning \"What-if\" Explanations for Sequential Decision-Making","date":"2020-07-02","arxiv_id":"2007.13531","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-deep-reinforcement-learning-for-1","title":"Decentralized Deep Reinforcement Learning for Network Level Traffic Signal Control","date":"2020-07-02","arxiv_id":"2007.03433","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-centered-collaborative-robots-with-deep","title":"Human-centered collaborative robots with deep reinforcement learning","date":"2020-07-02","arxiv_id":"2007.01009","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-generalized-reinforcement-learning","title":"A Generalized Reinforcement Learning Algorithm for Online 3D Bin-Packing","date":"2020-07-01","arxiv_id":"2007.00463","repositories_listed":0,"syntology":null},{"url":null,"slug":"falsification-based-robust-adversarial","title":"Falsification-Based Robust Adversarial Reinforcement Learning","date":"2020-07-01","arxiv_id":"2007.00691","repositories_listed":0,"syntology":null},{"url":null,"slug":"interaction-limited-inverse-reinforcement","title":"Interaction-limited Inverse Reinforcement Learning","date":"2020-07-01","arxiv_id":"2007.00425","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-guidance-of-dialogue-generation-with","title":"Semantic Guidance of Dialogue Generation with Reinforcement Learning","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-transfer-in-reinforcement-learning","title":"Sequential Transfer in Reinforcement Learning with a Generative Model","date":"2020-07-01","arxiv_id":"2007.00722","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-reinforcement-learning-agent","title":"Accelerating Reinforcement Learning Agent with EEG-based Implicit Human Feedback","date":"2020-06-30","arxiv_id":"2006.16498","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-a-survey","title":"Model-based Reinforcement Learning: A Survey","date":"2020-06-30","arxiv_id":"2006.16712","repositories_listed":0,"syntology":null},{"url":null,"slug":"testing-match-3-video-games-with-deep","title":"Testing match-3 video games with Deep Reinforcement Learning","date":"2020-06-30","arxiv_id":"2007.01137","repositories_listed":0,"syntology":null},{"url":null,"slug":"empirically-verifying-hypotheses-using","title":"Empirically Verifying Hypotheses Using Reinforcement Learning","date":"2020-06-29","arxiv_id":"2006.15762","repositories_listed":0,"syntology":null},{"url":null,"slug":"extracting-latent-state-representations-with","title":"Extracting Latent State Representations with Linear Dynamics from Rich Observations","date":"2020-06-29","arxiv_id":"2006.16128","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-learning-automation-iot-attack","title":"Towards Learning-automation IoT Attack Detection through Reinforcement Learning","date":"2020-06-29","arxiv_id":"2006.15826","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-handwritten","title":"Reinforcement Learning Based Handwritten Digit Recognition with Two-State Q-Learning","date":"2020-06-28","arxiv_id":"2007.01193","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-framework-for-reinforcement-learning-and","title":"A Unifying Framework for Reinforcement Learning and Planning","date":"2020-06-26","arxiv_id":"2006.15009","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximating-euclidean-by-imprecise-markov","title":"Approximating Euclidean by Imprecise Markov Decision Processes","date":"2020-06-26","arxiv_id":"2006.14923","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-predictive-representations-in","title":"Learning predictive representations in autonomous driving to improve deep reinforcement learning","date":"2020-06-26","arxiv_id":"2006.15110","repositories_listed":0,"syntology":null},{"url":null,"slug":"perception-prediction-reaction-agents-for","title":"Perception-Prediction-Reaction Agents for Deep Reinforcement Learning","date":"2020-06-26","arxiv_id":"2006.15223","repositories_listed":0,"syntology":null},{"url":null,"slug":"psychological-and-neural-evidence-for","title":"Reinforcement Learning and its Connections with Neuroscience and Psychology","date":"2020-06-25","arxiv_id":"2007.01099","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-approach-to-synaptic-learning-for","title":"A differential Hebbian framework for biologically-plausible motor control","date":"2020-06-24","arxiv_id":"2006.13471","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-aware-representations-for-model-based","title":"Control-Aware Representations for Model-based Reinforcement Learning","date":"2020-06-24","arxiv_id":"2006.13408","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-robotic-systems-interpreting","title":"Explainable robotic systems: Understanding goal-driven actions in a reinforcement learning scenario","date":"2020-06-24","arxiv_id":"2006.13615","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-stochastic-approximation-a-unified-view","title":"Local Stochastic Approximation: A Unified View of Federated Learning and Distributed Multi-Task Reinforcement Learning Algorithms","date":"2020-06-24","arxiv_id":"2006.13460","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-non-stationary","title":"Reinforcement Learning for Non-Stationary Markov Decision Processes: The Blessing of (More) Optimism","date":"2020-06-24","arxiv_id":"2006.14389","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-minimax-optimal-reinforcement","title":"Towards Minimax Optimal Reinforcement Learning in Factored Markov Decision Processes","date":"2020-06-24","arxiv_id":"2006.13405","repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-constrained-reinforcement-learning-for","title":"Batch-Constrained Reinforcement Learning for Dynamic Distribution Network Reconfiguration","date":"2020-06-23","arxiv_id":"2006.12749","repositories_listed":0,"syntology":null},{"url":null,"slug":"environment-shaping-in-reinforcement-learning","title":"Environment Shaping in Reinforcement Learning using State Abstraction","date":"2020-06-23","arxiv_id":"2006.13160","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-multi-agent-reinforcement-learning-for","title":"Online Multi-agent Reinforcement Learning for Decentralized Inverter-based Volt-VAR Control","date":"2020-06-23","arxiv_id":"2006.12841","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-reinforcement-learning-for","title":"Provably Efficient Reinforcement Learning for Discounted MDPs with Feature Mapping","date":"2020-06-23","arxiv_id":"2006.13165","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-reinforcement-learning-a-1","title":"Risk-Sensitive Reinforcement Learning: a Martingale Approach to Reward Uncertainty","date":"2020-06-23","arxiv_id":"2006.12686","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-combinatorial-optimization-with","title":"Constrained Combinatorial Optimization with Reinforcement Learning","date":"2020-06-22","arxiv_id":"2006.11984","repositories_listed":0,"syntology":null},{"url":null,"slug":"ecological-reinforcement-learning-1","title":"Ecological Reinforcement Learning","date":"2020-06-22","arxiv_id":"2006.12478","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-sampling-based-maximum-entropy","title":"Efficient Sampling-Based Maximum Entropy Inverse Reinforcement Learning with Application to Autonomous Driving","date":"2020-06-22","arxiv_id":"2006.13704","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-reinforcement-learning-with-self","title":"Near-Optimal Reinforcement Learning with Self-Play","date":"2020-06-22","arxiv_id":"2006.12007","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-causal-reinforcement","title":"Provably Efficient Causal Reinforcement Learning with Confounded Observational Data","date":"2020-06-22","arxiv_id":"2006.12311","repositories_listed":0,"syntology":null}],"record_sha256":"4ca265e053ac7ec207e39c78cbf9eeabcc9c0ebfd21bb14e12b09f8e88df812c","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}