{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/120","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":120,"pages_in_order":152,"rows_per_page":100,"rows":[11901,12000],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/119","next":"/task/reinforcement-learning-1/papers/121","papers":[{"url":null,"slug":"the-effect-of-multi-step-methods-on","title":"The Effect of Multi-step Methods on Overestimation in Deep Reinforcement Learning","date":"2020-06-23","arxiv_id":"2006.12692","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-deep-reinforcement-learning-based","title":"Accelerated Deep Reinforcement Learning Based Load Shedding for Emergency Voltage Control","date":"2020-06-22","arxiv_id":"2006.12667","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-combinatorial-optimization-with","title":"Constrained Combinatorial Optimization with Reinforcement Learning","date":"2020-06-22","arxiv_id":"2006.11984","repositories_listed":0,"syntology":null},{"url":null,"slug":"ecological-reinforcement-learning-1","title":"Ecological Reinforcement Learning","date":"2020-06-22","arxiv_id":"2006.12478","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-sampling-based-maximum-entropy","title":"Efficient Sampling-Based Maximum Entropy Inverse Reinforcement Learning with Application to Autonomous Driving","date":"2020-06-22","arxiv_id":"2006.13704","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-reinforcement-learning-with-self","title":"Near-Optimal Reinforcement Learning with Self-Play","date":"2020-06-22","arxiv_id":"2006.12007","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-causal-reinforcement","title":"Provably Efficient Causal Reinforcement Learning with Confounded Observational Data","date":"2020-06-22","arxiv_id":"2006.12311","repositories_listed":0,"syntology":null},{"url":null,"slug":"qopt-optimistic-value-function","title":"QTRAN++: Improved Value Transformation for Cooperative Multi-Agent Reinforcement Learning","date":"2020-06-22","arxiv_id":"2006.12010","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-reinforcement-learning-near","title":"Risk-Sensitive Reinforcement Learning: Near-Optimal Risk-Sample Tradeoff in Regret","date":"2020-06-22","arxiv_id":"2006.13827","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-of","title":"Sample-Efficient Reinforcement Learning of Undercomplete POMDPs","date":"2020-06-22","arxiv_id":"2006.12484","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-the-curse-of-many-agents-provable","title":"Breaking the Curse of Many Agents: Provable Mean Embedding Q-Iteration for Mean-Field Reinforcement Learning","date":"2020-06-21","arxiv_id":"2006.11917","repositories_listed":0,"syntology":null},{"url":null,"slug":"gradient-em-bayesian-meta-learning","title":"Gradient-EM Bayesian Meta-learning","date":"2020-06-21","arxiv_id":"2006.11764","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-for-deep","title":"Hierarchical Reinforcement Learning for Deep Goal Reasoning: An Expressiveness Analysis","date":"2020-06-21","arxiv_id":"2006.11704","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-trembling-hand-perfect-mean-field","title":"Reinforcement Learning for Mean Field Games with Strategic Complementarities","date":"2020-06-21","arxiv_id":"2006.11683","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-self-critical-training-for","title":"Off-Policy Self-Critical Training for Transformer in Visual Paragraph Generation","date":"2020-06-21","arxiv_id":"2006.11714","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-optimism-in-model-based-reinforcement","title":"Towards Tractable Optimism in Model-Based Reinforcement Learning","date":"2020-06-21","arxiv_id":"2006.11911","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-safe-reinforcement-learning-with","title":"Accelerating Safe Reinforcement Learning with Constraint-mismatched Policies","date":"2020-06-20","arxiv_id":"2006.11645","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropic-risk-constrained-soft-robust-policy","title":"Entropic Risk Constrained Soft-Robust Policy Optimization","date":"2020-06-20","arxiv_id":"2006.11679","repositories_listed":0,"syntology":null},{"url":null,"slug":"langevin-dynamics-for-inverse-reinforcement","title":"Langevin Dynamics for Adaptive Inverse Reinforcement Learning of Stochastic Gradient Algorithms","date":"2020-06-20","arxiv_id":"2006.11674","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-robust-reinforcement-learning-with","title":"Robust Reinforcement Learning using Least Squares Policy Iteration with Provable Performance Guarantees","date":"2020-06-20","arxiv_id":"2006.11608","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for","title":"A Reinforcement Learning Approach for Transient Control of Liquid Rocket Engines","date":"2020-06-19","arxiv_id":"2006.11108","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-to-earn-enabling-coordination-within-a","title":"Learn to Earn: Enabling Coordination within a Ride Hailing Fleet","date":"2020-06-19","arxiv_id":"2006.10904","repositories_listed":0,"syntology":null},{"url":null,"slug":"nrowan-dqn-a-stable-noisy-network-with-noise","title":"NROWAN-DQN: A Stable Noisy Network with Noise Reduction and Online Weight Adjustment for Exploration","date":"2020-06-19","arxiv_id":"2006.10980","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-reward-free-reinforcement-learning-with","title":"On Reward-Free Reinforcement Learning with Linear Function Approximation","date":"2020-06-19","arxiv_id":"2006.11274","repositories_listed":0,"syntology":null},{"url":null,"slug":"set-invariant-constrained-reinforcement","title":"FISAR: Forward Invariant Safe Reinforcement Learning with a Deep Neural Network-Based Optimize","date":"2020-06-19","arxiv_id":"2006.11419","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-reinforcement-2","title":"Cooperative Multi-Agent Reinforcement Learning with Partial Observations","date":"2020-06-18","arxiv_id":"2006.10822","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-amidst-lifelong","title":"Deep Reinforcement Learning amidst Lifelong Non-Stationarity","date":"2020-06-18","arxiv_id":"2006.10701","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-value-function-approximation-for","title":"Distributed Value Function Approximation for Collaborative Multi-Agent Reinforcement Learning","date":"2020-06-18","arxiv_id":"2006.10443","repositories_listed":0,"syntology":null},{"url":null,"slug":"flambe-structural-complexity-and","title":"FLAMBE: Structural Complexity and Representation Learning of Low Rank MDPs","date":"2020-06-18","arxiv_id":"2006.10814","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-recommender-system-via-knowledge","title":"Interactive Recommender System via Knowledge Graph-enhanced Reinforcement Learning","date":"2020-06-18","arxiv_id":"2006.10389","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-adaptive-reinforcement-learning-in","title":"Provably adaptive reinforcement learning in metric spaces","date":"2020-06-18","arxiv_id":"2006.10875","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-estimation-bias-via-weighted-delayed","title":"WD3: Taming the Estimation Bias in Deep Reinforcement Learning","date":"2020-06-18","arxiv_id":"2006.12622","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-controller-for-3d","title":"Deep Reinforcement Learning Controller for 3D Path-following and Collision Avoidance by Autonomous Underwater Vehicles","date":"2020-06-17","arxiv_id":"2006.09792","repositories_listed":0,"syntology":null},{"url":null,"slug":"eco-vehicular-edge-networks-for-connected","title":"Eco-Vehicular Edge Networks for Connected Transportation: A Distributed Multi-Agent Reinforcement Learning Approach","date":"2020-06-17","arxiv_id":"2003.01005","repositories_listed":0,"syntology":null},{"url":null,"slug":"introduction-to-machine-learning-for","title":"Introduction to Machine Learning for Accelerator Physics","date":"2020-06-17","arxiv_id":"2006.09913","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameterized-mdps-and-reinforcement-learning","title":"Parameterized MDPs and Reinforcement Learning Problems -- A Maximum Entropy Principle Based Framework","date":"2020-06-17","arxiv_id":"2006.09646","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-evaluation-and-seeking-for-multi-agent","title":"Policy Evaluation and Seeking for Multi-Agent Reinforcement Learning via Best Response","date":"2020-06-17","arxiv_id":"2006.09585","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-uncertainty","title":"Reinforcement Learning with Uncertainty Estimation for Tactical Decision-Making in Intersections","date":"2020-06-17","arxiv_id":"2006.09786","repositories_listed":0,"syntology":null},{"url":null,"slug":"colreg-compliant-collision-avoidance-for","title":"COLREG-Compliant Collision Avoidance for Unmanned Surface Vehicle using Deep Reinforcement Learning","date":"2020-06-16","arxiv_id":"2006.09540","repositories_listed":0,"syntology":null},{"url":null,"slug":"index-selection-for-nosql-database-with-deep","title":"Index Selection for NoSQL Database with Deep Reinforcement Learning","date":"2020-06-16","arxiv_id":"2006.08842","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-embedding-model-based-reinforcement","title":"Model Embedding Model-Based Reinforcement Learning","date":"2020-06-16","arxiv_id":"2006.09234","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-4","title":"Multi-Agent Reinforcement Learning for Adaptive User Association in Dynamic mmWave Networks","date":"2020-06-16","arxiv_id":"2006.09066","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-reinforcement-learning-control-by","title":"Online Reinforcement Learning Control by Direct Heuristic Dynamic Programming: from Time-Driven to Event-Driven","date":"2020-06-16","arxiv_id":"2006.08938","repositories_listed":0,"syntology":null},{"url":null,"slug":"preference-based-reinforcement-learning-with","title":"Preference-based Reinforcement Learning with Finite-Time Guarantees","date":"2020-06-16","arxiv_id":"2006.08910","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-control-of-robotic","title":"Reinforcement Learning Control of Robotic Knee with Human in the Loop by Flexible Policy Iteration","date":"2020-06-16","arxiv_id":"2006.09008","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-cyclegan-reinforcement-learning-aware-1","title":"RL-CycleGAN: Reinforcement Learning Aware Simulation-To-Real","date":"2020-06-16","arxiv_id":"2006.09001","repositories_listed":0,"syntology":null},{"url":null,"slug":"shieldnn-a-provably-safe-nn-filter-for-unsafe","title":"ShieldNN: A Provably Safe NN Filter for Unsafe NN Controllers","date":"2020-06-16","arxiv_id":"2006.09564","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-the-order-batching-and-sequencing","title":"Solving the Order Batching and Sequencing Problem using Deep Reinforcement Learning","date":"2020-06-16","arxiv_id":"2006.09507","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-agnostic-exploration-in-reinforcement","title":"Task-agnostic Exploration in Reinforcement Learning","date":"2020-06-16","arxiv_id":"2006.09497","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-teaching-dimension-of-q-learning","title":"The Sample Complexity of Teaching-by-Reinforcement on Q-Learning","date":"2020-06-16","arxiv_id":"2006.09324","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-online-evolving-framework-for-advancing","title":"An online evolving framework for advancing reinforcement-learning based automated vehicle control","date":"2020-06-15","arxiv_id":"2006.08092","repositories_listed":0,"syntology":null},{"url":null,"slug":"designing-high-fidelity-multi-qubit-gates-for","title":"Designing high-fidelity multi-qubit gates for semiconductor quantum dots through deep reinforcement learning","date":"2020-06-15","arxiv_id":"2006.08813","repositories_listed":0,"syntology":null},{"url":null,"slug":"runtime-adaptation-in-wireless-sensor-nodes","title":"Runtime Adaptation in Wireless Sensor Nodes Using Structured Learning","date":"2020-06-15","arxiv_id":"2006.08666","repositories_listed":0,"syntology":null},{"url":null,"slug":"variable-gain-gradient-descent-based","title":"Variable Gain Gradient Descent-based Reinforcement Learning for Robust Optimal Tracking Control of Uncertain Nonlinear System with Input-Constraints","date":"2020-06-15","arxiv_id":"1911.04157","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-and-detection-on","title":"Adversarial Attacks and Detection on Reinforcement Learning-Based Interactive Recommender Systems","date":"2020-06-14","arxiv_id":"2006.07934","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-local-policy-optimization-via-diversity","title":"Non-local Policy Optimization via Diversity-regularized Collaborative Exploration","date":"2020-06-14","arxiv_id":"2006.07781","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-supervision-from","title":"Reinforcement Learning with Supervision from Noisy Demonstrations","date":"2020-06-14","arxiv_id":"2006.07808","repositories_listed":0,"syntology":null},{"url":null,"slug":"tackling-morpion-solitaire-with-alphazero","title":"Tackling Morpion Solitaire with AlphaZero-likeRanked Reward Reinforcement Learning","date":"2020-06-14","arxiv_id":"2006.07970","repositories_listed":0,"syntology":null},{"url":null,"slug":"hindsight-expectation-maximization-for-goal","title":"Hindsight Expectation Maximization for Goal-conditioned Reinforcement Learning","date":"2020-06-13","arxiv_id":"2006.07549","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-as-iterative-and","title":"Reinforcement Learning as Iterative and Amortised Inference","date":"2020-06-13","arxiv_id":"2006.10524","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-brief-look-at-generalization-in-visual-meta","title":"A Brief Look at Generalization in Visual Meta-Reinforcement Learning","date":"2020-06-12","arxiv_id":"2006.07262","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-worlds-in-reinforcement-learning","title":"Bridging Worlds in Reinforcement Learning with Model-Advantage","date":"2020-06-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-control-for-searching-and-planning","title":"Continuous Control for Searching and Planning with a Learned Model","date":"2020-06-12","arxiv_id":"2006.07430","repositories_listed":0,"syntology":null},{"url":null,"slug":"decorrelated-double-q-learning","title":"Decorrelated Double Q-learning","date":"2020-06-12","arxiv_id":"2006.06956","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-neural","title":"Deep Reinforcement Learning for Neural Control","date":"2020-06-12","arxiv_id":"2006.07352","repositories_listed":0,"syntology":null},{"url":null,"slug":"explore-then-execute-adapting-without-rewards-1","title":"Explore then Execute: Adapting without Rewards via Factorized Meta-Reinforcement Learning","date":"2020-06-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generalizing-curricula-for-reinforcement","title":"Generalizing Curricula for Reinforcement Learning","date":"2020-06-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-for-5","title":"Hierarchical reinforcement learning for efficent exploration and transfer","date":"2020-06-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"human-and-multi-agent-collaboration-in-a","title":"Human and Multi-Agent collaboration in a human-MARL teaming framework","date":"2020-06-12","arxiv_id":"2006.07301","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-intrinsically-motivated-options-to","title":"Learning Intrinsically Motivated Options to Stimulate Policy Exploration","date":"2020-06-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"logical-composition-in-lifelong-reinforcement","title":"Logical Composition in Lifelong Reinforcement Learning","date":"2020-06-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-robust-to","title":"Meta-Reinforcement Learning Robust to Distributional Shift via Model Identification and Experience Relabeling","date":"2020-06-12","arxiv_id":"2006.07178","repositories_listed":0,"syntology":null},{"url":null,"slug":"potential-field-guided-actor-critic","title":"Potential Field Guided Actor-Critic Reinforcement Learning","date":"2020-06-12","arxiv_id":"2006.06923","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-guaranteed-reinforcement-learning","title":"Safety-guaranteed Reinforcement Learning based on Multi-class Support Vector Machine","date":"2020-06-12","arxiv_id":"2006.07446","repositories_listed":0,"syntology":null},{"url":null,"slug":"starcraft-ii-build-order-optimization-using","title":"StarCraft II Build Order Optimization using Deep Reinforcement Learning and Monte-Carlo Tree Search","date":"2020-06-12","arxiv_id":"2006.10525","repositories_listed":0,"syntology":null},{"url":null,"slug":"systematic-generalisation-through-task","title":"Systematic Generalisation through Task Temporal Logic and Deep Reinforcement Learning","date":"2020-06-12","arxiv_id":"2006.08767","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-reinforcement-learning-to-allocate-and","title":"Using Reinforcement Learning to Allocate and Manage Service Function Chains in Cellular Networks","date":"2020-06-12","arxiv_id":"2006.07349","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-electric","title":"Deep Reinforcement Learning for Electric Transmission Voltage Control","date":"2020-06-11","arxiv_id":"2006.06728","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-by-maximizing-renyi-entropy-for","title":"Exploration by Maximizing Rényi Entropy for Reward-Free RL Framework","date":"2020-06-11","arxiv_id":"2006.06193","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-informational-learning-processes","title":"Multi-Agent Informational Learning Processes","date":"2020-06-11","arxiv_id":"2006.06870","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-via","title":"Sample Efficient Reinforcement Learning via Low-Rank Matrix Estimation","date":"2020-06-11","arxiv_id":"2006.06135","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-multi-agent-reinforcement-learning","title":"Scalable Multi-Agent Reinforcement Learning for Networked Systems with Average Reward","date":"2020-06-11","arxiv_id":"2006.06626","repositories_listed":0,"syntology":null},{"url":null,"slug":"surveys-without-questions-a-reinforcement","title":"Surveys without Questions: A Reinforcement Learning Approach","date":"2020-06-11","arxiv_id":"2006.06323","repositories_listed":0,"syntology":null},{"url":null,"slug":"zeroth-order-supervised-policy-improvement","title":"Zeroth-Order Supervised Policy Improvement","date":"2020-06-11","arxiv_id":"2006.06600","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-optical","title":"Deep reinforcement learning for optical systems: A case study of mode-locked lasers","date":"2020-06-10","arxiv_id":"2006.05579","repositories_listed":0,"syntology":null},{"url":null,"slug":"development-of-a-stochastic-traffic","title":"Development of A Stochastic Traffic Environment with Generative Time-Series Models for Improving Generalization Capabilities of Autonomous Driving Agents","date":"2020-06-10","arxiv_id":"2006.05821","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-play-table-tennis-from-scratch","title":"Learning to Play Table Tennis From Scratch using Muscular Robots","date":"2020-06-10","arxiv_id":"2006.05935","repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-learning-and-control-engineering-the","title":"Machine learning and control engineering: The model-free case","date":"2020-06-10","arxiv_id":"2006.05738","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-in-a","title":"Multi-Agent Reinforcement Learning in a Realistic Limit Order Book Market Simulation","date":"2020-06-10","arxiv_id":"2006.05574","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-risk-sensitive-reinforcement","title":"Off-Policy Risk-Sensitive Reinforcement Learning Based Constrained Robust Optimal Control","date":"2020-06-10","arxiv_id":"2006.05681","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-cost-management-in-smart-meters-an","title":"Privacy-Cost Management in Smart Meters with Mutual Information-Based Reinforcement Learning","date":"2020-06-10","arxiv_id":"2006.06106","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-greedyucb-a-new-exploration-policy-for","title":"Q-greedyUCB: a New Exploration Policy for Adaptive and Resource-efficient Scheduling","date":"2020-06-10","arxiv_id":"2006.05902","repositories_listed":0,"syntology":null},{"url":null,"slug":"searching-learning-strategy-with","title":"Searching Learning Strategy with Reinforcement Learning for 3D Medical Image Segmentation","date":"2020-06-10","arxiv_id":"2006.05847","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-reinforcement-learning","title":"Self-Supervised Reinforcement Learning for Recommender Systems","date":"2020-06-10","arxiv_id":"2006.05779","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-impact-of-non-stationarity-on","title":"Transient Non-Stationarity and Generalisation in Deep Reinforcement Learning","date":"2020-06-10","arxiv_id":"2006.05826","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-overall-view-of-key-problems-in","title":"An overall view of key problems in algorithmic trading and recent progress","date":"2020-06-09","arxiv_id":"2006.05515","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-discovery-from-incomplete-data-using","title":"Causal Discovery from Incomplete Data using An Encoder and Reinforcement Learning","date":"2020-06-09","arxiv_id":"2006.05554","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-learning-on-heterogeneous","title":"Distributed Learning on Heterogeneous Resource-Constrained Devices","date":"2020-06-09","arxiv_id":"2006.05403","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-focused-agent-based-modeling-using-rl","title":"Policy-focused Agent-based Modeling using RL Behavioral Models","date":"2020-06-09","arxiv_id":"2006.05048","repositories_listed":0,"syntology":null},{"url":null,"slug":"stealing-deep-reinforcement-learning-models","title":"Stealing Deep Reinforcement Learning Models for Fun and Profit","date":"2020-06-09","arxiv_id":"2006.05032","repositories_listed":0,"syntology":null}],"record_sha256":"e4b99853fda81761da1993a6cc17dc29ca473d1272d43a93d5dc72a5906c3400","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}