{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/51","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":51,"pages_in_order":59,"rows_per_page":100,"rows":[5001,5100],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/50","next":"/task/deep-reinforcement-learning/papers/52","papers":[{"url":null,"slug":"deep-model-compression-via-deep-reinforcement","title":"Deep Model Compression Via Two-Stage Deep Reinforcement Learning","date":"2019-12-04","arxiv_id":"1912.02254","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-agent-communication-under-limited","title":"Learning Agent Communication under Limited Bandwidth by Message Pruning","date":"2019-12-03","arxiv_id":"1912.05304","repositories_listed":0,"syntology":null},{"url":null,"slug":"191201715","title":"Human-Robot Collaboration via Deep Reinforcement Learning of Real-World Interactions","date":"2019-12-02","arxiv_id":"1912.01715","repositories_listed":0,"syntology":null},{"url":null,"slug":"market-making-and-incentives-design-in-the","title":"Market making and incentives design in the presence of a dark pool: a deep reinforcement learning approach","date":"2019-12-02","arxiv_id":"1912.01129","repositories_listed":0,"syntology":null},{"url":null,"slug":"flow-rate-control-in-smart-district-heating","title":"Flow Rate Control in Smart District Heating Systems Using Deep Reinforcement Learning","date":"2019-12-01","arxiv_id":"1912.05313","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-embedded-drl-for-intelligent-greenhouse","title":"Model Embedded DRL for Intelligent Greenhouse Control","date":"2019-12-01","arxiv_id":"1912.00020","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-temporal-difference-learning-converges-1","title":"Neural Temporal-Difference Learning Converges to Global Optima","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-trust-regionproximal-policy","title":"Neural Trust Region/Proximal Policy Optimization Attains Globally Optimal Policy","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"algorithmic-improvements-for-deep","title":"Algorithmic Improvements for Deep Reinforcement Learning applied to Interactive Fiction","date":"2019-11-28","arxiv_id":"1911.12511","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-with-2","title":"Multi-Agent Deep Reinforcement Learning with Adaptive Policies","date":"2019-11-28","arxiv_id":"1912.00949","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-adaptive","title":"Adversarial Deep Reinforcement Learning based Adaptive Moving Target Defense","date":"2019-11-27","arxiv_id":"1911.11972","repositories_listed":0,"syntology":null},{"url":null,"slug":"grim-repr-prioritising-generating-important","title":"GRIm-RePR: Prioritising Generating Important Features for Pseudo-Rehearsal","date":"2019-11-27","arxiv_id":"1911.11988","repositories_listed":0,"syntology":null},{"url":null,"slug":"restoring-chaos-using-deep-reinforcement","title":"Restoring Chaos Using Deep Reinforcement Learning","date":"2019-11-27","arxiv_id":"1912.00947","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-portfolio-management-with","title":"A General Framework on Enhancing Portfolio Management with Reinforcement Learning","date":"2019-11-26","arxiv_id":"1911.11880","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-vehicle-mixed-reality-reinforcement","title":"Multi-Vehicle Mixed-Reality Reinforcement Learning for Autonomous Multi-Lane Driving","date":"2019-11-26","arxiv_id":"1911.11699","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-architecture","title":"A Deep Reinforcement Learning Architecture for Multi-stage Optimal Control","date":"2019-11-25","arxiv_id":"1911.10684","repositories_listed":0,"syntology":null},{"url":null,"slug":"biologically-inspired-architectures-for","title":"Biologically inspired architectures for sample-efficient deep reinforcement learning","date":"2019-11-25","arxiv_id":"1911.11285","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-multi-driver","title":"Deep Reinforcement Learning for Multi-Driver Vehicle Dispatching and Repositioning Problem","date":"2019-11-25","arxiv_id":"1911.11260","repositories_listed":0,"syntology":null},{"url":null,"slug":"merging-deterministic-policy-gradient","title":"Merging Deterministic Policy Gradient Estimations with Varied Bias-Variance Tradeoff for Effective Deep Reinforcement Learning","date":"2019-11-24","arxiv_id":"1911.10527","repositories_listed":0,"syntology":null},{"url":null,"slug":"which-channel-to-ask-my-question-personalized","title":"Which Channel to Ask My Question? Personalized Customer Service RequestStream Routing using DeepReinforcement Learning","date":"2019-11-24","arxiv_id":"1911.10521","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-trading","title":"Deep Reinforcement Learning for Trading","date":"2019-11-22","arxiv_id":"1911.10107","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-neuroethology-of-a-virtual-rodent-1","title":"Deep neuroethology of a virtual rodent","date":"2019-11-21","arxiv_id":"1911.09451","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-in-cryptocurrency","title":"Deep Reinforcement Learning in Cryptocurrency Market Making","date":"2019-11-20","arxiv_id":"1911.08647","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-online-threat-screening-games-using","title":"Solving Online Threat Screening Games using Constrained Action Space Reinforcement Learning","date":"2019-11-20","arxiv_id":"1911.08799","repositories_listed":0,"syntology":null},{"url":null,"slug":"placement-optimization-of-aerial-base","title":"Placement Optimization of Aerial Base Stations with Deep Reinforcement Learning","date":"2019-11-19","arxiv_id":"1911.08111","repositories_listed":0,"syntology":null},{"url":null,"slug":"gamma-nets-generalizing-value-estimation-over","title":"Gamma-Nets: Generalizing Value Estimation over Timescale","date":"2019-11-18","arxiv_id":"1911.07794","repositories_listed":0,"syntology":null},{"url":null,"slug":"inducing-cooperation-via-team-regret","title":"Inducing Cooperation via Team Regret Minimization based Multi-Agent Deep Reinforcement Learning","date":"2019-11-18","arxiv_id":"1911.07712","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-reinforcement-learning-of","title":"Unsupervised Reinforcement Learning of Transferable Meta-Skills for Embodied Navigation","date":"2019-11-18","arxiv_id":"1911.07450","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-policy-gradient-algorithms-by","title":"Off-Policy Policy Gradient Algorithms by Constraining the State Distribution Shift","date":"2019-11-16","arxiv_id":"1911.06970","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-co-adaptation-of-morphology","title":"Data-efficient Co-Adaptation of Morphology and Behaviour with Deep Reinforcement Learning","date":"2019-11-15","arxiv_id":"1911.06832","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-exploration-through-latent","title":"Improved Exploration through Latent Trajectory Optimization in Deep Deterministic Policy Gradient","date":"2019-11-15","arxiv_id":"1911.06833","repositories_listed":0,"syntology":null},{"url":null,"slug":"atari-fying-the-vehicle-routing-problem-with","title":"Gamifying the Vehicle Routing Problem with Stochastic Requests","date":"2019-11-14","arxiv_id":"1911.05922","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-adaptive","title":"Deep Reinforcement Learning for Adaptive Traffic Signal Control","date":"2019-11-14","arxiv_id":"1911.06294","repositories_listed":0,"syntology":null},{"url":null,"slug":"buffer-aware-wireless-scheduling-based-on","title":"Buffer-aware Wireless Scheduling based on Deep Reinforcement Learning","date":"2019-11-13","arxiv_id":"1911.05281","repositories_listed":0,"syntology":null},{"url":null,"slug":"msdf-a-deep-reinforcement-learning-framework","title":"MSDF: A Deep Reinforcement Learning Framework for Service Function Chain Migration","date":"2019-11-12","arxiv_id":"1911.04801","repositories_listed":0,"syntology":null},{"url":null,"slug":"schedule-earth-observation-satellites-with","title":"Schedule Earth Observation satellites with Deep Reinforcement Learning","date":"2019-11-12","arxiv_id":"1911.05696","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-path-policy-optimization","title":"Multi-Path Policy Optimization","date":"2019-11-11","arxiv_id":"1911.04207","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-dynamic","title":"Deep Reinforcement Learning Based Dynamic Trajectory Control for UAV-assisted Mobile Edge Computing","date":"2019-11-10","arxiv_id":"1911.03887","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimalistic-attacks-how-little-it-takes-to","title":"Minimalistic Attacks: How Little it Takes to Fool a Deep Reinforcement Learning Policy","date":"2019-11-10","arxiv_id":"1911.03849","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-added-chemical-discovery-using","title":"Value-Added Chemical Discovery Using Reinforcement Learning","date":"2019-11-10","arxiv_id":"1911.07630","repositories_listed":0,"syntology":null},{"url":null,"slug":"worst-cases-policy-gradients","title":"Worst Cases Policy Gradients","date":"2019-11-09","arxiv_id":"1911.03618","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-sharing-between-cooperative","title":"Experience Sharing Between Cooperative Reinforcement Learning Agents","date":"2019-11-06","arxiv_id":"1911.02191","repositories_listed":0,"syntology":null},{"url":null,"slug":"mbcal-a-simple-and-efficient-reinforcement","title":"MBCAL: Sample Efficient and Variance Reduced Reinforcement Learning for Recommender Systems","date":"2019-11-06","arxiv_id":"1911.02248","repositories_listed":0,"syntology":null},{"url":null,"slug":"resilient-load-restoration-in-microgrids","title":"Resilient Load Restoration in Microgrids Considering Mobile Energy Storage Fleets: A Deep Reinforcement Learning Approach","date":"2019-11-06","arxiv_id":"1911.02206","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepracer-educational-autonomous-racing","title":"DeepRacer: Educational Autonomous Racing Platform for Experimentation with Sim2Real Reinforcement Learning","date":"2019-11-05","arxiv_id":"1911.01562","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-multi-robot-exploration-via-multi","title":"Efficient Multi-robot Exploration via Multi-head Attention-based Cooperation Strategy","date":"2019-11-05","arxiv_id":"1911.01774","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-end-to-end-deep-rl-framework-for-task","title":"An End-to-End Deep RL Framework for Task Arrangement in Crowdsourcing Platforms","date":"2019-11-04","arxiv_id":"1911.01030","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-robustness-training-for-deep","title":"Online Robustness Training for Deep Reinforcement Learning","date":"2019-11-03","arxiv_id":"1911.00887","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-text","title":"Deep Reinforcement Learning-based Text Anonymization against Private-Attribute Inference","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"experienced-deep-reinforcement-learning-with","title":"Experienced Deep Reinforcement Learning with Generative Adversarial Networks (GANs) for Model-Free Ultra Reliable Low Latency Communication","date":"2019-11-01","arxiv_id":"1911.03264","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-graph-attention-mechanism-into","title":"Incorporating Graph Attention Mechanism into Knowledge Graph Reasoning Based on Deep Reinforcement Learning","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"seeded-self-play-for-language-learning","title":"Seeded self-play for language learning","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-narration-based-reward-shaping-approach","title":"A Narration-based Reward Shaping Approach using Grounded Natural Language Commands","date":"2019-10-31","arxiv_id":"1911.00497","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepline-automl-tool-for-pipelines-generation","title":"DeepLine: AutoML Tool for Pipelines Generation using Deep Reinforcement Learning and Hierarchical Actions Filtering","date":"2019-10-31","arxiv_id":"1911.00061","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlink-deep-reinforcement-learning-for-user","title":"RLINK: Deep Reinforcement Learning for User Identity Linkage","date":"2019-10-31","arxiv_id":"1910.14273","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-distributed-model-free-algorithm-for-multi","title":"A Distributed Model-Free Algorithm for Multi-hop Ride-sharing using Deep Reinforcement Learning","date":"2019-10-30","arxiv_id":"1910.14002","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-testing-and-falsification-with","title":"Automatic Testing With Reusable Adversarial Agents","date":"2019-10-30","arxiv_id":"1910.13645","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-distributed","title":"Deep Reinforcement Learning for Distributed Uncoordinated Cognitive Radios Resource Allocation","date":"2019-10-29","arxiv_id":"1911.03366","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-market-making","title":"Deep reinforcement learning for market making in corporate bonds: beating the curse of dimensionality","date":"2019-10-29","arxiv_id":"1910.13205","repositories_listed":0,"syntology":null},{"url":null,"slug":"certified-adversarial-robustness-for-deep","title":"Certified Adversarial Robustness for Deep Reinforcement Learning","date":"2019-10-28","arxiv_id":"1910.12908","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-architecture-evolution-in-deep","title":"Neural Architecture Evolution in Deep Reinforcement Learning for Continuous Control","date":"2019-10-28","arxiv_id":"1910.12824","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-resource-allocation-in-wireless","title":"Optimal Resource Allocation in Wireless Control Systems via Deep Policy Gradient","date":"2019-10-25","arxiv_id":"1910.11900","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-in-deep-reinforcement-learning","title":"Pre-training in Deep Reinforcement Learning for Automatic Speech Recognition","date":"2019-10-24","arxiv_id":"1910.11256","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-and-safer-training-by-embedding-high","title":"Faster and Safer Training by Embedding High-Level Knowledge into Deep Reinforcement Learning","date":"2019-10-22","arxiv_id":"1910.09986","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-resilient-behaviors-for-navigation","title":"Learning Resilient Behaviors for Navigation Under Uncertainty","date":"2019-10-22","arxiv_id":"1910.09998","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-framework-for-multi-agent-reinforcement","title":"A New Framework for Multi-Agent Reinforcement Learning -- Centralized Training and Exploration with Decentralized Execution via Policy Distillation","date":"2019-10-21","arxiv_id":"1910.09152","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-benefits-from-trajectory","title":"Combining Benefits from Trajectory Optimization and Deep Reinforcement Learning","date":"2019-10-21","arxiv_id":"1910.09667","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-allocation-in-mobility-aware","title":"Resource Allocation in Mobility-Aware Federated Learning Networks: A Deep Reinforcement Learning Approach","date":"2019-10-21","arxiv_id":"1910.09172","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-sim-to-real-adaptation-for","title":"Self-Supervised Sim-to-Real Adaptation for Visual Robotic Manipulation","date":"2019-10-21","arxiv_id":"1910.09470","repositories_listed":0,"syntology":null},{"url":null,"slug":"diverse-behavior-is-what-game-ai-needs","title":"Diverse Behavior Is What Game AI Needs: Generating Varied Human-Like Playing Styles Using Evolutionary Multi-Objective Deep Reinforcement Learning","date":"2019-10-20","arxiv_id":"1910.09022","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-6d-multi-object-pose-estimation-in","title":"Active 6D Multi-Object Pose Estimation in Cluttered Scenarios with Deep Reinforcement Learning","date":"2019-10-19","arxiv_id":"1910.08811","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-ai-deep-reinforcement-learning","title":"Explainable AI: Deep Reinforcement Learning Agents for Residential Demand Side Cost Savings in Smart Grids","date":"2019-10-19","arxiv_id":"1910.08719","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-connections-between-constrained","title":"On Connections between Constrained Optimization and Reinforcement Learning","date":"2019-10-18","arxiv_id":"1910.08476","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-deep-learning-techniques-for-1","title":"A Survey of Deep Learning Techniques for Autonomous Driving","date":"2019-10-17","arxiv_id":"1910.07738","repositories_listed":0,"syntology":null},{"url":null,"slug":"creativity-in-robot-manipulation-with-deep","title":"Creativity in Robot Manipulation with Deep Reinforcement Learning","date":"2019-10-16","arxiv_id":"1910.07459","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordination-of-pv-smart-inverters-using-deep","title":"Coordination of PV Smart Inverters Using Deep Reinforcement Learning for Grid Voltage Regulation","date":"2019-10-14","arxiv_id":"1910.05907","repositories_listed":0,"syntology":null},{"url":null,"slug":"qos-and-jamming-aware-wireless-networking","title":"QoS and Jamming-Aware Wireless Networking Using Deep Reinforcement Learning","date":"2019-10-13","arxiv_id":"1910.05766","repositories_listed":0,"syntology":null},{"url":null,"slug":"curiosity-driven-recommendation-strategy-for","title":"Curiosity-Driven Recommendation Strategy for Adaptive Learning via Deep Reinforcement Learning","date":"2019-10-12","arxiv_id":"1910.12577","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-hvac-scheduling-using-reinforcement","title":"Building HVAC Scheduling Using Reinforcement Learning via Neural Network Based Model Approximation","date":"2019-10-11","arxiv_id":"1910.05313","repositories_listed":0,"syntology":null},{"url":null,"slug":"green-deep-reinforcement-learning-for-radio","title":"Green Deep Reinforcement Learning for Radio Resource Management: Architecture, Algorithm Compression and Challenge","date":"2019-10-11","arxiv_id":"1910.05054","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-intrinsically-motivated-robotic","title":"Efficient Intrinsically Motivated Robotic Grasping with Learning-Adaptive Imagination in Latent Space","date":"2019-10-10","arxiv_id":"1910.04729","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dual-hormone-closed-loop-delivery-system","title":"A Dual-Hormone Closed-Loop Delivery System for Type 1 Diabetes Using Deep Reinforcement Learning","date":"2019-10-09","arxiv_id":"1910.04059","repositories_listed":0,"syntology":null},{"url":null,"slug":"defensive-escort-teams-via-multi-agent-deep","title":"Defensive Escort Teams via Multi-Agent Deep Reinforcement Learning","date":"2019-10-09","arxiv_id":"1910.04537","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-deep-double-q-routing","title":"Hierarchical Deep Double Q-Routing","date":"2019-10-09","arxiv_id":"1910.04041","repositories_listed":0,"syntology":null},{"url":null,"slug":"tactical-reward-shaping-bypassing","title":"Tactical Reward Shaping: Bypassing Reinforcement Learning with Strategy-Based Goals","date":"2019-10-08","arxiv_id":"1910.03144","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepmnavigate-deep-reinforced-multi-robot","title":"DeepMNavigate: Deep Reinforced Multi-Robot Navigation Unifying Local & Global Collision Avoidance","date":"2019-10-04","arxiv_id":"1910.09441","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-single-shot","title":"Deep Reinforcement Learning for Single-Shot Diagnosis and Adaptation in Damaged Robots","date":"2019-10-02","arxiv_id":"1910.01240","repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-off-policy-reinforcement-learning","title":"Never Worse, Mostly Better: Stable Policy Improvement in Deep Reinforcement Learning","date":"2019-10-02","arxiv_id":"1910.01062","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-active-learning-for-human","title":"Deep Reinforcement Active Learning for Human-in-the-Loop Person Re-Identification","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-interaction-aware-scene-understanding","title":"Dynamic Interaction-Aware Scene Understanding for Reinforcement Learning in Autonomous Driving","date":"2019-09-30","arxiv_id":"1909.13582","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-motion-planning-of-quadrotors","title":"End-to-End Motion Planning of Quadrotors Using Deep Reinforcement Learning","date":"2019-09-30","arxiv_id":"1909.13599","repositories_listed":0,"syntology":null},{"url":null,"slug":"tensor-based-cooperative-control-for-large","title":"Tensor-based Cooperative Control for Large Scale Multi-intersection Traffic Signal Using Deep Reinforcement Learning and Imitation Learning","date":"2019-09-30","arxiv_id":"1909.13428","repositories_listed":0,"syntology":null},{"url":null,"slug":"counterfactual-states-for-atari-agents-via","title":"Counterfactual States for Atari Agents via Generative Deep Learning","date":"2019-09-27","arxiv_id":"1909.12969","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-power","title":"Deep Reinforcement Learning Based Power control for Wireless Multicast Systems","date":"2019-09-27","arxiv_id":"1910.05308","repositories_listed":0,"syntology":null},{"url":null,"slug":"surreal-system-fully-integrated-stack-for","title":"SURREAL-System: Fully-Integrated Stack for Distributed Deep Reinforcement Learning","date":"2019-09-27","arxiv_id":"1909.12989","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-generalization-in-td-methods-for","title":"Assessing Generalization in TD methods for Deep Reinforcement Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"d3pg-deep-differentiable-deterministic-policy","title":"D3PG: Deep Differentiable Deterministic Policy Gradients","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-auto-deferring-policy-for-combinatorial","title":"Deep Auto-Deferring Policy for Combinatorial Optimization","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"do-recent-advancements-in-model-based-deep","title":"Do recent advancements in model-based deep reinforcement learning really improve data efficiency?","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evo-nas-evolutionary-neural-hybrid-agent-for","title":"Evo-NAS: Evolutionary-Neural Hybrid Agent for Architecture Search","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"08ee19bfe83003969cb1acc60390cfff1881fff88d988f3fa9377c5416e050cc","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}