{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/47","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":47,"pages_in_order":59,"rows_per_page":100,"rows":[4601,4700],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/46","next":"/task/deep-reinforcement-learning/papers/48","papers":[{"url":null,"slug":"a-tutorial-of-ultra-reliable-and-low-latency","title":"A Tutorial on Ultra-Reliable and Low-Latency Communications in 6G: Integrating Domain Knowledge into Deep Learning","date":"2020-09-13","arxiv_id":"2009.06010","repositories_listed":0,"syntology":null},{"url":null,"slug":"embodied-visual-navigation-with-automatic","title":"Embodied Visual Navigation with Automatic Curriculum Learning in Real Environments","date":"2020-09-11","arxiv_id":"2009.05429","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlcfr-minimize-counterfactual-regret-by-deep","title":"RLCFR: Minimize Counterfactual Regret by Deep Reinforcement Learning","date":"2020-09-10","arxiv_id":"2009.06373","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-option","title":"Deep Reinforcement Learning for Option Replication and Hedging","date":"2020-09-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"active-learning-of-causal-structures-with","title":"Active Learning of Causal Structures with Deep Reinforcement Learning","date":"2020-09-07","arxiv_id":"2009.03009","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-transferred-energy-management","title":"Data-Driven Transferred Energy Management Strategy for Hybrid Electric Vehicles via Deep Reinforcement Learning","date":"2020-09-07","arxiv_id":"2009.03289","repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-and-adapting-to-crisis-pattern-with","title":"Detecting and adapting to crisis pattern with context based Deep Reinforcement Learning","date":"2020-09-07","arxiv_id":"2009.07200","repositories_listed":0,"syntology":null},{"url":null,"slug":"driving-tasks-transfer-in-deep-reinforcement","title":"Driving Tasks Transfer in Deep Reinforcement Learning for Decision-making of Autonomous Vehicles","date":"2020-09-07","arxiv_id":"2009.03268","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-infer-user-hidden-states-for","title":"Learning to Infer User Hidden States for Online Sequential Advertising","date":"2020-09-03","arxiv_id":"2009.01453","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-the-single-track-train-scheduling","title":"Solving the single-track train scheduling problem via Deep Reinforcement Learning","date":"2020-09-01","arxiv_id":"2009.00433","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-outer-loop-control-using-deep","title":"Data-driven Outer-Loop Control Using Deep Reinforcement Learning for Trajectory Tracking","date":"2020-08-31","arxiv_id":"2008.13732","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-contact-rich","title":"Deep Reinforcement Learning for Contact-Rich Skills Using Compliant Movement Primitives","date":"2020-08-30","arxiv_id":"2008.13223","repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-game-difficulty-and-churn-without","title":"Predicting Game Difficulty and Churn Without Players","date":"2020-08-29","arxiv_id":"2008.12937","repositories_listed":0,"syntology":null},{"url":null,"slug":"controlling-level-of-unconsciousness-with","title":"Controlling Level of Unconsciousness by Titrating Propofol with Deep Reinforcement Learning","date":"2020-08-27","arxiv_id":"2008.12333","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessment-of-reward-functions-for","title":"Assessment of Reward Functions for Reinforcement Learning Traffic Signal Control under Real-World Limitations","date":"2020-08-26","arxiv_id":"2008.11634","repositories_listed":0,"syntology":null},{"url":null,"slug":"decision-making-for-autonomous-vehicles-on","title":"Decision-making for Autonomous Vehicles on Highway: Deep Reinforcement Learning with Continuous Action Horizon","date":"2020-08-26","arxiv_id":"2008.11852","repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-particle-attention-visual-feature","title":"Selective Particle Attention: Visual Feature-Based Attention in Deep Reinforcement Learning","date":"2020-08-26","arxiv_id":"2008.11491","repositories_listed":0,"syntology":null},{"url":null,"slug":"auxiliary-task-based-deep-reinforcement","title":"Auxiliary-task Based Deep Reinforcement Learning for Participant Selection Problem in Mobile Crowdsourcing","date":"2020-08-25","arxiv_id":"2008.11087","repositories_listed":0,"syntology":null},{"url":null,"slug":"t-soft-update-of-target-network-for-deep","title":"t-Soft Update of Target Network for Deep Reinforcement Learning","date":"2020-08-25","arxiv_id":"2008.10861","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-dispatching-for-large-scale","title":"Dynamic Dispatching for Large-Scale Heterogeneous Fleet via Multi-agent Deep Reinforcement Learning","date":"2020-08-24","arxiv_id":"2008.10713","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-online-learning-for-cognitive-radar","title":"Efficient Online Learning for Cognitive Radar-Cellular Coexistence via Contextual Thompson Sampling","date":"2020-08-24","arxiv_id":"2008.10149","repositories_listed":0,"syntology":null},{"url":null,"slug":"variable-compliance-control-for-robotic-peg","title":"Variable Compliance Control for Robotic Peg-in-Hole Assembly: A Deep Reinforcement Learning Approach","date":"2020-08-24","arxiv_id":"2008.10224","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-and-multiple-time-scale-eligibility","title":"Adaptive and Multiple Time-scale Eligibility Traces for Online Deep Reinforcement Learning","date":"2020-08-23","arxiv_id":"2008.10040","repositories_listed":0,"syntology":null},{"url":null,"slug":"dsp-a-differential-spatial-prediction-scheme","title":"DSP: A Differential Spatial Prediction Scheme for Comprehensive real industrial datasets","date":"2020-08-23","arxiv_id":"2008.09951","repositories_listed":0,"syntology":null},{"url":null,"slug":"mobile-networks-for-computer-go","title":"Mobile Networks for Computer Go","date":"2020-08-23","arxiv_id":"2008.10080","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-imitation-learning-via-random","title":"Adversarial Imitation Learning via Random Search","date":"2020-08-21","arxiv_id":"2008.09450","repositories_listed":0,"syntology":null},{"url":null,"slug":"biomechanic-posture-stabilisation-via","title":"Biomechanic Posture Stabilisation via Iterative Training of Multi-policy Deep Reinforcement Learning Agents","date":"2020-08-21","arxiv_id":"2008.12210","repositories_listed":0,"syntology":null},{"url":null,"slug":"static-neural-compiler-optimization-via-deep","title":"Static Neural Compiler Optimization via Deep Reinforcement Learning","date":"2020-08-20","arxiv_id":"2008.08951","repositories_listed":0,"syntology":null},{"url":null,"slug":"channel-wise-hessian-aware-trace-weighted","title":"Channel-wise Hessian Aware trace-Weighted Quantization of Neural Networks","date":"2020-08-19","arxiv_id":"2008.08284","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-smart-security-enhancement-of","title":"Toward Smart Security Enhancement of Federated Learning Networks","date":"2020-08-19","arxiv_id":"2008.08330","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-relation-analysis-of-markov-decision","title":"A Relation Analysis of Markov Decision Process Frameworks","date":"2020-08-18","arxiv_id":"2008.07820","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-trading-strategies-across-liquidity","title":"Adaptive trading strategies across liquidity pools","date":"2020-08-18","arxiv_id":"2008.07807","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-social-robotic-navigation","title":"Analysis of Social Robotic Navigation approaches: CNN Encoder and Incremental Learning as an alternative to Deep Reinforcement Learning","date":"2020-08-18","arxiv_id":"2008.07965","repositories_listed":0,"syntology":null},{"url":null,"slug":"super-human-performance-in-gran-turismo-sport","title":"Super-Human Performance in Gran Turismo Sport Using Deep Reinforcement Learning","date":"2020-08-18","arxiv_id":"2008.07971","repositories_listed":0,"syntology":null},{"url":null,"slug":"ubiquitous-distributed-deep-reinforcement","title":"Ubiquitous Distributed Deep Reinforcement Learning at the Edge: Analyzing Byzantine Agents in Discrete Action Spaces","date":"2020-08-18","arxiv_id":"2008.07863","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepslicing-deep-reinforcement-learning","title":"DeepSlicing: Deep Reinforcement Learning Assisted Resource Allocation for Network Slicing","date":"2020-08-17","arxiv_id":"2008.07614","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-reference-reinforcement-learning-for","title":"Model-Reference Reinforcement Learning for Collision-Free Tracking Control of Autonomous Surface Vehicles","date":"2020-08-17","arxiv_id":"2008.07240","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-adaptive-synchronization-approach-for","title":"An adaptive synchronization approach for weights of deep reinforcement learning","date":"2020-08-16","arxiv_id":"2008.06973","repositories_listed":0,"syntology":null},{"url":null,"slug":"drl-based-qos-aware-resource-allocation","title":"DRL-Based QoS-Aware Resource Allocation Scheme for Coexistence of Licensed and Unlicensed Users in LTE and Beyond","date":"2020-08-16","arxiv_id":"2008.06905","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-braking-and-throttle-system-a-deep","title":"Autonomous Braking and Throttle System: A Deep Reinforcement Learning Approach for Naturalistic Driving","date":"2020-08-15","arxiv_id":"2008.06696","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainability-in-deep-reinforcement-learning","title":"Explainability in Deep Reinforcement Learning","date":"2020-08-15","arxiv_id":"2008.06693","repositories_listed":0,"syntology":null},{"url":null,"slug":"decision-making-at-unsignalized-intersection","title":"Decision-making at Unsignalized Intersection for Autonomous Vehicles: Left-turn Maneuver with Deep Reinforcement Learning","date":"2020-08-14","arxiv_id":"2008.06595","repositories_listed":0,"syntology":null},{"url":null,"slug":"defending-adversarial-attacks-without","title":"Adversary Agnostic Robust Deep Reinforcement Learning","date":"2020-08-14","arxiv_id":"2008.06199","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-1","title":"Multi-Agent Deep Reinforcement Learning enabled Computation Resource Allocation in a Vehicular Cloud Network","date":"2020-08-14","arxiv_id":"2008.06464","repositories_listed":0,"syntology":null},{"url":null,"slug":"visuomotor-mechanical-search-learning-to","title":"Visuomotor Mechanical Search: Learning to Retrieve Target Objects in Clutter","date":"2020-08-13","arxiv_id":"2008.06073","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-ocular-biomechanics-environment-for","title":"An ocular biomechanics environment for reinforcement learning","date":"2020-08-12","arxiv_id":"2008.05088","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-smart-1","title":"A Review of Deep Reinforcement Learning for Smart Building Energy Management","date":"2020-08-12","arxiv_id":"2008.05074","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-model-bias-for-robust-offline-deep","title":"Overcoming Model Bias for Robust Offline Deep Reinforcement Learning","date":"2020-08-12","arxiv_id":"2008.05533","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-intelligent-control-strategy-for-buck-dc","title":"An Intelligent Control Strategy for buck DC-DC Converter via Deep Reinforcement Learning","date":"2020-08-11","arxiv_id":"2008.04542","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-deep-reinforcement-learning-for-1","title":"Deep Model-Based Reinforcement Learning for High-Dimensional Problems, a Survey","date":"2020-08-11","arxiv_id":"2008.05598","repositories_listed":0,"syntology":null},{"url":null,"slug":"bilevel-learning-model-towards-industrial","title":"Bilevel Learning Model Towards Industrial Scheduling","date":"2020-08-10","arxiv_id":"2008.04130","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-label","title":"Deep Reinforcement Learning with Label Embedding Reward for Supervised Image Hashing","date":"2020-08-10","arxiv_id":"2008.03973","repositories_listed":0,"syntology":null},{"url":null,"slug":"grimgep-learning-progress-for-robust-goal","title":"GRIMGEP: Learning Progress for Robust Goal Sampling in Visual Deep Reinforcement Learning","date":"2020-08-10","arxiv_id":"2008.04388","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-for-many-transfer-learning-for-building","title":"One for Many: Transfer Learning for Building HVAC Control","date":"2020-08-09","arxiv_id":"2008.03625","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-deep-reinforcement-learning-for-1","title":"Distributed Deep Reinforcement Learning for Functional Split Control in Energy Harvesting Virtualized Small Cells","date":"2020-08-07","arxiv_id":"2008.04105","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-coordination-offsets-for-signalized","title":"Adaptive Coordination Offsets for Signalized Arterial Intersections using Deep Reinforcement Learning","date":"2020-08-06","arxiv_id":"2008.02691","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-to-detect-brain","title":"Deep reinforcement learning to detect brain lesions on MRI: a proof-of-concept application of reinforcement learning to medical images","date":"2020-08-06","arxiv_id":"2008.02708","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-field","title":"Deep Reinforcement Learning for Field Development Optimization","date":"2020-08-05","arxiv_id":"2008.12627","repositories_listed":0,"syntology":null},{"url":null,"slug":"follow-the-object-curriculum-learning-for","title":"Follow the Object: Curriculum Learning for Manipulation Tasks with Imagined Goals","date":"2020-08-05","arxiv_id":"2008.02066","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-power-control-from-a-fixed-batch-of","title":"Learning Power Control from a Fixed Batch of Data","date":"2020-08-05","arxiv_id":"2008.02669","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-analysis-of-deep-reinforcement","title":"A Comparative Analysis of Deep Reinforcement Learning-enabled Freeway Decision-making for Automated Vehicles","date":"2020-08-04","arxiv_id":"2008.01302","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-relearning-approach-to-reinforcement","title":"A Relearning Approach to Reinforcement Learning for Control of Smart Buildings","date":"2020-08-04","arxiv_id":"2008.01879","repositories_listed":0,"syntology":null},{"url":null,"slug":"explanation-of-reinforcement-learning-model","title":"Explanation of Reinforcement Learning Model in Dynamic Multi-Agent System","date":"2020-08-04","arxiv_id":"2008.01508","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiple-code-hashing-for-efficient-image","title":"Multiple Code Hashing for Efficient Image Retrieval","date":"2020-08-04","arxiv_id":"2008.01503","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-control-of-mobile-robots-with","title":"Cooperative Control of Mobile Robots with Stackelberg Learning","date":"2020-08-03","arxiv_id":"2008.00679","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamics-generalization-via-information","title":"Dynamics Generalization via Information Bottleneck in Deep Reinforcement Learning","date":"2020-08-03","arxiv_id":"2008.00614","repositories_listed":0,"syntology":null},{"url":null,"slug":"tracking-the-race-between-deep-reinforcement","title":"Tracking the Race Between Deep Reinforcement Learning and Imitation Learning -- Extended Version","date":"2020-08-03","arxiv_id":"2008.00766","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-mobile-edge","title":"Deep Reinforcement Learning Based Mobile Edge Computing for Intelligent Internet of Things","date":"2020-08-01","arxiv_id":"2008.00250","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-task-scheduling-for-fog-computing-with","title":"Online Task Scheduling for Fog Computing with Multi-Resource Fairness","date":"2020-08-01","arxiv_id":"2008.00207","repositories_listed":0,"syntology":null},{"url":null,"slug":"service-chain-composition-with-failures-in","title":"Service Chain Composition with Failures in NFV Systems: A Game-Theoretic Perspective","date":"2020-08-01","arxiv_id":"2008.00208","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-geometric-reasoning-for-room-layout","title":"Spatial Geometric Reasoning for Room Layout Estimation via Deep Reinforcement Learning","date":"2020-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"v2i-connectivity-based-dynamic-queue-jump","title":"V2I Connectivity-Based Dynamic Queue-Jump Lane for Emergency Vehicles: A Deep Reinforcement Learning Approach","date":"2020-08-01","arxiv_id":"2008.00335","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-using-cyclical","title":"Deep Reinforcement Learning using Cyclical Learning Rates","date":"2020-07-31","arxiv_id":"2008.01171","repositories_listed":0,"syntology":null},{"url":null,"slug":"classic-meets-modern-a-pragmatic-learning","title":"Classic Meets Modern: a Pragmatic Learning-Based Congestion Control for the Internet","date":"2020-07-30","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-robustness-for-machine-learning","title":"Adversarial Robustness for Machine Learning Cyber Defenses Using Log Data","date":"2020-07-29","arxiv_id":"2007.14983","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-hedging-of-long-term-financial","title":"Deep Hedging of Long-Term Financial Derivatives","date":"2020-07-29","arxiv_id":"2007.15128","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantity-vs-quality-on-hyperparameter","title":"Quantity vs. Quality: On Hyperparameter Optimization for Deep Reinforcement Learning","date":"2020-07-29","arxiv_id":"2007.14604","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-internet-of-uavs-distributed","title":"Cooperative Internet of UAVs: Distributed Trajectory Design by Multi-agent Deep Reinforcement Learning","date":"2020-07-28","arxiv_id":"2007.14297","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-dynamic-2","title":"Deep Reinforcement Learning for Dynamic Spectrum Sensing and Aggregation in Multi-Channel Wireless Networks","date":"2020-07-28","arxiv_id":"2007.13965","repositories_listed":0,"syntology":null},{"url":null,"slug":"flexpool-a-distributed-model-free-deep","title":"FlexPool: A Distributed Model-Free Deep Reinforcement Learning Algorithm for Joint Passengers & Goods Transportation","date":"2020-07-27","arxiv_id":"2007.13699","repositories_listed":0,"syntology":null},{"url":null,"slug":"artificial-intelligence-in-the-creative","title":"Artificial Intelligence in the Creative Industries: A Review","date":"2020-07-24","arxiv_id":"2007.12391","repositories_listed":0,"syntology":null},{"url":null,"slug":"buffer-pool-aware-query-scheduling-via-deep","title":"Buffer Pool Aware Query Scheduling via Deep Reinforcement Learning","date":"2020-07-21","arxiv_id":"2007.10568","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-vs-deep-bayesian-reinforcement-learning","title":"Trade-off on Sim2Real Learning: Real-world Learning Faster than Simulations","date":"2020-07-21","arxiv_id":"2007.10675","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-deep-reinforcement-learning-2","title":"Hierarchical Deep Reinforcement Learning Approach for Multi-Objective Scheduling With Varying Queue Sizes","date":"2020-07-17","arxiv_id":"2007.09256","repositories_listed":0,"syntology":null},{"url":null,"slug":"decision-making-strategy-on-highway-for","title":"Decision-making Strategy on Highway for Autonomous Vehicles using Deep Reinforcement Learning","date":"2020-07-16","arxiv_id":"2007.08691","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-reinforcement-learning-of","title":"Distributed Reinforcement Learning of Targeted Grasping with Active Vision for Mobile Manipulators","date":"2020-07-16","arxiv_id":"2007.08082","repositories_listed":0,"syntology":null},{"url":null,"slug":"drift-deep-reinforcement-learning-for","title":"DRIFT: Deep Reinforcement Learning for Functional Software Testing","date":"2020-07-16","arxiv_id":"2007.08220","repositories_listed":0,"syntology":null},{"url":null,"slug":"dueling-deep-q-network-for-highway-decision","title":"Dueling Deep Q Network for Highway Decision Making in Autonomous Vehicles: A Case Study","date":"2020-07-16","arxiv_id":"2007.08343","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-detection-of-fetal-pose-in-3d-mri-by","title":"Enhanced detection of fetal pose in 3D MRI by Deep Reinforcement Learning with physical structure priors on anatomy","date":"2020-07-16","arxiv_id":"2007.08146","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-like-energy-management-based-on-deep","title":"Human-like Energy Management Based on Deep Reinforcement Learning and Historical Driving Experiences","date":"2020-07-16","arxiv_id":"2007.10126","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-gradient-reinforcement-learning-with-an","title":"Meta-Gradient Reinforcement Learning with an Objective Discovered Online","date":"2020-07-16","arxiv_id":"2007.08433","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixture-of-step-returns-in-bootstrapped-dqn","title":"Mixture of Step Returns in Bootstrapped DQN","date":"2020-07-16","arxiv_id":"2007.08229","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-deep-reinforcement-learning-enabled","title":"Transfer Deep Reinforcement Learning-enabled Energy Management Strategy for Hybrid Tracked Vehicle","date":"2020-07-16","arxiv_id":"2007.08690","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-freshness-aware-task-offloading","title":"Information Freshness-Aware Task Offloading in Air-Ground Integrated Edge Computing Systems","date":"2020-07-15","arxiv_id":"2007.10129","repositories_listed":0,"syntology":null},{"url":null,"slug":"qgraph-bounded-q-learning-stabilizing-model-1","title":"Qgraph-bounded Q-learning: Stabilizing Model-Free Off-Policy Deep Reinforcement Learning","date":"2020-07-15","arxiv_id":"2007.07582","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustifying-reinforcement-learning-agents","title":"Robustifying Reinforcement Learning Agents via Action Space Adversarial Training","date":"2020-07-14","arxiv_id":"2007.07176","repositories_listed":0,"syntology":null},{"url":null,"slug":"aircaprl-autonomous-aerial-human-motion","title":"AirCapRL: Autonomous Aerial Human Motion Capture using Deep Reinforcement Learning","date":"2020-07-13","arxiv_id":"2007.06343","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-jamming-attacks-and-defense","title":"Adversarial jamming attacks and defense strategies via adaptive deep reinforcement learning","date":"2020-07-12","arxiv_id":"2007.06055","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulating-multi-exit-evacuation-using-deep","title":"Simulating multi-exit evacuation using deep reinforcement learning","date":"2020-07-11","arxiv_id":"2007.05783","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-autonomous-vehicle-control-in-the","title":"A Survey on Autonomous Vehicle Control in the Era of Mixed-Autonomy: From Physics-Based to AI-Guided Driving Policy Learning","date":"2020-07-10","arxiv_id":"2007.05156","repositories_listed":0,"syntology":null}],"record_sha256":"94b2805d3e7cf0b69ba462708eabecac704beae59342e3d56ec91c27316bf4ef","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}