{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/50","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":50,"pages_in_order":59,"rows_per_page":100,"rows":[4901,5000],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/49","next":"/task/deep-reinforcement-learning/papers/51","papers":[{"url":null,"slug":"guided-constrained-policy-optimization-for","title":"Guided Constrained Policy Optimization for Dynamic Quadrupedal Robot Locomotion","date":"2020-02-22","arxiv_id":"2002.09676","repositories_listed":0,"syntology":null},{"url":null,"slug":"vehicle-tracking-in-wireless-sensor-networks","title":"Vehicle Tracking in Wireless Sensor Networks via Deep Reinforcement Learning","date":"2020-02-22","arxiv_id":"2002.09671","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-freshness-and-energy-efficient-uav","title":"Data Freshness and Energy-Efficient UAV Navigation Optimization: A Deep Reinforcement Learning Approach","date":"2020-02-21","arxiv_id":"2003.04816","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-aware-energy-scheduling-for-edge","title":"Risk-Aware Energy Scheduling for Edge Computing with Microgrid: A Multi-Agent Deep Reinforcement Learning Approach","date":"2020-02-21","arxiv_id":"2003.02157","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-adversarial-strategically-timed","title":"Enhanced Adversarial Strategically-Timed Attacks against Deep Reinforcement Learning","date":"2020-02-20","arxiv_id":"2002.09027","repositories_listed":0,"syntology":null},{"url":null,"slug":"kogun-accelerating-deep-reinforcement","title":"KoGuN: Accelerating Deep Reinforcement Learning via Integrating Human Suboptimal Knowledge","date":"2020-02-18","arxiv_id":"2002.07418","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-issue-bargaining-with-deep","title":"Multi-Issue Bargaining With Deep Reinforcement Learning","date":"2020-02-18","arxiv_id":"2002.07788","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-simple-object-representations","title":"Investigating Simple Object Representations in Model-Free Deep Reinforcement Learning","date":"2020-02-16","arxiv_id":"2002.06703","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-management-in-wireless-networks-via","title":"Resource Management in Wireless Networks via Multi-Agent Deep Reinforcement Learning","date":"2020-02-14","arxiv_id":"2002.06215","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-beam","title":"Deep Reinforcement Learning-Based Beam Tracking for Low-Latency Services in Vehicular Networks","date":"2020-02-13","arxiv_id":"2002.05564","repositories_listed":0,"syntology":null},{"url":null,"slug":"modrld-am-multiobjective-deep-reinforcement","title":"MODRL/D-AM: Multiobjective Deep Reinforcement Learning Algorithm Using Decomposition and Attention Model for Multiobjective Optimization","date":"2020-02-13","arxiv_id":"2002.05484","repositories_listed":0,"syntology":null},{"url":null,"slug":"connectivity-driven-communication-in-multi","title":"Learning Multi-Agent Coordination through Connectivity-driven Communication","date":"2020-02-12","arxiv_id":"2002.05233","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-training-for-reinforcement","title":"Data Efficient Training for Reinforcement Learning with Adaptive Behavior Policy Sharing","date":"2020-02-12","arxiv_id":"2002.05229","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-driven-heterogeneous-mec-system-with-uav","title":"AI Driven Heterogeneous MEC System with UAV Assistance for Dynamic Environment -- Challenges and Solutions","date":"2020-02-11","arxiv_id":"2002.05020","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-reward-shaping-for-mobile-robot-navigation","title":"On Reward Shaping for Mobile Robot Navigation: A Reinforcement Learning and SLAM Based Approach","date":"2020-02-10","arxiv_id":"2002.04109","repositories_listed":0,"syntology":null},{"url":null,"slug":"proficiency-aware-multi-agent-actor-critic","title":"Proficiency Constrained Multi-Agent Reinforcement Learning for Environment-Adaptive Multi UAV-UGV Teaming","date":"2020-02-10","arxiv_id":"2002.03910","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximizing-the-total-reward-via-reward","title":"Reward Tweaking: Maximizing the Total Reward While Planning for Short Horizons","date":"2020-02-09","arxiv_id":"2002.03327","repositories_listed":0,"syntology":null},{"url":null,"slug":"comprehensive-and-efficient-data-labeling-via","title":"Comprehensive and Efficient Data Labeling via Adaptive Model Scheduling","date":"2020-02-08","arxiv_id":"2002.05520","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-duet-online-music-accompaniment-generation","title":"RL-Duet: Online Music Accompaniment Generation Using Deep Reinforcement Learning","date":"2020-02-08","arxiv_id":"2002.03082","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-lane-change-strategy-using-proximal","title":"Automated Lane Change Strategy using Proximal Policy Optimization-based Deep Reinforcement Learning","date":"2020-02-07","arxiv_id":"2002.02667","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-energy-dispatch-in-isolated","title":"Dynamic Energy Dispatch Based on Deep Reinforcement Learning in IoT-Driven Smart Isolated Microgrids","date":"2020-02-07","arxiv_id":"2002.02581","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-whole-body-motor-skills-for","title":"Learning Whole-body Motor Skills for Humanoids","date":"2020-02-07","arxiv_id":"2002.02991","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-heterogeneous-knowledge-among-peer","title":"Transfer Heterogeneous Knowledge Among Peer-to-Peer Teammates: A Model Distillation Approach","date":"2020-02-06","arxiv_id":"2002.02202","repositories_listed":0,"syntology":null},{"url":null,"slug":"unboxing-mac-protocol-design-optimization","title":"Unboxing MAC Protocol Design Optimization Using Deep Learning","date":"2020-02-06","arxiv_id":"2002.03795","repositories_listed":0,"syntology":null},{"url":null,"slug":"bootstrapping-a-dqn-replay-memory-with","title":"Bootstrapping a DQN Replay Memory with Synthetic Experiences","date":"2020-02-04","arxiv_id":"2002.01370","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuro-evolutionary-frameworks-for-generalized","title":"Neuro-evolutionary Frameworks for Generalized Learning Agents","date":"2020-02-04","arxiv_id":"2002.01088","repositories_listed":0,"syntology":null},{"url":null,"slug":"prophet-proactive-candidate-selection-for","title":"Prophet: Proactive Candidate-Selection for Federated Learning by Predicting the Qualities of Training and Reporting Phases","date":"2020-02-03","arxiv_id":"2002.00577","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-autonomous-2","title":"Deep Reinforcement Learning for Autonomous Driving: A Survey","date":"2020-02-02","arxiv_id":"2002.00444","repositories_listed":0,"syntology":null},{"url":null,"slug":"policygnn-aggregation-optimization-for-graph","title":"PolicyGNN: Aggregation Optimization for Graph Neural Networks","date":"2020-02-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-to-1","title":"A Deep Reinforcement Learning Approach to Concurrent Bilateral Negotiation","date":"2020-01-31","arxiv_id":"2001.11785","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-deep-reinforcement-learning-for","title":"Constrained Deep Reinforcement Learning for Energy Sustainable Multi-UAV based Random Access IoT Networks with NOMA","date":"2020-01-31","arxiv_id":"2002.00073","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-deep-reinforcement-learning-for","title":"Survey of Deep Reinforcement Learning for Motion Planning of Autonomous Vehicles","date":"2020-01-30","arxiv_id":"2001.11231","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiple-access-in-dynamic-cell-free-networks","title":"Multiple Access in Dynamic Cell-Free Networks: Outage Performance and Deep Reinforcement Learning-Based Design","date":"2020-01-29","arxiv_id":"2002.02801","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-learning-multi-agent-negotiations-via","title":"Towards Learning Multi-agent Negotiations via Self-Play","date":"2020-01-28","arxiv_id":"2001.10208","repositories_listed":0,"syntology":null},{"url":null,"slug":"developing-multi-task-recommendations-with","title":"Developing Multi-Task Recommendations with Long-Term Rewards via Policy Distilled Reinforcement Learning","date":"2020-01-27","arxiv_id":"2001.09595","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentiment-and-knowledge-based-algorithmic","title":"Sentiment and Knowledge Based Algorithmic Trading with Deep Reinforcement Learning","date":"2020-01-26","arxiv_id":"2001.09403","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-blind","title":"Deep Reinforcement Learning based Blind mmWave MIMO Beam Alignment","date":"2020-01-25","arxiv_id":"2001.09251","repositories_listed":0,"syntology":null},{"url":null,"slug":"egomap-projective-mapping-and-structured-1","title":"EgoMap: Projective mapping and structured egocentric memory for Deep RL","date":"2020-01-24","arxiv_id":"2002.02286","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-vision-based-adaptive-cruise","title":"End-to-End Vision-Based Adaptive Cruise Control (ACC) Using Deep Reinforcement Learning","date":"2020-01-24","arxiv_id":"2001.09181","repositories_listed":0,"syntology":null},{"url":null,"slug":"stacked-auto-encoder-based-deep-reinforcement","title":"Stacked Auto Encoder Based Deep Reinforcement Learning for Online Resource Scheduling in Large-Scale MEC Networks","date":"2020-01-24","arxiv_id":"2001.09223","repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-learning-assisted-handover-and","title":"Machine Learning assisted Handover and Resource Management for Cellular Connected Drones","date":"2020-01-22","arxiv_id":"2001.07937","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-vehicle-cell","title":"Reinforcement Learning Based Vehicle-cell Association Algorithm for Highly Mobile Millimeter Wave Communication","date":"2020-01-22","arxiv_id":"2001.07915","repositories_listed":0,"syntology":null},{"url":null,"slug":"fresh-interactive-reward-shaping-in-high","title":"FRESH: Interactive Reward Shaping in High-Dimensional State Spaces using Human Feedback","date":"2020-01-19","arxiv_id":"2001.06781","repositories_listed":0,"syntology":null},{"url":null,"slug":"effects-of-sparse-rewards-of-different","title":"Effects of sparse rewards of different magnitudes in the speed of learning of model-based actor critic methods","date":"2020-01-18","arxiv_id":"2001.06725","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-motion-planning-for-dense-and","title":"Multi-agent Motion Planning for Dense and Dynamic Environments via Deep Reinforcement Learning","date":"2020-01-18","arxiv_id":"2001.06627","repositories_listed":0,"syntology":null},{"url":null,"slug":"algorithms-in-multi-agent-systems-a-holistic","title":"Algorithms in Multi-Agent Systems: A Holistic Perspective from Reinforcement Learning and Game Theory","date":"2020-01-17","arxiv_id":"2001.06487","repositories_listed":0,"syntology":null},{"url":null,"slug":"inducing-cooperation-in-multi-agent-games","title":"Inducing Cooperative behaviour in Sequential-Social dilemmas through Multi-Agent Reinforcement Learning using Status-Quo Loss","date":"2020-01-15","arxiv_id":"2001.05458","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-grasp-manipulation-using-evolutionary","title":"Robotic Grasp Manipulation Using Evolutionary Computing and Deep Reinforcement Learning","date":"2020-01-15","arxiv_id":"2001.05443","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-locomote-with-deep-neural-network","title":"Learning to Locomote with Deep Neural-Network and CPG-based Control in a Soft Snake Robot","date":"2020-01-13","arxiv_id":"2001.04059","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-complex-1","title":"Deep Reinforcement Learning for Complex Manipulation Tasks with Sparse Feedback","date":"2020-01-12","arxiv_id":"2001.03877","repositories_listed":0,"syntology":null},{"url":null,"slug":"functional-error-correction-for-robust-neural","title":"Functional Error Correction for Robust Neural Networks","date":"2020-01-12","arxiv_id":"2001.03814","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-interactive-reinforcement-learning-for","title":"Deep Interactive Reinforcement Learning for Path Following of Autonomous Underwater Vehicle","date":"2020-01-10","arxiv_id":"2001.03359","repositories_listed":0,"syntology":null},{"url":null,"slug":"eeg-based-drowsiness-estimation-for-driving","title":"EEG-based Drowsiness Estimation for Driving Safety using Deep Q-Learning","date":"2020-01-08","arxiv_id":"2001.02399","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-for-4","title":"Multi-Agent Deep Reinforcement Learning for Cooperative Connected Vehicles","date":"2020-01-08","arxiv_id":"2001.02337","repositories_listed":0,"syntology":null},{"url":null,"slug":"perception-and-decision-making-of-autonomous","title":"Perception and Navigation in Autonomous Systems in the Era of Learning: A Survey","date":"2020-01-08","arxiv_id":"2001.02319","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-speed-autonomous-drifting-with-deep","title":"High-speed Autonomous Drifting with Deep Reinforcement Learning","date":"2020-01-06","arxiv_id":"2001.01377","repositories_listed":0,"syntology":null},{"url":null,"slug":"incentivizing-the-emergence-of-grounded","title":"Generalizing Emergent Communication","date":"2020-01-06","arxiv_id":"2001.01772","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-roundabout-insertion-using-deep","title":"Intelligent Roundabout Insertion using Deep Reinforcement Learning","date":"2020-01-03","arxiv_id":"2001.00786","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-markov-decision-process-model-for-socio","title":"A Markov Decision Process Model for Socio-Economic Systems Impacted by Climate Change","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-droplet-routing-in-digital","title":"Adaptive Droplet Routing in Digital Microfluidic Biochips Using Deep Reinforcement Learning","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-randomized-least-squares-value-iteration","title":"Deep Randomized Least Squares Value Iteration","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-implicit","title":"Deep Reinforcement Learning with Implicit Human Feedback","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-smooth-1","title":"Deep Reinforcement Learning with Smooth Policy","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-language-emergence-through-empathy","title":"Enhancing Language Emergence through Empathy","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"inferring-dqn-structure-for-high-dimensional","title":"Inferring DQN structure for high-dimensional continuous control","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"insights-on-visual-representations-for","title":"Insights on Visual Representations for Embodied Navigation Tasks","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-fair-policies-in-multi-objective","title":"Learning Fair Policies in Multi-Objective (Deep) Reinforcement Learning with Average and Discounted Rewards","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"options-as-responses-grounding-behavioural-1","title":"OPtions as REsponses: Grounding behavioural hierarchies in multi-agent reinforcement learning","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"way-off-policy-batch-deep-reinforcement-1","title":"Way Off-Policy Batch Deep Reinforcement Learning of Human Preferences in Dialog","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-based-out-of-distribution-1","title":"Uncertainty-Based Out-of-Distribution Classification in Deep Reinforcement Learning","date":"2019-12-31","arxiv_id":"2001.00496","repositories_listed":0,"syntology":null},{"url":null,"slug":"computational-model-discovery-with","title":"Computational model discovery with reinforcement learning","date":"2019-12-29","arxiv_id":"2001.00008","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-policy-distillation-in-deep","title":"Real-time Policy Distillation in Deep Reinforcement Learning","date":"2019-12-29","arxiv_id":"1912.12630","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-complex","title":"Deep reinforcement learning for complex evaluation of one-loop diagrams in quantum field theory","date":"2019-12-27","arxiv_id":"1912.12322","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-deep-reinforcement-learning-in","title":"A Survey of Deep Reinforcement Learning in Video Games","date":"2019-12-23","arxiv_id":"1912.10944","repositories_listed":0,"syntology":null},{"url":null,"slug":"monte-carlo-tree-search-for-policy","title":"Monte-Carlo Tree Search for Policy Optimization","date":"2019-12-23","arxiv_id":"1912.10648","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-aware-multi-server-mobile-edge","title":"Energy-Aware Multi-Server Mobile Edge Computing: A Deep Reinforcement Learning Approach","date":"2019-12-22","arxiv_id":"1912.10485","repositories_listed":0,"syntology":null},{"url":null,"slug":"predictive-coding-for-boosting-deep-1","title":"Predictive Coding for Boosting Deep Reinforcement Learning with Sparse Rewards","date":"2019-12-21","arxiv_id":"1912.13414","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-the-potential-of-deep","title":"Exploiting the potential of deep reinforcement learning for classification tasks in high-dimensional and unstructured data","date":"2019-12-20","arxiv_id":"1912.09595","repositories_listed":0,"syntology":null},{"url":null,"slug":"mastering-complex-control-in-moba-games-with","title":"Mastering Complex Control in MOBA Games with Deep Reinforcement Learning","date":"2019-12-20","arxiv_id":"1912.09729","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-collision-avoidance-in-dense","title":"Optimizing Collision Avoidance in Dense Airspace using Deep Reinforcement Learning","date":"2019-12-20","arxiv_id":"1912.10146","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-designed-rf-pulse","title":"Deep Reinforcement Learning Designed Shinnar-Le Roux RF Pulse using Root-Flipping: DeepRF_SLR","date":"2019-12-19","arxiv_id":"1912.09015","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-motion","title":"Deep Reinforcement Learning for Motion Planning of Mobile Robots","date":"2019-12-19","arxiv_id":"1912.09260","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-smart-home","title":"Deep Reinforcement Learning for Smart Home Energy Management","date":"2019-12-19","arxiv_id":"1909.10165","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysing-deep-reinforcement-learning-agents","title":"Analysing Deep Reinforcement Learning Agents Trained with Domain Randomisation","date":"2019-12-18","arxiv_id":"1912.08324","repositories_listed":0,"syntology":null},{"url":null,"slug":"taming-an-autonomous-surface-vehicle-for-path","title":"Taming an autonomous surface vehicle for path following and collision avoidance using deep reinforcement learning","date":"2019-12-18","arxiv_id":"1912.08578","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-bias-variance-tradeoff-textbooks-need","title":"On the Bias-Variance Tradeoff: Textbooks Need an Update","date":"2019-12-17","arxiv_id":"1912.08286","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordination-in-adversarial-sequential-team","title":"Coordination in Adversarial Sequential Team Games via Multi-Agent Deep Reinforcement Learning","date":"2019-12-16","arxiv_id":"1912.07712","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-term-planning-and-situational-awareness","title":"Long-Term Planning and Situational Awareness in OpenAI Five","date":"2019-12-13","arxiv_id":"1912.06721","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-as-environment-a-deep-reinforcement","title":"Text as Environment: A Deep Reinforcement Learning Text Readability Assessment Model","date":"2019-12-12","arxiv_id":"1912.05957","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-robotic-task-generalization-using","title":"Efficient Robotic Task Generalization Using Deep Model Fusion Reinforcement Learning","date":"2019-12-11","arxiv_id":"1912.05205","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-aware-scheduling-of-jobs-in","title":"Energy-aware Scheduling of Jobs in Heterogeneous Cluster Systems Using Deep Reinforcement Learning","date":"2019-12-11","arxiv_id":"1912.05160","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-deep-reinforcement-learning-for","title":"Online Deep Reinforcement Learning for Autonomous UAV Navigation and Exploration of Outdoor Environments","date":"2019-12-11","arxiv_id":"1912.05684","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-finite-time-analysis-of-q-learning-with-1","title":"A Finite-Time Analysis of Q-Learning with Neural Network Function Approximation","date":"2019-12-10","arxiv_id":"1912.04511","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-rl-based-trajectory-planning-for-aoi","title":"Deep RL-based Trajectory Planning for AoI Minimization in UAV-assisted IoT","date":"2019-12-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-sparse-representations-incrementally","title":"Learning Sparse Representations Incrementally in Deep Reinforcement Learning","date":"2019-12-09","arxiv_id":"1912.04002","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-code-coded-caching-via-deep","title":"Learning to Code: Coded Caching via Deep Reinforcement Learning","date":"2019-12-09","arxiv_id":"1912.04321","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-based-reinforcement-learning-for","title":"Transformer Based Reinforcement Learning For Games","date":"2019-12-09","arxiv_id":"1912.03918","repositories_listed":0,"syntology":null},{"url":null,"slug":"effects-of-a-social-force-model-reward-in","title":"Effects of a Social Force Model reward in Robot Navigation based on Deep Reinforcement Learning","date":"2019-12-08","arxiv_id":"1912.03747","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-routing-a","title":"Deep Reinforcement Learning for Routing a Heterogeneous Fleet of Vehicles","date":"2019-12-06","arxiv_id":"1912.03341","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-pricing-on-e-commerce-platform-with","title":"Dynamic Pricing on E-commerce Platform with Deep Reinforcement Learning: A Field Experiment","date":"2019-12-05","arxiv_id":"1912.02572","repositories_listed":0,"syntology":null}],"record_sha256":"27637ef737c3634f429bc49825d78c4c5a3ff49707609d6114aada573e40ffce","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}