{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/42","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":42,"pages_in_order":59,"rows_per_page":100,"rows":[4101,4200],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/41","next":"/task/deep-reinforcement-learning/papers/43","papers":[{"url":null,"slug":"provably-efficient-representation-learning-in","title":"Provably Efficient Representation Selection in Low-rank Markov Decision Processes: From Online to Offline RL","date":"2021-06-22","arxiv_id":"2106.11935","repositories_listed":0,"syntology":null},{"url":null,"slug":"emphatic-algorithms-for-deep-reinforcement","title":"Emphatic Algorithms for Deep Reinforcement Learning","date":"2021-06-21","arxiv_id":"2106.11779","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-model-based-hierarchical","title":"Interpretable Model-based Hierarchical Reinforcement Learning using Inductive Logic Programming","date":"2021-06-21","arxiv_id":"2106.11417","repositories_listed":0,"syntology":null},{"url":null,"slug":"colorrl-reinforced-coloring-for-end-to-end","title":"ColorRL: Reinforced Coloring for End-to-End Instance Segmentation","date":"2021-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"lau-net-latitude-adaptive-upscaling-network","title":"LAU-Net: Latitude Adaptive Upscaling Network for Omnidirectional Image Super-Resolution","date":"2021-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-the-non-differentiable-optimization","title":"Learning the Non-Differentiable Optimization for Blind Super-Resolution","date":"2021-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarially-trained-neural-policies-in-the","title":"Adversarially Trained Neural Policies in the Fourier Domain","date":"2021-06-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-models-predict","title":"Deep Reinforcement Learning Models Predict Visual Responses in the Brain: A Preliminary Result","date":"2021-06-18","arxiv_id":"2106.10112","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-learning-for-user-engagement-and","title":"Multi-Task Learning for User Engagement and Adoption in Live Video Streaming Events","date":"2021-06-18","arxiv_id":"2106.10305","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-robust-feature-mapping-in-deep","title":"Non-Robust Feature Mapping in Deep Reinforcement Learning","date":"2021-06-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"prediction-free-real-time-flexible-control-of","title":"Prediction-Free, Real-Time Flexible Control of Tidal Lagoons through Proximal Policy Optimisation: A Case Study for the Swansea Lagoon","date":"2021-06-18","arxiv_id":"2106.10360","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategically-timed-state-observation-attacks","title":"Strategically-timed State-Observation Attacks on Deep Reinforcement Learning Agents","date":"2021-06-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach","title":"A Deep Reinforcement Learning Approach towards Pendulum Swing-up Problem based on TF-Agents","date":"2021-06-17","arxiv_id":"2106.09556","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-an-irs","title":"A Reinforcement Learning Approach for an IRS-assisted NOMA Network","date":"2021-06-17","arxiv_id":"2106.09611","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-1","title":"Deep Reinforcement Learning Based Optimization for IRS Based UAV-NOMA Downlink Networks","date":"2021-06-17","arxiv_id":"2106.09616","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-automated","title":"Deep reinforcement learning with automated label extraction from clinical reports accurately classifies 3D MRI brain volumes","date":"2021-06-17","arxiv_id":"2106.09812","repositories_listed":0,"syntology":null},{"url":null,"slug":"many-agent-reinforcement-learning-under","title":"Many Agent Reinforcement Learning Under Partial Observability","date":"2021-06-17","arxiv_id":"2106.09825","repositories_listed":0,"syntology":null},{"url":null,"slug":"modelling-resource-allocation-in-uncertain","title":"Modelling resource allocation in uncertain system environment through deep reinforcement learning","date":"2021-06-17","arxiv_id":"2106.09461","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-and-optimisation-of-bellman-residual","title":"Analysis and Optimisation of Bellman Residual Errors with Neural Function Approximation","date":"2021-06-16","arxiv_id":"2106.08774","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-on-a-multi-asset","title":"Deep reinforcement learning on a multi-asset environment for trading","date":"2021-06-15","arxiv_id":"2106.08437","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-multi-objective-policy-optimization-as-a","title":"On Multi-objective Policy Optimization as a Tool for Reinforcement Learning: Case Studies in Offline RL and Finetuning","date":"2021-06-15","arxiv_id":"2106.08199","repositories_listed":0,"syntology":null},{"url":null,"slug":"population-coding-and-dynamic-neurons","title":"Population-coding and Dynamic-neurons improved Spiking Actor Network for Reinforcement Learning","date":"2021-06-15","arxiv_id":"2106.07854","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-a-target-based-actor-critic","title":"Analysis of a Target-Based Actor-Critic Algorithm with Linear Function Approximation","date":"2021-06-14","arxiv_id":"2106.07472","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-aided-heuristics-design-for-storage","title":"Learning-Aided Heuristics Design for Storage System","date":"2021-06-14","arxiv_id":"2106.07288","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-policy-deep-reinforcement-learning-for-the","title":"On-Policy Deep Reinforcement Learning for the Average-Reward Criterion","date":"2021-06-14","arxiv_id":"2106.07329","repositories_listed":0,"syntology":null},{"url":null,"slug":"poisoning-deep-reinforcement-learning-agents","title":"Poisoning Deep Reinforcement Learning Agents with In-Distribution Triggers","date":"2021-06-14","arxiv_id":"2106.07798","repositories_listed":0,"syntology":null},{"url":null,"slug":"user-guided-personalized-image-aesthetic","title":"User-Guided Personalized Image Aesthetic Assessment based on Deep Reinforcement Learning","date":"2021-06-14","arxiv_id":"2106.07488","repositories_listed":0,"syntology":null},{"url":null,"slug":"density-based-bonuses-on-learned","title":"Density-Based Bonuses on Learned Representations for Reward-Free Exploration in Deep Reinforcement Learning","date":"2021-06-13","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsic-control-of-variational-beliefs-in","title":"Intrinsic Control of Variational Beliefs in Dynamic Partially-Observed Visual Environments","date":"2021-06-13","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-on-abstract-domains-a-new-approach","title":"Learning on Abstract Domains: A New Approach for Verifiable Guarantee in Reinforcement Learning","date":"2021-06-13","arxiv_id":"2106.06931","repositories_listed":0,"syntology":null},{"url":null,"slug":"a3c-s-automated-agent-accelerator-co-search","title":"A3C-S: Automated Agent Accelerator Co-Search towards Efficient Deep Reinforcement Learning","date":"2021-06-11","arxiv_id":"2106.06577","repositories_listed":0,"syntology":null},{"url":null,"slug":"courteous-behavior-of-automated-vehicles-at","title":"Courteous Behavior of Automated Vehicles at Unsignalized Intersections via Reinforcement Learning","date":"2021-06-11","arxiv_id":"2106.06369","repositories_listed":0,"syntology":null},{"url":null,"slug":"drld-sp-a-deep-reinforcement-learning-based","title":"DRLD-SP: A Deep Reinforcement Learning-based Dynamic Service Placement in Edge-Enabled Internet of Vehicles","date":"2021-06-11","arxiv_id":"2106.06291","repositories_listed":0,"syntology":null},{"url":"/paper/gdi-rethinking-what-makes-reinforcement","slug":"gdi-rethinking-what-makes-reinforcement","title":"GDI: Rethinking What Makes Reinforcement Learning Different From Supervised Learning","date":"2021-06-11","arxiv_id":"2106.06232","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-battery-operation-for-energy","title":"Data-driven battery operation for energy arbitrage using rainbow deep reinforcement learning","date":"2021-06-10","arxiv_id":"2106.06061","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-industrial-control","title":"Reinforcement Learning for Industrial Control Network Cyber Security Orchestration","date":"2021-06-09","arxiv_id":"2106.05332","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-value-network-based-approach-for-multi","title":"A Deep Value-network Based Approach for Multi-Driver Order Dispatching","date":"2021-06-08","arxiv_id":"2106.04493","repositories_listed":0,"syntology":null},{"url":null,"slug":"don-t-get-yourself-into-trouble-risk-aware","title":"Don't Get Yourself into Trouble! Risk-aware Decision-Making for Autonomous Vehicles","date":"2021-06-08","arxiv_id":"2106.04625","repositories_listed":0,"syntology":null},{"url":null,"slug":"left-ventricle-contouring-in-cardiac-images","title":"Left Ventricle Contouring in Cardiac Images Based on Deep Reinforcement Learning","date":"2021-06-08","arxiv_id":"2106.04127","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-practical-credit-assignment-for-deep","title":"Towards Practical Credit Assignment for Deep Reinforcement Learning","date":"2021-06-08","arxiv_id":"2106.04499","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-artificial-intelligence-xai-for-1","title":"Explainable Artificial Intelligence (XAI) for Increasing User Trust in Deep Reinforcement Learning Driven Autonomous Systems","date":"2021-06-07","arxiv_id":"2106.03775","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-uav-trajectory-and-data-collection","title":"3D UAV Trajectory and Data Collection Optimisation via Deep Reinforcement Learning","date":"2021-06-06","arxiv_id":"2106.03129","repositories_listed":0,"syntology":null},{"url":null,"slug":"distop-discovering-a-topological","title":"DisTop: Discovering a Topological representation to learn diverse and rewarding skills","date":"2021-06-06","arxiv_id":"2106.03853","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-trading-models-in-the-forex-market","title":"Online Trading Models with Deep Reinforcement Learning in the Forex Market Considering Transaction Costs","date":"2021-06-06","arxiv_id":"2106.03035","repositories_listed":0,"syntology":null},{"url":null,"slug":"feeling-of-presence-maximization-mmwave","title":"Feeling of Presence Maximization: mmWave-Enabled Virtual Reality Meets Deep Reinforcement Learning","date":"2021-06-03","arxiv_id":"2107.01001","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-uav","title":"Deep Reinforcement Learning-based UAV Navigation and Control: A Soft Actor-Critic with Hindsight Experience Replay Approach","date":"2021-06-02","arxiv_id":"2106.01016","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-deeper-deep-reinforcement-learning","title":"Towards Deeper Deep Reinforcement Learning with Spectral Normalization","date":"2021-06-02","arxiv_id":"2106.01151","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-coarse-to-fine-question-answering-system","title":"A Coarse to Fine Question Answering System based on Reinforcement Learning","date":"2021-06-01","arxiv_id":"2106.00257","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantitative-day-trading-from-natural","title":"Quantitative Day Trading from Natural Language using Reinforcement Learning","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policies-for-the-dynamic-traveling-maintainer","title":"Policies for the Dynamic Traveling Maintainer Problem with Alerts","date":"2021-05-31","arxiv_id":"2105.15119","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-the-deployment-time-inference","title":"Reducing the Deployment-Time Inference Control Costs of Deep Reinforcement Learning Agents via an Asymmetric Architecture","date":"2021-05-30","arxiv_id":"2105.14471","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-deep-reinforcement-learning","title":"A Survey of Deep Reinforcement Learning Algorithms for Motion Planning and Control of Autonomous Vehicles","date":"2021-05-29","arxiv_id":"2105.14218","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-reconfigurable-surface-assisted","title":"Reconfigurable Intelligent Surface-assisted Multi-UAV Networks: Efficient Resource Allocation with Deep Reinforcement Learning","date":"2021-05-28","arxiv_id":"2105.14142","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferable-deep-reinforcement-learning","title":"Transferable Deep Reinforcement Learning Framework for Autonomous Vehicles with Joint Radar-Data Communications","date":"2021-05-28","arxiv_id":"2105.13670","repositories_listed":0,"syntology":null},{"url":null,"slug":"branching-dueling-q-network-based-online","title":"Branching Dueling Q-Network Based Online Scheduling of a Microgrid With Distributed Energy Storage Systems","date":"2021-05-27","arxiv_id":"2105.13497","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-aware-taxi-dispatching-at-city-scale","title":"Context-aware taxi dispatching at city-scale using deep reinforcement learning","date":"2021-05-26","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-radio","title":"Deep Reinforcement Learning for Radio Resource Allocation and Management in Next Generation Heterogeneous Wireless Networks: A Survey","date":"2021-05-25","arxiv_id":"2106.00574","repositories_listed":0,"syntology":null},{"url":null,"slug":"igo-qnn-quantum-neural-network-architecture","title":"IGO-QNN: Quantum Neural Network Architecture for Inductive Grover Oracularization","date":"2021-05-25","arxiv_id":"2105.11603","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-uav-collision-avoidance-using","title":"Interpretable UAV Collision Avoidance using Deep Reinforcement Learning","date":"2021-05-25","arxiv_id":"2105.12254","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowsr-knowledge-sharing-among-homogeneous","title":"KnowSR: Knowledge Sharing among Homogeneous Agents in Multi-agent Reinforcement Learning","date":"2021-05-25","arxiv_id":"2105.11611","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-model-based-off-policy-reinforcement","title":"Safe Model-based Off-policy Reinforcement Learning for Eco-Driving in Connected and Automated Hybrid Electric Vehicles","date":"2021-05-25","arxiv_id":"2105.11640","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-based-reinforcement-learning-for","title":"Attention-based Reinforcement Learning for Real-Time UAV Semantic Communication","date":"2021-05-22","arxiv_id":"2105.10716","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-using","title":"Multi-Agent Deep Reinforcement Learning using Attentive Graph Neural Architectures for Real-Time Strategy Games","date":"2021-05-21","arxiv_id":"2105.10211","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-stochastic-composite-augmented-lagrangian","title":"A Stochastic Composite Augmented Lagrangian Method For Reinforcement Learning","date":"2021-05-20","arxiv_id":"2105.09716","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-sample-efficient-reinforcement","title":"Towards a Sample Efficient Reinforcement Learning Pipeline for Vision Based Robotics","date":"2021-05-20","arxiv_id":"2105.09719","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-assisted-oxygen","title":"Reinforcement Learning Assisted Oxygen Therapy for COVID-19 Patients Under Intensive Care","date":"2021-05-19","arxiv_id":"2105.08923","repositories_listed":0,"syntology":null},{"url":null,"slug":"robo-advising-enhancing-investment-with","title":"Robo-Advising: Enhancing Investment with Inverse Optimization and Deep Reinforcement Learning","date":"2021-05-19","arxiv_id":"2105.09264","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-deep-reinforcement-learning","title":"Application of deep reinforcement learning for Indian stock trading automation","date":"2021-05-18","arxiv_id":"2106.16088","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-multimodal-transportation-planning","title":"Online Multimodal Transportation Planning using Deep Reinforcement Learning","date":"2021-05-18","arxiv_id":"2105.08374","repositories_listed":0,"syntology":null},{"url":null,"slug":"mean-field-games-flock-the-reinforcement","title":"Mean Field Games Flock! The Reinforcement Learning Way","date":"2021-05-17","arxiv_id":"2105.07933","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-heuristically-assisted-deep-reinforcement","title":"A Heuristically Assisted Deep Reinforcement Learning Approach for Network Slice Placement","date":"2021-05-14","arxiv_id":"2105.06741","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-warm-start-mcts-in-alphazero-like","title":"Adaptive Warm-Start MCTS in AlphaZero-like Deep Reinforcement Learning","date":"2021-05-13","arxiv_id":"2105.06136","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-safe-decision","title":"Reinforcement Learning Based Safe Decision Making for Highway Autonomous Driving","date":"2021-05-13","arxiv_id":"2105.06517","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-reinforcement-learning-in-dynamic","title":"Adversarial Reinforcement Learning in Dynamic Channel Access and Power Control","date":"2021-05-12","arxiv_id":"2105.05817","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-reinforcement-learning-on-graphs","title":"Zero-Shot Reinforcement Learning on Graphs for Autonomous Exploration Under Uncertainty","date":"2021-05-11","arxiv_id":"2105.04758","repositories_listed":0,"syntology":null},{"url":null,"slug":"age-of-information-aware-vnf-scheduling-in","title":"Age of Information Aware VNF Scheduling in Industrial IoT Using Deep Reinforcement Learning","date":"2021-05-10","arxiv_id":"2105.04207","repositories_listed":0,"syntology":null},{"url":null,"slug":"mctg-multi-frequency-continuous-share-trading","title":"A parallel-network continuous quantitative trading model with GARCH and PPO","date":"2021-05-08","arxiv_id":"2105.03625","repositories_listed":0,"syntology":null},{"url":null,"slug":"utilizing-skipped-frames-in-action-repeats","title":"Utilizing Skipped Frames in Action Repeats via Pseudo-Actions","date":"2021-05-07","arxiv_id":"2105.03041","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-aware-q-networks-resolving-temporal","title":"Time-Aware Q-Networks: Resolving Temporal Irregularity for Deep Reinforcement Learning","date":"2021-05-06","arxiv_id":"2105.02580","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-algorithms-for-regenerative-stopping","title":"Learning Algorithms for Regenerative Stopping Problems with Applications to Shipping Consolidation in Logistics","date":"2021-05-05","arxiv_id":"2105.02318","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-enhancement-for-deep-reinforcement","title":"Safety Enhancement for Deep Reinforcement Learning in Autonomous Separation Assurance","date":"2021-05-05","arxiv_id":"2105.02331","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-lottery-tickets-and-minimal-task","title":"On Lottery Tickets and Minimal Task Representations in Deep Reinforcement Learning","date":"2021-05-04","arxiv_id":"2105.01648","repositories_listed":0,"syntology":null},{"url":null,"slug":"backdoorl-backdoor-attack-against-competitive","title":"BACKDOORL: Backdoor Attack against Competitive Reinforcement Learning","date":"2021-05-02","arxiv_id":"2105.00579","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovering-diverse-athletic-jumping","title":"Discovering Diverse Athletic Jumping Strategies","date":"2021-05-02","arxiv_id":"2105.00371","repositories_listed":0,"syntology":null},{"url":null,"slug":"pedestrian-collision-avoidance-for-autonomous","title":"Pedestrian Collision Avoidance for Autonomous Vehicles at Unsignalized Intersection Using Deep Q-Network","date":"2021-05-01","arxiv_id":"2105.00153","repositories_listed":0,"syntology":null},{"url":null,"slug":"discrete-time-mean-field-control-with","title":"Discrete-Time Mean Field Control with Environment States","date":"2021-04-30","arxiv_id":"2104.14900","repositories_listed":0,"syntology":null},{"url":null,"slug":"antagonistic-crowd-simulation-model","title":"Emotional Contagion-Aware Deep Reinforcement Learning for Antagonistic Crowd Simulation","date":"2021-04-29","arxiv_id":"2105.00854","repositories_listed":0,"syntology":null},{"url":null,"slug":"hypernetwork-dismantling-via-deep","title":"Hypernetwork Dismantling via Deep Reinforcement Learning","date":"2021-04-29","arxiv_id":"2104.14332","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-emergence-of-whole-body-strategies","title":"On the Emergence of Whole-body Strategies from Humanoid Robot Push-recovery Learning","date":"2021-04-29","arxiv_id":"2104.14534","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-intersection-handling-using-multi","title":"End-to-End Intersection Handling using Multi-Agent Deep Reinforcement Learning","date":"2021-04-28","arxiv_id":"2104.13617","repositories_listed":0,"syntology":null},{"url":null,"slug":"controlling-earthquake-like-instabilities","title":"Controlling earthquake-like instabilities using artificial intelligence","date":"2021-04-27","arxiv_id":"2104.13180","repositories_listed":0,"syntology":null},{"url":null,"slug":"socialai-0-1-towards-a-benchmark-to-stimulate","title":"SocialAI 0.1: Towards a Benchmark to Stimulate Research on Socio-Cognitive Abilities in Deep Reinforcement Learning Agents","date":"2021-04-27","arxiv_id":"2104.13207","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-hyperparameter-optimization-for","title":"Efficient Hyperparameter Optimization for Physics-based Character Animation","date":"2021-04-26","arxiv_id":"2104.12365","repositories_listed":0,"syntology":null},{"url":null,"slug":"development-of-a-soft-actor-critic-deep","title":"Development of a Soft Actor Critic Deep Reinforcement Learning Approach for Harnessing Energy Flexibility in a Large Office Building","date":"2021-04-25","arxiv_id":"2104.12125","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-for-5","title":"A Deep Reinforcement Learning Approach for the Meal Delivery Problem","date":"2021-04-24","arxiv_id":"2104.12000","repositories_listed":0,"syntology":null},{"url":null,"slug":"formula-rl-deep-reinforcement-learning-for","title":"Formula RL: Deep Reinforcement Learning for Autonomous Racing using Telemetry Data","date":"2021-04-22","arxiv_id":"2104.11106","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-aided-deep-reinforcement-learning-for","title":"Model-aided Deep Reinforcement Learning for Sample-efficient UAV Trajectory Design in IoT Networks","date":"2021-04-21","arxiv_id":"2104.10403","repositories_listed":0,"syntology":null},{"url":null,"slug":"tackling-variabilities-in-autonomous-driving","title":"Tackling Variabilities in Autonomous Driving","date":"2021-04-21","arxiv_id":"2104.10415","repositories_listed":0,"syntology":null},{"url":null,"slug":"drl-deep-reinforcement-learning-for","title":"DRL: Deep Reinforcement Learning for Intelligent Robot Control -- Concept, Literature, and Future","date":"2021-04-20","arxiv_id":"2105.13806","repositories_listed":0,"syntology":null},{"url":null,"slug":"gddr-gnn-based-data-driven-routing","title":"GDDR: GNN-based Data-Driven Routing","date":"2021-04-20","arxiv_id":"2104.09919","repositories_listed":0,"syntology":null}],"record_sha256":"9e93b970bc874d7a446c5cc0535714cafba5d6ccdaa6d3ce91e49f36a8899127","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}