{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/32","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":32,"pages_in_order":59,"rows_per_page":100,"rows":[3101,3200],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/31","next":"/task/deep-reinforcement-learning/papers/33","papers":[{"url":null,"slug":"haps-uav-enabled-heterogeneous-networks-a","title":"HAPS-UAV-Enabled Heterogeneous Networks: A Deep Reinforcement Learning Approach","date":"2023-03-22","arxiv_id":"2303.12883","repositories_listed":0,"syntology":null},{"url":null,"slug":"p-3-o-transferring-visual-representations-for","title":"$P^{3}O$: Transferring Visual Representations for Reinforcement Learning via Prompting","date":"2023-03-22","arxiv_id":"2303.12371","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-16","title":"Large-Scale Traffic Signal Control Using Constrained Network Partition and Adaptive Deep Reinforcement Learning","date":"2023-03-21","arxiv_id":"2303.11899","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-transient-and-steady-state","title":"Bridging Transient and Steady-State Performance in Voltage Control: A Reinforcement Learning Approach with Safe Gradient Flow","date":"2023-03-20","arxiv_id":"2303.11417","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-hypothesis-testing-in-unknown","title":"Active hypothesis testing in unknown environments using recurrent neural networks and model free reinforcement learning","date":"2023-03-19","arxiv_id":"2303.10623","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-reward-for-visual-relationships","title":"Multi-modal reward for visual relationships-based image captioning","date":"2023-03-19","arxiv_id":"2303.10766","repositories_listed":0,"syntology":null},{"url":null,"slug":"mobile-edge-adversarial-detection-for-digital","title":"Mobile Edge Adversarial Detection for Digital Twinning to the Metaverse with Deep Reinforcement Learning","date":"2023-03-18","arxiv_id":"2303.10288","repositories_listed":0,"syntology":null},{"url":null,"slug":"measurement-optimization-under-uncertainty","title":"Measurement Optimization under Uncertainty using Deep Reinforcement Learning","date":"2023-03-17","arxiv_id":"2303.09750","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-learning-of-high-level-plans-from","title":"Efficient Learning of High Level Plans from Play","date":"2023-03-16","arxiv_id":"2303.09628","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-management-of-multi-mode-plug-in","title":"Energy Management of Multi-mode Plug-in Hybrid Electric Vehicle using Multi-agent Deep Reinforcement Learning","date":"2023-03-16","arxiv_id":"2303.09658","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-rewards-to-optimize-global","title":"Learning Rewards to Optimize Global Performance Metrics in Deep Reinforcement Learning","date":"2023-03-16","arxiv_id":"2303.09027","repositories_listed":0,"syntology":null},{"url":null,"slug":"psychotherapy-ai-companion-with-reinforcement","title":"Psychotherapy AI Companion with Reinforcement Learning Recommendations and Interpretable Policy Dynamics","date":"2023-03-16","arxiv_id":"2303.09601","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-physics-learning-and-system","title":"Residual Physics Learning and System Identification for Sim-to-real Transfer of Policies on Buoyancy Assisted Legged Robots","date":"2023-03-16","arxiv_id":"2303.09597","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-conditioned-policy-gradient-for-multi","title":"Latent-Conditioned Policy Gradient for Multi-Objective Deep Reinforcement Learning","date":"2023-03-15","arxiv_id":"2303.08909","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-transfer-in-hand-manipulations","title":"Learning to Transfer In-Hand Manipulations Using a Greedy Shape Curriculum","date":"2023-03-14","arxiv_id":"2303.12726","repositories_listed":0,"syntology":null},{"url":null,"slug":"loss-of-plasticity-in-continual-deep","title":"Loss of Plasticity in Continual Deep Reinforcement Learning","date":"2023-03-13","arxiv_id":"2303.07507","repositories_listed":0,"syntology":null},{"url":null,"slug":"autodenoise-automatic-data-instance-denoising","title":"AutoDenoise: Automatic Data Instance Denoising for Recommendations","date":"2023-03-12","arxiv_id":"2303.06611","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-power-2","title":"Deep Reinforcement Learning Based Power Allocation for Minimizing AoI and Energy Consumption in MIMO-NOMA IoT Systems","date":"2023-03-11","arxiv_id":"2303.06411","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-synergies-between-quality","title":"Understanding the Synergies between Quality-Diversity and Deep Reinforcement Learning","date":"2023-03-10","arxiv_id":"2303.06164","repositories_listed":0,"syntology":null},{"url":null,"slug":"conceptual-reinforcement-learning-for","title":"Conceptual Reinforcement Learning for Language-Conditioned Tasks","date":"2023-03-09","arxiv_id":"2303.05069","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-power-electronics-from-theory-to","title":"Quantum Power Electronics: From Theory to Implementation","date":"2023-03-08","arxiv_id":"2303.04763","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-memory-based-learning-to-solve-tasks","title":"Using Memory-Based Learning to Solve Tasks with State-Action Constraints","date":"2023-03-08","arxiv_id":"2303.04327","repositories_listed":0,"syntology":null},{"url":null,"slug":"virtual-reality-in-metaverse-over-wireless","title":"Virtual Reality in Metaverse over Wireless Networks with User-centered Deep Reinforcement Learning","date":"2023-03-08","arxiv_id":"2303.04349","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-skill-acquisition-for-complex","title":"Efficient Skill Acquisition for Complex Manipulation Tasks in Obstructed Environments","date":"2023-03-06","arxiv_id":"2303.03365","repositories_listed":0,"syntology":null},{"url":null,"slug":"demonstration-guided-deep-reinforcement-1","title":"Demonstration-guided Deep Reinforcement Learning for Coordinated Ramp Metering and Perimeter Control in Large Scale Networks","date":"2023-03-04","arxiv_id":"2303.03395","repositories_listed":0,"syntology":null},{"url":null,"slug":"double-a3c-deep-reinforcement-learning-on","title":"Double A3C: Deep Reinforcement Learning on OpenAI Gym Games","date":"2023-03-04","arxiv_id":"2303.02271","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-o-ran-traffic-steering-for-urllc","title":"Intelligent O-RAN Traffic Steering for URLLC Through Deep Reinforcement Learning","date":"2023-03-03","arxiv_id":"2303.01960","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-start-team-orienteering-problem-for-uas","title":"Multi-Start Team Orienteering Problem for UAS Mission Re-Planning with Data-Efficient Deep Reinforcement Learning","date":"2023-03-02","arxiv_id":"2303.01963","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-sharing-with-network-pruning-for","title":"Parameter Sharing with Network Pruning for Scalable Multi-Agent Deep Reinforcement Learning","date":"2023-03-02","arxiv_id":"2303.00912","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-labels-multi-agent-deep","title":"Reinforced Labels: Multi-Agent Deep Reinforcement Learning for Point-Feature Label Placement","date":"2023-03-02","arxiv_id":"2303.01388","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-plasticity-in-neural-networks","title":"Understanding plasticity in neural networks","date":"2023-03-02","arxiv_id":"2303.01486","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-trader-without","title":"A Deep Reinforcement Learning Trader without Offline Training","date":"2023-03-01","arxiv_id":"2303.00356","repositories_listed":0,"syntology":null},{"url":null,"slug":"auxiliary-task-based-deep-reinforcement-1","title":"Auxiliary Task-based Deep Reinforcement Learning for Quantum Control","date":"2023-02-28","arxiv_id":"2302.14312","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-reinforcement-learning-for-operator","title":"Graph Reinforcement Learning for Operator Selection in the ALNS Metaheuristic","date":"2023-02-28","arxiv_id":"2302.14678","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-in","title":"Hierarchical Reinforcement Learning in Complex 3D Environments","date":"2023-02-28","arxiv_id":"2302.14451","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-secrecy-via-aerial-reflection-and","title":"Robust Secrecy via Aerial Reflection and Jamming: Joint Optimization of Deployment and Transmission","date":"2023-02-28","arxiv_id":"2302.14764","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-resource-allocation-for-metaverse","title":"Dynamic Resource Allocation for Metaverse Applications with Deep Reinforcement Learning","date":"2023-02-27","arxiv_id":"2302.13445","repositories_listed":0,"syntology":null},{"url":null,"slug":"exposure-based-multi-agent-inspection-of-a","title":"Exposure-Based Multi-Agent Inspection of a Tumbling Target Using Deep Reinforcement Learning","date":"2023-02-27","arxiv_id":"2302.14188","repositories_listed":0,"syntology":null},{"url":null,"slug":"puppeteer-and-marionette-learning","title":"Puppeteer and Marionette: Learning Anticipatory Quadrupedal Locomotion Based on Interactions of a Central Pattern Generator and Supraspinal Drive","date":"2023-02-26","arxiv_id":"2302.13378","repositories_listed":0,"syntology":null},{"url":null,"slug":"sim-and-real-reinforcement-learning-for","title":"Sim-and-Real Reinforcement Learning for Manipulation: A Consensus-based Approach","date":"2023-02-26","arxiv_id":"2302.13423","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepcpg-policies-for-robot-locomotion","title":"DeepCPG Policies for Robot Locomotion","date":"2023-02-25","arxiv_id":"2302.13191","repositories_listed":0,"syntology":null},{"url":null,"slug":"prioritized-trace-selection-towards-high","title":"Plume: A Framework for High Performance Deep RL Network Controllers via Prioritized Trace Sampling","date":"2023-02-24","arxiv_id":"2302.12403","repositories_listed":0,"syntology":null},{"url":null,"slug":"securing-iot-communication-using-physical","title":"Securing IoT Communication using Physical Sensor Data -- Graph Layer Security with Federated Multi-Agent Deep Reinforcement Learning","date":"2023-02-24","arxiv_id":"2302.12592","repositories_listed":0,"syntology":null},{"url":null,"slug":"why-target-networks-stabilise-temporal","title":"Why Target Networks Stabilise Temporal Difference Methods","date":"2023-02-24","arxiv_id":"2302.12537","repositories_listed":0,"syntology":null},{"url":null,"slug":"to-the-noise-and-back-diffusion-for-shared","title":"To the Noise and Back: Diffusion for Shared Autonomy","date":"2023-02-23","arxiv_id":"2302.12244","repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-experience-replay-compression-using","title":"Selective experience replay compression using coresets for lifelong deep reinforcement learning in medical imaging","date":"2023-02-22","arxiv_id":"2302.11510","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-reinforcement-learning-for-3","title":"Constrained Reinforcement Learning for Predictive Control in Real-Time Stochastic Dynamic Optimal Power Flow","date":"2023-02-21","arxiv_id":"2302.10382","repositories_listed":0,"syntology":null},{"url":null,"slug":"curiosity-driven-exploration-in-sparse-reward","title":"Curiosity-driven Exploration in Sparse-reward Multi-agent Reinforcement Learning","date":"2023-02-21","arxiv_id":"2302.10825","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-on-local","title":"Deep Reinforcement Learning Based on Local GNN for Goal-conditioned Deformable Object Rearranging","date":"2023-02-21","arxiv_id":"2302.10446","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-robotic-2","title":"Deep Reinforcement Learning for Robotic Pushing and Picking in Cluttered Environment","date":"2023-02-21","arxiv_id":"2302.10717","repositories_listed":0,"syntology":null},{"url":null,"slug":"uav-path-planning-employing-mpc-reinforcement","title":"UAV Path Planning Employing MPC- Reinforcement Learning Method Considering Collision Avoidance","date":"2023-02-21","arxiv_id":"2302.10669","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-deep-reinforcement-learning-by-verifying","title":"Safe Deep Reinforcement Learning by Verifying Task-Level Properties","date":"2023-02-20","arxiv_id":"2302.10030","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-reward-based-deep","title":"Uncertainty-Aware Reward-based Deep Reinforcement Learning for Intent Analysis of Social Media Information","date":"2023-02-19","arxiv_id":"2302.10195","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-via-epistemic-risk","title":"Efficient Exploration via Epistemic-Risk-Seeking Policy Optimization","date":"2023-02-18","arxiv_id":"2302.09339","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-mmwave","title":"Deep Reinforcement Learning for mmWave Initial Beam Alignment","date":"2023-02-17","arxiv_id":"2302.08969","repositories_listed":0,"syntology":null},{"url":null,"slug":"robot-path-planning-using-deep-reinforcement","title":"Robot path planning using deep reinforcement learning","date":"2023-02-17","arxiv_id":"2302.09120","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-multi-user","title":"Deep Reinforcement Learning for Multi-user Massive MIMO with Channel Aging","date":"2023-02-14","arxiv_id":"2302.06853","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-efficient-computation-offloading-in-1","title":"Energy Efficient Computation Offloading in Aerial Edge Networks With Multi-Agent Cooperation","date":"2023-02-14","arxiv_id":"2302.09021","repositories_listed":0,"syntology":null},{"url":null,"slug":"to-risk-or-not-to-risk-learning-with-risk","title":"To Risk or Not to Risk: Learning with Risk Quantification for IoT Task Offloading in UAVs","date":"2023-02-14","arxiv_id":"2302.07399","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-safety-property-collection-and","title":"Online Safety Property Collection and Refinement for Safe Deep Reinforcement Learning in Mapless Navigation","date":"2023-02-13","arxiv_id":"2302.06695","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-charging-profile-design-for-solar","title":"Optimal Charging Profile Design for Solar-Powered Sustainable UAV Communication Networks","date":"2023-02-13","arxiv_id":"2302.06092","repositories_listed":0,"syntology":null},{"url":null,"slug":"verifying-generalization-in-deep-learning","title":"Verifying Generalization in Deep Learning","date":"2023-02-11","arxiv_id":"2302.05745","repositories_listed":0,"syntology":null},{"url":null,"slug":"ris-assisted-jamming-rejection-and-path","title":"RIS-Assisted Jamming Rejection and Path Planning for UAV-Borne IoT Platform: A New Deep Reinforcement Learning Framework","date":"2023-02-10","arxiv_id":"2302.04994","repositories_listed":0,"syntology":null},{"url":null,"slug":"equivariant-muzero","title":"Equivariant MuZero","date":"2023-02-09","arxiv_id":"2302.04798","repositories_listed":0,"syntology":null},{"url":null,"slug":"smart-resource-allocation-model-via","title":"Smart Resource Allocation Model via Artificial Intelligence in Software Defined 6G Networks","date":"2023-02-09","arxiv_id":"2302.04655","repositories_listed":0,"syntology":null},{"url":null,"slug":"arena-web-a-web-based-development-and","title":"Arena-Web -- A Web-based Development and Benchmarking Platform for Autonomous Navigation Approaches","date":"2023-02-06","arxiv_id":"2302.02898","repositories_listed":0,"syntology":null},{"url":null,"slug":"dealing-with-non-stationarity-in","title":"Dealing With Non-stationarity in Decentralized Cooperative Multi-Agent Deep Reinforcement Learning via Multi-Timescale Learning","date":"2023-02-06","arxiv_id":"2302.02792","repositories_listed":0,"syntology":null},{"url":null,"slug":"holistic-deep-reinforcement-learning-based","title":"Holistic Deep-Reinforcement-Learning-based Training of Autonomous Navigation Systems","date":"2023-02-06","arxiv_id":"2302.02921","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-problems-and-modern-solutions-for-deep","title":"Open Problems and Modern Solutions for Deep Reinforcement Learning","date":"2023-02-05","arxiv_id":"2302.02298","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-traffic-light-1","title":"Deep Reinforcement Learning for Traffic Light Control in Intelligent Transportation Systems","date":"2023-02-04","arxiv_id":"2302.03669","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-of-deep-reinforcement-learning","title":"Generalization of Deep Reinforcement Learning for Jammer-Resilient Frequency and Power Allocation","date":"2023-02-04","arxiv_id":"2302.02250","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-cyber-system","title":"Deep Reinforcement Learning for Cyber System Defense under Dynamic Adversarial Uncertainties","date":"2023-02-03","arxiv_id":"2302.01595","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-online-error","title":"Deep Reinforcement Learning for Online Error Detection in Cyber-Physical Systems","date":"2023-02-03","arxiv_id":"2302.01567","repositories_listed":0,"syntology":null},{"url":null,"slug":"user-centric-heterogeneous-action-deep","title":"User-centric Heterogeneous-action Deep Reinforcement Learning for Virtual Reality in the Metaverse over Wireless Networks","date":"2023-02-03","arxiv_id":"2302.01471","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-policy-gradient-by-estimating","title":"Accelerating Policy Gradient by Estimating Value Function from Prior Computation in Deep Reinforcement Learning","date":"2023-02-02","arxiv_id":"2302.01399","repositories_listed":0,"syntology":null},{"url":null,"slug":"alphazzle-jigsaw-puzzle-solver-with-deep","title":"Alphazzle: Jigsaw Puzzle Solver with Deep Monte-Carlo Tree Search","date":"2023-02-01","arxiv_id":"2302.00384","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-tree-search-generative-models-and","title":"Combining Deep Reinforcement Learning and Search with Generative Models for Game-Theoretic Opponent Modeling","date":"2023-02-01","arxiv_id":"2302.00797","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-optimization-approach-using","title":"Deep Reinforcement Learning for Energy-Efficient on the Heterogeneous Computing Architecture","date":"2023-02-01","arxiv_id":"2302.00168","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-zone-hvac-control-with-model-based-deep","title":"Multi-zone HVAC Control with Model-Based Deep Reinforcement Learning","date":"2023-02-01","arxiv_id":"2302.00725","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-grid-aware-dynamic-matching-using","title":"Scalable Grid-Aware Dynamic Matching using Deep Reinforcement Learning","date":"2023-01-31","arxiv_id":"2301.13796","repositories_listed":0,"syntology":null},{"url":null,"slug":"v2n-service-scaling-with-deep-reinforcement","title":"V2N Service Scaling with Deep Reinforcement Learning","date":"2023-01-30","arxiv_id":"2301.13324","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-framework-for-7","title":"A Deep Reinforcement Learning Framework for Optimizing Congestion Control in Data Centers","date":"2023-01-29","arxiv_id":"2301.12558","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-deep-reinforcement-learning-3","title":"Sample Efficient Deep Reinforcement Learning via Local Planning","date":"2023-01-29","arxiv_id":"2301.12579","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-robustness-of-the-deep","title":"Analyzing Robustness of the Deep Reinforcement Learning Algorithm in Ramp Metering Applications Considering False Data Injection Attack and Defense","date":"2023-01-28","arxiv_id":"2301.12036","repositories_listed":0,"syntology":null},{"url":null,"slug":"rcsearcher-reaction-center-identification-in","title":"RCsearcher: Reaction Center Identification in Retrosynthesis via Deep Q-Learning","date":"2023-01-28","arxiv_id":"2301.12071","repositories_listed":0,"syntology":null},{"url":null,"slug":"turbulence-control-in-plane-couette-flow","title":"Turbulence control in plane Couette flow using low-dimensional neural ODE-based models and deep reinforcement learning","date":"2023-01-28","arxiv_id":"2301.12098","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-memory-efficient-deep-reinforcement","title":"A Memory Efficient Deep Reinforcement Learning Approach For Snake Game Autonomous Agents","date":"2023-01-27","arxiv_id":"2301.11977","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-deep-reinforcement-learning-for","title":"Exploring Deep Reinforcement Learning for Holistic Smart Building Control","date":"2023-01-27","arxiv_id":"2301.11510","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-human-road-crossing-decisions-as","title":"Modeling human road crossing decisions as reward maximization with visual perception limitations","date":"2023-01-27","arxiv_id":"2301.11737","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-episodic-control-with-state","title":"Neural Episodic Control with State Abstraction","date":"2023-01-27","arxiv_id":"2301.11490","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-diverse-human","title":"Reinforcement Learning from Diverse Human Preferences","date":"2023-01-27","arxiv_id":"2301.11774","repositories_listed":0,"syntology":null},{"url":null,"slug":"double-deep-reinforcement-learning-techniques","title":"Double Deep Reinforcement Learning Techniques for Low Dimensional Sensing Mapless Navigation of Terrestrial Mobile Robots","date":"2023-01-26","arxiv_id":"2301.11173","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-deep-reinforcement-learning-based-2","title":"A Novel Deep Reinforcement Learning-based Approach for Enhancing Spectral Efficiency of IRS-assisted Wireless Systems","date":"2023-01-24","arxiv_id":"2302.14706","repositories_listed":0,"syntology":null},{"url":null,"slug":"autocost-evolving-intrinsic-cost-for-zero","title":"AutoCost: Evolving Intrinsic Cost for Zero-violation Reinforcement Learning","date":"2023-01-24","arxiv_id":"2301.10339","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepadmr-a-deep-learning-based-anomaly","title":"DeepADMR: A Deep Learning based Anomaly Detection for MANET Routing","date":"2023-01-24","arxiv_id":"2302.13877","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-baselines-for-multiple-object","title":"Effective Baselines for Multiple Object Rearrangement Planning in Partially Observable Mapped Environments","date":"2023-01-24","arxiv_id":"2301.09854","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-deep-reinforcement-learning-state","title":"Explainable Deep Reinforcement Learning: State of the Art and Challenges","date":"2023-01-24","arxiv_id":"2301.09937","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-to-6","title":"A deep reinforcement learning approach to assess the low-altitude airspace capacity for urban air mobility","date":"2023-01-23","arxiv_id":"2301.09758","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-inter-area-oscillation-damping","title":"Optimal Inter-area Oscillation Damping Control: A Transfer Deep Reinforcement Learning Approach with Switching Control Strategy","date":"2023-01-23","arxiv_id":"2301.09321","repositories_listed":0,"syntology":null},{"url":null,"slug":"accdecoder-accelerated-decoding-for-neural","title":"AccDecoder: Accelerated Decoding for Neural-enhanced Video Analytics","date":"2023-01-20","arxiv_id":"2301.08664","repositories_listed":0,"syntology":null}],"record_sha256":"ed4743cdf0b57a1d7b71c3a4054a88991108872cea50850f969e5053e96f07b0","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}