{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/34","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":34,"pages_in_order":59,"rows_per_page":100,"rows":[3301,3400],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/33","next":"/task/deep-reinforcement-learning/papers/35","papers":[{"url":null,"slug":"deep-reinforcement-learning-for-combined","title":"Deep Reinforcement Learning for Combined Coverage and Resource Allocation in UAV-aided RAN-slicing","date":"2022-11-15","arxiv_id":"2211.09713","repositories_listed":0,"syntology":null},{"url":null,"slug":"digital-twin-assisted-collaborative","title":"Digital Twin-Assisted Collaborative Transcoding for Better User Satisfaction in Live Streaming","date":"2022-11-13","arxiv_id":"2211.06906","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-for-11","title":"Multi-Agent Deep Reinforcement Learning for Efficient Passenger Delivery in Urban Air Mobility","date":"2022-11-13","arxiv_id":"2211.06890","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-vector","title":"Deep Reinforcement Learning with Vector Quantized Encoding","date":"2022-11-12","arxiv_id":"2211.06733","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-microgrid","title":"Deep Reinforcement Learning Microgrid Optimization Strategy Considering Priority Flexible Demand Side","date":"2022-11-11","arxiv_id":"2211.05946","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-graph-neural-networks-based-framework-for","title":"A Graph Neural Networks based Framework for Topology-Aware Proactive SLA Management in a Latency Critical NFV Application Use-case","date":"2022-11-10","arxiv_id":"2212.00714","repositories_listed":0,"syntology":null},{"url":null,"slug":"job-scheduling-in-datacenters-using","title":"Job Scheduling in Datacenters using Constraint Controlled RL","date":"2022-11-10","arxiv_id":"2211.05338","repositories_listed":0,"syntology":null},{"url":null,"slug":"rare-renewable-energy-aware-resource","title":"RARE: Renewable Energy Aware Resource Management in Datacenters","date":"2022-11-10","arxiv_id":"2211.05346","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-n-1-secure-hv-grid-flexibility","title":"Robust N-1 secure HV Grid Flexibility Estimation for TSO-DSO coordinated Congestion Management with Deep Reinforcement Learning","date":"2022-11-10","arxiv_id":"2211.05855","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-deep-reinforcement-learning-for","title":"Interpretable Deep Reinforcement Learning for Green Security Games with Real-Time Information","date":"2022-11-09","arxiv_id":"2211.04987","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-dwa-omnidirectional-motion-planning-for","title":"RL-DWA Omnidirectional Motion Planning for Person Following in Domestic Assistance and Monitoring","date":"2022-11-09","arxiv_id":"2211.04993","repositories_listed":0,"syntology":null},{"url":null,"slug":"single-agent-to-multi-agent-in-deep","title":"Solving Collaborative Dec-POMDPs with Deep Reinforcement Learning Heuristics","date":"2022-11-09","arxiv_id":"2211.15411","repositories_listed":0,"syntology":null},{"url":null,"slug":"pretraining-in-deep-reinforcement-learning-a","title":"Pretraining in Deep Reinforcement Learning: A Survey","date":"2022-11-08","arxiv_id":"2211.03959","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-influence-maximization-from-an-ml","title":"A Survey on Influence Maximization: From an ML-Based Combinatorial Optimization","date":"2022-11-06","arxiv_id":"2211.03074","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatio-temporal-incentives-optimization-for","title":"Spatio-temporal Incentives Optimization for Ride-hailing Services with Offline Deep Reinforcement Learning","date":"2022-11-06","arxiv_id":"2211.03240","repositories_listed":0,"syntology":null},{"url":null,"slug":"fair-and-efficient-distributed-edge-learning","title":"Fair and Efficient Distributed Edge Learning with Hybrid Multipath TCP","date":"2022-11-03","arxiv_id":"2211.09723","repositories_listed":0,"syntology":null},{"url":null,"slug":"theta-resonance-a-single-step-reinforcement","title":"Theta-Resonance: A Single-Step Reinforcement Learning Method for Design Space Exploration","date":"2022-11-03","arxiv_id":"2211.02052","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-irs-phase","title":"Deep Reinforcement Learning for IRS Phase Shift Design in Spatiotemporally Correlated Environments","date":"2022-11-02","arxiv_id":"2211.09726","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-power-control","title":"Deep Reinforcement Learning for Power Control in Next-Generation WiFi Network Systems","date":"2022-11-02","arxiv_id":"2211.01107","repositories_listed":0,"syntology":null},{"url":null,"slug":"wind-power-forecasting-considering-data","title":"Wind Power Forecasting Considering Data Privacy Protection: A Federated Deep Reinforcement Learning Approach","date":"2022-11-02","arxiv_id":"2211.02674","repositories_listed":0,"syntology":null},{"url":null,"slug":"cpg-rl-learning-central-pattern-generators","title":"CPG-RL: Learning Central Pattern Generators for Quadruped Locomotion","date":"2022-11-01","arxiv_id":"2211.00458","repositories_listed":0,"syntology":null},{"url":null,"slug":"event-tables-for-efficient-experience-replay","title":"Event Tables for Efficient Experience Replay","date":"2022-11-01","arxiv_id":"2211.00576","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-adaptive-evolutionary-computation","title":"Learning Adaptive Evolutionary Computation for Solving Multi-Objective Optimization Problems","date":"2022-11-01","arxiv_id":"2211.09719","repositories_listed":0,"syntology":null},{"url":null,"slug":"teacher-student-curriculum-learning-for","title":"Teacher-student curriculum learning for reinforcement learning","date":"2022-10-31","arxiv_id":"2210.17368","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitating-opponent-to-win-adversarial-policy","title":"Imitating Opponent to Win: Adversarial Policy Imitation Learning in Two-player Competitive Games","date":"2022-10-30","arxiv_id":"2210.16915","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-guided-exploration-in-deep","title":"Knowledge-Guided Exploration in Deep Reinforcement Learning","date":"2022-10-26","arxiv_id":"2210.15670","repositories_listed":0,"syntology":null},{"url":null,"slug":"network-aware-compute-and-memory-allocation","title":"Network Aware Compute and Memory Allocation in Optically Composable Data Centres with Deep Reinforcement Learning and Graph Neural Networks","date":"2022-10-26","arxiv_id":"2211.02466","repositories_listed":0,"syntology":null},{"url":null,"slug":"reachability-verification-based-reliability","title":"Reachability Verification Based Reliability Assessment for Deep Reinforcement Learning Controlled Robotics and Autonomous Systems","date":"2022-10-26","arxiv_id":"2210.14991","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-shot-offline-and-production-scalable-pid","title":"One-shot, Offline and Production-Scalable PID Optimisation with Deep Reinforcement Learning","date":"2022-10-25","arxiv_id":"2210.13906","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-reinforcement-learning-based-cnn","title":"Graph Reinforcement Learning-based CNN Inference Offloading in Dynamic Edge Computing","date":"2022-10-24","arxiv_id":"2210.13464","repositories_listed":0,"syntology":null},{"url":null,"slug":"oss-mentor-a-framework-for-improving","title":"OSS Mentor A framework for improving developers contributions via deep reinforcement learning","date":"2022-10-24","arxiv_id":"2210.13990","repositories_listed":0,"syntology":null},{"url":null,"slug":"climate-change-policy-exploration-using","title":"Climate Change Policy Exploration using Reinforcement Learning","date":"2022-10-23","arxiv_id":"2211.17013","repositories_listed":0,"syntology":null},{"url":null,"slug":"guided-skill-learning-and-abstraction-for","title":"LEAGUE: Guided Skill Learning and Abstraction for Long-Horizon Manipulation","date":"2022-10-23","arxiv_id":"2210.12631","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-general-world-models-in-a-handful-of","title":"Learning General World Models in a Handful of Reward-Free Deployments","date":"2022-10-23","arxiv_id":"2210.12719","repositories_listed":0,"syntology":null},{"url":null,"slug":"cut-and-approximate-3d-shape-reconstruction","title":"Cut-and-Approximate: 3D Shape Reconstruction from Planar Cross-sections with Deep Reinforcement Learning","date":"2022-10-22","arxiv_id":"2210.12509","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-transfer-in-deep-reinforcement","title":"Probing Transfer in Deep Reinforcement Learning without Task Engineering","date":"2022-10-22","arxiv_id":"2210.12448","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-the-gap-between-target-networks-and","title":"Bridging the Gap Between Target Networks and Functional Regularization","date":"2022-10-21","arxiv_id":"2210.12282","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-inverse","title":"Deep Reinforcement Learning for Inverse Inorganic Materials Design","date":"2022-10-21","arxiv_id":"2210.11931","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-stabilization","title":"Deep Reinforcement Learning for Stabilization of Large-scale Probabilistic Boolean Networks","date":"2022-10-21","arxiv_id":"2210.12229","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-quantum-enabled-6g-slicing","title":"Towards Quantum-Enabled 6G Slicing","date":"2022-10-21","arxiv_id":"2212.11755","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-session-recommendations-in-e","title":"Fine-Grained Session Recommendations in E-commerce using Deep Reinforcement Learning","date":"2022-10-20","arxiv_id":"2210.15451","repositories_listed":0,"syntology":null},{"url":null,"slug":"simple-emergent-action-representations-from","title":"Simple Emergent Action Representations from Multi-Task Policy Training","date":"2022-10-18","arxiv_id":"2210.09566","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropy-regularized-reinforcement-learning","title":"Entropy Regularized Reinforcement Learning with Cascading Networks","date":"2022-10-16","arxiv_id":"2210.08503","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-impact-of-task-underspecification-in","title":"The Impact of Task Underspecification in Evaluating Deep Reinforcement Learning","date":"2022-10-16","arxiv_id":"2210.08607","repositories_listed":0,"syntology":null},{"url":null,"slug":"dyfen-agent-based-fee-setting-in-payment","title":"DyFEn: Agent-Based Fee Setting in Payment Channel Networks","date":"2022-10-15","arxiv_id":"2210.08197","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-scalable-finite-difference-method-for-deep","title":"A Scalable Finite Difference Method for Deep Reinforcement Learning","date":"2022-10-14","arxiv_id":"2210.07487","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-patch-foraging-in-deep-reinforcement","title":"Adaptive patch foraging in deep reinforcement learning agents","date":"2022-10-14","arxiv_id":"2210.08085","repositories_listed":0,"syntology":null},{"url":null,"slug":"monte-carlo-augmented-actor-critic-for-sparse","title":"Monte Carlo Augmented Actor-Critic for Sparse Reward Deep Reinforcement Learning from Suboptimal Demonstrations","date":"2022-10-14","arxiv_id":"2210.07432","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-automatic-run","title":"Deep reinforcement learning for automatic run-time adaptation of UWB PHY radio settings","date":"2022-10-13","arxiv_id":"2210.15498","repositories_listed":0,"syntology":null},{"url":null,"slug":"observed-adversaries-in-deep-reinforcement","title":"Observed Adversaries in Deep Reinforcement Learning","date":"2022-10-13","arxiv_id":"2210.06787","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-multi-agent-reinforcement-learning-2","title":"Towards Multi-Agent Reinforcement Learning driven Over-The-Counter Market Simulations","date":"2022-10-13","arxiv_id":"2210.07184","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-deep-reinforcement-learning-based","title":"Transfer Deep Reinforcement Learning-based Large-scale V2G Continuous Charging Coordination with Renewable Energy Sources","date":"2022-10-13","arxiv_id":"2210.07013","repositories_listed":0,"syntology":null},{"url":null,"slug":"point-cloud-scene-completion-with-joint-color","title":"Point Cloud Scene Completion with Joint Color and Semantic Estimation from Single RGB-D Image","date":"2022-10-12","arxiv_id":"2210.05891","repositories_listed":0,"syntology":null},{"url":null,"slug":"smooth-trajectory-collision-avoidance-through","title":"Smooth Trajectory Collision Avoidance through Deep Reinforcement Learning","date":"2022-10-12","arxiv_id":"2210.06377","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-adaptive-mcts-with-td-learning-in","title":"Exploring Adaptive MCTS with TD Learning in miniXCOM","date":"2022-10-10","arxiv_id":"2210.05014","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-n-step-surrogate-stage-reward-to-reduce","title":"Long N-step Surrogate Stage Reward to Reduce Variances of Deep Reinforcement Learning in Complex Problems","date":"2022-10-10","arxiv_id":"2210.04820","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-action-space-reference-model","title":"Reducing Action Space: Reference-Model-Assisted Deep Reinforcement Learning for Inverter-based Volt-Var Control","date":"2022-10-10","arxiv_id":"2210.07360","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulating-coverage-path-planning-with-roomba","title":"Simulating Coverage Path Planning with Roomba","date":"2022-10-10","arxiv_id":"2210.04988","repositories_listed":0,"syntology":null},{"url":null,"slug":"algorithmic-trading-using-continuous-action","title":"Algorithmic Trading Using Continuous Action Space Deep Reinforcement Learning","date":"2022-10-07","arxiv_id":"2210.03469","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-enable-uncertainty-estimation-in","title":"How to Enable Uncertainty Estimation in Proximal Policy Optimization","date":"2022-10-07","arxiv_id":"2210.03649","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-inventory-management","title":"Deep Inventory Management","date":"2022-10-06","arxiv_id":"2210.03137","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-up-stochastic-gradient-descent-for","title":"Scaling up Stochastic Gradient Descent for Non-convex Optimisation","date":"2022-10-06","arxiv_id":"2210.02882","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-neural-consolidation-for-transfer-in","title":"On Neural Consolidation for Transfer in Reinforcement Learning","date":"2022-10-05","arxiv_id":"2210.02240","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-scheduling","title":"Using Deep Reinforcement Learning for mmWave Real-Time Scheduling","date":"2022-10-04","arxiv_id":"2210.01423","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperbolic-deep-reinforcement-learning","title":"Hyperbolic Deep Reinforcement Learning","date":"2022-10-04","arxiv_id":"2210.01542","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-deep-reinforcement-1","title":"Cooperative Multi-Agent Deep Reinforcement Learning for Reliable and Energy-Efficient Mobile Access via Multi-UAV Control","date":"2022-10-03","arxiv_id":"2210.00945","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-for-wireless-networked-systems","title":"Deep Learning for Wireless Networked Systems: a joint Estimation-Control-Scheduling Approach","date":"2022-10-03","arxiv_id":"2210.00673","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-option-discovery-using-deep-q","title":"Interpretable Option Discovery using Deep Q-Learning and Variational Autoencoders","date":"2022-10-03","arxiv_id":"2210.01231","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-minimally-violating-continuous","title":"Learning Minimally-Violating Continuous Control for Infeasible Linear Temporal Logic Specifications","date":"2022-10-03","arxiv_id":"2210.01162","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-exploration-in-actor-critic","title":"Boosting Exploration in Actor-Critic Algorithms by Incentivizing Plausible Novel States","date":"2022-10-01","arxiv_id":"2210.00211","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparing-bert-based-reward-functions-for","title":"Comparing BERT-based Reward Functions for Deep Reinforcement Learning in Machine Translation","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-training-of-deep-ensemble","title":"Ensemble Reinforcement Learning in Continuous Spaces -- A Hierarchical Multi-Step Approach for Policy Training","date":"2022-09-29","arxiv_id":"2209.14488","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-driver-s-evasive-behavior-during","title":"Modeling driver's evasive behavior during safety-critical lane changes:Two-dimensional time-to-collision and deep reinforcement learning","date":"2022-09-29","arxiv_id":"2209.15133","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-generalization-of-deep-reinforcement","title":"Generalization in Deep Reinforcement Learning for Robotic Navigation by Reward Shaping","date":"2022-09-28","arxiv_id":"2209.14271","repositories_listed":0,"syntology":null},{"url":null,"slug":"predictive-crypto-asset-automated-market","title":"Predictive Crypto-Asset Automated Market Making Architecture for Decentralized Finance using Deep Reinforcement Learning","date":"2022-09-28","arxiv_id":"2211.01346","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-of-experiments-for-the-calibration-of","title":"Design of experiments for the calibration of history-dependent models via deep reinforcement learning and an enhanced Kalman filter","date":"2022-09-27","arxiv_id":"2209.13126","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-allocation-for-mobile-metaverse-with","title":"Resource Allocation for Mobile Metaverse with the Internet of Vehicles over 6G Wireless Communications: A Deep Reinforcement Learning Approach","date":"2022-09-27","arxiv_id":"2209.13425","repositories_listed":0,"syntology":null},{"url":null,"slug":"advanced-skills-by-learning-locomotion-and","title":"Advanced Skills by Learning Locomotion and Local Navigation End-to-End","date":"2022-09-26","arxiv_id":"2209.12827","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-and-deploying-robust-locomotion","title":"Learning and Deploying Robust Locomotion Policies with Minimal Dynamics Randomization","date":"2022-09-26","arxiv_id":"2209.12878","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-adaptive-mesh","title":"Deep Reinforcement Learning for Adaptive Mesh Refinement","date":"2022-09-25","arxiv_id":"2209.12351","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-efficiency-maximization-for-a-wpt-d2d","title":"Joint Robust Beamforming Design for WPT-assisted D2D Communications in MISO-NOMA: Fractional Programming and Deep Reinforcement Learning","date":"2022-09-25","arxiv_id":"2209.12253","repositories_listed":0,"syntology":null},{"url":null,"slug":"computational-discovery-of-energy-efficient","title":"Computational Discovery of Energy-Efficient Heat Treatment for Microstructure Design using Deep Reinforcement Learning","date":"2022-09-22","arxiv_id":"2209.11259","repositories_listed":0,"syntology":null},{"url":null,"slug":"developing-evaluating-and-scaling-learning","title":"Developing, Evaluating and Scaling Learning Agents in Multi-Agent Environments","date":"2022-09-22","arxiv_id":"2209.10958","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-good-is-neural-combinatorial-optimization","title":"How Good Is Neural Combinatorial Optimization? A Systematic Evaluation on the Traveling Salesman Problem","date":"2022-09-22","arxiv_id":"2209.10913","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverted-landing-in-a-small-aerial-robot-via","title":"Inverted Landing in a Small Aerial Robot via Deep Reinforcement Learning for Triggering and Control of Rotational Maneuvers","date":"2022-09-22","arxiv_id":"2209.11043","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimizing-human-assistance-augmenting-a","title":"Minimizing Human Assistance: Augmenting a Single Demonstration for Deep Reinforcement Learning","date":"2022-09-22","arxiv_id":"2209.11275","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-based-charging","title":"A Deep Reinforcement Learning-Based Charging Scheduling Approach with Augmented Lagrangian for Electric Vehicle","date":"2022-09-20","arxiv_id":"2209.09772","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-value-iteration","title":"Graph Value Iteration","date":"2022-09-20","arxiv_id":"2209.09608","repositories_listed":0,"syntology":null},{"url":null,"slug":"macro-action-based-multi-agent-robot-deep","title":"Macro-Action-Based Multi-Agent/Robot Deep Reinforcement Learning under Partial Observability","date":"2022-09-20","arxiv_id":"2209.10003","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-transferable-and-automatic-tuning-of-deep","title":"A Transferable and Automatic Tuning of Deep Reinforcement Learning for Cost Effective Phishing Detection","date":"2022-09-19","arxiv_id":"2209.09033","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-unicast-multicast-scheduling-for-age","title":"Dynamic Unicast-Multicast Scheduling for Age-Optimal Information Dissemination in Vehicular Networks","date":"2022-09-19","arxiv_id":"2209.13006","repositories_listed":0,"syntology":null},{"url":null,"slug":"rewarding-episodic-visitation-discrepancy-for","title":"Rewarding Episodic Visitation Discrepancy for Exploration in Reinforcement Learning","date":"2022-09-19","arxiv_id":"2209.08842","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-deep-reinforcement-learning","title":"Evolutionary Deep Reinforcement Learning Using Elite Buffer: A Novel Approach Towards DRL Combined with EA in Continuous Control Tasks","date":"2022-09-18","arxiv_id":"2209.08480","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-level-explanation-of-deep-reinforcement","title":"Multi-level Explanation of Deep Reinforcement Learning-based Scheduling","date":"2022-09-18","arxiv_id":"2209.09645","repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsically-motivated-reinforcement-2","title":"Intrinsically Motivated Reinforcement Learning based Recommendation with Counterfactual Data Augmentation","date":"2022-09-17","arxiv_id":"2209.08228","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-task-1","title":"Deep Reinforcement Learning for Task Offloading in UAV-Aided Smart Farm Networks","date":"2022-09-15","arxiv_id":"2209.07367","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-policy-gradients-with","title":"Multi-Objective Policy Gradients with Topological Constraints","date":"2022-09-15","arxiv_id":"2209.07096","repositories_listed":0,"syntology":null},{"url":null,"slug":"proapt-projection-of-apt-threats-with-deep","title":"ProAPT: Projection of APT Threats with Deep Reinforcement Learning","date":"2022-09-15","arxiv_id":"2209.07215","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-self-attention-based-navigation-in","title":"Towards self-attention based visual navigation in the real world","date":"2022-09-15","arxiv_id":"2209.07043","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-learning-based-trajectory-planning-of","title":"A Learning-Based Trajectory Planning of Multiple UAVs for AoI Minimization in IoT Networks","date":"2022-09-13","arxiv_id":"2209.09206","repositories_listed":0,"syntology":null}],"record_sha256":"86284500567f72c04f54ae22bae01195291b45c5a9c32e991c2325a3d518af8d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}