{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/37","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":37,"pages_in_order":59,"rows_per_page":100,"rows":[3601,3700],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/36","next":"/task/deep-reinforcement-learning/papers/38","papers":[{"url":null,"slug":"optimizing-nitrogen-management-with-deep","title":"Optimizing Nitrogen Management with Deep Reinforcement Learning and Crop Simulations","date":"2022-04-21","arxiv_id":"2204.10394","repositories_listed":0,"syntology":null},{"url":null,"slug":"network-topology-optimization-via-deep","title":"Network Topology Optimization via Deep Reinforcement Learning","date":"2022-04-19","arxiv_id":"2204.14133","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-bayesian-policy-reuse-with-a","title":"Efficient Bayesian Policy Reuse with a Scalable Observation Model in Deep Reinforcement Learning","date":"2022-04-16","arxiv_id":"2204.07729","repositories_listed":0,"syntology":null},{"url":null,"slug":"d3pg-dirichlet-ddpg-for-task-partitioning-and","title":"D3PG: Dirichlet DDPG for Task Partitioning and Offloading With Constrained Hybrid Action Space in Mobile-Edge Computing","date":"2022-04-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-and-practical-quantum-compiler","title":"Efficient and practical quantum compiler towards multi-qubit systems with deep reinforcement learning","date":"2022-04-14","arxiv_id":"2204.06904","repositories_listed":0,"syntology":null},{"url":null,"slug":"glocal-glocalized-curriculum-aided-learning","title":"GloCAL: Glocalized Curriculum-Aided Learning of Multiple Tasks with Application to Robotic Grasping","date":"2022-04-14","arxiv_id":"2204.06835","repositories_listed":0,"syntology":null},{"url":null,"slug":"methodical-advice-collection-and-reuse-in","title":"Methodical Advice Collection and Reuse in Deep Reinforcement Learning","date":"2022-04-14","arxiv_id":"2204.07254","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-coseg-a-novel-image-co-segmentation","title":"RL-CoSeg : A Novel Image Co-Segmentation Algorithm with Deep Reinforcement Learning","date":"2022-04-12","arxiv_id":"2204.05951","repositories_listed":0,"syntology":null},{"url":null,"slug":"smart-interference-management-xapp-using-deep","title":"Smart Interference Management xApp using Deep Reinforcement Learning","date":"2022-04-12","arxiv_id":"2204.09707","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-semi","title":"Deep Reinforcement Learning Based Semi-Autonomous Control for Robotic Surgery","date":"2022-04-11","arxiv_id":"2204.05433","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-vision-transformer-methods-for","title":"Evaluating Vision Transformer Methods for Deep Reinforcement Learning from Pixels","date":"2022-04-11","arxiv_id":"2204.04905","repositories_listed":0,"syntology":null},{"url":null,"slug":"mr-inet-gym-framework-for-edge-deployment-of","title":"MR-iNet Gym: Framework for Edge Deployment of Deep Reinforcement Learning on Embedded Software Defined Radio","date":"2022-04-09","arxiv_id":"2204.04507","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-the-long-term-behaviour-of-deep","title":"Optimizing the Long-Term Behaviour of Deep Reinforcement Learning for Pushing and Grasping","date":"2022-04-07","arxiv_id":"2204.03487","repositories_listed":0,"syntology":null},{"url":null,"slug":"service-resource-allocation-problem-in-the","title":"Optimal service resource management strategy for IoT-based health information system considering value co-creation of users","date":"2022-04-05","arxiv_id":"2204.02521","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimising-energy-efficiency-in-uav-assisted","title":"Optimising Energy Efficiency in UAV-Assisted Networks using Deep Reinforcement Learning","date":"2022-04-04","arxiv_id":"2204.01597","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-physical-activity-recommendation-on","title":"Enhancing Digital Health Services: A Machine Learning Approach to Personalized Exercise Goal Setting","date":"2022-04-03","arxiv_id":"2204.00961","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-high-dof-reaching-and-grasping-via","title":"Learning High-DOF Reaching-and-Grasping via Dynamic Representation of Gripper-Object Interaction","date":"2022-04-03","arxiv_id":"2204.13998","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-transfer-in-deep-reinforcement","title":"Hybrid Transfer in Deep Reinforcement Learning for Ads Allocation","date":"2022-04-02","arxiv_id":"2204.11589","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-decision-forest-via-deep","title":"Building Decision Forest via Deep Reinforcement Learning","date":"2022-04-01","arxiv_id":"2204.00306","repositories_listed":0,"syntology":null},{"url":null,"slug":"cogngen-constructing-the-kernel-of-a","title":"Maze Learning using a Hyperdimensional Predictive Processing Cognitive Architecture","date":"2022-03-31","arxiv_id":"2204.00619","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-graph","title":"Spatio-Temporal Graph Convolutional Neural Networks for Physics-Aware Grid Learning Algorithms","date":"2022-03-31","arxiv_id":"2203.16732","repositories_listed":0,"syntology":null},{"url":null,"slug":"mask-atari-for-deep-reinforcement-learning-as","title":"Mask Atari for Deep Reinforcement Learning as POMDP Benchmarks","date":"2022-03-31","arxiv_id":"2203.16777","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-the-properties-of-neural","title":"Investigating the Properties of Neural Network Representations in Reinforcement Learning","date":"2022-03-30","arxiv_id":"2203.15955","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-step-two-critic-deep-reinforcement","title":"Reducing Learning Difficulties: One-Step Two-Critic Deep Reinforcement Learning for Inverter-based Volt-Var Control","date":"2022-03-30","arxiv_id":"2203.16289","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-interpretable-deep-reinforcement","title":"Towards Interpretable Deep Reinforcement Learning Models via Inverse Reinforcement Learning","date":"2022-03-30","arxiv_id":"2203.16464","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-data-driven","title":"Deep Reinforcement Learning for Data-Driven Adaptive Scanning in Ptychography","date":"2022-03-29","arxiv_id":"2203.15413","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-aided-platoon","title":"Deep Reinforcement Learning Aided Platoon Control Relying on V2X Information","date":"2022-03-28","arxiv_id":"2203.15781","repositories_listed":0,"syntology":null},{"url":null,"slug":"limited-parameter-denoising-for-low-dose-x","title":"Limited Parameter Denoising for Low-dose X-ray Computed Tomography Using Deep Reinforcement Learning","date":"2022-03-28","arxiv_id":"2203.14794","repositories_listed":0,"syntology":null},{"url":null,"slug":"reptile-a-proactive-real-time-deep","title":"REPTILE: A Proactive Real-Time Deep Reinforcement Learning Self-adaptive Framework","date":"2022-03-28","arxiv_id":"2203.14686","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-neuromorphic-processors-realization","title":"A Novel Neuromorphic Processors Realization of Spiking Deep Reinforcement Learning for Portfolio Management","date":"2022-03-26","arxiv_id":"2203.14159","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-evolution-and-deep-reinforcement","title":"Combining Evolution and Deep Reinforcement Learning for Policy Search: a Survey","date":"2022-03-26","arxiv_id":"2203.14009","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-conservative-q-learning-approach-for","title":"A Conservative Q-Learning approach for handling distribution shift in sepsis treatment strategies","date":"2022-03-25","arxiv_id":"2203.13884","repositories_listed":0,"syntology":null},{"url":null,"slug":"dealing-with-sparse-rewards-using-graph","title":"Dealing with Sparse Rewards Using Graph Neural Networks","date":"2022-03-25","arxiv_id":"2203.13424","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-optimal-well","title":"Deep reinforcement learning for optimal well control in subsurface systems with uncertain geology","date":"2022-03-24","arxiv_id":"2203.13375","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-allocation-optimization-using","title":"The state-of-the-art review on resource allocation problem using artificial intelligence methods on various computing paradigms","date":"2022-03-23","arxiv_id":"2203.12315","repositories_listed":0,"syntology":null},{"url":null,"slug":"review-of-metrics-to-measure-the-stability","title":"Review of Metrics to Measure the Stability, Robustness and Resilience of Reinforcement Learning","date":"2022-03-22","arxiv_id":"2203.12048","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-deep-reinforcement-learning","title":"Scalable Deep Reinforcement Learning Algorithms for Mean Field Games","date":"2022-03-22","arxiv_id":"2203.11973","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-of","title":"Hierarchical Reinforcement Learning of Locomotion Policies in Response to Approaching Objects: A Preliminary Study","date":"2022-03-20","arxiv_id":"2203.10616","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-reward-function-in","title":"Reinforcement learning reward function in unmanned aerial vehicle control tasks","date":"2022-03-20","arxiv_id":"2203.10519","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-guided-graph","title":"Deep reinforcement learning guided graph neural networks for brain network analysis","date":"2022-03-18","arxiv_id":"2203.10093","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-learning-for-privacy-preservation","title":"Federated Learning for Privacy Preservation in Smart Healthcare Systems: A Comprehensive Survey","date":"2022-03-18","arxiv_id":"2203.09702","repositories_listed":0,"syntology":null},{"url":null,"slug":"infinite-horizon-reach-avoid-zero-sum-games","title":"Infinite-Horizon Reach-Avoid Zero-Sum Games via Deep Reinforcement Learning","date":"2022-03-18","arxiv_id":"2203.10142","repositories_listed":0,"syntology":null},{"url":null,"slug":"latency-optimization-for-blockchain-empowered","title":"Latency Optimization for Blockchain-Empowered Federated Learning in Multi-Server Edge Computing","date":"2022-03-18","arxiv_id":"2203.09670","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-optimization-with-adaptive","title":"Proximal Policy Optimization with Adaptive Threshold for Symmetric Relative Density Ratio","date":"2022-03-18","arxiv_id":"2203.09809","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-based-caching","title":"A Deep Reinforcement Learning-Based Caching Strategy for IoT Networks with Transient Data","date":"2022-03-16","arxiv_id":"2203.12674","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-multi-agent-reinforcement","title":"A Survey of Multi-Agent Deep Reinforcement Learning with Communication","date":"2022-03-16","arxiv_id":"2203.08975","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-phase-encode-selection-for-slice","title":"Active Phase-Encode Selection for Slice-Specific Fast MR Scanning Using a Transformer-Based Deep Reinforcement Learning Framework","date":"2022-03-11","arxiv_id":"2203.05756","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-binary-reinforcement-learning-for","title":"Deep Binary Reinforcement Learning for Scalable Verification","date":"2022-03-11","arxiv_id":"2203.05704","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-neural-networks-for-relational","title":"Graph Neural Networks for Relational Inductive Bias in Vision-based Deep Reinforcement Learning of Robot Control","date":"2022-03-11","arxiv_id":"2203.05985","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-scheduling-for-minimizing-aoi-in","title":"Minimizing the AoI in Resource-Constrained Multi-Source Relaying Systems: Dynamic and Learning-based Scheduling","date":"2022-03-10","arxiv_id":"2203.05656","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-like-navigation-behavior-a-statistical","title":"Human-Like Navigation Behavior: A Statistical Evaluation Framework","date":"2022-03-10","arxiv_id":"2203.05965","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigation-of-factorized-optical-flows-as","title":"Investigation of Factorized Optical Flows as Mid-Level Representations","date":"2022-03-09","arxiv_id":"2203.04927","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-robot-cooperative-pursuit-via-potential","title":"Multi-robot Cooperative Pursuit via Potential Field-Enhanced Reinforcement Learning","date":"2022-03-09","arxiv_id":"2203.04700","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-reinforcement-learning-for-predictive","title":"Designing Heterogeneous GNNs with Desired Permutation Properties for Wireless Resource Allocation","date":"2022-03-08","arxiv_id":"2203.03906","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-based-age-of-information","title":"A Practical AoI Scheduler in IoT Networks with Relays","date":"2022-03-08","arxiv_id":"2203.04227","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-broad-reinforcement-learning-for","title":"Multi-Agent Broad Reinforcement Learning for Intelligent Traffic Light Control","date":"2022-03-08","arxiv_id":"2203.04310","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-based-bayesian-experimental-design-for","title":"Policy-Based Bayesian Experimental Design for Non-Differentiable Implicit Models","date":"2022-03-08","arxiv_id":"2203.04272","repositories_listed":0,"syntology":null},{"url":null,"slug":"renyi-state-entropy-for-exploration","title":"Rényi State Entropy for Exploration Acceleration in Reinforcement Learning","date":"2022-03-08","arxiv_id":"2203.04297","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-reinforcement-learning-methods-in","title":"A Survey on Reinforcement Learning Methods in Character Animation","date":"2022-03-07","arxiv_id":"2203.04735","repositories_listed":0,"syntology":null},{"url":null,"slug":"co-optimization-of-on-ramp-merging-and-plug","title":"Co-Optimization of On-Ramp Merging and Plug-In Hybrid Electric Vehicle Power Split Using Deep Reinforcement Learning","date":"2022-03-07","arxiv_id":"2203.03113","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-cooperation-strategy-generation-in","title":"Efficient Policy Generation in Multi-Agent Systems via Hypergraph Neural Network","date":"2022-03-07","arxiv_id":"2203.03265","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-transfer-in-deep-reinforcement","title":"Knowledge Transfer in Deep Reinforcement Learning for Slice-Aware Mobility Robustness Optimization","date":"2022-03-07","arxiv_id":"2203.03227","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-location-aware","title":"Reinforcement Learning for Location-Aware Scheduling","date":"2022-03-07","arxiv_id":"2203.03480","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-model-free","title":"Deep Reinforcement Learning based Model-free On-line Dynamic Multi-Microgrid Formation to Enhance Resilience","date":"2022-03-06","arxiv_id":"2203.03030","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchically-structured-scheduling-and","title":"Hierarchically Structured Scheduling and Execution of Tasks in a Multi-Agent Environment","date":"2022-03-06","arxiv_id":"2203.03021","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-reward-gradients-for-reinforcement","title":"Leveraging Reward Gradients For Reinforcement Learning in Differentiable Physics Simulations","date":"2022-03-06","arxiv_id":"2203.02857","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-deep-reinforcement-learning-for","title":"Offline Deep Reinforcement Learning for Dynamic Pricing of Consumer Credit","date":"2022-03-06","arxiv_id":"2203.03003","repositories_listed":0,"syntology":null},{"url":null,"slug":"cloud-edge-training-architecture-for-sim-to","title":"Cloud-Edge Training Architecture for Sim-to-Real Deep Reinforcement Learning","date":"2022-03-04","arxiv_id":"2203.02230","repositories_listed":0,"syntology":null},{"url":null,"slug":"bilateral-deep-reinforcement-learning","title":"Bilateral Deep Reinforcement Learning Approach for Better-than-human Car Following Model","date":"2022-03-03","arxiv_id":"2203.04749","repositories_listed":0,"syntology":null},{"url":null,"slug":"modality-adaptive-mixup-and-invariant","title":"Modality-Adaptive Mixup and Invariant Decomposition for RGB-Infrared Person Re-Identification","date":"2022-03-03","arxiv_id":"2203.01735","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-and-adaptation-based-on-consistency","title":"Imitation and Adaptation Based on Consistency: A Quadruped Robot Imitates Animals from Videos Using Deep Reinforcement Learning","date":"2022-03-02","arxiv_id":"2203.05973","repositories_listed":0,"syntology":null},{"url":null,"slug":"keeping-minimal-experience-to-achieve","title":"Keeping Minimal Experience to Achieve Efficient Interpretable Policy Distillation","date":"2022-03-02","arxiv_id":"2203.00822","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximating-a-deep-reinforcement-learning","title":"Approximating a deep reinforcement learning docking agent using linear model trees","date":"2022-03-01","arxiv_id":"2203.00369","repositories_listed":0,"syntology":null},{"url":null,"slug":"explaining-a-deep-reinforcement-learning","title":"Explaining a Deep Reinforcement Learning Docking Agent Using Linear Model Trees with User Adapted Visualization","date":"2022-03-01","arxiv_id":"2203.00368","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-multi-agent-drl-based-framework","title":"Hierarchical Multi-Agent DRL-Based Framework for Joint Multi-RAT Assignment and Dynamic Resource Allocation in Next-Generation HetNets","date":"2022-02-28","arxiv_id":"2202.13652","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-knowledge-based-automated-analog","title":"Domain Knowledge-Based Automated Analog Circuit Design with Deep Reinforcement Learning","date":"2022-02-26","arxiv_id":"2202.13185","repositories_listed":0,"syntology":null},{"url":null,"slug":"consolidated-adaptive-t-soft-update-for-deep","title":"Consolidated Adaptive T-soft Update for Deep Reinforcement Learning","date":"2022-02-25","arxiv_id":"2202.12504","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-joint-1","title":"Deep Reinforcement Learning-Based Joint Satellite Scheduling and Resource Allocation in Satellite-Terrestrial Integrated Networks","date":"2022-02-24","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"behaviour-diverse-automatic-penetration","title":"Behaviour-Diverse Automatic Penetration Testing: A Curiosity-Driven Multi-Objective Deep Reinforcement Learning Approach","date":"2022-02-22","arxiv_id":"2202.10630","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-fidelity-reinforcement-learning","title":"Multi-fidelity reinforcement learning framework for shape optimization","date":"2022-02-22","arxiv_id":"2202.11170","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-warehouse-robot-using-deep-q","title":"Autonomous Warehouse Robot using Deep Q-Learning","date":"2022-02-21","arxiv_id":"2202.10019","repositories_listed":0,"syntology":null},{"url":null,"slug":"ccpt-automatic-gameplay-testing-and","title":"CCPT: Automatic Gameplay Testing and Validation with Curiosity-Conditioned Proximal Trajectories","date":"2022-02-21","arxiv_id":"2202.10057","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-a-smart-resource-allocation-policy-via","title":"Toward a Smart Resource Allocation Policy via Artificial Intelligence in 6G Networks: Centralized or Decentralized?","date":"2022-02-18","arxiv_id":"2202.09093","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-deep-reinforcement-learning-based","title":"A Survey on Deep Reinforcement Learning-based Approaches for Adaptation and Generalization","date":"2022-02-17","arxiv_id":"2202.08444","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-augmented-reinforcement-learning-1","title":"Retrieval-Augmented Reinforcement Learning","date":"2022-02-17","arxiv_id":"2202.08417","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-via-genetic","title":"Robust Reinforcement Learning via Genetic Curriculum","date":"2022-02-17","arxiv_id":"2202.08393","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-multi","title":"Deep Reinforcement Learning Based Multi-Access Edge Computing Schedule for Internet of Vehicle","date":"2022-02-15","arxiv_id":"2202.08972","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-drone-swarm-navigation-and-multi","title":"Autonomous Drone Swarm Navigation and Multi-target Tracking in 3D Environments with Dynamic Obstacles","date":"2022-02-13","arxiv_id":"2202.06253","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-and-convex-mean","title":"Deep Reinforcement Learning and Convex Mean-Variance Optimisation for Portfolio Management","date":"2022-02-13","arxiv_id":"2203.11318","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-privacy-utility-trade-off-against","title":"Active Privacy-Utility Trade-off Against Inference in Time-Series Data Sharing","date":"2022-02-11","arxiv_id":"2202.05833","repositories_listed":0,"syntology":null},{"url":null,"slug":"abstraction-for-deep-reinforcement-learning","title":"Abstraction for Deep Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.05839","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-based-robust-resource-allocation-in-end-to","title":"AI-based Robust Resource Allocation in End-to-End Network Slicing under Demand and CSI Uncertainties","date":"2022-02-10","arxiv_id":"2202.05131","repositories_listed":0,"syntology":null},{"url":null,"slug":"development-and-validation-of-an-ai-driven","title":"Development and Validation of an AI-Driven Model for the La Rance Tidal Barrage: A Generalisable Case Study","date":"2022-02-10","arxiv_id":"2202.05347","repositories_listed":0,"syntology":null},{"url":null,"slug":"scenario-assisted-deep-reinforcement-learning","title":"Scenario-Assisted Deep Reinforcement Learning","date":"2022-02-09","arxiv_id":"2202.04337","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-management-based-on-multi-agent-deep","title":"Energy Management Based on Multi-Agent Deep Reinforcement Learning for A Multi-Energy Industrial Park","date":"2022-02-08","arxiv_id":"2202.03771","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-explanations-for-reinforcement-learning","title":"Local Explanations for Reinforcement Learning","date":"2022-02-08","arxiv_id":"2202.03597","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-deep-and-reinforcement-learning-for","title":"Robust, Deep, and Reinforcement Learning for Management of Communication and Power Networks","date":"2022-02-08","arxiv_id":"2202.05395","repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-actor-critic-with-inhibitory-networks-1","title":"Soft Actor-Critic with Inhibitory Networks for Faster Retraining","date":"2022-02-07","arxiv_id":"2202.02918","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-aware-edge-association-for-cluster","title":"Energy-Aware Edge Association for Cluster-based Personalized Federated Learning","date":"2022-02-06","arxiv_id":"2202.02727","repositories_listed":0,"syntology":null},{"url":null,"slug":"5g-network-on-wings-a-deep-reinforcement","title":"5G Network on Wings: A Deep Reinforcement Learning Approach to the UAV-based Integrated Access and Backhaul","date":"2022-02-04","arxiv_id":"2202.02006","repositories_listed":0,"syntology":null}],"record_sha256":"e46fe116527b49b72a1abe3e16ef40aabc7cbb41a4cc8341a38abf89054cb7a9","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}