{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/22","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":22,"pages_in_order":59,"rows_per_page":100,"rows":[2101,2200],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/21","next":"/task/deep-reinforcement-learning/papers/23","papers":[{"url":null,"slug":"hierarchical-multi-agent-drl-based-dynamic","title":"Hierarchical Multi-Agent DRL Based Dynamic Cluster Reconfiguration for UAV Mobility Management","date":"2024-12-05","arxiv_id":"2412.16167","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrated-sensing-and-communications-for-low","title":"Integrated Sensing and Communications for Low-Altitude Economy: A Deep Reinforcement Learning Approach","date":"2024-12-05","arxiv_id":"2412.04074","repositories_listed":0,"syntology":null},{"url":null,"slug":"less-is-more-a-stealthy-and-efficient","title":"Less is More: A Stealthy and Efficient Adversarial Attack Method for DRL-based Autonomous Driving Policies","date":"2024-12-04","arxiv_id":"2412.03051","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-deep-reinforcement-learning-to-enhance","title":"Using Deep Reinforcement Learning to Enhance Channel Sampling Patterns in Integrated Sensing and Communication","date":"2024-12-04","arxiv_id":"2412.03157","repositories_listed":0,"syntology":null},{"url":null,"slug":"gnn-based-auto-encoder-for-short-linear-block","title":"GNN-based Auto-Encoder for Short Linear Block Codes: A DRL Approach","date":"2024-12-03","arxiv_id":"2412.02053","repositories_listed":0,"syntology":null},{"url":null,"slug":"robofail-analyzing-failures-in-robot-learning","title":"From Mystery to Mastery: Failure Diagnosis for Improving Manipulation Policies","date":"2024-12-03","arxiv_id":"2412.02818","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-memory-based-reinforcement-learning","title":"A Memory-Based Reinforcement Learning Approach to Integrated Sensing and Communication","date":"2024-12-02","arxiv_id":"2412.01077","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-for-19","title":"Multi-Agent Deep Reinforcement Learning for Distributed and Autonomous Platoon Coordination via Speed-regulation over Large-scale Transportation Networks","date":"2024-12-02","arxiv_id":"2412.01075","repositories_listed":0,"syntology":null},{"url":null,"slug":"combinatorial-rising-bandit","title":"Combinatorial Rising Bandit","date":"2024-12-01","arxiv_id":"2412.00798","repositories_listed":0,"syntology":null},{"url":null,"slug":"core-placement-optimization-of-many-core","title":"Core Placement Optimization of Many-core Brain-Inspired Near-Storage Systems for Spiking Neural Network Training","date":"2024-11-29","arxiv_id":"2411.19430","repositories_listed":0,"syntology":null},{"url":null,"slug":"sango-socially-aware-navigation-through","title":"SANGO: Socially Aware Navigation through Grouped Obstacles","date":"2024-11-29","arxiv_id":"2411.19497","repositories_listed":0,"syntology":null},{"url":null,"slug":"comprehensive-survey-of-reinforcement","title":"A Comprehensive Survey of Reinforcement Learning: From Algorithms to Practical Challenges","date":"2024-11-28","arxiv_id":"2411.18892","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-soft-actor-critic-algorithms","title":"Application of Soft Actor-Critic Algorithms in Optimizing Wastewater Treatment with Time Delays Integration","date":"2024-11-27","arxiv_id":"2411.18305","repositories_listed":0,"syntology":null},{"url":null,"slug":"jppo-joint-power-and-prompt-optimization-for","title":"JPPO: Joint Power and Prompt Optimization for Accelerated Large Language Model Services","date":"2024-11-27","arxiv_id":"2411.18010","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-timescale-digital-twin-assisted-model","title":"Two-Timescale Digital Twin Assisted Model Interference and Retraining over Wireless Network","date":"2024-11-27","arxiv_id":"2411.18329","repositories_listed":0,"syntology":null},{"url":null,"slug":"crash-challenging-reinforcement-learning","title":"CRASH: Challenging Reinforcement-Learning Based Adversarial Scenarios For Safety Hardening","date":"2024-11-26","arxiv_id":"2411.16996","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-combinatorial-node-selection-and","title":"Joint Combinatorial Node Selection and Resource Allocations in the Lightning Network using Attention-based Reinforcement Learning","date":"2024-11-26","arxiv_id":"2411.17353","repositories_listed":0,"syntology":null},{"url":null,"slug":"why-the-agent-made-that-decision-explaining","title":"Why the Agent Made that Decision: Explaining Deep Reinforcement Learning with Vision Masks","date":"2024-11-25","arxiv_id":"2411.16120","repositories_listed":0,"syntology":null},{"url":null,"slug":"broad-critic-deep-actor-reinforcement","title":"Broad Critic Deep Actor Reinforcement Learning for Continuous Control","date":"2024-11-24","arxiv_id":"2411.15806","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-a-local-trading-strategy-deep","title":"Learning a local trading strategy: deep reinforcement learning for grid-scale renewable energy integration","date":"2024-11-23","arxiv_id":"2411.15422","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-systematic-study-of-multi-agent-deep","title":"A Systematic Study of Multi-Agent Deep Reinforcement Learning for Safe and Robust Autonomous Highway Ramp Entry","date":"2024-11-21","arxiv_id":"2411.14593","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-enabled-adaptive-voltage-protection","title":"Learning-Enabled Adaptive Voltage Protection Against Load Alteration Attacks On Smart Grids","date":"2024-11-21","arxiv_id":"2411.15229","repositories_listed":0,"syntology":null},{"url":null,"slug":"movable-antenna-equipped-uav-for-data","title":"Movable Antenna-Equipped UAV for Data Collection in Backscatter Sensor Networks: A Deep Reinforcement Learning-based Approach","date":"2024-11-21","arxiv_id":"2411.13970","repositories_listed":0,"syntology":null},{"url":null,"slug":"height-heterogeneous-interaction-graph","title":"HEIGHT: Heterogeneous Interaction Graph Transformer for Robot Navigation in Crowded and Constrained Environments","date":"2024-11-19","arxiv_id":"2411.12150","repositories_listed":0,"syntology":null},{"url":null,"slug":"skilltree-explainable-skill-based-deep","title":"SkillTree: Explainable Skill-Based Deep Reinforcement Learning for Long-Horizon Control Tasks","date":"2024-11-19","arxiv_id":"2411.12173","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-symbolic-learning-with-logical","title":"Reinforced Symbolic Learning with Logical Constraints for Predicting Turbine Blade Fatigue Life","date":"2024-11-18","arxiv_id":"2412.03580","repositories_listed":0,"syntology":null},{"url":null,"slug":"signaling-and-social-learning-in-swarms-of","title":"Signaling and Social Learning in Swarms of Robots","date":"2024-11-18","arxiv_id":"2411.11616","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamics-of-resource-allocation-in-o-rans-an","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","date":"2024-11-17","arxiv_id":"2412.01839","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcing-competitive-multi-agents-for","title":"Reinforcing Competitive Multi-Agents for Playing So Long Sucker","date":"2024-11-17","arxiv_id":"2411.11057","repositories_listed":0,"syntology":null},{"url":null,"slug":"wireless-resource-allocation-with","title":"Wireless Resource Allocation with Collaborative Distributed and Centralized DRL under Control Channel Attacks","date":"2024-11-16","arxiv_id":"2411.10702","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-parameter-degeneracy-using-joint","title":"Mitigating Parameter Degeneracy using Joint Conditional Diffusion Model for WECC Composite Load Model in Power Systems","date":"2024-11-15","arxiv_id":"2411.10431","repositories_listed":0,"syntology":null},{"url":null,"slug":"edge-caching-optimization-with-ppo-and","title":"Edge Caching Optimization with PPO and Transfer Learning for Dynamic Environments","date":"2024-11-14","arxiv_id":"2411.09812","repositories_listed":0,"syntology":null},{"url":null,"slug":"fair-resource-allocation-in-weakly-coupled","title":"Fair Resource Allocation in Weakly Coupled Markov Decision Processes","date":"2024-11-14","arxiv_id":"2411.09804","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-practical-deep-schedulers-for","title":"Towards Practical Deep Schedulers for Allocating Cellular Radio Resources","date":"2024-11-13","arxiv_id":"2411.08529","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-secure-intelligent-o-ran-architecture","title":"Towards Secure Intelligent O-RAN Architecture: Vulnerabilities, Threats and Promising Technical Solutions using LLMs","date":"2024-11-13","arxiv_id":"2411.08640","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-traffic-signal-control-using-high","title":"Optimizing Traffic Signal Control using High-Dimensional State Representation and Efficient Deep Reinforcement Learning","date":"2024-11-12","arxiv_id":"2411.07759","repositories_listed":0,"syntology":null},{"url":null,"slug":"test-where-decisions-matter-importance-driven","title":"Test Where Decisions Matter: Importance-driven Testing for Deep Reinforcement Learning","date":"2024-11-12","arxiv_id":"2411.07700","repositories_listed":0,"syntology":null},{"url":null,"slug":"gsl-pcd-improving-generalist-specialist","title":"GSL-PCD: Improving Generalist-Specialist Learning with Point Cloud Feature-based Task Partitioning","date":"2024-11-11","arxiv_id":"2411.06733","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-age-state-belief-is-all-you-need","title":"Joint Age-State Belief is All You Need: Minimizing AoII via Pull-Based Remote Estimation","date":"2024-11-11","arxiv_id":"2411.07179","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-partition-and-resource-allocation-for","title":"Model Partition and Resource Allocation for Split Learning in Vehicular Edge Networks","date":"2024-11-11","arxiv_id":"2411.06773","repositories_listed":0,"syntology":null},{"url":null,"slug":"ocmdp-observation-constrained-markov-decision","title":"OCMDP: Observation-Constrained Markov Decision Process","date":"2024-11-11","arxiv_id":"2411.07087","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-monitoring-and-analysis-of-track","title":"Real-time Monitoring and Analysis of Track and Field Athletes Based on Edge Computing and Deep Reinforcement Learning Algorithm","date":"2024-11-11","arxiv_id":"2411.06720","repositories_listed":0,"syntology":null},{"url":null,"slug":"to-train-or-not-to-train-balancing-efficiency","title":"To Train or Not to Train: Balancing Efficiency and Training Cost in Deep Reinforcement Learning for Mobile Edge Computing","date":"2024-11-11","arxiv_id":"2411.07086","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-hop-upstream-preemptive-traffic-signal","title":"Multi-hop Upstream Anticipatory Traffic Signal Control with Deep Reinforcement Learning","date":"2024-11-10","arxiv_id":"2411.07271","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-digital-twin","title":"Deep Reinforcement Learning for Digital Twin-Oriented Complex Networked Systems","date":"2024-11-09","arxiv_id":"2411.06148","repositories_listed":0,"syntology":null},{"url":null,"slug":"acceleration-for-deep-reinforcement-learning","title":"Acceleration for Deep Reinforcement Learning using Parallel and Distributed Computing: A Survey","date":"2024-11-08","arxiv_id":"2411.05614","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-distributed-common-operational","title":"Data-Driven Distributed Common Operational Picture from Heterogeneous Platforms using Multi-Agent Reinforcement Learning","date":"2024-11-08","arxiv_id":"2411.05683","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-active-flow-control-strategies","title":"Towards Active Flow Control Strategies Through Deep Reinforcement Learning","date":"2024-11-08","arxiv_id":"2411.05536","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-robustness-of-reinforcement","title":"Evaluating Robustness of Reinforcement Learning Algorithms for Autonomous Shipping","date":"2024-11-07","arxiv_id":"2411.04915","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximizing-user-connectivity-in-ai-enabled","title":"Maximizing User Connectivity in AI-Enabled Multi-UAV Networks: A Distributed Strategy Generalized to Arbitrary User Distributions","date":"2024-11-07","arxiv_id":"2411.05205","repositories_listed":0,"syntology":null},{"url":null,"slug":"plasticity-loss-in-deep-reinforcement","title":"Plasticity Loss in Deep Reinforcement Learning: A Survey","date":"2024-11-07","arxiv_id":"2411.04832","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-hidden-monotone-variational","title":"Solving Hidden Monotone Variational Inequalities with Surrogate Losses","date":"2024-11-07","arxiv_id":"2411.05228","repositories_listed":0,"syntology":null},{"url":null,"slug":"uevavd-a-dataset-for-developing-uav-s-eye","title":"UEVAVD: A Dataset for Developing UAV's Eye View Active Object Detection","date":"2024-11-07","arxiv_id":"2411.04348","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-study-of-deep-reinforcement-2","title":"A Comparative Study of Deep Reinforcement Learning for Crop Production Management","date":"2024-11-06","arxiv_id":"2411.04106","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-task-generalisation-with-multi","title":"Accelerating Task Generalisation with Multi-Level Skill Hierarchies","date":"2024-11-05","arxiv_id":"2411.02998","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-decision-making-for-uav","title":"Autonomous Decision Making for UAV Cooperative Pursuit-Evasion Game with Reinforcement Learning","date":"2024-11-05","arxiv_id":"2411.02983","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-weight-adjusting-deep-q-networks-for","title":"Dynamic Weight Adjusting Deep Q-Networks for Real-Time Environmental Adaptation","date":"2024-11-04","arxiv_id":"2411.02559","repositories_listed":0,"syntology":null},{"url":null,"slug":"irs-enhanced-secure-semantic-communication","title":"IRS-Enhanced Secure Semantic Communication Networks: Cross-Layer and Context-Awared Resource Allocation","date":"2024-11-04","arxiv_id":"2411.01821","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-optimizing-1","title":"Deep Reinforcement Learning for Optimizing Inverter Control: Fixed and Adaptive Gain Tuning Strategies for Power System Stability","date":"2024-11-03","arxiv_id":"2411.01451","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-timescale-model-caching-and-resource","title":"Two-Timescale Model Caching and Resource Allocation for Edge-Enabled AI-Generated Content Services","date":"2024-11-03","arxiv_id":"2411.01458","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-trajectory-1","title":"Deep Reinforcement Learning for Trajectory and Phase Shift Optimization of Aerial RIS in CoMP-NOMA Networks","date":"2024-11-02","arxiv_id":"2411.01338","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-adaptive-mixed-criticality","title":"Enhancing Adaptive Mixed-Criticality Scheduling with Deep Reinforcement Learning","date":"2024-11-01","arxiv_id":"2411.00572","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-imitation-learning-based-optimal-energy","title":"Safe Imitation Learning-based Optimal Energy Storage Systems Dispatch in Distribution Networks","date":"2024-11-01","arxiv_id":"2411.00995","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptiveisp-learning-an-adaptive-image-signal","title":"AdaptiveISP: Learning an Adaptive Image Signal Processor for Object Detection","date":"2024-10-30","arxiv_id":"2410.22939","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-programming-via-large-language","title":"Automatic programming via large language models with population self-evolution for dynamic job shop scheduling problem","date":"2024-10-30","arxiv_id":"2410.22657","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-hype-to-reality-the-road-ahead-of","title":"From Hype to Reality: The Road Ahead of Deploying DRL in 6G Networks","date":"2024-10-30","arxiv_id":"2410.23086","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-governance-in-networked-systems-via","title":"Resource Governance in Networked Systems via Integrated Variational Autoencoders and Reinforcement Learning","date":"2024-10-30","arxiv_id":"2410.23393","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-driving-car-racing-application-of-deep","title":"Self-Driving Car Racing: Application of Deep Reinforcement Learning","date":"2024-10-30","arxiv_id":"2410.22766","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-deep-reinforcement-learning-with-a","title":"Combining Deep Reinforcement Learning with a Jerk-Bounded Trajectory Generator for Kinematically Constrained Motion Planning","date":"2024-10-28","arxiv_id":"2410.20907","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-agent-deep-reinforcement-learning-for-1","title":"Dual-Agent Deep Reinforcement Learning for Dynamic Pricing and Replenishment","date":"2024-10-28","arxiv_id":"2410.21109","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-reinforcement-learning-based-two","title":"Quantum Reinforcement Learning-Based Two-Stage Unit Commitment Framework for Enhanced Power Systems Robustness","date":"2024-10-28","arxiv_id":"2410.21240","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-downlink","title":"Reinforcement Learning-Based Downlink Transmit Precoding for Mitigating the Impact of Delayed CSI in Satellite Systems","date":"2024-10-28","arxiv_id":"2410.21489","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-to-video-generative-adversarial-network","title":"Video to Video Generative Adversarial Network for Few-shot Learning Based on Policy Gradient","date":"2024-10-28","arxiv_id":"2410.20657","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-diversity-based-experience-replay","title":"Efficient Diversity-based Experience Replay for Deep Reinforcement Learning","date":"2024-10-27","arxiv_id":"2410.20487","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-environment-design-via-regret","title":"Adversarial Environment Design via Regret-Guided Diffusion Models","date":"2024-10-25","arxiv_id":"2410.19715","repositories_listed":0,"syntology":null},{"url":null,"slug":"metatrading-an-immersion-aware-model-trading","title":"MetaTrading: An Immersion-Aware Model Trading Framework for Vehicular Metaverse Services","date":"2024-10-25","arxiv_id":"2410.19665","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-dispersal-of-ecological-species","title":"Evolutionary Dispersal of Ecological Species via Multi-Agent Deep Reinforcement Learning","date":"2024-10-24","arxiv_id":"2410.18621","repositories_listed":0,"syntology":null},{"url":null,"slug":"implementing-deep-reinforcement-learning","title":"Implementing Deep Reinforcement Learning-Based Grid Voltage Control in Real-World Power Systems: Challenges and Insights","date":"2024-10-24","arxiv_id":"2410.19880","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-spectrum-access-for-ambient","title":"Dynamic Spectrum Access for Ambient Backscatter Communication-assisted D2D Systems with Quantum Reinforcement Learning","date":"2024-10-23","arxiv_id":"2410.17971","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-information-bottleneck-for-deep","title":"Multimodal Information Bottleneck for Deep Reinforcement Learning with Multiple Sensors","date":"2024-10-23","arxiv_id":"2410.17551","repositories_listed":0,"syntology":null},{"url":null,"slug":"corrected-soft-actor-critic-for-continuous","title":"Corrected Soft Actor Critic for Continuous Control","date":"2024-10-22","arxiv_id":"2410.16739","repositories_listed":0,"syntology":null},{"url":null,"slug":"invisible-manipulation-deep-reinforcement","title":"Invisible Manipulation Deep Reinforcement Learning Enhanced Stealthy Attacks on Battery Energy Management Systems","date":"2024-10-22","arxiv_id":"2410.17402","repositories_listed":0,"syntology":null},{"url":null,"slug":"llm-assisted-red-teaming-of-diffusion-models","title":"LLM-Assisted Red Teaming of Diffusion Models through \"Failures Are Fated, But Can Be Faded\"","date":"2024-10-22","arxiv_id":"2410.16738","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-load-balancing-in-software-defined","title":"Safe Load Balancing in Software-Defined-Networking","date":"2024-10-22","arxiv_id":"2410.16846","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-distance-geomagnetic-navigation-in-gnss","title":"Long-distance Geomagnetic Navigation in GNSS-denied Environments with Deep Reinforcement Learning","date":"2024-10-21","arxiv_id":"2410.15837","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-for-job-shop","title":"Offline reinforcement learning for job-shop scheduling problems","date":"2024-10-21","arxiv_id":"2410.15714","repositories_listed":0,"syntology":null},{"url":null,"slug":"patrol-security-game-defending-against","title":"Patrol Security Game: Defending Against Adversary with Freedom in Attack Timing, Location, and Duration","date":"2024-10-21","arxiv_id":"2410.15600","repositories_listed":0,"syntology":null},{"url":null,"slug":"rgmdt-return-gap-minimizing-decision-tree","title":"RGMDT: Return-Gap-Minimizing Decision Tree Extraction in Non-Euclidean Metric Space","date":"2024-10-21","arxiv_id":"2410.16517","repositories_listed":0,"syntology":null},{"url":null,"slug":"assemblycomplete-3d-combinatorial","title":"AssemblyComplete: 3D Combinatorial Construction with Deep Reinforcement Learning","date":"2024-10-20","arxiv_id":"2410.15469","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforced-trader-hrt-a-bi-level","title":"Hierarchical Reinforced Trader (HRT): A Bi-Level Approach for Optimizing Stock Selection and Execution","date":"2024-10-19","arxiv_id":"2410.14927","repositories_listed":0,"syntology":null},{"url":null,"slug":"mentor-mixture-of-experts-network-with-task","title":"MENTOR: Mixture-of-Experts Network with Task-Oriented Perturbation for Visual Reinforcement Learning","date":"2024-10-19","arxiv_id":"2410.14972","repositories_listed":0,"syntology":null},{"url":null,"slug":"drl-optimization-trajectory-generation-via","title":"DRL Optimization Trajectory Generation via Wireless Network Intent-Guided Diffusion Models for Optimizing Resource Allocation","date":"2024-10-18","arxiv_id":"2410.14481","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-end-to-end-neurosymbolic","title":"Interpretable end-to-end Neurosymbolic Reinforcement Learning agents","date":"2024-10-18","arxiv_id":"2410.14371","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-non-markov-market","title":"Reinforcement Learning in Non-Markov Market-Making","date":"2024-10-18","arxiv_id":"2410.14504","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-inception-for-bounded-backdoor","title":"Adversarial Inception Backdoor Attacks against Reinforcement Learning","date":"2024-10-17","arxiv_id":"2410.13995","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-guided-coevolution-improved-team","title":"Transformer Guided Coevolution: Improved Team Selection in Multiagent Adversarial Team Games","date":"2024-10-17","arxiv_id":"2410.13769","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hierarchical-drl-approach-for-resource","title":"A Hierarchical DRL Approach for Resource Optimization in Multi-RIS Multi-Operator Networks","date":"2024-10-16","arxiv_id":"2410.12320","repositories_listed":0,"syntology":null},{"url":null,"slug":"aoi-aware-resource-allocation-for-smart-multi","title":"AoI-Aware Resource Allocation for Smart Multi-QoS Provisioning","date":"2024-10-16","arxiv_id":"2410.12384","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-learning-rate-for-deep-reinforcement","title":"Dynamic Learning Rate for Deep Reinforcement Learning: A Bandit Approach","date":"2024-10-16","arxiv_id":"2410.12598","repositories_listed":0,"syntology":null},{"url":null,"slug":"spectrum-sharing-using-deep-reinforcement","title":"Spectrum Sharing using Deep Reinforcement Learning in Vehicular Networks","date":"2024-10-16","arxiv_id":"2410.12521","repositories_listed":0,"syntology":null}],"record_sha256":"97a5960f69c1a2a68c07dce0f0650fa2e67ce090f7ed1fdb03910596aa64d78f","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}