{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/23","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":23,"pages_in_order":59,"rows_per_page":100,"rows":[2201,2300],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/22","next":"/task/deep-reinforcement-learning/papers/24","papers":[{"url":null,"slug":"advanced-persistent-threats-apt-attribution","title":"Advanced Persistent Threats (APT) Attribution Using Deep Reinforcement Learning","date":"2024-10-15","arxiv_id":"2410.11463","repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-control-codesign-for-large","title":"Communication-Control Codesign for Large-Scale Wireless Networked Control Systems","date":"2024-10-15","arxiv_id":"2410.11316","repositories_listed":0,"syntology":null},{"url":null,"slug":"physical-informed-inspired-deep-reinforcement","title":"Physical Informed-Inspired Deep Reinforcement Learning Based Bi-Level Programming for Microgrid Scheduling","date":"2024-10-15","arxiv_id":"2410.11932","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-the-dynamic-volatility-fitting","title":"Solving The Dynamic Volatility Fitting Problem: A Deep Reinforcement Learning Approach","date":"2024-10-15","arxiv_id":"2410.11789","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-shielding-and-reinforcement","title":"Compositional Shielding and Reinforcement Learning for Multi-Agent Systems","date":"2024-10-14","arxiv_id":"2410.10460","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-deep-reinforcement-learning-to","title":"Continual Deep Reinforcement Learning to Prevent Catastrophic Forgetting in Jamming Mitigation","date":"2024-10-14","arxiv_id":"2410.10521","repositories_listed":0,"syntology":null},{"url":null,"slug":"dr-mpc-deep-residual-model-predictive-control","title":"DR-MPC: Deep Residual Model Predictive Control for Real-world Social Navigation","date":"2024-10-14","arxiv_id":"2410.10646","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-robustness-in-deep-reinforcement","title":"Enhancing Robustness in Deep Reinforcement Learning: A Lyapunov Exponent Approach","date":"2024-10-14","arxiv_id":"2410.10674","repositories_listed":0,"syntology":null},{"url":null,"slug":"mad-td-model-augmented-data-stabilizes-high","title":"MAD-TD: Model-Augmented Data stabilizes High Update Ratio RL","date":"2024-10-11","arxiv_id":"2410.08896","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-actor-critics-in-autonomous-cyber","title":"Multi-Agent Actor-Critics in Autonomous Cyber Defense","date":"2024-10-11","arxiv_id":"2410.09134","repositories_listed":0,"syntology":null},{"url":null,"slug":"masked-generative-priors-improve-world-models","title":"Masked Generative Priors Improve World Models Sequence Modelling Capabilities","date":"2024-10-10","arxiv_id":"2410.07836","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuroplastic-expansion-in-deep-reinforcement","title":"Neuroplastic Expansion in Deep Reinforcement Learning","date":"2024-10-10","arxiv_id":"2410.07994","repositories_listed":0,"syntology":null},{"url":null,"slug":"parallel-digital-twin-driven-deep","title":"Large Vision Model-Enhanced Digital Twin with Deep Reinforcement Learning for User Association and Load Balancing in Dynamic Wireless Networks","date":"2024-10-10","arxiv_id":"2410.07611","repositories_listed":0,"syntology":null},{"url":null,"slug":"variations-in-multi-agent-actor-critic","title":"Variations in Multi-Agent Actor-Critic Frameworks for Joint Optimizations in UAV Swarm Networks: Recent Evolution, Challenges, and Directions","date":"2024-10-09","arxiv_id":"2410.06627","repositories_listed":0,"syntology":null},{"url":null,"slug":"aaai-workshop-on-ai-planning-for-cyber","title":"AAAI Workshop on AI Planning for Cyber-Physical Systems -- CAIPI24","date":"2024-10-08","arxiv_id":"2410.07245","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-based-shielding-for-safe-autonomy","title":"Learning-Based Shielding for Safe Autonomy under Unknown Dynamics","date":"2024-10-07","arxiv_id":"2410.07359","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-interactive-agent-in-large-fps-game","title":"Training Interactive Agent in Large FPS Game Map with Rule-enhanced Reinforcement Learning","date":"2024-10-07","arxiv_id":"2410.04936","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-debugging-deep-reinforcement-learning","title":"Toward Debugging Deep Reinforcement Learning Programs with RLExplorer","date":"2024-10-06","arxiv_id":"2410.04322","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-action-priors-from-a-single-gait-cycle","title":"Latent Action Priors for Locomotion with Deep Reinforcement Learning","date":"2024-10-04","arxiv_id":"2410.03246","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-channel-selection-using-feddrl-in-v2x","title":"Joint Channel Selection using FedDRL in V2X","date":"2024-10-03","arxiv_id":"2410.20687","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-event-streams-with-deep","title":"Leveraging Event Streams with Deep Reinforcement Learning for End-to-End UAV Tracking","date":"2024-10-03","arxiv_id":"2410.14685","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-guided-rl-for-interpretable-feature","title":"Semantic-Guided RL for Interpretable Feature Engineering","date":"2024-10-03","arxiv_id":"2410.02519","repositories_listed":0,"syntology":null},{"url":null,"slug":"finding-path-and-cycle-counting-formulae-in","title":"Finding path and cycle counting formulae in graphs with Deep Reinforcement Learning","date":"2024-10-02","arxiv_id":"2410.01661","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-diffusion-based-contract-design","title":"Generative Diffusion-based Contract Design for Efficient AI Twins Migration in Vehicular Embodied AI Networks","date":"2024-10-02","arxiv_id":"2410.01176","repositories_listed":0,"syntology":null},{"url":null,"slug":"life-uh-finds-a-way-systematic-neural-search","title":"Life, uh, Finds a Way: Systematic Neural Search","date":"2024-10-02","arxiv_id":"2410.01349","repositories_listed":0,"syntology":null},{"url":null,"slug":"realizable-continuous-space-shields-for-safe","title":"Realizable Continuous-Space Shields for Safe Reinforcement Learning","date":"2024-10-02","arxiv_id":"2410.02038","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-transformer-based-deep-reinforcement","title":"A transformer-based deep reinforcement learning approach to spatial navigation in a partially observable Morris Water Maze","date":"2024-10-01","arxiv_id":"2410.12820","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-abstraction-for-reinforcement","title":"Contrastive Abstraction for Reinforcement Learning","date":"2024-10-01","arxiv_id":"2410.00704","repositories_listed":0,"syntology":null},{"url":null,"slug":"iov-oriented-integrated-sensing-computation","title":"IoV-Oriented Integrated Sensing, Computation, and Communication: System Design and Resource Allocation","date":"2024-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-data-transport-mechanism-for-uav","title":"Adaptive Data Transport Mechanism for UAV Surveillance Missions in Lossy Environments","date":"2024-09-30","arxiv_id":"2410.10843","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-approach-for","title":"Meta Reinforcement Learning Approach for Adaptive Resource Optimization in O-RAN","date":"2024-09-30","arxiv_id":"2410.03737","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalisation-via-dynamic-policy-fusion","title":"Personalisation via Dynamic Policy Fusion","date":"2024-09-30","arxiv_id":"2409.20016","repositories_listed":0,"syntology":null},{"url":null,"slug":"methods-for-mitigating-uncertainty-in-real","title":"Methods for Mitigating Uncertainty in Real-Time Operations of a Connected Microgrid","date":"2024-09-29","arxiv_id":"2409.19568","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-efficient-computation-with-dvfs-using","title":"Energy-Efficient Computation with DVFS using Deep Reinforcement Learning for Multi-Task Systems in Edge Computing","date":"2024-09-28","arxiv_id":"2409.19434","repositories_listed":0,"syntology":null},{"url":null,"slug":"refutation-of-spectral-graph-theory-1","title":"Refutation of Spectral Graph Theory Conjectures with Search Algorithms)","date":"2024-09-27","arxiv_id":"2409.18626","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-deep-reinforcement-learning-for-volt","title":"Robust Deep Reinforcement Learning for Volt-VAR Optimization in Active Distribution System under Uncertainty","date":"2024-09-27","arxiv_id":"2409.18937","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-end-to-end-autonomous-driving","title":"Hierarchical End-to-End Autonomous Driving: Integrating BEV Perception with Deep Reinforcement Learning","date":"2024-09-26","arxiv_id":"2409.17659","repositories_listed":0,"syntology":null},{"url":null,"slug":"navigation-in-a-simplified-urban-flow-through","title":"Navigation in a simplified Urban Flow through Deep Reinforcement Learning","date":"2024-09-26","arxiv_id":"2409.17922","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-for-deep-reinforcement-learning","title":"A Survey for Deep Reinforcement Learning Based Network Intrusion Detection","date":"2024-09-25","arxiv_id":"2410.07612","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-driven-risk-aware-scheduling-for-active","title":"AI-Driven Risk-Aware Scheduling for Active Debris Removal Missions","date":"2024-09-25","arxiv_id":"2409.17012","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-fractional-multi-agent-deep","title":"Asynchronous Fractional Multi-Agent Deep Reinforcement Learning for Age-Minimal Mobile Edge Computing","date":"2024-09-25","arxiv_id":"2409.16832","repositories_listed":0,"syntology":null},{"url":"/paper/exploring-semantic-clustering-in-deep","slug":"exploring-semantic-clustering-in-deep","title":"Exploring Semantic Clustering in Deep Reinforcement Learning for Video Games","date":"2024-09-25","arxiv_id":"2409.17411","repositories_listed":0,"syntology":{"n":17,"n_ran":9,"n_constructed":6,"n_ran_checked":7,"n_instrument":2,"n_unverified":8,"n_honours":0,"n_violates":1,"n_no_contract":6,"n_pointer_only":0,"phrase":"9 ran (of which 6 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 1 violated, 6 with no contract checked; 2 where Syntology's instrument failed) · 8 unverified","sample_list":"/paper/exploring-semantic-clustering-in-deep#ran","syntology_url":"https://syntology.ai/paper/2409.17411","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2409.17411"}},"official":null}},{"url":null,"slug":"learning-bipedal-walking-for-humanoid-robots","title":"Learning Bipedal Walking for Humanoid Robots in Challenging Environments with Obstacle Avoidance","date":"2024-09-25","arxiv_id":"2410.08212","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-finite-space-mean","title":"Reinforcement Learning for Finite Space Mean-Field Type Games","date":"2024-09-25","arxiv_id":"2409.18152","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-space-mission-planning-a","title":"Revisiting Space Mission Planning: A Reinforcement Learning-Guided Approach for Multi-Debris Rendezvous","date":"2024-09-25","arxiv_id":"2409.16882","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-representations-in-state-space","title":"Uncertainty Representations in State-Space Layers for Deep Reinforcement Learning under Partial Observability","date":"2024-09-25","arxiv_id":"2409.16824","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-critical-review-of-safe-reinforcement","title":"A Critical Review of Safe Reinforcement Learning Techniques in Smart Grid Applications","date":"2024-09-24","arxiv_id":"2409.16256","repositories_listed":0,"syntology":null},{"url":null,"slug":"artificial-intelligence-for-secured","title":"Artificial Intelligence for Secured Information Systems in Smart Cities: Collaborative IoT Computing with Deep Reinforcement Learning and Blockchain","date":"2024-09-24","arxiv_id":"2409.16444","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-uav-pursuit-evasion-with-online","title":"Online Planning for Multi-UAV Pursuit-Evasion in Unknown Environments Using Deep Reinforcement Learning","date":"2024-09-24","arxiv_id":"2409.15866","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-coordination-and-capacity-control-for","title":"Neural Coordination and Capacity Control for Inventory Management","date":"2024-09-24","arxiv_id":"2410.02817","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-obstacle","title":"Deep Reinforcement Learning-based Obstacle Avoidance for Robot Movement in Warehouse Environments","date":"2024-09-23","arxiv_id":"2409.14972","repositories_listed":0,"syntology":null},{"url":null,"slug":"spformer-a-transformer-based-drl-decision","title":"SPformer: A Transformer Based DRL Decision Making Method for Connected Automated Vehicles","date":"2024-09-23","arxiv_id":"2409.15105","repositories_listed":0,"syntology":null},{"url":null,"slug":"uav-enabled-data-collection-for-iot-networks","title":"UAV-Enabled Data Collection for IoT Networks via Rainbow Learning","date":"2024-09-22","arxiv_id":"2409.14521","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-job-shop-scheduling-in-the","title":"Optimizing Job Shop Scheduling in the Furniture Industry: A Reinforcement Learning Approach Considering Machine Setup, Batch Variability, and Intralogistics","date":"2024-09-18","arxiv_id":"2409.11820","repositories_listed":0,"syntology":null},{"url":null,"slug":"automating-proton-pbs-treatment-planning-for","title":"Automating proton PBS treatment planning for head and neck cancers using policy gradient-based deep reinforcement learning","date":"2024-09-17","arxiv_id":"2409.11576","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-uncertainty-for-safe-social","title":"Disentangling Uncertainty for Safe Social Navigation using Deep Reinforcement Learning","date":"2024-09-16","arxiv_id":"2409.10655","repositories_listed":0,"syntology":null},{"url":null,"slug":"shire-enhancing-sample-efficiency-using-human","title":"SHIRE: Enhancing Sample Efficiency using Human Intuition in REinforcement Learning","date":"2024-09-16","arxiv_id":"2409.09990","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-tracking-a","title":"Deep reinforcement learning for tracking a moving target in jellyfish-like swimming","date":"2024-09-13","arxiv_id":"2409.08815","repositories_listed":0,"syntology":null},{"url":null,"slug":"oidm-an-observability-based-intelligent","title":"OIDM: An Observability-based Intelligent Distributed Edge Sensing Method for Industrial Cyber-Physical Systems","date":"2024-09-13","arxiv_id":"2409.08549","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-spatiotemporal-stealthy-backdoor-attack","title":"A Spatiotemporal Stealthy Backdoor Attack against Cooperative Multi-Agent Deep Reinforcement Learning","date":"2024-09-12","arxiv_id":"2409.07775","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-model-based-federated-learning-against","title":"Multi-Model based Federated Learning Against Model Poisoning Attack: A Deep Learning Based Model Selection for MEC Systems","date":"2024-09-12","arxiv_id":"2409.08237","repositories_listed":0,"syntology":null},{"url":null,"slug":"tera-spacecom-gnn-based-deep-reinforcement","title":"Tera-SpaceCom: GNN-based Deep Reinforcement Learning for Joint Resource Allocation and Task Offloading in TeraHertz Band Space Networks","date":"2024-09-12","arxiv_id":"2409.07911","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-opinion-shaping-a-deep-reinforcement","title":"Towards Opinion Shaping: A Deep Reinforcement Learning Approach in Bot-User Interactions","date":"2024-09-12","arxiv_id":"2409.11426","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-novelty-guided-action-persistence-in","title":"State-Novelty Guided Action Persistence in Deep Reinforcement Learning","date":"2024-09-09","arxiv_id":"2409.05433","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantfactor-reinforce-mining-steady-formulaic","title":"QuantFactor REINFORCE: Mining Steady Formulaic Alpha Factors with Variance-bounded REINFORCE","date":"2024-09-08","arxiv_id":"2409.05144","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-enabled-beam-alignment","title":"Reinforcement-Learning-Enabled Beam Alignment for Water-Air Direct Optical Wireless Communications","date":"2024-09-05","arxiv_id":"2409.03250","repositories_listed":0,"syntology":null},{"url":null,"slug":"simplex-enabled-safe-continual-learning","title":"Simplex-enabled Safe Continual Learning Machine","date":"2024-09-05","arxiv_id":"2409.05898","repositories_listed":0,"syntology":null},{"url":null,"slug":"decision-transformer-for-enhancing-neural","title":"Decision Transformer for Enhancing Neural Local Search on the Job Shop Scheduling Problem","date":"2024-09-04","arxiv_id":"2409.02697","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-timescale-synchronization-and-migration","title":"Two-Timescale Synchronization and Migration for Digital Twin Networks: A Multi-Agent Deep Reinforcement Learning Approach","date":"2024-09-02","arxiv_id":"2409.01092","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-multi-hop-traffic-pressure-for","title":"Generalized Multi-hop Traffic Pressure for Heterogeneous Traffic Perimeter Control","date":"2024-09-01","arxiv_id":"2409.00753","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparison-of-model-predictive-control-and","title":"Comparison of Model Predictive Control and Proximal Policy Optimization for a 1-DOF Helicopter System","date":"2024-08-28","arxiv_id":"2408.15633","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-qos-provision-in-business-centric","title":"Statistical QoS Provision in Business-Centric Networks","date":"2024-08-28","arxiv_id":"2408.15609","repositories_listed":0,"syntology":null},{"url":null,"slug":"earth-observation-satellite-scheduling-with","title":"Earth Observation Satellite Scheduling with Graph Neural Networks","date":"2024-08-27","arxiv_id":"2408.15041","repositories_listed":0,"syntology":null},{"url":null,"slug":"ma-cdmr-an-intelligent-cross-domain-multicast","title":"MA-CDMR: An Intelligent Cross-domain Multicast Routing Method based on Multiagent Deep Reinforcement Learning in Multi-domain SDWN","date":"2024-08-27","arxiv_id":"2409.05888","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-9","title":"Model-Based Reinforcement Learning for Control of Strongly-Disturbed Unsteady Aerodynamic Flows","date":"2024-08-26","arxiv_id":"2408.14685","repositories_listed":0,"syntology":null},{"url":null,"slug":"robot-navigation-with-entity-based-collision","title":"Robot Navigation with Entity-Based Collision Avoidance using Deep Reinforcement Learning","date":"2024-08-26","arxiv_id":"2408.14183","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-target-assignment-and-path","title":"Multi-Agent Target Assignment and Path Finding for Intelligent Warehouse: A Cooperative Multi-Agent Deep Reinforcement Learning Perspective","date":"2024-08-25","arxiv_id":"2408.13750","repositories_listed":0,"syntology":null},{"url":null,"slug":"synesthesia-of-machines-som-enhanced-isac","title":"Synesthesia of Machines (SoM)-Enhanced ISAC Precoding for Vehicular Networks with Double Dynamics","date":"2024-08-24","arxiv_id":"2408.13546","repositories_listed":0,"syntology":null},{"url":null,"slug":"cc-drl-a-convex-combined-deep-reinforcement","title":"cc-DRL: a Convex Combined Deep Reinforcement Learning Flight Control Design for a Morphing Quadrotor","date":"2024-08-23","arxiv_id":"2408.13054","repositories_listed":0,"syntology":null},{"url":null,"slug":"localized-observation-abstraction-using","title":"Localized Observation Abstraction Using Piecewise Linear Spatial Decay for Reinforcement Learning in Combat Simulations","date":"2024-08-23","arxiv_id":"2408.13328","repositories_listed":0,"syntology":null},{"url":null,"slug":"emotion-agent-unsupervised-deep-reinforcement","title":"Emotion-Agent: Unsupervised Deep Reinforcement Learning with Distribution-Prototype Reward for Continuous Emotional EEG Analysis","date":"2024-08-22","arxiv_id":"2408.12121","repositories_listed":0,"syntology":null},{"url":null,"slug":"measurement-based-fast-quantum-state","title":"Fast State Stabilization using Deep Reinforcement Learning for Measurement-based Quantum Feedback Control","date":"2024-08-21","arxiv_id":"2408.11328","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-part-based-representations-for","title":"Using Part-based Representations for Explainable Deep Reinforcement Learning","date":"2024-08-21","arxiv_id":"2408.11455","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-bess-and-grid-setpoints-optimization","title":"Adaptive BESS and Grid Setpoints Optimization: A Model-Free Framework for Efficient Battery Management under Dynamic Tariff Pricing","date":"2024-08-19","arxiv_id":"2408.09989","repositories_listed":0,"syntology":null},{"url":null,"slug":"demystifying-reinforcement-learning-in","title":"Demystifying Reinforcement Learning in Production Scheduling via Explainable AI","date":"2024-08-19","arxiv_id":"2408.09841","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-in-deep-reinforcement","title":"Efficient Exploration in Deep Reinforcement Learning: A Novel Bayesian Actor-Critic Algorithm","date":"2024-08-19","arxiv_id":"2408.10055","repositories_listed":0,"syntology":null},{"url":null,"slug":"gradient-reduction-convolutional-neural","title":"Gradient Reduction Convolutional Neural Network Policy for Financial Deep Reinforcement Learning","date":"2024-08-16","arxiv_id":"2408.11859","repositories_listed":0,"syntology":null},{"url":null,"slug":"d5rl-diverse-datasets-for-data-driven-deep","title":"D5RL: Diverse Datasets for Data-Driven Deep Reinforcement Learning","date":"2024-08-15","arxiv_id":"2408.08441","repositories_listed":0,"syntology":null},{"url":null,"slug":"ireca-intrinsic-reward-enhanced-context-aware","title":"BCR-DRL: Behavior- and Context-aware Reward for Deep Reinforcement Learning in Human-AI Coordination","date":"2024-08-15","arxiv_id":"2408.07877","repositories_listed":0,"syntology":null},{"url":null,"slug":"prioritizing-modalities-flexible-importance","title":"Prioritizing Modalities: Flexible Importance Scheduling in Federated Multimodal Learning","date":"2024-08-13","arxiv_id":"2408.06549","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-deep-reinforcement-learning-for","title":"Residual Deep Reinforcement Learning for Inverter-based Volt-Var Control","date":"2024-08-13","arxiv_id":"2408.06790","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-deep-reinforcement-learning-for-3","title":"Robust Deep Reinforcement Learning for Inverter-based Volt-Var Control in Partially Observable Distribution Networks","date":"2024-08-13","arxiv_id":"2408.06776","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-3","title":"Wireless MAC Protocol Synthesis and Optimization with Multi-Agent Distributed Reinforcement Learning","date":"2024-08-12","arxiv_id":"2408.05884","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepair-a-multi-agent-deep-reinforcement","title":"DeepAir: A Multi-Agent Deep Reinforcement Learning Based Scheme for an Unknown User Location Problem","date":"2024-08-11","arxiv_id":"2408.05712","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-metropolitan-carbon-emissions-with","title":"Mitigating Metropolitan Carbon Emissions with Dynamic Eco-driving at Scale","date":"2024-08-10","arxiv_id":"2408.05609","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-deep-reinforcement-4","title":"Cooperative Multi-Agent Deep Reinforcement Learning in Content Ranking Optimization","date":"2024-08-08","arxiv_id":"2408.04251","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-the-design-of","title":"Deep Reinforcement Learning for the Design of Metamaterial Mechanisms with Functional Compliance Control","date":"2024-08-08","arxiv_id":"2408.04376","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-oriented-uav-communication-design-and","title":"Goal-Oriented UAV Communication Design and Optimization for Target Tracking: A MachineLearning Approach","date":"2024-08-08","arxiv_id":"2408.04358","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowpc-knowledge-driven-programmatic","title":"KnowPC: Knowledge-Driven Programmatic Reinforcement Learning for Zero-shot Coordination","date":"2024-08-08","arxiv_id":"2408.04336","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-robotics-a","title":"Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes","date":"2024-08-07","arxiv_id":"2408.03539","repositories_listed":0,"syntology":null}],"record_sha256":"cf8731af70e101cd8cd63f8f1decb0101807f21a514d3db1aeb6c7e192c04c73","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}