{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/28","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":28,"pages_in_order":59,"rows_per_page":100,"rows":[2701,2800],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/27","next":"/task/deep-reinforcement-learning/papers/29","papers":[{"url":null,"slug":"swap-based-deep-reinforcement-learning-for","title":"Swap-based Deep Reinforcement Learning for Facility Location Problems in Networks","date":"2023-12-25","arxiv_id":"2312.15658","repositories_listed":0,"syntology":null},{"url":null,"slug":"vae-for-modified-1-hot-generative-materials","title":"VAE for Modified 1-Hot Generative Materials Modeling, A Step Towards Inverse Material Design","date":"2023-12-25","arxiv_id":"2401.06779","repositories_listed":0,"syntology":null},{"url":null,"slug":"drl-based-sidelobe-suppression-for-multi","title":"DRL-Based Sidelobe Suppression for Multi-focus Reconfigurable Intelligent Surface","date":"2023-12-24","arxiv_id":"2312.15565","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-investigation-of-belief-free-drl-and-mcts","title":"An investigation of belief-free DRL and MCTS for inspection and maintenance planning","date":"2023-12-22","arxiv_id":"2312.14824","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiagent-copilot-approach-for-shared","title":"Multiagent Copilot Approach for Shared Autonomy between Human EEG and TD3 Deep Reinforcement Learning","date":"2023-12-22","arxiv_id":"2312.14458","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-curriculum-learning-with-gradient","title":"Automatic Curriculum Learning with Gradient Reward Signals","date":"2023-12-21","arxiv_id":"2312.13565","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-placement","title":"Deep Reinforcement Learning Based Placement for Integrated Access Backhauling in UAV-Assisted Wireless Networks","date":"2023-12-21","arxiv_id":"2312.14247","repositories_listed":0,"syntology":null},{"url":null,"slug":"modular-neural-network-policies-for-learning","title":"Modular Neural Network Policies for Learning In-Flight Object Catching with a Robot Hand-Arm System","date":"2023-12-21","arxiv_id":"2312.13987","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-fairness-aware-spectrum-auction-for","title":"Dynamic Fairness-Aware Spectrum Auction for Enhanced Licensed Shared Access in 6G Networks","date":"2023-12-20","arxiv_id":"2312.12867","repositories_listed":0,"syntology":null},{"url":null,"slug":"pgn-a-perturbation-generation-network-against","title":"PGN: A perturbation generation network against deep reinforcement learning","date":"2023-12-20","arxiv_id":"2312.12904","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-network-approximation-for-pessimistic","title":"Neural Network Approximation for Pessimistic Offline Reinforcement Learning","date":"2023-12-19","arxiv_id":"2312.11863","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-search-and-coverage-using-point-cloud","title":"Active search and coverage using point-cloud reinforcement learning","date":"2023-12-18","arxiv_id":"2312.11410","repositories_listed":0,"syntology":null},{"url":null,"slug":"rapid-open-world-adaptation-by-adaptation","title":"Rapid Open-World Adaptation by Adaptation Principles Learning","date":"2023-12-18","arxiv_id":"2312.11138","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-dispatch-a-deep-reinforcement-learning","title":"Deep-Dispatch: A Deep Reinforcement Learning-Based Vehicle Dispatch Algorithm for Advanced Air Mobility","date":"2023-12-17","arxiv_id":"2312.10809","repositories_listed":0,"syntology":null},{"url":null,"slug":"fractional-deep-reinforcement-learning-for","title":"Fractional Deep Reinforcement Learning for Age-Minimal Mobile Edge Computing","date":"2023-12-16","arxiv_id":"2312.10418","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-learning-of-corridor-clearance-a","title":"Model-free Learning of Corridor Clearance: A Near-term Deployment Perspective","date":"2023-12-16","arxiv_id":"2312.10339","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-deep-learning-for-site-specific","title":"Spatial Deep Learning for Site-Specific Movement Optimization of Aerial Base Stations","date":"2023-12-16","arxiv_id":"2312.10490","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-joint-cruise","title":"Deep Reinforcement Learning for Joint Cruise Control and Intelligent Data Acquisition in UAVs-Assisted Sensor Networks","date":"2023-12-15","arxiv_id":"2312.09953","repositories_listed":0,"syntology":null},{"url":"/paper/graphrare-reinforcement-learning-enhanced","slug":"graphrare-reinforcement-learning-enhanced","title":"GraphRARE: Reinforcement Learning Enhanced Graph Neural Network with Relative Entropy","date":"2023-12-15","arxiv_id":"2312.09708","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustness-verification-of-deep-reinforcement","title":"Robustness Verification of Deep Reinforcement Learning Based Control Systems using Reward Martingales","date":"2023-12-15","arxiv_id":"2312.09695","repositories_listed":0,"syntology":null},{"url":null,"slug":"improve-robustness-of-reinforcement-learning","title":"Improve Robustness of Reinforcement Learning against Observation Perturbations via $l_\\infty$ Lipschitz Policy Networks","date":"2023-12-14","arxiv_id":"2312.08751","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-invitation-to-deep-reinforcement-learning","title":"An Invitation to Deep Reinforcement Learning","date":"2023-12-13","arxiv_id":"2312.08365","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-designing-multi-uav-aided-wireless-powered","title":"On Designing Multi-UAV aided Wireless Powered Dynamic Communication via Hierarchical Deep Reinforcement Learning","date":"2023-12-13","arxiv_id":"2312.07917","repositories_listed":0,"syntology":null},{"url":null,"slug":"secure-deep-reinforcement-learning-for","title":"Secure Deep Reinforcement Learning for Dynamic Resource Allocation in Wireless MEC Networks","date":"2023-12-13","arxiv_id":"2312.08016","repositories_listed":0,"syntology":null},{"url":null,"slug":"foss-a-self-learned-doctor-for-query","title":"FOSS: A Self-Learned Doctor for Query Optimizer","date":"2023-12-11","arxiv_id":"2312.06357","repositories_listed":0,"syntology":null},{"url":null,"slug":"mobile-edge-computing-and-ai-enabled-web3","title":"Mobile Edge Computing and AI Enabled Web3 Metaverse over 6G Wireless Communications: A Deep Reinforcement Learning Approach","date":"2023-12-11","arxiv_id":"2312.06293","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-decentralized-cooperative-platoon","title":"Scalable Decentralized Cooperative Platoon using Multi-Agent Deep Reinforcement Learning","date":"2023-12-11","arxiv_id":"2312.06858","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-based-prediction-and-planning-policy","title":"Graph-based Prediction and Planning Policy Network (GP3Net) for scalable self-driving in dynamic environments using Deep Reinforcement Learning","date":"2023-12-10","arxiv_id":"2312.05784","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-model-for-embodied-intelligence-modeling","title":"Self Model for Embodied Intelligence: Modeling Full-Body Human Musculoskeletal System and Locomotion Control with Hierarchical Low-Dimensional Representation","date":"2023-12-09","arxiv_id":"2312.05473","repositories_listed":0,"syntology":null},{"url":null,"slug":"canaries-and-whistles-resilient-drone","title":"Canaries and Whistles: Resilient Drone Communication Networks with (or without) Deep Reinforcement Learning","date":"2023-12-08","arxiv_id":"2312.04940","repositories_listed":0,"syntology":null},{"url":null,"slug":"development-and-assessment-of-autonomous","title":"Development and Assessment of Autonomous Vehicles in Both Fully Automated and Mixed Traffic Conditions","date":"2023-12-08","arxiv_id":"2312.04805","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-sample-in-cartesian-mri","title":"Learning to sample in Cartesian MRI","date":"2023-12-07","arxiv_id":"2312.04327","repositories_listed":0,"syntology":null},{"url":null,"slug":"trustfed-a-reliable-federated-learning","title":"TrustFed: A Reliable Federated Learning Framework with Malicious-Attack Resistance","date":"2023-12-06","arxiv_id":"2312.04597","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-community","title":"Deep Reinforcement Learning for Community Battery Scheduling under Uncertainties of Load, PV Generation, and Energy Prices","date":"2023-12-04","arxiv_id":"2312.03008","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-reinforcement-learning-for-4","title":"Distributed Reinforcement Learning for Molecular Design: Antioxidant case","date":"2023-12-03","arxiv_id":"2312.01267","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-temporal-credit-assignment-in","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","date":"2023-12-02","arxiv_id":"2312.01072","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-resource-allocation-for-semantic","title":"Adaptive Resource Allocation for Semantic Communication Networks","date":"2023-12-02","arxiv_id":"2312.01081","repositories_listed":0,"syntology":null},{"url":null,"slug":"anomaly-detection-via-learning-based","title":"Anomaly Detection via Learning-Based Sequential Controlled Sensing","date":"2023-11-30","arxiv_id":"2312.00088","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-deep-reinforcement-learning-2","title":"Data-efficient Deep Reinforcement Learning for Vehicle Trajectory Control","date":"2023-11-30","arxiv_id":"2311.18393","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-optimal-2","title":"Deep Reinforcement Learning Based Optimal Energy Management of Multi-energy Microgrids with Uncertainties","date":"2023-11-30","arxiv_id":"2311.18327","repositories_listed":0,"syntology":null},{"url":null,"slug":"handling-cost-and-constraints-with-off-policy","title":"Handling Cost and Constraints with Off-Policy Deep Reinforcement Learning","date":"2023-11-30","arxiv_id":"2311.18684","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-for-semantic-knowledge-base-guided","title":"Learning for Semantic Knowledge Base-Guided Online Feature Transmission in Dynamic Channels","date":"2023-11-30","arxiv_id":"2311.18316","repositories_listed":0,"syntology":null},{"url":null,"slug":"urllc-awared-resource-allocation-for","title":"URLLC-Awared Resource Allocation for Heterogeneous Vehicular Edge Computing","date":"2023-11-30","arxiv_id":"2311.18352","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-graphs-feedback","title":"Deep Reinforcement Learning Graphs: Feedback Motion Planning via Neural Lyapunov Verification","date":"2023-11-29","arxiv_id":"2311.17587","repositories_listed":0,"syntology":null},{"url":null,"slug":"langwm-language-grounded-world-model","title":"LanGWM: Language Grounded World Model","date":"2023-11-29","arxiv_id":"2311.17593","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-attack-resilient-scheduling-of","title":"Enhancing Cyber-Resilience in Integrated Energy System Scheduling with Demand Response Using Deep Reinforcement Learning","date":"2023-11-28","arxiv_id":"2311.17941","repositories_listed":0,"syntology":null},{"url":null,"slug":"agent-aware-training-for-agent-agnostic","title":"Agent-Aware Training for Agent-Agnostic Action Advising in Deep Reinforcement Learning","date":"2023-11-28","arxiv_id":"2311.16807","repositories_listed":0,"syntology":null},{"url":null,"slug":"digital-twin-enhanced-deep-reinforcement","title":"Digital Twin-Enhanced Deep Reinforcement Learning for Resource Management in Networks Slicing","date":"2023-11-28","arxiv_id":"2311.16876","repositories_listed":0,"syntology":null},{"url":null,"slug":"edge-ai-for-internet-of-energy-challenges-and","title":"Edge AI for Internet of Energy: Challenges and Perspectives","date":"2023-11-28","arxiv_id":"2311.16851","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-conditioned-offline-planning-from","title":"Goal-conditioned Offline Planning from Curious Exploration","date":"2023-11-28","arxiv_id":"2311.16996","repositories_listed":0,"syntology":null},{"url":null,"slug":"mission-driven-exploration-for-accelerated","title":"Mission-driven Exploration for Accelerated Deep Reinforcement Learning with Temporal Logic Task Specifications","date":"2023-11-28","arxiv_id":"2311.17059","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimization-theory-based-deep-reinforcement","title":"Optimization Theory Based Deep Reinforcement Learning for Resource Allocation in Ultra-Reliable Wireless Networked Control Systems","date":"2023-11-28","arxiv_id":"2311.16895","repositories_listed":0,"syntology":null},{"url":null,"slug":"2312-09436","title":"Temporal Transfer Learning for Traffic Optimization with Coarse-grained Advisory Autonomy","date":"2023-11-27","arxiv_id":"2312.09436","repositories_listed":0,"syntology":null},{"url":null,"slug":"addressing-long-horizon-tasks-by-integrating","title":"Program Machine Policy: Addressing Long-Horizon Tasks by Integrating Program Synthesis and State Machines","date":"2023-11-27","arxiv_id":"2311.15960","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-autonomous-navigation-with","title":"Interactive Autonomous Navigation with Internal State Inference and Interactivity Estimation","date":"2023-11-27","arxiv_id":"2311.16091","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-power-1","title":"Multi-Agent Reinforcement Learning for Power Control in Wireless Networks via Adaptive Graphs","date":"2023-11-27","arxiv_id":"2311.15858","repositories_listed":0,"syntology":null},{"url":null,"slug":"agent-as-cerebrum-controller-as-cerebellum","title":"Agent as Cerebrum, Controller as Cerebellum: Implementing an Embodied LMM-based Agent on Drones","date":"2023-11-25","arxiv_id":"2311.15033","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-open-world-reinforcement-learning","title":"Efficient Open-world Reinforcement Learning via Knowledge Distillation and Autonomous Rule Discovery","date":"2023-11-24","arxiv_id":"2311.14270","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-ensure-a-safe-control-strategy-towards","title":"How to ensure a safe control strategy? Towards a SRL for urban transit autonomous operation","date":"2023-11-24","arxiv_id":"2311.14457","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-explainable-strategy-templates-using","title":"Towards Explainable Strategy Templates using NLP Transformers","date":"2023-11-23","arxiv_id":"2311.14061","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-speed-voltage-control-in-active","title":"High-Speed Voltage Control in Active Distribution Systems with Smart Inverter Coordination and Deep Reinforcement Learning","date":"2023-11-22","arxiv_id":"2311.13080","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-approximate-dynamic-programming-for","title":"Neural Approximate Dynamic Programming for the Ultra-fast Order Dispatching Problem","date":"2023-11-21","arxiv_id":"2311.12975","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapter-rl-adaptation-of-any-agent-using","title":"ADAPTER-RL: Adaptation of Any Agent using Reinforcement Learning","date":"2023-11-20","arxiv_id":"2311.11537","repositories_listed":0,"syntology":null},{"url":null,"slug":"aiaas-for-oran-based-6g-networks-multi-time","title":"AIaaS for ORAN-based 6G Networks: Multi-time Scale Slice Resource Management with DRL","date":"2023-11-20","arxiv_id":"2311.11668","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-timescale-control-and-communications","title":"Multi-Timescale Control and Communications with Deep Reinforcement Learning -- Part I: Communication-Aware Vehicle Control","date":"2023-11-19","arxiv_id":"2311.11281","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-timescale-control-and-communications-1","title":"Multi-Timescale Control and Communications with Deep Reinforcement Learning -- Part II: Control-Aware Radio Resource Allocation","date":"2023-11-19","arxiv_id":"2311.11280","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-network-slicing-multi-agent-policies","title":"Robust Network Slicing: Multi-Agent Policies, Adversarial Attacks, and Defensive Strategies","date":"2023-11-19","arxiv_id":"2311.11206","repositories_listed":0,"syntology":null},{"url":null,"slug":"6g-fresnel-spot-beamfocusing-using-large","title":"6G Fresnel Spot Beamfocusing using Large-Scale Metasurfaces: A Distributed DRL-Based Approach","date":"2023-11-18","arxiv_id":"2311.11109","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-feature-extractors-for","title":"Benchmarking Feature Extractors for Reinforcement Learning-Based Semiconductor Defect Localization","date":"2023-11-18","arxiv_id":"2311.11145","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-sensing-and-communication-optimization","title":"Joint Sensing and Communication Optimization in Target-Mounted STARS-Assisted Vehicular Networks: A MADRL Approach","date":"2023-11-17","arxiv_id":"2311.10352","repositories_listed":0,"syntology":null},{"url":null,"slug":"short-vs-long-term-coordination-of-drones","title":"Short vs. Long-term Coordination of Drones: When Distributed Optimization Meets Deep Reinforcement Learning","date":"2023-11-16","arxiv_id":"2311.09852","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-mrl-based-design-solution-for-ris-assisted","title":"An MRL-Based Design Solution for RIS-Assisted MU-MIMO Wireless System under Time-Varying Channels","date":"2023-11-15","arxiv_id":"2311.08840","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-introduction-to-reinforcement-learning-for","title":"An introduction to reinforcement learning for neuroscience","date":"2023-11-13","arxiv_id":"2311.07315","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-oriented-estimation-of-multiple-markov","title":"Goal-oriented Estimation of Multiple Markov Sources in Resource-constrained Systems","date":"2023-11-13","arxiv_id":"2311.07346","repositories_listed":0,"syntology":null},{"url":null,"slug":"tiago-rl-simulated-reinforcement-learning","title":"TIAGo RL: Simulated Reinforcement Learning Environments with Tactile Data for Mobile Robots","date":"2023-11-13","arxiv_id":"2311.07260","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-transferring-tactile-based-continuous","title":"Towards Transferring Tactile-based Continuous Force Control Policies from Simulation to Robot","date":"2023-11-13","arxiv_id":"2311.07245","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-aware-sampling-and-transmission-in","title":"Semantic-aware Sampling and Transmission in Energy Harvesting Systems: A POMDP Approach","date":"2023-11-11","arxiv_id":"2311.06522","repositories_listed":0,"syntology":null},{"url":null,"slug":"genetic-algorithm-enhanced-by-deep","title":"Genetic Algorithm enhanced by Deep Reinforcement Learning in parent selection mechanism and mutation : Minimizing makespan in permutation flow shop scheduling problems","date":"2023-11-10","arxiv_id":"2311.05937","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-stochastic-nonlinear-model","title":"Adaptive Stochastic Nonlinear Model Predictive Control with Look-ahead Deep Reinforcement Learning for Autonomous Vehicle Motion Control","date":"2023-11-07","arxiv_id":"2311.04303","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-based-latency-constrained-fronthaul-1","title":"Learning-Based Latency-Constrained Fronthaul Compression Optimization in C-RAN","date":"2023-11-07","arxiv_id":"2311.03899","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-estimation-errors-by-twin-td","title":"Mitigating Estimation Errors by Twin TD-Regularized Actor and Critic for Deep Reinforcement Learning","date":"2023-11-07","arxiv_id":"2311.03711","repositories_listed":0,"syntology":null},{"url":null,"slug":"drnet-a-decision-making-method-for-autonomous","title":"DRNet: A Decision-Making Method for Autonomous Lane Changingwith Deep Reinforcement Learning","date":"2023-11-02","arxiv_id":"2311.01602","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-qos-aware-slice-resource","title":"Intelligent QoS aware slice resource allocation with user association parameterization for beyond 5G ORAN based architecture using DRL","date":"2023-11-02","arxiv_id":"2311.01594","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-neural-topological-mapping-for-multi","title":"Active Neural Topological Mapping for Multi-Agent Exploration","date":"2023-11-01","arxiv_id":"2311.00252","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-impartial-policies-for-sequential","title":"Learning impartial policies for sequential counterfactual explanations using Deep Reinforcement Learning","date":"2023-11-01","arxiv_id":"2311.00523","repositories_listed":0,"syntology":null},{"url":null,"slug":"handover-protocol-learning-for-leo-satellite","title":"Handover Protocol Learning for LEO Satellite Networks: Access Delay and Collision Minimization","date":"2023-10-31","arxiv_id":"2310.20215","repositories_listed":0,"syntology":null},{"url":null,"slug":"pick-and-pass-as-a-hat-trick-class-for-first","title":"Closed Drafting as a Case Study for First-Principle Interpretability, Memory, and Generalizability in Deep Reinforcement Learning","date":"2023-10-31","arxiv_id":"2310.20654","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-and-safe-deep-reinforcement","title":"Sample-Efficient and Safe Deep Reinforcement Learning via Reset Deep Ensemble Agents","date":"2023-10-31","arxiv_id":"2310.20287","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymmetric-diffusion-based-channel-adaptive","title":"Asymmetric Diffusion Based Channel-Adaptive Secure Wireless Semantic Communications","date":"2023-10-30","arxiv_id":"2310.19439","repositories_listed":0,"syntology":null},{"url":null,"slug":"automaton-distillation-neuro-symbolic","title":"Automaton Distillation: Neuro-Symbolic Transfer Learning for Deep Reinforcement Learning","date":"2023-10-29","arxiv_id":"2310.19137","repositories_listed":0,"syntology":null},{"url":"/paper/weakly-coupled-deep-q-networks","slug":"weakly-coupled-deep-q-networks","title":"Weakly Coupled Deep Q-Networks","date":"2023-10-28","arxiv_id":"2310.18803","repositories_listed":0,"syntology":{"n":10,"n_ran":5,"n_constructed":2,"n_ran_checked":3,"n_instrument":2,"n_unverified":5,"n_honours":1,"n_violates":0,"n_no_contract":2,"n_pointer_only":10,"phrase":"5 ran (of which 2 constructed an object rather than computing a result; 3 with no instrument failure: 1 honoured, 0 violated, 2 with no contract checked; 2 where Syntology's instrument failed) · 5 unverified","sample_list":"/paper/weakly-coupled-deep-q-networks#ran","syntology_url":"https://syntology.ai/paper/2310.18803","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2310.18803"}},"official":null}},{"url":null,"slug":"deep-reinforcement-learning-for-weapons-to","title":"Deep Reinforcement Learning for Weapons to Targets Assignment in a Hypersonic strike","date":"2023-10-27","arxiv_id":"2310.18509","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-resource-management-for-edge-network","title":"Adaptive Resource Management for Edge Network Slicing using Incremental Multi-Agent Deep Reinforcement Learning","date":"2023-10-26","arxiv_id":"2310.17523","repositories_listed":0,"syntology":null},{"url":null,"slug":"fedpeat-convergence-of-federated-learning","title":"FedPEAT: Convergence of Federated Learning, Parameter-Efficient Fine Tuning, and Emulator Assisted Tuning for Artificial Intelligence Foundation Models with Mobile Edge Computing","date":"2023-10-26","arxiv_id":"2310.17491","repositories_listed":0,"syntology":null},{"url":null,"slug":"grow-your-limits-continuous-improvement-with","title":"Grow Your Limits: Continuous Improvement with Real-World RL for Robotic Locomotion","date":"2023-10-26","arxiv_id":"2310.17634","repositories_listed":0,"syntology":null},{"url":null,"slug":"orchestration-of-emulator-assisted-mobile","title":"Orchestration of Emulator Assisted Mobile Edge Tuning for AI Foundation Models: A Multi-Agent Deep Reinforcement Learning Approach","date":"2023-10-26","arxiv_id":"2310.17492","repositories_listed":0,"syntology":null},{"url":null,"slug":"imperfect-digital-twin-assisted-low-cost","title":"Imperfect Digital Twin Assisted Low Cost Reinforcement Training for Multi-UAV Networks","date":"2023-10-25","arxiv_id":"2310.16302","repositories_listed":0,"syntology":null},{"url":null,"slug":"fractal-landscapes-in-policy-optimization","title":"Fractal Landscapes in Policy Optimization","date":"2023-10-24","arxiv_id":"2310.15418","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-and-sample-complexity","title":"On the Convergence and Sample Complexity Analysis of Deep Q-Networks with $ε$-Greedy Exploration","date":"2023-10-24","arxiv_id":"2310.16173","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-large-flexible-job-shop-scheduling","title":"Solving the flexible job-shop scheduling problem through an enhanced deep reinforcement learning approach","date":"2023-10-24","arxiv_id":"2310.15706","repositories_listed":0,"syntology":null}],"record_sha256":"6f754fd0e5bc3d880d45c5e51345183e89cbaf47afa26c517401fa342a172978","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}