{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/21","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":21,"pages_in_order":59,"rows_per_page":100,"rows":[2001,2100],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/20","next":"/task/deep-reinforcement-learning/papers/22","papers":[{"url":null,"slug":"deep-reinforcement-learning-for-dynamic-6","title":"Deep Reinforcement Learning for Dynamic Resource Allocation in Wireless Networks","date":"2025-02-03","arxiv_id":"2502.01129","repositories_listed":0,"syntology":null},{"url":null,"slug":"drl-based-dolph-tschebyscheff-beamforming-in","title":"DRL-based Dolph-Tschebyscheff Beamforming in Downlink Transmission for Mobile Users","date":"2025-02-03","arxiv_id":"2502.01278","repositories_listed":0,"syntology":null},{"url":null,"slug":"tell-drive-enhancing-autonomous-driving-with","title":"TeLL-Drive: Enhancing Autonomous Driving with Teacher LLM-Guided Deep Reinforcement Learning","date":"2025-02-03","arxiv_id":"2502.01387","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-concept-based-neuron-level","title":"Compositional Concept-Based Neuron-Level Interpretability for Deep Reinforcement Learning","date":"2025-02-02","arxiv_id":"2502.00684","repositories_listed":0,"syntology":null},{"url":null,"slug":"actor-critic-with-experience-replay-based","title":"Actor Critic with Experience Replay-based automatic treatment planning for prostate cancer intensity modulated radiotherapy","date":"2025-02-01","arxiv_id":"2502.00346","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-game-theoretic-analysis-of","title":"An Empirical Game-Theoretic Analysis of Autonomous Cyber-Defence Agents","date":"2025-01-31","arxiv_id":"2501.19206","repositories_listed":0,"syntology":null},{"url":null,"slug":"decorrelated-soft-actor-critic-for-efficient","title":"Decorrelated Soft Actor-Critic for Efficient Deep Reinforcement Learning","date":"2025-01-31","arxiv_id":"2501.19133","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-tax-evasion-emergence-using","title":"Investigating Tax Evasion Emergence Using Dual Large Language Model and Deep Reinforcement Learning Powered Agent-based Simulation","date":"2025-01-30","arxiv_id":"2501.18177","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dual-agent-adversarial-framework-for-robust","title":"A Dual-Agent Adversarial Framework for Robust Generalization in Deep Reinforcement Learning","date":"2025-01-29","arxiv_id":"2501.17384","repositories_listed":0,"syntology":null},{"url":null,"slug":"asap-learning-generalizable-online-bin","title":"ASAP: Learning Generalizable Online Bin Packing via Adaptive Selection After Pruning","date":"2025-01-29","arxiv_id":"2501.17377","repositories_listed":0,"syntology":null},{"url":null,"slug":"digital-twin-enabled-real-time-control-in","title":"Digital Twin Synchronization: Bridging the Sim-RL Agent to a Real-Time Robotic Additive Manufacturing Control","date":"2025-01-29","arxiv_id":"2501.18016","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-interplay-between-sparsity-and","title":"On the Interplay Between Sparsity and Training in Deep Reinforcement Learning","date":"2025-01-28","arxiv_id":"2501.16729","repositories_listed":0,"syntology":null},{"url":null,"slug":"objects-matter-object-centric-world-models","title":"Objects matter: object-centric world models improve reinforcement learning in visually complex environments","date":"2025-01-27","arxiv_id":"2501.16443","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-quantum-circuit","title":"Reinforcement Learning for Quantum Circuit Design: Using Matrix Representations","date":"2025-01-27","arxiv_id":"2501.16509","repositories_listed":0,"syntology":null},{"url":null,"slug":"movable-antenna-aided-cooperative-isac","title":"Movable Antenna-Aided Cooperative ISAC Network with Time Synchronization error and Imperfect CSI","date":"2025-01-26","arxiv_id":"2501.15410","repositories_listed":0,"syntology":null},{"url":null,"slug":"extensive-exploration-in-complex-traffic","title":"Extensive Exploration in Complex Traffic Scenarios using Hierarchical Reinforcement Learning","date":"2025-01-25","arxiv_id":"2501.14992","repositories_listed":0,"syntology":null},{"url":null,"slug":"signal-whisperers-enhancing-wireless","title":"Signal Whisperers: Enhancing Wireless Reception Using DRL-Guided Reflector Arrays","date":"2025-01-25","arxiv_id":"2501.15044","repositories_listed":0,"syntology":null},{"url":null,"slug":"age-and-power-minimization-via-meta-deep","title":"Age and Power Minimization via Meta-Deep Reinforcement Learning in UAV Networks","date":"2025-01-24","arxiv_id":"2501.14603","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-more-with-the-same-effort-how","title":"Learning more with the same effort: how randomization improves the robustness of a robotic deep reinforcement learning agent","date":"2025-01-24","arxiv_id":"2501.14443","repositories_listed":0,"syntology":null},{"url":null,"slug":"csaot-cooperative-multi-agent-system-for","title":"CSAOT: Cooperative Multi-Agent System for Active Object Tracking","date":"2025-01-23","arxiv_id":"2501.13994","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-ai-aided-feature-selection-and","title":"Explainable AI-aided Feature Selection and Model Reduction for DRL-based V2X Resource Allocation","date":"2025-01-23","arxiv_id":"2501.13552","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-hybrid","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","date":"2025-01-22","arxiv_id":"2501.12627","repositories_listed":0,"syntology":null},{"url":null,"slug":"uav-assisted-internet-of-vehicles-a-framework","title":"UAV-assisted Internet of Vehicles: A Framework Empowered by Reinforcement Learning and Blockchain","date":"2025-01-22","arxiv_id":"2502.15713","repositories_listed":0,"syntology":null},{"url":null,"slug":"heuristic-deep-reinforcement-learning-for","title":"Heuristic Deep Reinforcement Learning for Phase Shift Optimization in RIS-assisted Secure Satellite Communication Systems with RSMA","date":"2025-01-21","arxiv_id":"2501.12311","repositories_listed":0,"syntology":null},{"url":null,"slug":"sum-rate-enhancement-using-machine-learning","title":"Sum Rate Enhancement using Machine Learning for Semi-Self Sensing Hybrid RIS-Enabled ISAC in THz Bands","date":"2025-01-21","arxiv_id":"2501.12353","repositories_listed":0,"syntology":null},{"url":null,"slug":"drl-based-maximization-of-the-sum-cross-layer","title":"DRL-Based Maximization of the Sum Cross-Layer Achievable Rate for Networks Under Jamming","date":"2025-01-20","arxiv_id":"2501.11626","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimum-power-allocation-for-low-rank-wi-fi","title":"Optimum Power Allocation for Low Rank Wi-Fi Channels: A Comparison with Deep RL Framework","date":"2025-01-20","arxiv_id":"2501.11266","repositories_listed":0,"syntology":null},{"url":null,"slug":"performance-analysis-of-nr-sidelink-and-wi-fi","title":"Collaborative Channel Access and Transmission for NR Sidelink and Wi-Fi Coexistence over Unlicensed Spectrum","date":"2025-01-20","arxiv_id":"2501.17878","repositories_listed":0,"syntology":null},{"url":null,"slug":"secure-resource-allocation-via-constrained","title":"Secure Resource Allocation via Constrained Deep Reinforcement Learning","date":"2025-01-20","arxiv_id":"2501.11557","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-switch-type-policy-network-for","title":"A Novel Switch-Type Policy Network for Resource Allocation Problems: Technical Report","date":"2025-01-19","arxiv_id":"2501.11136","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-target-localization-under","title":"Adaptive Target Localization under Uncertainty using Multi-Agent Deep Reinforcement Learning with Knowledge Transfer","date":"2025-01-19","arxiv_id":"2501.10924","repositories_listed":0,"syntology":null},{"url":null,"slug":"blockchain-assisted-demonstration-cloning-for","title":"Blockchain-assisted Demonstration Cloning for Multi-Agent Deep Reinforcement Learning","date":"2025-01-19","arxiv_id":"2501.10938","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-deep-reinforcement-learning-for-1","title":"Federated Deep Reinforcement Learning for Energy Efficient Multi-Functional RIS-Assisted Low-Earth Orbit Networks","date":"2025-01-19","arxiv_id":"2501.11079","repositories_listed":0,"syntology":null},{"url":null,"slug":"classical-and-deep-reinforcement-learning","title":"Classical and Deep Reinforcement Learning Inventory Control Policies for Pharmaceutical Supply Chains with Perishability and Non-Stationarity","date":"2025-01-18","arxiv_id":"2501.10895","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-ai-transparency-xrl-based-resource","title":"Enhancing AI Transparency: XRL-Based Resource Management and RAN Slicing for 6G ORAN Architecture","date":"2025-01-17","arxiv_id":"2501.10292","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-uav-path-planning-efficiency","title":"Enhancing UAV Path Planning Efficiency Through Accelerated Learning","date":"2025-01-17","arxiv_id":"2501.10141","repositories_listed":0,"syntology":null},{"url":null,"slug":"wasserstein-adaptive-value-estimation-for","title":"Wasserstein Adaptive Value Estimation for Actor-Critic Reinforcement Learning","date":"2025-01-17","arxiv_id":"2501.10605","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-searching-of-extreme-operating","title":"Fast Searching of Extreme Operating Conditions for Relay Protection Setting Calculation Based on Graph Neural Network and Reinforcement Learning","date":"2025-01-16","arxiv_id":"2501.09399","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-explainability-to-interpretability","title":"From Explainability to Interpretability: Interpretable Policies in Reinforcement Learning Via Model Explanation","date":"2025-01-16","arxiv_id":"2501.09858","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-deep-reinforcement-learning-to-1","title":"Application of Deep Reinforcement Learning to UAV Swarming for Ground Surveillance","date":"2025-01-15","arxiv_id":"2501.08655","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-portfolio-optimization-via-augmented","title":"Dynamic Portfolio Optimization via Augmented DDPG with Quantum Price Levels-Based Trading Strategy","date":"2025-01-15","arxiv_id":"2501.08528","repositories_listed":0,"syntology":null},{"url":null,"slug":"speq-stabilization-phases-for-efficient-q","title":"SPEQ: Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","date":"2025-01-15","arxiv_id":"2501.08669","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-pricing-in-high-speed-railways-using","title":"Dynamic Pricing in High-Speed Railways Using Multi-Agent Reinforcement Learning","date":"2025-01-14","arxiv_id":"2501.08234","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-federated-deep-learning-framework-for-cell","title":"A Federated Deep Learning Framework for Cell-Free RSMA Networks","date":"2025-01-13","arxiv_id":"2501.07126","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-defi-accessibility-through","title":"Improving DeFi Accessibility through Efficient Liquidity Provisioning with Deep Reinforcement Learning","date":"2025-01-13","arxiv_id":"2501.07508","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-multi-agent-dynamic-portfolio","title":"A novel multi-agent dynamic portfolio optimization learning system based on hierarchical deep reinforcement learning","date":"2025-01-12","arxiv_id":"2501.06832","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-optimized","title":"Deep Reinforcement Learning Optimized Intelligent Resource Allocation in Active RIS-Integrated TN-NTN Networks","date":"2025-01-11","arxiv_id":"2501.06482","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-delay-and-energy-consumption","title":"Task Delay and Energy Consumption Minimization for Low-altitude MEC via Evolutionary Multi-objective Deep Reinforcement Learning","date":"2025-01-11","arxiv_id":"2501.06410","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-practical-demonstration-of-drl-based","title":"A Practical Demonstration of DRL-Based Dynamic Resource Allocation xApp Using OpenAirInterface","date":"2025-01-10","arxiv_id":"2501.05879","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-integrated-dispatching-and-idle","title":"Real-Time Integrated Dispatching and Idle Fleet Steering with Deep Reinforcement Learning for A Meal Delivery Platform","date":"2025-01-10","arxiv_id":"2501.05808","repositories_listed":0,"syntology":null},{"url":null,"slug":"curla-curriculum-learning-based-deep","title":"CuRLA: Curriculum Learning Based Deep Reinforcement Learning for Autonomous Driving","date":"2025-01-09","arxiv_id":"2501.04982","repositories_listed":0,"syntology":null},{"url":null,"slug":"promoting-shared-energy-storage-aggregation","title":"Promoting Shared Energy Storage Aggregation among High Price-Tolerance Prosumer: An Incentive Deposit and Withdrawal Service","date":"2025-01-09","arxiv_id":"2501.04964","repositories_listed":0,"syntology":null},{"url":null,"slug":"timerl-efficient-deep-reinforcement-learning","title":"TimeRL: Efficient Deep Reinforcement Learning with Polyhedral Dependence Graphs","date":"2025-01-09","arxiv_id":"2501.05408","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperl-parameter-informed-reinforcement","title":"HypeRL: Parameter-Informed Reinforcement Learning for Parametric PDEs","date":"2025-01-08","arxiv_id":"2501.04538","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-adversarial-attacks-in","title":"Rethinking Adversarial Attacks in Reinforcement Learning from Policy Distribution Perspective","date":"2025-01-07","arxiv_id":"2501.03562","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-satellite-beam-hopping-and-power","title":"Multi-Satellite Beam Hopping and Power Allocation Using Deep Reinforcement Learning","date":"2025-01-04","arxiv_id":"2501.02309","repositories_listed":0,"syntology":null},{"url":null,"slug":"blast-a-stealthy-backdoor-leverage-attack","title":"BLAST: A Stealthy Backdoor Leverage Attack against Cooperative Multi-Agent Deep Reinforcement Learning based Systems","date":"2025-01-03","arxiv_id":"2501.01593","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-scenario-based-decision-making-for","title":"Evaluating Scenario-based Decision-making for Interactive Autonomous Driving Using Rational Criteria: A Survey","date":"2025-01-03","arxiv_id":"2501.01886","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-job","title":"Deep Reinforcement Learning for Job Scheduling and Resource Management in Cloud Computing: An Algorithm-Level Review","date":"2025-01-02","arxiv_id":"2501.01007","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-intelligent-antenna-positioning","title":"Towards Intelligent Antenna Positioning: Leveraging DRL for FAS-Aided ISAC Systems","date":"2025-01-02","arxiv_id":"2501.01281","repositories_listed":0,"syntology":null},{"url":null,"slug":"b-dqn-improving-deep-q-learning-by-evolving","title":"$β$-DQN: Improving Deep Q-Learning By Evolving the Behavior","date":"2025-01-01","arxiv_id":"2501.00913","repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-and-accelerating-autofocus-with","title":"Stabilizing and Accelerating Autofocus with Expert Trajectory Regularized Deep Reinforcement Learning","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-recognition-using-actor-critic","title":"Goal Recognition using Actor-Critic Optimization","date":"2024-12-31","arxiv_id":"2501.01463","repositories_listed":0,"syntology":null},{"url":null,"slug":"protein-structure-prediction-in-the-3d-hp","title":"Protein Structure Prediction in the 3D HP Model Using Deep Reinforcement Learning","date":"2024-12-29","arxiv_id":"2412.20329","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-context-aware-multi-path","title":"Adaptive Context-Aware Multi-Path Transmission Control for VR/AR Content: A Deep Reinforcement Learning Approach","date":"2024-12-27","arxiv_id":"2412.19737","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-ceilings-to-walls-universal-dynamic","title":"From Ceilings to Walls: Universal Dynamic Perching of Small Aerial Robots on Surfaces with Variable Orientations","date":"2024-12-27","arxiv_id":"2412.19765","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-classification-with-deep-reinforcement","title":"Image Classification with Deep Reinforcement Active Learning","date":"2024-12-27","arxiv_id":"2412.19877","repositories_listed":0,"syntology":null},{"url":null,"slug":"mobile-robots-through-task-based-human","title":"Mobile Robots through Task-Based Human Instructions using Incremental Curriculum Learning","date":"2024-12-26","arxiv_id":"2412.19159","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-fantasy-sports-team-selection-with","title":"Optimizing Fantasy Sports Team Selection with Deep Reinforcement Learning","date":"2024-12-26","arxiv_id":"2412.19215","repositories_listed":0,"syntology":null},{"url":null,"slug":"preventive-energy-management-for-distribution","title":"Preventive Energy Management for Distribution Systems Under Uncertain Events: A Deep Reinforcement Learning Approach","date":"2024-12-26","arxiv_id":"2412.19382","repositories_listed":0,"syntology":null},{"url":null,"slug":"ris-assisted-aerial-non-terrestrial-networks","title":"RIS-Assisted Aerial Non-Terrestrial Networks: An Intelligent Synergy with Deep Reinforcement Learning","date":"2024-12-25","arxiv_id":"2412.18957","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustness-evaluation-of-offline","title":"Robustness Evaluation of Offline Reinforcement Learning for Robot Control Against Action Perturbations","date":"2024-12-25","arxiv_id":"2412.18781","repositories_listed":0,"syntology":null},{"url":null,"slug":"autosculpt-a-pattern-based-model-auto-pruning","title":"AutoSculpt: A Pattern-based Model Auto-pruning Framework Using Reinforcement Learning and Graph Learning","date":"2024-12-24","arxiv_id":"2412.18091","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-deep-reinforcement-learning-for","title":"Multimodal Deep Reinforcement Learning for Portfolio Optimization","date":"2024-12-23","arxiv_id":"2412.17293","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-a-focus-on","title":"Reinforcement Learning with a Focus on Adjusting Policies to Reach Targets","date":"2024-12-23","arxiv_id":"2412.17344","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-tutorial-on-non-terrestrial-networks","title":"A Tutorial on Non-Terrestrial Networks: Towards Global and Ubiquitous 6G Connectivity","date":"2024-12-21","arxiv_id":"2412.16611","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-systems-for","title":"Deep Reinforcement Learning Based Systems for Safety Critical Applications in Aerospace","date":"2024-12-21","arxiv_id":"2412.16489","repositories_listed":0,"syntology":null},{"url":null,"slug":"apirl-deep-reinforcement-learning-for-rest","title":"APIRL: Deep Reinforcement Learning for REST API Fuzzing","date":"2024-12-20","arxiv_id":"2412.15991","repositories_listed":0,"syntology":null},{"url":null,"slug":"implementing-td3-to-train-a-neural-network-to","title":"Implementing TD3 to train a Neural Network to fly a Quadcopter through an FPV Gate","date":"2024-12-18","arxiv_id":"2412.14367","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-power-smoothing-control-for-wind","title":"Coordinated Power Smoothing Control for Wind Storage Integrated System with Physics-informed Deep Reinforcement Learning","date":"2024-12-17","arxiv_id":"2412.17838","repositories_listed":0,"syntology":null},{"url":null,"slug":"distribution-free-uncertainty-quantification-2","title":"Distribution-Free Uncertainty Quantification in Mechanical Ventilation Treatment: A Conformal Deep Q-Learning Framework","date":"2024-12-17","arxiv_id":"2412.12597","repositories_listed":0,"syntology":null},{"url":null,"slug":"physics-model-guided-worst-case-sampling-for","title":"Physics-model-guided Worst-case Sampling for Safe Reinforcement Learning","date":"2024-12-17","arxiv_id":"2412.13224","repositories_listed":0,"syntology":null},{"url":null,"slug":"practicable-black-box-evasion-attacks-on-link","title":"Practicable Black-box Evasion Attacks on Link Prediction in Dynamic Graphs -- A Graph Sequential Embedding Method","date":"2024-12-17","arxiv_id":"2412.13134","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-bayesian-deep-reinforcement","title":"Generalized Bayesian deep reinforcement learning","date":"2024-12-16","arxiv_id":"2412.11743","repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-reinforcement-learning-in","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","date":"2024-12-16","arxiv_id":"2412.12089","repositories_listed":0,"syntology":null},{"url":null,"slug":"rat-adversarial-attacks-on-deep-reinforcement","title":"RAT: Adversarial Attacks on Deep Reinforcement Agents for Targeted Behaviors","date":"2024-12-14","arxiv_id":"2412.10713","repositories_listed":0,"syntology":null},{"url":null,"slug":"advances-in-transformers-for-robotic","title":"Advances in Transformers for Robotic Applications: A Review","date":"2024-12-13","arxiv_id":"2412.10599","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-scalable","title":"Deep Reinforcement Learning for Scalable Multiagent Spacecraft Inspection","date":"2024-12-13","arxiv_id":"2412.10530","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-combinatorial-optimization-neural","title":"Scaling Combinatorial Optimization Neural Improvement Heuristics with Online Search and Adaptation","date":"2024-12-13","arxiv_id":"2412.10163","repositories_listed":0,"syntology":null},{"url":null,"slug":"gainadaptor-learning-quadrupedal-locomotion","title":"GainAdaptor: Learning Quadrupedal Locomotion with Dual Actors for Adaptable and Energy-Efficient Walking on Various Terrains","date":"2024-12-12","arxiv_id":"2412.09520","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-sketch-decompositions-in-planning","title":"Learning Sketch Decompositions in Planning via Deep Reinforcement Learning","date":"2024-12-11","arxiv_id":"2412.08574","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-reward-specification-in-deep","title":"Effective Reward Specification in Deep Reinforcement Learning","date":"2024-12-10","arxiv_id":"2412.07177","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-progressive-influence-maximization-in","title":"Non-Progressive Influence Maximization in Dynamic Social Networks","date":"2024-12-10","arxiv_id":"2412.07402","repositories_listed":0,"syntology":null},{"url":null,"slug":"bounded-exploration-with-world-model","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","date":"2024-12-09","arxiv_id":"2412.06139","repositories_listed":0,"syntology":null},{"url":null,"slug":"edge-delayed-deep-deterministic-policy","title":"Edge Delayed Deep Deterministic Policy Gradient: efficient continuous control for edge scenarios","date":"2024-12-09","arxiv_id":"2412.06390","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-based-deep-reinforcement-learning-of","title":"Vision-Based Deep Reinforcement Learning of UAV Autonomous Navigation Using Privileged Information","date":"2024-12-09","arxiv_id":"2412.06313","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-temporally-correlated-latent-exploration","title":"A Temporally Correlated Latent Exploration for Reinforcement Learning","date":"2024-12-06","arxiv_id":"2412.04775","repositories_listed":0,"syntology":null},{"url":null,"slug":"putting-the-iterative-training-of-decision","title":"Putting the Iterative Training of Decision Trees to the Test on a Real-World Robotic Task","date":"2024-12-06","arxiv_id":"2412.04974","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-mapping-for-reinforcement-learning-in","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","date":"2024-12-05","arxiv_id":"2412.04327","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-learning-for-irs-assisted-mec","title":"Hierarchical Learning for IRS-Assisted MEC Systems with Rate-Splitting Multiple Access","date":"2024-12-05","arxiv_id":"2412.04002","repositories_listed":0,"syntology":null}],"record_sha256":"cf82404b0b667ccb45c51ba5dbcc527a0a642be421de074df442af3eff63ed1c","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}