{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/33","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":33,"pages_in_order":59,"rows_per_page":100,"rows":[3201,3300],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/32","next":"/task/deep-reinforcement-learning/papers/34","papers":[{"url":null,"slug":"asynchronous-deep-double-duelling-q-learning","title":"Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets","date":"2023-01-20","arxiv_id":"2301.08688","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-estimation-bias-in-policy","title":"Revisiting Estimation Bias in Policy Gradients for Deep Reinforcement Learning","date":"2023-01-20","arxiv_id":"2301.08442","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-meta-reinforcement-learning","title":"A Survey of Meta-Reinforcement Learning","date":"2023-01-19","arxiv_id":"2301.08028","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-gas-trading","title":"Domain-adapted Learning and Interpretability: DRL for Gas Trading","date":"2023-01-19","arxiv_id":"2301.08359","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-deep-reinforcement-learning-for","title":"Automated deep reinforcement learning for real-time scheduling strategy of multi-energy system integrated with post-carbon and direct-air carbon captured system","date":"2023-01-18","arxiv_id":"2301.07768","repositories_listed":0,"syntology":null},{"url":null,"slug":"direct-learning-from-sparse-and-shifting","title":"DIRECT: Learning from Sparse and Shifting Rewards using Discriminative Reward Co-Training","date":"2023-01-18","arxiv_id":"2301.07421","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-robust-deep-reinforcement","title":"Adversarial Robust Deep Reinforcement Learning Requires Redefining Robustness","date":"2023-01-17","arxiv_id":"2301.07487","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-solve-arithmetic-problems-with-a","title":"Learning to solve arithmetic problems with a virtual abacus","date":"2023-01-17","arxiv_id":"2301.06870","repositories_listed":0,"syntology":null},{"url":null,"slug":"hiflash-communication-efficient-hierarchical","title":"HiFlash: Communication-Efficient Hierarchical Federated Learning with Adaptive Staleness Control and Heterogeneity-aware Client-Edge Association","date":"2023-01-16","arxiv_id":"2301.06447","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-human-cognition-with-a-hybrid-deep","title":"CogReact: A Reinforced Framework to Model Human Cognitive Reaction Modulated by Dynamic Intervention","date":"2023-01-15","arxiv_id":"2301.06216","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-and-effective-communication-for","title":"Semantic and Effective Communication for Remote Control Tasks with Dynamic Feature Compression","date":"2023-01-14","arxiv_id":"2301.05901","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-decentralized-pilot-assignment-methodology","title":"A Decentralized Pilot Assignment Algorithm for Scalable O-RAN Cell-Free Massive MIMO","date":"2023-01-12","arxiv_id":"2301.04774","repositories_listed":0,"syntology":null},{"url":null,"slug":"sok-adversarial-machine-learning-attacks-and","title":"SoK: Adversarial Machine Learning Attacks and Defences in Multi-Agent Reinforcement Learning","date":"2023-01-11","arxiv_id":"2301.04299","repositories_listed":0,"syntology":null},{"url":null,"slug":"actor-director-critic-a-novel-deep","title":"Actor-Director-Critic: A Novel Deep Reinforcement Learning Framework","date":"2023-01-10","arxiv_id":"2301.03887","repositories_listed":0,"syntology":null},{"url":null,"slug":"enabling-ai-generated-content-aigc-services","title":"Enabling AI-Generated Content (AIGC) Services in Wireless Edge Networks","date":"2023-01-09","arxiv_id":"2301.03220","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-uav-path-learning-for-age-and-power","title":"Multi-UAV Path Learning for Age and Power Optimization in IoT with UAV Battery Recharge","date":"2023-01-09","arxiv_id":"2301.03423","repositories_listed":0,"syntology":null},{"url":null,"slug":"network-slicing-via-transfer-learning-aided","title":"Network Slicing via Transfer Learning aided Distributed Deep Reinforcement Learning","date":"2023-01-09","arxiv_id":"2301.03262","repositories_listed":0,"syntology":null},{"url":null,"slug":"xdqn-inherently-interpretable-dqn-through","title":"XDQN: Inherently Interpretable DQN through Mimicking","date":"2023-01-08","arxiv_id":"2301.03043","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-based","title":"A Deep Reinforcement Learning-Based Controller for Magnetorheological-Damped Vehicle Suspension","date":"2023-01-06","arxiv_id":"2301.02714","repositories_listed":0,"syntology":null},{"url":null,"slug":"drl-gan-a-hybrid-approach-for-binary-and","title":"DRL-GAN: A Hybrid Approach for Binary and Multiclass Network Intrusion Detection","date":"2023-01-05","arxiv_id":"2301.03368","repositories_listed":0,"syntology":null},{"url":null,"slug":"chat2map-efficient-scene-mapping-from-multi","title":"Chat2Map: Efficient Scene Mapping from Multi-Ego Conversations","date":"2023-01-04","arxiv_id":"2301.02184","repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-learning-for-large-scale-optimization","title":"Machine Learning for Large-Scale Optimization in 6G Wireless Networks","date":"2023-01-03","arxiv_id":"2301.03377","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-asset-1","title":"Deep Reinforcement Learning for Asset Allocation: Reward Clipping","date":"2023-01-02","arxiv_id":"2301.05300","repositories_listed":0,"syntology":null},{"url":null,"slug":"gait-generating-aesthetic-indoor-tours-with","title":"GAIT: Generating Aesthetic Indoor Tours with Deep Reinforcement Learning","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"accuracy-guaranteed-collaborative-dnn","title":"Accuracy-Guaranteed Collaborative DNN Inference in Industrial IoT via Deep Reinforcement Learning","date":"2022-12-31","arxiv_id":"2301.00130","repositories_listed":0,"syntology":null},{"url":null,"slug":"situation-aware-deep-reinforcement-learning","title":"Situation-Aware Deep Reinforcement Learning for Autonomous Nonlinear Mobility Control in Cyber-Physical Loitering Munition Systems","date":"2022-12-31","arxiv_id":"2301.00124","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-deep-reinforcement-learning-and","title":"Hybrid Deep Reinforcement Learning and Planning for Safe and Comfortable Automated Driving","date":"2022-12-30","arxiv_id":"2301.00650","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-experts-advice-aggregation-framework","title":"A Novel Experts Advice Aggregation Framework Using Deep Reinforcement Learning for Portfolio Management","date":"2022-12-29","arxiv_id":"2212.14477","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-multi-agent-deep-reinforcement","title":"Federated Multi-Agent Deep Reinforcement Learning Approach via Physics-Informed Reward for Multi-Microgrid Energy Management","date":"2022-12-29","arxiv_id":"2301.00641","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-cpg-rl-learning-central-pattern","title":"Visual CPG-RL: Learning Central Pattern Generators for Visually-Guided Quadruped Locomotion","date":"2022-12-29","arxiv_id":"2212.14400","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-a-sequence-to-sequence-nlp-model","title":"Improving a sequence-to-sequence nlp model using a reinforcement learning policy algorithm","date":"2022-12-28","arxiv_id":"2212.14117","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-automating-codenames-spymasters-with","title":"Towards automating Codenames spymasters with deep reinforcement learning","date":"2022-12-28","arxiv_id":"2212.14104","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-optimization-enhanced-deep","title":"Bayesian Optimization Enhanced Deep Reinforcement Learning for Trajectory Planning and Network Formation in Multi-UAV Networks","date":"2022-12-27","arxiv_id":"2212.13396","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-wind-and","title":"Deep Reinforcement Learning for Wind and Energy Storage Coordination in Wholesale Energy and Ancillary Service Markets","date":"2022-12-27","arxiv_id":"2212.13368","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-deep-reinforcement-learning-for","title":"Hierarchical Deep Reinforcement Learning for Age-of-Information Minimization in IRS-aided and Wireless-powered Wireless Networks","date":"2022-12-27","arxiv_id":"2212.13390","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-scheduling-of-island-integrated","title":"Optimal scheduling of island integrated energy systems considering multi-uncertainties and hydrothermal simultaneous transmission: A deep reinforcement learning approach","date":"2022-12-27","arxiv_id":"2212.13472","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-reinforcement-learning-with-loss","title":"Off-Policy Reinforcement Learning with Loss Function Weighted by Temporal Difference Error","date":"2022-12-26","arxiv_id":"2212.13175","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-heat-pump","title":"Deep Reinforcement Learning for Heat Pump Control","date":"2022-12-24","arxiv_id":"2212.12716","repositories_listed":0,"syntology":null},{"url":null,"slug":"structure-enhanced-drl-for-optimal","title":"Structure-Enhanced DRL for Optimal Transmission Scheduling","date":"2022-12-24","arxiv_id":"2212.12704","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-cognitive-frequency-allocation-strategy-for","title":"a cognitive frequency allocation strategy for multi-carrier radar against communication interference","date":"2022-12-23","arxiv_id":"2212.12247","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-multi-agent-reinforcement","title":"Coordinated Multi-Agent Reinforcement Learning for Unmanned Aerial Vehicle Swarms in Autonomous Mobile Access Applications","date":"2022-12-23","arxiv_id":"2304.08493","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-optimization-with-graph","title":"Proximal Policy Optimization with Graph Neural Networks for Optimal Power Flow","date":"2022-12-23","arxiv_id":"2212.12470","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoding-surface-codes-with-deep","title":"Decoding surface codes with deep reinforcement learning and probabilistic policy reuse","date":"2022-12-22","arxiv_id":"2212.11890","repositories_listed":0,"syntology":null},{"url":null,"slug":"device-selection-for-the-coexistence-of-urllc","title":"BSAC-CoEx: Coexistence of URLLC and Distributed Learning Services via Device Selection","date":"2022-12-22","arxiv_id":"2212.11805","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-swim-efficiently-in-a-nonuniform","title":"Learning to swim efficiently in a nonuniform flow field","date":"2022-12-22","arxiv_id":"2212.11482","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-memetic-algorithm-with-reinforcement","title":"A Memetic Algorithm with Reinforcement Learning for Sociotechnical Production Scheduling","date":"2022-12-21","arxiv_id":"2212.10936","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-trajectory","title":"Deep Reinforcement Learning for Trajectory Path Planning and Distributed Inference in Resource-Constrained UAV Swarms","date":"2022-12-21","arxiv_id":"2212.11201","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-path-selection-in-software-defined","title":"Robust Path Selection in Software-defined WANs using Deep Reinforcement Learning","date":"2022-12-21","arxiv_id":"2212.11155","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-quantum-soft-actor-critic-for","title":"Variational Quantum Soft Actor-Critic for Robotic Arm Control","date":"2022-12-20","arxiv_id":"2212.11681","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-relay-selection-and-beam-management","title":"Joint Relay Selection and Beam Management Based on Deep Reinforcement Learning for Millimeter Wave Vehicular Communication","date":"2022-12-19","arxiv_id":"2212.09862","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-coreference-resolution-based-on","title":"Neural Coreference Resolution based on Reinforcement Learning","date":"2022-12-18","arxiv_id":"2212.09028","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-bci-enabled-metaverse-a-joint-radio","title":"Toward BCI-enabled Metaverse: A Joint Learning and Resource Allocation Approach","date":"2022-12-17","arxiv_id":"2212.08811","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparing-approaches-to-distributed-control","title":"Comparing Approaches to Distributed Control of Fluid Systems based on Multi-Agent Systems","date":"2022-12-16","arxiv_id":"2212.08450","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-patrolling-with-battery","title":"An Energy-aware and Fault-tolerant Deep Reinforcement Learning based approach for Multi-agent Patrolling Problems","date":"2022-12-16","arxiv_id":"2212.08230","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-agile-active","title":"Reinforcement Learning for Agile Active Target Sensing with a UAV","date":"2022-12-16","arxiv_id":"2212.08214","repositories_listed":0,"syntology":null},{"url":null,"slug":"driver-assistance-eco-driving-and","title":"Driver Assistance Eco-driving and Transmission Control with Deep Reinforcement Learning","date":"2022-12-15","arxiv_id":"2212.07594","repositories_listed":0,"syntology":null},{"url":null,"slug":"sim-to-real-transfer-for-quadrupedal","title":"Sim-to-Real Transfer for Quadrupedal Locomotion via Terrain Transformer","date":"2022-12-15","arxiv_id":"2212.07740","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-control-based-on-deep-reinforcement","title":"Quantum Control based on Deep Reinforcement Learning","date":"2022-12-14","arxiv_id":"2212.07385","repositories_listed":0,"syntology":null},{"url":null,"slug":"ppo-ue-proximal-policy-optimization-via","title":"PPO-UE: Proximal Policy Optimization via Uncertainty-Aware Exploration","date":"2022-12-13","arxiv_id":"2212.06343","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-optimization-based","title":"Proximal Policy Optimization Based Reinforcement Learning for Joint Bidding in Energy and Frequency Regulation Markets","date":"2022-12-13","arxiv_id":"2212.06551","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-cooperative-perception-for","title":"Decentralized cooperative perception for autonomous vehicles: Learning to value the unknown","date":"2022-12-12","arxiv_id":"2301.01250","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-approximate-exploratory-data","title":"Reinforced Approximate Exploratory Data Analysis","date":"2022-12-12","arxiv_id":"2212.06225","repositories_listed":0,"syntology":null},{"url":null,"slug":"where-to-go-agent-guidance-with-deep","title":"Where to go: Agent Guidance with Deep Reinforcement Learning in A City-Scale Online Ride-Hailing Service","date":"2022-12-12","arxiv_id":"2212.05742","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-through-the-lens-of-learning","title":"Generalization Through the Lens of Learning Dynamics","date":"2022-12-11","arxiv_id":"2212.05377","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-deep-reinforcement-learning-for-1","title":"Hierarchical Deep Reinforcement Learning for VWAP Strategy Optimization","date":"2022-12-11","arxiv_id":"2212.14670","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-deep-reinforcement-learning-1","title":"Off-Policy Deep Reinforcement Learning Algorithms for Handling Various Robotic Manipulator Tasks","date":"2022-12-11","arxiv_id":"2212.05572","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-stochastic-gradient-descent-algorithm","title":"A Novel Stochastic Gradient Descent Algorithm for Learning Principal Subspaces","date":"2022-12-08","arxiv_id":"2212.04025","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-scale-arbitrary-image-super-resolution","title":"A Scale-Arbitrary Image Super-Resolution Network Using Frequency-domain Information","date":"2022-12-08","arxiv_id":"2212.04314","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-and-planning-of-flexible-mobile-micro","title":"Design and Planning of Flexible Mobile Micro-Grids Using Deep Reinforcement Learning","date":"2022-12-08","arxiv_id":"2212.04136","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-self-imitation-learning-from","title":"Accelerating Self-Imitation Learning from Demonstrations via Policy Constraints and Q-Ensemble","date":"2022-12-07","arxiv_id":"2212.03562","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-deep-reinforcement-learning-based-1","title":"A Novel Deep Reinforcement Learning Based Automated Stock Trading System Using Cascaded LSTM Networks","date":"2022-12-06","arxiv_id":"2212.02721","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-guidance-strategy-for-active","title":"Cooperative Guidance Strategy for Active Defense Spacecraft with Imperfect Information via Deep Reinforcement Learning","date":"2022-12-06","arxiv_id":"2212.03093","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-learning-of-voltage-control","title":"Efficient Learning of Voltage Control Strategies via Model-based Deep Reinforcement Learning","date":"2022-12-06","arxiv_id":"2212.02715","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hierarchical-deep-reinforcement-learning","title":"A Hierarchical Deep Reinforcement Learning Framework for 6-DOF UCAV Air-to-Air Combat","date":"2022-12-05","arxiv_id":"2212.03830","repositories_listed":0,"syntology":null},{"url":null,"slug":"ct-dqn-control-tutored-deep-reinforcement","title":"CT-DQN: Control-Tutored Deep Reinforcement Learning","date":"2022-12-02","arxiv_id":"2212.01343","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-deep-reinforcement-learning-a","title":"Distributed Deep Reinforcement Learning: A Survey and A Multi-Player Multi-Agent Learning Toolbox","date":"2022-12-01","arxiv_id":"2212.00253","repositories_listed":0,"syntology":null},{"url":null,"slug":"launchpad-learning-to-schedule-using-offline","title":"Launchpad: Learning to Schedule Using Offline and Online RL Methods","date":"2022-12-01","arxiv_id":"2212.00639","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-function-optimization-of-a-deep","title":"Reward Function Optimization of a Deep Reinforcement Learning Collision Avoidance System","date":"2022-12-01","arxiv_id":"2212.00855","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-multi-truck","title":"Reinforcement Learning for Multi-Truck Vehicle Routing Problems","date":"2022-11-30","arxiv_id":"2211.17078","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-cost-of-learning-efficiency-vs-efficacy","title":"The Cost of Learning: Efficiency vs. Efficacy of Learning-Based RRM for 6G","date":"2022-11-30","arxiv_id":"2211.16915","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximating-martingale-process-for-variance","title":"Approximating Martingale Process for Variance Reduction in Deep Reinforcement Learning with Large State Space","date":"2022-11-29","arxiv_id":"2211.15886","repositories_listed":0,"syntology":null},{"url":null,"slug":"autotuning-pid-control-using-actor-critic","title":"Autotuning PID control using Actor-Critic Deep Reinforcement Learning","date":"2022-11-29","arxiv_id":"2212.00013","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-neural-algorithmic-planners","title":"Continuous Neural Algorithmic Planners","date":"2022-11-29","arxiv_id":"2211.15839","repositories_listed":0,"syntology":null},{"url":null,"slug":"discrete-control-in-real-world-driving","title":"Discrete Control in Real-World Driving Environments using Deep Reinforcement Learning","date":"2022-11-29","arxiv_id":"2211.15920","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-energy-management-and-demand","title":"Distributed Energy Management and Demand Response in Smart Grids: A Multi-Agent Deep Reinforcement Learning Framework","date":"2022-11-29","arxiv_id":"2211.15858","repositories_listed":0,"syntology":null},{"url":null,"slug":"performance-evaluation-optimization-and","title":"Performance Evaluation, Optimization and Dynamic Decision in Blockchain Systems: A Recent Overview","date":"2022-11-29","arxiv_id":"2211.15907","repositories_listed":0,"syntology":null},{"url":null,"slug":"accerl-policy-acceleration-framework-for-deep","title":"AcceRL: Policy Acceleration Framework for Deep Reinforcement Learning","date":"2022-11-28","arxiv_id":"2211.15023","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-deep-reinforcement-learning-using","title":"Causal Deep Reinforcement Learning Using Observational Data","date":"2022-11-28","arxiv_id":"2211.15355","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-episodic-control","title":"Continuous Episodic Control","date":"2022-11-28","arxiv_id":"2211.15183","repositories_listed":0,"syntology":null},{"url":null,"slug":"isolation-scheme-for-virtual-network","title":"An Isolation-Aware Online Virtual Network Embedding via Deep Reinforcement Learning","date":"2022-11-25","arxiv_id":"2211.14158","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-team-performance-with-transfer","title":"Enhancing team performance with transfer-learning during real-world human-robot collaboration","date":"2022-11-23","arxiv_id":"2211.13070","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-learning-for-continuous-action","title":"Representation Learning for Continuous Action Spaces is Beneficial for Efficient Policy Learning","date":"2022-11-23","arxiv_id":"2211.13257","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-to-5","title":"A Deep Reinforcement Learning Approach to Rare Event Estimation","date":"2022-11-22","arxiv_id":"2211.12470","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-optimize","title":"A Reinforcement Learning Approach to Optimize Available Network Bandwidth Utilization","date":"2022-11-22","arxiv_id":"2211.11949","repositories_listed":0,"syntology":null},{"url":null,"slug":"don-t-watch-me-a-spatio-temporal-trojan","title":"Don't Watch Me: A Spatio-Temporal Trojan Attack on Deep-Reinforcement-Learning-Augment Autonomous Driving","date":"2022-11-22","arxiv_id":"2211.14440","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-local-feature-with-global-visual","title":"Real-time Local Feature with Global Visual Information Enhancement","date":"2022-11-20","arxiv_id":"2211.10981","repositories_listed":0,"syntology":null},{"url":null,"slug":"structure-enhanced-deep-reinforcement","title":"Structure-Enhanced Deep Reinforcement Learning for Optimal Transmission Scheduling","date":"2022-11-20","arxiv_id":"2211.10827","repositories_listed":0,"syntology":null},{"url":null,"slug":"credit-cognisant-reinforcement-learning-for","title":"Credit-cognisant reinforcement learning for multi-agent cooperation","date":"2022-11-18","arxiv_id":"2211.10100","repositories_listed":0,"syntology":null},{"url":null,"slug":"proactive-resilient-transmission-and","title":"Proactive Resilient Transmission and Scheduling Mechanisms for mmWave Networks","date":"2022-11-17","arxiv_id":"2211.09307","repositories_listed":0,"syntology":null},{"url":null,"slug":"solar-power-driven-ev-charging-optimization","title":"Solar Power driven EV Charging Optimization with Deep Reinforcement Learning","date":"2022-11-17","arxiv_id":"2211.09479","repositories_listed":0,"syntology":null}],"record_sha256":"98e1c02d0467d7b2ab2a7fadb9fa5a4bf477e707dd7ba3f5e8d624c1bbb19bd7","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}