{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/43","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":43,"pages_in_order":59,"rows_per_page":100,"rows":[4201,4300],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/42","next":"/task/deep-reinforcement-learning/papers/44","papers":[{"url":null,"slug":"network-wide-traffic-signal-control","title":"Network-wide traffic signal control optimization using a multi-agent deep reinforcement learning","date":"2021-04-20","arxiv_id":"2104.09936","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-synthesis-of-verified-controllers-in","title":"Scalable Synthesis of Verified Controllers in Deep Reinforcement Learning","date":"2021-04-20","arxiv_id":"2104.10219","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-learning-for-financial-markets","title":"Adaptive learning for financial markets mixing model-based and model-free RL for volatility targeting","date":"2021-04-19","arxiv_id":"2104.10483","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-in-a-monetary","title":"Deep Reinforcement Learning in a Monetary Model","date":"2021-04-19","arxiv_id":"2104.09368","repositories_listed":0,"syntology":null},{"url":null,"slug":"mt-opt-continuous-multi-task-robotic","title":"MT-Opt: Continuous Multi-Task Robotic Reinforcement Learning at Scale","date":"2021-04-16","arxiv_id":"2104.08212","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-attention-for-multi-agent-coordination","title":"Joint Attention for Multi-Agent Coordination and Social Learning","date":"2021-04-15","arxiv_id":"2104.07750","repositories_listed":0,"syntology":null},{"url":null,"slug":"gan-based-interactive-reinforcement-learning","title":"GAN-Based Interactive Reinforcement Learning from Demonstration and Human Evaluative Feedback","date":"2021-04-14","arxiv_id":"2104.06600","repositories_listed":0,"syntology":null},{"url":null,"slug":"gridtopix-training-embodied-agents-with","title":"GridToPix: Training Embodied Agents with Minimal Supervision","date":"2021-04-14","arxiv_id":"2105.00931","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-comfort-aware-reinforcement-learning","title":"Visual Comfort Aware-Reinforcement Learning for Depth Adjustment of Stereoscopic 3D Images","date":"2021-04-14","arxiv_id":"2104.06782","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-the-long-term-average-reward-for","title":"Optimizing the Long-Term Average Reward for Continuing MDPs: A Technical Report","date":"2021-04-13","arxiv_id":"2104.06139","repositories_listed":0,"syntology":null},{"url":null,"slug":"thief-beware-of-what-get-you-there-towards","title":"Thief, Beware of What Get You There: Towards Understanding Model Extraction Attack","date":"2021-04-13","arxiv_id":"2104.05921","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-controller","title":"Deep Reinforcement Learning Based Controller for Active Heave Compensation","date":"2021-04-12","arxiv_id":"2104.05599","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-matching-markets-in-power-grid","title":"Dynamic Matching Markets in Power Grid: Concepts and Solution using Deep Reinforcement Learning","date":"2021-04-12","arxiv_id":"2104.05654","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-goal-conditioned-policy-with-intrinsic-1","title":"Learn Goal-Conditioned Policy with Intrinsic Motivation for Deep Reinforcement Learning","date":"2021-04-11","arxiv_id":"2104.05043","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-based-energy","title":"A Reinforcement-Learning-Based Energy-Efficient Framework for Multi-Task Video Analytics Pipeline","date":"2021-04-09","arxiv_id":"2104.04443","repositories_listed":0,"syntology":null},{"url":null,"slug":"jamming-resilient-path-planning-for-multiple","title":"Jamming-Resilient Path Planning for Multiple UAVs via Deep Reinforcement Learning","date":"2021-04-09","arxiv_id":"2104.04477","repositories_listed":0,"syntology":null},{"url":null,"slug":"symmetry-reduction-for-deep-reinforcement","title":"Symmetry reduction for deep reinforcement learning active control of chaotic spatiotemporal dynamics","date":"2021-04-09","arxiv_id":"2104.05437","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-conditioned-distributional-soft-actor","title":"Risk-Conditioned Distributional Soft Actor-Critic for Risk-Sensitive Navigation","date":"2021-04-07","arxiv_id":"2104.03111","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-deep-reinforcement-learning-for-3","title":"Distributed Deep Reinforcement Learning for Collaborative Spectrum Sharing","date":"2021-04-06","arxiv_id":"2104.02059","repositories_listed":0,"syntology":null},{"url":null,"slug":"zeus-efficiently-localizing-actions-in-videos","title":"Zeus: Efficiently Localizing Actions in Videos using Reinforcement Learning","date":"2021-04-06","arxiv_id":"2104.06142","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-powered-irs","title":"Deep Reinforcement Learning Powered IRS-Assisted Downlink NOMA","date":"2021-04-03","arxiv_id":"2104.01414","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-based-uav-trajectory-optimization","title":"Learning-Based UAV Trajectory Optimization with Collision Avoidance and Connectivity Constraints","date":"2021-04-03","arxiv_id":"2104.06256","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-double-deep-q-learning-for-joint","title":"Federated Double Deep Q-learning for Joint Delay and Energy Minimization in IoT networks","date":"2021-04-02","arxiv_id":"2104.11320","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-dose-helical-cbct-denoising-by-using","title":"Low Dose Helical CBCT denoising by using domain filtering with deep reinforcement learning","date":"2021-04-02","arxiv_id":"2104.00889","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapool-a-diurnal-adaptive-fleet-management","title":"AdaPool: A Diurnal-Adaptive Fleet Management Framework using Model-Free Deep Reinforcement Learning and Change Point Detection","date":"2021-04-01","arxiv_id":"2104.00203","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-constrained","title":"Deep Reinforcement Learning for Constrained Field Development Optimization in Subsurface Two-phase Flow","date":"2021-03-31","arxiv_id":"2104.00527","repositories_listed":0,"syntology":null},{"url":null,"slug":"ris-assisted-uav-for-timely-data-collection","title":"RIS-Assisted UAV for Timely Data Collection in IoT Networks","date":"2021-03-31","arxiv_id":"2103.17162","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlad-time-series-anomaly-detection-through","title":"RLAD: Time Series Anomaly Detection through Reinforcement Learning and Active Learning","date":"2021-03-31","arxiv_id":"2104.00543","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-heterogeneous-general-equilibrium","title":"Solving Heterogeneous General Equilibrium Economic Models with Deep Reinforcement Learning","date":"2021-03-31","arxiv_id":"2103.16977","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmenting-automated-game-testing-with-deep","title":"Augmenting Automated Game Testing with Deep Reinforcement Learning","date":"2021-03-29","arxiv_id":"2103.15819","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-of-event","title":"Deep reinforcement learning of event-triggered communication and control for multi-agent cooperative transport","date":"2021-03-29","arxiv_id":"2103.15260","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-resource-management-for-mc-noma-a-deep","title":"Joint Resource Management for MC-NOMA: A Deep Reinforcement Learning Approach","date":"2021-03-29","arxiv_id":"2103.15371","repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-sample-efficiency-and","title":"Measuring Sample Efficiency and Generalization in Reinforcement Learning Benchmarks: NeurIPS 2020 Procgen Benchmark","date":"2021-03-29","arxiv_id":"2103.15332","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowru-knowledge-reusing-via-knowledge","title":"KnowRU: Knowledge Reusing via Knowledge Distillation in Multi-agent Reinforcement Learning","date":"2021-03-27","arxiv_id":"2103.14891","repositories_listed":0,"syntology":null},{"url":null,"slug":"barrier-function-based-safe-reinforcement","title":"Barrier Function-based Safe Reinforcement Learning for Emergency Control of Power Systems","date":"2021-03-26","arxiv_id":"2103.14186","repositories_listed":0,"syntology":null},{"url":null,"slug":"segvisrl-visuomotor-development-for-a-lunar","title":"SegVisRL: Visuomotor Development for a Lunar Rover for Hazard Avoidance using Camera Images","date":"2021-03-26","arxiv_id":"2103.14422","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-meta-reinforcement-learning-approach-to","title":"A Meta-Reinforcement Learning Approach to Process Control","date":"2021-03-25","arxiv_id":"2103.14060","repositories_listed":0,"syntology":null},{"url":null,"slug":"aoa-based-pilot-assignment-in-massive-mimo","title":"AoA-Based Pilot Assignment in Massive MIMO Systems Using Deep Reinforcement Learning","date":"2021-03-25","arxiv_id":"2103.13791","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-program-triggered-reinforcement","title":"Hierarchical Program-Triggered Reinforcement Learning Agents For Automated Driving","date":"2021-03-25","arxiv_id":"2103.13861","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-gradient-convergence-bound-of-federated","title":"The Gradient Convergence Bound of Federated Multi-Agent Reinforcement Learning with Efficient Communication","date":"2021-03-24","arxiv_id":"2103.13026","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-the-generalization-performance-and","title":"IPAPRec: A promising tool for learning high-performance mapless navigation skills with deep reinforcement learning","date":"2021-03-22","arxiv_id":"2103.11686","repositories_listed":0,"syntology":null},{"url":null,"slug":"smart-scheduling-based-on-deep-reinforcement","title":"Smart Scheduling based on Deep Reinforcement Learning for Cellular Networks","date":"2021-03-22","arxiv_id":"2103.11542","repositories_listed":0,"syntology":null},{"url":null,"slug":"maast-map-attention-with-semantic","title":"MaAST: Map Attention with Semantic Transformersfor Efficient Visual Navigation","date":"2021-03-21","arxiv_id":"2103.11374","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-multi-modal-policies-for-industrial","title":"Robust Multi-Modal Policies for Industrial Assembly via Reinforcement Learning and Demonstrations: A Large-Scale Study","date":"2021-03-21","arxiv_id":"2103.11512","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-pessimism-with-optimism-for-robust","title":"Combining Pessimism with Optimism for Robust and Efficient Model-Based Deep Reinforcement Learning","date":"2021-03-18","arxiv_id":"2103.10369","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-aided-ran-slicing","title":"Deep Reinforcement Learning-Aided RAN Slicing Enforcement for B5G Latency Sensitive Services","date":"2021-03-18","arxiv_id":"2103.10277","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-synthesis-for-data-augmentation-in","title":"Image Synthesis for Data Augmentation in Medical CT using Deep Reinforcement Learning","date":"2021-03-18","arxiv_id":"2103.10493","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-reinforcement-learning-for","title":"Decentralized Reinforcement Learning for Multi-Target Search and Detection by a Team of Drones","date":"2021-03-17","arxiv_id":"2103.09520","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-organizing-mmwave-mimo-cell-free","title":"Self-Organizing mmWave MIMO Cell-Free Networks With Hybrid Beamforming: A Hierarchical DRL-Based Design","date":"2021-03-17","arxiv_id":"2103.11823","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-curriculum-reinforcement-learning-for","title":"Goal-constrained Sparse Reinforcement Learning for End-to-End Driving","date":"2021-03-16","arxiv_id":"2103.09189","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-drone-racing-with-deep","title":"Autonomous Drone Racing with Deep Reinforcement Learning","date":"2021-03-15","arxiv_id":"2103.08624","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-symbolic-rules-for-interpretable","title":"Learning Symbolic Rules for Interpretable Deep Reinforcement Learning","date":"2021-03-15","arxiv_id":"2103.08228","repositories_listed":0,"syntology":null},{"url":null,"slug":"modelling-human-kinetics-and-kinematics","title":"Modelling Human Kinetics and Kinematics during Walking using Reinforcement Learning","date":"2021-03-15","arxiv_id":"2103.08125","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulation-studies-on-deep-reinforcement","title":"Simulation Studies on Deep Reinforcement Learning for Building Control with Human Interaction","date":"2021-03-14","arxiv_id":"2103.07919","repositories_listed":0,"syntology":null},{"url":null,"slug":"success-weighted-by-completion-time-a","title":"Success Weighted by Completion Time: A Dynamics-Aware Evaluation Criteria for Embodied Navigation","date":"2021-03-14","arxiv_id":"2103.08022","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-sequential-decision-making-with","title":"Optimal sequential decision making with probabilistic digital twins","date":"2021-03-12","arxiv_id":"2103.07405","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-vision-based-deep-reinforcement-learning","title":"A Vision Based Deep Reinforcement Learning Algorithm for UAV Obstacle Avoidance","date":"2021-03-11","arxiv_id":"2103.06403","repositories_listed":0,"syntology":null},{"url":null,"slug":"age-of-information-optimization-in-a-ris","title":"Age of Information Optimization in a RIS-Assisted Wireless Network","date":"2021-03-11","arxiv_id":"2103.06405","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-the-hidden-activations-of-deep","title":"Analyzing the Hidden Activations of Deep Policy Networks: Why Representation Matters","date":"2021-03-11","arxiv_id":"2103.06398","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-high-speed-running-for-quadruped","title":"Robust High-speed Running for Quadruped Robots via Deep Reinforcement Learning","date":"2021-03-11","arxiv_id":"2103.06484","repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-learning-for-massive-industrial","title":"Machine Learning for Massive Industrial Internet of Things","date":"2021-03-10","arxiv_id":"2103.08308","repositories_listed":0,"syntology":null},{"url":null,"slug":"i-am-robot-neuromuscular-reinforcement","title":"I am Robot: Neuromuscular Reinforcement Learning to Actuate Human Limbs through Functional Electrical Stimulation","date":"2021-03-09","arxiv_id":"2103.05349","repositories_listed":0,"syntology":null},{"url":null,"slug":"pretraining-reward-free-representations-for","title":"Pretraining Reward-Free Representations for Data-Efficient Reinforcement Learning","date":"2021-03-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-energy-saving-snake-locomotion-gait-policy","title":"An Energy-Saving Snake Locomotion Gait Policy Obtained Using Deep Reinforcement Learning","date":"2021-03-08","arxiv_id":"2103.04511","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-world-ride-hailing-vehicle-repositioning","title":"Real-world Ride-hailing Vehicle Repositioning using Deep Reinforcement Learning","date":"2021-03-08","arxiv_id":"2103.04555","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-based-mobile-robotics-obstacle","title":"Vision-Based Mobile Robotics Obstacle Avoidance With Deep Reinforcement Learning","date":"2021-03-08","arxiv_id":"2103.04727","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-coding-and-scheduling-optimization-for","title":"Joint Coding and Scheduling Optimization for Distributed Learning over Wireless Edge Networks","date":"2021-03-07","arxiv_id":"2103.04303","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-resource-management-for-providing-qos","title":"Dynamic Resource Management for Providing QoS in Drone Delivery Systems","date":"2021-03-06","arxiv_id":"2103.04015","repositories_listed":0,"syntology":null},{"url":null,"slug":"passing-through-narrow-gaps-with-deep","title":"Passing Through Narrow Gaps with Deep Reinforcement Learning","date":"2021-03-06","arxiv_id":"2103.03991","repositories_listed":0,"syntology":null},{"url":null,"slug":"saint-acc-safety-aware-intelligent-adaptive","title":"SAINT-ACC: Safety-Aware Intelligent Adaptive Cruise Control for Autonomous Vehicles Using Deep Reinforcement Learning","date":"2021-03-06","arxiv_id":"2104.06506","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-explanation-using-attention-mechanism-1","title":"Visual Explanation using Attention Mechanism in Actor-Critic-based Deep Reinforcement Learning","date":"2021-03-06","arxiv_id":"2103.04067","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-you-fix-my-neural-network-real-time","title":"Can You Fix My Neural Network? Real-Time Adaptive Waveform Synthesis for Resilient Wireless Signal Classification","date":"2021-03-05","arxiv_id":"2103.03745","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-in-medical","title":"Deep reinforcement learning in medical imaging: A literature review","date":"2021-03-05","arxiv_id":"2103.05115","repositories_listed":0,"syntology":null},{"url":null,"slug":"routing-algorithms-as-tools-for-integrating","title":"Routing algorithms as tools for integrating social distancing with emergency evacuation","date":"2021-03-05","arxiv_id":"2103.03413","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuromechanics-based-deep-reinforcement","title":"Neuromechanics-based Deep Reinforcement Learning of Neurostimulation Control in FES cycling","date":"2021-03-04","arxiv_id":"2103.03057","repositories_listed":0,"syntology":null},{"url":null,"slug":"addressing-action-oscillations-through","title":"Addressing Action Oscillations through Learning Policy Inertia","date":"2021-03-03","arxiv_id":"2103.02287","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-orientation","title":"Reinforcement Learning for Orientation Estimation Using Inertial Sensors with Performance Guarantee","date":"2021-03-03","arxiv_id":"2103.02357","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-external-1","title":"Reinforcement Learning with External Knowledge by using Logical Neural Networks","date":"2021-03-03","arxiv_id":"2103.02363","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-play-learning-strategies-for-resource","title":"Self-play Learning Strategies for Resource Assignment in Open-RAN Networks","date":"2021-03-03","arxiv_id":"2103.02649","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-mimo-control-of-room-temperature","title":"Data-driven control of room temperature and bidirectional EV charging using deep reinforcement learning: simulations and experiments","date":"2021-03-02","arxiv_id":"2103.01886","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-navigation-of-an-ultrasound-probe","title":"Autonomous Navigation of an Ultrasound Probe Towards Standard Scan Planes with Deep Reinforcement Learning","date":"2021-03-01","arxiv_id":"2103.00718","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-monopoly-gameplay-a-hybrid-model","title":"Decision Making in Monopoly using a Hybrid Deep Reinforcement Learning Approach","date":"2021-03-01","arxiv_id":"2103.00683","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-adaptive-mesh","title":"Reinforcement Learning for Adaptive Mesh Refinement","date":"2021-03-01","arxiv_id":"2103.01342","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-load-shedding-for-grid-emergency","title":"Adaptive Load Shedding for Grid Emergency Control via Deep Reinforcement Learning","date":"2021-02-25","arxiv_id":"2102.12908","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-resource-block-and-beamforming","title":"Radio Resource Management for Cellular-Connected UAV: A Learning Approach","date":"2021-02-25","arxiv_id":"2102.13222","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-regret-reinforcement-learning-with-heavy","title":"No-Regret Reinforcement Learning with Heavy-Tailed Rewards","date":"2021-02-25","arxiv_id":"2102.12769","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-effect-of-auxiliary-tasks-on","title":"On The Effect of Auxiliary Tasks on Representation Dynamics","date":"2021-02-25","arxiv_id":"2102.13089","repositories_listed":0,"syntology":null},{"url":null,"slug":"where-to-go-next-learning-a-subgoal","title":"Where to go next: Learning a Subgoal Recommendation Policy for Navigation Among Pedestrians","date":"2021-02-25","arxiv_id":"2102.13073","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-safe-landing","title":"Deep Reinforcement Learning for Safe Landing Site Selection with Concurrent Consideration of Divert Maneuvers","date":"2021-02-24","arxiv_id":"2102.12432","repositories_listed":0,"syntology":null},{"url":null,"slug":"fixar-a-fixed-point-deep-reinforcement","title":"FIXAR: A Fixed-Point Deep Reinforcement Learning Platform with Quantization-Aware Training and Adaptive Parallelism","date":"2021-02-24","arxiv_id":"2102.12103","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-invariant-nbv-planner-for-active-cross","title":"Domain-invariant NBV Planner for Active Cross-domain Self-localization","date":"2021-02-23","arxiv_id":"2102.11530","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-dynamic-3","title":"Deep Reinforcement Learning for Dynamic Spectrum Sharing of LTE and NR","date":"2021-02-22","arxiv_id":"2102.11176","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-learning-of-robot-manipulation-tasks","title":"Improved Learning of Robot Manipulation Tasks via Tactile Intrinsic Motivation","date":"2021-02-22","arxiv_id":"2102.11051","repositories_listed":0,"syntology":null},{"url":null,"slug":"return-based-contrastive-representation-1","title":"Return-Based Contrastive Representation Learning for Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.10960","repositories_listed":0,"syntology":null},{"url":null,"slug":"stratified-experience-replay-correcting","title":"Stratified Experience Replay: Correcting Multiplicity Bias in Off-Policy Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.11319","repositories_listed":0,"syntology":null},{"url":null,"slug":"qoe-optimization-for-live-video-streaming-in","title":"QoE Optimization for Live Video Streaming in UAV-to-UAV Communications via Deep Reinforcement Learning","date":"2021-02-21","arxiv_id":"2102.10637","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-train-your-heron","title":"How To Train Your HERON","date":"2021-02-20","arxiv_id":"2102.10357","repositories_listed":0,"syntology":null},{"url":null,"slug":"tacticzero-learning-to-prove-theorems-from","title":"TacticZero: Learning to Prove Theorems from Scratch with Deep Reinforcement Learning","date":"2021-02-19","arxiv_id":"2102.09756","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-preserving-teacher-student-deep","title":"Privacy-Preserving Kickstarting Deep Reinforcement Learning with Privacy-Aware Learners","date":"2021-02-18","arxiv_id":"2102.09599","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-beam-pattern","title":"Reinforcement Learning for Beam Pattern Design in Millimeter Wave and Massive MIMO Systems","date":"2021-02-18","arxiv_id":"2102.09084","repositories_listed":0,"syntology":null}],"record_sha256":"55bec5f6cde1a7ea3f31e11a1e2a754a362f1e19ca78f0ef0000164e3c5cc8c6","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}