{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/44","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":44,"pages_in_order":59,"rows_per_page":100,"rows":[4301,4400],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/43","next":"/task/deep-reinforcement-learning/papers/45","papers":[{"url":null,"slug":"smart-feasibility-pump-reinforcement-learning","title":"Smart Feasibility Pump: Reinforcement Learning for (Mixed) Integer Programming","date":"2021-02-18","arxiv_id":"2102.09663","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategic-bidding-in-freight-transport-using","title":"Strategic bidding in freight transport using deep reinforcement learning","date":"2021-02-18","arxiv_id":"2102.09253","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-matters-in-using-data-augmentation-for","title":"Efficient Scheduling of Data Augmentation for Deep Reinforcement Learning","date":"2021-02-17","arxiv_id":"2102.08581","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-privacy-utility-trade-off-against-a","title":"Active Privacy-utility Trade-off Against a Hypothesis Testing Adversary","date":"2021-02-16","arxiv_id":"2102.08308","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-larger-networks-for-deep","title":"Training Larger Networks for Deep Reinforcement Learning","date":"2021-02-16","arxiv_id":"2102.07920","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-iot-security-a","title":"Reinforcement Learning for IoT Security: A Comprehensive Survey","date":"2021-02-14","arxiv_id":"2102.07247","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-attention-guided-dynamic-value","title":"Sparse Attention Guided Dynamic Value Estimation for Single-Task Multi-Scene Reinforcement Learning","date":"2021-02-14","arxiv_id":"2102.07266","repositories_listed":0,"syntology":null},{"url":null,"slug":"modelling-cooperation-in-network-games-with","title":"Modelling Cooperation in Network Games with Spatio-Temporal Complexity","date":"2021-02-13","arxiv_id":"2102.06911","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-backup","title":"Deep Reinforcement Learning for Backup Strategies against Adversaries","date":"2021-02-12","arxiv_id":"2102.06632","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalizing-decision-making-for-automated","title":"Generalizing Decision Making for Automated Driving with an Invariant Environment Representation using Deep Reinforcement Learning","date":"2021-02-12","arxiv_id":"2102.06765","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-combinatorial","title":"Deep Reinforcement Learning for Combinatorial Optimization: Covering Salesman Problems","date":"2021-02-11","arxiv_id":"2102.05875","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-portfolio-1","title":"Deep Reinforcement Learning for Portfolio Optimization using Latent Feature State Space (LFSS) Module","date":"2021-02-11","arxiv_id":"2102.06233","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-processor-frequency-adjustment-for","title":"Adaptive Processor Frequency Adjustment for Mobile Edge Computing with Intermittent Energy Supply","date":"2021-02-10","arxiv_id":"2102.05449","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-symmetric","title":"Deep Reinforcement Learning with Symmetric Prior for Predictive Power Allocation to Mobile Users","date":"2021-02-10","arxiv_id":"2103.13298","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-equational-theorem-proving","title":"Learning Equational Theorem Proving","date":"2021-02-10","arxiv_id":"2102.05547","repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-progress-in-deep-reinforcement-1","title":"Measuring Progress in Deep Reinforcement Learning Sample Efficiency","date":"2021-02-09","arxiv_id":"2102.04881","repositories_listed":0,"syntology":null},{"url":null,"slug":"scheduling-the-nasa-deep-space-network-with","title":"Scheduling the NASA Deep Space Network with Deep Reinforcement Learning","date":"2021-02-09","arxiv_id":"2102.05167","repositories_listed":0,"syntology":null},{"url":null,"slug":"corner-case-generation-and-analysis-for","title":"Corner Case Generation and Analysis for Safety Assessment of Autonomous Vehicles","date":"2021-02-06","arxiv_id":"2102.03483","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-model-and-search-for-computer-go","title":"Improving Model and Search for Computer Go","date":"2021-02-06","arxiv_id":"2102.03467","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-for-7","title":"Multi-Agent Deep Reinforcement Learning for Request Dispatching in Distributed-Controller Software-Defined Networking","date":"2021-02-06","arxiv_id":"2103.03022","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-based-heuristic-search-robust","title":"Experience-Based Heuristic Search: Robust Motion Planning with Deep Q-Learning","date":"2021-02-05","arxiv_id":"2102.03127","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-image-1","title":"Deep reinforcement learning-based image classification achieves perfect testing set accuracy for MRI brain tumors with a training set of only 30 images","date":"2021-02-04","arxiv_id":"2102.02895","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-train-your-robot-with-deep","title":"How to Train Your Robot with Deep Reinforcement Learning; Lessons We've Learned","date":"2021-02-04","arxiv_id":"2102.02915","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-abstraction-based-method-to-verify-multi","title":"An Abstraction-based Method to Check Multi-Agent Deep Reinforcement-Learning Behaviors","date":"2021-02-02","arxiv_id":"2102.01434","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximately-solving-mean-field-games-via","title":"Approximately Solving Mean Field Games via Entropy-Regularized Deep Reinforcement Learning","date":"2021-02-02","arxiv_id":"2102.01585","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-reinforcement-learning-de-novo","title":"A step toward a reinforcement learning de novo genome assembler","date":"2021-02-02","arxiv_id":"2102.02649","repositories_listed":0,"syntology":null},{"url":null,"slug":"drldo-a-novel-drl-based-de-obfuscationsystem","title":"DRLDO: A novel DRL based De-ObfuscationSystem for Defense against Metamorphic Malware","date":"2021-02-01","arxiv_id":"2102.00898","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-beamforming-for-mmwave-mu-miso-systems","title":"Hybrid Beamforming for mmWave MU-MISO Systems Exploiting Multi-agent Deep Reinforcement Learning","date":"2021-02-01","arxiv_id":"2102.00735","repositories_listed":0,"syntology":null},{"url":null,"slug":"throughput-optimization-for-grant-free","title":"Throughput Optimization for Grant-Free Multiple Access With Multiagent Deep Reinforcement Learning","date":"2021-02-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-aided-monte-carlo","title":"Deep Reinforcement Learning Aided Monte Carlo Tree Search for MIMO Detection","date":"2021-01-30","arxiv_id":"2102.00178","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-product","title":"Deep Reinforcement Learning-Based Product Recommender for Online Advertising","date":"2021-01-30","arxiv_id":"2102.00333","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-based-vs-model-free-adaptive-control","title":"Learning-based vs Model-free Adaptive Control of a MAV under Wind Gust","date":"2021-01-29","arxiv_id":"2101.12501","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-voltage-control-using-structure","title":"Scalable Voltage Control using Structure-Driven Hierarchical Deep Reinforcement Learning","date":"2021-01-29","arxiv_id":"2102.00077","repositories_listed":0,"syntology":null},{"url":null,"slug":"thermal-control-of-laser-powder-bed-fusion","title":"Thermal Control of Laser Powder Bed Fusion Using Deep Reinforcement Learning","date":"2021-01-29","arxiv_id":"2102.03355","repositories_listed":0,"syntology":null},{"url":null,"slug":"reconfigurable-intelligent-surface-enabled-2","title":"Reconfigurable Intelligent Surface Enabled Vehicular Communication: Joint User Scheduling and Passive Beamforming","date":"2021-01-28","arxiv_id":"2101.12247","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-bi-level-optimization-for","title":"Investigating Bi-Level Optimization for Learning and Vision from a Unified Perspective: A Survey and Beyond","date":"2021-01-27","arxiv_id":"2101.11517","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-minerl-2020-competition-on-sample","title":"The MineRL 2020 Competition on Sample Efficient Reinforcement Learning using Human Priors","date":"2021-01-26","arxiv_id":"2101.11071","repositories_listed":0,"syntology":null},{"url":null,"slug":"gst-group-sparse-training-for-accelerating","title":"GST: Group-Sparse Training for Accelerating Deep Reinforcement Learning","date":"2021-01-24","arxiv_id":"2101.09650","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-intersection-traffic-optimisation-a","title":"Multi-intersection Traffic Optimisation: A Benchmark Dataset and a Strong Baseline","date":"2021-01-24","arxiv_id":"2101.09640","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-setup-policies-reliable-transition","title":"Learning Setup Policies: Reliable Transition Between Locomotion Behaviours","date":"2021-01-23","arxiv_id":"2101.09391","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-hop-ris-empowered-terahertz","title":"Multi-hop RIS-Empowered Terahertz Communications: A DRL-based Hybrid Beamforming Design","date":"2021-01-22","arxiv_id":"2101.09137","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-spatio","title":"Deep Reinforcement Learning with Spatio-temporal Traffic Forecasting for Data-Driven Base Station Sleep Control","date":"2021-01-21","arxiv_id":"2101.08391","repositories_listed":0,"syntology":null},{"url":null,"slug":"collision-free-flocking-with-a-dynamic-squad","title":"Flocking and Collision Avoidance for a Dynamic Squad of Fixed-Wing UAVs Using Deep Reinforcement Learning","date":"2021-01-20","arxiv_id":"2101.08074","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-optimizes","title":"Deep Reinforcement Learning Optimizes Graphene Nanopores for Efficient Desalination","date":"2021-01-19","arxiv_id":"2101.07399","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-embedded-lqr","title":"Deep Reinforcement Learning with Embedded LQR Controllers","date":"2021-01-18","arxiv_id":"2101.07175","repositories_listed":0,"syntology":null},{"url":null,"slug":"stable-deep-reinforcement-learning-method-by","title":"Stable deep reinforcement learning method by predicting uncertainty in rewards as a subtask","date":"2021-01-18","arxiv_id":"2101.06906","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-remote-sensing-image-attribute","title":"Adaptive Remote Sensing Image Attribute Learning for Active Object Detection","date":"2021-01-16","arxiv_id":"2101.06438","repositories_listed":0,"syntology":null},{"url":null,"slug":"affordance-based-reinforcement-learning-for","title":"Affordance-based Reinforcement Learning for Urban Driving","date":"2021-01-15","arxiv_id":"2101.05970","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-haptic-shared","title":"Deep Reinforcement Learning for Haptic Shared Control in Unknown Tasks","date":"2021-01-15","arxiv_id":"2101.06227","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-recommender-1","title":"Reinforcement learning based recommender systems: A survey","date":"2021-01-15","arxiv_id":"2101.06286","repositories_listed":0,"syntology":null},{"url":null,"slug":"cocktail-edge-caching-ride-dynamic-trends-of","title":"Cocktail Edge Caching: Ride Dynamic Trends of Content Popularity with Ensemble Learning","date":"2021-01-14","arxiv_id":"2101.05885","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-the-robustness-of-collaborative","title":"Evaluating the Robustness of Collaborative Agents","date":"2021-01-14","arxiv_id":"2101.05507","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-framework-for-3","title":"A Deep Reinforcement Learning Framework for Eco-driving in Connected and Automated Hybrid Electric Vehicles","date":"2021-01-13","arxiv_id":"2101.05372","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-and-fast-adaptation-for-grid","title":"Learning and Fast Adaptation for Grid Emergency Control via Deep Meta Reinforcement Learning","date":"2021-01-13","arxiv_id":"2101.05317","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-and-scalable-routing-with-multi-agent","title":"Robust and Scalable Routing with Multi-Agent Deep Reinforcement Learning for MANETs","date":"2021-01-09","arxiv_id":"2101.03273","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-quantum","title":"Deep Reinforcement Learning with Quantum-inspired Experience Replay","date":"2021-01-06","arxiv_id":"2101.02034","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-a-curriculum-approach-to-reinforcement","title":"An A* Curriculum Approach to Reinforcement Learning for RGBD Indoor Robot Navigation","date":"2021-01-05","arxiv_id":"2101.01774","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-joint-learning-and-communication-framework","title":"Effective Communications: A Joint Learning and Communication Framework for Multi-Agent Reinforcement Learning over Noisy Channels","date":"2021-01-02","arxiv_id":"2101.10369","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-robust-fuel-optimization-strategy-for","title":"A Robust Fuel Optimization Strategy For Hybrid Electric Vehicles: A Deep Reinforcement Learning Based Continuous Time Design Approach","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-deep-reinforcement-learning-for","title":"A Survey on Deep Reinforcement Learning for Audio-Based Applications","date":"2021-01-01","arxiv_id":"2101.00240","repositories_listed":0,"syntology":null},{"url":null,"slug":"average-reward-reinforcement-learning-with-1","title":"Average Reward Reinforcement Learning with Monotonic Policy Improvement","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-multi-agent-deep-reinforcement","title":"Benchmarking Multi-Agent Deep Reinforcement Learning Algorithms","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bounded-myopic-adversaries-for-deep","title":"Bounded Myopic Adversaries for Deep Reinforcement Learning Agents","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"compute-and-memory-efficient-reinforcement","title":"Compute- and Memory-Efficient Reinforcement Learning with Latent Experience Replay","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-multi-agent-exploration-using","title":"Coordinated Multi-Agent Exploration Using Shared Goals","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-state-self-constraint-for-feature","title":"Cross-State Self-Constraint for Feature Generalization in Deep Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"daylight-assessing-generalization-skills-of","title":"Daylight: Assessing Generalization Skills of Deep Reinforcement Learning Agents","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-from-dynamic-demonstration","title":"Deep Q Learning from Dynamic Demonstration with Behavioral Cloning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-with-low-switching-cost","title":"Deep Q-Learning with Low Switching Cost","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-anti","title":"Deep Reinforcement Learning-based Anti-jamming Power Allocation in a Two-cell NOMA Network","date":"2021-01-01","arxiv_id":"2101.00270","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-adaptive","title":"Deep Reinforcement Learning With Adaptive Combined Critics","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"discrete-predictive-representation-for-long","title":"Discrete Predictive Representation for Long-horizon Planning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-transferability-of-perturbations-in","title":"Exploring Transferability of Perturbations in Deep Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"factored-action-spaces-in-deep-reinforcement","title":"Factored Action Spaces in Deep Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"factoredrl-leveraging-factored-graphs-for","title":"FactoredRL: Leveraging Factored Graphs for Deep Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"genetic-soft-updates-for-policy-evolution-in","title":"Genetic Soft Updates for Policy Evolution in Deep Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-reinforcement-learning-with-1","title":"Interpretable Reinforcement Learning With Neural Symbolic Logic","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsically-guided-exploration-in-meta","title":"Intrinsically Guided Exploration in Meta Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-latent-landmarks-for-generalizable","title":"Learning Latent Landmarks for Generalizable Planning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-predictive-communication-by","title":"Learning Predictive Communication by Imagination in Networked System Control","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"monotonic-robust-policy-optimization-with","title":"Monotonic Robust Policy Optimization with Model Discrepancy","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-exploration-with-backward","title":"Optimistic Exploration with Backward Bootstrapped Bonus for Deep Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pgps-coupling-policy-gradient-with-population","title":"PGPS : Coupling Policy Gradient with Population-based Search","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"playing-atari-with-capsule-networks-a","title":"Playing Atari with Capsule Networks: A systematic comparison of CNN and CapsNets-based agents.","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"practical-marginalized-importance-sampling","title":"Practical Marginalized Importance Sampling with the Successor Representation","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reaper-improving-sample-efficiency-in-model","title":"ReaPER: Improving Sample Efficiency in Model-Based Latent Imagination","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"simple-augmentation-goes-a-long-way-adrl-for","title":"Simple Augmentation Goes a Long Way: ADRL for DNN Quantization","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-and-leveraging-causal-relations","title":"Understanding and Leveraging Causal Relations in Deep Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"using-deep-reinforcement-learning-to-train","title":"Using Deep Reinforcement Learning to Train and Evaluate Instructional Sequencing Policies for an Intelligent Tutoring System","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"weighted-bellman-backups-for-improved-signal","title":"Weighted Bellman Backups for Improved Signal-to-Noise in Q-Updates","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-maintenance-in-iot-networks-via","title":"Autonomous Maintenance in IoT Networks via AoI-driven Deep Reinforcement Learning","date":"2020-12-31","arxiv_id":"2012.15548","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-based-deep-reinforcement-learning","title":"Curriculum-based Deep Reinforcement Learning for Quantum Control","date":"2020-12-31","arxiv_id":"2012.15427","repositories_listed":0,"syntology":null},{"url":null,"slug":"relational-deep-reinforcement-learning-for","title":"Relational Deep Reinforcement Learning for Routing in Wireless Networks","date":"2020-12-31","arxiv_id":"2012.15700","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-grasping-of-fully-occluded-objects","title":"Robotic Grasping of Fully-Occluded Objects using RF Perception","date":"2020-12-31","arxiv_id":"2012.15436","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-based-multi","title":"A Deep Reinforcement Learning Based Multi-Criteria Decision Support System for Textile Manufacturing Process Optimization","date":"2020-12-29","arxiv_id":"2012.14794","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-ai-and-intelligent-reflecting","title":"Leveraging AI and Intelligent Reflecting Surface for Energy-Efficient Communication in 6G IoT","date":"2020-12-29","arxiv_id":"2012.14716","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-multi-agent-actor-critic-learning","title":"Federated Multi-Agent Actor-Critic Learning for Age Sensitive Mobile Edge Computing","date":"2020-12-28","arxiv_id":"2012.14137","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-deep-rl-variance-constrained","title":"Risk-Sensitive Deep RL: Variance-Constrained Actor-Critic Provably Finds Globally Optimal Policy","date":"2020-12-28","arxiv_id":"2012.14098","repositories_listed":0,"syntology":null},{"url":null,"slug":"portfolio-optimization-with-2d-relative","title":"Portfolio Optimization with 2D Relative-Attentional Gated Transformer","date":"2020-12-27","arxiv_id":"2101.03138","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-sample-efficient-episodic-control","title":"Towards sample-efficient episodic control with DAC-ML","date":"2020-12-26","arxiv_id":"2012.13779","repositories_listed":0,"syntology":null}],"record_sha256":"5b98abc20ea12816179b8d5598b41733f755e0d175232af7477048dbccca7561","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}