{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/38","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":38,"pages_in_order":59,"rows_per_page":100,"rows":[3701,3800],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/37","next":"/task/deep-reinforcement-learning/papers/39","papers":[{"url":null,"slug":"a-discourse-on-metods-meta-optimized","title":"Meta-Reinforcement Learning with Self-Modifying Networks","date":"2022-02-04","arxiv_id":"2202.02363","repositories_listed":0,"syntology":null},{"url":null,"slug":"malleable-agents-for-re-configurable-robotic","title":"Malleable Agents for Re-Configurable Robotic Manipulators","date":"2022-02-04","arxiv_id":"2202.02395","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-assisted","title":"Deep Reinforcement Learning Assisted Federated Learning Algorithm for Data Management of IIoT","date":"2022-02-03","arxiv_id":"2202.03575","repositories_listed":0,"syntology":null},{"url":null,"slug":"network-resource-allocation-strategy-based-on","title":"Network Resource Allocation Strategy Based on Deep Reinforcement Learning","date":"2022-02-03","arxiv_id":"2202.03193","repositories_listed":0,"syntology":null},{"url":null,"slug":"space-air-ground-integrated-multi-domain","title":"Space-Air-Ground Integrated Multi-domain Network Resource Orchestration based on Virtual Network Architecture: a DRL Method","date":"2022-02-03","arxiv_id":"2202.02459","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-reinforcement-learning-for","title":"Federated Reinforcement Learning for Collective Navigation of Robotic Swarms","date":"2022-02-02","arxiv_id":"2202.01141","repositories_listed":0,"syntology":null},{"url":null,"slug":"dexvip-learning-dexterous-grasping-with-human","title":"DexVIP: Learning Dexterous Grasping with Human Hand Pose Priors from Video","date":"2022-02-01","arxiv_id":"2202.00164","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-sample-efficiency-of-value-based","title":"Improving Sample Efficiency of Value Based Models Using Attention and Vision Transformers","date":"2022-02-01","arxiv_id":"2202.00710","repositories_listed":0,"syntology":null},{"url":null,"slug":"planner-reasoner-inside-a-multi-task","title":"PRIMA: Planner-Reasoner Inside a Multi-task Reasoning Agent","date":"2022-02-01","arxiv_id":"2202.00531","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-optimal-active","title":"Reinforcement learning of optimal active particle navigation","date":"2022-02-01","arxiv_id":"2202.00812","repositories_listed":0,"syntology":null},{"url":null,"slug":"underwater-differential-game-finite-time","title":"Underwater Differential Game: Finite-Time Target Hunting Task with Communication Delay","date":"2022-02-01","arxiv_id":"2202.00329","repositories_listed":0,"syntology":null},{"url":null,"slug":"warmth-and-competence-in-human-agent","title":"Warmth and competence in human-agent cooperation","date":"2022-01-31","arxiv_id":"2201.13448","repositories_listed":0,"syntology":null},{"url":null,"slug":"dearfsac-an-approach-to-optimizing-unreliable","title":"DearFSAC: An Approach to Optimizing Unreliable Federated Learning via Deep Reinforcement Learning","date":"2022-01-30","arxiv_id":"2201.12701","repositories_listed":0,"syntology":null},{"url":null,"slug":"deeprng-towards-deep-reinforcement-learning","title":"DeepRNG: Towards Deep Reinforcement Learning-Assisted Generative Testing of Software","date":"2022-01-29","arxiv_id":"2201.12602","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-exploration-deep-reinforcement","title":"Overcoming Exploration: Deep Reinforcement Learning for Continuous Control in Cluttered Environments from Temporal Logic Specifications","date":"2022-01-28","arxiv_id":"2201.12231","repositories_listed":0,"syntology":null},{"url":null,"slug":"adam-based-augmented-random-search-for","title":"Adam-based Augmented Random Search for Control Policies for Distributed Energy Resource Cyber Attack Mitigation","date":"2022-01-27","arxiv_id":"2201.11825","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperparameter-tuning-for-deep-reinforcement","title":"Hyperparameter Tuning for Deep Reinforcement Learning Applications","date":"2022-01-26","arxiv_id":"2201.11182","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-deep-reinforcement-learning-for-zero","title":"Using Deep Reinforcement Learning for Zero Defect Smart Forging","date":"2022-01-25","arxiv_id":"2201.10268","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-intravascular-ultrasound-imaging","title":"Accelerated Intravascular Ultrasound Imaging using Deep Reinforcement Learning","date":"2022-01-24","arxiv_id":"2201.09522","repositories_listed":0,"syntology":null},{"url":"/paper/evolution-gym-a-large-scale-benchmark-for-1","slug":"evolution-gym-a-large-scale-benchmark-for-1","title":"Evolution Gym: A Large-Scale Benchmark for Evolving Soft Robots","date":"2022-01-24","arxiv_id":"2201.09863","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-reinforcement-learning-for-wireless","title":"Large-Scale Graph Reinforcement Learning in Wireless Control Systems","date":"2022-01-24","arxiv_id":"2201.09859","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-under-signal","title":"Deep reinforcement learning under signal temporal logic constraints using Lagrangian relaxation","date":"2022-01-21","arxiv_id":"2201.08504","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-spiking-q","title":"Deep Reinforcement Learning with Spiking Q-learning","date":"2022-01-21","arxiv_id":"2201.09754","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-two-step-hybrid-policy-for-graph-1","title":"Learning Two-Step Hybrid Policy for Graph-Based Interpretable Reinforcement Learning","date":"2022-01-21","arxiv_id":"2201.08520","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-prescriptive-dirichlet-power-allocation","title":"A Prescriptive Dirichlet Power Allocation Policy with Deep Reinforcement Learning","date":"2022-01-20","arxiv_id":"2201.08445","repositories_listed":0,"syntology":null},{"url":null,"slug":"edgemap-crowdsourcing-high-definition-map-in","title":"EdgeMap: CrowdSourcing High Definition Map in Automotive Edge Computing","date":"2022-01-20","arxiv_id":"2201.07973","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancement-or-super-resolution-learning","title":"Enhancement or Super-Resolution: Learning-based Adaptive Video Streaming with Client-Side Video Processing","date":"2022-01-20","arxiv_id":"2201.08197","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-allocation-algorithm-for-mec-based","title":"Resource allocation algorithm for MEC based on Deep Reinforcement Learning","date":"2022-01-20","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-awareness-safety-of-deep-reinforcement","title":"Self-Awareness Safety of Deep Reinforcement Learning in Road Traffic Junction Driving","date":"2022-01-20","arxiv_id":"2201.08116","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-reinforcement-learning-based-eco","title":"Hybrid Reinforcement Learning-Based Eco-Driving Strategy for Connected and Automated Vehicles at Signalized Intersections","date":"2022-01-19","arxiv_id":"2201.07833","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-representation-learning-with","title":"Accelerating Representation Learning with View-Consistent Dynamics in Data-Efficient Reinforcement Learning","date":"2022-01-18","arxiv_id":"2201.07016","repositories_listed":0,"syntology":null},{"url":null,"slug":"k-nearest-multi-agent-deep-reinforcement","title":"K-nearest Multi-agent Deep Reinforcement Learning for Collaborative Tasks with a Variable Number of Agents","date":"2022-01-18","arxiv_id":"2201.07092","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-by-random-network-distillation-1","title":"Exploration by Random Network Distillation","date":"2022-01-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"summarising-and-comparing-agent-dynamics-with","title":"Summarising and Comparing Agent Dynamics with Contrastive Spatiotemporal Abstraction","date":"2022-01-17","arxiv_id":"2201.07749","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-37-implementation-details-of-proximal","title":"The 37 Implementation Details of Proximal Policy Optimization","date":"2022-01-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-family-of-cognitively-realistic-parsing","title":"A Family of Cognitively Realistic Parsing Environments for Deep Reinforcement Learning","date":"2022-01-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-deep-reinforcement","title":"Cooperative Multi-Agent Deep Reinforcement Learning for Reliable Surveillance via Autonomous Multi-UAV Control","date":"2022-01-15","arxiv_id":"2201.05843","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-shared","title":"Deep Reinforcement Learning for Shared Autonomous Vehicles (SAV) Fleet Management","date":"2022-01-15","arxiv_id":"2201.05720","repositories_listed":0,"syntology":null},{"url":null,"slug":"profitable-strategy-design-by-using-deep","title":"Profitable Strategy Design by Using Deep Reinforcement Learning for Trades on Cryptocurrency Markets","date":"2022-01-15","arxiv_id":"2201.05906","repositories_listed":0,"syntology":null},{"url":null,"slug":"recursive-least-squares-advantage-actor","title":"Recursive Least Squares Advantage Actor-Critic Algorithms","date":"2022-01-15","arxiv_id":"2201.05918","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-reinforcement-learning-an-overview","title":"Automated Reinforcement Learning: An Overview","date":"2022-01-13","arxiv_id":"2201.05000","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-action-selection-for-gradient","title":"Evolutionary Action Selection for Gradient-based Policy Learning","date":"2022-01-12","arxiv_id":"2201.04286","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-echelon-supply-chains-with-uncertain","title":"Multi-echelon Supply Chains with Uncertain Seasonal Demands and Lead Times Using Deep Reinforcement Learning","date":"2022-01-12","arxiv_id":"2201.04651","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-deep-reinforcement-learning","title":"Benchmarking Deep Reinforcement Learning Algorithms for Vision-based Robotics","date":"2022-01-11","arxiv_id":"2201.04224","repositories_listed":0,"syntology":null},{"url":null,"slug":"smartdet-context-aware-dynamic-control-of","title":"SmartDet: Context-Aware Dynamic Control of Edge Task Offloading for Mobile Object Detection","date":"2022-01-11","arxiv_id":"2201.04235","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-independent-capsule-based-agents-for","title":"Task Independent Capsule-Based Agents for Deep Q-Learning","date":"2022-01-11","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-adaptive-device-edge-co-inference","title":"An Adaptive Device-Edge Co-Inference Framework Based on Soft Actor-Critic","date":"2022-01-09","arxiv_id":"2201.02968","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-policy-loss-and-planning","title":"Assessing Policy, Loss and Planning Combinations in Reinforcement Learning using a New Modular Architecture","date":"2022-01-08","arxiv_id":"2201.02874","repositories_listed":0,"syntology":null},{"url":null,"slug":"supervised-permutation-invariant-networks-for-1","title":"Supervised Permutation Invariant Networks for Solving the CVRP with Bounded Fleet Size","date":"2022-01-05","arxiv_id":"2201.01529","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-1","title":"Deep Reinforcement Learning, a textbook","date":"2022-01-04","arxiv_id":"2201.02135","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-control-policies-for-fall-prevention","title":"Learning Control Policies for Fall prevention and safety in bipedal locomotion","date":"2022-01-04","arxiv_id":"2201.01361","repositories_listed":0,"syntology":null},{"url":null,"slug":"finding-general-equilibria-in-many-agent-1","title":"Analyzing Micro-Founded General Equilibrium Models with Many Agents using Deep Reinforcement Learning","date":"2022-01-03","arxiv_id":"2201.01163","repositories_listed":0,"syntology":null},{"url":null,"slug":"ame-attention-and-memory-enhancement-in-hyper","title":"AME: Attention and Memory Enhancement in Hyper-Parameter Optimization","date":"2022-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"symmetry-aware-neural-architecture-for-1","title":"Symmetry-Aware Neural Architecture for Embodied Visual Exploration","date":"2022-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-complementarity-guided-reinforcement","title":"Temporal Complementarity-Guided Reinforcement Learning for Image-to-Video Person Re-Identification","date":"2022-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"single-shot-pruning-for-offline-reinforcement","title":"Single-Shot Pruning for Offline Reinforcement Learning","date":"2021-12-31","arxiv_id":"2112.15579","repositories_listed":0,"syntology":null},{"url":null,"slug":"ddpg-car-following-model-with-real-world","title":"Modified DDPG car-following model with a real-world human driving experience with CARLA simulator","date":"2021-12-29","arxiv_id":"2112.14602","repositories_listed":0,"syntology":null},{"url":null,"slug":"embodied-learning-for-lifelong-visual","title":"Embodied Learning for Lifelong Visual Perception","date":"2021-12-28","arxiv_id":"2112.14084","repositories_listed":0,"syntology":null},{"url":null,"slug":"2112-13937","title":"Multiagent Model-based Credit Assignment for Continuous Control","date":"2021-12-27","arxiv_id":"2112.13937","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-machine-learning-pipeline-for-autonomous","title":"A machine learning pipeline for autonomous numerical analytic continuation of Dyson-Schwinger equations","date":"2021-12-24","arxiv_id":"2112.13011","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-interpretable-reinforcement","title":"A Survey on Interpretable Reinforcement Learning","date":"2021-12-24","arxiv_id":"2112.13112","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-neuroevolution-squeezes-more-out-of","title":"Deep Neuroevolution Squeezes More out of Small Neural Networks and Small Training Sets: Sample Application to MRI Brain Sequence Classification","date":"2021-12-24","arxiv_id":"2112.12990","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-channel-access-via-meta-reinforcement","title":"Dynamic Channel Access via Meta-Reinforcement Learning","date":"2021-12-24","arxiv_id":"2201.09075","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-impact-of-missing-velocity-information-in","title":"Missing Velocity in Dynamic Obstacle Avoidance based on Deep Reinforcement Learning","date":"2021-12-23","arxiv_id":"2112.12465","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-optimal-power","title":"Deep Reinforcement Learning for Optimal Power Flow with Renewables Using Graph Information","date":"2021-12-22","arxiv_id":"2112.11461","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-augmented-deep-reinforcement-learning","title":"Graph augmented Deep Reinforcement Learning in the GameRLand3D environment","date":"2021-12-22","arxiv_id":"2112.11731","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-scalable-deep-reinforcement-learning-model","title":"A Scalable Deep Reinforcement Learning Model for Online Scheduling Coflows of Multi-Stage Jobs for High Performance Computing","date":"2021-12-21","arxiv_id":"2112.11055","repositories_listed":0,"syntology":null},{"url":null,"slug":"district-cooling-system-control-for-providing","title":"District Cooling System Control for Providing Operating Reserve based on Safe Deep Reinforcement Learning","date":"2021-12-21","arxiv_id":"2112.10949","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-androids-dream-of-electric-fences-safety-1","title":"Do Androids Dream of Electric Fences? Safety-Aware Reinforcement Learning with Latent Shielding","date":"2021-12-21","arxiv_id":"2112.11490","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-sequential-batch","title":"Reinforcement Learning based Sequential Batch-sampling for Bayesian Optimal Experimental Design","date":"2021-12-21","arxiv_id":"2112.10944","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-oriented-image-transmission-for-scene","title":"Task-Oriented Image Transmission for Scene Classification in Unmanned Aerial Systems","date":"2021-12-21","arxiv_id":"2112.10948","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-model-for","title":"A deep reinforcement learning model for predictive maintenance planning of road assets: Integrating LCA and LCCA","date":"2021-12-20","arxiv_id":"2112.12589","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-robust-policy-against-disturbance-in","title":"Learning Robust Policy against Disturbance in Transition Dynamics via State-Conservative Policy Optimization","date":"2021-12-20","arxiv_id":"2112.10513","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimization-for-master-uav-powered-auxiliary","title":"Optimization for Master-UAV-powered Auxiliary-Aerial-IRS-assisted IoT Networks: An Option-based Multi-agent Hierarchical Deep Reinforcement Learning Approach","date":"2021-12-20","arxiv_id":"2112.10630","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-multi-agent-deep-reinforcement-learning","title":"Safe multi-agent deep reinforcement learning for joint bidding and maintenance scheduling of generation units","date":"2021-12-20","arxiv_id":"2112.10459","repositories_listed":0,"syntology":null},{"url":null,"slug":"creativity-of-ai-automatic-symbolic-option","title":"Creativity of AI: Hierarchical Planning Model Learning for Facilitating Deep Reinforcement Learning","date":"2021-12-18","arxiv_id":"2112.09836","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-authentic","title":"Deep Reinforcement Learning-based Authentic Dialogue Generation To Protect Youth From Cybergrooming","date":"2021-12-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-lane-change-decision-algorithm","title":"Personalized Lane Change Decision Algorithm Using Deep Reinforcement Learning Approach","date":"2021-12-17","arxiv_id":"2112.13646","repositories_listed":0,"syntology":null},{"url":null,"slug":"symmetry-aware-neural-architecture-for","title":"Symmetry-aware Neural Architecture for Embodied Visual Navigation","date":"2021-12-17","arxiv_id":"2112.09515","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-safe-deep-reinforcement-learning","title":"Benchmarking Safe Deep Reinforcement Learning in Aquatic Navigation","date":"2021-12-16","arxiv_id":"2112.10593","repositories_listed":0,"syntology":null},{"url":null,"slug":"centralizing-state-values-in-dueling-networks","title":"Centralizing State-Values in Dueling Networks for Multi-Robot Reinforcement Learning Mapless Navigation","date":"2021-12-16","arxiv_id":"2112.09012","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-policies-learn","title":"Deep Reinforcement Learning Policies Learn Shared Adversarial Features Across MDPs","date":"2021-12-16","arxiv_id":"2112.09025","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-directed-story-generation-augmenting","title":"Goal-Directed Story Generation: Augmenting Generative Language Models with Reinforcement Learning","date":"2021-12-16","arxiv_id":"2112.08593","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepscalper-a-risk-aware-deep-reinforcement","title":"DeepScalper: A Risk-Aware Reinforcement Learning Framework to Capture Fleeting Intraday Trading Opportunities","date":"2021-12-15","arxiv_id":"2201.09058","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-navigation-and-configuration-of","title":"Autonomous Navigation and Configuration of Integrated Access Backhauling for UAV Base Station Using Reinforcement Learning","date":"2021-12-14","arxiv_id":"2112.07313","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantifying-multimodality-in-world-models","title":"Quantifying Multimodality in World Models","date":"2021-12-14","arxiv_id":"2112.07263","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-exploration-using-a-linear","title":"Contextual Exploration Using a Linear Approximation Method Based on Satisficing","date":"2021-12-13","arxiv_id":"2112.06452","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-architecture-search-via-continual","title":"Quantum Architecture Search via Continual Reinforcement Learning","date":"2021-12-10","arxiv_id":"2112.05779","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-uncertainty-aware-deployment-of","title":"Zero-Shot Uncertainty-Aware Deployment of Simulation Trained Policies on Real-World Robots","date":"2021-12-10","arxiv_id":"2112.05299","repositories_listed":0,"syntology":null},{"url":null,"slug":"dr3-value-based-deep-reinforcement-learning-1","title":"DR3: Value-Based Deep Reinforcement Learning Requires Explicit Regularization","date":"2021-12-09","arxiv_id":"2112.04716","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-dimensional-stock-portfolio-trading-with","title":"High-Dimensional Stock Portfolio Trading with Deep Reinforcement Learning","date":"2021-12-09","arxiv_id":"2112.04755","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-generalizable-behavior-via-visual","title":"Learning Generalizable Behavior via Visual Rewrite Rules","date":"2021-12-09","arxiv_id":"2112.05218","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-for-deep-reinforcement-learning-in-1","title":"A Review for Deep Reinforcement Learning in Atari:Benchmarks, Challenges, and Solutions","date":"2021-12-08","arxiv_id":"2112.04145","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-deep-reinforcement-learning-to","title":"Application of Deep Reinforcement Learning to Payment Fraud","date":"2021-12-08","arxiv_id":"2112.04236","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-transferable-approach-for-partitioning","title":"A Transferable Approach for Partitioning Machine Learning Models on Multi-Chip-Modules","date":"2021-12-07","arxiv_id":"2112.04041","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-is-power-intrinsic-control-via-1","title":"Information is Power: Intrinsic Control via Information Capture","date":"2021-12-07","arxiv_id":"2112.03899","repositories_listed":0,"syntology":null},{"url":null,"slug":"ptr-ppo-proximal-policy-optimization-with","title":"PTR-PPO: Proximal Policy Optimization with Prioritized Trajectory Replay","date":"2021-12-07","arxiv_id":"2112.03798","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilled-domain-randomization","title":"Distilled Domain Randomization","date":"2021-12-06","arxiv_id":"2112.03149","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-spatial-causal-interpretations-for","title":"Temporal-Spatial Causal Interpretations for Vision-Based Reinforcement Learning","date":"2021-12-06","arxiv_id":"2112.03020","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmark-for-out-of-distribution-detection","title":"Benchmark for Out-of-Distribution Detection in Deep Reinforcement Learning","date":"2021-12-05","arxiv_id":"2112.02694","repositories_listed":0,"syntology":null}],"record_sha256":"24a327adba71f5292ab78bf455ad184b61b8778bcac13cbe08ce9dcce436ed1a","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}