{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/57","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":57,"pages_in_order":59,"rows_per_page":100,"rows":[5601,5700],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/56","next":"/task/deep-reinforcement-learning/papers/58","papers":[{"url":null,"slug":"rearrangement-with-nonprehensile-manipulation","title":"Rearrangement with Nonprehensile Manipulation Using Deep Reinforcement Learning","date":"2018-03-15","arxiv_id":"1803.05752","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-speed-and-lane-change-decision","title":"Automated Speed and Lane Change Decision Making using Deep Reinforcement Learning","date":"2018-03-14","arxiv_id":"1803.10056","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-learning-with-concurrent-actions-in","title":"Imitation Learning with Concurrent Actions in 3D Games","date":"2018-03-14","arxiv_id":"1803.05402","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-2017-aibirds-competition","title":"The 2017 AIBIRDS Competition","date":"2018-03-14","arxiv_id":"1803.05156","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-search-in-continuous-action-domains-an","title":"Policy Search in Continuous Action Domains: an Overview","date":"2018-03-13","arxiv_id":"1803.04706","repositories_listed":0,"syntology":null},{"url":null,"slug":"kickstarting-deep-reinforcement-learning","title":"Kickstarting Deep Reinforcement Learning","date":"2018-03-10","arxiv_id":"1803.03835","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multi-objective-deep-reinforcement-learning","title":"A Multi-Objective Deep Reinforcement Learning Framework","date":"2018-03-08","arxiv_id":"1803.02965","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepcas-a-deep-reinforcement-learning","title":"DeepCAS: A Deep Reinforcement Learning Algorithm for Control-Aware Scheduling","date":"2018-03-08","arxiv_id":"1803.02998","repositories_listed":0,"syntology":null},{"url":null,"slug":"extracting-action-sequences-from-texts-based","title":"Extracting Action Sequences from Texts Based on Deep Reinforcement Learning","date":"2018-03-07","arxiv_id":"1803.02632","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-history-began-from-alexnet-a","title":"The History Began from AlexNet: A Comprehensive Survey on Deep Learning Approaches","date":"2018-03-03","arxiv_id":"1803.01164","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-control-for-distributed-stream","title":"Model-Free Control for Distributed Stream Data Processing using Deep Reinforcement Learning","date":"2018-03-02","arxiv_id":"1803.01016","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-for-signal-authentication-and","title":"Deep Learning for Signal Authentication and Security in Massive Internet of Things Systems","date":"2018-03-01","arxiv_id":"1803.00916","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-sponsored","title":"Deep Reinforcement Learning for Sponsored Search Real-time Bidding","date":"2018-03-01","arxiv_id":"1803.00259","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-join-order","title":"Deep Reinforcement Learning for Join Order Enumeration","date":"2018-02-28","arxiv_id":"1803.00055","repositories_listed":0,"syntology":null},{"url":null,"slug":"weighted-double-deep-multiagent-reinforcement","title":"Weighted Double Deep Multiagent Reinforcement Learning in Stochastic Cooperative Environments","date":"2018-02-23","arxiv_id":"1802.08534","repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-theory-of-mind","title":"Machine Theory of Mind","date":"2018-02-21","arxiv_id":"1802.07740","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-reinforcement-learning-with-complex","title":"Continual Reinforcement Learning with Complex Synapses","date":"2018-02-20","arxiv_id":"1802.07239","repositories_listed":0,"syntology":null},{"url":null,"slug":"recommendations-with-negative-feedback-via","title":"Recommendations with Negative Feedback via Pairwise Deep Reinforcement Learning","date":"2018-02-19","arxiv_id":"1802.06501","repositories_listed":0,"syntology":null},{"url":null,"slug":"sim-to-real-optimization-of-complex-real","title":"Sim-to-Real Optimization of Complex Real World Mobile Network with Imperfect Information via Deep Reinforcement Learning from Self-play","date":"2018-02-18","arxiv_id":"1802.06416","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-framework-for-1","title":"A Deep Reinforcement Learning Framework for Rebalancing Dockless Bike Sharing Systems","date":"2018-02-13","arxiv_id":"1802.04592","repositories_listed":0,"syntology":null},{"url":null,"slug":"diversity-driven-exploration-strategy-for","title":"Diversity-Driven Exploration Strategy for Deep Reinforcement Learning","date":"2018-02-13","arxiv_id":"1802.04564","repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-reinforcement-learning-with","title":"Progressive Reinforcement Learning with Distillation for Multi-Skilled Motion Control","date":"2018-02-13","arxiv_id":"1802.04765","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-deep-reinforcement-learning","title":"Sample Efficient Deep Reinforcement Learning for Dialogue Systems with Large Action Spaces","date":"2018-02-11","arxiv_id":"1802.03753","repositories_listed":0,"syntology":null},{"url":null,"slug":"precision-medicine-as-a-control-problem-using","title":"Precision medicine as a control problem: Using simulation and deep reinforcement learning to discover adaptive, personalized multi-cytokine therapy for sepsis","date":"2018-02-08","arxiv_id":"1802.10440","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-image-hashing","title":"Deep Reinforcement Learning for Image Hashing","date":"2018-02-07","arxiv_id":"1802.02904","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-collective-swimming-by-harnessing","title":"Efficient collective swimming by harnessing vortices through deep reinforcement learning","date":"2018-02-07","arxiv_id":"1802.02674","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-parametric-closed-loop-policies-for","title":"Learning Parametric Closed-Loop Policies for Markov Potential Games","date":"2018-02-03","arxiv_id":"1802.00899","repositories_listed":0,"syntology":null},{"url":null,"slug":"elements-of-effective-deep-reinforcement","title":"Elements of Effective Deep Reinforcement Learning towards Tactical Driving Decision Making","date":"2018-02-01","arxiv_id":"1802.00332","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-oriented-chatbot-dialog-management","title":"Goal-Oriented Chatbot Dialog Management Bootstrapping with Transfer Learning","date":"2018-02-01","arxiv_id":"1802.00500","repositories_listed":0,"syntology":null},{"url":null,"slug":"virtual-to-real-learning-to-control-in-visual","title":"Virtual-to-Real: Learning to Control in Visual Semantic Segmentation","date":"2018-02-01","arxiv_id":"1802.00285","repositories_listed":0,"syntology":null},{"url":null,"slug":"vr-goggles-for-robots-real-to-sim-domain","title":"VR-Goggles for Robots: Real-to-sim Domain Adaptation for Visual Control","date":"2018-02-01","arxiv_id":"1802.00265","repositories_listed":0,"syntology":null},{"url":null,"slug":"pretraining-deep-actor-critic-reinforcement","title":"Pretraining Deep Actor-Critic Reinforcement Learning Algorithms With Expert Demonstrations","date":"2018-01-31","arxiv_id":"1801.10459","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-using-capsules-in","title":"Deep Reinforcement Learning using Capsules in Advanced Game Environments","date":"2018-01-29","arxiv_id":"1801.09597","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-dynamic","title":"Deep Reinforcement Learning for Dynamic Treatment Regimes on Medical Registry Data","date":"2018-01-28","arxiv_id":"1801.09271","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-chatbot-short","title":"A Deep Reinforcement Learning Chatbot (Short Version)","date":"2018-01-20","arxiv_id":"1801.06700","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-driven-networking-a-deep","title":"Experience-driven Networking: A Deep Reinforcement Learning based Approach","date":"2018-01-17","arxiv_id":"1801.05757","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-case-for-automatic-database","title":"The Case for Automatic Database Administration using Deep Reinforcement Learning","date":"2018-01-17","arxiv_id":"1801.05643","repositories_listed":0,"syntology":null},{"url":null,"slug":"cellular-connected-uavs-over-5g-deep","title":"Cellular-Connected UAVs over 5G: Deep Reinforcement Learning for Interference Management","date":"2018-01-16","arxiv_id":"1801.05500","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-of-cell-movement","title":"Deep Reinforcement Learning of Cell Movement in the Early Stage of C. elegans Embryogenesis","date":"2018-01-14","arxiv_id":"1801.04600","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-action-exploration-for-learning","title":"Model-Based Action Exploration for Learning Dynamic Motion Skills","date":"2018-01-11","arxiv_id":"1801.03954","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-1","title":"Sample-Efficient Reinforcement Learning through Transfer and Architectural Priors","date":"2018-01-07","arxiv_id":"1801.02268","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-deep-q-learning-using-neural-episodic","title":"Faster Deep Q-learning using Neural Episodic Control","date":"2018-01-06","arxiv_id":"1801.01968","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-optimal","title":"Deep Reinforcement Learning based Optimal Control of Hot Water Systems","date":"2018-01-04","arxiv_id":"1801.01467","repositories_listed":0,"syntology":null},{"url":null,"slug":"screenernet-learning-self-paced-curriculum","title":"ScreenerNet: Learning Self-Paced Curriculum for Deep Neural Networks","date":"2018-01-03","arxiv_id":"1801.00904","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dynamic-game-approach-to-training-robust","title":"A dynamic game approach to training robust deep policies","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hierarchical-model-for-device-placement","title":"A Hierarchical Model for Device Placement","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"automata-guided-hierarchical-reinforcement-1","title":"AUTOMATA GUIDED HIERARCHICAL REINFORCEMENT LEARNING FOR ZERO-SHOT SKILL COMPOSITION","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-vehicle-fleet-coordination-with","title":"Autonomous Vehicle Fleet Coordination With Deep Reinforcement Learning","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"avoiding-catastrophic-states-with-intrinsic","title":"Avoiding Catastrophic States with Intrinsic Fear","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-model-based-and-model-free-rl-via","title":"Combining Model-based and Model-free RL via Multi-step Control Variates","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"do-deep-reinforcement-learning-algorithms","title":"Do Deep Reinforcement Learning Algorithms really Learn to Navigate?","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adaptation-for-deep-reinforcement","title":"Domain Adaptation for Deep Reinforcement Learning in Visually Distinct Games","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-forward-model-for-real-time-strategy","title":"Latent forward model for Real-time Strategy game planning with incomplete information","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-robust-rewards-with-adverserial","title":"Learning Robust Rewards with Adverserial Inverse Reinforcement Learning","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-treat-sepsis-with-multi-output","title":"Learning to Treat Sepsis with Multi-Output Gaussian Process Deep Recurrent Q-Networks","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"long-term-memory-network-for-combinatorial","title":"Long Term Memory Network for Combinatorial Optimization Problems","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"lsd-net-look-step-and-detect-for-joint","title":"LSD-Net: Look, Step and Detect for Joint Navigation and Multi-View Recognition with Deep Reinforcement Learning","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-for-multidimensional-action","title":"Policy Gradient For Multidimensional Action Spaces: Action Sampling and Entropy Bonus","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"trl-discriminative-hints-for-scalable-reverse","title":"TRL: Discriminative Hints for Scalable Reverse Curriculum Learning","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"using-deep-reinforcement-learning-to-generate","title":"Using Deep Reinforcement Learning to Generate Rationales for Molecules","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-policy-inference-q-network-for-multi","title":"A Deep Policy Inference Q-Network for Multi-Agent Systems","date":"2017-12-21","arxiv_id":"1712.07893","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-the-master-slave-architecture-in","title":"Revisiting the Master-Slave Architecture in Multi-Agent Deep Reinforcement Learning","date":"2017-12-20","arxiv_id":"1712.07305","repositories_listed":0,"syntology":null},{"url":null,"slug":"es-is-more-than-just-a-traditional-finite","title":"ES Is More Than Just a Traditional Finite-Difference Approximator","date":"2017-12-18","arxiv_id":"1712.06568","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-deep-reinforcement-learning","title":"Towards a Deep Reinforcement Learning Approach for Tower Line Wars","date":"2017-12-17","arxiv_id":"1712.06180","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-focus-attention-network-for-efficient","title":"Multi-focus Attention Network for Efficient Deep Reinforcement Learning","date":"2017-12-13","arxiv_id":"1712.04603","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-boosted-by","title":"Deep Reinforcement Learning Boosted by External Knowledge","date":"2017-12-12","arxiv_id":"1712.04101","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulated-autonomous-driving-on-realistic","title":"Simulated Autonomous Driving on Realistic Road Networks using Deep Reinforcement Learning","date":"2017-12-12","arxiv_id":"1712.04363","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-robust-dialog-policies-in-noisy","title":"Learning Robust Dialog Policies in Noisy Environments","date":"2017-12-11","arxiv_id":"1712.04034","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-deep-reinforcement-learning-with","title":"Robust Deep Reinforcement Learning with Adversarial Attacks","date":"2017-12-11","arxiv_id":"1712.03632","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-dynamics-for-enhanced-sampling-in","title":"Reinforced dynamics for enhanced sampling in large atomic and molecular systems","date":"2017-12-10","arxiv_id":"1712.03461","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-model-for-arbitration-between","title":"A Novel Model for Arbitration between Planning and Habitual Control Systems","date":"2017-12-06","arxiv_id":"1712.02441","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-lda-uncovering-latent-patterns-in-text","title":"Q-LDA: Uncovering Latent Patterns in Text-based Sequential Decision Processes","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-the-use-of-deep-reinforcement-1","title":"Towards the Use of Deep Reinforcement Learning with Global Policy for Query-based Extractive Summarisation","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"comparing-deep-reinforcement-learning-and","title":"Comparing Deep Reinforcement Learning and Evolutionary Methods in Continuous Control","date":"2017-11-30","arxiv_id":"1712.00006","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-learning-in-evolution-strategies-via","title":"Improved Learning in Evolution Strategies via Sparser Inter-Agent Network Topologies","date":"2017-11-30","arxiv_id":"1711.11180","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-estimates-for-efficient-neural","title":"Uncertainty Estimates for Efficient Neural Network-based Dialogue Policy Optimisation","date":"2017-11-30","arxiv_id":"1711.11486","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-benchmarking-environment-for-reinforcement","title":"A Benchmarking Environment for Reinforcement Learning Based Task Oriented Dialogue Management","date":"2017-11-29","arxiv_id":"1711.11023","repositories_listed":0,"syntology":null},{"url":null,"slug":"automating-vehicles-by-deep-reinforcement","title":"Automating Vehicles by Deep Reinforcement Learning using Task Separation with Hill Climbing","date":"2017-11-29","arxiv_id":"1711.10785","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-optimization-of-task-oriented","title":"End-to-End Optimization of Task-Oriented Dialogue Model with Deep Reinforcement Learning","date":"2017-11-29","arxiv_id":"1711.10712","repositories_listed":0,"syntology":null},{"url":null,"slug":"malaria-likelihood-prediction-by-effectively","title":"Malaria Likelihood Prediction By Effectively Surveying Households Using Deep Reinforcement Learning","date":"2017-11-25","arxiv_id":"1711.09223","repositories_listed":0,"syntology":null},{"url":null,"slug":"asking-the-difficult-questions-goal-oriented","title":"Asking the Difficult Questions: Goal-Oriented Visual Question Generation via Intermediate Rewards","date":"2017-11-21","arxiv_id":"1711.07614","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-multi","title":"Deep Reinforcement Learning for Multi-Resource Multi-Machine Job Scheduling","date":"2017-11-20","arxiv_id":"1711.07440","repositories_listed":0,"syntology":null},{"url":null,"slug":"bbq-networks-efficient-exploration-in-deep","title":"BBQ-Networks: Efficient Exploration in Deep Reinforcement Learning for Task-Oriented Dialogue Systems","date":"2017-11-15","arxiv_id":"1711.05715","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-user-and-agent-models-a-deep-task","title":"Integrating User and Agent Models: A Deep Task-Oriented Dialogue System","date":"2017-11-10","arxiv_id":"1711.03697","repositories_listed":0,"syntology":null},{"url":null,"slug":"composing-meta-policies-for-autonomous","title":"Composing Meta-Policies for Autonomous Driving Using Hierarchical Deep Reinforcement Learning","date":"2017-11-04","arxiv_id":"1711.01503","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-by-genetic-distillation","title":"Policy Optimization by Genetic Distillation","date":"2017-11-03","arxiv_id":"1711.01012","repositories_listed":0,"syntology":null},{"url":null,"slug":"acquiring-target-stacking-skills-by-goal","title":"Acquiring Target Stacking Skills by Goal-Parameterized Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":"1711.00267","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-parameter-tuning-in-optimization","title":"Intelligent Parameter Tuning in Optimization-based Iterative CT Reconstruction via Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":"1711.00414","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-diagnose-assimilating-clinical","title":"Learning to Diagnose: Assimilating Clinical Narratives using Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"paraphrase-generation-with-deep-reinforcement","title":"Paraphrase Generation with Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":"1711.00279","repositories_listed":0,"syntology":null},{"url":null,"slug":"automata-guided-hierarchical-reinforcement","title":"Automata-Guided Hierarchical Reinforcement Learning for Skill Composition","date":"2017-10-31","arxiv_id":"1711.00129","repositories_listed":0,"syntology":null},{"url":null,"slug":"diff-dac-distributed-actor-critic-for-average","title":"Diff-DAC: Distributed Actor-Critic for Average Multitask Deep Reinforcement Learning","date":"2017-10-28","arxiv_id":"1710.10363","repositories_listed":0,"syntology":null},{"url":null,"slug":"consequentialist-conditional-cooperation-in","title":"Consequentialist conditional cooperation in social dilemmas with imperfect information","date":"2017-10-19","arxiv_id":"1710.06975","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymmetric-actor-critic-for-image-based-robot","title":"Asymmetric Actor Critic for Image-Based Robot Learning","date":"2017-10-18","arxiv_id":"1710.06542","repositories_listed":0,"syntology":null},{"url":null,"slug":"map-based-multi-policy-reinforcement-learning","title":"Map-based Multi-Policy Reinforcement Learning: Enhancing Adaptability of Robots by Deep Reinforcement Learning","date":"2017-10-17","arxiv_id":"1710.06117","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-framework","title":"Deep Reinforcement Learning: Framework, Applications, and Embedded Implementations","date":"2017-10-10","arxiv_id":"1710.03792","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-abstract-q-networks","title":"Deep Abstract Q-Networks","date":"2017-10-02","arxiv_id":"1710.00459","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-aware-deep-reinforcement-learning","title":"Attention-Aware Deep Reinforcement Learning for Video Face Recognition","date":"2017-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-sharing-deep-deterministic-policy","title":"Parameter Sharing Deep Deterministic Policy Gradient for Cooperative Multi-agent Reinforcement Learning","date":"2017-10-01","arxiv_id":"1710.00336","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-continuous-control-of-flippers-for-a","title":"Towards continuous control of flippers for a multi-terrain robot using deep reinforcement learning","date":"2017-09-25","arxiv_id":"1709.08430","repositories_listed":0,"syntology":null}],"record_sha256":"f0880810ffb71add94634dfb3706d332345daf56c0251562b36e31cce588275c","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}