{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/123","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":123,"pages_in_order":135,"rows_per_page":100,"rows":[12201,12300],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/122","next":"/task/reinforcement-learning-2/papers/124","papers":[{"url":null,"slug":"sample-complexity-of-estimating-the-policy","title":"Sample Complexity of Estimating the Policy Gradient for Nearly Deterministic Dynamical Systems","date":"2019-01-24","arxiv_id":"1901.08562","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-for-multi","title":"Hierarchical Reinforcement Learning for Multi-agent MOBA Game","date":"2019-01-23","arxiv_id":"1901.08004","repositories_listed":0,"syntology":null},{"url":null,"slug":"phonetic-enriched-text-representation-for","title":"Phonetic-enriched Text Representation for Chinese Sentiment Analysis with Reinforcement Learning","date":"2019-01-23","arxiv_id":"1901.07880","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-markov-decision","title":"Reinforcement Learning of Markov Decision Processes with Peak Constraints","date":"2019-01-23","arxiv_id":"1901.07839","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-recovery-controller-for-a-quadrupedal","title":"Robust Recovery Controller for a Quadrupedal Robot using Deep Reinforcement Learning","date":"2019-01-22","arxiv_id":"1901.07517","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-short-survey-on-probabilistic-reinforcement","title":"A Short Survey on Probabilistic Reinforcement Learning","date":"2019-01-21","arxiv_id":"1901.07010","repositories_listed":0,"syntology":null},{"url":null,"slug":"lifelong-federated-reinforcement-learning-a","title":"Lifelong Federated Reinforcement Learning: A Learning Architecture for Navigation in Cloud Robotic Systems","date":"2019-01-19","arxiv_id":"1901.06455","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-physically-safe-reinforcement","title":"Towards Physically Safe Reinforcement Learning under Supervision","date":"2019-01-19","arxiv_id":"1901.06576","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-embedded","title":"Multi-agent Reinforcement Learning Embedded Game for the Optimization of Building Energy Control and Power System Planning","date":"2019-01-17","arxiv_id":"1901.07333","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionarily-curated-curriculum-learning","title":"Evolutionarily-Curated Curriculum Learning for Deep Reinforcement Learning Agents","date":"2019-01-16","arxiv_id":"1901.05431","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-learning-on-graphs-a","title":"Representation Learning on Graphs: A Reinforcement Learning Application","date":"2019-01-16","arxiv_id":"1901.05351","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparing-knowledge-based-reinforcement","title":"Comparing Knowledge-based Reinforcement Learning to Neural Networks in a Strategy Game","date":"2019-01-15","arxiv_id":"1901.04626","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-sepsis-treatment-strategies-by","title":"Improving Sepsis Treatment Strategies by Combining Deep and Kernel-Based Reinforcement Learning","date":"2019-01-15","arxiv_id":"1901.04670","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-level-control-of-a-quadrotor-with-deep","title":"Low Level Control of a Quadrotor with Deep Model-Based Reinforcement Learning","date":"2019-01-11","arxiv_id":"1901.03737","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-global-convergence-of-imitation","title":"On the Global Convergence of Imitation Learning: A Case for Linear Quadratic Regulator","date":"2019-01-11","arxiv_id":"1901.03674","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-tensioning-method-using-deep","title":"A New Tensioning Method using Deep Reinforcement Learning for Surgical Pattern Cutting","date":"2019-01-10","arxiv_id":"1901.03327","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-perception-in-reinforcement-learning","title":"Motion Perception in Reinforcement Learning with Dynamic Objects","date":"2019-01-10","arxiv_id":"1901.03162","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-based-out-of-distribution","title":"Uncertainty-Based Out-of-Distribution Detection in Deep Reinforcement Learning","date":"2019-01-08","arxiv_id":"1901.02219","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dual-mode-adaptive-basal-bolus-advisor","title":"A dual mode adaptive basal-bolus advisor based on reinforcement learning","date":"2019-01-07","arxiv_id":"1901.01816","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-tree-search-for-portfolio-management","title":"A* Tree Search for Portfolio Management","date":"2019-01-07","arxiv_id":"1901.01855","repositories_listed":0,"syntology":null},{"url":null,"slug":"credit-assignment-techniques-in-stochastic","title":"Credit Assignment Techniques in Stochastic Computation Graphs","date":"2019-01-07","arxiv_id":"1901.01761","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-applications-of-deep-reinforcement","title":"Exploring applications of deep reinforcement learning for real-world autonomous driving systems","date":"2019-01-06","arxiv_id":"1901.01536","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-control-nets-for-deep-reinforcement","title":"Recurrent Control Nets for Deep Reinforcement Learning","date":"2019-01-06","arxiv_id":"1901.01994","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-should-i-do-now-marrying-reinforcement","title":"What Should I Do Now? Marrying Reinforcement Learning and Symbolic Planning","date":"2019-01-06","arxiv_id":"1901.01492","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-goal-directed-reinforcement","title":"Accelerating Goal-Directed Reinforcement Learning by Model Characterization","date":"2019-01-04","arxiv_id":"1901.01977","repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-teaching-in-hierarchical-genetic","title":"Machine Teaching in Hierarchical Genetic Reinforcement Learning: Curriculum Design of Reward Functions for Swarm Shepherding","date":"2019-01-04","arxiv_id":"1901.00949","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-decision-making-in-mixed-agent","title":"Optimal Decision-Making in Mixed-Agent Partially Observable Stochastic Environments via Reinforcement Learning","date":"2019-01-04","arxiv_id":"1901.01325","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-like-autonomous-car-following-model","title":"Human-Like Autonomous Car-Following Model with Deep Reinforcement Learning","date":"2019-01-03","arxiv_id":"1901.00569","repositories_listed":0,"syntology":null},{"url":null,"slug":"imminent-collision-mitigation-with","title":"Imminent Collision Mitigation with Reinforcement Learning and Vision","date":"2019-01-03","arxiv_id":"1901.00898","repositories_listed":0,"syntology":null},{"url":null,"slug":"complementary-reinforcement-learning-towards","title":"Complementary reinforcement learning towards explainable agents","date":"2019-01-01","arxiv_id":"1901.00188","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-with-distribution","title":"Meta Reinforcement Learning with Distribution of Exploration Parameters Learned by Evolution Strategies","date":"2018-12-29","arxiv_id":"1812.11314","repositories_listed":0,"syntology":null},{"url":null,"slug":"meeting-bot-reinforcement-learning-for","title":"MEETING BOT: Reinforcement Learning for Dialogue Based Meeting Scheduling","date":"2018-12-28","arxiv_id":"1812.11158","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-representation-learning-with-recurrent","title":"State representation learning with recurrent capsule networks","date":"2018-12-28","arxiv_id":"1812.11202","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-architecture-for","title":"Quantum Adiabatic Algorithm Design using Reinforcement Learning","date":"2018-12-27","arxiv_id":"1812.10797","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-concept-of-deep-reinforcement-learning","title":"A New Concept of Deep Reinforcement Learning based Augmented General Sequence Tagging System","date":"2018-12-26","arxiv_id":"1812.10234","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-walk-via-deep-reinforcement","title":"Learning to Walk via Deep Reinforcement Learning","date":"2018-12-26","arxiv_id":"1812.11103","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-market-making-using-multi-agent","title":"Optimizing Market Making using Multi-Agent Reinforcement Learning","date":"2018-12-26","arxiv_id":"1812.10252","repositories_listed":0,"syntology":null},{"url":null,"slug":"vmav-c-a-deep-attention-based-reinforcement","title":"VMAV-C: A Deep Attention-based Reinforcement Learning Algorithm for Model-based Control","date":"2018-12-24","arxiv_id":"1812.09968","repositories_listed":0,"syntology":null},{"url":null,"slug":"escape-room-a-configurable-testbed-for","title":"Escape Room: A Configurable Testbed for Hierarchical Reinforcement Learning","date":"2018-12-22","arxiv_id":"1812.09521","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-navigate-the-web","title":"Learning to Navigate the Web","date":"2018-12-21","arxiv_id":"1812.09195","repositories_listed":0,"syntology":null},{"url":null,"slug":"nadpex-an-on-policy-temporally-consistent","title":"NADPEx: An on-policy temporally consistent exploration method for deep reinforcement learning","date":"2018-12-21","arxiv_id":"1812.09028","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-meta-reinforcement-learning-for-1","title":"A Review of Meta-Reinforcement Learning for Deep Neural Networks Architecture Search","date":"2018-12-20","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-quantum-error-correction-codes","title":"Optimizing Quantum Error Correction Codes with Reinforcement Learning","date":"2018-12-20","arxiv_id":"1812.08451","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-search","title":"Deep reinforcement learning for search, recommendation, and online advertising: a survey","date":"2018-12-18","arxiv_id":"1812.07127","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adaptation-for-reinforcement-learning","title":"Domain Adaptation for Reinforcement Learning on the Atari","date":"2018-12-18","arxiv_id":"1812.07452","repositories_listed":0,"syntology":null},{"url":null,"slug":"incentive-based-demand-response-for-smart","title":"Incentive-based demand response for smart grid with reinforcement learning and deep neural network","date":"2018-12-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-meta-reinforcement-learning-for","title":"A Review of Meta-Reinforcement Learning for Deep Neural Networks Architecture Search","date":"2018-12-17","arxiv_id":"1812.07995","repositories_listed":0,"syntology":null},{"url":null,"slug":"fuzzy-controller-of-reward-of-reinforcement","title":"Fuzzy Controller of Reward of Reinforcement Learning For Handwritten Digit Recognition","date":"2018-12-17","arxiv_id":"1812.07028","repositories_listed":0,"syntology":null},{"url":null,"slug":"malthusian-reinforcement-learning","title":"Malthusian Reinforcement Learning","date":"2018-12-17","arxiv_id":"1812.07019","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-adaptive-caching","title":"Reinforcement Learning for Adaptive Caching with Dynamic Storage Pricing","date":"2018-12-17","arxiv_id":"1812.08593","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-likelihood-quantile-networks","title":"Likelihood Quantile Networks for Coordinating Multi-Agent Reinforcement Learning","date":"2018-12-15","arxiv_id":"1812.06319","repositories_listed":0,"syntology":null},{"url":null,"slug":"guaranteed-satisficing-and-finite-regret","title":"Guaranteed satisficing and finite regret: Analysis of a cognitive satisficing value function","date":"2018-12-14","arxiv_id":"1812.05795","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-shared-model-governance-via-model","title":"Scaling shared model governance via model splitting","date":"2018-12-14","arxiv_id":"1812.05979","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-communicate-a-machine-learning","title":"Learning to Communicate: A Machine Learning Framework for Heterogeneous Multi-Agent Robotic Systems","date":"2018-12-13","arxiv_id":"1812.05256","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-model-free-reinforcement-learning","title":"Efficient Model-Free Reinforcement Learning Using Gaussian Process","date":"2018-12-11","arxiv_id":"1812.04359","repositories_listed":0,"syntology":null},{"url":null,"slug":"kf-lax-kronecker-factored-curvature","title":"KF-LAX: Kronecker-factored curvature estimation for control variate optimization in reinforcement learning","date":"2018-12-11","arxiv_id":"1812.04181","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-montezumas-revenge-from-a-single","title":"Learning Montezuma's Revenge from a Single Demonstration","date":"2018-12-08","arxiv_id":"1812.03381","repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-efficient-distributed-4","title":"Communication-Efficient Policy Gradient Methods for Distributed Reinforcement Learning","date":"2018-12-07","arxiv_id":"1812.03239","repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-and-characterizing-generalization","title":"Measuring and Characterizing Generalization in Deep Reinforcement Learning","date":"2018-12-07","arxiv_id":"1812.02868","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-reinforcement-learning-for-robot","title":"Residual Reinforcement Learning for Robot Control","date":"2018-12-07","arxiv_id":"1812.03201","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-deep-q-learning-with-demonstration","title":"Active Deep Q-learning with Demonstration","date":"2018-12-06","arxiv_id":"1812.02632","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-and-the-deadly","title":"Deep Reinforcement Learning and the Deadly Triad","date":"2018-12-06","arxiv_id":"1812.02648","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-analyses-for-fully","title":"Finite-Sample Analysis For Decentralized Batch Multi-Agent Reinforcement Learning With Networked Agents","date":"2018-12-06","arxiv_id":"1812.02783","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-effects-of-negative-adaptation-in-model","title":"The effects of negative adaptation in Model-Agnostic Meta-Learning","date":"2018-12-05","arxiv_id":"1812.02159","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-versus-exploitation-in","title":"Exploration versus exploitation in reinforcement learning: a stochastic control approach","date":"2018-12-04","arxiv_id":"1812.01552","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperbolic-embeddings-for-learning-options-in","title":"Hyperbolic Embeddings for Learning Options in Hierarchical Reinforcement Learning","date":"2018-12-04","arxiv_id":"1812.01487","repositories_listed":0,"syntology":null},{"url":null,"slug":"bach2bach-generating-music-using-a-deep","title":"Bach2Bach: Generating Music Using A Deep Reinforcement Learning Approach","date":"2018-12-03","arxiv_id":"1812.01060","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-intelligent","title":"Deep Reinforcement Learning for Intelligent Transportation Systems","date":"2018-12-03","arxiv_id":"1812.00979","repositories_listed":0,"syntology":null},{"url":null,"slug":"foldingzero-protein-folding-from-scratch-in","title":"FoldingZero: Protein Folding from Scratch in Hydrophobic-Polar Model","date":"2018-12-03","arxiv_id":"1812.00967","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-adversarial-self-imitation","title":"Generative Adversarial Self-Imitation Learning","date":"2018-12-03","arxiv_id":"1812.00950","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-planner-overfitting-in-model-based","title":"Mitigating Planner Overfitting in Model-Based Reinforcement Learning","date":"2018-12-03","arxiv_id":"1812.01129","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-with","title":"Multi-agent Deep Reinforcement Learning with Extremely Noisy Observations","date":"2018-12-03","arxiv_id":"1812.00922","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-constrained-deep-reinforcement","title":"Resource Constrained Deep Reinforcement Learning","date":"2018-12-03","arxiv_id":"1812.00600","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-cross-entropy-method-for-safe","title":"Constrained Cross-Entropy Method for Safe Reinforcement Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-multitask-reinforcement-learning","title":"Distributed Multitask Reinforcement Learning with Quadratic Convergence","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fighting-boredom-in-recommender-systems-with","title":"Fighting Boredom in Recommender Systems with Linear Reinforcement Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"genetic-gated-networks-for-deep-reinforcement-1","title":"Genetic-Gated Networks for Deep Reinforcement Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"geometrically-coupled-monte-carlo-sampling","title":"Geometrically Coupled Monte Carlo Sampling","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multiple-step-greedy-policies-in-approximate","title":"Multiple-Step Greedy Policies in Approximate and Online Reinforcement Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"negotiable-reinforcement-learning-for-pareto","title":"Negotiable Reinforcement Learning for Pareto Optimal Sequential Decision-Making","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"refuel-exploring-sparse-features-in-deep","title":"REFUEL: Exploring Sparse Features in Deep Reinforcement Learning for Fast Disease Diagnosis","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-multiple-experts","title":"Reinforcement Learning with Multiple Experts: A Bayesian Model Combination Approach","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-importance-of-sampling-inmeta","title":"The Importance of Sampling inMeta-Reinforcement Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-of-value-functions-via-variational","title":"Transfer of Value Functions via Variational Methods","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-transfer-with-deictic-object","title":"Zero-Shot Transfer with Deictic Object-Oriented Representation in Reinforcement Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"blockpuzzle-a-challenge-in-physical-reasoning","title":"BlockPuzzle - A Challenge in Physical Reasoning and Generalization for Robot Learning","date":"2018-11-30","arxiv_id":"1812.00091","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-monte-carlo-tree-search-as-a","title":"Using Monte Carlo Tree Search as a Demonstrator within Asynchronous Deep RL","date":"2018-11-30","arxiv_id":"1812.00045","repositories_listed":0,"syntology":null},{"url":null,"slug":"flow-shape-design-for-microfluidic-devices","title":"Flow Shape Design for Microfluidic Devices Using Deep Reinforcement Learning","date":"2018-11-29","arxiv_id":"1811.12444","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-time-optimal","title":"Deep Reinforcement Learning for Time Optimal Velocity Control using Prior Knowledge","date":"2018-11-28","arxiv_id":"1811.11615","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-face-aging-in-videos-via-deep","title":"Automatic Face Aging in Videos via Deep Reinforcement Learning","date":"2018-11-27","arxiv_id":"1811.11082","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-traffic-light-control-at","title":"Distributed traffic light control at uncoupled intersections with real-world topology by deep reinforcement learning","date":"2018-11-27","arxiv_id":"1811.11233","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-state-representations-in-complex","title":"Learning State Representations in Complex Systems with Multimodal Data","date":"2018-11-27","arxiv_id":"1811.11067","repositories_listed":0,"syntology":null},{"url":null,"slug":"quality-aware-multimodal-saliency-detection","title":"Quality-Aware Multimodal Saliency Detection via Deep Reinforcement Learning","date":"2018-11-27","arxiv_id":"1811.10763","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-configuration-of-energy-harvesting","title":"Scaling Configuration of Energy Harvesting Sensors with Reinforcement Learning","date":"2018-11-27","arxiv_id":"1811.11259","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-with-distributed-deep-reinforcement","title":"PNS: Population-Guided Novelty Search for Reinforcement Learning in Hard Exploration Environments","date":"2018-11-26","arxiv_id":"1811.10264","repositories_listed":0,"syntology":null},{"url":null,"slug":"genetic-gated-networks-for-deep-reinforcement","title":"Genetic-Gated Networks for Deep Reinforcement","date":"2018-11-26","arxiv_id":"1903.01886","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-model-based-reinforcement-learning-approach","title":"A Model-Based Reinforcement Learning Approach for a Rare Disease Diagnostic Task","date":"2018-11-25","arxiv_id":"1811.10112","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-activate-relay-nodes-deep","title":"Learning to Activate Relay Nodes: Deep Reinforcement Learning Approach","date":"2018-11-24","arxiv_id":"1811.09759","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-sepsis","title":"Model-Based Reinforcement Learning for Sepsis Treatment","date":"2018-11-23","arxiv_id":"1811.09602","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-level-strategy-selection-under-partial","title":"High-Level Strategy Selection under Partial Observability in StarCraft: Brood War","date":"2018-11-21","arxiv_id":"1811.08568","repositories_listed":0,"syntology":null}],"record_sha256":"cd7673ca3c81ae3ef4e928851134a055eff3fa8c362191fcbe8197b1b7549333","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}