{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/115","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":115,"pages_in_order":132,"rows_per_page":100,"rows":[11401,11500],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/114","next":"/task/reinforcement-learning/papers/116","papers":[{"url":null,"slug":"learning-montezumas-revenge-from-a-single","title":"Learning Montezuma's Revenge from a Single Demonstration","date":"2018-12-08","arxiv_id":"1812.03381","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-artificial-intelligence-trends-in","title":"A Survey on Artificial Intelligence Trends in Spacecraft Guidance Dynamics and Control","date":"2018-12-07","arxiv_id":"1812.02948","repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-efficient-distributed-4","title":"Communication-Efficient Policy Gradient Methods for Distributed Reinforcement Learning","date":"2018-12-07","arxiv_id":"1812.03239","repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-and-characterizing-generalization","title":"Measuring and Characterizing Generalization in Deep Reinforcement Learning","date":"2018-12-07","arxiv_id":"1812.02868","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-reinforcement-learning-for-robot","title":"Residual Reinforcement Learning for Robot Control","date":"2018-12-07","arxiv_id":"1812.03201","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-deep-reinforcement-learning-driving","title":"Zero-shot Deep Reinforcement Learning Driving Policy Transfer for Autonomous Vehicles based on Robust Control","date":"2018-12-07","arxiv_id":"1812.03216","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-deep-q-learning-with-demonstration","title":"Active Deep Q-learning with Demonstration","date":"2018-12-06","arxiv_id":"1812.02632","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-and-the-deadly","title":"Deep Reinforcement Learning and the Deadly Triad","date":"2018-12-06","arxiv_id":"1812.02648","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-analyses-for-fully","title":"Finite-Sample Analysis For Decentralized Batch Multi-Agent Reinforcement Learning With Networked Agents","date":"2018-12-06","arxiv_id":"1812.02783","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropic-policy-composition-with-generalized","title":"Composing Entropic Policies using Divergence Correction","date":"2018-12-05","arxiv_id":"1812.02216","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-design-circuits","title":"Learning to Design Circuits","date":"2018-12-05","arxiv_id":"1812.02734","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-effects-of-negative-adaptation-in-model","title":"The effects of negative adaptation in Model-Agnostic Meta-Learning","date":"2018-12-05","arxiv_id":"1812.02159","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-versus-exploitation-in","title":"Exploration versus exploitation in reinforcement learning: a stochastic control approach","date":"2018-12-04","arxiv_id":"1812.01552","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperbolic-embeddings-for-learning-options-in","title":"Hyperbolic Embeddings for Learning Options in Hierarchical Reinforcement Learning","date":"2018-12-04","arxiv_id":"1812.01487","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-vine-copula-models-for-synthetic","title":"Learning Vine Copula Models For Synthetic Data Generation","date":"2018-12-04","arxiv_id":"1812.01226","repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-option-critic","title":"Natural Option Critic","date":"2018-12-04","arxiv_id":"1812.01488","repositories_listed":0,"syntology":null},{"url":null,"slug":"rigorous-agent-evaluation-an-adversarial","title":"Rigorous Agent Evaluation: An Adversarial Approach to Uncover Catastrophic Failures","date":"2018-12-04","arxiv_id":"1812.01647","repositories_listed":0,"syntology":null},{"url":null,"slug":"bach2bach-generating-music-using-a-deep","title":"Bach2Bach: Generating Music Using A Deep Reinforcement Learning Approach","date":"2018-12-03","arxiv_id":"1812.01060","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-intelligent","title":"Deep Reinforcement Learning for Intelligent Transportation Systems","date":"2018-12-03","arxiv_id":"1812.00979","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilling-information-from-a-flood-a","title":"Distilling Information from a Flood: A Possibility for the Use of Meta-Analysis and Systematic Review in Machine Learning Research","date":"2018-12-03","arxiv_id":"1812.01074","repositories_listed":0,"syntology":null},{"url":null,"slug":"foldingzero-protein-folding-from-scratch-in","title":"FoldingZero: Protein Folding from Scratch in Hydrophobic-Polar Model","date":"2018-12-03","arxiv_id":"1812.00967","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-diverse-programs-with-instruction","title":"Generating Diverse Programs with Instruction Conditioned Reinforced Adversarial Learning","date":"2018-12-03","arxiv_id":"1812.00898","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-adversarial-self-imitation","title":"Generative Adversarial Self-Imitation Learning","date":"2018-12-03","arxiv_id":"1812.00950","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-planner-overfitting-in-model-based","title":"Mitigating Planner Overfitting in Model-Based Reinforcement Learning","date":"2018-12-03","arxiv_id":"1812.01129","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-with","title":"Multi-agent Deep Reinforcement Learning with Extremely Noisy Observations","date":"2018-12-03","arxiv_id":"1812.00922","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-constrained-deep-reinforcement","title":"Resource Constrained Deep Reinforcement Learning","date":"2018-12-03","arxiv_id":"1812.00600","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-matting","title":"Active Matting","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-control-of-large-mdps-with-unknown","title":"Bayesian Control of Large MDPs with Unknown Dynamics in Data-Poor Environments","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-cross-entropy-method-for-safe","title":"Constrained Cross-Entropy Method for Safe Reinforcement Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deepexposure-learning-to-expose-photos-with","title":"DeepExposure: Learning to Expose Photos with Asynchronously Reinforced Adversarial Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-multitask-reinforcement-learning","title":"Distributed Multitask Reinforcement Learning with Quadratic Convergence","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-measurement-scheduling-for-adverse","title":"Dynamic Measurement Scheduling for Adverse Event Forecasting using Deep RL","date":"2018-12-01","arxiv_id":"1812.00268","repositories_listed":0,"syntology":null},{"url":null,"slug":"fighting-boredom-in-recommender-systems-with","title":"Fighting Boredom in Recommender Systems with Linear Reinforcement Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"genetic-gated-networks-for-deep-reinforcement-1","title":"Genetic-Gated Networks for Deep Reinforcement Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"geometrically-coupled-monte-carlo-sampling","title":"Geometrically Coupled Monte Carlo Sampling","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-value-aware-model-learning","title":"Iterative Value-Aware Model Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multiple-step-greedy-policies-in-approximate","title":"Multiple-Step Greedy Policies in Approximate and Online Reinforcement Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"negotiable-reinforcement-learning-for-pareto","title":"Negotiable Reinforcement Learning for Pareto Optimal Sequential Decision-Making","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"post-device-placement-with-cross-entropy","title":"Post: Device Placement with Cross-Entropy Minimization and Proximal Policy Optimization","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"refuel-exploring-sparse-features-in-deep","title":"REFUEL: Exploring Sparse Features in Deep Reinforcement Learning for Fast Disease Diagnosis","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-multiple-experts","title":"Reinforcement Learning with Multiple Experts: A Bayesian Model Combination Approach","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"synthesize-policies-for-transfer-and","title":"Synthesize Policies for Transfer and Adaptation across Tasks and Environments","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-importance-of-sampling-inmeta","title":"The Importance of Sampling inMeta-Reinforcement Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-of-value-functions-via-variational","title":"Transfer of Value Functions via Variational Methods","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"why-so-gloomy-a-bayesian-explanation-of-human","title":"Why so gloomy? A Bayesian explanation of human pessimism bias in the multi-armed bandit task","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-transfer-with-deictic-object","title":"Zero-Shot Transfer with Deictic Object-Oriented Representation in Reinforcement Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"blockpuzzle-a-challenge-in-physical-reasoning","title":"BlockPuzzle - A Challenge in Physical Reasoning and Generalization for Robot Learning","date":"2018-11-30","arxiv_id":"1812.00091","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-organize-your-deep-reinforcement","title":"How to Organize your Deep Reinforcement Learning Agents: The Importance of Communication Topology","date":"2018-11-30","arxiv_id":"1811.12556","repositories_listed":0,"syntology":null},{"url":null,"slug":"modulated-policy-hierarchies","title":"Modulated Policy Hierarchies","date":"2018-11-30","arxiv_id":"1812.00025","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-monte-carlo-tree-search-as-a","title":"Using Monte Carlo Tree Search as a Demonstrator within Asynchronous Deep RL","date":"2018-11-30","arxiv_id":"1812.00045","repositories_listed":0,"syntology":null},{"url":null,"slug":"flow-shape-design-for-microfluidic-devices","title":"Flow Shape Design for Microfluidic Devices Using Deep Reinforcement Learning","date":"2018-11-29","arxiv_id":"1811.12444","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-structure-aware-online-learning-algorithm","title":"A Structure-aware Online Learning Algorithm for Markov Decision Processes","date":"2018-11-28","arxiv_id":"1811.11646","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-time-optimal","title":"Deep Reinforcement Learning for Time Optimal Velocity Control using Prior Knowledge","date":"2018-11-28","arxiv_id":"1811.11615","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-replay-for-continual-learning","title":"Experience Replay for Continual Learning","date":"2018-11-28","arxiv_id":"1811.11682","repositories_listed":0,"syntology":null},{"url":null,"slug":"trajectory-based-learning-for-ball-in-maze","title":"Trajectory-based Learning for Ball-in-Maze Games","date":"2018-11-28","arxiv_id":"1811.11441","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-control-through-non-parametric","title":"Unsupervised Control Through Non-Parametric Discriminative Rewards","date":"2018-11-28","arxiv_id":"1811.11359","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-face-aging-in-videos-via-deep","title":"Automatic Face Aging in Videos via Deep Reinforcement Learning","date":"2018-11-27","arxiv_id":"1811.11082","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-traffic-light-control-at","title":"Distributed traffic light control at uncoupled intersections with real-world topology by deep reinforcement learning","date":"2018-11-27","arxiv_id":"1811.11233","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-state-representations-in-complex","title":"Learning State Representations in Complex Systems with Multimodal Data","date":"2018-11-27","arxiv_id":"1811.11067","repositories_listed":0,"syntology":null},{"url":null,"slug":"prioritizing-starting-states-for","title":"Exploring Restart Distributions","date":"2018-11-27","arxiv_id":"1811.11298","repositories_listed":0,"syntology":null},{"url":null,"slug":"quality-aware-multimodal-saliency-detection","title":"Quality-Aware Multimodal Saliency Detection via Deep Reinforcement Learning","date":"2018-11-27","arxiv_id":"1811.10763","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-configuration-of-energy-harvesting","title":"Scaling Configuration of Energy Harvesting Sensors with Reinforcement Learning","date":"2018-11-27","arxiv_id":"1811.11259","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-is-interpretable-using-machine-learning","title":"What is Interpretable? Using Machine Learning to Design Interpretable Decision-Support Systems","date":"2018-11-27","arxiv_id":"1811.10799","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-with-distributed-deep-reinforcement","title":"PNS: Population-Guided Novelty Search for Reinforcement Learning in Hard Exploration Environments","date":"2018-11-26","arxiv_id":"1811.10264","repositories_listed":0,"syntology":null},{"url":null,"slug":"genetic-gated-networks-for-deep-reinforcement","title":"Genetic-Gated Networks for Deep Reinforcement","date":"2018-11-26","arxiv_id":"1903.01886","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimization-of-information-seeking-dialogue","title":"Optimization of Information-Seeking Dialogue Strategy for Argumentation-Based Dialogue System","date":"2018-11-26","arxiv_id":"1811.10728","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-model-based-reinforcement-learning-approach","title":"A Model-Based Reinforcement Learning Approach for a Rare Disease Diagnostic Task","date":"2018-11-25","arxiv_id":"1811.10112","repositories_listed":0,"syntology":null},{"url":"/paper/reinforced-cross-modal-matching-and-self","slug":"reinforced-cross-modal-matching-and-self","title":"Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation","date":"2018-11-25","arxiv_id":"1811.10092","repositories_listed":0,"syntology":null},{"url":null,"slug":"connecting-the-dots-between-mle-and-rl-for","title":"Connecting the Dots Between MLE and RL for Sequence Prediction","date":"2018-11-24","arxiv_id":"1811.09740","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-neural-hybrid-agents-for","title":"Evolutionary-Neural Hybrid Agents for Architecture Search","date":"2018-11-24","arxiv_id":"1811.09828","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-activate-relay-nodes-deep","title":"Learning to Activate Relay Nodes: Deep Reinforcement Learning Approach","date":"2018-11-24","arxiv_id":"1811.09759","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-attend-in-a-brain-inspired-deep","title":"Learning to attend in a brain-inspired deep neural network","date":"2018-11-23","arxiv_id":"1811.09699","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-sepsis","title":"Model-Based Reinforcement Learning for Sepsis Treatment","date":"2018-11-23","arxiv_id":"1811.09602","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-off-policy-policy-gradient-theorem-using","title":"An Off-policy Policy Gradient Theorem Using Emphatic Weightings","date":"2018-11-22","arxiv_id":"1811.09013","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-level-strategy-selection-under-partial","title":"High-Level Strategy Selection under Partial Observability in StarCraft: Brood War","date":"2018-11-21","arxiv_id":"1811.08568","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-reinforcement-learning-to-self","title":"Integrating Reinforcement Learning to Self Training for Pulmonary Nodule Segmentation in Chest X-rays","date":"2018-11-21","arxiv_id":"1811.08840","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-task-motion-planning-with","title":"Integrating Task-Motion Planning with Reinforcement Learning for Robust Decision Making in Mobile Robots","date":"2018-11-21","arxiv_id":"1811.08955","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-rl-in-contextual-decision","title":"Model-based RL in Contextual Decision Processes: PAC bounds and Exponential Improvements over Model-free Approaches","date":"2018-11-21","arxiv_id":"1811.08540","repositories_listed":0,"syntology":null},{"url":"/paper/neural-machine-translation-with-adequacy","slug":"neural-machine-translation-with-adequacy","title":"Neural Machine Translation with Adequacy-Oriented Learning","date":"2018-11-21","arxiv_id":"1811.08541","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-learning-of-pedestrian","title":"Representation Learning of Pedestrian Trajectories Using Actor-Critic Sequence-to-Sequence Autoencoder","date":"2018-11-20","arxiv_id":"1811.08069","repositories_listed":0,"syntology":null},{"url":null,"slug":"chat-more-if-you-like-dynamic-cue-words","title":"Chat More If You Like: Dynamic Cue Words Planning to Flow Longer Conversations","date":"2018-11-19","arxiv_id":"1811.07631","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-efficiency-in-reinforcement-learning","title":"Energy Efficiency in Reinforcement Learning for Wireless Sensor Networks","date":"2018-11-19","arxiv_id":"1812.02538","repositories_listed":0,"syntology":null},{"url":null,"slug":"measurement-based-adaptation-protocol-with","title":"Measurement-based adaptation protocol with quantum reinforcement learning in a Rigetti quantum computer","date":"2018-11-19","arxiv_id":"1811.07594","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-and-inverse","title":"Reinforcement Learning and Inverse Reinforcement Learning with System 1 and System 2","date":"2018-11-19","arxiv_id":"1811.08549","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulated-autonomous-driving-in-a-realistic","title":"Simulated Autonomous Driving in a Realistic Driving Environment using Deep Reinforcement Learning and a Deterministic Finite State Machine","date":"2018-11-19","arxiv_id":"1811.07868","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-infer-rl-based-search-for-dnn","title":"Learning to infer: RL-based search for DNN primitive selection on Heterogeneous Embedded Systems","date":"2018-11-18","arxiv_id":"1811.07315","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-with-model-based","title":"Policy Optimization with Model-based Explorations","date":"2018-11-18","arxiv_id":"1811.07350","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-organizing-maps-for-storage-and-transfer","title":"Self-Organizing Maps for Storage and Transfer of Knowledge in Reinforcement Learning","date":"2018-11-18","arxiv_id":"1811.08318","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-extraction-of-a-hierarchical","title":"Autonomous Extraction of a Hierarchical Structure of Tasks in Reinforcement Learning, A Sequential Associate Rule Mining Approach","date":"2018-11-17","arxiv_id":"1811.08275","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergence-of-linguistic-conventions-in-multi","title":"Emergence of linguistic conventions in multi-agent reinforcement learning","date":"2018-11-17","arxiv_id":"1811.07208","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-sharing-reinforcement-learning","title":"Parameter Sharing Reinforcement Learning Architecture for Multi Agent Driving Behaviors","date":"2018-11-17","arxiv_id":"1811.07214","repositories_listed":0,"syntology":null},{"url":null,"slug":"recursive-sparse-pseudo-input-gaussian","title":"Recursive Sparse Pseudo-input Gaussian Process SARSA","date":"2018-11-17","arxiv_id":"1811.07201","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-impatient-may-use-limited-optimism-to","title":"The Impatient May Use Limited Optimism to Minimize Regret","date":"2018-11-17","arxiv_id":"1811.07146","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-algorithmic-perspective-on-imitation","title":"An Algorithmic Perspective on Imitation Learning","date":"2018-11-16","arxiv_id":"1811.06711","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-where-to-fixate-on-foveated-images","title":"Cost-Aware Fine-Grained Recognition for IoTs Based on Sequential Fixations","date":"2018-11-16","arxiv_id":"1811.06868","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-stochastic-composition","title":"Asynchronous Stochastic Composition Optimization with Variance Reduction","date":"2018-11-15","arxiv_id":"1811.06396","repositories_listed":0,"syntology":null},{"url":null,"slug":"concept-learning-through-deep-reinforcement","title":"Concept Learning through Deep Reinforcement Learning with Memory-Augmented Neural Networks","date":"2018-11-15","arxiv_id":"1811.06145","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-dependent-upper-confidence-bounds-for","title":"Context-Dependent Upper-Confidence Bounds for Directed Exploration","date":"2018-11-15","arxiv_id":"1811.06629","repositories_listed":0,"syntology":null},{"url":null,"slug":"intervention-aided-reinforcement-learning-for","title":"Intervention Aided Reinforcement Learning for Safe and Practical Policy Optimization in Navigation","date":"2018-11-15","arxiv_id":"1811.06187","repositories_listed":0,"syntology":null},{"url":null,"slug":"orthogonal-policy-gradient-and-autonomous","title":"Orthogonal Policy Gradient and Autonomous Driving Application","date":"2018-11-15","arxiv_id":"1811.06151","repositories_listed":0,"syntology":null}],"record_sha256":"c7f3528e02fdef0268fff45c85b204ce90bf0cb2fa95af232ef1dfc45f8669be","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}