{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/118","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":118,"pages_in_order":132,"rows_per_page":100,"rows":[11701,11800],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/117","next":"/task/reinforcement-learning/papers/119","papers":[{"url":null,"slug":"how-to-combine-tree-search-methods-in","title":"How to Combine Tree-Search Methods in Reinforcement Learning","date":"2018-09-06","arxiv_id":"1809.01843","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-what-not-to-learn-action-elimination","title":"Learn What Not to Learn: Action Elimination with Deep Reinforcement Learning","date":"2018-09-06","arxiv_id":"1809.02121","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-regularization-for-deep","title":"Model-Based Regularization for Deep Reinforcement Learning with Transcoder Networks","date":"2018-09-06","arxiv_id":"1809.01906","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-world-models-facilitate-policy","title":"Recurrent World Models Facilitate Policy Evolution","date":"2018-09-04","arxiv_id":"1809.01999","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-deep-reinforcement-learning-with","title":"Transferring Deep Reinforcement Learning with Adversarial Objective and Augmentation","date":"2018-09-04","arxiv_id":"1809.00770","repositories_listed":0,"syntology":null},{"url":null,"slug":"flatland-a-lightweight-first-person-2-d","title":"Flatland: a Lightweight First-Person 2-D Environment for Reinforcement Learning","date":"2018-09-03","arxiv_id":"1809.00510","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-exploration-for-deep-reinforcement","title":"Effective Exploration for Deep Reinforcement Learning via Bootstrapped Q-Ensembles under Tsallis Entropy Regularization","date":"2018-09-02","arxiv_id":"1809.00403","repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-language-person-search-using-deep","title":"Natural Language Person Search Using Deep Reinforcement Learning","date":"2018-09-02","arxiv_id":"1809.00365","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-contextual-bandit-based-approach-for","title":"A Contextual-bandit-based Approach for Informed Decision-making in Clinical Trials","date":"2018-09-01","arxiv_id":"1809.00258","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-deep-reinforcement-learning-for","title":"Collaborative Deep Reinforcement Learning for Multi-Object Tracking","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-iterative","title":"Deep Reinforcement Learning with Iterative Shift for Visual Tracking","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-agent-deep-reinforcement-learning-for","title":"Dual-Agent Deep Reinforcement Learning for Deformable Face Tracking","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-oriented-visual-question-generation-via","title":"Goal-Oriented Visual Question Generation via Intermediate Rewards","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"part-activated-deep-reinforcement-learning","title":"Part-Activated Deep Reinforcement Learning for Action Prediction","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-actor-critic-tracking","title":"Real-time 'Actor-Critic' Tracking","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"snap-angle-prediction-for-360a-panoramas","title":"Snap Angle Prediction for 360Â° Panoramas","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"directed-exploration-in-pac-model-free","title":"Directed Exploration in PAC Model-Free Reinforcement Learning","date":"2018-08-31","arxiv_id":"1808.10552","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensemble-sequence-level-training-for","title":"Ensemble Sequence Level Training for Multimodal MT: OSU-Baidu WMT18 Multimodal Machine Translation System Report","date":"2018-08-31","arxiv_id":"1808.10592","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-driven-translation","title":"A Reinforcement Learning-driven Translation Model for Search-Oriented Conversational Systems","date":"2018-08-29","arxiv_id":"1809.01495","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-exploration-through-state","title":"Approximate Exploration through State Abstraction","date":"2018-08-29","arxiv_id":"1808.09819","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-a-policy-for-opportunistic-active","title":"Learning a Policy for Opportunistic Active Learning","date":"2018-08-29","arxiv_id":"1808.10009","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-confidence-error-estimates-for-learned","title":"High-confidence error estimates for learned value functions","date":"2018-08-28","arxiv_id":"1808.09127","repositories_listed":0,"syntology":null},{"url":null,"slug":"marl-fwc-optimal-coordination-of-freeway","title":"MARL-FWC: Optimal Coordination of Freeway Traffic Control Measures","date":"2018-08-27","arxiv_id":"1808.09806","repositories_listed":0,"syntology":null},{"url":"/paper/navigationnet-a-large-scale-interactive","slug":"navigationnet-a-large-scale-interactive","title":"NavigationNet: A Large-scale Interactive Indoor Navigation Dataset","date":"2018-08-25","arxiv_id":"1808.08374","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-optimization-and-its-dynamic","title":"Proximal Policy Optimization and its Dynamic Version for Sequence Generation","date":"2018-08-24","arxiv_id":"1808.07982","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-shared-structures-and-hierarchies","title":"Exploring Shared Structures and Hierarchies for Multiple NLP Tasks","date":"2018-08-23","arxiv_id":"1808.07658","repositories_listed":0,"syntology":null},{"url":null,"slug":"playing-20-question-game-with-policy-based","title":"Playing 20 Question Game with Policy-Based Reinforcement Learning","date":"2018-08-23","arxiv_id":"1808.07645","repositories_listed":0,"syntology":null},{"url":null,"slug":"catastrophic-importance-of-catastrophic","title":"Catastrophic Importance of Catastrophic Forgetting","date":"2018-08-20","arxiv_id":"1808.07049","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-oriented-dialogue-policy-learning-from","title":"Goal-oriented Dialogue Policy Learning from Failures","date":"2018-08-20","arxiv_id":"1808.06497","repositories_listed":0,"syntology":null},{"url":null,"slug":"source-critical-reinforcement-learning-for","title":"Source-Critical Reinforcement Learning for Transferring Spoken Language Understanding to a New Language","date":"2018-08-19","arxiv_id":"1808.06167","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-poisoning-attacks-in-contextual-bandits","title":"Data Poisoning Attacks in Contextual Bandits","date":"2018-08-17","arxiv_id":"1808.05760","repositories_listed":0,"syntology":null},{"url":null,"slug":"importance-mixing-improving-sample-reuse-in","title":"Importance mixing: Improving sample reuse in evolutionary policy search methods","date":"2018-08-17","arxiv_id":"1808.05832","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-autonomous-defence","title":"Reinforcement Learning for Autonomous Defence in Software-Defined Networking","date":"2018-08-17","arxiv_id":"1808.05770","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-consistency-verification-into","title":"Incorporating Consistency Verification into Neural Data-to-Document Generation","date":"2018-08-15","arxiv_id":"1808.05306","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-optimal-policy-for-patient-laboratory","title":"An Optimal Policy for Patient Laboratory Tests in Intensive Care Units","date":"2018-08-14","arxiv_id":"1808.04679","repositories_listed":0,"syntology":null},{"url":null,"slug":"directed-policy-gradient-for-safe","title":"Directed Policy Gradient for Safe Reinforcement Learning with Human Advice","date":"2018-08-13","arxiv_id":"1808.04096","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-sensor-network-reconfiguration-with","title":"Visual Sensor Network Reconfiguration with Deep Reinforcement Learning","date":"2018-08-13","arxiv_id":"1808.04287","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-active-object-tracking-and-its","title":"End-to-end Active Object Tracking and Its Real-world Deployment via Reinforcement Learning","date":"2018-08-10","arxiv_id":"1808.03405","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-as-wasserstein-gradient","title":"Policy Optimization as Wasserstein Gradient Flows","date":"2018-08-09","arxiv_id":"1808.03030","repositories_listed":0,"syntology":null},{"url":null,"slug":"segmental-audio-word2vec-representing","title":"Segmental Audio Word2Vec: Representing Utterances as Sequences of Vectors with Applications in Spoken Term Detection","date":"2018-08-07","arxiv_id":"1808.02228","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-multivariate-policy-evaluation","title":"Distributional Multivariate Policy Evaluation and Exploration with the Bellman GAN","date":"2018-08-06","arxiv_id":"1808.01960","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-optimizing-deep-convolutional-neural","title":"On Optimizing Deep Convolutional Neural Networks by Evolutionary Computing","date":"2018-08-06","arxiv_id":"1808.01766","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-bounds-for-reinforcement-learning-via","title":"Regret Bounds for Reinforcement Learning via Markov Chain Concentration","date":"2018-08-06","arxiv_id":"1808.01813","repositories_listed":0,"syntology":null},{"url":null,"slug":"genesys-enabling-continuous-learning-through","title":"GeneSys: Enabling Continuous Learning through Neural Network Evolution in Hardware","date":"2018-08-03","arxiv_id":"1808.01363","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-actionable-representations-from","title":"Learning Actionable Representations from Visual Observations","date":"2018-08-02","arxiv_id":"1808.00928","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-concept-of-deep-reinforcement-learning-1","title":"A New Concept of Deep Reinforcement Learning based Augmented General Tagging System","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-framework-for","title":"A Reinforcement Learning Framework for Natural Question Generation using Bi-discriminators","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-rationale-augmented-charge","title":"Interpretable Rationale Augmented Charge Prediction System","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dexterous-in-hand-manipulation","title":"Learning Dexterous In-Hand Manipulation","date":"2018-08-01","arxiv_id":"1808.00177","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-math-word-problem-solver-with","title":"Neural Math Word Problem Solver with Reinforcement Learning","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"source-critical-reinforcement-learning-for-1","title":"Source Critical Reinforcement Learning for Transferring Spoken Language Understanding to a New Language","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-dialogue-policy-with-graph-neural","title":"Structured Dialogue Policy with Graph Neural Networks","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-stabilizable-dynamical-systems-via","title":"Learning Stabilizable Dynamical Systems via Control Contraction Metrics","date":"2018-07-31","arxiv_id":"1808.00113","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-object-perceiver-recognition-guided","title":"Active Object Perceiver: Recognition-guided Policy Learning for Object Searching on Mobile Robots","date":"2018-07-30","arxiv_id":"1807.11174","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-spatiotemporal-self-supervision-by","title":"Improving Spatiotemporal Self-Supervision by Deep Reinforcement Learning","date":"2018-07-30","arxiv_id":"1807.11293","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-interrupt-a-hierarchical-deep","title":"Learning to Interrupt: A Hierarchical Deep Reinforcement Learning Framework for Efficient Exploration","date":"2018-07-30","arxiv_id":"1807.11150","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-motion-priors-in-videos-for","title":"Leveraging Motion Priors in Videos for Improving Human Segmentation","date":"2018-07-30","arxiv_id":"1807.11436","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-tap-setting-of-voltage-regulation","title":"Optimal Tap Setting of Voltage Regulation Transformers Using Batch Reinforcement Learning","date":"2018-07-29","arxiv_id":"1807.10997","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-pdf-probabilistic-surface-optimization","title":"Deep PDF: Probabilistic Surface Optimization and Density Estimation","date":"2018-07-27","arxiv_id":"1807.10728","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-target","title":"A Reinforcement Learning Approach to Target Tracking in a Camera Network","date":"2018-07-26","arxiv_id":"1807.10336","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-feedback-for-affordance-driven","title":"Multi-modal Feedback for Affordance-driven Interactive Reinforcement Learning","date":"2018-07-26","arxiv_id":"1807.09991","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-bayesian-reinforcement-learning","title":"Variational Bayesian Reinforcement Learning with Regret Bounds","date":"2018-07-25","arxiv_id":"1807.09647","repositories_listed":0,"syntology":null},{"url":"/paper/video-storytelling","slug":"video-storytelling","title":"Video Storytelling: Textual Summaries for Events","date":"2018-07-25","arxiv_id":"1807.09418","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-temporal-difference-reinforcement-learning","title":"A Temporal Difference Reinforcement Learning Theory of Emotion: unifying emotion, cognition and adaptive behavior","date":"2018-07-24","arxiv_id":"1807.08941","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-explanations-for-reinforcement","title":"Contrastive Explanations for Reinforcement Learning in terms of Expected Consequences","date":"2018-07-23","arxiv_id":"1807.08706","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-play-pong-using-policy-gradient","title":"Learning to Play Pong using Policy Gradient Learning","date":"2018-07-23","arxiv_id":"1807.08452","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-structure-aware-reinforcement","title":"Accelerated Structure-Aware Reinforcement Learning for Delay-Sensitive Energy Harvesting Wireless Sensors","date":"2018-07-22","arxiv_id":"1807.08315","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-advantage-actor-critic-agent-for","title":"Asynchronous Advantage Actor-Critic Agent for Starcraft II","date":"2018-07-22","arxiv_id":"1807.08217","repositories_listed":0,"syntology":null},{"url":null,"slug":"navren-rl-learning-to-fly-in-real-environment","title":"NAVREN-RL: Learning to fly in real environment via end-to-end deep reinforcement learning using monocular images","date":"2018-07-22","arxiv_id":"1807.08241","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatically-designing-cnn-architectures-for","title":"Automatically Designing CNN Architectures for Medical Image Segmentation","date":"2018-07-19","arxiv_id":"1807.07663","repositories_listed":0,"syntology":null},{"url":null,"slug":"fuzzergym-a-competitive-framework-for-fuzzing","title":"FuzzerGym: A Competitive Framework for Fuzzing and Learning","date":"2018-07-19","arxiv_id":"1807.07490","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-organizing-maps-as-a-storage-and","title":"Self-Organizing Maps as a Storage and Transfer Mechanism in Reinforcement Learning","date":"2018-07-19","arxiv_id":"1807.07530","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-explainable-and-controllable-open","title":"Towards Explainable and Controllable Open Domain Dialogue Generation with Dialogue Acts","date":"2018-07-19","arxiv_id":"1807.07255","repositories_listed":0,"syntology":null},{"url":null,"slug":"news-based-trading-strategies","title":"News-based trading strategies","date":"2018-07-18","arxiv_id":"1807.06824","repositories_listed":0,"syntology":null},{"url":null,"slug":"representational-efficiency-outweighs-action","title":"Representational efficiency outweighs action efficiency in human program induction","date":"2018-07-18","arxiv_id":"1807.07134","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-ltlfldlf-goals","title":"Foundations for Restraining Bolts: Reinforcement Learning with LTLf/LDLf restraining specifications","date":"2018-07-17","arxiv_id":"1807.06333","repositories_listed":0,"syntology":null},{"url":null,"slug":"discrete-linear-complexity-reinforcement","title":"Discrete linear-complexity reinforcement learning in continuous action spaces for Q-learning algorithms","date":"2018-07-16","arxiv_id":"1807.06957","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-robust-policy-learning-in-the-presence","title":"Online Robust Policy Learning in the Presence of Unknown Adversaries","date":"2018-07-16","arxiv_id":"1807.06064","repositories_listed":0,"syntology":null},{"url":null,"slug":"shielded-decision-making-in-mdps","title":"Safe Reinforcement Learning via Probabilistic Shields","date":"2018-07-16","arxiv_id":"1807.06096","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-interpretable-deep-reinforcement","title":"Toward Interpretable Deep Reinforcement Learning with Linear Model U-Trees","date":"2018-07-16","arxiv_id":"1807.05887","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-hierarchy-aware-inverse","title":"Exploring Hierarchy-Aware Inverse Reinforcement Learning","date":"2018-07-13","arxiv_id":"1807.05037","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-constrained-randomized-shortest-paths","title":"A Constrained Randomized Shortest-Paths Framework for Optimal Exploration","date":"2018-07-12","arxiv_id":"1807.04551","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-bottleneck-simulator-a-model-based-deep","title":"The Bottleneck Simulator: A Model-based Deep Reinforcement Learning Approach","date":"2018-07-12","arxiv_id":"1807.04723","repositories_listed":0,"syntology":null},{"url":null,"slug":"will-it-blend-composing-value-functions-in","title":"Will it Blend? Composing Value Functions in Reinforcement Learning","date":"2018-07-12","arxiv_id":"1807.04439","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hierarchical-bayesian-linear-regression","title":"A Hierarchical Bayesian Linear Regression Model with Local Features for Stochastic Dynamics Approximation","date":"2018-07-11","arxiv_id":"1807.03931","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-local-is-the-local-diversity-reinforcing","title":"How Local is the Local Diversity? Reinforcing Sequential Determinantal Point Processes with Dynamic Ground Sets for Supervised Video Summarization","date":"2018-07-11","arxiv_id":"1807.04219","repositories_listed":0,"syntology":null},{"url":null,"slug":"cirl-controllable-imitative-reinforcement","title":"CIRL: Controllable Imitative Reinforcement Learning for Vision-based Self-driving","date":"2018-07-10","arxiv_id":"1807.03776","repositories_listed":0,"syntology":null},{"url":null,"slug":"deterministic-policy-gradients-with-general","title":"Deterministic Policy Gradients With General State Transitions","date":"2018-07-10","arxiv_id":"1807.03708","repositories_listed":0,"syntology":null},{"url":null,"slug":"partial-policy-based-reinforcement-learning","title":"Partial Policy-based Reinforcement Learning for Anatomical Landmark Localization in 3D Medical Images","date":"2018-07-09","arxiv_id":"1807.02908","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-summarisation-by-classification-with","title":"Video Summarisation by Classification with Deep Reinforcement Learning","date":"2018-07-09","arxiv_id":"1807.03089","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-deep-compression-by-reinforcement","title":"Auto Deep Compression by Reinforcement Learning Based Actor-Critic Structure","date":"2018-07-08","arxiv_id":"1807.02886","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-policy-search-algorithms-for","title":"A survey on policy search algorithms for learning robot controllers in a handful of trials","date":"2018-07-06","arxiv_id":"1807.02303","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-race-driving-with-deep","title":"End-to-End Race Driving with Deep Reinforcement Learning","date":"2018-07-06","arxiv_id":"1807.02371","repositories_listed":0,"syntology":null},{"url":null,"slug":"jumper-learning-when-to-make-classification","title":"JUMPER: Learning When to Make Classification Decisions in Reading","date":"2018-07-06","arxiv_id":"1807.02314","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduction-for-reinforcement-learning","title":"Variance Reduction for Reinforcement Learning in Input-Driven Environments","date":"2018-07-06","arxiv_id":"1807.02264","repositories_listed":0,"syntology":null},{"url":null,"slug":"arcades-a-deep-model-for-adaptive-decision","title":"Arcades: A deep model for adaptive decision making in voice controlled smart-home","date":"2018-07-05","arxiv_id":"1807.01970","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-doom-using","title":"Deep Reinforcement Learning for Doom using Unsupervised Auxiliary Tasks","date":"2018-07-05","arxiv_id":"1807.01960","repositories_listed":0,"syntology":null},{"url":null,"slug":"encoding-motion-primitives-for-autonomous","title":"Encoding Motion Primitives for Autonomous Vehicles using Virtual Velocity Constraints and Neural Network Scheduling","date":"2018-07-05","arxiv_id":"1807.02187","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-oriented-trajectories-for-efficient","title":"Goal-oriented Trajectories for Efficient Exploration","date":"2018-07-05","arxiv_id":"1807.02078","repositories_listed":0,"syntology":null},{"url":null,"slug":"per-decision-multi-step-temporal-difference","title":"Per-decision Multi-step Temporal Difference Learning with Control Variates","date":"2018-07-05","arxiv_id":"1807.01830","repositories_listed":0,"syntology":null}],"record_sha256":"4c724c36b7ec65ecc598e534e6dd6654d8d61085d7a3af909e1ac27e41a23038","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}