{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/125","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":125,"pages_in_order":135,"rows_per_page":100,"rows":[12401,12500],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/124","next":"/task/reinforcement-learning-2/papers/126","papers":[{"url":null,"slug":"exploiting-environmental-variation-to-improve","title":"Exploiting Environmental Variation to Improve Policy Robustness in Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"expressiveness-in-deep-reinforcement-learning","title":"Expressiveness in Deep Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"guided-exploration-in-deep-reinforcement","title":"Guided Exploration in Deep Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-policies-using-inverse-rewards-for","title":"Hybrid Policies Using Inverse Rewards for Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"incremental-hierarchical-reinforcement","title":"Incremental Hierarchical Reinforcement Learning with Multitask LMDPs","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-parallel-exploration-for","title":"Interactive Parallel Exploration for Reinforcement Learning in Continuous Action Spaces","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-coordinate-multiple-reinforcement","title":"Learning to Coordinate Multiple Reinforcement Learning Agents for Diverse Query Reformulation","date":"2018-09-27","arxiv_id":"1809.10658","repositories_listed":0,"syntology":null},{"url":null,"slug":"mimicking-actions-is-a-good-strategy-for","title":"Mimicking actions is a good strategy for beginners: Fast Reinforcement Learning with Expert Action Sequences","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-generalization-in-capacity-limited","title":"Policy Generalization In Capacity-Limited Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"shrinkage-based-bias-variance-trade-off-for","title":"Shrinkage-based Bias-Variance Trade-off for Deep Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"successor-options-an-option-discovery-1","title":"Successor Options : An Option Discovery Algorithm for Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-wisdom-of-the-crowd-reliable-deep","title":"The wisdom of the crowd: reliable deep reinforcement learning through ensembles of Q-functions","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-exploration-with-deep-model","title":"Unsupervised Exploration with Deep Model-Based Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"what-would-pi-do-imitation-learning-via-off","title":"What Would pi* Do?: Imitation Learning via Off-Policy Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"where-off-policy-deep-reinforcement-learning","title":"Where Off-Policy Deep Reinforcement Learning Fails","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"alphaseq-sequence-discovery-with-deep","title":"AlphaSeq: Sequence Discovery with Deep Reinforcement Learning","date":"2018-09-26","arxiv_id":"1810.01218","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-navigation-behaviors-end-to-end-with","title":"Learning Navigation Behaviors End-to-End with AutoRL","date":"2018-09-26","arxiv_id":"1809.10124","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-through-probing-a-decentralized","title":"Learning through Probing: a decentralized reinforcement learning architecture for social dilemmas","date":"2018-09-26","arxiv_id":"1809.10007","repositories_listed":0,"syntology":null},{"url":null,"slug":"omega-regular-objectives-in-model-free","title":"Omega-Regular Objectives in Model-Free Reinforcement Learning","date":"2018-09-26","arxiv_id":"1810.00950","repositories_listed":0,"syntology":null},{"url":null,"slug":"anderson-acceleration-for-reinforcement","title":"Anderson Acceleration for Reinforcement Learning","date":"2018-09-25","arxiv_id":"1809.09501","repositories_listed":0,"syntology":null},{"url":null,"slug":"floyd-warshall-reinforcement-learning","title":"Floyd-Warshall Reinforcement Learning: Learning from Past Experiences to Reach New Goals","date":"2018-09-25","arxiv_id":"1809.09318","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-deep-multiagent-reinforcement","title":"Hierarchical Deep Multiagent Reinforcement Learning with Temporal Abstraction","date":"2018-09-25","arxiv_id":"1809.09332","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-precision-policy-distillation-with","title":"Low Precision Policy Distillation with Application to Low-Power, Real-time Sensation-Cognition-Action Loop with Neuromorphic Computing","date":"2018-09-25","arxiv_id":"1809.09260","repositories_listed":0,"syntology":null},{"url":null,"slug":"resilient-computing-with-reinforcement","title":"Resilient Computing with Reinforcement Learning on a Dynamical System: Case Study in Sorting","date":"2018-09-25","arxiv_id":"1809.09261","repositories_listed":0,"syntology":null},{"url":null,"slug":"epirl-a-reinforcement-learning-agent-to","title":"EpiRL: A Reinforcement Learning Agent to Facilitate Epistasis Detection","date":"2018-09-24","arxiv_id":"1809.09143","repositories_listed":0,"syntology":null},{"url":null,"slug":"sdn-flow-entry-management-using-reinforcement","title":"SDN Flow Entry Management Using Reinforcement Learning","date":"2018-09-24","arxiv_id":"1809.09003","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-learning-framework-for-high-precision","title":"A Learning Framework for High Precision Industrial Assembly","date":"2018-09-23","arxiv_id":"1809.08548","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-reinforcement-learning-for-full-length","title":"On Reinforcement Learning for Full-length Game of StarCraft","date":"2018-09-23","arxiv_id":"1809.09095","repositories_listed":0,"syntology":null},{"url":null,"slug":"geometric-multi-model-fitting-by-deep","title":"Geometric Multi-Model Fitting by Deep Reinforcement Learning","date":"2018-09-22","arxiv_id":"1809.08397","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-analysis-of-the-gtd-policy","title":"Finite Sample Analysis of the GTD Policy Evaluation Algorithms in Markov Setting","date":"2018-09-21","arxiv_id":"1809.08926","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-multi-objective-reinforcement","title":"Interpretable Multi-Objective Reinforcement Learning through Policy Orchestration","date":"2018-09-21","arxiv_id":"1809.08343","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligentcrowd-mobile-crowdsensing-via","title":"IntelligentCrowd: Mobile Crowdsensing via Multi-Agent Reinforcement Learning","date":"2018-09-20","arxiv_id":"1809.07830","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-reinforcement-learning-with","title":"Interpretable Reinforcement Learning with Ensemble Methods","date":"2018-09-19","arxiv_id":"1809.06995","repositories_listed":0,"syntology":null},{"url":null,"slug":"prosocial-or-selfish-agents-with-different","title":"Prosocial or Selfish? Agents with different behaviors for Contract Negotiation using Reinforcement Learning","date":"2018-09-19","arxiv_id":"1809.07066","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiobjective-reinforcement-learning-for","title":"Multiobjective Reinforcement Learning for Reconfigurable Adaptive Optimal Control of Manufacturing Processes","date":"2018-09-18","arxiv_id":"1809.06750","repositories_listed":0,"syntology":null},{"url":null,"slug":"scc-rfmq-learning-in-cooperative-markov-games","title":"SCC-rFMQ Learning in Cooperative Markov Games with Continuous Actions","date":"2018-09-18","arxiv_id":"1809.06625","repositories_listed":0,"syntology":null},{"url":null,"slug":"switching-isotropic-and-directional","title":"Switching Isotropic and Directional Exploration with Parameter Space Noise in Deep Reinforcement Learning","date":"2018-09-18","arxiv_id":"1809.06570","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-imitation-via-variational-inverse","title":"Adversarial Imitation via Variational Inverse Reinforcement Learning","date":"2018-09-17","arxiv_id":"1809.06404","repositories_listed":0,"syntology":null},{"url":null,"slug":"automata-guided-reinforcement-learning-with","title":"Automata Guided Reinforcement Learning With Demonstrations","date":"2018-09-17","arxiv_id":"1809.06305","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-goal-masking-for-continuous-deep","title":"Curriculum goal masking for continuous deep reinforcement learning","date":"2018-09-17","arxiv_id":"1809.06146","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-collaborate-multi-scenario","title":"Learning to Collaborate: Multi-Scenario Ranking via Multi-Agent Reinforcement Learning","date":"2018-09-17","arxiv_id":"1809.06260","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-sensitive-deep-reinforcement-learning","title":"Object-sensitive Deep Reinforcement Learning","date":"2018-09-17","arxiv_id":"1809.06064","repositories_listed":0,"syntology":null},{"url":null,"slug":"improvements-on-hindsight-learning","title":"Improvements on Hindsight Learning","date":"2018-09-16","arxiv_id":"1809.06719","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-reinforcement-learning-for","title":"Adversarial Reinforcement Learning for Observer Design in Autonomous Systems under Cyber Attacks","date":"2018-09-15","arxiv_id":"1809.06784","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-tuning-distributed-stream-processing","title":"Auto-tuning Distributed Stream Processing Systems using Reinforcement Learning","date":"2018-09-14","arxiv_id":"1809.05495","repositories_listed":0,"syntology":null},{"url":null,"slug":"macquarie-university-at-bioasq-6b-deep-1","title":"Macquarie University at BioASQ 6b: Deep learning and deep reinforcement learning for query-based multi-document summarisation","date":"2018-09-14","arxiv_id":"1809.05283","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-diagnostics-for-deep-reinforcement","title":"Visual Diagnostics for Deep Reinforcement Learning Policy Development","date":"2018-09-14","arxiv_id":"1809.06781","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordination-driven-learning-in-multi-agent","title":"Coordination-driven learning in multi-agent problem spaces","date":"2018-09-13","arxiv_id":"1809.04918","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-based-on-deep-reinforcement","title":"Image Captioning based on Deep Reinforcement Learning","date":"2018-09-13","arxiv_id":"1809.04835","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-personalized-and-flexible-playlist","title":"Automatic, Personalized, and Flexible Playlist Generation using Reinforcement Learning","date":"2018-09-12","arxiv_id":"1809.04214","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multi-agent-reinforcement-learning-method","title":"A Multi-Agent Reinforcement Learning Method for Impression Allocation in Online Display Advertising","date":"2018-09-10","arxiv_id":"1809.03152","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-generate-structured-queries-from","title":"Learning to Generate Structured Queries from Natural Language with Indirect Supervision","date":"2018-09-10","arxiv_id":"1809.03195","repositories_listed":0,"syntology":null},{"url":null,"slug":"vpe-variational-policy-embedding-for-transfer","title":"VPE: Variational Policy Embedding for Transfer Reinforcement Learning","date":"2018-09-10","arxiv_id":"1809.03548","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-prediction-of-interactive","title":"Probabilistic Prediction of Interactive Driving Behavior via Hierarchical Inverse Reinforcement Learning","date":"2018-09-09","arxiv_id":"1809.02926","repositories_listed":0,"syntology":null},{"url":null,"slug":"ans-adaptive-network-scaling-for-deep","title":"ANS: Adaptive Network Scaling for Deep Rectifier Reinforcement Learning Models","date":"2018-09-06","arxiv_id":"1809.02112","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-combine-tree-search-methods-in","title":"How to Combine Tree-Search Methods in Reinforcement Learning","date":"2018-09-06","arxiv_id":"1809.01843","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-what-not-to-learn-action-elimination","title":"Learn What Not to Learn: Action Elimination with Deep Reinforcement Learning","date":"2018-09-06","arxiv_id":"1809.02121","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-regularization-for-deep","title":"Model-Based Regularization for Deep Reinforcement Learning with Transcoder Networks","date":"2018-09-06","arxiv_id":"1809.01906","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-world-models-facilitate-policy","title":"Recurrent World Models Facilitate Policy Evolution","date":"2018-09-04","arxiv_id":"1809.01999","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-deep-reinforcement-learning-with","title":"Transferring Deep Reinforcement Learning with Adversarial Objective and Augmentation","date":"2018-09-04","arxiv_id":"1809.00770","repositories_listed":0,"syntology":null},{"url":null,"slug":"flatland-a-lightweight-first-person-2-d","title":"Flatland: a Lightweight First-Person 2-D Environment for Reinforcement Learning","date":"2018-09-03","arxiv_id":"1809.00510","repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-language-person-search-using-deep","title":"Natural Language Person Search Using Deep Reinforcement Learning","date":"2018-09-02","arxiv_id":"1809.00365","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-contextual-bandit-based-approach-for","title":"A Contextual-bandit-based Approach for Informed Decision-making in Clinical Trials","date":"2018-09-01","arxiv_id":"1809.00258","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-deep-reinforcement-learning-for","title":"Collaborative Deep Reinforcement Learning for Multi-Object Tracking","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-iterative","title":"Deep Reinforcement Learning with Iterative Shift for Visual Tracking","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-agent-deep-reinforcement-learning-for","title":"Dual-Agent Deep Reinforcement Learning for Deformable Face Tracking","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"part-activated-deep-reinforcement-learning","title":"Part-Activated Deep Reinforcement Learning for Action Prediction","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"snap-angle-prediction-for-360a-panoramas","title":"Snap Angle Prediction for 360Â° Panoramas","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"directed-exploration-in-pac-model-free","title":"Directed Exploration in PAC Model-Free Reinforcement Learning","date":"2018-08-31","arxiv_id":"1808.10552","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensemble-sequence-level-training-for","title":"Ensemble Sequence Level Training for Multimodal MT: OSU-Baidu WMT18 Multimodal Machine Translation System Report","date":"2018-08-31","arxiv_id":"1808.10592","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-driven-translation","title":"A Reinforcement Learning-driven Translation Model for Search-Oriented Conversational Systems","date":"2018-08-29","arxiv_id":"1809.01495","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-a-policy-for-opportunistic-active","title":"Learning a Policy for Opportunistic Active Learning","date":"2018-08-29","arxiv_id":"1808.10009","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-confidence-error-estimates-for-learned","title":"High-confidence error estimates for learned value functions","date":"2018-08-28","arxiv_id":"1808.09127","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-control-of-eye-movements-during","title":"Optimal control of eye-movements during visual search","date":"2018-08-28","arxiv_id":"1703.04182","repositories_listed":0,"syntology":null},{"url":"/paper/navigationnet-a-large-scale-interactive","slug":"navigationnet-a-large-scale-interactive","title":"NavigationNet: A Large-scale Interactive Indoor Navigation Dataset","date":"2018-08-25","arxiv_id":"1808.08374","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-optimization-and-its-dynamic","title":"Proximal Policy Optimization and its Dynamic Version for Sequence Generation","date":"2018-08-24","arxiv_id":"1808.07982","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-shared-structures-and-hierarchies","title":"Exploring Shared Structures and Hierarchies for Multiple NLP Tasks","date":"2018-08-23","arxiv_id":"1808.07658","repositories_listed":0,"syntology":null},{"url":null,"slug":"playing-20-question-game-with-policy-based","title":"Playing 20 Question Game with Policy-Based Reinforcement Learning","date":"2018-08-23","arxiv_id":"1808.07645","repositories_listed":0,"syntology":null},{"url":null,"slug":"catastrophic-importance-of-catastrophic","title":"Catastrophic Importance of Catastrophic Forgetting","date":"2018-08-20","arxiv_id":"1808.07049","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-oriented-dialogue-policy-learning-from","title":"Goal-oriented Dialogue Policy Learning from Failures","date":"2018-08-20","arxiv_id":"1808.06497","repositories_listed":0,"syntology":null},{"url":null,"slug":"source-critical-reinforcement-learning-for","title":"Source-Critical Reinforcement Learning for Transferring Spoken Language Understanding to a New Language","date":"2018-08-19","arxiv_id":"1808.06167","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-poisoning-attacks-in-contextual-bandits","title":"Data Poisoning Attacks in Contextual Bandits","date":"2018-08-17","arxiv_id":"1808.05760","repositories_listed":0,"syntology":null},{"url":null,"slug":"importance-mixing-improving-sample-reuse-in","title":"Importance mixing: Improving sample reuse in evolutionary policy search methods","date":"2018-08-17","arxiv_id":"1808.05832","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-autonomous-defence","title":"Reinforcement Learning for Autonomous Defence in Software-Defined Networking","date":"2018-08-17","arxiv_id":"1808.05770","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-consistency-verification-into","title":"Incorporating Consistency Verification into Neural Data-to-Document Generation","date":"2018-08-15","arxiv_id":"1808.05306","repositories_listed":0,"syntology":null},{"url":null,"slug":"directed-policy-gradient-for-safe","title":"Directed Policy Gradient for Safe Reinforcement Learning with Human Advice","date":"2018-08-13","arxiv_id":"1808.04096","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-sensor-network-reconfiguration-with","title":"Visual Sensor Network Reconfiguration with Deep Reinforcement Learning","date":"2018-08-13","arxiv_id":"1808.04287","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-bounds-for-reinforcement-learning-via","title":"Regret Bounds for Reinforcement Learning via Markov Chain Concentration","date":"2018-08-06","arxiv_id":"1808.01813","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-concept-of-deep-reinforcement-learning-1","title":"A New Concept of Deep Reinforcement Learning based Augmented General Tagging System","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-framework-for","title":"A Reinforcement Learning Framework for Natural Question Generation using Bi-discriminators","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-rationale-augmented-charge","title":"Interpretable Rationale Augmented Charge Prediction System","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dexterous-in-hand-manipulation","title":"Learning Dexterous In-Hand Manipulation","date":"2018-08-01","arxiv_id":"1808.00177","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-math-word-problem-solver-with","title":"Neural Math Word Problem Solver with Reinforcement Learning","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"source-critical-reinforcement-learning-for-1","title":"Source Critical Reinforcement Learning for Transferring Spoken Language Understanding to a New Language","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-dialogue-policy-with-graph-neural","title":"Structured Dialogue Policy with Graph Neural Networks","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-spatiotemporal-self-supervision-by","title":"Improving Spatiotemporal Self-Supervision by Deep Reinforcement Learning","date":"2018-07-30","arxiv_id":"1807.11293","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-interrupt-a-hierarchical-deep","title":"Learning to Interrupt: A Hierarchical Deep Reinforcement Learning Framework for Efficient Exploration","date":"2018-07-30","arxiv_id":"1807.11150","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-tap-setting-of-voltage-regulation","title":"Optimal Tap Setting of Voltage Regulation Transformers Using Batch Reinforcement Learning","date":"2018-07-29","arxiv_id":"1807.10997","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-target","title":"A Reinforcement Learning Approach to Target Tracking in a Camera Network","date":"2018-07-26","arxiv_id":"1807.10336","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-feedback-for-affordance-driven","title":"Multi-modal Feedback for Affordance-driven Interactive Reinforcement Learning","date":"2018-07-26","arxiv_id":"1807.09991","repositories_listed":0,"syntology":null}],"record_sha256":"61922f666390f33674ee5322948105c9677ac3389559537293b3934af538accd","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}