{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/124","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":124,"pages_in_order":132,"rows_per_page":100,"rows":[12301,12400],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/123","next":"/task/reinforcement-learning/papers/125","papers":[{"url":null,"slug":"automating-vehicles-by-deep-reinforcement","title":"Automating Vehicles by Deep Reinforcement Learning using Task Separation with Hill Climbing","date":"2017-11-29","arxiv_id":"1711.10785","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-q-learning-for-visual-vocabulary","title":"Curriculum Q-Learning for Visual Vocabulary Acquisition","date":"2017-11-29","arxiv_id":"1711.10837","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-with-double-uncertain","title":"Efficient exploration with Double Uncertain Value Networks","date":"2017-11-29","arxiv_id":"1711.10789","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-optimization-of-task-oriented","title":"End-to-End Optimization of Task-Oriented Dialogue Model with Deep Reinforcement Learning","date":"2017-11-29","arxiv_id":"1711.10712","repositories_listed":0,"syntology":null},{"url":"/paper/home-a-household-multimodal-environment","slug":"home-a-household-multimodal-environment","title":"HoME: a Household Multimodal Environment","date":"2017-11-29","arxiv_id":"1711.11017","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-to-adapt-speech","title":"Reinforcement Learning To Adapt Speech Enhancement to Instantaneous Input Signal Quality","date":"2017-11-29","arxiv_id":"1711.10791","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-captioning-via-hierarchical","title":"Video Captioning via Hierarchical Reinforcement Learning","date":"2017-11-29","arxiv_id":"1711.11135","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-algorithm-for","title":"A reinforcement learning algorithm for building collaboration in multi-agent systems","date":"2017-11-28","arxiv_id":"1711.10574","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-policy-search-via-return","title":"Hierarchical Policy Search via Return-Weighted Density Estimation","date":"2017-11-28","arxiv_id":"1711.10173","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-longitudinal-face-demonstration","title":"Learning from Longitudinal Face Demonstration - Where Tractable Deep Modeling Meets Inverse Reinforcement Learning","date":"2017-11-28","arxiv_id":"1711.10520","repositories_listed":0,"syntology":null},{"url":null,"slug":"malaria-likelihood-prediction-by-effectively","title":"Malaria Likelihood Prediction By Effectively Surveying Households Using Deep Reinforcement Learning","date":"2017-11-25","arxiv_id":"1711.09223","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-compression-inspired-framework-for-macro","title":"A Compression-Inspired Framework for Macro Discovery","date":"2017-11-24","arxiv_id":"1711.09048","repositories_listed":0,"syntology":null},{"url":null,"slug":"cascade-attribute-learning-network","title":"Cascade Attribute Learning Network","date":"2017-11-24","arxiv_id":"1711.09142","repositories_listed":0,"syntology":null},{"url":"/paper/are-you-talking-to-me-reasoned-visual-dialog","slug":"are-you-talking-to-me-reasoned-visual-dialog","title":"Are You Talking to Me? Reasoned Visual Dialog Generation through Adversarial Learning","date":"2017-11-21","arxiv_id":"1711.07613","repositories_listed":0,"syntology":null},{"url":null,"slug":"asking-the-difficult-questions-goal-oriented","title":"Asking the Difficult Questions: Goal-Oriented Visual Question Generation via Intermediate Rewards","date":"2017-11-21","arxiv_id":"1711.07614","repositories_listed":0,"syntology":null},{"url":null,"slug":"posterior-sampling-for-large-scale","title":"Posterior Sampling for Large Scale Reinforcement Learning","date":"2017-11-21","arxiv_id":"1711.07979","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-agent-behaviors-from-videos-via","title":"Transferring Agent Behaviors from Videos via Motion GANs","date":"2017-11-21","arxiv_id":"1711.07676","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-multi","title":"Deep Reinforcement Learning for Multi-Resource Multi-Machine Job Scheduling","date":"2017-11-20","arxiv_id":"1711.07440","repositories_listed":0,"syntology":null},{"url":null,"slug":"modular-continual-learning-in-a-unified","title":"Modular Continual Learning in a Unified Visual Environment","date":"2017-11-20","arxiv_id":"1711.07425","repositories_listed":0,"syntology":null},{"url":null,"slug":"situationally-aware-options","title":"Situationally Aware Options","date":"2017-11-20","arxiv_id":"1711.07832","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-network-based-reinforcement-learning","title":"Neural Network Based Reinforcement Learning for Audio-Visual Gaze Control in Human-Robot Interaction","date":"2017-11-18","arxiv_id":"1711.06834","repositories_listed":0,"syntology":null},{"url":null,"slug":"bbq-networks-efficient-exploration-in-deep","title":"BBQ-Networks: Efficient Exploration in Deep Reinforcement Learning for Task-Oriented Dialogue Systems","date":"2017-11-15","arxiv_id":"1711.05715","repositories_listed":0,"syntology":null},{"url":null,"slug":"costate-focused-models-for-reinforcement","title":"Costate-focused models for reinforcement learning","date":"2017-11-15","arxiv_id":"1711.05817","repositories_listed":0,"syntology":null},{"url":null,"slug":"finding-efficient-swimming-strategies-in-a","title":"Finding Efficient Swimming Strategies in a Three Dimensional Chaotic Flow by Reinforcement Learning","date":"2017-11-15","arxiv_id":"1711.05826","repositories_listed":0,"syntology":null},{"url":null,"slug":"markov-decision-processes-with-continuous","title":"Markov Decision Processes with Continuous Side Information","date":"2017-11-15","arxiv_id":"1711.05726","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-adaptive-newton-method-for","title":"Variational Adaptive-Newton Method for Explorative Learning","date":"2017-11-15","arxiv_id":"1711.05560","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-decision-making-framework-for","title":"A unified decision making framework for supply and demand management in microgrid networks","date":"2017-11-14","arxiv_id":"1711.05078","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-fusion-networks-for-machine-reading","title":"Dynamic Fusion Networks for Machine Reading Comprehension","date":"2017-11-14","arxiv_id":"1711.04964","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-zoom-in-network-for-fast-object","title":"Dynamic Zoom-in Network for Fast Object Detection in Large Images","date":"2017-11-14","arxiv_id":"1711.05187","repositories_listed":0,"syntology":null},{"url":null,"slug":"loss-functions-for-multiset-prediction","title":"Loss Functions for Multiset Prediction","date":"2017-11-14","arxiv_id":"1711.05246","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-a-large-scale","title":"Reinforcement Learning in a large scale photonic Recurrent Neural Network","date":"2017-11-14","arxiv_id":"1711.05133","repositories_listed":0,"syntology":null},{"url":null,"slug":"saliency-based-sequential-image-attention","title":"Saliency-based Sequential Image Attention with Multiset Prediction","date":"2017-11-14","arxiv_id":"1711.05165","repositories_listed":0,"syntology":null},{"url":null,"slug":"actual-actor-critic-under-adversarial","title":"ACtuAL: Actor-Critic Under Adversarial Learning","date":"2017-11-13","arxiv_id":"1711.04755","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduced-methods-for-non-convex","title":"Variance Reduced methods for Non-convex Composition Optimization","date":"2017-11-13","arxiv_id":"1711.04416","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-knowledge-transfer-for","title":"Fine Grained Knowledge Transfer for Personalized Task-oriented Dialogue Systems","date":"2017-11-11","arxiv_id":"1711.04079","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-method-for-stochastic-composition","title":"Accelerated Method for Stochastic Composition Optimization with Nonsmooth Regularization","date":"2017-11-10","arxiv_id":"1711.03937","repositories_listed":0,"syntology":null},{"url":null,"slug":"applications-of-deep-learning-and","title":"Applications of Deep Learning and Reinforcement Learning to Biological Data","date":"2017-11-10","arxiv_id":"1711.03985","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-user-and-agent-models-a-deep-task","title":"Integrating User and Agent Models: A Deep Task-Oriented Dialogue System","date":"2017-11-10","arxiv_id":"1711.03697","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-speech-recognition","title":"Reinforcement Learning of Speech Recognition System Based on Policy Gradient and Hypothesis Selection","date":"2017-11-10","arxiv_id":"1711.03689","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-analysis-of-multiple-turn","title":"An Empirical Analysis of Multiple-Turn Reasoning Strategies in Reading Comprehension Tasks","date":"2017-11-09","arxiv_id":"1711.03230","repositories_listed":0,"syntology":null},{"url":null,"slug":"worm-level-control-through-search-based","title":"Worm-level Control through Search-based Reinforcement Learning","date":"2017-11-09","arxiv_id":"1711.03467","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-storage-arbitrage-in-real-time-markets","title":"Energy Storage Arbitrage in Real-Time Markets via Reinforcement Learning","date":"2017-11-08","arxiv_id":"1711.03127","repositories_listed":0,"syntology":null},{"url":null,"slug":"intriguing-properties-of-adversarial-examples","title":"Intriguing Properties of Adversarial Examples","date":"2017-11-08","arxiv_id":"1711.02846","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-deep-mean-field-games-for-modeling","title":"Learning Deep Mean Field Games for Modeling Large Population Behavior","date":"2017-11-08","arxiv_id":"1711.03156","repositories_listed":0,"syntology":null},{"url":null,"slug":"double-q-and-q-unifying-reinforcement","title":"Double Q($σ$) and Q($σ, λ$): Unifying Reinforcement Learning Control Algorithms","date":"2017-11-05","arxiv_id":"1711.01569","repositories_listed":0,"syntology":null},{"url":null,"slug":"composing-meta-policies-for-autonomous","title":"Composing Meta-Policies for Autonomous Driving Using Hierarchical Deep Reinforcement Learning","date":"2017-11-04","arxiv_id":"1711.01503","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-by-genetic-distillation","title":"Policy Optimization by Genetic Distillation","date":"2017-11-03","arxiv_id":"1711.01012","repositories_listed":0,"syntology":null},{"url":null,"slug":"routing-networks-adaptive-selection-of-non","title":"Routing Networks: Adaptive Selection of Non-linear Functions for Multi-Task Learning","date":"2017-11-03","arxiv_id":"1711.01239","repositories_listed":0,"syntology":null},{"url":null,"slug":"acquiring-target-stacking-skills-by-goal","title":"Acquiring Target Stacking Skills by Goal-Parameterized Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":"1711.00267","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-text-summarization-using","title":"Automatic Text Summarization Using Reinforcement Learning with Embedding Features","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-parameter-tuning-in-optimization","title":"Intelligent Parameter Tuning in Optimization-based Iterative CT Reconstruction via Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":"1711.00414","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-diagnose-assimilating-clinical","title":"Learning to Diagnose: Assimilating Clinical Narratives using Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"paraphrase-generation-with-deep-reinforcement","title":"Paraphrase Generation with Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":"1711.00279","repositories_listed":0,"syntology":null},{"url":null,"slug":"automata-guided-hierarchical-reinforcement","title":"Automata-Guided Hierarchical Reinforcement Learning for Skill Composition","date":"2017-10-31","arxiv_id":"1711.00129","repositories_listed":0,"syntology":null},{"url":null,"slug":"artificial-intelligence-as-structural","title":"Artificial Intelligence as Structural Estimation: Economic Interpretations of Deep Blue, Bonanza, and AlphaGo","date":"2017-10-30","arxiv_id":"1710.10967","repositories_listed":0,"syntology":null},{"url":null,"slug":"exponential-improvements-for-quantum","title":"Exponential improvements for quantum-accessible reinforcement learning","date":"2017-10-30","arxiv_id":"1710.11160","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequence-to-sequence-asr-optimization-via","title":"Sequence-to-Sequence ASR Optimization via Reinforcement Learning","date":"2017-10-30","arxiv_id":"1710.10774","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-to-learn-with-multitask","title":"Transfer Learning to Learn with Multitask Neural Model Search","date":"2017-10-30","arxiv_id":"1710.10776","repositories_listed":0,"syntology":null},{"url":null,"slug":"unifying-value-iteration-advantage-learning","title":"Unifying Value Iteration, Advantage Learning, and Dynamic Policy Programming","date":"2017-10-30","arxiv_id":"1710.10866","repositories_listed":0,"syntology":null},{"url":null,"slug":"diff-dac-distributed-actor-critic-for-average","title":"Diff-DAC: Distributed Actor-Critic for Average Multitask Deep Reinforcement Learning","date":"2017-10-28","arxiv_id":"1710.10363","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-under-noisy","title":"Inverse Reinforcement Learning Under Noisy Observations","date":"2017-10-27","arxiv_id":"1710.10116","repositories_listed":0,"syntology":null},{"url":null,"slug":"duality-free-methods-for-stochastic","title":"Duality-free Methods for Stochastic Composition Optimization","date":"2017-10-26","arxiv_id":"1710.09554","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-model-identification-via-physics-engines","title":"Fast Model Identification via Physics Engines for Data-Efficient Policy Search","date":"2017-10-24","arxiv_id":"1710.08893","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-reinforcement-learning","title":"Accelerated Reinforcement Learning","date":"2017-10-23","arxiv_id":"1710.08070","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-generalization-in-the-subspaces","title":"Exploiting generalization in the subspaces for faster model-based learning","date":"2017-10-22","arxiv_id":"1710.08012","repositories_listed":0,"syntology":null},{"url":null,"slug":"insulin-regimen-ml-based-control-for-t2dm","title":"Insulin Regimen ML-based control for T2DM patients","date":"2017-10-21","arxiv_id":"1710.07855","repositories_listed":0,"syntology":null},{"url":null,"slug":"consequentialist-conditional-cooperation-in","title":"Consequentialist conditional cooperation in social dilemmas with imperfect information","date":"2017-10-19","arxiv_id":"1710.06975","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-monotone-games","title":"Online Monotone Games","date":"2017-10-19","arxiv_id":"1710.07328","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymmetric-actor-critic-for-image-based-robot","title":"Asymmetric Actor Critic for Image-Based Robot Learning","date":"2017-10-18","arxiv_id":"1710.06542","repositories_listed":0,"syntology":null},{"url":null,"slug":"map-based-multi-policy-reinforcement-learning","title":"Map-based Multi-Policy Reinforcement Learning: Enhancing Adaptability of Robots by Deep Reinforcement Learning","date":"2017-10-17","arxiv_id":"1710.06117","repositories_listed":0,"syntology":null},{"url":null,"slug":"primal-dual-learning-sample-complexity-and","title":"Primal-Dual $π$ Learning: Sample Complexity and Sublinear Run Time for Ergodic Markov Decision Problems","date":"2017-10-17","arxiv_id":"1710.06100","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-variance-reduction-for-policy","title":"Stochastic Variance Reduction for Policy Gradient Estimation","date":"2017-10-17","arxiv_id":"1710.06034","repositories_listed":0,"syntology":null},{"url":null,"slug":"manifold-regularization-for-kernelized-lstd","title":"Manifold Regularization for Kernelized LSTD","date":"2017-10-15","arxiv_id":"1710.05387","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-epicurus-the-father-of-reinforcement","title":"Is Epicurus the father of Reinforcement Learning?","date":"2017-10-12","arxiv_id":"1710.04582","repositories_listed":0,"syntology":null},{"url":null,"slug":"prm-rl-long-range-robotic-navigation-tasks-by","title":"PRM-RL: Long-range Robotic Navigation Tasks by Combining Reinforcement Learning and Sampling-based Planning","date":"2017-10-11","arxiv_id":"1710.03937","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-framework","title":"Deep Reinforcement Learning: Framework, Applications, and Embedded Implementations","date":"2017-10-10","arxiv_id":"1710.03792","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-and-off-policy-monotonic-policy","title":"On- and Off-Policy Monotonic Policy Improvement","date":"2017-10-10","arxiv_id":"1710.03442","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-inverse-reinforcement-learning-via","title":"Meta Inverse Reinforcement Learning via Maximum Reward Sharing for Human Motion Analysis","date":"2017-10-07","arxiv_id":"1710.03592","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-k-shot-learning-with-regularized","title":"Efficient K-Shot Learning with Regularized Deep Networks","date":"2017-10-06","arxiv_id":"1710.02277","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-in-feature-space-for","title":"Exploration in Feature Space for Reinforcement Learning","date":"2017-10-05","arxiv_id":"1710.02210","repositories_listed":0,"syntology":null},{"url":null,"slug":"event-identification-as-a-decision-process","title":"Event Identification as a Decision Process with Non-linear Representation of Text","date":"2017-10-03","arxiv_id":"1710.00969","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-abstract-q-networks","title":"Deep Abstract Q-Networks","date":"2017-10-02","arxiv_id":"1710.00459","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-aware-deep-reinforcement-learning","title":"Attention-Aware Deep Reinforcement Learning for Video Face Recognition","date":"2017-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-sharing-deep-deterministic-policy","title":"Parameter Sharing Deep Deterministic Policy Gradient for Cooperative Multi-agent Reinforcement Learning","date":"2017-10-01","arxiv_id":"1710.00336","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-how-to-learn-an-adaptive-dialogue","title":"Learning how to learn: an adaptive dialogue agent for incrementally learning visually grounded word meanings","date":"2017-09-29","arxiv_id":"1709.10423","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-and-synaptic-array-transceiver-a-brain","title":"Neural and Synaptic Array Transceiver: A Brain-Inspired Computing Framework for Embedded Learning","date":"2017-09-29","arxiv_id":"1709.10205","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-burchak-corpus-a-challenge-data-set-for","title":"The BURCHAK corpus: a Challenge Data Set for Interactive Learning of Visually Grounded Word Meanings","date":"2017-09-29","arxiv_id":"1709.10431","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-policy-search-method-for-temporal-logic","title":"A Policy Search Method For Temporal Logic Specified Reinforcement Learning Tasks","date":"2017-09-27","arxiv_id":"1709.09611","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-reinforcement-learning-mechanism-for","title":"A Simple Reinforcement Learning Mechanism for Resource Allocation in LTE-A Networks with Markov Decision Process and Q-Learning","date":"2017-09-27","arxiv_id":"1709.09312","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-detour-problem-in-a-stochastic","title":"The detour problem in a stochastic environment: Tolman revisited","date":"2017-09-27","arxiv_id":"1709.09761","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-oriented-neural-programming-oonp-for","title":"Object-oriented Neural Programming (OONP) for Document Understanding","date":"2017-09-26","arxiv_id":"1709.08853","repositories_listed":0,"syntology":null},{"url":null,"slug":"predictive-state-decoders-encoding-the-future","title":"Predictive-State Decoders: Encoding the Future into Recurrent Networks","date":"2017-09-25","arxiv_id":"1709.08520","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-continuous-control-of-flippers-for-a","title":"Towards continuous control of flippers for a multi-terrain robot using deep reinforcement learning","date":"2017-09-25","arxiv_id":"1709.08430","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-optimal-online-method-of-selecting-source","title":"An Optimal Online Method of Selecting Source Policies for Reinforcement Learning","date":"2017-09-24","arxiv_id":"1709.08201","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-unmanned-aerial-vehicle-control-for","title":"Learning Unmanned Aerial Vehicle Control for Autonomous Target Following","date":"2017-09-24","arxiv_id":"1709.08233","repositories_listed":0,"syntology":null},{"url":null,"slug":"bootstrapping-incremental-dialogue-systems-1","title":"Bootstrapping incremental dialogue systems from minimal data: the generalisation power of dialogue grammars","date":"2017-09-22","arxiv_id":"1709.07858","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-with","title":"Inverse Reinforcement Learning with Conditional Choice Probabilities","date":"2017-09-22","arxiv_id":"1709.07597","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiqubit-and-multilevel-quantum","title":"Multiqubit and multilevel quantum reinforcement learning with quantum technologies","date":"2017-09-22","arxiv_id":"1709.07848","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-overfitting-and-asymptotic-bias-in-batch","title":"On overfitting and asymptotic bias in batch reinforcement learning with partial observability","date":"2017-09-22","arxiv_id":"1709.07796","repositories_listed":0,"syntology":null},{"url":null,"slug":"optlayer-practical-constrained-optimization","title":"OptLayer - Practical Constrained Optimization for Deep Reinforcement Learning in the Real World","date":"2017-09-22","arxiv_id":"1709.07643","repositories_listed":0,"syntology":null}],"record_sha256":"9a70b4ca23bc1bd48b3cfab816518ecfff5bf4abe0fab31cea5a27ac3cad0e8d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}