{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/126","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":126,"pages_in_order":132,"rows_per_page":100,"rows":[12501,12600],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/125","next":"/task/reinforcement-learning/papers/127","papers":[{"url":null,"slug":"the-complex-negotiation-dialogue-game","title":"The Complex Negotiation Dialogue Game","date":"2017-07-05","arxiv_id":"1707.01450","repositories_listed":0,"syntology":null},{"url":null,"slug":"opeb-open-physical-environment-benchmark-for","title":"OPEB: Open Physical Environment Benchmark for Artificial Intelligence","date":"2017-07-04","arxiv_id":"1707.00790","repositories_listed":0,"syntology":null},{"url":null,"slug":"hashing-over-predicted-future-frames-for","title":"Hashing over Predicted Future Frames for Informed Exploration of Deep Reinforcement Learning","date":"2017-07-03","arxiv_id":"1707.00524","repositories_listed":0,"syntology":null},{"url":null,"slug":"grammatical-error-correction-with-neural","title":"Grammatical Error Correction with Neural Reinforcement Learning","date":"2017-07-02","arxiv_id":"1707.00299","repositories_listed":0,"syntology":null},{"url":null,"slug":"budget-aware-deep-semantic-video-segmentation","title":"Budget-Aware Deep Semantic Video Segmentation","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/coarse-to-fine-question-answering-for-long","slug":"coarse-to-fine-question-answering-for-long","title":"Coarse-to-Fine Question Answering for Long Documents","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-learning-of-grounded-verb","title":"Interactive Learning of Grounded Verb Semantics towards Human-Robot Communication","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-actor-critic-reinforcement","title":"Sample-efficient Actor-Critic Reinforcement Learning with Supervised Data for Dialogue Management","date":"2017-07-01","arxiv_id":"1707.00130","repositories_listed":0,"syntology":null},{"url":null,"slug":"actor-critic-sequence-training-for-image","title":"Actor-Critic Sequence Training for Image Captioning","date":"2017-06-29","arxiv_id":"1706.09601","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretability-via-model-extraction","title":"Interpretability via Model Extraction","date":"2017-06-29","arxiv_id":"1706.09773","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-learn-meta-critic-networks-for","title":"Learning to Learn: Meta-Critic Networks for Sample Efficient Learning","date":"2017-06-29","arxiv_id":"1706.09529","repositories_listed":0,"syntology":null},{"url":null,"slug":"path-integral-networks-end-to-end","title":"Path Integral Networks: End-to-End Differentiable Optimal Control","date":"2017-06-29","arxiv_id":"1706.09597","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-decomposition-in-bayesian-neural","title":"Uncertainty Decomposition in Bayesian Neural Networks with Latent Variables","date":"2017-06-26","arxiv_id":"1706.08495","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-related-convolutional-restricted","title":"Temporal-related Convolutional-Restricted-Boltzmann-Machine capable of learning relational order via reinforcement learning procedure?","date":"2017-06-24","arxiv_id":"1706.08001","repositories_listed":0,"syntology":null},{"url":null,"slug":"structure-learning-in-motor-controla-deep","title":"Structure Learning in Motor Control:A Deep Reinforcement Learning Model","date":"2017-06-21","arxiv_id":"1706.06827","repositories_listed":0,"syntology":null},{"url":null,"slug":"observational-learning-by-reinforcement","title":"Observational Learning by Reinforcement Learning","date":"2017-06-20","arxiv_id":"1706.06617","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-methods-for-reinforcement","title":"Policy Gradient Methods for Reinforcement Learning with Function Approximation and Action-Dependent Baselines","date":"2017-06-20","arxiv_id":"1706.06643","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-mechanics-of-node-perturbation","title":"Statistical Mechanics of Node-perturbation Learning with Noisy Baseline","date":"2017-06-20","arxiv_id":"1706.06953","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-real-time-decentralized-reinforcement","title":"Toward Real-Time Decentralized Reinforcement Learning using Finite Support Basis Functions","date":"2017-06-20","arxiv_id":"1706.06695","repositories_listed":0,"syntology":null},{"url":null,"slug":"pedestrian-prediction-by-planning-using-deep","title":"Pedestrian Prediction by Planning using Deep Neural Networks","date":"2017-06-19","arxiv_id":"1706.05904","repositories_listed":0,"syntology":null},{"url":null,"slug":"sub-domain-modelling-for-dialogue-management","title":"Sub-domain Modelling for Dialogue Management with Hierarchical Reinforcement Learning","date":"2017-06-19","arxiv_id":"1706.06210","repositories_listed":0,"syntology":null},{"url":null,"slug":"expected-policy-gradients","title":"Expected Policy Gradients","date":"2017-06-15","arxiv_id":"1706.05374","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-under-model-mismatch","title":"Reinforcement Learning under Model Mismatch","date":"2017-06-15","arxiv_id":"1706.04711","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-budget","title":"Reinforcement Learning with Budget-Constrained Nonparametric Function Approximation for Opportunistic Spectrum Access","date":"2017-06-14","arxiv_id":"1706.04546","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-optimistic-versus-randomized-exploration","title":"On Optimistic versus Randomized Exploration in Reinforcement Learning","date":"2017-06-13","arxiv_id":"1706.04241","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learning-framework-for-automated-driving","title":"Meta learning Framework for Automated Driving","date":"2017-06-11","arxiv_id":"1706.04038","repositories_listed":0,"syntology":null},{"url":null,"slug":"accnet-actor-coordinator-critic-net-for","title":"ACCNet: Actor-Coordinator-Critic Net for \"Learning-to-Communicate\" with Deep Multi-agent Reinforcement Learning","date":"2017-06-10","arxiv_id":"1706.03235","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoupling-learning-rules-from","title":"Decoupling Learning Rules from Representations","date":"2017-06-09","arxiv_id":"1706.03100","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-learn-from-noisy-web-videos","title":"Learning to Learn from Noisy Web Videos","date":"2017-06-09","arxiv_id":"1706.02884","repositories_listed":0,"syntology":null},{"url":null,"slug":"symmetry-learning-for-function-approximation","title":"Symmetry Learning for Function Approximation in Reinforcement Learning","date":"2017-06-09","arxiv_id":"1706.02999","repositories_listed":0,"syntology":null},{"url":null,"slug":"sympathy-begins-with-a-smile-intelligence","title":"Sympathy Begins with a Smile, Intelligence Begins with a Word: Use of Multimodal Features in Spoken Human-Robot Interaction","date":"2017-06-08","arxiv_id":"1706.02757","repositories_listed":0,"syntology":null},{"url":null,"slug":"unlocking-the-potential-of-simulators-design","title":"Unlocking the Potential of Simulators: Design with RL in Mind","date":"2017-06-08","arxiv_id":"1706.02501","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforcement-learning-via-initial","title":"Efficient Reinforcement Learning via Initial Pure Exploration","date":"2017-06-07","arxiv_id":"1706.02237","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-method-for-the-online-construction-of-the","title":"A method for the online construction of the set of states of a Markov Decision Process using Answer Set Programming","date":"2017-06-05","arxiv_id":"1706.01417","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-synthesizing-complex-programs-from","title":"Towards Synthesizing Complex Programs from Input-Output Examples","date":"2017-06-05","arxiv_id":"1706.01284","repositories_listed":0,"syntology":null},{"url":null,"slug":"ucb-exploration-via-q-ensembles","title":"UCB Exploration via Q-Ensembles","date":"2017-06-05","arxiv_id":"1706.01502","repositories_listed":0,"syntology":null},{"url":null,"slug":"actor-critic-for-linearly-solvable-continuous","title":"Actor-Critic for Linearly-Solvable Continuous MDP with Partially Known Dynamics","date":"2017-06-04","arxiv_id":"1706.01077","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-latent-attention-within-neural","title":"Modeling Latent Attention Within Neural Networks","date":"2017-06-02","arxiv_id":"1706.00536","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpolated-policy-gradient-merging-on","title":"Interpolated Policy Gradient: Merging On-Policy and Off-Policy Gradient Estimation for Deep Reinforcement Learning","date":"2017-06-01","arxiv_id":"1706.00387","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergence-of-language-with-multi-agent-games","title":"Emergence of Language with Multi-agent Games: Learning to Communicate with Sequences of Symbols","date":"2017-05-31","arxiv_id":"1705.11192","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-markovian-control-with-gated-end-to-end","title":"Non-Markovian Control with Gated End-to-End Memory Policy Networks","date":"2017-05-31","arxiv_id":"1705.10993","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-learning-rate","title":"Reinforcement Learning for Learning Rate Control","date":"2017-05-31","arxiv_id":"1705.11159","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-dynamic-decision-making-with-deep","title":"Sequential Dynamic Decision Making with Deep Neural Nets on a Test-Time Budget","date":"2017-05-31","arxiv_id":"1705.10924","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-active-object-tracking-via","title":"End-to-end Active Object Tracking via Reinforcement Learning","date":"2017-05-30","arxiv_id":"1705.10561","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-replay-using-transition-sequences","title":"Experience Replay Using Transition Sequences","date":"2017-05-30","arxiv_id":"1705.10834","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-acceleration-control-for","title":"Fine-grained acceleration control for autonomous intersection management using deep reinforcement learning","date":"2017-05-30","arxiv_id":"1705.10432","repositories_listed":0,"syntology":null},{"url":null,"slug":"boltzmann-exploration-done-right","title":"Boltzmann Exploration Done Right","date":"2017-05-29","arxiv_id":"1705.10257","repositories_listed":0,"syntology":null},{"url":null,"slug":"role-playing-learning-for-socially","title":"Role Playing Learning for Socially Concomitant Mobile Robot Navigation","date":"2017-05-29","arxiv_id":"1705.10092","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-temporal-attention-and-split-rate","title":"Reinforced Temporal Attention and Split-Rate Transfer for Depth-Based Person Re-Identification","date":"2017-05-28","arxiv_id":"1705.09882","repositories_listed":0,"syntology":null},{"url":null,"slug":"convergent-tree-backup-and-retrace-with","title":"Convergent Tree Backup and Retrace with Function Approximation","date":"2017-05-25","arxiv_id":"1705.09322","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-domain-perceptual-reward-functions","title":"Cross-Domain Perceptual Reward Functions","date":"2017-05-25","arxiv_id":"1705.09045","repositories_listed":0,"syntology":null},{"url":null,"slug":"first-spike-based-visual-categorization-using","title":"First-spike based visual categorization using reward-modulated STDP","date":"2017-05-25","arxiv_id":"1705.09132","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-space-decomposition-and-subgoal","title":"State Space Decomposition and Subgoal Creation for Transfer in Deep Reinforcement Learning","date":"2017-05-24","arxiv_id":"1705.08997","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-state-space-models-for-optimal","title":"Continuous State-Space Models for Optimal Sepsis Treatment - a Deep Reinforcement Learning Approach","date":"2017-05-23","arxiv_id":"1705.08422","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-experience-replay-generation-for","title":"Enhanced Experience Replay Generation for Efficient Reinforcement Learning","date":"2017-05-23","arxiv_id":"1705.08245","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-semantic-planning-using-deep-successor","title":"Visual Semantic Planning using Deep Successor Representations","date":"2017-05-23","arxiv_id":"1705.08080","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-view-of-entropy-regularized-markov","title":"A unified view of entropy-regularized Markov decision processes","date":"2017-05-22","arxiv_id":"1705.07798","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-enrichment-based-task-independent","title":"Experience enrichment based task independent reward model","date":"2017-05-21","arxiv_id":"1705.07460","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-mix-n-step-returns-generalizing","title":"Learning to Mix n-Step Returns: Generalizing lambda-Returns for Deep Reinforcement Learning","date":"2017-05-21","arxiv_id":"1705.07445","repositories_listed":0,"syntology":null},{"url":null,"slug":"shallow-updates-for-deep-reinforcement","title":"Shallow Updates for Deep Reinforcement Learning","date":"2017-05-21","arxiv_id":"1705.07461","repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-reinforcement-learning-on-the","title":"Batch Reinforcement Learning on the Industrial Benchmark: First Experiences","date":"2017-05-20","arxiv_id":"1705.07262","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-factor-policies-and-action-value","title":"Learning to Factor Policies and Action-Value Functions: Factored Action Space Representations for Deep Reinforcement learning","date":"2017-05-20","arxiv_id":"1705.07269","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparison-of-reinforcement-learning","title":"A Comparison of Reinforcement Learning Techniques for Fuzzy Cloud Auto-Scaling","date":"2017-05-19","arxiv_id":"1705.07114","repositories_listed":0,"syntology":null},{"url":null,"slug":"atari-games-and-intel-processors","title":"Atari games and Intel processors","date":"2017-05-19","arxiv_id":"1705.06936","repositories_listed":0,"syntology":null},{"url":null,"slug":"posterior-sampling-for-reinforcement-learning","title":"Posterior sampling for reinforcement learning: worst-case regret bounds","date":"2017-05-19","arxiv_id":"1705.07041","repositories_listed":0,"syntology":null},{"url":null,"slug":"delving-into-adversarial-attacks-on-deep","title":"Delving into adversarial attacks on deep policies","date":"2017-05-18","arxiv_id":"1705.06452","repositories_listed":0,"syntology":null},{"url":null,"slug":"new-reinforcement-learning-using-a-chaotic","title":"New Reinforcement Learning Using a Chaotic Neural Network for Emergence of \"Thinking\" - \"Exploration\" Grows into \"Thinking\" through Learning -","date":"2017-05-16","arxiv_id":"1705.05551","repositories_listed":0,"syntology":null},{"url":null,"slug":"emotion-in-reinforcement-learning-agents-and","title":"Emotion in Reinforcement Learning Agents and Robots: A Survey","date":"2017-05-15","arxiv_id":"1705.05172","repositories_listed":0,"syntology":null},{"url":null,"slug":"repeated-inverse-reinforcement-learning","title":"Repeated Inverse Reinforcement Learning","date":"2017-05-15","arxiv_id":"1705.05427","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-episodic-value-iteration-for-model-based","title":"Deep Episodic Value Iteration for Model-based Meta-Reinforcement Learning","date":"2017-05-09","arxiv_id":"1705.03562","repositories_listed":0,"syntology":null},{"url":null,"slug":"experimental-results-reinforcement-learning","title":"Experimental results : Reinforcement Learning of POMDPs using Spectral Methods","date":"2017-05-07","arxiv_id":"1705.02553","repositories_listed":0,"syntology":null},{"url":null,"slug":"answer-set-programming-for-non-stationary","title":"Answer Set Programming for Non-Stationary Markov Decision Processes","date":"2017-05-03","arxiv_id":"1705.01399","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-knowledge-transfer-in-deep-q","title":"Analyzing Knowledge Transfer in Deep Q-Networks for Autonomously Handling Multiple Intersections","date":"2017-05-02","arxiv_id":"1705.01197","repositories_listed":0,"syntology":null},{"url":null,"slug":"navigating-occluded-intersections-with","title":"Navigating Occluded Intersections with Autonomous Vehicles using Deep Reinforcement Learning","date":"2017-05-02","arxiv_id":"1705.01196","repositories_listed":0,"syntology":null},{"url":null,"slug":"traffic-light-control-using-deep-policy","title":"Traffic Light Control Using Deep Policy-Gradient and Value-Function Based Reinforcement Learning","date":"2017-04-28","arxiv_id":"1704.08883","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-thermal-comfort","title":"Reinforcement Learning-based Thermal Comfort Control for Vehicle Cabins","date":"2017-04-25","arxiv_id":"1704.07899","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-dynamic","title":"Reinforcement Learning Based Dynamic Selection of Auxiliary Objectives with Preserving of the Best Found Solution","date":"2017-04-24","arxiv_id":"1704.07187","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-constraint-programming-as","title":"Stochastic Constraint Programming as Reinforcement Learning","date":"2017-04-24","arxiv_id":"1704.07183","repositories_listed":0,"syntology":null},{"url":null,"slug":"equivalence-between-policy-gradients-and-soft","title":"Equivalence Between Policy Gradients and Soft Q-Learning","date":"2017-04-21","arxiv_id":"1704.06440","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-weaning","title":"A Reinforcement Learning Approach to Weaning of Mechanical Ventilation in Intensive Care Units","date":"2017-04-20","arxiv_id":"1704.06300","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-external","title":"Reinforcement Learning with External Knowledge and Two-Stage Q-functions for Predicting Popular Reddit Threads","date":"2017-04-20","arxiv_id":"1704.06217","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-recurrence-and-eligibility","title":"Investigating Recurrence and Eligibility Traces in Deep Q-Networks","date":"2017-04-18","arxiv_id":"1704.05495","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-negations-in-information","title":"Understanding Negations in Information Processing: Learning from Replicating Human Behavior","date":"2017-04-18","arxiv_id":"1704.05356","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-warm-start-for-the-online-actor","title":"Effective Warm Start for the Online Actor-Critic Reinforcement Learning based mHealth Intervention","date":"2017-04-17","arxiv_id":"1704.04866","repositories_listed":0,"syntology":null},{"url":null,"slug":"pseudorehearsal-in-actor-critic-agents","title":"Pseudorehearsal in actor-critic agents","date":"2017-04-17","arxiv_id":"1704.04912","repositories_listed":0,"syntology":null},{"url":"/paper/the-reactor-a-fast-and-sample-efficient-actor","slug":"the-reactor-a-fast-and-sample-efficient-actor","title":"The Reactor: A fast and sample-efficient Actor-Critic agent for Reinforcement Learning","date":"2017-04-15","arxiv_id":"1704.04651","repositories_listed":0,"syntology":null},{"url":null,"slug":"environment-independent-task-specifications","title":"Environment-Independent Task Specifications via GLTL","date":"2017-04-14","arxiv_id":"1704.04341","repositories_listed":0,"syntology":null},{"url":null,"slug":"ultrafast-photonic-reinforcement-learning","title":"Ultrafast photonic reinforcement learning based on laser chaos","date":"2017-04-14","arxiv_id":"1704.04379","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dynamic-connectome-supports-the-emergence","title":"A dynamic connectome supports the emergence of stable computational function of neural circuits through reward-based learning","date":"2017-04-13","arxiv_id":"1704.04238","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-image","title":"Deep Reinforcement Learning-based Image Captioning with Embedding Reward","date":"2017-04-12","arxiv_id":"1704.03899","repositories_listed":0,"syntology":null},{"url":null,"slug":"composite-task-completion-dialogue-policy","title":"Composite Task-Completion Dialogue Policy Learning via Hierarchical Deep Reinforcement Learning","date":"2017-04-10","arxiv_id":"1704.03084","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-deep-reinforcement-learning","title":"Data-efficient Deep Reinforcement Learning for Dexterous Manipulation","date":"2017-04-10","arxiv_id":"1704.03073","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-safe-interruptibility-for","title":"Dynamic Safe Interruptibility for Decentralized Multi-Agent Reinforcement Learning","date":"2017-04-10","arxiv_id":"1704.02882","repositories_listed":0,"syntology":null},{"url":null,"slug":"stein-variational-policy-gradient","title":"Stein Variational Policy Gradient","date":"2017-04-07","arxiv_id":"1704.02399","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-analyses-for-td0-with-function","title":"Finite Sample Analyses for TD(0) with Function Approximation","date":"2017-04-04","arxiv_id":"1704.01161","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-advisor-reinforcement-learning","title":"Multi-Advisor Reinforcement Learning","date":"2017-04-03","arxiv_id":"1704.00756","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-properties-of-the-softmax-function","title":"On the Properties of the Softmax Function with Application in Game Theory and Reinforcement Learning","date":"2017-04-03","arxiv_id":"1704.00805","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-persuasion-strategies-and-deep","title":"Evaluating Persuasion Strategies and Deep Reinforcement Learning methods for Negotiation Dialogue agents","date":"2017-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"integrated-learning-of-dialog-strategies-and","title":"Integrated Learning of Dialog Strategies and Semantic Parsing","date":"2017-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"enter-the-matrix-safely-interruptible","title":"Enter the Matrix: Safely Interruptible Autonomous Systems via Virtualization","date":"2017-03-30","arxiv_id":"1703.10284","repositories_listed":0,"syntology":null}],"record_sha256":"75e73c79aefe9ed2ab57c964d1029d55a88b88831a86a0dbc4352442ba7fae39","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}