{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/145","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":145,"pages_in_order":152,"rows_per_page":100,"rows":[14401,14500],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/144","next":"/task/reinforcement-learning-1/papers/146","papers":[{"url":null,"slug":"pseudorehearsal-in-actor-critic-agents-with","title":"Pseudorehearsal in actor-critic agents with neural network function approximation","date":"2017-12-20","arxiv_id":"1712.07686","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-attentional-reinforcement-learning","title":"Recurrent Attentional Reinforcement Learning for Multi-label Image Recognition","date":"2017-12-20","arxiv_id":"1712.07465","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-the-master-slave-architecture-in","title":"Revisiting the Master-Slave Architecture in Multi-Agent Deep Reinforcement Learning","date":"2017-12-20","arxiv_id":"1712.07305","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-wasserstein-reinforcement-learning-and-the","title":"On Wasserstein Reinforcement Learning and the Fokker-Planck equation","date":"2017-12-19","arxiv_id":"1712.07185","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-dimensional-anti-jamming-mobile","title":"Two-dimensional Anti-jamming Mobile Communication Based on Reinforcement Learning","date":"2017-12-19","arxiv_id":"1712.06793","repositories_listed":0,"syntology":null},{"url":null,"slug":"es-is-more-than-just-a-traditional-finite","title":"ES Is More Than Just a Traditional Finite-Difference Approximator","date":"2017-12-18","arxiv_id":"1712.06568","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-relationship-between-the-openai","title":"On the Relationship Between the OpenAI Evolution Strategy and Stochastic Gradient Descent","date":"2017-12-18","arxiv_id":"1712.06564","repositories_listed":0,"syntology":null},{"url":null,"slug":"integral-equations-and-machine-learning","title":"Integral Equations and Machine Learning","date":"2017-12-17","arxiv_id":"1712.06115","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-deep-reinforcement-learning","title":"Towards a Deep Reinforcement Learning Approach for Tower Line Wars","date":"2017-12-17","arxiv_id":"1712.06180","repositories_listed":0,"syntology":null},{"url":null,"slug":"occams-razor-is-insufficient-to-infer-the","title":"Occam's razor is insufficient to infer the preferences of irrational agents","date":"2017-12-15","arxiv_id":"1712.05812","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-for-marketing","title":"Inverse Reinforcement Learning for Marketing","date":"2017-12-13","arxiv_id":"1712.04612","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-focus-attention-network-for-efficient","title":"Multi-focus Attention Network for Efficient Deep Reinforcement Learning","date":"2017-12-13","arxiv_id":"1712.04603","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-boosted-by","title":"Deep Reinforcement Learning Boosted by External Knowledge","date":"2017-12-12","arxiv_id":"1712.04101","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-policies-for-reinforcement","title":"Interpretable Policies for Reinforcement Learning by Genetic Programming","date":"2017-12-12","arxiv_id":"1712.04170","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulated-autonomous-driving-on-realistic","title":"Simulated Autonomous Driving on Realistic Road Networks using Deep Reinforcement Learning","date":"2017-12-12","arxiv_id":"1712.04363","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-deep-reinforcement-learning-with","title":"Robust Deep Reinforcement Learning with Adversarial Attacks","date":"2017-12-11","arxiv_id":"1712.03632","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-eigenoption-critic-framework","title":"The Eigenoption-Critic Framework","date":"2017-12-11","arxiv_id":"1712.04065","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-dynamics-for-enhanced-sampling-in","title":"Reinforced dynamics for enhanced sampling in large atomic and molecular systems","date":"2017-12-10","arxiv_id":"1712.03461","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-primal-dual-reinforcement-learning","title":"Deep Primal-Dual Reinforcement Learning: Accelerating Actor-Critic using Bellman Duality","date":"2017-12-07","arxiv_id":"1712.02467","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-offline-goal-oriented-dialog","title":"End-to-End Offline Goal-Oriented Dialog Policy Learning via Policy Gradient","date":"2017-12-07","arxiv_id":"1712.02838","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-reinforcement-learning-for-object","title":"Interactive Reinforcement Learning for Object Grounding via Self-Talking","date":"2017-12-02","arxiv_id":"1712.00576","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-reinforcement-learning-in-stochastic","title":"Online Reinforcement Learning in Stochastic Games","date":"2017-12-02","arxiv_id":"1712.00579","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-and-reinforcement-learning-for","title":"Representation and Reinforcement Learning for Personalized Glycemic Control in Septic Patients","date":"2017-12-02","arxiv_id":"1712.00654","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-batch-size-for-safe-policy-gradients","title":"Adaptive Batch Size for Safe Policy Gradients","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"compatible-reward-inverse-reinforcement","title":"Compatible Reward Inverse Reinforcement Learning","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-reinforcement-learning-in","title":"Data-Efficient Reinforcement Learning in Continuous State-Action Gaussian-POMDPs","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-depth-context-tree-weighting","title":"Dynamic-Depth Context Tree Weighting","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"log-normality-and-skewness-of-estimated","title":"Log-normality and Skewness of Estimated State/Action Values in Reinforcement Learning","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-value-approximators-learning-when-to","title":"Natural Value Approximators: Learning when to Trust Past Estimates","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-posterior-sampling-for","title":"Optimistic posterior sampling for reinforcement learning: worst-case regret bounds","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"q-lda-uncovering-latent-patterns-in-text","title":"Q-LDA: Uncovering Latent Patterns in Text-based Sequential Decision Processes","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"comparing-deep-reinforcement-learning-and","title":"Comparing Deep Reinforcement Learning and Evolutionary Methods in Continuous Control","date":"2017-11-30","arxiv_id":"1712.00006","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-learning-in-evolution-strategies-via","title":"Improved Learning in Evolution Strategies via Sparser Inter-Agent Network Topologies","date":"2017-11-30","arxiv_id":"1711.11180","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-exploration-for-identifying-linear","title":"Safe Exploration for Identifying Linear Systems via Robust Optimization","date":"2017-11-30","arxiv_id":"1711.11165","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-autonomous-driving-knowledge-on","title":"Transferring Autonomous Driving Knowledge on Simulated and Real Intersections","date":"2017-11-30","arxiv_id":"1712.01106","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-benchmarking-environment-for-reinforcement","title":"A Benchmarking Environment for Reinforcement Learning Based Task Oriented Dialogue Management","date":"2017-11-29","arxiv_id":"1711.11023","repositories_listed":0,"syntology":null},{"url":null,"slug":"automating-vehicles-by-deep-reinforcement","title":"Automating Vehicles by Deep Reinforcement Learning using Task Separation with Hill Climbing","date":"2017-11-29","arxiv_id":"1711.10785","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-complex-collective-behaviour-be-generated","title":"Can Complex Collective Behaviour Be Generated Through Randomness, Memory and a Pinch of Luck?","date":"2017-11-29","arxiv_id":"1711.11161","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-optimization-of-task-oriented","title":"End-to-End Optimization of Task-Oriented Dialogue Model with Deep Reinforcement Learning","date":"2017-11-29","arxiv_id":"1711.10712","repositories_listed":0,"syntology":null},{"url":"/paper/home-a-household-multimodal-environment","slug":"home-a-household-multimodal-environment","title":"HoME: a Household Multimodal Environment","date":"2017-11-29","arxiv_id":"1711.11017","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-to-adapt-speech","title":"Reinforcement Learning To Adapt Speech Enhancement to Instantaneous Input Signal Quality","date":"2017-11-29","arxiv_id":"1711.10791","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-captioning-via-hierarchical","title":"Video Captioning via Hierarchical Reinforcement Learning","date":"2017-11-29","arxiv_id":"1711.11135","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-algorithm-for","title":"A reinforcement learning algorithm for building collaboration in multi-agent systems","date":"2017-11-28","arxiv_id":"1711.10574","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-policy-search-via-return","title":"Hierarchical Policy Search via Return-Weighted Density Estimation","date":"2017-11-28","arxiv_id":"1711.10173","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-longitudinal-face-demonstration","title":"Learning from Longitudinal Face Demonstration - Where Tractable Deep Modeling Meets Inverse Reinforcement Learning","date":"2017-11-28","arxiv_id":"1711.10520","repositories_listed":0,"syntology":null},{"url":null,"slug":"malaria-likelihood-prediction-by-effectively","title":"Malaria Likelihood Prediction By Effectively Surveying Households Using Deep Reinforcement Learning","date":"2017-11-25","arxiv_id":"1711.09223","repositories_listed":0,"syntology":null},{"url":null,"slug":"cascade-attribute-learning-network","title":"Cascade Attribute Learning Network","date":"2017-11-24","arxiv_id":"1711.09142","repositories_listed":0,"syntology":null},{"url":null,"slug":"asking-the-difficult-questions-goal-oriented","title":"Asking the Difficult Questions: Goal-Oriented Visual Question Generation via Intermediate Rewards","date":"2017-11-21","arxiv_id":"1711.07614","repositories_listed":0,"syntology":null},{"url":null,"slug":"posterior-sampling-for-large-scale","title":"Posterior Sampling for Large Scale Reinforcement Learning","date":"2017-11-21","arxiv_id":"1711.07979","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-agent-behaviors-from-videos-via","title":"Transferring Agent Behaviors from Videos via Motion GANs","date":"2017-11-21","arxiv_id":"1711.07676","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-multi","title":"Deep Reinforcement Learning for Multi-Resource Multi-Machine Job Scheduling","date":"2017-11-20","arxiv_id":"1711.07440","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-network-based-reinforcement-learning","title":"Neural Network Based Reinforcement Learning for Audio-Visual Gaze Control in Human-Robot Interaction","date":"2017-11-18","arxiv_id":"1711.06834","repositories_listed":0,"syntology":null},{"url":null,"slug":"bbq-networks-efficient-exploration-in-deep","title":"BBQ-Networks: Efficient Exploration in Deep Reinforcement Learning for Task-Oriented Dialogue Systems","date":"2017-11-15","arxiv_id":"1711.05715","repositories_listed":0,"syntology":null},{"url":null,"slug":"costate-focused-models-for-reinforcement","title":"Costate-focused models for reinforcement learning","date":"2017-11-15","arxiv_id":"1711.05817","repositories_listed":0,"syntology":null},{"url":null,"slug":"finding-efficient-swimming-strategies-in-a","title":"Finding Efficient Swimming Strategies in a Three Dimensional Chaotic Flow by Reinforcement Learning","date":"2017-11-15","arxiv_id":"1711.05826","repositories_listed":0,"syntology":null},{"url":null,"slug":"markov-decision-processes-with-continuous","title":"Markov Decision Processes with Continuous Side Information","date":"2017-11-15","arxiv_id":"1711.05726","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-adaptive-newton-method-for","title":"Variational Adaptive-Newton Method for Explorative Learning","date":"2017-11-15","arxiv_id":"1711.05560","repositories_listed":0,"syntology":null},{"url":null,"slug":"loss-functions-for-multiset-prediction","title":"Loss Functions for Multiset Prediction","date":"2017-11-14","arxiv_id":"1711.05246","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-a-large-scale","title":"Reinforcement Learning in a large scale photonic Recurrent Neural Network","date":"2017-11-14","arxiv_id":"1711.05133","repositories_listed":0,"syntology":null},{"url":null,"slug":"saliency-based-sequential-image-attention","title":"Saliency-based Sequential Image Attention with Multiset Prediction","date":"2017-11-14","arxiv_id":"1711.05165","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-method-for-stochastic-composition","title":"Accelerated Method for Stochastic Composition Optimization with Nonsmooth Regularization","date":"2017-11-10","arxiv_id":"1711.03937","repositories_listed":0,"syntology":null},{"url":null,"slug":"applications-of-deep-learning-and","title":"Applications of Deep Learning and Reinforcement Learning to Biological Data","date":"2017-11-10","arxiv_id":"1711.03985","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-speech-recognition","title":"Reinforcement Learning of Speech Recognition System Based on Policy Gradient and Hypothesis Selection","date":"2017-11-10","arxiv_id":"1711.03689","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-analysis-of-multiple-turn","title":"An Empirical Analysis of Multiple-Turn Reasoning Strategies in Reading Comprehension Tasks","date":"2017-11-09","arxiv_id":"1711.03230","repositories_listed":0,"syntology":null},{"url":null,"slug":"worm-level-control-through-search-based","title":"Worm-level Control through Search-based Reinforcement Learning","date":"2017-11-09","arxiv_id":"1711.03467","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-storage-arbitrage-in-real-time-markets","title":"Energy Storage Arbitrage in Real-Time Markets via Reinforcement Learning","date":"2017-11-08","arxiv_id":"1711.03127","repositories_listed":0,"syntology":null},{"url":null,"slug":"double-q-and-q-unifying-reinforcement","title":"Double Q($σ$) and Q($σ, λ$): Unifying Reinforcement Learning Control Algorithms","date":"2017-11-05","arxiv_id":"1711.01569","repositories_listed":0,"syntology":null},{"url":null,"slug":"composing-meta-policies-for-autonomous","title":"Composing Meta-Policies for Autonomous Driving Using Hierarchical Deep Reinforcement Learning","date":"2017-11-04","arxiv_id":"1711.01503","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-by-genetic-distillation","title":"Policy Optimization by Genetic Distillation","date":"2017-11-03","arxiv_id":"1711.01012","repositories_listed":0,"syntology":null},{"url":null,"slug":"acquiring-target-stacking-skills-by-goal","title":"Acquiring Target Stacking Skills by Goal-Parameterized Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":"1711.00267","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-text-summarization-using","title":"Automatic Text Summarization Using Reinforcement Learning with Embedding Features","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-parameter-tuning-in-optimization","title":"Intelligent Parameter Tuning in Optimization-based Iterative CT Reconstruction via Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":"1711.00414","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-diagnose-assimilating-clinical","title":"Learning to Diagnose: Assimilating Clinical Narratives using Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"paraphrase-generation-with-deep-reinforcement","title":"Paraphrase Generation with Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":"1711.00279","repositories_listed":0,"syntology":null},{"url":null,"slug":"automata-guided-hierarchical-reinforcement","title":"Automata-Guided Hierarchical Reinforcement Learning for Skill Composition","date":"2017-10-31","arxiv_id":"1711.00129","repositories_listed":0,"syntology":null},{"url":null,"slug":"artificial-intelligence-as-structural","title":"Artificial Intelligence as Structural Estimation: Economic Interpretations of Deep Blue, Bonanza, and AlphaGo","date":"2017-10-30","arxiv_id":"1710.10967","repositories_listed":0,"syntology":null},{"url":null,"slug":"exponential-improvements-for-quantum","title":"Exponential improvements for quantum-accessible reinforcement learning","date":"2017-10-30","arxiv_id":"1710.11160","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequence-to-sequence-asr-optimization-via","title":"Sequence-to-Sequence ASR Optimization via Reinforcement Learning","date":"2017-10-30","arxiv_id":"1710.10774","repositories_listed":0,"syntology":null},{"url":null,"slug":"unifying-value-iteration-advantage-learning","title":"Unifying Value Iteration, Advantage Learning, and Dynamic Policy Programming","date":"2017-10-30","arxiv_id":"1710.10866","repositories_listed":0,"syntology":null},{"url":null,"slug":"diff-dac-distributed-actor-critic-for-average","title":"Diff-DAC: Distributed Actor-Critic for Average Multitask Deep Reinforcement Learning","date":"2017-10-28","arxiv_id":"1710.10363","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-under-noisy","title":"Inverse Reinforcement Learning Under Noisy Observations","date":"2017-10-27","arxiv_id":"1710.10116","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-reinforcement-learning","title":"Accelerated Reinforcement Learning","date":"2017-10-23","arxiv_id":"1710.08070","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-generalization-in-the-subspaces","title":"Exploiting generalization in the subspaces for faster model-based learning","date":"2017-10-22","arxiv_id":"1710.08012","repositories_listed":0,"syntology":null},{"url":null,"slug":"insulin-regimen-ml-based-control-for-t2dm","title":"Insulin Regimen ML-based control for T2DM patients","date":"2017-10-21","arxiv_id":"1710.07855","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-monotone-games","title":"Online Monotone Games","date":"2017-10-19","arxiv_id":"1710.07328","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymmetric-actor-critic-for-image-based-robot","title":"Asymmetric Actor Critic for Image-Based Robot Learning","date":"2017-10-18","arxiv_id":"1710.06542","repositories_listed":0,"syntology":null},{"url":null,"slug":"map-based-multi-policy-reinforcement-learning","title":"Map-based Multi-Policy Reinforcement Learning: Enhancing Adaptability of Robots by Deep Reinforcement Learning","date":"2017-10-17","arxiv_id":"1710.06117","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-variance-reduction-for-policy","title":"Stochastic Variance Reduction for Policy Gradient Estimation","date":"2017-10-17","arxiv_id":"1710.06034","repositories_listed":0,"syntology":null},{"url":null,"slug":"manifold-regularization-for-kernelized-lstd","title":"Manifold Regularization for Kernelized LSTD","date":"2017-10-15","arxiv_id":"1710.05387","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-epicurus-the-father-of-reinforcement","title":"Is Epicurus the father of Reinforcement Learning?","date":"2017-10-12","arxiv_id":"1710.04582","repositories_listed":0,"syntology":null},{"url":null,"slug":"prm-rl-long-range-robotic-navigation-tasks-by","title":"PRM-RL: Long-range Robotic Navigation Tasks by Combining Reinforcement Learning and Sampling-based Planning","date":"2017-10-11","arxiv_id":"1710.03937","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-framework","title":"Deep Reinforcement Learning: Framework, Applications, and Embedded Implementations","date":"2017-10-10","arxiv_id":"1710.03792","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-and-off-policy-monotonic-policy","title":"On- and Off-Policy Monotonic Policy Improvement","date":"2017-10-10","arxiv_id":"1710.03442","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-inverse-reinforcement-learning-via","title":"Meta Inverse Reinforcement Learning via Maximum Reward Sharing for Human Motion Analysis","date":"2017-10-07","arxiv_id":"1710.03592","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-in-feature-space-for","title":"Exploration in Feature Space for Reinforcement Learning","date":"2017-10-05","arxiv_id":"1710.02210","repositories_listed":0,"syntology":null},{"url":null,"slug":"event-identification-as-a-decision-process","title":"Event Identification as a Decision Process with Non-linear Representation of Text","date":"2017-10-03","arxiv_id":"1710.00969","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-aware-deep-reinforcement-learning","title":"Attention-Aware Deep Reinforcement Learning for Video Face Recognition","date":"2017-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-sharing-deep-deterministic-policy","title":"Parameter Sharing Deep Deterministic Policy Gradient for Cooperative Multi-agent Reinforcement Learning","date":"2017-10-01","arxiv_id":"1710.00336","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-how-to-learn-an-adaptive-dialogue","title":"Learning how to learn: an adaptive dialogue agent for incrementally learning visually grounded word meanings","date":"2017-09-29","arxiv_id":"1709.10423","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-policy-search-method-for-temporal-logic","title":"A Policy Search Method For Temporal Logic Specified Reinforcement Learning Tasks","date":"2017-09-27","arxiv_id":"1709.09611","repositories_listed":0,"syntology":null}],"record_sha256":"39c7a10bb1e1caff319f427563953f1462e5da05b2ef4e5c32b9755a5843b31b","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}