{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/123","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":123,"pages_in_order":132,"rows_per_page":100,"rows":[12201,12300],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/122","next":"/task/reinforcement-learning/papers/124","papers":[{"url":null,"slug":"alpha-divergence-bridges-maximum-likelihood","title":"Alpha-divergence bridges maximum likelihood and reinforcement learning in neural sequence generation","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"automata-guided-hierarchical-reinforcement-1","title":"AUTOMATA GUIDED HIERARCHICAL REINFORCEMENT LEARNING FOR ZERO-SHOT SKILL COMPOSITION","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-vehicle-fleet-coordination-with","title":"Autonomous Vehicle Fleet Coordination With Deep Reinforcement Learning","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"avoiding-catastrophic-states-with-intrinsic","title":"Avoiding Catastrophic States with Intrinsic Fear","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"code-synthesis-with-priority-queue-training","title":"Code Synthesis with Priority Queue Training","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"combination-of-supervised-and-reinforcement","title":"Combination of Supervised and Reinforcement Learning For Vision-Based Autonomous Control","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-model-based-and-model-free-rl-via","title":"Combining Model-based and Model-free RL via Multi-step Control Variates","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"discovery-of-predictive-representations-with","title":"Discovery of Predictive Representations With a Network of General Value Functions","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"do-deep-reinforcement-learning-algorithms","title":"Do Deep Reinforcement Learning Algorithms really Learn to Navigate?","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adaptation-for-deep-reinforcement","title":"Domain Adaptation for Deep Reinforcement Learning in Visually Distinct Games","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-deep-recurrent-models-with","title":"Exploring Deep Recurrent Models with Reinforcement Learning for Molecule Design","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-reinforcement-learning-with-expert","title":"Faster Reinforcement Learning with Expert State Sequences","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"gating-out-sensory-noise-in-a-spike-based","title":"Gating out sensory noise in a spike-based Long Short-Term Memory network","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-of-policy-gradient-methods-1","title":"Global Convergence of Policy Gradient Methods for Linearized Control Problems","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-forward-model-for-real-time-strategy","title":"Latent forward model for Real-time Strategy game planning with incomplete information","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"latentpoison-adversarial-attacks-on-the-1","title":"LatentPoison -- Adversarial Attacks On The Latent Space","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-an-embedding-space-for-transferable","title":"Learning an Embedding Space for Transferable Robot Skills","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dynamic-state-abstractions-for-model","title":"Learning Dynamic State Abstractions for Model-Based Reinforcement Learning","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-gaussian-policies-from-smoothed","title":"Learning Gaussian Policies from Smoothed Action Value Functions","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-objects-from-pixels","title":"Learning objects from pixels","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-robust-rewards-with-adverserial","title":"Learning Robust Rewards with Adverserial Inverse Reinforcement Learning","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-treat-sepsis-with-multi-output","title":"Learning to Treat Sepsis with Multi-Output Gaussian Process Deep Recurrent Q-Networks","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"long-term-memory-network-for-combinatorial","title":"Long Term Memory Network for Combinatorial Optimization Problems","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"lsd-net-look-step-and-detect-for-joint","title":"LSD-Net: Look, Step and Detect for Joint Navigation and Multi-View Recognition with Deep Reinforcement Learning","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-imitation-learning-from-state","title":"Model-based imitation learning from state trajectories","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-task-graph-execution","title":"Neural Task Graph Execution","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neuron-as-an-agent","title":"Neuron as an Agent","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"now-i-remember-episodic-memory-for","title":"Now I Remember! Episodic Memory For Reinforcement Learning","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pointing-out-sql-queries-from-text","title":"Pointing Out SQL Queries From Text","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-for-multidimensional-action","title":"Policy Gradient For Multidimensional Action Spaces: Action Sampling and Entropy Bonus","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-multiple-actions-for-stochastic","title":"Predicting Multiple Actions for Stochastic Continuous Control","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-via-replica-stacking","title":"Reinforcement Learning via Replica Stacking of Quantum Measurements for the Training of Quantum Boltzmann Machines","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"representing-entropy-a-short-proof-of-the","title":"Representing Entropy : A short proof of the equivalence between soft Q-learning and policy gradients","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-estimation-via-state-prediction","title":"Reward Estimation via State Prediction","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-exploration-via-hierarchical","title":"Structured Exploration via Hierarchical Variational Policy Networks","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-learning-better-metrics-for-sequence","title":"Toward learning better metrics for sequence generation training with policy gradient","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"trl-discriminative-hints-for-scalable-reverse","title":"TRL: Discriminative Hints for Scalable Reverse Curriculum Learning","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"universal-agent-for-disentangling","title":"Universal Agent for Disentangling Environments and Tasks","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"using-deep-reinforcement-learning-to-generate","title":"Using Deep Reinforcement Learning to Generate Rationales for Molecules","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sbeed-convergent-reinforcement-learning-with","title":"SBEED: Convergent Reinforcement Learning with Nonlinear Function Approximation","date":"2017-12-29","arxiv_id":"1712.10285","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-analogical","title":"Reinforcement Learning with Analogical Similarity to Guide Schema Induction and Attention","date":"2017-12-28","arxiv_id":"1712.10070","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-do-we-need-to-build-explainable-ai","title":"What do we need to build explainable AI systems for the medical domain?","date":"2017-12-28","arxiv_id":"1712.09923","repositories_listed":0,"syntology":null},{"url":null,"slug":"consensus-based-sequence-training-for-video","title":"Consensus-based Sequence Training for Video Captioning","date":"2017-12-27","arxiv_id":"1712.09532","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-short-variational-proof-of-equivalence","title":"A short variational proof of equivalence between policy gradients and soft Q learning","date":"2017-12-22","arxiv_id":"1712.08650","repositories_listed":0,"syntology":null},{"url":null,"slug":"least-squares-temporal-difference-learning","title":"Least-Squares Temporal Difference Learning for the Linear Quadratic Regulator","date":"2017-12-22","arxiv_id":"1712.08642","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-policy-inference-q-network-for-multi","title":"A Deep Policy Inference Q-Network for Multi-Agent Systems","date":"2017-12-21","arxiv_id":"1712.07893","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiagent-based-participatory-urban","title":"Multiagent-based Participatory Urban Simulation through Inverse Reinforcement Learning","date":"2017-12-21","arxiv_id":"1712.07887","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-flexible-approach-to-automated-rnn","title":"A Flexible Approach to Automated RNN Architecture Generation","date":"2017-12-20","arxiv_id":"1712.07316","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-and-interpretable-skill","title":"Hierarchical and Interpretable Skill Acquisition in Multi-task Reinforcement Learning","date":"2017-12-20","arxiv_id":"1712.07294","repositories_listed":0,"syntology":null},{"url":null,"slug":"pseudorehearsal-in-actor-critic-agents-with","title":"Pseudorehearsal in actor-critic agents with neural network function approximation","date":"2017-12-20","arxiv_id":"1712.07686","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-attentional-reinforcement-learning","title":"Recurrent Attentional Reinforcement Learning for Multi-label Image Recognition","date":"2017-12-20","arxiv_id":"1712.07465","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-the-master-slave-architecture-in","title":"Revisiting the Master-Slave Architecture in Multi-Agent Deep Reinforcement Learning","date":"2017-12-20","arxiv_id":"1712.07305","repositories_listed":0,"syntology":null},{"url":null,"slug":"sim2real-view-invariant-visual-servoing-by","title":"Sim2Real View Invariant Visual Servoing by Recurrent Control","date":"2017-12-20","arxiv_id":"1712.07642","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-shot-pedestrian-re-identification-via","title":"Multi-shot Pedestrian Re-identification via Sequential Decision Making","date":"2017-12-19","arxiv_id":"1712.07257","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-wasserstein-reinforcement-learning-and-the","title":"On Wasserstein Reinforcement Learning and the Fokker-Planck equation","date":"2017-12-19","arxiv_id":"1712.07185","repositories_listed":0,"syntology":null},{"url":null,"slug":"scale-invariant-temporal-history-sith-optimal","title":"Scale-invariant temporal history (SITH): optimal slicing of the past in an uncertain world","date":"2017-12-19","arxiv_id":"1712.07165","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-dimensional-anti-jamming-mobile","title":"Two-dimensional Anti-jamming Mobile Communication Based on Reinforcement Learning","date":"2017-12-19","arxiv_id":"1712.06793","repositories_listed":0,"syntology":null},{"url":null,"slug":"es-is-more-than-just-a-traditional-finite","title":"ES Is More Than Just a Traditional Finite-Difference Approximator","date":"2017-12-18","arxiv_id":"1712.06568","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-relationship-between-the-openai","title":"On the Relationship Between the OpenAI Evolution Strategy and Stochastic Gradient Descent","date":"2017-12-18","arxiv_id":"1712.06564","repositories_listed":0,"syntology":null},{"url":null,"slug":"integral-equations-and-machine-learning","title":"Integral Equations and Machine Learning","date":"2017-12-17","arxiv_id":"1712.06115","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-deep-reinforcement-learning","title":"Towards a Deep Reinforcement Learning Approach for Tower Line Wars","date":"2017-12-17","arxiv_id":"1712.06180","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforce-learning-with-nonparametric","title":"Inverse Reinforce Learning with Nonparametric Behavior Clustering","date":"2017-12-15","arxiv_id":"1712.05514","repositories_listed":0,"syntology":null},{"url":null,"slug":"occams-razor-is-insufficient-to-infer-the","title":"Occam's razor is insufficient to infer the preferences of irrational agents","date":"2017-12-15","arxiv_id":"1712.05812","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-navigate-by-growing-deep-networks","title":"Learning to Navigate by Growing Deep Networks","date":"2017-12-14","arxiv_id":"1712.05084","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-for-marketing","title":"Inverse Reinforcement Learning for Marketing","date":"2017-12-13","arxiv_id":"1712.04612","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-focus-attention-network-for-efficient","title":"Multi-focus Attention Network for Efficient Deep Reinforcement Learning","date":"2017-12-13","arxiv_id":"1712.04603","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-boosted-by","title":"Deep Reinforcement Learning Boosted by External Knowledge","date":"2017-12-12","arxiv_id":"1712.04101","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-policies-for-reinforcement","title":"Interpretable Policies for Reinforcement Learning by Genetic Programming","date":"2017-12-12","arxiv_id":"1712.04170","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulated-autonomous-driving-on-realistic","title":"Simulated Autonomous Driving on Realistic Road Networks using Deep Reinforcement Learning","date":"2017-12-12","arxiv_id":"1712.04363","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-robust-dialog-policies-in-noisy","title":"Learning Robust Dialog Policies in Noisy Environments","date":"2017-12-11","arxiv_id":"1712.04034","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-deep-reinforcement-learning-with","title":"Robust Deep Reinforcement Learning with Adversarial Attacks","date":"2017-12-11","arxiv_id":"1712.03632","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-eigenoption-critic-framework","title":"The Eigenoption-Critic Framework","date":"2017-12-11","arxiv_id":"1712.04065","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-dynamics-for-enhanced-sampling-in","title":"Reinforced dynamics for enhanced sampling in large atomic and molecular systems","date":"2017-12-10","arxiv_id":"1712.03461","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-primal-dual-reinforcement-learning","title":"Deep Primal-Dual Reinforcement Learning: Accelerating Actor-Critic using Bellman Duality","date":"2017-12-07","arxiv_id":"1712.02467","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-offline-goal-oriented-dialog","title":"End-to-End Offline Goal-Oriented Dialog Policy Learning via Policy Gradient","date":"2017-12-07","arxiv_id":"1712.02838","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-model-for-arbitration-between","title":"A Novel Model for Arbitration between Planning and Habitual Control Systems","date":"2017-12-06","arxiv_id":"1712.02441","repositories_listed":0,"syntology":null},{"url":null,"slug":"inferring-agent-objectives-at-different","title":"Inferring agent objectives at different scales of a complex adaptive system","date":"2017-12-04","arxiv_id":"1712.01137","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-detect-chest-radiographs","title":"Learning to detect chest radiographs containing lung nodules using visual attention networks","date":"2017-12-04","arxiv_id":"1712.00996","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-reinforcement-learning-for-object","title":"Interactive Reinforcement Learning for Object Grounding via Self-Talking","date":"2017-12-02","arxiv_id":"1712.00576","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-reinforcement-learning-in-stochastic","title":"Online Reinforcement Learning in Stochastic Games","date":"2017-12-02","arxiv_id":"1712.00579","repositories_listed":0,"syntology":null},{"url":null,"slug":"pfax-predictable-feature-analysis-to-perform","title":"PFAx: Predictable Feature Analysis to Perform Control","date":"2017-12-02","arxiv_id":"1712.00634","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-and-reinforcement-learning-for","title":"Representation and Reinforcement Learning for Personalized Glycemic Control in Septic Patients","date":"2017-12-02","arxiv_id":"1712.00654","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-double-competitive-strategy-based-learning","title":"A double competitive strategy based learning automata algorithm","date":"2017-12-01","arxiv_id":"1712.00222","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-batch-size-for-safe-policy-gradients","title":"Adaptive Batch Size for Safe Policy Gradients","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"compatible-reward-inverse-reinforcement","title":"Compatible Reward Inverse Reinforcement Learning","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-reinforcement-learning-in","title":"Data-Efficient Reinforcement Learning in Continuous State-Action Gaussian-POMDPs","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"decoding-with-value-networks-for-neural","title":"Decoding with Value Networks for Neural Machine Translation","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-depth-context-tree-weighting","title":"Dynamic-Depth Context Tree Weighting","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"log-normality-and-skewness-of-estimated","title":"Log-normality and Skewness of Estimated State/Action Values in Reinforcement Learning","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-value-approximators-learning-when-to","title":"Natural Value Approximators: Learning when to Trust Past Estimates","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-posterior-sampling-for","title":"Optimistic posterior sampling for reinforcement learning: worst-case regret bounds","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"q-lda-uncovering-latent-patterns-in-text","title":"Q-LDA: Uncovering Latent Patterns in Text-based Sequential Decision Processes","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-minimization-in-mdps-with-options","title":"Regret Minimization in MDPs with Options without Prior Knowledge","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-the-use-of-deep-reinforcement-1","title":"Towards the Use of Deep Reinforcement Learning with Global Policy for Query-based Extractive Summarisation","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"comparing-deep-reinforcement-learning-and","title":"Comparing Deep Reinforcement Learning and Evolutionary Methods in Continuous Control","date":"2017-11-30","arxiv_id":"1712.00006","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-learning-in-evolution-strategies-via","title":"Improved Learning in Evolution Strategies via Sparser Inter-Agent Network Topologies","date":"2017-11-30","arxiv_id":"1711.11180","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-exploration-for-identifying-linear","title":"Safe Exploration for Identifying Linear Systems via Robust Optimization","date":"2017-11-30","arxiv_id":"1711.11165","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-autonomous-driving-knowledge-on","title":"Transferring Autonomous Driving Knowledge on Simulated and Real Intersections","date":"2017-11-30","arxiv_id":"1712.01106","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-estimates-for-efficient-neural","title":"Uncertainty Estimates for Efficient Neural Network-based Dialogue Policy Optimisation","date":"2017-11-30","arxiv_id":"1711.11486","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-benchmarking-environment-for-reinforcement","title":"A Benchmarking Environment for Reinforcement Learning Based Task Oriented Dialogue Management","date":"2017-11-29","arxiv_id":"1711.11023","repositories_listed":0,"syntology":null}],"record_sha256":"0a975cfa1876c8da697f8b6311bfcc3a7707c7b9b4f9013f48af0a2e0a3c2fba","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}