{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/model-based-reinforcement-learning/papers/7","list_of":"/task/model-based-reinforcement-learning","task":"Model-based Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":7,"pages_in_order":8,"rows_per_page":100,"rows":[601,700],"of":708,"counts":{"archive_papers_tagged":708,"with_a_code_link":234,"where_syntology_ran_a_sample":72,"not_listed_spam_title":0,"listed":708,"listed_where_code_ran":72,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":66,"every_run_a_failure_of_syntologys_instrument":6,"listed_with_a_run_with_no_instrument_failure":66,"listed_every_run_a_failure_of_syntologys_instrument":6,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/model-based-reinforcement-learning","prev":"/task/model-based-reinforcement-learning/papers/6","next":"/task/model-based-reinforcement-learning/papers/8","papers":[{"url":null,"slug":"learning-to-combat-compounding-error-in-model-1","title":"Learning to Combat Compounding-Error in Model-Based Reinforcement Learning","date":"2019-12-24","arxiv_id":"1912.11206","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-linear-regression-on-deep","title":"Bayesian Linear Regression on Deep Representations","date":"2019-12-14","arxiv_id":"1912.06760","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-latent-state-spaces-for-planning-1","title":"Learning Latent State Spaces for Planning through Reward Prediction","date":"2019-12-09","arxiv_id":"1912.04201","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferable-force-torque-dynamics-model-for","title":"Transferable Force-Torque Dynamics Model for Peg-in-hole Task","date":"2019-11-30","arxiv_id":"1912.00260","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-random-search-for-quadcopter","title":"Augmented Random Search for Quadcopter Control: An alternative to Reinforcement Learning","date":"2019-11-28","arxiv_id":"1911.12553","repositories_listed":0,"syntology":null},{"url":null,"slug":"robo-planet-learning-to-poke-in-a-day","title":"Robo-PlaNet: Learning to Poke in a Day","date":"2019-11-09","arxiv_id":"1911.03594","repositories_listed":0,"syntology":null},{"url":null,"slug":"mbcal-a-simple-and-efficient-reinforcement","title":"MBCAL: Sample Efficient and Variance Reduced Reinforcement Learning for Recommender Systems","date":"2019-11-06","arxiv_id":"1911.02248","repositories_listed":0,"syntology":null},{"url":null,"slug":"tustin-neural-networks-a-class-of-recurrent","title":"Tustin neural networks: a class of recurrent nets for adaptive MPC of mechanical systems","date":"2019-11-04","arxiv_id":"1911.01310","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularizing-model-based-planning-with-energy","title":"Regularizing Model-Based Planning with Energy-Based Models","date":"2019-10-12","arxiv_id":"1910.05527","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-hvac-scheduling-using-reinforcement","title":"Building HVAC Scheduling Using Reinforcement Learning via Neural Network Based Model Approximation","date":"2019-10-11","arxiv_id":"1910.05313","repositories_listed":0,"syntology":null},{"url":null,"slug":"imagined-value-gradients-model-based-policy","title":"Imagined Value Gradients: Model-Based Policy Optimization with Transferable Latent Dynamics Models","date":"2019-10-09","arxiv_id":"1910.04142","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-exploiting","title":"Model-Based Reinforcement Learning Exploiting State-Action Equivalence","date":"2019-10-09","arxiv_id":"1910.04077","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-1","title":"Model-based Reinforcement Learning for Predictions and Control for Limit Order Books","date":"2019-10-09","arxiv_id":"1910.03743","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-step-greedy-policies-in-model-free-deep-1","title":"Multi-step Greedy Reinforcement Learning Algorithms","date":"2019-10-07","arxiv_id":"1910.02919","repositories_listed":0,"syntology":null},{"url":null,"slug":"counterfactual-regularization-for-model-based","title":"Counterfactual Regularization for Model-Based Reinforcement Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-exploration-of-deep-reinforcement","title":"Improving Exploration of Deep Reinforcement Learning using Planning for Policy Search","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-by-shaking-computing-policy","title":"Learning by shaking: Computing policy gradients by physical forward-propagation","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"model-imitation-for-model-based-reinforcement","title":"Model Imitation for Model-Based Reinforcement Learning","date":"2019-09-25","arxiv_id":"1909.11821","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-step-greedy-policies-in-model-free-deep","title":"Multi-step Greedy Policies in Model-Free Deep Reinforcement Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-in-the-face-of","title":"Policy Optimization In the Face of Uncertainty","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-tree-network","title":"Policy Tree Network","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-averse-value-expansion-for-sample","title":"Risk Averse Value Expansion for Sample Efficient and Robust Policy Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"s2vg-soft-stochastic-value-gradient-method","title":"S2VG: Soft Stochastic Value Gradient method","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"revisit-policy-optimization-in-matrix-form","title":"Revisit Policy Optimization in Matrix Form","date":"2019-09-19","arxiv_id":"1909.09186","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-prediction-network-model-free-behavior","title":"Policy Prediction Network: Model-Free Behavior Policy with Model-Based Learning in Continuous Action Space","date":"2019-09-15","arxiv_id":"1909.07373","repositories_listed":0,"syntology":null},{"url":null,"slug":"gradient-aware-model-based-policy-search","title":"Gradient-Aware Model-based Policy Search","date":"2019-09-09","arxiv_id":"1909.04115","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-lookahead-reinforcement-learning","title":"Model-based Lookahead Reinforcement Learning","date":"2019-08-15","arxiv_id":"1908.06012","repositories_listed":0,"syntology":null},{"url":null,"slug":"chance-constrained-trajectory-optimization-1","title":"Chance-Constrained Trajectory Optimization for Non-linear Systems with Unknown Stochastic Dynamics","date":"2019-07-31","arxiv_id":"1906.11003","repositories_listed":0,"syntology":null},{"url":null,"slug":"delegative-reinforcement-learning-learning-to","title":"Delegative Reinforcement Learning: learning to avoid traps with a little help","date":"2019-07-19","arxiv_id":"1907.08461","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-intrinsically-motivated-approach-for","title":"An Intrinsically-Motivated Approach for Learning Highly Exploring and Fast Mixing Policies","date":"2019-07-10","arxiv_id":"1907.04662","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-dynamics-models-for-data","title":"Interpretable Dynamics Models for Data-Efficient Reinforcement Learning","date":"2019-07-10","arxiv_id":"1907.04902","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-inference-mpc-for-bayesian-model","title":"Variational Inference MPC for Bayesian Model-based Reinforcement Learning","date":"2019-07-08","arxiv_id":"1907.04202","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-model-based-policy","title":"Uncertainty-aware Model-based Policy Optimization","date":"2019-06-25","arxiv_id":"1906.10717","repositories_listed":0,"syntology":null},{"url":null,"slug":"hill-climbing-on-value-estimates-for-search","title":"Hill Climbing on Value Estimates for Search-control in Dyna","date":"2019-06-18","arxiv_id":"1906.07791","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-model-based-reinforcement-learning","title":"Iterative Model-Based Reinforcement Learning Using Simulations in the Differentiable Neural Computer","date":"2019-06-17","arxiv_id":"1906.07248","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-optimality-of-sparse-model-based","title":"Model-Based Reinforcement Learning with a Generative Model is Minimax Optimal","date":"2019-06-10","arxiv_id":"1906.03804","repositories_listed":0,"syntology":null},{"url":null,"slug":"combating-the-compounding-error-problem-with","title":"Combating the Compounding-Error Problem with a Multi-step Model","date":"2019-05-30","arxiv_id":"1905.13320","repositories_listed":0,"syntology":null},{"url":null,"slug":"switching-linear-dynamics-for-variational","title":"Switching Linear Dynamics for Variational Bayes Filtering","date":"2019-05-29","arxiv_id":"1905.12434","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-optimistic-reinforcement","title":"Near-optimal Optimistic Reinforcement Learning using Empirical Bernstein Inequalities","date":"2019-05-27","arxiv_id":"1905.12425","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-machine-learning-by-pipeline","title":"Automatic Machine Learning by Pipeline Synthesis using Model-Based Reinforcement Learning and a Grammar","date":"2019-05-24","arxiv_id":"1905.10345","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-knowledge-based-agent-learning-to-do","title":"Deep Knowledge Based Agent: Learning to do tasks by self-thinking about imaginary worlds","date":"2019-05-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-the-long-term-future-in-model-based","title":"Modeling the Long Term Future in Model-Based Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"non-stationary-markov-decision-processes-a","title":"Non-Stationary Markov Decision Processes, a Worst-Case Approach using Model-Based Reinforcement Learning, Extended version","date":"2019-04-22","arxiv_id":"1904.10090","repositories_listed":0,"syntology":null},{"url":null,"slug":"curious-ilqr-resolving-uncertainty-in-model","title":"Curious iLQR: Resolving Uncertainty in Model-based RL","date":"2019-04-15","arxiv_id":"1904.06786","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-adapting-goals-allow-transfer-of","title":"Self-Adapting Goals Allow Transfer of Predictive Models to New Tasks","date":"2019-04-04","arxiv_id":"1904.02435","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-with-expectation-models","title":"Planning with Expectation Models","date":"2019-04-02","arxiv_id":"1904.01191","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularizing-trajectory-optimization-with","title":"Regularizing Trajectory Optimization with Denoising Autoencoders","date":"2019-03-28","arxiv_id":"1903.11981","repositories_listed":0,"syntology":null},{"url":null,"slug":"rloc-neurobiologically-inspired-hierarchical","title":"RLOC: Neurobiologically Inspired Hierarchical Reinforcement Learning Algorithm for Continuous Control of Nonlinear Dynamical Systems","date":"2019-03-07","arxiv_id":"1903.03064","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dynamics-model-in-reinforcement","title":"Learning Dynamics Model in Reinforcement Learning by Incorporating the Long Term Future","date":"2019-03-05","arxiv_id":"1903.01599","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-object-based-perception-and","title":"Joint Perception and Control as Inference with an Object-based Implementation","date":"2019-03-04","arxiv_id":"1903.01385","repositories_listed":0,"syntology":null},{"url":null,"slug":"belief-dynamics-extraction","title":"Belief dynamics extraction","date":"2019-02-02","arxiv_id":"1902.00673","repositories_listed":0,"syntology":null},{"url":null,"slug":"successor-features-support-model-based-and","title":"Successor Features Combine Elements of Model-Free and Model-based Reinforcement Learning","date":"2019-01-31","arxiv_id":"1901.11437","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-multi","title":"Multi-Agent Reinforcement Learning with Multi-Step Generative Models","date":"2019-01-29","arxiv_id":"1901.10251","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-level-control-of-a-quadrotor-with-deep","title":"Low Level Control of a Quadrotor with Deep Model-Based Reinforcement Learning","date":"2019-01-11","arxiv_id":"1901.03737","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-goal-directed-reinforcement","title":"Accelerating Goal-Directed Reinforcement Learning by Model Characterization","date":"2019-01-04","arxiv_id":"1901.01977","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-decision-making-in-mixed-agent","title":"Optimal Decision-Making in Mixed-Agent Partially Observable Stochastic Environments via Reinforcement Learning","date":"2019-01-04","arxiv_id":"1901.01325","repositories_listed":0,"syntology":null},{"url":null,"slug":"vmav-c-a-deep-attention-based-reinforcement","title":"VMAV-C: A Deep Attention-based Reinforcement Learning Algorithm for Model-based Control","date":"2018-12-24","arxiv_id":"1812.09968","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-online-learning-via-meta-learning","title":"Deep Online Learning via Meta-Learning: Continual Adaptation for Model-Based RL","date":"2018-12-18","arxiv_id":"1812.07671","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-planner-overfitting-in-model-based","title":"Mitigating Planner Overfitting in Model-Based Reinforcement Learning","date":"2018-12-03","arxiv_id":"1812.01129","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-value-aware-model-learning","title":"Iterative Value-Aware Model Learning","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-state-representations-in-complex","title":"Learning State Representations in Complex Systems with Multimodal Data","date":"2018-11-27","arxiv_id":"1811.11067","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-model-based-reinforcement-learning-approach","title":"A Model-Based Reinforcement Learning Approach for a Rare Disease Diagnostic Task","date":"2018-11-25","arxiv_id":"1811.10112","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-sepsis","title":"Model-Based Reinforcement Learning for Sepsis Treatment","date":"2018-11-23","arxiv_id":"1811.09602","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-rl-in-contextual-decision","title":"Model-based RL in Contextual Decision Processes: PAC bounds and Exponential Improvements over Model-free Approaches","date":"2018-11-21","arxiv_id":"1811.08540","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-with-model-based","title":"Policy Optimization with Model-based Explorations","date":"2018-11-18","arxiv_id":"1811.07350","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-simple-approach-to-multi-step-model","title":"Towards a Simple Approach to Multi-step Model-based Reinforcement Learning","date":"2018-10-31","arxiv_id":"1811.00128","repositories_listed":0,"syntology":null},{"url":null,"slug":"incremental-learning-abstract-discrete","title":"Incremental learning abstract discrete planning domains and mappings to continuous perceptions","date":"2018-10-16","arxiv_id":"1810.07096","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-powerful-policies-and-better","title":"Learning powerful policies and better dynamics models by encouraging consistency","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-asymptotic-performance-of","title":"Understanding the Asymptotic Performance of Model-Based RL Methods","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-exploration-with-deep-model","title":"Unsupervised Exploration with Deep Model-Based Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-stabilizable-dynamical-systems-via","title":"Learning Stabilizable Dynamical Systems via Control Contraction Metrics","date":"2018-07-31","arxiv_id":"1808.00113","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-bottleneck-simulator-a-model-based-deep","title":"The Bottleneck Simulator: A Model-based Deep Reinforcement Learning Approach","date":"2018-07-12","arxiv_id":"1807.04723","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hierarchical-bayesian-linear-regression","title":"A Hierarchical Bayesian Linear Regression Model with Local Features for Stochastic Dynamics Approximation","date":"2018-07-11","arxiv_id":"1807.03931","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-effect-of-planning-shape-on-dyna-style","title":"The Effect of Planning Shape on Dyna-style Planning in High-dimensional State Spaces","date":"2018-06-05","arxiv_id":"1806.01825","repositories_listed":0,"syntology":null},{"url":null,"slug":"equivalence-between-wasserstein-and-value","title":"Equivalence Between Wasserstein and Value-Aware Loss for Model-based Reinforcement Learning","date":"2018-06-01","arxiv_id":"1806.01265","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-exploration-with-simplified-models-and","title":"Fast Exploration with Simplified Models and Approximately Optimistic Planning in Model Based Reinforcement Learning","date":"2018-06-01","arxiv_id":"1806.00175","repositories_listed":0,"syntology":null},{"url":null,"slug":"feedback-based-tree-search-for-reinforcement","title":"Feedback-Based Tree Search for Reinforcement Learning","date":"2018-05-15","arxiv_id":"1805.05935","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-temporal-models-with-spatial","title":"Generative Temporal Models with Spatial Memory for Partially Observed Environments","date":"2018-04-25","arxiv_id":"1804.09401","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-dynamics-models-for-adaptive","title":"Personalized Dynamics Models for Adaptive Assistive Navigation Systems","date":"2018-04-11","arxiv_id":"1804.04118","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-non-prehensile","title":"Reinforcement learning for non-prehensile manipulation: Transfer from simulation to physical system","date":"2018-03-28","arxiv_id":"1803.10371","repositories_listed":0,"syntology":null},{"url":null,"slug":"dop-deep-optimistic-planning-with-approximate","title":"DOP: Deep Optimistic Planning with Approximate Value Function Evaluation","date":"2018-03-22","arxiv_id":"1803.08501","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-with-latent","title":"Meta Reinforcement Learning with Latent Variable Gaussian Processes","date":"2018-03-20","arxiv_id":"1803.07551","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-cp-learning-action-values-for-cooperative","title":"Q-CP: Learning Action Values for Cooperative Planning","date":"2018-03-01","arxiv_id":"1803.00297","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-and-querying-fast-generative-models","title":"Learning and Querying Fast Generative Models for Reinforcement Learning","date":"2018-02-08","arxiv_id":"1802.03006","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dynamic-state-abstractions-for-model","title":"Learning Dynamic State Abstractions for Model-Based Reinforcement Learning","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"automating-vehicles-by-deep-reinforcement","title":"Automating Vehicles by Deep Reinforcement Learning using Task Separation with Hill Climbing","date":"2017-11-29","arxiv_id":"1711.10785","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-model-identification-via-physics-engines","title":"Fast Model Identification via Physics Engines for Data-Efficient Policy Search","date":"2017-10-24","arxiv_id":"1710.08893","repositories_listed":0,"syntology":null},{"url":null,"slug":"insulin-regimen-ml-based-control-for-t2dm","title":"Insulin Regimen ML-based control for T2DM patients","date":"2017-10-21","arxiv_id":"1710.07855","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-detour-problem-in-a-stochastic","title":"The detour problem in a stochastic environment: Tolman revisited","date":"2017-09-27","arxiv_id":"1709.09761","repositories_listed":0,"syntology":null},{"url":null,"slug":"structure-learning-in-motor-controla-deep","title":"Structure Learning in Motor Control:A Deep Reinforcement Learning Model","date":"2017-06-21","arxiv_id":"1706.06827","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-episodic-value-iteration-for-model-based","title":"Deep Episodic Value Iteration for Model-based Meta-Reinforcement Learning","date":"2017-05-09","arxiv_id":"1705.03562","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-reinforcement-learning-for-demand","title":"Using Reinforcement Learning for Demand Response of Domestic Hot Water Buffers: a Real-Life Demonstration","date":"2017-03-16","arxiv_id":"1703.05486","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-learning-approach-for-joint-video","title":"A Deep Learning Approach for Joint Video Frame and Reward Prediction in Atari Games","date":"2016-11-21","arxiv_id":"1611.07078","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-learning-with-deep-model-based","title":"Multi-task learning with deep model based reinforcement learning","date":"2016-11-04","arxiv_id":"1611.01457","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-error-bounds-for-model-based","title":"Policy Error Bounds for Model-Based Reinforcement Learning with Factored Linear Models","date":"2016-02-19","arxiv_id":"1602.06346","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-learning-of-feedback-policies","title":"Data-Efficient Learning of Feedback Policies from Image Pixels using Deep Dynamical Models","date":"2015-10-08","arxiv_id":"1510.02173","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-with","title":"Model-based Reinforcement Learning with Parametrized Physical Models and Optimism-Driven Exploration","date":"2015-09-23","arxiv_id":"1509.06824","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-shot-learning-of-manipulation-skills-with","title":"One-Shot Learning of Manipulation Skills with Online Dynamics Adaptation and Neural Network Priors","date":"2015-09-23","arxiv_id":"1509.06841","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-model-based-reinforcement-learning","title":"Efficient model-based reinforcement learning for approximate online optimal","date":"2015-02-09","arxiv_id":"1502.02609","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-pixels-to-torques-policy-learning-with","title":"From Pixels to Torques: Policy Learning with Deep Dynamical Models","date":"2015-02-08","arxiv_id":"1502.02251","repositories_listed":0,"syntology":null}],"record_sha256":"e50f9e950922f14efbff09afd5d2cb4728b2aa6f0436e8a276ada587d0e37d3e","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}