{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/model-based-reinforcement-learning/papers/6","list_of":"/task/model-based-reinforcement-learning","task":"Model-based Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":6,"pages_in_order":8,"rows_per_page":100,"rows":[501,600],"of":708,"counts":{"archive_papers_tagged":708,"with_a_code_link":234,"where_syntology_ran_a_sample":72,"not_listed_spam_title":0,"listed":708,"listed_where_code_ran":72,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":66,"every_run_a_failure_of_syntologys_instrument":6,"listed_with_a_run_with_no_instrument_failure":66,"listed_every_run_a_failure_of_syntologys_instrument":6,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/model-based-reinforcement-learning","prev":"/task/model-based-reinforcement-learning/papers/5","next":"/task/model-based-reinforcement-learning/papers/7","papers":[{"url":null,"slug":"detecting-and-adapting-to-novelty-in-games","title":"Detecting and Adapting to Novelty in Games","date":"2021-06-04","arxiv_id":"2106.02204","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-model-based-off-policy-reinforcement","title":"Safe Model-based Off-policy Reinforcement Learning for Eco-Driving in Connected and Automated Hybrid Electric Vehicles","date":"2021-05-25","arxiv_id":"2105.11640","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-design-choices-in-offline-model-1","title":"Revisiting Design Choices in Offline Model Based Reinforcement Learning","date":"2021-05-21","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"acting-upon-imagination-when-to-trust","title":"Acting upon Imagination: when to trust imagined trajectories in model based reinforcement learning","date":"2021-05-12","arxiv_id":"2105.05716","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-reinforcement-learning-for-1","title":"Data-Efficient Reinforcement Learning for Malaria Control","date":"2021-05-04","arxiv_id":"2105.01620","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-with-expectation-models-for-control","title":"Planning with Expectation Models for Control","date":"2021-04-17","arxiv_id":"2104.08543","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-exploration-in-model-based-reinforcement","title":"Safe Exploration in Model-based Reinforcement Learning using Control Barrier Functions","date":"2021-04-16","arxiv_id":"2104.08171","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-reweight-imaginary-transitions","title":"Learning to Reweight Imaginary Transitions for Model-Based Reinforcement Learning","date":"2021-04-09","arxiv_id":"2104.04174","repositories_listed":0,"syntology":null},{"url":null,"slug":"gem-group-enhanced-model-for-learning","title":"GEM: Group Enhanced Model for Learning Dynamical Control Systems","date":"2021-04-07","arxiv_id":"2104.02844","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-a-disentangled","title":"Reinforcement Learning with a Disentangled Universal Value Function for Item Recommendation","date":"2021-04-07","arxiv_id":"2104.02981","repositories_listed":0,"syntology":null},{"url":null,"slug":"particle-mpc-for-uncertain-and-learning-based","title":"Particle MPC for Uncertain and Learning-Based Control","date":"2021-04-06","arxiv_id":"2104.02213","repositories_listed":0,"syntology":null},{"url":null,"slug":"dealio-data-efficient-adversarial-learning","title":"DEALIO: Data-Efficient Adversarial Learning for Imitation from Observation","date":"2021-03-31","arxiv_id":"2104.00163","repositories_listed":0,"syntology":null},{"url":null,"slug":"discriminator-augmented-model-based","title":"Discriminator Augmented Model-Based Reinforcement Learning","date":"2021-03-24","arxiv_id":"2103.12999","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-pessimism-with-optimism-for-robust","title":"Combining Pessimism with Optimism for Robust and Efficient Model-Based Deep Reinforcement Learning","date":"2021-03-18","arxiv_id":"2103.10369","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-user-interfaces-with-model-based","title":"Adapting User Interfaces with Model-based Reinforcement Learning","date":"2021-03-11","arxiv_id":"2103.06807","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-state-representations-via-temporal","title":"Learning State Representations via Temporal Cycle-Consistency Constraint in Model-Based Reinforcement Learning","date":"2021-03-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-task-informed-abstractions","title":"Learning Task Informed Abstractions","date":"2021-03-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"less-suboptimal-learning-and-control-in","title":"Less Suboptimal Learning and Control in Variational POMDPs","date":"2021-03-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"solipsistic-reinforcement-learning","title":"Solipsistic Reinforcement Learning","date":"2021-03-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-model-learning","title":"Minimax Model Learning","date":"2021-03-02","arxiv_id":"2103.02084","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-off-and-on-policy-training-in-model","title":"Combining Off and On-Policy Training in Model-Based Reinforcement Learning","date":"2021-02-24","arxiv_id":"2102.12194","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentinel-taming-uncertainty-with-ensemble","title":"SENTINEL: Taming Uncertainty with Ensemble-based Distributional Reinforcement Learning","date":"2021-02-22","arxiv_id":"2102.11075","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-invariant-state-abstractions-for-model","title":"Model-Invariant State Abstractions for Model-Based Reinforcement Learning","date":"2021-02-19","arxiv_id":"2102.09850","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-policy-search-using-monte-carlo","title":"Model-Based Policy Search Using Monte Carlo Gradient Estimation with Real Systems Application","date":"2021-01-28","arxiv_id":"2101.12115","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-policy-search-for-partially","title":"Model-based Policy Search for Partially Measurable Systems","date":"2021-01-21","arxiv_id":"2101.08740","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-3","title":"Model-Based Reinforcement Learning for Approximate Optimal Control with Temporal Logic Specifications","date":"2021-01-18","arxiv_id":"2101.07156","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-under-model-risk-for","title":"Biomanufacturing Harvest Optimization with Small Data","date":"2021-01-11","arxiv_id":"2101.03735","repositories_listed":0,"syntology":null},{"url":null,"slug":"extracting-strong-policies-for-robotics-tasks","title":"Extracting Strong Policies for Robotics Tasks from zero-order trajectory optimizers","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"non-markovian-predictive-coding-for-planning","title":"Non-Markovian Predictive Coding For Planning In Latent Space","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-trade-offs-of-image-prediction-in-visual","title":"On Trade-offs of Image Prediction in Visual Model-Based Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-balancing-offline-model-based","title":"Representation Balancing Offline Model-based Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-meta-level-model-based-reinforcement","title":"Offline Meta-level Model-based Reinforcement Learning Approach for Cold-Start Recommendation","date":"2020-12-04","arxiv_id":"2012.02476","repositories_listed":0,"syntology":null},{"url":null,"slug":"nested-mixture-of-experts-cooperative-and","title":"Nested Mixture of Experts: Cooperative and Competitive Learning of Hybrid Dynamical System","date":"2020-11-20","arxiv_id":"2011.10605","repositories_listed":0,"syntology":null},{"url":null,"slug":"analog-circuit-design-with-dyna-style","title":"Analog Circuit Design with Dyna-Style Reinforcement Learning","date":"2020-11-16","arxiv_id":"2011.07665","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-qn-a-reinforcement-learning-framework-for","title":"RL-QN: A Reinforcement Learning Framework for Optimal Control of Queueing Systems","date":"2020-11-14","arxiv_id":"2011.07401","repositories_listed":0,"syntology":null},{"url":null,"slug":"critic-pi2-master-continuous-planning-via","title":"Critic PI2: Master Continuous Planning via Policy Improvement with Path Integrals and Deep Actor-Critic Reinforcement Learning","date":"2020-11-13","arxiv_id":"2011.06752","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-from","title":"Model-based Reinforcement Learning from Signal Temporal Logic Specifications","date":"2020-11-10","arxiv_id":"2011.04950","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-eco","title":"Model-Based Reinforcement Learning for Eco-Driving Control of Electric Vehicles","date":"2020-11-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-role-of-planning-in-model-based-deep-1","title":"On the role of planning in model-based deep reinforcement learning","date":"2020-11-08","arxiv_id":"2011.04021","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-value-equivalence-principle-for-model","title":"The Value Equivalence Principle for Model-Based Reinforcement Learning","date":"2020-11-06","arxiv_id":"2011.03506","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentiable-physics-models-for-real-world","title":"Differentiable Physics Models for Real-world Offline Model-based Reinforcement Learning","date":"2020-11-03","arxiv_id":"2011.01734","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-efficient-active","title":"Reinforcement Learning with Efficient Active Feature Acquisition","date":"2020-11-02","arxiv_id":"2011.00825","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-using","title":"Sample-efficient reinforcement learning using deep Gaussian processes","date":"2020-11-02","arxiv_id":"2011.01226","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-completion-dialogue-policy-learning-via","title":"Task-Completion Dialogue Policy Learning via Monte Carlo Tree Search with Dueling Network","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-the-exploration-of-deep","title":"Improving the Exploration of Deep Reinforcement Learning in Continuous Domains using Planning for Policy Search","date":"2020-10-24","arxiv_id":"2010.12974","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-with-exploration-addressing-dynamics","title":"Planning with Exploration: Addressing Dynamics Bottleneck in Model-based Reinforcement Learning","date":"2020-10-24","arxiv_id":"2010.12914","repositories_listed":0,"syntology":null},{"url":null,"slug":"error-bounds-of-imitating-policies-and","title":"Error Bounds of Imitating Policies and Environments","date":"2020-10-22","arxiv_id":"2010.11876","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-verification-of-model-based-1","title":"Safety Verification of Model Based Reinforcement Learning Controllers","date":"2020-10-21","arxiv_id":"2010.10740","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-contact-safe-model-based","title":"Uncertainty-aware Contact-safe Model-based Reinforcement Learning","date":"2020-10-16","arxiv_id":"2010.08169","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-type","title":"Model-Based Reinforcement Learning for Type 1Diabetes Blood Glucose Control","date":"2020-10-13","arxiv_id":"2010.06266","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-on-computational","title":"Reinforcement Learning on Computational Resource Allocation of Cloud-based Wireless Networks","date":"2020-10-10","arxiv_id":"2010.05024","repositories_listed":0,"syntology":null},{"url":null,"slug":"trust-the-model-when-it-is-confident-masked","title":"Trust the Model When It Is Confident: Masked Model-based Actor-Critic","date":"2020-10-10","arxiv_id":"2010.04893","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-state-action-embedding-for-efficient-1","title":"Jointly-Learned State-Action Embedding for Efficient Reinforcement Learning","date":"2020-10-09","arxiv_id":"2010.04444","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-sharp-analysis-of-model-based-reinforcement-1","title":"A Sharp Analysis of Model-based Reinforcement Learning with Self-Play","date":"2020-10-04","arxiv_id":"2010.01604","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-design-space-adaptation-with-deep","title":"Trust-Region Method with Deep Reinforcement Learning in Analog Design Space Exploration","date":"2020-09-29","arxiv_id":"2009.13772","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-for-model-based","title":"Efficient Exploration for Model-based Reinforcement Learning with Continuous States and Actions","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"jointly-trained-state-action-embedding-for","title":"Jointly-Trained State-Action Embedding for Efficient Reinforcement Learning","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-horizon-value-estimation-for-model","title":"Dynamic Horizon Value Estimation for Model-based Reinforcement Learning","date":"2020-09-21","arxiv_id":"2009.09593","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-contraction-approach-to-model-based","title":"A Contraction Approach to Model-based Reinforcement Learning","date":"2020-09-18","arxiv_id":"2009.08586","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-relationship-between-dynamic-programming","title":"Reward Maximisation through Discrete Active Inference","date":"2020-09-17","arxiv_id":"2009.08111","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-reinforcement-learning-for","title":"Multi-Objective Model-based Reinforcement Learning for Infectious Disease Control","date":"2020-09-09","arxiv_id":"2009.04607","repositories_listed":0,"syntology":null},{"url":null,"slug":"document-editing-assistants-and-model-based","title":"Document-editing Assistants and Model-based Reinforcement Learning as a Path to Conversational AI","date":"2020-08-27","arxiv_id":"2008.12095","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-point-estimate-inferring-ensemble","title":"Beyond Point Estimate: Inferring Ensemble Prediction Variation from Neuron Activation Strength in Recommender Systems","date":"2020-08-17","arxiv_id":"2008.07032","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-deep-reinforcement-learning-for-1","title":"Deep Model-Based Reinforcement Learning for High-Dimensional Problems, a Survey","date":"2020-08-11","arxiv_id":"2008.05598","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-transition-models-with-time-delayed","title":"Learning Transition Models with Time-delayed Causal Relations","date":"2020-08-04","arxiv_id":"2008.01593","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreaming-model-based-reinforcement-learning","title":"Dreaming: Model-based Reinforcement Learning by Latent Imagination without Reconstruction","date":"2020-07-29","arxiv_id":"2007.14535","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-safety-aware-model-based-reinforcement","title":"Safe Model-Based Reinforcement Learning for Systems with Parametric Uncertainties","date":"2020-07-24","arxiv_id":"2007.12666","repositories_listed":0,"syntology":null},{"url":null,"slug":"explore-more-and-improve-regret-in-linear","title":"Reinforcement Learning with Fast Stabilization in Linear Dynamical Systems","date":"2020-07-23","arxiv_id":"2007.12291","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-multi-agent-rl-in-zero-sum-markov","title":"Model-Based Multi-Agent RL in Zero-Sum Markov Games with Near-Optimal Sample Complexity","date":"2020-07-15","arxiv_id":"2007.07461","repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-dyna-style-planning-under-limited","title":"Selective Dyna-style Planning Under Limited Model Capacity","date":"2020-07-05","arxiv_id":"2007.02418","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-a-survey","title":"Model-based Reinforcement Learning: A Survey","date":"2020-06-30","arxiv_id":"2006.16712","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-aware-representations-for-model-based","title":"Control-Aware Representations for Model-based Reinforcement Learning","date":"2020-06-24","arxiv_id":"2006.13408","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-optimism-in-model-based-reinforcement","title":"Towards Tractable Optimism in Model-Based Reinforcement Learning","date":"2020-06-21","arxiv_id":"2006.11911","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-learning-for-nonlinear-system","title":"Active Learning for Nonlinear System Identification with Guarantees","date":"2020-06-18","arxiv_id":"2006.10277","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-embedding-model-based-reinforcement","title":"Model Embedding Model-Based Reinforcement Learning","date":"2020-06-16","arxiv_id":"2006.09234","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-model-based-policy-optimization","title":"Variational Model-based Policy Optimization","date":"2020-06-09","arxiv_id":"2006.05443","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-plan-via-deep-optimistic-value","title":"Learning to Plan via Deep Optimistic Value Exploration","date":"2020-06-08","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-entropy-model-rollouts-fast-model","title":"Maximum Entropy Model Rollouts: Fast Model Based Policy Optimization without Compounding Errors","date":"2020-06-08","arxiv_id":"2006.04802","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-growth-and-form-of-knowledge-networks-by","title":"The growth and form of knowledge networks by kinesthetic curiosity","date":"2020-06-04","arxiv_id":"2006.02949","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-with-value","title":"Model-Based Reinforcement Learning with Value-Targeted Regression","date":"2020-06-01","arxiv_id":"2006.01107","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-the-sample-size-barrier-in-model","title":"Breaking the Sample Size Barrier in Model-Based Reinforcement Learning with a Generative Model","date":"2020-05-26","arxiv_id":"2005.12900","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-augmented-actor-critic-backpropagating-1","title":"Model-Augmented Actor-Critic: Backpropagating through Paths","date":"2020-05-16","arxiv_id":"2005.08068","repositories_listed":0,"syntology":null},{"url":null,"slug":"mutual-information-maximization-for-robust-1","title":"Mutual Information Maximization for Robust Plannable Representations","date":"2020-05-16","arxiv_id":"2005.08114","repositories_listed":0,"syntology":null},{"url":null,"slug":"fostering-event-compression-using-gated","title":"Fostering Event Compression using Gated Surprise","date":"2020-05-12","arxiv_id":"2005.05704","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for","title":"Model-based reinforcement learning for biological sequence design","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-atari-1","title":"Model Based Reinforcement Learning for Atari","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-model-based-actor-critic-for","title":"Sample-Efficient Model-based Actor-Critic for an Interactive Dialogue Task","date":"2020-04-28","arxiv_id":"2004.13657","repositories_listed":0,"syntology":null},{"url":null,"slug":"flexible-and-efficient-long-range-planning-1","title":"Flexible and Efficient Long-Range Planning Through Curious Exploration","date":"2020-04-22","arxiv_id":"2004.10876","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-survival-in-model-based","title":"Modeling Survival in model-based Reinforcement Learning","date":"2020-04-18","arxiv_id":"2004.08648","repositories_listed":0,"syntology":null},{"url":"/paper/a-game-theoretic-framework-for-model-based","slug":"a-game-theoretic-framework-for-model-based","title":"A Game Theoretic Framework for Model Based Reinforcement Learning","date":"2020-04-16","arxiv_id":"2004.07804","repositories_listed":0,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/a-game-theoretic-framework-for-model-based#ran","syntology_url":"https://syntology.ai/paper/2004.07804","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2004.07804"}},"official":null}},{"url":null,"slug":"online-constrained-model-based-reinforcement","title":"Online Constrained Model-based Reinforcement Learning","date":"2020-04-07","arxiv_id":"2004.03499","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperation-without-coordination-hierarchical","title":"Model-based Reinforcement Learning for Decentralized Multiagent Rendezvous","date":"2020-03-15","arxiv_id":"2003.06906","repositories_listed":0,"syntology":null},{"url":null,"slug":"planet-of-the-bayesians-reconsidering-and","title":"PlaNet of the Bayesians: Reconsidering and Improving Deep Planning Network by Incorporating Bayesian Inference","date":"2020-03-01","arxiv_id":"2003.00370","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-2","title":"Model-Based Reinforcement Learning for Physical Systems Without Velocity and Acceleration Measurements","date":"2020-02-25","arxiv_id":"2002.10621","repositories_listed":0,"syntology":null},{"url":null,"slug":"frequency-based-search-control-in-dyna-1","title":"Frequency-based Search-control in Dyna","date":"2020-02-14","arxiv_id":"2002.05822","repositories_listed":0,"syntology":null},{"url":null,"slug":"ready-policy-one-world-building-through","title":"Ready Policy One: World Building Through Active Learning","date":"2020-02-07","arxiv_id":"2002.02693","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-tubes-for-tube-mpc","title":"Deep Learning Tubes for Tube MPC","date":"2020-02-05","arxiv_id":"2002.01587","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-policy-optimization-for-trajectory","title":"Local Policy Optimization for Trajectory-Centric Reinforcement Learning","date":"2020-01-22","arxiv_id":"2001.08092","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-multi-agent-reinforcement","title":"Model-based Multi-Agent Reinforcement Learning with Cooperative Prioritized Sweeping","date":"2020-01-15","arxiv_id":"2001.07527","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-game-theoretic-perspective-on-model-based","title":"A Game Theoretic Perspective on Model-Based Reinforcement Learning","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"ee5ea65f710ccbeea976fe75a9033e4d0dcd227abf6d0e6ff4c6a5bb93f48cad","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}