{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/offline-rl/papers/7","list_of":"/task/offline-rl","task":"Offline RL","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":7,"pages_in_order":8,"rows_per_page":100,"rows":[601,700],"of":755,"counts":{"archive_papers_tagged":755,"with_a_code_link":310,"where_syntology_ran_a_sample":164,"not_listed_spam_title":0,"listed":755,"listed_where_code_ran":164,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":139,"every_run_a_failure_of_syntologys_instrument":25,"listed_with_a_run_with_no_instrument_failure":139,"listed_every_run_a_failure_of_syntologys_instrument":25,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/offline-rl","prev":"/task/offline-rl/papers/6","next":"/task/offline-rl/papers/8","papers":[{"url":null,"slug":"offline-reinforcement-learning-with-closed","title":"Offline Reinforcement Learning with Closed-Form Policy Improvement Operators","date":"2022-11-29","arxiv_id":"2211.15956","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-conditional-generative-modeling-all-you","title":"Is Conditional Generative Modeling all you need for Decision-Making?","date":"2022-11-28","arxiv_id":"2211.15657","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-q-learning-on-diverse-multi-task-data","title":"Offline Q-Learning on Diverse Multi-Task Data Both Scales And Generalizes","date":"2022-11-28","arxiv_id":"2211.15144","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-aware-proximal-pessimistic-algorithms","title":"State-Aware Proximal Pessimistic Algorithms for Offline Reinforcement Learning","date":"2022-11-28","arxiv_id":"2211.15065","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-generalization-for-robust-model-based","title":"Domain Generalization for Robust Model-Based Offline Reinforcement Learning","date":"2022-11-27","arxiv_id":"2211.14827","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-instance-dependent-bounds-for-offline","title":"On Instance-Dependent Bounds for Offline Reinforcement Learning with Linear Function Approximation","date":"2022-11-23","arxiv_id":"2211.13208","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-transformer-for-offline-meta","title":"Contextual Transformer for Offline Meta Reinforcement Learning","date":"2022-11-15","arxiv_id":"2211.08016","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-adaptive","title":"Offline Reinforcement Learning with Adaptive Behavior Regularization","date":"2022-11-15","arxiv_id":"2211.08251","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-offline-data-in-online","title":"Leveraging Offline Data in Online Reinforcement Learning","date":"2022-11-09","arxiv_id":"2211.04974","repositories_listed":0,"syntology":null},{"url":null,"slug":"armor-a-model-based-framework-for-improving","title":"ARMOR: A Model-based Framework for Improving Arbitrary Baseline Policies with Offline Data","date":"2022-11-08","arxiv_id":"2211.04538","repositories_listed":0,"syntology":null},{"url":null,"slug":"wall-street-tree-search-risk-aware-planning","title":"Wall Street Tree Search: Risk-Aware Planning for Offline Reinforcement Learning","date":"2022-11-06","arxiv_id":"2211.04583","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-value-learning-implicit-models","title":"Contrastive Value Learning: Implicit Models for Simple Offline RL","date":"2022-11-03","arxiv_id":"2211.02100","repositories_listed":0,"syntology":null},{"url":null,"slug":"oracle-inequalities-for-model-selection-in","title":"Oracle Inequalities for Model Selection in Offline Reinforcement Learning","date":"2022-11-03","arxiv_id":"2211.02016","repositories_listed":0,"syntology":null},{"url":"/paper/dual-generator-offline-reinforcement-learning","slug":"dual-generator-offline-reinforcement-learning","title":"Dual Generator Offline Reinforcement Learning","date":"2022-11-02","arxiv_id":"2211.01471","repositories_listed":0,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/dual-generator-offline-reinforcement-learning#ran","syntology_url":"https://syntology.ai/paper/2211.01471","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2211.01471"}},"official":null}},{"url":null,"slug":"offline-rl-with-realistic-datasets","title":"Offline RL With Realistic Datasets: Heteroskedasticity and Support Constraints","date":"2022-11-02","arxiv_id":"2211.01052","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-conservative-offline-rl-with-general","title":"Optimal Conservative Offline RL with General Function Approximation via Augmented Lagrangian","date":"2022-11-01","arxiv_id":"2211.00716","repositories_listed":0,"syntology":null},{"url":null,"slug":"implicit-offline-reinforcement-learning-via","title":"Implicit Offline Reinforcement Learning via Supervised Learning","date":"2022-10-21","arxiv_id":"2210.12272","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-offline-reinforcement-learning-via","title":"Boosting Offline Reinforcement Learning via Data Rebalancing","date":"2022-10-17","arxiv_id":"2210.09241","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-pipeline-for-offline","title":"Data-Efficient Pipeline for Offline Reinforcement Learning with Limited Data","date":"2022-10-16","arxiv_id":"2210.08642","repositories_listed":0,"syntology":null},{"url":"/paper/state-advantage-weighting-for-offline-rl","slug":"state-advantage-weighting-for-offline-rl","title":"State Advantage Weighting for Offline RL","date":"2022-10-09","arxiv_id":"2210.04251","repositories_listed":0,"syntology":{"n":5,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":5,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"0 ran · 5 unverified","sample_list":"/paper/state-advantage-weighting-for-offline-rl#ran","syntology_url":"https://syntology.ai/paper/2210.04251","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2210.04251"}},"official":null}},{"url":null,"slug":"the-role-of-coverage-in-online-reinforcement","title":"The Role of Coverage in Online Reinforcement Learning","date":"2022-10-09","arxiv_id":"2210.04157","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-5","title":"Offline Reinforcement Learning with Differentiable Function Approximation is Provably Efficient","date":"2022-10-03","arxiv_id":"2210.00750","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-4","title":"Offline Reinforcement Learning with Instrumental Variables in Confounded Markov Decision Processes","date":"2022-09-18","arxiv_id":"2209.08666","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-offline-reinforcement-learning-help","title":"Can Offline Reinforcement Learning Help Natural Language Understanding?","date":"2022-09-15","arxiv_id":"2212.03864","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributionally-robust-offline-reinforcement","title":"Distributionally Robust Offline Reinforcement Learning with Linear Function Approximation","date":"2022-09-14","arxiv_id":"2209.06620","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-memory-related-multi-task-method-based-on","title":"Task-Agnostic Learning to Accomplish New Tasks","date":"2022-09-09","arxiv_id":"2209.04100","repositories_listed":0,"syntology":null},{"url":null,"slug":"dialogue-evaluation-with-offline","title":"Dialogue Evaluation with Offline Reinforcement Learning","date":"2022-09-02","arxiv_id":"2209.00876","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategic-decision-making-in-the-presence-of","title":"Strategic Decision-Making in the Presence of Information Asymmetry: Provably Efficient RL with Algorithmic Instruments","date":"2022-08-23","arxiv_id":"2208.11040","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributionally-robust-model-based-offline","title":"Distributionally Robust Model-Based Offline Reinforcement Learning with Near-Optimal Sample Complexity","date":"2022-08-11","arxiv_id":"2208.05767","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-at-multiple","title":"Offline Reinforcement Learning at Multiple Frequencies","date":"2022-07-26","arxiv_id":"2207.13082","repositories_listed":0,"syntology":null},{"url":null,"slug":"bcrlsp-an-offline-reinforcement-learning","title":"BCRLSP: An Offline Reinforcement Learning Framework for Sequential Targeted Promotion","date":"2022-07-16","arxiv_id":"2207.07790","repositories_listed":0,"syntology":null},{"url":null,"slug":"griddlyjs-a-web-ide-for-reinforcement","title":"GriddlyJS: A Web IDE for Reinforcement Learning","date":"2022-07-13","arxiv_id":"2207.06105","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-of-implicit-regularization","title":"An Empirical Study of Implicit Regularization in Deep Offline RL","date":"2022-07-05","arxiv_id":"2207.02099","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-rl-policies-should-be-trained-to-be","title":"Offline RL Policies Should be Trained to be Adaptive","date":"2022-07-05","arxiv_id":"2207.02200","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompting-decision-transformer-for-few-shot","title":"Prompting Decision Transformer for Few-Shot Policy Generalization","date":"2022-06-27","arxiv_id":"2206.13499","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-model-based-reinforcement","title":"A Survey on Model-based Reinforcement Learning","date":"2022-06-19","arxiv_id":"2206.09328","repositories_listed":0,"syntology":null},{"url":"/paper/bootstrapped-transformer-for-offline","slug":"bootstrapped-transformer-for-offline","title":"Bootstrapped Transformer for Offline Reinforcement Learning","date":"2022-06-17","arxiv_id":"2206.08569","repositories_listed":0,"syntology":{"n":4,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/bootstrapped-transformer-for-offline#ran","syntology_url":"https://syntology.ai/paper/2206.08569","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2206.08569"}},"official":null}},{"url":null,"slug":"contrastive-learning-as-goal-conditioned","title":"Contrastive Learning as Goal-Conditioned Reinforcement Learning","date":"2022-06-15","arxiv_id":"2206.07568","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-benefit-of-multitask-representation","title":"Provable Benefit of Multitask Representation Learning in Reinforcement Learning","date":"2022-06-13","arxiv_id":"2206.05900","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-offline-reinforcement","title":"Provably Efficient Offline Reinforcement Learning with Trajectory-Wise Reward","date":"2022-06-13","arxiv_id":"2206.06426","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-offline-reinforcement-learning","title":"Federated Offline Reinforcement Learning","date":"2022-06-11","arxiv_id":"2206.05581","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-retrieval-for-reinforcement","title":"Large-Scale Retrieval for Reinforcement Learning","date":"2022-06-10","arxiv_id":"2206.05314","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-role-of-discount-factor-in-offline","title":"On the Role of Discount Factor in Offline Reinforcement Learning","date":"2022-06-07","arxiv_id":"2206.03383","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-causal","title":"Offline Reinforcement Learning with Causal Structured World Models","date":"2022-06-03","arxiv_id":"2206.01474","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-3","title":"Offline Reinforcement Learning with Differential Privacy","date":"2022-06-02","arxiv_id":"2206.00810","repositories_listed":0,"syntology":null},{"url":null,"slug":"know-your-boundaries-the-necessity-of","title":"Know Your Boundaries: The Necessity of Explicit Behavioral Cloning in Offline RL","date":"2022-06-01","arxiv_id":"2206.00695","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-generation-with-provable-coverability","title":"Model Generation with Provable Coverability for Offline Reinforcement Learning","date":"2022-06-01","arxiv_id":"2206.00316","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearly-minimax-optimal-offline-reinforcement","title":"Nearly Minimax Optimal Offline Reinforcement Learning with Linear Function Approximation: Single-Agent MDP and Markov Game","date":"2022-05-31","arxiv_id":"2205.15512","repositories_listed":0,"syntology":null},{"url":null,"slug":"you-can-t-count-on-luck-why-decision","title":"You Can't Count on Luck: Why Decision Transformers and RvS Fail in Stochastic Environments","date":"2022-05-31","arxiv_id":"2205.15967","repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimism-in-the-face-of-confounders-provably","title":"Pessimism in the Face of Confounders: Provably Efficient Offline Reinforcement Learning in Partially Observable Markov Decision Processes","date":"2022-05-26","arxiv_id":"2205.13589","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-spend-your-robot-time-bridging","title":"How to Spend Your Robot Time: Bridging Kickstarting and Offline Reinforcement Learning for Vision-based Robotic Manipulation","date":"2022-05-06","arxiv_id":"2205.03353","repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimism-meets-vcg-learning-dynamic","title":"Pessimism meets VCG: Learning Dynamic Mechanism Design via Offline Reinforcement Learning","date":"2022-05-05","arxiv_id":"2205.02450","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-flexible-inference-in-sequential","title":"Towards Flexible Inference in Sequential Decision Problems via Bidirectional Transformers","date":"2022-04-28","arxiv_id":"2204.13326","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-value-functions-from-undirected-1","title":"Learning Value Functions from Undirected State-only Experience","date":"2022-04-26","arxiv_id":"2204.12458","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-should-we-prefer-offline-reinforcement","title":"When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?","date":"2022-04-12","arxiv_id":"2204.05618","repositories_listed":0,"syntology":null},{"url":null,"slug":"settling-the-sample-complexity-of-model-based","title":"Settling the Sample Complexity of Model-Based Offline Reinforcement Learning","date":"2022-04-11","arxiv_id":"2204.05275","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-conservative-q-learning-approach-for","title":"A Conservative Q-Learning approach for handling distribution shift in sepsis treatment strategies","date":"2022-03-25","arxiv_id":"2203.13884","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-under-value","title":"Offline Reinforcement Learning Under Value and Density-Ratio Realizability: The Power of Gaps","date":"2022-03-25","arxiv_id":"2203.13935","repositories_listed":0,"syntology":null},{"url":null,"slug":"bellman-residual-orthogonalization-for","title":"Bellman Residual Orthogonalization for Offline Reinforcement Learning","date":"2022-03-24","arxiv_id":"2203.12786","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-trajectories-for-highway-driving","title":"Optimizing Trajectories for Highway Driving with Offline Reinforcement Learning","date":"2022-03-21","arxiv_id":"2203.10949","repositories_listed":0,"syntology":null},{"url":null,"slug":"dara-dynamics-aware-reward-augmentation-in-1","title":"DARA: Dynamics-Aware Reward Augmentation in Offline Reinforcement Learning","date":"2022-03-13","arxiv_id":"2203.06662","repositories_listed":0,"syntology":null},{"url":null,"slug":"reliable-validation-of-reinforcement-learning","title":"Reliable validation of Reinforcement Learning Benchmarks","date":"2022-03-02","arxiv_id":"2203.01075","repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimistic-q-learning-for-offline","title":"Pessimistic Q-Learning for Offline Reinforcement Learning: Towards Optimal Sample Complexity","date":"2022-02-28","arxiv_id":"2202.13890","repositories_listed":0,"syntology":null},{"url":null,"slug":"settling-the-communication-complexity-for","title":"Settling the Communication Complexity for Distributed Offline Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.04862","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-2","title":"Offline Reinforcement Learning with Realizability and Single-policy Concentrability","date":"2022-02-09","arxiv_id":"2202.04634","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferred-q-learning","title":"Transferred Q-learning","date":"2022-02-09","arxiv_id":"2202.04709","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-leverage-unlabeled-data-in-offline","title":"How to Leverage Unlabeled Data in Offline Reinforcement Learning","date":"2022-02-03","arxiv_id":"2202.01741","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-challenges-of-exploration-for-offline","title":"The Challenges of Exploration for Offline Reinforcement Learning","date":"2022-01-27","arxiv_id":"2201.11861","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-for-road","title":"Offline Reinforcement Learning for Road Traffic Control","date":"2022-01-07","arxiv_id":"2201.02381","repositories_listed":0,"syntology":null},{"url":null,"slug":"importance-of-empirical-sample-complexity","title":"Importance of Empirical Sample Complexity Analysis for Offline Reinforcement Learning","date":"2021-12-31","arxiv_id":"2112.15578","repositories_listed":0,"syntology":null},{"url":null,"slug":"single-shot-pruning-for-offline-reinforcement","title":"Single-Shot Pruning for Offline Reinforcement Learning","date":"2021-12-31","arxiv_id":"2112.15579","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-validation-tool-for-designing-reinforcement","title":"A Validation Tool for Designing Reinforcement Learning Environments","date":"2021-12-10","arxiv_id":"2112.05519","repositories_listed":0,"syntology":null},{"url":null,"slug":"dr3-value-based-deep-reinforcement-learning-1","title":"DR3: Value-Based Deep Reinforcement Learning Requires Explicit Regularization","date":"2021-12-09","arxiv_id":"2112.04716","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-offline-imitating-learning","title":"Curriculum Offline Imitating Learning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-zero-shot-generalization-in-offline-1","title":"Improving Zero-shot Generalization in Offline Reinforcement Learning using Generalized Similarity Functions","date":"2021-11-29","arxiv_id":"2111.14629","repositories_listed":0,"syntology":null},{"url":null,"slug":"umbrella-uncertainty-aware-model-based","title":"UMBRELLA: Uncertainty-Aware Model-Based Offline Reinforcement Learning Leveraging Planning","date":"2021-11-22","arxiv_id":"2111.11097","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-fundamental","title":"Offline Reinforcement Learning: Fundamental Barriers for Value Function Approximation","date":"2021-11-21","arxiv_id":"2111.10919","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-generalisation-in-deep","title":"A Survey of Zero-shot Generalisation in Deep Reinforcement Learning","date":"2021-11-18","arxiv_id":"2111.09794","repositories_listed":0,"syntology":null},{"url":"/paper/koopman-q-learning-offline-reinforcement-1","slug":"koopman-q-learning-offline-reinforcement-1","title":"Koopman Q-learning: Offline Reinforcement Learning via Symmetries of Dynamics","date":"2021-11-02","arxiv_id":"2111.01365","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-instance-optimal-offline","title":"Towards Instance-Optimal Offline Reinforcement Learning with Pessimism","date":"2021-10-17","arxiv_id":"2110.08695","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-penalized-q-learning-for-recommender","title":"Value Penalized Q-Learning for Recommender Systems","date":"2021-10-15","arxiv_id":"2110.07923","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-learning-for-online-and-1","title":"Representation Learning for Online and Offline RL in Low-rank MDPs","date":"2021-10-09","arxiv_id":"2110.04652","repositories_listed":0,"syntology":null},{"url":null,"slug":"showing-your-offline-reinforcement-learning","title":"Showing Your Offline Reinforcement Learning Work: Online Evaluation Budget Matters","date":"2021-10-08","arxiv_id":"2110.04156","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-rl-with-resource-constrained-online","title":"Offline RL With Resource Constrained Online Deployment","date":"2021-10-07","arxiv_id":"2110.03165","repositories_listed":0,"syntology":null},{"url":null,"slug":"you-only-evaluate-once-a-simple-baseline","title":"You Only Evaluate Once: a Simple Baseline Algorithm for Offline RL","date":"2021-10-05","arxiv_id":"2110.02304","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-q-learning-for-interaction-limited","title":"Adaptive Q-learning for Interaction-Limited Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"crowdplay-crowdsourcing-human-demonstration","title":"CrowdPlay: Crowdsourcing human demonstration data for offline learning in Atari games","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"data-sharing-without-rewards-in-multi-task","title":"Data Sharing without Rewards in Multi-Task Offline Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-pseudometric-based-action","title":"Learning Pseudometric-based Action Representations for Offline Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-for-large","title":"Offline Reinforcement Learning for Large Scale Language Action Spaces","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-resource","title":"Offline Reinforcement Learning with Resource Constrained Online Deployment","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pareto-policy-pool-for-model-based-offline","title":"Pareto Policy Pool for Model-based Offline Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/particle-based-stochastic-policy-optimization","slug":"particle-based-stochastic-policy-optimization","title":"Particle Based Stochastic Policy Optimization","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-shifting-for-optimistic-exploration","title":"Reward Shifting for Optimistic Exploration and Conservative Exploitation","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-offline-reinforcement","title":"Semi-supervised Offline Reinforcement Learning with Pre-trained Decision Transformers","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"should-i-run-offline-reinforcement-learning","title":"Should I Run Offline Reinforcement Learning or Behavioral Cloning?","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"targeted-environment-design-from-offline-data","title":"Targeted Environment Design from Offline Data","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-essential-elements-of-offline-rl-via","title":"The Essential Elements of Offline RL via Supervised Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-regularized-policy-learning-for","title":"Uncertainty Regularized Policy Learning for Offline Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-oracle-guiding-for-reinforcement","title":"Variational oracle guiding for reinforcement learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"ef356304fd7365db45043ae2da18368b05d1f755e41be446b0ad5b51fe28ba4e","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}