{"url":"/task/offline-rl","name":"Offline RL","slug":"offline-rl","description_markdown":null,"categories":[{"name":"Miscellaneous","url":"/area/miscellaneous"},{"name":"Playing Games","url":"/area/playing-games"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":755,"papers_with_code":310,"benchmarks":2,"benchmark_tables_in_archive":2,"benchmark_tables_shown":2,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":7,"subtasks":1,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/offline-rl-on-d4rl","slug":"offline-rl-on-d4rl","dataset":"D4RL","dataset_url":"/dataset/d4rl","rows_in_archive":3,"metrics":["Average Reward"],"first_row_in_archive_order":{"model":"KFC","paper_title":"Koopman Q-learning: Offline Reinforcement Learning via Symmetries of Dynamics","paper_url":"/paper/koopman-q-learning-offline-reinforcement-1","paper_date":"2021-11-02","arxiv_id":"2111.01365","code_links":[],"syntology":null}},{"leaderboard":"/sota/offline-rl-on-walker2d","slug":"offline-rl-on-walker2d","dataset":"Walker2d","dataset_url":null,"rows_in_archive":1,"metrics":["D4RL Normalized Score"],"first_row_in_archive_order":{"model":"ParPI","paper_title":"Particle Based Stochastic Policy Optimization","paper_url":"/paper/particle-based-stochastic-policy-optimization","paper_date":"2021-09-29","arxiv_id":null,"code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/d4rl","name":"D4RL","full_name":"D4RL","num_papers_in_archive":538},{"url":"/dataset/robonet","name":"RoboNet","full_name":"","num_papers_in_archive":28},{"url":"/dataset/neorl","name":"NeoRL","full_name":"","num_papers_in_archive":10},{"url":"/dataset/rl-unplugged","name":"RL Unplugged","full_name":"RL Unplugged","num_papers_in_archive":7},{"url":"/dataset/caglar","name":"RLU","full_name":"RL Unplugged","num_papers_in_archive":2},{"url":"/dataset/visuomotor-affordance-learning-val-robot","name":"Visuomotor affordance learning (VAL) robot interaction dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/neorl2","name":"NeoRL-2","full_name":"","num_papers_in_archive":0}],"subtasks":[{"url":"/task/dqn-replay-dataset","name":"DQN Replay Dataset"}],"parent_tasks":[{"url":"/task/general-reinforcement-learning","name":"General Reinforcement Learning"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":310,"tagged_in_all":755,"items":[{"url":"/paper/decision-transformer-reinforcement-learning","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","date":"2021-06-02","arxiv_id":"2106.01345","repositories_listed":20,"syntology":{"n":26,"n_ran":17,"n_unverified":9,"n_pointer_only":6}},{"url":"/paper/conservative-q-learning-for-offline","title":"Conservative Q-Learning for Offline Reinforcement Learning","date":"2020-06-08","arxiv_id":"2006.04779","repositories_listed":18,"syntology":{"n":34,"n_ran":24,"n_unverified":10,"n_pointer_only":5}},{"url":"/paper/offline-reinforcement-learning-with-implicit","title":"Offline Reinforcement Learning with Implicit Q-Learning","date":"2021-10-12","arxiv_id":"2110.06169","repositories_listed":17,"syntology":{"n":58,"n_ran":32,"n_unverified":26,"n_pointer_only":22}},{"url":"/paper/reformer-the-efficient-transformer-1","title":"Reformer: The Efficient Transformer","date":"2020-01-13","arxiv_id":"2001.04451","repositories_listed":10,"syntology":{"n":8,"n_ran":6,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/a-minimalist-approach-to-offline","title":"A Minimalist Approach to Offline Reinforcement Learning","date":"2021-06-12","arxiv_id":"2106.06860","repositories_listed":8,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/transformers-are-rnns-fast-autoregressive","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","date":"2020-06-29","arxiv_id":"2006.16236","repositories_listed":8,"syntology":{"n":8,"n_ran":3,"n_unverified":5,"n_pointer_only":3}},{"url":"/paper/rethinking-attention-with-performers","title":"Rethinking Attention with Performers","date":"2020-09-30","arxiv_id":"2009.14794","repositories_listed":7,"syntology":{"n":16,"n_ran":9,"n_unverified":7,"n_pointer_only":6}},{"url":"/paper/datasets-for-data-driven-reinforcement","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","date":"2020-04-15","arxiv_id":"2004.07219","repositories_listed":7,"syntology":{"n":12,"n_ran":4,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/mopo-model-based-offline-policy-optimization","title":"MOPO: Model-based Offline Policy Optimization","date":"2020-05-27","arxiv_id":"2005.13239","repositories_listed":6,"syntology":{"n":8,"n_ran":3,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/uncertainty-based-offline-reinforcement","title":"Uncertainty-Based Offline Reinforcement Learning with Diversified Q-Ensemble","date":"2021-10-04","arxiv_id":"2110.01548","repositories_listed":5,"syntology":{"n":21,"n_ran":13,"n_unverified":8,"n_pointer_only":6}},{"url":"/paper/critic-regularized-regression","title":"Critic Regularized Regression","date":"2020-06-26","arxiv_id":"2006.15134","repositories_listed":5,"syntology":null},{"url":"/paper/acme-a-research-framework-for-distributed","title":"Acme: A Research Framework for Distributed Reinforcement Learning","date":"2020-06-01","arxiv_id":"2006.00979","repositories_listed":5,"syntology":null},{"url":"/paper/offline-rl-with-no-ood-actions-in-sample","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","date":"2023-03-28","arxiv_id":"2303.15810","repositories_listed":4,"syntology":{"n":3,"n_ran":1,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/the-in-sample-softmax-for-offline","title":"The In-Sample Softmax for Offline Reinforcement Learning","date":"2023-02-28","arxiv_id":"2302.14372","repositories_listed":4,"syntology":null},{"url":"/paper/extreme-q-learning-maxent-rl-without-entropy","title":"Extreme Q-Learning: MaxEnt RL without Entropy","date":"2023-01-05","arxiv_id":"2301.02328","repositories_listed":4,"syntology":{"n":13,"n_ran":8,"n_unverified":5,"n_pointer_only":7}},{"url":"/paper/combo-conservative-offline-model-based-policy","title":"COMBO: Conservative Offline Model-Based Policy Optimization","date":"2021-02-16","arxiv_id":"2102.08363","repositories_listed":4,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/deployment-efficient-reinforcement-learning","title":"Deployment-Efficient Reinforcement Learning via Model-Based Offline Optimization","date":"2020-06-05","arxiv_id":"2006.03647","repositories_listed":4,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/revisiting-the-minimalist-approach-to-offline","title":"Revisiting the Minimalist Approach to Offline Reinforcement Learning","date":"2023-05-16","arxiv_id":"2305.09836","repositories_listed":3,"syntology":{"n":16,"n_ran":7,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/cal-ql-calibrated-offline-rl-pre-training-for-1","title":"Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning","date":"2023-03-09","arxiv_id":"2303.05479","repositories_listed":3,"syntology":null},{"url":"/paper/model-based-offline-reinforcement-learning","title":"Model-Based Offline Reinforcement Learning with Pessimism-Modulated Dynamics Belief","date":"2022-10-13","arxiv_id":"2210.06692","repositories_listed":3,"syntology":null},{"url":"/paper/diffusion-policies-as-an-expressive-policy","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","date":"2022-08-12","arxiv_id":"2208.06193","repositories_listed":3,"syntology":{"n":18,"n_ran":11,"n_unverified":7,"n_pointer_only":10}},{"url":"/paper/cosformer-rethinking-softmax-in-attention-1","title":"cosFormer: Rethinking Softmax in Attention","date":"2022-02-17","arxiv_id":"2202.08791","repositories_listed":3,"syntology":null},{"url":"/paper/supported-policy-optimization-for-offline","title":"Supported Policy Optimization for Offline Reinforcement Learning","date":"2022-02-13","arxiv_id":"2202.06239","repositories_listed":3,"syntology":null},{"url":"/paper/adversarially-trained-actor-critic-for","title":"Adversarially Trained Actor Critic for Offline Reinforcement Learning","date":"2022-02-05","arxiv_id":"2202.02446","repositories_listed":3,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/near-real-world-benchmarks-for-offline","title":"NeoRL: A Near Real-World Benchmark for Offline Reinforcement Learning","date":"2021-02-01","arxiv_id":"2102.00714","repositories_listed":3,"syntology":null},{"url":"/paper/training-frankensteins-creature-to-stack","title":"The CoSTAR Block Stacking Dataset: Learning with Workspace Constraints","date":"2018-10-27","arxiv_id":"1810.11714","repositories_listed":3,"syntology":null},{"url":"/paper/a-clean-slate-for-offline-reinforcement","title":"A Clean Slate for Offline Reinforcement Learning","date":"2025-04-15","arxiv_id":"2504.11453","repositories_listed":2,"syntology":null},{"url":"/paper/flow-q-learning","title":"Flow Q-Learning","date":"2025-02-04","arxiv_id":"2502.02538","repositories_listed":2,"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":5}},{"url":"/paper/offline-reinforcement-learning-for-llm-multi","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","date":"2024-12-20","arxiv_id":"2412.16145","repositories_listed":2,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/q-value-regularized-transformer-for-offline","title":"Q-value Regularized Transformer for Offline Reinforcement Learning","date":"2024-05-27","arxiv_id":"2405.17098","repositories_listed":2,"syntology":{"n":8,"n_ran":2,"n_unverified":6,"n_pointer_only":0}}],"syntology_records":20,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}