{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/d4rl/papers/2","list_of":"/task/d4rl","task":"D4RL","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":3,"rows_per_page":100,"rows":[101,200],"of":226,"counts":{"archive_papers_tagged":226,"with_a_code_link":108,"where_syntology_ran_a_sample":68,"not_listed_spam_title":0,"listed":226,"listed_where_code_ran":68,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":59,"every_run_a_failure_of_syntologys_instrument":9,"listed_with_a_run_with_no_instrument_failure":59,"listed_every_run_a_failure_of_syntologys_instrument":9,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/d4rl","prev":"/task/d4rl","next":"/task/d4rl/papers/3","papers":[{"url":"/paper/pessimistic-bootstrapping-for-uncertainty-1","slug":"pessimistic-bootstrapping-for-uncertainty-1","title":"Pessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement Learning","date":"2022-02-23","arxiv_id":"2202.11566","repositories_listed":1,"syntology":null},{"url":"/paper/flowformer-linearizing-transformers-with","slug":"flowformer-linearizing-transformers-with","title":"Flowformer: Linearizing Transformers with Conservation Flows","date":"2022-02-13","arxiv_id":"2202.06258","repositories_listed":1,"syntology":{"n":6,"n_ran":6,"n_constructed":0,"n_ran_checked":4,"n_instrument":2,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":3,"n_pointer_only":2,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 1 honoured, 0 violated, 3 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/flowformer-linearizing-transformers-with#ran","syntology_url":"https://syntology.ai/paper/2202.06258","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2202.06258"}},"official":{"repos":["thuml/Flowformer"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/score-spurious-correlation-reduction-for","slug":"score-spurious-correlation-reduction-for","title":"False Correlation Reduction for Offline Reinforcement Learning","date":"2021-10-24","arxiv_id":"2110.12468","repositories_listed":1,"syntology":null},{"url":"/paper/offline-reinforcement-learning-with-value-1","slug":"offline-reinforcement-learning-with-value-1","title":"Offline Reinforcement Learning with Value-based Episodic Memory","date":"2021-10-19","arxiv_id":"2110.09796","repositories_listed":1,"syntology":null},{"url":"/paper/offline-reinforcement-learning-with-in-sample","slug":"offline-reinforcement-learning-with-in-sample","title":"Offline Reinforcement Learning with In-sample Q-Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/a-pragmatic-look-at-deep-imitation-learning","slug":"a-pragmatic-look-at-deep-imitation-learning","title":"A Pragmatic Look at Deep Imitation Learning","date":"2021-08-04","arxiv_id":"2108.01867","repositories_listed":1,"syntology":null},{"url":"/paper/conservative-offline-distributional","slug":"conservative-offline-distributional","title":"Conservative Offline Distributional Reinforcement Learning","date":"2021-07-12","arxiv_id":"2107.06106","repositories_listed":1,"syntology":{"n":5,"n_ran":4,"n_constructed":2,"n_ran_checked":3,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":5,"phrase":"4 ran (of which 2 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/conservative-offline-distributional#ran","syntology_url":"https://syntology.ai/paper/2107.06106","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2107.06106"}},"official":{"repos":["JasonMa2016/CODAC"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":2,"n_ran_no_instrument_failure":3,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/offline-rl-without-off-policy-evaluation","slug":"offline-rl-without-off-policy-evaluation","title":"Offline RL Without Off-Policy Evaluation","date":"2021-06-16","arxiv_id":"2106.08909","repositories_listed":1,"syntology":null},{"url":null,"slug":"from-novelty-to-imitation-self-distilled","title":"From Novelty to Imitation: Self-Distilled Rewards for Offline Reinforcement Learning","date":"2025-07-17","arxiv_id":"2507.12815","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-residual-reinforcement-learning","title":"Accelerating Residual Reinforcement Learning with Uncertainty Estimation","date":"2025-06-21","arxiv_id":"2506.17564","repositories_listed":0,"syntology":null},{"url":null,"slug":"moorl-a-framework-for-integrating-offline","title":"MOORL: A Framework for Integrating Offline-Online Reinforcement Learning","date":"2025-06-11","arxiv_id":"2506.09574","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-based-trajectory-clustering-in-offline","title":"Policy-Based Trajectory Clustering in Offline Reinforcement Learning","date":"2025-06-10","arxiv_id":"2506.09202","repositories_listed":0,"syntology":null},{"url":null,"slug":"stitch-ope-trajectory-stitching-with-guided","title":"STITCH-OPE: Trajectory Stitching with Guided Diffusion for Off-Policy Evaluation","date":"2025-05-27","arxiv_id":"2505.20781","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-driven-world-model-adaptation-for","title":"Policy-Driven World Model Adaptation for Robust Offline Model-based Reinforcement Learning","date":"2025-05-19","arxiv_id":"2505.13709","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-distance-aware-transition","title":"Temporal Distance-aware Transition Augmentation for Offline Model-based Reinforcement Learning","date":"2025-05-19","arxiv_id":"2505.13144","repositories_listed":0,"syntology":null},{"url":null,"slug":"imagination-limited-q-learning-for-offline","title":"Imagination-Limited Q-Learning for Offline Reinforcement Learning","date":"2025-05-18","arxiv_id":"2505.12211","repositories_listed":0,"syntology":null},{"url":null,"slug":"pretraining-a-shared-q-network-for-data","title":"Pretraining a Shared Q-Network for Data-Efficient Offline Reinforcement Learning","date":"2025-05-09","arxiv_id":"2505.05701","repositories_listed":0,"syntology":null},{"url":null,"slug":"taming-ood-actions-for-offline-reinforcement","title":"Taming OOD Actions for Offline Reinforcement Learning: An Advantage-Based Approach","date":"2025-05-08","arxiv_id":"2505.05126","repositories_listed":0,"syntology":null},{"url":null,"slug":"analytic-energy-guided-policy-optimization","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","date":"2025-05-03","arxiv_id":"2505.01822","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-optimal-discriminator-weighted-imitation","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","date":"2025-04-17","arxiv_id":"2504.13368","repositories_listed":0,"syntology":null},{"url":"/paper/vipo-value-function-inconsistency-penalized","slug":"vipo-value-function-inconsistency-penalized","title":"VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning","date":"2025-04-16","arxiv_id":"2504.11944","repositories_listed":0,"syntology":{"n":14,"n_ran":10,"n_constructed":9,"n_ran_checked":9,"n_instrument":1,"n_unverified":4,"n_honours":0,"n_violates":0,"n_no_contract":9,"n_pointer_only":14,"phrase":"10 ran (of which 9 constructed an object rather than computing a result; 9 with no instrument failure: 0 honoured, 0 violated, 9 with no contract checked; 1 where Syntology's instrument failed) · 4 unverified","sample_list":"/paper/vipo-value-function-inconsistency-penalized#ran","syntology_url":"https://syntology.ai/paper/2504.11944","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2504.11944"}},"official":null}},{"url":null,"slug":"decision-spikeformer-spike-driven-transformer","title":"Decision SpikeFormer: Spike-Driven Transformer for Decision Making","date":"2025-04-04","arxiv_id":"2504.03800","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-offline-reinforcement-learning-3","title":"Model-Based Offline Reinforcement Learning with Adversarial Data Augmentation","date":"2025-03-26","arxiv_id":"2503.20285","repositories_listed":0,"syntology":null},{"url":null,"slug":"diverse-transformer-decoding-for-offline","title":"Diverse Transformer Decoding for Offline Reinforcement Learning Using Financial Algorithmic Approaches","date":"2025-02-13","arxiv_id":"2502.10473","repositories_listed":0,"syntology":null},{"url":null,"slug":"behavior-regularized-diffusion-policy","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","date":"2025-02-07","arxiv_id":"2502.04778","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-suboptimal-data-in-continuous","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","date":"2025-02-01","arxiv_id":"2502.00288","repositories_listed":0,"syntology":null},{"url":null,"slug":"projection-implicit-q-learning-with-support","title":"Projection Implicit Q-Learning with Support Constraint for Offline Reinforcement Learning","date":"2025-01-15","arxiv_id":"2501.08907","repositories_listed":0,"syntology":null},{"url":null,"slug":"drdt3-diffusion-refined-decision-test-time","title":"DRDT3: Diffusion-Refined Decision Test-Time Training Model","date":"2025-01-12","arxiv_id":"2501.06718","repositories_listed":0,"syntology":null},{"url":null,"slug":"sale-based-offline-reinforcement-learning","title":"SALE-Based Offline Reinforcement Learning with Ensemble Q-Networks","date":"2025-01-07","arxiv_id":"2501.03676","repositories_listed":0,"syntology":null},{"url":null,"slug":"sr-reward-taking-the-path-more-traveled","title":"SR-Reward: Taking The Path More Traveled","date":"2025-01-04","arxiv_id":"2501.02330","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-conditioned-data-augmentation-for","title":"Goal-Conditioned Data Augmentation for Offline Reinforcement Learning","date":"2024-12-29","arxiv_id":"2412.20519","repositories_listed":0,"syntology":null},{"url":null,"slug":"acl-ql-adaptive-conservative-level-in-q","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","date":"2024-12-22","arxiv_id":"2412.16848","repositories_listed":0,"syntology":null},{"url":null,"slug":"finer-behavioral-foundation-models-via-auto","title":"Finer Behavioral Foundation Models via Auto-Regressive Features and Advantage Weighting","date":"2024-12-05","arxiv_id":"2412.04368","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-decision-transformer-with-diffusion","title":"Enhancing Decision Transformer with Diffusion-Based Trajectory Branch Generation","date":"2024-11-18","arxiv_id":"2411.11327","repositories_listed":0,"syntology":null},{"url":null,"slug":"return-augmented-decision-transformer-for-off","title":"Return Augmented Decision Transformer for Off-Dynamics Reinforcement Learning","date":"2024-10-30","arxiv_id":"2410.23450","repositories_listed":0,"syntology":null},{"url":null,"slug":"samg-state-action-aware-offline-to-online","title":"SAMG: State-Action-Aware Offline-to-Online Reinforcement Learning with Offline Model Guidance","date":"2024-10-24","arxiv_id":"2410.18626","repositories_listed":0,"syntology":null},{"url":null,"slug":"rgmdt-return-gap-minimizing-decision-tree","title":"RGMDT: Return-Gap-Minimizing Decision Tree Extraction in Non-Euclidean Metric Space","date":"2024-10-21","arxiv_id":"2410.16517","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-optimal-transport-in-offline","title":"Rethinking Optimal Transport in Offline Reinforcement Learning","date":"2024-10-17","arxiv_id":"2410.14069","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-model-predictive-control","title":"Diffusion Model Predictive Control","date":"2024-10-07","arxiv_id":"2410.05364","repositories_listed":0,"syntology":null},{"url":null,"slug":"kan-v-s-mlp-for-offline-reinforcement","title":"KAN v.s. MLP for Offline Reinforcement Learning","date":"2024-09-15","arxiv_id":"2409.09653","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-transformer-long-horizon-offline","title":"Planning Transformer: Long-Horizon Offline Reinforcement Learning with Planning Tokens","date":"2024-09-14","arxiv_id":"2409.09513","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-value-regularized-decision-convformer-for","title":"Q-value Regularized Decision ConvFormer for Offline Reinforcement Learning","date":"2024-09-12","arxiv_id":"2409.08062","repositories_listed":0,"syntology":null},{"url":null,"slug":"forward-kl-regularized-preference","title":"Forward KL Regularized Preference Optimization for Aligning Diffusion Policies","date":"2024-09-09","arxiv_id":"2409.05622","repositories_listed":0,"syntology":null},{"url":null,"slug":"sumo-search-based-uncertainty-estimation-for","title":"SUMO: Search-Based Uncertainty Estimation for Model-Based Offline Reinforcement Learning","date":"2024-08-23","arxiv_id":"2408.12970","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-model-based-reinforcement-learning","title":"Offline Model-Based Reinforcement Learning with Anti-Exploration","date":"2024-08-20","arxiv_id":"2408.10713","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02165","title":"SelfBC: Self Behavior Cloning for Offline Reinforcement Learning","date":"2024-08-04","arxiv_id":"2408.02165","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-imputed","title":"Offline Reinforcement Learning with Imputed Rewards","date":"2024-07-15","arxiv_id":"2407.10839","repositories_listed":0,"syntology":null},{"url":null,"slug":"tackling-long-horizon-tasks-with-model-based","title":"Model-based Offline Reinforcement Learning with Lower Expectile Q-Learning","date":"2024-06-30","arxiv_id":"2407.00699","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-reward-labeling-bridging-offline","title":"Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning","date":"2024-06-14","arxiv_id":"2406.10445","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffpogan-diffusion-policies-with-generative","title":"DiffPoGAN: Diffusion Policies with Generative Adversarial Networks for Offline Reinforcement Learning","date":"2024-06-13","arxiv_id":"2406.09089","repositories_listed":0,"syntology":null},{"url":null,"slug":"semopo-learning-high-quality-model-and-policy","title":"SeMOPO: Learning High-quality Model and Policy from Low-quality Offline Visual Datasets","date":"2024-06-13","arxiv_id":"2406.09486","repositories_listed":0,"syntology":null},{"url":null,"slug":"cdsa-conservative-denoising-score-based","title":"CDSA: Conservative Denoising Score-based Algorithm for Offline Reinforcement Learning","date":"2024-06-11","arxiv_id":"2406.07541","repositories_listed":0,"syntology":null},{"url":null,"slug":"udql-bridging-the-gap-between-mse-loss-and","title":"UDQL: Bridging The Gap between MSE Loss and The Optimal Value Function in Offline Reinforcement Learning","date":"2024-06-05","arxiv_id":"2406.03324","repositories_listed":0,"syntology":null},{"url":null,"slug":"decision-mamba-reinforcement-learning-via-1","title":"Decision Mamba: Reinforcement Learning via Hybrid Selective Sequence Modeling","date":"2024-05-31","arxiv_id":"2406.00079","repositories_listed":0,"syntology":null},{"url":null,"slug":"fourier-controller-networks-for-real-time","title":"Fourier Controller Networks for Real-Time Decision-Making in Embodied Learning","date":"2024-05-30","arxiv_id":"2405.19885","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-random-demonstrations-offline","title":"Learning from Random Demonstrations: Offline Reinforcement Learning with Importance-Sampled Diffusion Models","date":"2024-05-30","arxiv_id":"2405.19878","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-constrained-offline-reinforcement","title":"State-Constrained Offline Reinforcement Learning","date":"2024-05-23","arxiv_id":"2405.14374","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-agnostic-decision-transformer-for-multi","title":"Task-agnostic Decision Transformer for Multi-type Agent Control with Federated Split Training","date":"2024-05-22","arxiv_id":"2405.13445","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-robust-policy-enhancing-offline","title":"Towards Robust Policy: Enhancing Offline Reinforcement Learning with Adversarial Attacks and Defenses","date":"2024-05-18","arxiv_id":"2405.11206","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-offline-reinforcement-learning-with","title":"Improving Offline Reinforcement Learning with Inaccurate Simulators","date":"2024-05-07","arxiv_id":"2405.04307","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-trajectory-generalization-for-offline","title":"Offline Trajectory Generalization for Offline Reinforcement Learning","date":"2024-04-16","arxiv_id":"2404.10393","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularized-conditional-diffusion-model-for","title":"Regularized Conditional Diffusion Model for Multi-Task Preference Alignment","date":"2024-04-07","arxiv_id":"2404.04920","repositories_listed":0,"syntology":null},{"url":null,"slug":"simple-ingredients-for-offline-reinforcement","title":"Simple Ingredients for Offline Reinforcement Learning","date":"2024-03-19","arxiv_id":"2403.13097","repositories_listed":0,"syntology":null},{"url":null,"slug":"align-your-intents-offline-imitation-learning","title":"Align Your Intents: Offline Imitation Learning via Optimal Transport","date":"2024-02-20","arxiv_id":"2402.13037","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-diffuser-planning-towards-high","title":"Contrastive Diffuser: Planning Towards High Return States via Contrastive Learning","date":"2024-02-05","arxiv_id":"2402.02772","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-autoregressive-density-nets-vs-neural","title":"Deep autoregressive density nets vs neural ensembles for model-based offline reinforcement learning","date":"2024-02-05","arxiv_id":"2402.02858","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-world-model","title":"Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning","date":"2024-02-05","arxiv_id":"2402.03570","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffstitch-boosting-offline-reinforcement","title":"DiffStitch: Boosting Offline Reinforcement Learning with Diffusion-based Trajectory Stitching","date":"2024-02-04","arxiv_id":"2402.02439","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilling-conditional-diffusion-models-for","title":"Augmenting Offline Reinforcement Learning with State-only Interactions","date":"2024-02-01","arxiv_id":"2402.00807","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-former-stitching-via-latent","title":"Context-Former: Stitching via Latent Conditioned Sequence Modeling","date":"2024-01-29","arxiv_id":"2401.16452","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffuserlite-towards-real-time-diffusion","title":"DiffuserLite: Towards Real-time Diffusion Planning","date":"2024-01-27","arxiv_id":"2401.15443","repositories_listed":0,"syntology":null},{"url":null,"slug":"guided-data-augmentation-for-offline","title":"Guided Data Augmentation for Offline Reinforcement Learning and Imitation Learning","date":"2023-10-27","arxiv_id":"2310.18247","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-consistent-dynamics-models-are","title":"Reward-Consistent Dynamics Models are Strongly Generalizable for Offline Reinforcement Learning","date":"2023-10-09","arxiv_id":"2310.05422","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-mildly-conservative-model-based","title":"DOMAIN: MilDly COnservative Model-BAsed OfflINe Reinforcement Learning","date":"2023-09-16","arxiv_id":"2309.08925","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-decision-transformers-for","title":"Multi-Objective Decision Transformers for Offline Reinforcement Learning","date":"2023-08-31","arxiv_id":"2308.16379","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistically-efficient-variance-reduction","title":"Statistically Efficient Variance Reduction with Double Policy Estimation for Off-Policy Evaluation in Sequence-Modeled Reinforcement Learning","date":"2023-08-28","arxiv_id":"2308.14897","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-computational-efficient-bots-with","title":"Learning Computational Efficient Bots with Costly Features","date":"2023-08-18","arxiv_id":"2308.09629","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-on-policy","title":"Offline Reinforcement Learning with On-Policy Q-Function Regularization","date":"2023-07-25","arxiv_id":"2307.13824","repositories_listed":0,"syntology":null},{"url":null,"slug":"diverse-offline-imitation-via-fenchel-duality","title":"Offline Diversity Maximization Under Imitation Constraints","date":"2023-07-21","arxiv_id":"2307.11373","repositories_listed":0,"syntology":null},{"url":null,"slug":"budgeting-counterfactual-for-offline-rl","title":"Budgeting Counterfactual for Offline RL","date":"2023-07-12","arxiv_id":"2307.06328","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-policies-for-out-of-distribution","title":"Diffusion Policies for Out-of-Distribution Generalization in Offline Reinforcement Learning","date":"2023-07-10","arxiv_id":"2307.04726","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-7","title":"Offline Reinforcement Learning with Imbalanced Datasets","date":"2023-07-06","arxiv_id":"2307.02752","repositories_listed":0,"syntology":null},{"url":null,"slug":"elastic-decision-transformer-1","title":"Elastic Decision Transformer","date":"2023-07-05","arxiv_id":"2307.02484","repositories_listed":0,"syntology":null},{"url":null,"slug":"prioritized-trajectory-replay-a-replay-memory","title":"Prioritized Trajectory Replay: A Replay Memory for Data-driven Reinforcement Learning","date":"2023-06-27","arxiv_id":"2306.15503","repositories_listed":0,"syntology":null},{"url":null,"slug":"ceil-generalized-contextual-imitation","title":"CEIL: Generalized Contextual Imitation Learning","date":"2023-06-26","arxiv_id":"2306.14534","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-unified-uncertainty-guided-framework","title":"A Simple Unified Uncertainty-Guided Framework for Offline-to-Online Reinforcement Learning","date":"2023-06-13","arxiv_id":"2306.07541","repositories_listed":0,"syntology":null},{"url":null,"slug":"hipode-enhancing-offline-reinforcement","title":"HIPODE: Enhancing Offline Reinforcement Learning with High-Quality Synthetic Data from a Policy-Decoupled Approach","date":"2023-06-10","arxiv_id":"2306.06329","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-sample-policy-iteration-for-offline","title":"Iteratively Refined Behavior Regularization for Offline Reinforcement Learning","date":"2023-06-09","arxiv_id":"2306.05726","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-offline-reinforcement-learning-with-1","title":"Boosting Offline Reinforcement Learning with Action Preference Query","date":"2023-06-06","arxiv_id":"2306.03362","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-offline-rl-by-blending-heuristics","title":"Improving Offline RL by Blending Heuristics","date":"2023-06-01","arxiv_id":"2306.00321","repositories_listed":0,"syntology":null},{"url":null,"slug":"iql-td-mpc-implicit-q-learning-for","title":"IQL-TD-MPC: Implicit Q-Learning for Hierarchical Model Predictive Control","date":"2023-06-01","arxiv_id":"2306.00867","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergent-agentic-transformer-from-chain-of","title":"Emergent Agentic Transformer from Chain of Hindsight Experience","date":"2023-05-26","arxiv_id":"2305.16554","repositories_listed":0,"syntology":null},{"url":null,"slug":"skill-decision-transformer","title":"Skill Decision Transformer","date":"2023-01-31","arxiv_id":"2301.13573","repositories_listed":0,"syntology":null},{"url":null,"slug":"behaviour-discriminator-a-simple-data","title":"Improving Behavioural Cloning with Positive Unlabeled Learning","date":"2023-01-27","arxiv_id":"2301.11734","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-offline-reinforcement-learning-1","title":"Model-based Offline Reinforcement Learning with Local Misspecification","date":"2023-01-26","arxiv_id":"2301.11426","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-trajectory-stitching-for-improved-1","title":"Model-based trajectory stitching for improved behavioural cloning and its applications","date":"2022-12-08","arxiv_id":"2212.04280","repositories_listed":0,"syntology":null},{"url":null,"slug":"flow-to-control-offline-reinforcement","title":"Flow to Control: Offline Reinforcement Learning with Lossless Primitive Discovery","date":"2022-12-02","arxiv_id":"2212.01105","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-closed","title":"Offline Reinforcement Learning with Closed-Form Policy Improvement Operators","date":"2022-11-29","arxiv_id":"2211.15956","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-transformer-for-offline-meta","title":"Contextual Transformer for Offline Meta Reinforcement Learning","date":"2022-11-15","arxiv_id":"2211.08016","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-adaptive","title":"Offline Reinforcement Learning with Adaptive Behavior Regularization","date":"2022-11-15","arxiv_id":"2211.08251","repositories_listed":0,"syntology":null}],"record_sha256":"58fd3e27bed914e7e8004a8e8f2f1a81c857f033bfb1e7aaf54e1f25e7c6769e","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}