{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/offline-rl/papers/5","list_of":"/task/offline-rl","task":"Offline RL","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":5,"pages_in_order":8,"rows_per_page":100,"rows":[401,500],"of":755,"counts":{"archive_papers_tagged":755,"with_a_code_link":310,"where_syntology_ran_a_sample":164,"not_listed_spam_title":0,"listed":755,"listed_where_code_ran":164,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":139,"every_run_a_failure_of_syntologys_instrument":25,"listed_with_a_run_with_no_instrument_failure":139,"listed_every_run_a_failure_of_syntologys_instrument":25,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/offline-rl","prev":"/task/offline-rl/papers/4","next":"/task/offline-rl/papers/6","papers":[{"url":null,"slug":"optimization-solution-functions-as","title":"Optimization Solution Functions as Deterministic Policies for Offline Reinforcement Learning","date":"2024-08-27","arxiv_id":"2408.15368","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-to-online-reinforcement-learning","title":"Unsupervised-to-Online Reinforcement Learning","date":"2024-08-27","arxiv_id":"2408.14785","repositories_listed":0,"syntology":null},{"url":null,"slug":"sumo-search-based-uncertainty-estimation-for","title":"SUMO: Search-Based Uncertainty Estimation for Model-Based Offline Reinforcement Learning","date":"2024-08-23","arxiv_id":"2408.12970","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adaptation-for-offline-reinforcement","title":"Domain Adaptation for Offline Reinforcement Learning with Limited Samples","date":"2024-08-22","arxiv_id":"2408.12136","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-multi-modal-input-token-mixer","title":"Integrating Multi-Modal Input Token Mixer Into Mamba-Based Decision Models: Decision MetaMamba","date":"2024-08-20","arxiv_id":"2408.10517","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-model-based-reinforcement-learning","title":"Offline Model-Based Reinforcement Learning with Anti-Exploration","date":"2024-08-20","arxiv_id":"2408.10713","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-reinforcement-learning-through","title":"Enhancing Reinforcement Learning Through Guided Search","date":"2024-08-19","arxiv_id":"2408.10113","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-rl-as-a-minimalist-approach-to","title":"Model-based RL as a Minimalist Approach to Horizon-Free and Second-Order Bounds","date":"2024-08-16","arxiv_id":"2408.08994","repositories_listed":0,"syntology":null},{"url":null,"slug":"d5rl-diverse-datasets-for-data-driven-deep","title":"D5RL: Diverse Datasets for Data-Driven Deep Reinforcement Learning","date":"2024-08-15","arxiv_id":"2408.08441","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-reinforcement-learning-breaks-sample","title":"Hybrid Reinforcement Learning Breaks Sample Size Barriers in Linear MDPs","date":"2024-08-08","arxiv_id":"2408.04526","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-time-travel-and-consistent-market-making","title":"Consistent time travel for realistic interactions with historical data: reinforcement learning for market making","date":"2024-08-05","arxiv_id":"2408.02322","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-dice-in-sample-diffusion-guidance","title":"Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning","date":"2024-07-29","arxiv_id":"2407.20109","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-conditioned-offline-rl-for-multi","title":"Language-Conditioned Offline RL for Multi-Robot Navigation","date":"2024-07-29","arxiv_id":"2407.20164","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparsity-based-safety-conservatism-for","title":"Sparsity-based Safety Conservatism for Constrained Offline Reinforcement Learning","date":"2024-07-17","arxiv_id":"2407.13006","repositories_listed":0,"syntology":null},{"url":null,"slug":"because-bilinear-causal-representation-for","title":"BECAUSE: Bilinear Causal Representation for Generalizable Offline Model-based Reinforcement Learning","date":"2024-07-15","arxiv_id":"2407.10967","repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimism-meets-risk-risk-sensitive-offline","title":"Pessimism Meets Risk: Risk-Sensitive Offline Reinforcement Learning","date":"2024-07-10","arxiv_id":"2407.07631","repositories_listed":0,"syntology":null},{"url":null,"slug":"fosp-fine-tuning-offline-safe-policy-through","title":"FOSP: Fine-tuning Offline Safe Policy through World Models","date":"2024-07-06","arxiv_id":"2407.04942","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-decision-transformer-tackling-data","title":"Robust Decision Transformer: Tackling Data Corruption in Offline RL via Sequence Modeling","date":"2024-07-05","arxiv_id":"2407.04285","repositories_listed":0,"syntology":null},{"url":null,"slug":"to-switch-or-not-to-switch-balanced-policy","title":"To Switch or Not to Switch? Balanced Policy Switching in Offline Reinforcement Learning","date":"2024-07-01","arxiv_id":"2407.01837","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarks-for-reinforcement-learning-with","title":"Benchmarks for Reinforcement Learning with Biased Offline Data and Imperfect Simulators","date":"2024-06-30","arxiv_id":"2407.00806","repositories_listed":0,"syntology":null},{"url":null,"slug":"tackling-long-horizon-tasks-with-model-based","title":"Model-based Offline Reinforcement Learning with Lower Expectile Q-Learning","date":"2024-06-30","arxiv_id":"2407.00699","repositories_listed":0,"syntology":null},{"url":null,"slug":"preference-elicitation-for-offline","title":"Preference Elicitation for Offline Reinforcement Learning","date":"2024-06-26","arxiv_id":"2406.18450","repositories_listed":0,"syntology":null},{"url":null,"slug":"equivariant-offline-reinforcement-learning","title":"Equivariant Offline Reinforcement Learning","date":"2024-06-20","arxiv_id":"2406.13961","repositories_listed":0,"syntology":null},{"url":null,"slug":"urban-focused-multi-task-offline","title":"Urban-Focused Multi-Task Offline Reinforcement Learning with Contrastive Data Sharing","date":"2024-06-20","arxiv_id":"2406.14054","repositories_listed":0,"syntology":null},{"url":null,"slug":"order-optimal-instance-dependent-bounds-for","title":"Order-Optimal Instance-Dependent Bounds for Offline Reinforcement Learning with Preference Feedback","date":"2024-06-18","arxiv_id":"2406.12205","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-role-of-inherent-bellman-error-in-offline","title":"The Role of Inherent Bellman Error in Offline Reinforcement Learning with Linear Function Approximation","date":"2024-06-17","arxiv_id":"2406.11686","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-reward-labeling-bridging-offline","title":"Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning","date":"2024-06-14","arxiv_id":"2406.10445","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dual-approach-to-imitation-learning-from","title":"A Dual Approach to Imitation Learning from Observations with Offline Datasets","date":"2024-06-13","arxiv_id":"2406.08805","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffpogan-diffusion-policies-with-generative","title":"DiffPoGAN: Diffusion Policies with Generative Adversarial Networks for Offline Reinforcement Learning","date":"2024-06-13","arxiv_id":"2406.09089","repositories_listed":0,"syntology":null},{"url":null,"slug":"semopo-learning-high-quality-model-and-policy","title":"SeMOPO: Learning High-quality Model and Policy from Low-quality Offline Visual Datasets","date":"2024-06-13","arxiv_id":"2406.09486","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmenting-offline-rl-with-unlabeled-data","title":"Augmenting Offline RL with Unlabeled Data","date":"2024-06-11","arxiv_id":"2406.07117","repositories_listed":0,"syntology":null},{"url":null,"slug":"cdsa-conservative-denoising-score-based","title":"CDSA: Conservative Denoising Score-based Algorithm for Offline Reinforcement Learning","date":"2024-06-11","arxiv_id":"2406.07541","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-domain-knowledge-for-handling","title":"Integrating Domain Knowledge for handling Limited Data in Offline RL","date":"2024-06-11","arxiv_id":"2406.07041","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovering-multiple-solutions-from-a-single","title":"Discovering Multiple Solutions from a Single Task in Offline Reinforcement Learning","date":"2024-06-10","arxiv_id":"2406.05993","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-play-with-adversarial-critic-provable","title":"Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models","date":"2024-06-06","arxiv_id":"2406.04274","repositories_listed":0,"syntology":null},{"url":null,"slug":"udql-bridging-the-gap-between-mse-loss-and","title":"UDQL: Bridging The Gap between MSE Loss and The Optimal Value Function in Offline Reinforcement Learning","date":"2024-06-05","arxiv_id":"2406.03324","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-theory-of-learnability-for-offline-decision","title":"A Fast Convergence Theory for Offline Decision Making","date":"2024-06-03","arxiv_id":"2406.01378","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-prompting-model-based-offline","title":"Causal prompting model-based offline reinforcement learning","date":"2024-06-03","arxiv_id":"2406.01065","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-concave-utility-reinforcement","title":"Inverse Concave-Utility Reinforcement Learning is Inverse Game Theory","date":"2024-05-29","arxiv_id":"2405.19024","repositories_listed":0,"syntology":null},{"url":null,"slug":"preferred-action-optimized-diffusion-policies","title":"Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning","date":"2024-05-29","arxiv_id":"2405.18729","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-preference-optimization-augmenting","title":"Unified Preference Optimization: Language Model Alignment Beyond the Preference Frontier","date":"2024-05-28","arxiv_id":"2405.17956","repositories_listed":0,"syntology":null},{"url":null,"slug":"opera-automatic-offline-policy-evaluation","title":"OPERA: Automatic Offline Policy Evaluation with Re-weighted Aggregates of Multiple Estimators","date":"2024-05-27","arxiv_id":"2405.17708","repositories_listed":0,"syntology":null},{"url":null,"slug":"trajectory-data-suffices-for-statistically","title":"Trajectory Data Suffices for Statistically Efficient Learning in Offline RL with Linear $q^π$-Realizability and Concentrability","date":"2024-05-27","arxiv_id":"2405.16809","repositories_listed":0,"syntology":null},{"url":null,"slug":"exclusively-penalized-q-learning-for-offline","title":"Exclusively Penalized Q-learning for Offline Reinforcement Learning","date":"2024-05-23","arxiv_id":"2405.14082","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-rl-via-feature-occupancy-gradient","title":"Offline RL via Feature-Occupancy Gradient Ascent","date":"2024-05-22","arxiv_id":"2405.13755","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-imitation-learning-with","title":"Efficient Imitation Learning with Conservative World Models","date":"2024-05-21","arxiv_id":"2405.13193","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-robust-policy-enhancing-offline","title":"Towards Robust Policy: Enhancing Offline Reinforcement Learning with Adversarial Attacks and Defenses","date":"2024-05-18","arxiv_id":"2405.11206","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensemble-successor-representations-for-task","title":"Ensemble Successor Representations for Task Generalization in Offline-to-Online Reinforcement Learning","date":"2024-05-12","arxiv_id":"2405.07223","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-offline-reinforcement-learning-with","title":"Improving Offline Reinforcement Learning with Inaccurate Simulators","date":"2024-05-07","arxiv_id":"2405.04307","repositories_listed":0,"syntology":null},{"url":null,"slug":"out-of-distribution-adaptation-in-offline-rl","title":"Out-of-Distribution Adaptation in Offline RL: Counterfactual Reasoning via Causal Normalizing Flows","date":"2024-05-06","arxiv_id":"2405.03892","repositories_listed":0,"syntology":null},{"url":null,"slug":"robot-air-hockey-a-manipulation-testbed-for","title":"Robot Air Hockey: A Manipulation Testbed for Robot Learning with Reinforcement Learning","date":"2024-05-06","arxiv_id":"2405.03113","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalize-by-touching-tactile-ensemble-skill","title":"Generalize by Touching: Tactile Ensemble Skill Transfer for Robotic Furniture Assembly","date":"2024-04-26","arxiv_id":"2404.17684","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-8","title":"Offline Reinforcement Learning with Behavioral Supervisor Tuning","date":"2024-04-25","arxiv_id":"2404.16399","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-off-policy-reinforcement-learning","title":"An Offline Reinforcement Learning Algorithm Customized for Multi-Task Fusion in Large-Scale Recommender Systems","date":"2024-04-19","arxiv_id":"2404.17589","repositories_listed":0,"syntology":null},{"url":null,"slug":"single-task-continual-offline-reinforcement","title":"Data-Incremental Continual Offline Reinforcement Learning","date":"2024-04-19","arxiv_id":"2404.12639","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-trajectory-generalization-for-offline","title":"Offline Trajectory Generalization for Offline Reinforcement Learning","date":"2024-04-16","arxiv_id":"2404.10393","repositories_listed":0,"syntology":null},{"url":null,"slug":"empowering-embodied-visual-tracking-with","title":"Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL","date":"2024-04-15","arxiv_id":"2404.09857","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-probabilistic-planning-for","title":"Generative Probabilistic Planning for Optimizing Supply Chain Networks","date":"2024-04-11","arxiv_id":"2404.07511","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-domain-unlabeled-data-in-offline","title":"Leveraging Domain-Unlabeled Data in Offline Reinforcement Learning across Two Domains","date":"2024-04-11","arxiv_id":"2404.07465","repositories_listed":0,"syntology":null},{"url":null,"slug":"ctrl-sim-reactive-and-controllable-driving","title":"CtRL-Sim: Reactive and Controllable Driving Agents with Offline Reinforcement Learning","date":"2024-03-29","arxiv_id":"2403.19918","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-vision-and-language-navigation-with","title":"Scaling Vision-and-Language Navigation With Offline RL","date":"2024-03-27","arxiv_id":"2403.18454","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-distributional-offline","title":"Uncertainty-aware Distributional Offline Reinforcement Learning","date":"2024-03-26","arxiv_id":"2403.17646","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-recommender-2","title":"Reinforcement Learning-based Recommender Systems with Large Language Models for State Reward and Action Modeling","date":"2024-03-25","arxiv_id":"2403.16948","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-value-of-reward-lookahead-in","title":"The Value of Reward Lookahead in Reinforcement Learning","date":"2024-03-18","arxiv_id":"2403.11637","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-optimal-and-computationally-efficient","title":"Minimax Optimal and Computationally Efficient Algorithms for Distributionally Robust Offline Reinforcement Learning","date":"2024-03-14","arxiv_id":"2403.09621","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-optimizing-human-centric-objectives","title":"Towards Optimizing Human-Centric Objectives in AI-Assisted Decision-Making With Offline Reinforcement Learning","date":"2024-03-09","arxiv_id":"2403.05911","repositories_listed":0,"syntology":null},{"url":null,"slug":"why-online-reinforcement-learning-is-causal","title":"Why Online Reinforcement Learning is Causal","date":"2024-03-07","arxiv_id":"2403.04221","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-fictitious-self-play-for-competitive","title":"Offline Fictitious Self-Play for Competitive Games","date":"2024-02-29","arxiv_id":"2403.00841","repositories_listed":0,"syntology":null},{"url":null,"slug":"trajectory-wise-iterative-reinforcement","title":"Trajectory-wise Iterative Reinforcement Learning Framework for Auto-bidding","date":"2024-02-23","arxiv_id":"2402.15102","repositories_listed":0,"syntology":null},{"url":null,"slug":"align-your-intents-offline-imitation-learning","title":"Align Your Intents: Offline Imitation Learning via Optimal Transport","date":"2024-02-20","arxiv_id":"2402.13037","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-multi-task-transfer-rl-with","title":"Offline Multi-task Transfer RL with Representational Penalization","date":"2024-02-19","arxiv_id":"2402.12570","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-conditioned-offline-reinforcement-1","title":"Learning Goal-Conditioned Policies from Sub-Optimal Offline Data via Metric Learning","date":"2024-02-16","arxiv_id":"2402.10820","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-poisoning-attack-against-offline","title":"Universal Black-Box Reward Poisoning Attack against Offline Reinforcement Learning","date":"2024-02-15","arxiv_id":"2402.09695","repositories_listed":0,"syntology":null},{"url":null,"slug":"measurement-scheduling-for-icu-patients-with","title":"Measurement Scheduling for ICU Patients with Offline Reinforcement Learning","date":"2024-02-12","arxiv_id":"2402.07344","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-benefits-of-being-distributional-second","title":"More Benefits of Being Distributional: Second-Order Bounds for Reinforcement Learning","date":"2024-02-11","arxiv_id":"2402.07198","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-offline-reinforcement-learning-1","title":"Federated Offline Reinforcement Learning: Collaborative Single-Policy Coverage Suffices","date":"2024-02-08","arxiv_id":"2402.05876","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-actor-critic-reinforcement-learning","title":"Offline Actor-Critic Reinforcement Learning Scales to Large Models","date":"2024-02-08","arxiv_id":"2402.05546","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-world-fluid-directed-rigid-body-control","title":"Real-World Fluid Directed Rigid Body Control via Deep Reinforcement Learning","date":"2024-02-08","arxiv_id":"2402.06102","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-primal-dual-algorithm-for-offline","title":"A Primal-Dual Algorithm for Offline Constrained Reinforcement Learning with Linear MDPs","date":"2024-02-07","arxiv_id":"2402.04493","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-diffuser-planning-towards-high","title":"Contrastive Diffuser: Planning Towards High Return States via Contrastive Learning","date":"2024-02-05","arxiv_id":"2402.02772","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffstitch-boosting-offline-reinforcement","title":"DiffStitch: Boosting Offline Reinforcement Learning with Diffusion-based Trajectory Stitching","date":"2024-02-04","arxiv_id":"2402.02439","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-virtues-of-pessimism-in-inverse","title":"The Virtues of Pessimism in Inverse Reinforcement Learning","date":"2024-02-04","arxiv_id":"2402.02616","repositories_listed":0,"syntology":null},{"url":"/paper/value-aided-conditional-supervised-learning","slug":"value-aided-conditional-supervised-learning","title":"Adaptive $Q$-Aid for Conditional Supervised Learning in Offline Reinforcement Learning","date":"2024-02-03","arxiv_id":"2402.02017","repositories_listed":0,"syntology":{"n":5,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":5,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/value-aided-conditional-supervised-learning#ran","syntology_url":"https://syntology.ai/paper/2402.02017","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2402.02017"}},"official":null}},{"url":null,"slug":"context-former-stitching-via-latent","title":"Context-Former: Stitching via Latent Conditioned Sequence Modeling","date":"2024-01-29","arxiv_id":"2401.16452","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-object-navigation-in-real-environments","title":"Multi-Object Navigation in real environments using hybrid policies","date":"2024-01-24","arxiv_id":"2401.13800","repositories_listed":0,"syntology":null},{"url":null,"slug":"moma-model-based-mirror-ascent-for-offline","title":"MoMA: Model-based Mirror Ascent for Offline Reinforcement Learning","date":"2024-01-21","arxiv_id":"2401.11380","repositories_listed":0,"syntology":null},{"url":null,"slug":"harnessing-density-ratios-for-online","title":"Harnessing Density Ratios for Online Reinforcement Learning","date":"2024-01-18","arxiv_id":"2401.09681","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-continual-offline-reinforcement","title":"Solving Continual Offline Reinforcement Learning with Decision Transformer","date":"2024-01-16","arxiv_id":"2401.08478","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-model-rollouts-for-pessimistic","title":"Optimistic Model Rollouts for Pessimistic Offline Policy Optimization","date":"2024-01-11","arxiv_id":"2401.05899","repositories_listed":0,"syntology":null},{"url":null,"slug":"moto-offline-pre-training-to-online-fine","title":"MOTO: Offline Pre-training to Online Fine-tuning for Model-based Robot Learning","date":"2024-01-06","arxiv_id":"2401.03306","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-sample-efficient-offline-reinforcement-1","title":"On Sample-Efficient Offline Reinforcement Learning: Data Diversity, Posterior Sampling, and Beyond","date":"2024-01-06","arxiv_id":"2401.03301","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarially-trained-actor-critic-for-1","title":"Adversarially Trained Weighted Actor-Critic for Safe Offline Reinforcement Learning","date":"2024-01-01","arxiv_id":"2401.00629","repositories_listed":0,"syntology":null},{"url":null,"slug":"cudc-a-curiosity-driven-unsupervised-data","title":"CUDC: A Curiosity-Driven Unsupervised Data Collection Method with Adaptive Temporal Distances for Offline Reinforcement Learning","date":"2023-12-19","arxiv_id":"2312.12191","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-network-approximation-for-pessimistic","title":"Neural Network Approximation for Pessimistic Offline Reinforcement Learning","date":"2023-12-19","arxiv_id":"2312.11863","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-ran-slicing-with-offline","title":"Advancing RAN Slicing with Offline Reinforcement Learning","date":"2023-12-16","arxiv_id":"2312.10547","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-epistemic-variance-of-values-for","title":"Model-Based Epistemic Variance of Values for Risk-Aware Policy Optimization","date":"2023-12-07","arxiv_id":"2312.04386","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffused-task-agnostic-milestone-planner-1","title":"Diffused Task-Agnostic Milestone Planner","date":"2023-12-06","arxiv_id":"2312.03395","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluation-of-active-feature-acquisition-1","title":"Evaluation of Active Feature Acquisition Methods for Static Feature Settings","date":"2023-12-06","arxiv_id":"2312.03619","repositories_listed":0,"syntology":null},{"url":null,"slug":"h-gap-humanoid-control-with-a-generalist","title":"H-GAP: Humanoid Control with a Generalist Planner","date":"2023-12-05","arxiv_id":"2312.02682","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-inverse-reinforcement-learning-harder-than","title":"Is Inverse Reinforcement Learning Harder than Standard Reinforcement Learning? A Theoretical Perspective","date":"2023-11-29","arxiv_id":"2312.00054","repositories_listed":0,"syntology":null}],"record_sha256":"5130a821b1cc4059fa43d201aa8327759614a4257019d6cf46085cf3d41097cc","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}