{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/off-policy-evaluation/papers/2","list_of":"/task/off-policy-evaluation","task":"Off-policy evaluation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":3,"rows_per_page":100,"rows":[101,200],"of":265,"counts":{"archive_papers_tagged":265,"with_a_code_link":102,"where_syntology_ran_a_sample":40,"not_listed_spam_title":0,"listed":265,"listed_where_code_ran":40,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":30,"every_run_a_failure_of_syntologys_instrument":10,"listed_with_a_run_with_no_instrument_failure":30,"listed_every_run_a_failure_of_syntologys_instrument":10,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/off-policy-evaluation","prev":"/task/off-policy-evaluation","next":"/task/off-policy-evaluation/papers/3","papers":[{"url":"/paper/more-robust-doubly-robust-off-policy","slug":"more-robust-doubly-robust-off-policy","title":"More Robust Doubly Robust Off-policy Evaluation","date":"2018-02-10","arxiv_id":"1802.03493","repositories_listed":1,"syntology":null},{"url":"/paper/off-policy-evaluation-for-slate","slug":"off-policy-evaluation-for-slate","title":"Off-policy evaluation for slate recommendation","date":"2016-05-16","arxiv_id":"1605.04812","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/off-policy-evaluation-for-slate#ran","syntology_url":"https://syntology.ai/paper/1605.04812","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1605.04812"}},"official":{"repos":["adith387/slates_semisynth_expts"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":null,"slug":"off-policy-evaluation-and-learning-for-the","title":"Off-Policy Evaluation and Learning for the Future under Non-Stationarity","date":"2025-06-25","arxiv_id":"2506.20417","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-principled-path-to-fitted-distributional","title":"A Principled Path to Fitted Distributional Evaluation","date":"2025-06-24","arxiv_id":"2506.20048","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-gradient-dice-for-offline-constrained","title":"Semi-gradient DICE for Offline Constrained Reinforcement Learning","date":"2025-06-10","arxiv_id":"2506.08644","repositories_listed":0,"syntology":null},{"url":null,"slug":"stitch-ope-trajectory-stitching-with-guided","title":"STITCH-OPE: Trajectory Stitching with Guided Diffusion for Off-Policy Evaluation","date":"2025-05-27","arxiv_id":"2505.20781","repositories_listed":0,"syntology":null},{"url":null,"slug":"characterization-of-efficient-influence","title":"Characterization of Efficient Influence Function for Off-Policy Evaluation Under Optimal Policies","date":"2025-05-20","arxiv_id":"2505.13809","repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-temporal-difference-learning-via","title":"Stabilizing Temporal Difference Learning via Implicit Stochastic Recursion","date":"2025-05-02","arxiv_id":"2505.01361","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-for-sequential","title":"Off-Policy Evaluation for Sequential Persuasion Process with Unobserved Confounding","date":"2025-04-01","arxiv_id":"2504.01211","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-offline-model-based-rl-via-active","title":"Enhancing Offline Model-Based RL via Active Model Selection: A Bayesian Optimization Perspective","date":"2025-02-17","arxiv_id":"2502.11480","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-for-recommendations","title":"Off-Policy Evaluation for Recommendations with Missing-Not-At-Random Rewards","date":"2025-02-13","arxiv_id":"2502.08993","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-selection-for-off-policy-evaluation-new","title":"Model Selection for Off-policy Evaluation: New Algorithms and Experimental Protocol","date":"2025-02-11","arxiv_id":"2502.08021","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-for-payments-at-adyen","title":"Off-policy Evaluation for Payments at Adyen","date":"2025-01-15","arxiv_id":"2501.10470","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-and-counterfactual","title":"Off-Policy Evaluation and Counterfactual Methods in Dynamic Auction Environments","date":"2025-01-09","arxiv_id":"2501.05278","repositories_listed":0,"syntology":null},{"url":null,"slug":"candor-counterfactual-annotated-doubly-robust","title":"CANDOR: Counterfactual ANnotated DOubly Robust Off-Policy Evaluation","date":"2024-12-11","arxiv_id":"2412.08052","repositories_listed":0,"syntology":null},{"url":null,"slug":"concept-driven-off-policy-evaluation","title":"Concept-driven Off Policy Evaluation","date":"2024-11-28","arxiv_id":"2411.19395","repositories_listed":0,"syntology":null},{"url":null,"slug":"logarithmic-neyman-regret-for-adaptive","title":"Logarithmic Neyman Regret for Adaptive Estimation of the Average Treatment Effect","date":"2024-11-21","arxiv_id":"2411.14341","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-estimation-with-adaptively","title":"Off-policy estimation with adaptively collected data: the power of online learning","date":"2024-11-19","arxiv_id":"2411.12786","repositories_listed":0,"syntology":null},{"url":null,"slug":"primal-dual-spectral-representation-for-off","title":"Primal-Dual Spectral Representation for Off-policy Evaluation","date":"2024-10-23","arxiv_id":"2410.17538","repositories_listed":0,"syntology":null},{"url":null,"slug":"development-and-validation-of-heparin-dosing","title":"Development and Validation of Heparin Dosing Policies Using an Offline Reinforcement Learning Algorithm","date":"2024-09-24","arxiv_id":"2409.15753","repositories_listed":0,"syntology":null},{"url":null,"slug":"designing-an-interpretable-interface-for","title":"Designing an Interpretable Interface for Contextual Bandits","date":"2024-09-23","arxiv_id":"2409.15143","repositories_listed":0,"syntology":null},{"url":null,"slug":"limit-order-book-simulation-and-trade","title":"Limit Order Book Simulation and Trade Evaluation with $K$-Nearest-Neighbor Resampling","date":"2024-09-10","arxiv_id":"2409.06514","repositories_listed":0,"syntology":null},{"url":null,"slug":"intope-off-policy-evaluation-in-the-presence","title":"IntOPE: Off-Policy Evaluation in the Presence of Interference","date":"2024-08-24","arxiv_id":"2408.13484","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-off-policy-evaluation-and-learning","title":"Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits","date":"2024-08-20","arxiv_id":"2408.11202","repositories_listed":0,"syntology":null},{"url":null,"slug":"empowering-clinicians-with-medical-decision","title":"Empowering Clinicians with Medical Decision Transformers: A Framework for Sepsis Treatment","date":"2024-07-28","arxiv_id":"2407.19380","repositories_listed":0,"syntology":null},{"url":null,"slug":"balancing-immediate-revenue-and-future-off","title":"Balancing Immediate Revenue and Future Off-Policy Evaluation in Coupon Allocation","date":"2024-07-06","arxiv_id":"2407.11039","repositories_listed":0,"syntology":null},{"url":null,"slug":"autoope-automated-off-policy-estimator","title":"Automated Off-Policy Estimator Selection via Supervised Learning","date":"2024-06-26","arxiv_id":"2406.18022","repositories_listed":0,"syntology":null},{"url":null,"slug":"confident-natural-policy-gradient-for-local","title":"Confident Natural Policy Gradient for Local Planning in $q_π$-realizable Constrained MDPs","date":"2024-06-26","arxiv_id":"2406.18529","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-from-logged-human","title":"Off-Policy Evaluation from Logged Human Feedback","date":"2024-06-14","arxiv_id":"2406.10030","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-theory-of-learnability-for-offline-decision","title":"A Fast Convergence Theory for Offline Decision Making","date":"2024-06-03","arxiv_id":"2406.01378","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-in-latent-mdps-is-tractable-online","title":"RL in Latent MDPs is Tractable: Online Guarantees via Off-Policy Evaluation","date":"2024-06-03","arxiv_id":"2406.01389","repositories_listed":0,"syntology":null},{"url":null,"slug":"opera-automatic-offline-policy-evaluation","title":"OPERA: Automatic Offline Policy Evaluation with Re-weighted Aggregates of Multiple Estimators","date":"2024-05-27","arxiv_id":"2405.17708","repositories_listed":0,"syntology":null},{"url":"/paper/hyperparameter-optimization-can-even-be","slug":"hyperparameter-optimization-can-even-be","title":"Hyperparameter Optimization Can Even be Harmful in Off-Policy Learning and How to Deal with It","date":"2024-04-23","arxiv_id":"2404.15084","repositories_listed":0,"syntology":{"n":9,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":5,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 5 unverified","sample_list":"/paper/hyperparameter-optimization-can-even-be#ran","syntology_url":"https://syntology.ai/paper/2404.15084","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2404.15084"}},"official":null}},{"url":null,"slug":"data-poisoning-attacks-on-off-policy-policy","title":"Data Poisoning Attacks on Off-Policy Policy Evaluation Methods","date":"2024-04-06","arxiv_id":"2404.04714","repositories_listed":0,"syntology":null},{"url":null,"slug":"methodology-for-interpretable-reinforcement","title":"Methodology for Interpretable Reinforcement Learning for Optimizing Mechanical Ventilation","date":"2024-04-03","arxiv_id":"2404.03105","repositories_listed":0,"syntology":null},{"url":null,"slug":"doubly-robust-off-policy-evaluation-with-1","title":"Doubly-Robust Off-Policy Evaluation with Estimated Logging Policy","date":"2024-04-02","arxiv_id":"2404.01830","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-cram-method-for-efficient-simultaneous","title":"Cramming Contextual Bandits for On-policy Statistical Evaluation","date":"2024-03-11","arxiv_id":"2403.07031","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-off-policy-evaluation-and-learning","title":"Bayesian Off-Policy Evaluation and Learning for Large Action Spaces","date":"2024-02-22","arxiv_id":"2402.14664","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-curses-of-future-and-history-in-future","title":"On the Curses of Future and History in Future-dependent Value Functions for Off-policy Evaluation","date":"2024-02-22","arxiv_id":"2402.14703","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-in-markov-decision","title":"Off-Policy Evaluation in Markov Decision Processes under Weak Distributional Overlap","date":"2024-02-13","arxiv_id":"2402.08201","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-offline-policy-ranking-with","title":"Probabilistic Offline Policy Ranking with Approximate Bayesian Computation","date":"2023-12-17","arxiv_id":"2312.11551","repositories_listed":0,"syntology":null},{"url":null,"slug":"unbiased-offline-evaluation-for-learning-to","title":"Unbiased Offline Evaluation for Learning to Rank with Business Rules","date":"2023-11-03","arxiv_id":"2311.01828","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-for-large-action-spaces-2","title":"Off-Policy Evaluation for Large Action Spaces via Policy Convolution","date":"2023-10-24","arxiv_id":"2310.15433","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-complexity-of-preference-based","title":"Sample Complexity of Preference-Based Nonparametric Off-Policy Evaluation with Deep Networks","date":"2023-10-16","arxiv_id":"2310.10556","repositories_listed":0,"syntology":null},{"url":null,"slug":"mir2-towards-provably-robust-multi-agent","title":"Robust Multi-Agent Reinforcement Learning by Mutual Information Regularization","date":"2023-10-15","arxiv_id":"2310.09833","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-for-human-feedback","title":"Off-Policy Evaluation for Human Feedback","date":"2023-10-11","arxiv_id":"2310.07123","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-shift-aware-off-policy","title":"Distributional Shift-Aware Off-Policy Interval Estimation: A Unified Error Quantification Framework","date":"2023-09-23","arxiv_id":"2309.13278","repositories_listed":0,"syntology":null},{"url":null,"slug":"wasserstein-distributionally-robust-policy","title":"Wasserstein Distributionally Robust Policy Evaluation and Learning for Contextual Bandits","date":"2023-09-15","arxiv_id":"2309.08748","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistically-efficient-variance-reduction","title":"Statistically Efficient Variance Reduction with Double Policy Estimation for Off-Policy Evaluation in Sequence-Modeled Reinforcement Learning","date":"2023-08-28","arxiv_id":"2308.14897","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-optimal-approximation-factors-in","title":"The Optimal Approximation Factors in Misspecified Off-Policy Value Function Estimation","date":"2023-07-25","arxiv_id":"2307.13332","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-and-safe-remediation-of-defective","title":"Scalable and Safe Remediation of Defective Actions in Self-Learning Conversational Systems","date":"2023-05-17","arxiv_id":"2305.10528","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-for-large-action-spaces-1","title":"Off-Policy Evaluation for Large Action Spaces via Conjunct Effect Modeling","date":"2023-05-14","arxiv_id":"2305.08062","repositories_listed":0,"syntology":null},{"url":null,"slug":"conformal-off-policy-evaluation-in-markov","title":"Conformal Off-Policy Evaluation in Markov Decision Processes","date":"2023-04-05","arxiv_id":"2304.02574","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-sample-complexity-of-vanilla-model","title":"On the Sample Complexity of Vanilla Model-Based Offline Reinforcement Learning with Dependent Samples","date":"2023-03-07","arxiv_id":"2303.04268","repositories_listed":0,"syntology":null},{"url":null,"slug":"hope-human-centric-off-policy-evaluation-for","title":"HOPE: Human-Centric Off-Policy Evaluation for E-Learning and Healthcare","date":"2023-02-18","arxiv_id":"2302.09212","repositories_listed":0,"syntology":null},{"url":null,"slug":"singularity-aware-reinforcement-learning","title":"STEEL: Singularity-aware Reinforcement Learning","date":"2023-01-30","arxiv_id":"2301.13152","repositories_listed":0,"syntology":null},{"url":null,"slug":"inference-on-time-series-nonparametric","title":"Inference on Time Series Nonparametric Conditional Moment Restrictions Using General Sieves","date":"2022-12-31","arxiv_id":"2301.00092","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-instrumental-variable-approach-to","title":"An Instrumental Variable Approach to Confounded Off-Policy Evaluation","date":"2022-12-29","arxiv_id":"2212.14468","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantile-off-policy-evaluation-via-deep","title":"Quantile Off-Policy Evaluation via Deep Conditional Generative Learning","date":"2022-12-29","arxiv_id":"2212.14466","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-for-human","title":"Offline Reinforcement Learning for Human-Guided Human-Machine Interaction with Private Information","date":"2022-12-23","arxiv_id":"2212.12167","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-evaluation-for-offline-learning-are-we","title":"Safe Evaluation For Offline Learning: Are We Ready To Deploy?","date":"2022-12-16","arxiv_id":"2212.08302","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-marginalized-importance-sampling-to","title":"Scaling Marginalized Importance Sampling to High-Dimensional State-Spaces via State Abstraction","date":"2022-12-14","arxiv_id":"2212.07486","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-off-policy-evaluation-in","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","date":"2022-12-13","arxiv_id":"2212.06355","repositories_listed":0,"syntology":null},{"url":null,"slug":"counterfactual-learning-with-general-data","title":"Counterfactual Learning with General Data-generating Policies","date":"2022-12-04","arxiv_id":"2212.01925","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-policy-evaluation-and-optimization","title":"Offline Policy Evaluation and Optimization under Confounding","date":"2022-11-29","arxiv_id":"2211.16583","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-counterfactual-mean-embeddings-and","title":"Bayesian Counterfactual Mean Embeddings and Off-Policy Evaluation","date":"2022-11-02","arxiv_id":"2211.01518","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-the-return-off-policy-function","title":"Beyond the Return: Off-policy Function Estimation under User-specified Error-measuring Distributions","date":"2022-10-27","arxiv_id":"2210.15543","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-for-learning-to-rank","title":"Off-policy evaluation for learning-to-rank via interpolating the item-position model and the position-based model","date":"2022-10-15","arxiv_id":"2210.09512","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-for-episodic-partially","title":"Off-Policy Evaluation for Episodic Partially Observable Markov Decision Processes under Non-Parametric Models","date":"2022-09-21","arxiv_id":"2209.10064","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-robust-off-policy-evaluation-via","title":"Towards Robust Off-Policy Evaluation via Human Inputs","date":"2022-09-18","arxiv_id":"2209.08682","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-unified-policy-abstraction-theory","title":"Towards A Unified Policy Abstraction Theory and Representation Learning Approach in Markov Decision Processes","date":"2022-09-16","arxiv_id":"2209.07696","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-estimation-of-confounded-linear","title":"Statistical Estimation of Confounded Linear MDPs: An Instrumental Variable Approach","date":"2022-09-12","arxiv_id":"2209.05186","repositories_listed":0,"syntology":null},{"url":null,"slug":"conformal-off-policy-prediction-in-contextual","title":"Conformal Off-Policy Prediction in Contextual Bandits","date":"2022-06-09","arxiv_id":"2206.04405","repositories_listed":0,"syntology":null},{"url":null,"slug":"markovian-interference-in-experiments","title":"Markovian Interference in Experiments","date":"2022-06-06","arxiv_id":"2206.02371","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-complexity-of-nonparametric-off-policy","title":"Sample Complexity of Nonparametric Off-Policy Evaluation on Low-Dimensional Manifolds using Deep Networks","date":"2022-06-06","arxiv_id":"2206.02887","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-value-estimation-for-off-policy","title":"Hybrid Value Estimation for Off-policy Evaluation and Offline Reinforcement Learning","date":"2022-06-04","arxiv_id":"2206.02000","repositories_listed":0,"syntology":null},{"url":null,"slug":"counterfactual-analysis-in-dynamic-models","title":"Counterfactual Analysis in Dynamic Latent State Models","date":"2022-05-27","arxiv_id":"2205.13832","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-and-robust-self-learning-for-skill","title":"Scalable and Robust Self-Learning for Skill Routing in Large-Scale Conversational AI Systems","date":"2022-04-14","arxiv_id":"2204.07135","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-and-transferring-value-function-for","title":"Off-Policy Evaluation with Online Adaptation for Robot Exploration in Challenging Environments","date":"2022-04-07","arxiv_id":"2204.03140","repositories_listed":0,"syntology":null},{"url":null,"slug":"marginalized-operators-for-off-policy","title":"Marginalized Operators for Off-policy Reinforcement Learning","date":"2022-03-30","arxiv_id":"2203.16177","repositories_listed":0,"syntology":null},{"url":null,"slug":"bellman-residual-orthogonalization-for","title":"Bellman Residual Orthogonalization for Offline Reinforcement Learning","date":"2022-03-24","arxiv_id":"2203.12786","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-in-embedded-spaces","title":"Off-Policy Evaluation in Embedded Spaces","date":"2022-03-05","arxiv_id":"2203.02807","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-with-policy-dependent","title":"Off-Policy Evaluation with Policy-Dependent Optimization Response","date":"2022-02-25","arxiv_id":"2202.12958","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-fitted-q-evaluation-with","title":"Off-Policy Fitted Q-Evaluation with Differentiable Function Approximators: Z-Estimation and Inference Theory","date":"2022-02-10","arxiv_id":"2202.04970","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalizing-off-policy-evaluation-from-a","title":"Generalizing Off-Policy Evaluation From a Causal Perspective For Sequential Decision-Making","date":"2022-01-20","arxiv_id":"2201.08262","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-well-posedness-and-minimax-optimal-rates","title":"On Well-posedness and Minimax Optimal Rates of Nonparametric Q-function Estimation in Off-policy Evaluation","date":"2022-01-17","arxiv_id":"2201.06169","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-discharge-of-patients-from-intensive","title":"Optimal discharge of patients from intensive care via a data-driven policy learning framework","date":"2021-12-17","arxiv_id":"2112.09315","repositories_listed":0,"syntology":null},{"url":null,"slug":"weighted-model-estimation-for-offline-model","title":"Weighted model estimation for offline model-based reinforcement learning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"loss-functions-for-discrete-contextual","title":"Loss Functions for Discrete Contextual Pricing with Observational Data","date":"2021-11-18","arxiv_id":"2111.09933","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-in-partially-observed","title":"Off-Policy Evaluation in Partially Observed Markov Decision Processes under Sequential Ignorability","date":"2021-10-24","arxiv_id":"2110.12343","repositories_listed":0,"syntology":null},{"url":null,"slug":"stateful-offline-contextual-policy-evaluation","title":"Stateful Offline Contextual Policy Evaluation and Learning","date":"2021-10-19","arxiv_id":"2110.10081","repositories_listed":0,"syntology":null},{"url":null,"slug":"why-should-i-trust-you-bellman-evaluating-the","title":"Why Should I Trust You, Bellman? Evaluating the Bellman Objective with Off-Policy Data","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-spectral-approach-to-off-policy-evaluation","title":"A Spectral Approach to Off-Policy Evaluation for POMDPs","date":"2021-09-22","arxiv_id":"2109.10502","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-offline-reinforcement-learning","title":"Accelerating Offline Reinforcement Learning Application in Real-Time Bidding and Recommendation: Potential Use of Simulation","date":"2021-09-17","arxiv_id":"2109.08331","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-off-policy-estimator-selection-an","title":"Data-Driven Off-Policy Estimator Selection: An Application in User Marketing on An Online Content Delivery Service","date":"2021-09-17","arxiv_id":"2109.08621","repositories_listed":0,"syntology":null},{"url":null,"slug":"debiasing-samples-from-online-learning-using","title":"Debiasing Samples from Online Learning Using Bootstrap","date":"2021-07-31","arxiv_id":"2108.00236","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-learning-for-recommendations-at","title":"Online Learning for Recommendations at Grubhub","date":"2021-07-15","arxiv_id":"2107.07106","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-off-policy-evaluation-approach-for","title":"A Unified Off-Policy Evaluation Approach for General Value Function","date":"2021-07-06","arxiv_id":"2107.02711","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-aware-off-policy-evaluation-with","title":"Variance-Aware Off-Policy Evaluation with Linear Function Approximation","date":"2021-06-22","arxiv_id":"2106.11960","repositories_listed":0,"syntology":null},{"url":null,"slug":"autoregressive-dynamics-models-for-offline-1","title":"Autoregressive Dynamics Models for Offline Policy Evaluation and Optimization","date":"2021-04-28","arxiv_id":"2104.13877","repositories_listed":0,"syntology":null}],"record_sha256":"5579a018539e496ce9a95bae474fec005ceef002a8a4bfb6d8cda8ac6933ca7b","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}