{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/off-policy-evaluation/papers/3","list_of":"/task/off-policy-evaluation","task":"Off-policy evaluation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":3,"rows_per_page":100,"rows":[201,265],"of":265,"counts":{"archive_papers_tagged":265,"with_a_code_link":102,"where_syntology_ran_a_sample":40,"not_listed_spam_title":0,"listed":265,"listed_where_code_ran":40,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":30,"every_run_a_failure_of_syntologys_instrument":10,"listed_with_a_run_with_no_instrument_failure":30,"listed_every_run_a_failure_of_syntologys_instrument":10,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/off-policy-evaluation","prev":"/task/off-policy-evaluation/papers/2","next":null,"papers":[{"url":null,"slug":"discovering-an-aid-policy-to-minimize-student","title":"Discovering an Aid Policy to Minimize Student Evasion Using Offline Reinforcement Learning","date":"2021-04-20","arxiv_id":"2104.10258","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-risk-assessment-in-contextual","title":"Off-Policy Risk Assessment in Contextual Bandits","date":"2021-04-18","arxiv_id":"2104.08977","repositories_listed":0,"syntology":null},{"url":null,"slug":"infinite-horizon-offline-reinforcement","title":"Infinite-Horizon Offline Reinforcement Learning with Linear Function Approximation: Curse of Dimensionality and Algorithm","date":"2021-03-17","arxiv_id":"2103.09847","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-asymptotic-confidence-intervals-of-off-1","title":"Non-asymptotic Confidence Intervals of Off-policy Evaluation: Primal and Dual Bounds","date":"2021-03-09","arxiv_id":"2103.05741","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-model-learning","title":"Minimax Model Learning","date":"2021-03-02","arxiv_id":"2103.02084","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-confidence-sequences","title":"Off-policy Confidence Sequences","date":"2021-02-18","arxiv_id":"2102.09540","repositories_listed":0,"syntology":null},{"url":null,"slug":"bootstrapping-statistical-inference-for-off","title":"Bootstrapping Fitted Q-Evaluation for Off-Policy Inference","date":"2021-02-06","arxiv_id":"2102.03607","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-analysis-of-minimax-offline","title":"Finite Sample Analysis of Minimax Offline Reinforcement Learning: Completeness, Fast Rates and First-Order Efficiency","date":"2021-02-05","arxiv_id":"2102.02981","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-off-policy-evaluation-for-multi-armed","title":"Minimax Off-Policy Evaluation for Multi-Armed Bandits","date":"2021-01-19","arxiv_id":"2101.07781","repositories_listed":0,"syntology":null},{"url":null,"slug":"smoothed-functional-based-gradient-algorithms","title":"Smoothed functional-based gradient algorithms for off-policy reinforcement learning: A non-asymptotic viewpoint","date":"2021-01-06","arxiv_id":"2101.02137","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-of-slate-policies-under","title":"Off-Policy Evaluation of Slate Policies under Bayes Risk","date":"2021-01-05","arxiv_id":"2101.02553","repositories_listed":0,"syntology":null},{"url":null,"slug":"practical-marginalized-importance-sampling","title":"Practical Marginalized Importance Sampling with the Successor Representation","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-mixture-weights-for-off-policy","title":"Optimal Mixture Weights for Off-Policy Evaluation with Multiple Behavior Policies","date":"2020-11-29","arxiv_id":"2011.14359","repositories_listed":0,"syntology":null},{"url":null,"slug":"reliable-off-policy-evaluation-for","title":"Reliable Off-policy Evaluation for Reinforcement Learning","date":"2020-11-08","arxiv_id":"2011.04102","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-interval-estimation-with-lipschitz","title":"Off-Policy Interval Estimation with Lipschitz Value Iteration","date":"2020-10-29","arxiv_id":"2010.15392","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-practical-guide-of-off-policy-evaluation","title":"A Practical Guide of Off-Policy Evaluation for Bandit Problems","date":"2020-10-23","arxiv_id":"2010.12470","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-of-bandit-algorithm","title":"Off-Policy Evaluation of Bandit Algorithm from Dependent Samples under Batch Update Policy","date":"2020-10-23","arxiv_id":"2010.13554","repositories_listed":0,"syntology":null},{"url":null,"slug":"coindice-off-policy-confidence-interval","title":"CoinDICE: Off-Policy Confidence Interval Estimation","date":"2020-10-22","arxiv_id":"2010.11652","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-jump-q-evaluation-for-offline-policy","title":"Deep Jump Q-Evaluation for Offline Policy Evaluation in Continuous Action Space","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"accountable-off-policy-evaluation-with-kernel","title":"Accountable Off-Policy Evaluation With Kernel Bellman Statistics","date":"2020-08-15","arxiv_id":"2008.06668","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-in-infinite-horizon","title":"Off-policy Evaluation in Infinite-Horizon Reinforcement Learning with Latent Confounders","date":"2020-07-27","arxiv_id":"2007.13893","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-bootstrapping-for-uncertainty","title":"Statistical Bootstrapping for Uncertainty Estimation in Off-Policy Evaluation","date":"2020-07-27","arxiv_id":"2007.13609","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-via-the-regularized","title":"Off-Policy Evaluation via the Regularized Lagrangian","date":"2020-07-07","arxiv_id":"2007.03438","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-exploitability-evaluation-and","title":"Off-Policy Exploitability-Evaluation in Two-Player Zero-Sum Markov Games","date":"2020-07-04","arxiv_id":"2007.02141","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-maximum-entropy-approach-to-off-policy","title":"A maximum-entropy approach to off-policy evaluation in average-reward MDPs","date":"2020-06-17","arxiv_id":"2006.12620","repositories_listed":0,"syntology":null},{"url":null,"slug":"confidence-interval-for-off-policy-evaluation","title":"Confidence Interval for Off-Policy Evaluation from Dependent Samples via Bandit Algorithm: Approach from Standardized Martingales","date":"2020-06-12","arxiv_id":"2006.06982","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-evaluation-of-natural-stochastic","title":"Efficient Evaluation of Natural Stochastic Policies in Offline Reinforcement Learning","date":"2020-06-06","arxiv_id":"2006.03886","repositories_listed":0,"syntology":null},{"url":null,"slug":"causality-and-batch-reinforcement-learning","title":"Causality and Batch Reinforcement Learning: Complementary Approaches To Planning In Unknown Domains","date":"2020-06-03","arxiv_id":"2006.02579","repositories_listed":0,"syntology":null},{"url":"/paper/taylor-expansion-policy-optimization","slug":"taylor-expansion-policy-optimization","title":"Taylor Expansion Policy Optimization","date":"2020-03-13","arxiv_id":"2003.06259","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-optimal-off-policy-evaluation-with","title":"Minimax-Optimal Off-Policy Evaluation with Linear Function Approximation","date":"2020-02-21","arxiv_id":"2002.09516","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-counterfactual-reinforcement-learning","title":"Debiased Off-Policy Evaluation for Recommendation Systems","date":"2020-02-20","arxiv_id":"2002.08536","repositories_listed":0,"syntology":null},{"url":null,"slug":"doubledebiased-machine-learning-for-dynamic","title":"Double/Debiased Machine Learning for Dynamic Treatment Effects via g-Estimation","date":"2020-02-17","arxiv_id":"2002.07285","repositories_listed":0,"syntology":null},{"url":null,"slug":"confounding-robust-policy-evaluation-in","title":"Confounding-Robust Policy Evaluation in Infinite-Horizon Reinforcement Learning","date":"2020-02-11","arxiv_id":"2002.04518","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-off-policy-evaluation-in","title":"Interpretable Off-Policy Evaluation in Reinforcement Learning by Highlighting Influential Transitions","date":"2020-02-10","arxiv_id":"2002.03478","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-confidence-interval-for-off-policy","title":"Minimax Value Interval for Off-Policy Evaluation and Policy Optimization","date":"2020-02-06","arxiv_id":"2002.02081","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotically-efficient-off-policy","title":"Asymptotically Efficient Off-Policy Evaluation for Tabular Reinforcement Learning","date":"2020-01-29","arxiv_id":"2001.10742","repositories_listed":0,"syntology":null},{"url":null,"slug":"accountable-off-policy-evaluation-via-a","title":"Accountable Off-Policy Evaluation via a Kernelized Bellman Statistics","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"double-reinforcement-learning-for-efficient-1","title":"Double Reinforcement Learning for Efficient and Robust Off-Policy Evaluation","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"more-efficient-off-policy-evaluation-through","title":"More Efficient Off-Policy Evaluation through Regularized Targeted Learning","date":"2019-12-13","arxiv_id":"1912.06292","repositories_listed":0,"syntology":null},{"url":null,"slug":"triply-robust-off-policy-evaluation","title":"Triply Robust Off-Policy Evaluation","date":"2019-11-13","arxiv_id":"1911.05811","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-weight-and-q-function-learning-for","title":"Minimax Weight and Q-Function Learning for Off-Policy Evaluation","date":"2019-10-28","arxiv_id":"1910.12809","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-trade-offs-in-off-policy-learning","title":"Adaptive Trade-Offs in Off-Policy Learning","date":"2019-10-16","arxiv_id":"1910.07478","repositories_listed":0,"syntology":null},{"url":null,"slug":"doubly-robust-bias-reduction-in-infinite","title":"Doubly Robust Bias Reduction in Infinite Horizon Off-Policy Estimation","date":"2019-10-16","arxiv_id":"1910.07186","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-curse-of-horizon-in-off","title":"Understanding the Curse of Horizon in Off-Policy Evaluation via Conditional Importance Sampling","date":"2019-10-15","arxiv_id":"1910.06508","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficiently-breaking-the-curse-of-horizon","title":"Efficiently Breaking the Curse of Horizon in Off-Policy Evaluation with Double Reinforcement Learning","date":"2019-09-12","arxiv_id":"1909.05850","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-in-partially-observable","title":"Off-Policy Evaluation in Partially Observable Environments","date":"2019-09-09","arxiv_id":"1909.03739","repositories_listed":0,"syntology":null},{"url":null,"slug":"efron-stein-pac-bayesian-inequalities","title":"Efron-Stein PAC-Bayesian Inequalities","date":"2019-09-04","arxiv_id":"1909.01931","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-selection-policies-for-multitask","title":"Task Selection Policies for Multitask Learning","date":"2019-07-14","arxiv_id":"1907.06214","repositories_listed":0,"syntology":null},{"url":null,"slug":"expected-sarsa-with-control-variate-for","title":"Expected Sarsa($λ$) with Control Variate for Variance Reduction","date":"2019-06-25","arxiv_id":"1906.11058","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-off-policy-evaluation-for","title":"Towards Optimal Off-Policy Evaluation for Reinforcement Learning with Marginalized Importance Sampling","date":"2019-06-08","arxiv_id":"1906.03393","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-via-off-policy","title":"Off-Policy Evaluation via Off-Policy Classification","date":"2019-06-04","arxiv_id":"1906.01624","repositories_listed":0,"syntology":null},{"url":null,"slug":"defining-admissible-rewards-for-high","title":"Defining Admissible Rewards for High Confidence Policy Evaluation","date":"2019-05-30","arxiv_id":"1905.13167","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-parametric-and-nonparametric-models","title":"Combining Parametric and Nonparametric Models for Off-Policy Evaluation","date":"2019-05-14","arxiv_id":"1905.05787","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-preserving-off-policy-evaluation","title":"Privacy Preserving Off-Policy Evaluation","date":"2019-02-01","arxiv_id":"1902.00174","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-of-probabilistic","title":"Off-Policy Evaluation of Probabilistic Identity Data in Lookalike Modeling","date":"2019-01-04","arxiv_id":"1901.05560","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-comparison-of-ranking-functions-using","title":"Offline Comparison of Ranking Functions using Randomized Data","date":"2018-10-11","arxiv_id":"1810.05252","repositories_listed":0,"syntology":null},{"url":"/paper/efficient-counterfactual-learning-from-bandit","slug":"efficient-counterfactual-learning-from-bandit","title":"Efficient Counterfactual Learning from Bandit Feedback","date":"2018-09-10","arxiv_id":"1809.03084","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-and-learning-from","title":"Off-Policy Evaluation and Learning from Logged Bandit Feedback: Error Reduction via Surrogate Policy","date":"2018-08-01","arxiv_id":"1808.00232","repositories_listed":0,"syntology":null},{"url":null,"slug":"consistent-on-line-off-policy-evaluation","title":"Consistent On-Line Off-Policy Evaluation","date":"2017-02-23","arxiv_id":"1702.07121","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-validation-of-counterfactual","title":"Large-scale Validation of Counterfactual Learning Methods: A Test-Bed","date":"2016-12-01","arxiv_id":"1612.00367","repositories_listed":0,"syntology":null},{"url":null,"slug":"bootstrapping-with-models-confidence","title":"Bootstrapping with Models: Confidence Intervals for Off-Policy Evaluation","date":"2016-06-20","arxiv_id":"1606.06126","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-emphatic-temporal-difference","title":"Generalized Emphatic Temporal Difference Learning: Bias-Variance Analysis","date":"2015-09-17","arxiv_id":"1509.05172","repositories_listed":0,"syntology":null},{"url":null,"slug":"emphatic-td-bellman-operator-is-a-contraction","title":"Emphatic TD Bellman Operator is a Contraction","date":"2015-08-14","arxiv_id":"1508.03411","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-for-mdps-with-unknown","title":"Off-policy evaluation for MDPs with unknown structure","date":"2015-02-11","arxiv_id":"1502.03255","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-minimax-optimal-offline-policy-evaluation","title":"On Minimax Optimal Offline Policy Evaluation","date":"2014-09-12","arxiv_id":"1409.3653","repositories_listed":0,"syntology":null}],"record_sha256":"a997f33692ebba89b8781e87fcef64017b0e3e5b4e708580e633400d8bbe3fc9","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}