Browse State-of-the-Art › Off-policy evaluation › Papers, page 3
Off-policy evaluation
Papers archive 2025-07-28
archive papers tagged: 265 · with a code link: 102 · where Syntology ran a sample: 40 (30 with a run with no instrument failure, 10 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (40 of 265 tagged: 30 with a run with no instrument failure, 10 where every run was a failure of Syntology's instrument)
Page 3 of 3: papers 201 to 265 of 265, in archive order: by repositories listed in the archive (most first), then newest first, not by stars (the archive holds no stars, so PwC's “Social” and “Latest” sorts cannot be reproduced). Papers that list no repository come after every paper that lists one.
Papers without a page here are shown as plain text. A Syntology line reads “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the figure “where Syntology's instrument failed” counts failures of Syntology's instrument, not of the code. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code); hover it for the repositories the samples that ran came from. Abstracts are on each paper's page.
-
Discovering an Aid Policy to Minimize Student Evasion Using Offline Reinforcement Learning20 Apr 2021 0 repositories listed
-
Off-Policy Risk Assessment in Contextual Bandits18 Apr 2021 0 repositories listed
-
Infinite-Horizon Offline Reinforcement Learning with Linear Function Approximation: Curse of Dimensionality and Algorithm17 Mar 2021 0 repositories listed
-
Non-asymptotic Confidence Intervals of Off-policy Evaluation: Primal and Dual Bounds9 Mar 2021 0 repositories listed
-
Minimax Model Learning2 Mar 2021 0 repositories listed
-
Off-policy Confidence Sequences18 Feb 2021 0 repositories listed
-
Bootstrapping Fitted Q-Evaluation for Off-Policy Inference6 Feb 2021 0 repositories listed
-
Finite Sample Analysis of Minimax Offline Reinforcement Learning: Completeness, Fast Rates and First-Order Efficiency5 Feb 2021 0 repositories listed
-
Minimax Off-Policy Evaluation for Multi-Armed Bandits19 Jan 2021 0 repositories listed
-
Smoothed functional-based gradient algorithms for off-policy reinforcement learning: A non-asymptotic viewpoint6 Jan 2021 0 repositories listed
-
Off-Policy Evaluation of Slate Policies under Bayes Risk5 Jan 2021 0 repositories listed
-
Practical Marginalized Importance Sampling with the Successor Representation1 Jan 2021 0 repositories listed
-
Optimal Mixture Weights for Off-Policy Evaluation with Multiple Behavior Policies29 Nov 2020 0 repositories listed
-
Reliable Off-policy Evaluation for Reinforcement Learning8 Nov 2020 0 repositories listed
-
Off-Policy Interval Estimation with Lipschitz Value Iteration29 Oct 2020 0 repositories listed
-
A Practical Guide of Off-Policy Evaluation for Bandit Problems23 Oct 2020 0 repositories listed
-
Off-Policy Evaluation of Bandit Algorithm from Dependent Samples under Batch Update Policy23 Oct 2020 0 repositories listed
-
CoinDICE: Off-Policy Confidence Interval Estimation22 Oct 2020 0 repositories listed
-
Deep Jump Q-Evaluation for Offline Policy Evaluation in Continuous Action Space28 Sep 2020 0 repositories listed
-
Accountable Off-Policy Evaluation With Kernel Bellman Statistics15 Aug 2020 0 repositories listed
-
Off-policy Evaluation in Infinite-Horizon Reinforcement Learning with Latent Confounders27 Jul 2020 0 repositories listed
-
Statistical Bootstrapping for Uncertainty Estimation in Off-Policy Evaluation27 Jul 2020 0 repositories listed
-
Off-Policy Evaluation via the Regularized Lagrangian7 Jul 2020 0 repositories listed
-
Off-Policy Exploitability-Evaluation in Two-Player Zero-Sum Markov Games4 Jul 2020 0 repositories listed
-
A maximum-entropy approach to off-policy evaluation in average-reward MDPs17 Jun 2020 0 repositories listed
-
Confidence Interval for Off-Policy Evaluation from Dependent Samples via Bandit Algorithm: Approach from Standardized Martingales12 Jun 2020 0 repositories listed
-
Efficient Evaluation of Natural Stochastic Policies in Offline Reinforcement Learning6 Jun 2020 0 repositories listed
-
Causality and Batch Reinforcement Learning: Complementary Approaches To Planning In Unknown Domains3 Jun 2020 0 repositories listed
-
13 Mar 2020 0 repositories listed
-
Minimax-Optimal Off-Policy Evaluation with Linear Function Approximation21 Feb 2020 0 repositories listed
-
Debiased Off-Policy Evaluation for Recommendation Systems20 Feb 2020 0 repositories listed
-
Double/Debiased Machine Learning for Dynamic Treatment Effects via g-Estimation17 Feb 2020 0 repositories listed
-
Confounding-Robust Policy Evaluation in Infinite-Horizon Reinforcement Learning11 Feb 2020 0 repositories listed
-
Interpretable Off-Policy Evaluation in Reinforcement Learning by Highlighting Influential Transitions10 Feb 2020 0 repositories listed
-
Minimax Value Interval for Off-Policy Evaluation and Policy Optimization6 Feb 2020 0 repositories listed
-
Asymptotically Efficient Off-Policy Evaluation for Tabular Reinforcement Learning29 Jan 2020 0 repositories listed
-
Accountable Off-Policy Evaluation via a Kernelized Bellman Statistics1 Jan 2020 0 repositories listed
-
Double Reinforcement Learning for Efficient and Robust Off-Policy Evaluation1 Jan 2020 0 repositories listed
-
More Efficient Off-Policy Evaluation through Regularized Targeted Learning13 Dec 2019 0 repositories listed
-
Triply Robust Off-Policy Evaluation13 Nov 2019 0 repositories listed
-
Minimax Weight and Q-Function Learning for Off-Policy Evaluation28 Oct 2019 0 repositories listed
-
Adaptive Trade-Offs in Off-Policy Learning16 Oct 2019 0 repositories listed
-
Doubly Robust Bias Reduction in Infinite Horizon Off-Policy Estimation16 Oct 2019 0 repositories listed
-
Understanding the Curse of Horizon in Off-Policy Evaluation via Conditional Importance Sampling15 Oct 2019 0 repositories listed
-
Efficiently Breaking the Curse of Horizon in Off-Policy Evaluation with Double Reinforcement Learning12 Sep 2019 0 repositories listed
-
Off-Policy Evaluation in Partially Observable Environments9 Sep 2019 0 repositories listed
-
Efron-Stein PAC-Bayesian Inequalities4 Sep 2019 0 repositories listed
-
Task Selection Policies for Multitask Learning14 Jul 2019 0 repositories listed
-
Expected Sarsa(λ) with Control Variate for Variance Reduction25 Jun 2019 0 repositories listed
-
Towards Optimal Off-Policy Evaluation for Reinforcement Learning with Marginalized Importance Sampling8 Jun 2019 0 repositories listed
-
Off-Policy Evaluation via Off-Policy Classification4 Jun 2019 0 repositories listed
-
Defining Admissible Rewards for High Confidence Policy Evaluation30 May 2019 0 repositories listed
-
Combining Parametric and Nonparametric Models for Off-Policy Evaluation14 May 2019 0 repositories listed
-
Privacy Preserving Off-Policy Evaluation1 Feb 2019 0 repositories listed
-
Off-Policy Evaluation of Probabilistic Identity Data in Lookalike Modeling4 Jan 2019 0 repositories listed
-
Offline Comparison of Ranking Functions using Randomized Data11 Oct 2018 0 repositories listed
-
10 Sep 2018 0 repositories listed
-
Off-Policy Evaluation and Learning from Logged Bandit Feedback: Error Reduction via Surrogate Policy1 Aug 2018 0 repositories listed
-
Consistent On-Line Off-Policy Evaluation23 Feb 2017 0 repositories listed
-
Large-scale Validation of Counterfactual Learning Methods: A Test-Bed1 Dec 2016 0 repositories listed
-
Bootstrapping with Models: Confidence Intervals for Off-Policy Evaluation20 Jun 2016 0 repositories listed
-
Generalized Emphatic Temporal Difference Learning: Bias-Variance Analysis17 Sep 2015 0 repositories listed
-
Emphatic TD Bellman Operator is a Contraction14 Aug 2015 0 repositories listed
-
Off-policy evaluation for MDPs with unknown structure11 Feb 2015 0 repositories listed
-
On Minimax Optimal Offline Policy Evaluation12 Sep 2014 0 repositories listed