{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multi-armed-bandits/papers/9","list_of":"/task/multi-armed-bandits","task":"Multi-Armed Bandits","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":9,"pages_in_order":13,"rows_per_page":100,"rows":[801,900],"of":1262,"counts":{"archive_papers_tagged":1262,"with_a_code_link":253,"where_syntology_ran_a_sample":55,"not_listed_spam_title":0,"listed":1262,"listed_where_code_ran":55,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":44,"every_run_a_failure_of_syntologys_instrument":11,"listed_with_a_run_with_no_instrument_failure":44,"listed_every_run_a_failure_of_syntologys_instrument":11,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multi-armed-bandits","prev":"/task/multi-armed-bandits/papers/8","next":"/task/multi-armed-bandits/papers/10","papers":[{"url":null,"slug":"evaluating-probabilistic-inference-in-deep","title":"From Predictions to Decisions: The Importance of Joint Predictive Distributions","date":"2021-07-20","arxiv_id":"2107.09224","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-analysis-of-reinforcement-learning-for","title":"An Analysis of Reinforcement Learning for Malaria Control","date":"2021-07-19","arxiv_id":"2107.08988","repositories_listed":0,"syntology":null},{"url":null,"slug":"guideboot-guided-bootstrap-for-deep","title":"GuideBoot: Guided Bootstrap for Deep Contextual Bandits","date":"2021-07-18","arxiv_id":"2107.08383","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-to-misspecification-in-contextual-2","title":"Adapting to Misspecification in Contextual Bandits","date":"2021-07-12","arxiv_id":"2107.05745","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-selection-for-generic-contextual","title":"Model Selection for Generic Contextual Bandits","date":"2021-07-07","arxiv_id":"2107.03455","repositories_listed":0,"syntology":null},{"url":null,"slug":"dueling-bandits-with-adversarial-sleeping","title":"Dueling Bandits with Adversarial Sleeping","date":"2021-07-05","arxiv_id":"2107.02274","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-first-order-contextual-bandits","title":"Efficient First-Order Contextual Bandits: Prediction, Allocation, and Triangular Discrimination","date":"2021-07-05","arxiv_id":"2107.02237","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-restless-bandits-tackling-interval","title":"Restless and Uncertain: Robust Policies for Restless Bandits via Deep Multi-Agent Reinforcement Learning","date":"2021-07-04","arxiv_id":"2107.01689","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-decision-making-under-misspecified","title":"Bayesian decision-making under misspecified priors with applications to meta-learning","date":"2021-07-03","arxiv_id":"2107.01509","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularized-ofu-an-efficient-ucb-estimator","title":"Regularized OFU: an Efficient UCB Estimator forNon-linear Contextual Bandit","date":"2021-06-29","arxiv_id":"2106.15128","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-infused-policy-gradients-with-upper","title":"Knowledge Infused Policy Gradients with Upper Confidence Bound for Relational Bandits","date":"2021-06-25","arxiv_id":"2106.13895","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-player-multi-armed-bandits-with","title":"Multi-player Multi-armed Bandits with Collision-Dependent Reward Distributions","date":"2021-06-25","arxiv_id":"2106.13669","repositories_listed":0,"syntology":null},{"url":null,"slug":"random-effect-bandits","title":"Random Effect Bandits","date":"2021-06-23","arxiv_id":"2106.12200","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-framework-for-conservative","title":"A Reduction-Based Framework for Conservative Bandits and Reinforcement Learning","date":"2021-06-22","arxiv_id":"2106.11692","repositories_listed":0,"syntology":null},{"url":null,"slug":"banditmf-multi-armed-bandit-based-matrix","title":"BanditMF: Multi-Armed Bandit Based Matrix Factorization Recommender System","date":"2021-06-21","arxiv_id":"2106.10898","repositories_listed":0,"syntology":null},{"url":null,"slug":"smooth-sequential-optimisation-with-delayed","title":"Smooth Sequential Optimisation with Delayed Feedback","date":"2021-06-21","arxiv_id":"2106.11294","repositories_listed":0,"syntology":null},{"url":null,"slug":"banker-online-mirror-descent","title":"Banker Online Mirror Descent","date":"2021-06-16","arxiv_id":"2106.08943","repositories_listed":0,"syntology":null},{"url":null,"slug":"guaranteed-fixed-confidence-best-arm","title":"Guaranteed Fixed-Confidence Best Arm Identification in Multi-Armed Bandits: Simple Sequential Elimination Algorithms","date":"2021-06-12","arxiv_id":"2106.06848","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-model-selection-in-contextual-bandits","title":"Towards Costless Model Selection in Contextual Bandits: A Bias-Variance Perspective","date":"2021-06-11","arxiv_id":"2106.06483","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-central-limit-theorem-loss-aversion-and","title":"A Central Limit Theorem, Loss Aversion and Multi-Armed Bandits","date":"2021-06-10","arxiv_id":"2106.05472","repositories_listed":0,"syntology":null},{"url":null,"slug":"fixed-budget-best-arm-identification-in","title":"Fixed-Budget Best-Arm Identification in Structured Bandits","date":"2021-06-09","arxiv_id":"2106.04763","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-stochastic-multi-agent-multi","title":"Cooperative Stochastic Multi-agent Multi-armed Bandits Robust to Adversarial Corruptions","date":"2021-06-08","arxiv_id":"2106.04207","repositories_listed":0,"syntology":null},{"url":null,"slug":"scale-free-adversarial-multi-armed-bandits","title":"Scale Free Adversarial Multi Armed Bandits","date":"2021-06-08","arxiv_id":"2106.04700","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-learning-to-rank-long-sequences-with","title":"On Learning to Rank Long Sequences with Contextual Bandits","date":"2021-06-07","arxiv_id":"2106.03546","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentially-private-multi-armed-bandits-in","title":"Differentially Private Multi-Armed Bandits in the Shuffle Model","date":"2021-06-05","arxiv_id":"2106.02900","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-stochastic-linear-contextual-bandits","title":"Robust Stochastic Linear Contextual Bandits Under Adversarial Attacks","date":"2021-06-05","arxiv_id":"2106.02978","repositories_listed":0,"syntology":null},{"url":null,"slug":"fair-exploration-via-axiomatic-bargaining","title":"Fair Exploration via Axiomatic Bargaining","date":"2021-06-04","arxiv_id":"2106.02553","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-rates-of-locally-differentially","title":"Optimal Rates of (Locally) Differentially Private Heavy-tailed Multi-Armed Bandits","date":"2021-06-04","arxiv_id":"2106.02575","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-multi-armed-bandits-with","title":"Stochastic Multi-Armed Bandits with Unrestricted Delay Distributions","date":"2021-06-04","arxiv_id":"2106.02436","repositories_listed":0,"syntology":null},{"url":null,"slug":"parallelizing-contextual-linear-bandits","title":"Parallelizing Contextual Bandits","date":"2021-05-21","arxiv_id":"2105.10590","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-submodular-welfare-and-matroid-1","title":"Recurrent Submodular Welfare and Matroid Blocking Semi-Bandits","date":"2021-05-21","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-approximations-for-thompson","title":"Diffusion Approximations for Thompson Sampling","date":"2021-05-19","arxiv_id":"2105.09232","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-multi-armed-bandits-with-control","title":"Stochastic Multi-Armed Bandits with Control Variates","date":"2021-05-09","arxiv_id":"2105.03962","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-with-sparse-data-in-web","title":"Contextual Bandits with Sparse Data in Web setting","date":"2021-05-06","arxiv_id":"2105.02873","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-algorithms-for-range-searching-over","title":"Optimal Algorithms for Range Searching over Multi-Armed Bandits","date":"2021-05-04","arxiv_id":"2105.01390","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-certification-of-preference-based","title":"Online certification of preference-based fairness for personalized recommender systems","date":"2021-04-29","arxiv_id":"2104.14527","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-inference-with-m-estimators-on","title":"Statistical Inference with M-Estimators on Adaptively Collected Data","date":"2021-04-29","arxiv_id":"2104.14074","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-risk-assessment-in-contextual","title":"Off-Policy Risk Assessment in Contextual Bandits","date":"2021-04-18","arxiv_id":"2104.08977","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-efficient-algorithm-for-deep-stochastic","title":"An Efficient Algorithm for Deep Stochastic Contextual Bandits","date":"2021-04-12","arxiv_id":"2104.05613","repositories_listed":0,"syntology":null},{"url":null,"slug":"censored-semi-bandits-for-resource-allocation","title":"Censored Semi-Bandits for Resource Allocation","date":"2021-04-12","arxiv_id":"2104.05781","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-good-representations-in-linear","title":"Leveraging Good Representations in Linear Contextual Bandits","date":"2021-04-08","arxiv_id":"2104.03781","repositories_listed":0,"syntology":null},{"url":null,"slug":"multinomial-logit-contextual-bandits-provable","title":"Multinomial Logit Contextual Bandits: Provable Optimality and Practicality","date":"2021-03-25","arxiv_id":"2103.13929","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-optimal-algorithms-for-multi-player","title":"Towards Optimal Algorithms for Multi-Player Bandits without Collision Sensing Information","date":"2021-03-24","arxiv_id":"2103.13059","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-offline-reinforcement-learning-and","title":"Bridging Offline Reinforcement Learning and Imitation Learning: A Tale of Pessimism","date":"2021-03-22","arxiv_id":"2103.12021","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-contextual-bandits-for-fast-neighbor","title":"Deep Contextual Bandits for Fast Neighbor-Aided Initial Access in mmWave Cell-Free Networks","date":"2021-03-17","arxiv_id":"2103.09694","repositories_listed":0,"syntology":null},{"url":null,"slug":"homomorphically-encrypted-linear-contextual","title":"Encrypted Linear Contextual Bandit","date":"2021-03-17","arxiv_id":"2103.09927","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-algorithms-for-finite-horizon-and","title":"Efficient Algorithms for Finite Horizon and Streaming Restless Multi-Armed Bandit Problems","date":"2021-03-08","arxiv_id":"2103.04730","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearest-neighbor-search-under-uncertainty","title":"Nearest Neighbor Search Under Uncertainty","date":"2021-03-08","arxiv_id":"2103.05057","repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-intervention-planning-using-rmabs","title":"Selective Intervention Planning using Restless Multi-Armed Bandits to Improve Maternal and Child Health Outcomes","date":"2021-03-07","arxiv_id":"2103.09052","repositories_listed":0,"syntology":null},{"url":null,"slug":"fairness-of-exposure-in-stochastic-bandits","title":"Fairness of Exposure in Stochastic Bandits","date":"2021-03-03","arxiv_id":"2103.02735","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-to-misspecification-in-contextual-1","title":"Adapting to Misspecification in Contextual Bandits with Offline Regression Oracles","date":"2021-02-26","arxiv_id":"2102.13240","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-clustering-in-contextual-multi-armed","title":"Local Clustering in Contextual Multi-Armed Bandits","date":"2021-02-26","arxiv_id":"2103.00063","repositories_listed":0,"syntology":null},{"url":null,"slug":"doubly-adaptive-thompson-sampling-for-multi","title":"Online Multi-Armed Bandits with Adaptive Inference","date":"2021-02-25","arxiv_id":"2102.13202","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-thompson-sampling","title":"Meta-Thompson Sampling","date":"2021-02-11","arxiv_id":"2102.06129","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-multi-armed-bandits-with-limited","title":"Multi-Agent Multi-Armed Bandits with Limited Communication","date":"2021-02-10","arxiv_id":"2102.08462","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-stationary-reinforcement-learning-without","title":"Non-stationary Reinforcement Learning without Prior Knowledge: An Optimal Black-box Approach","date":"2021-02-10","arxiv_id":"2102.05406","repositories_listed":0,"syntology":null},{"url":null,"slug":"player-modeling-via-multi-armed-bandits","title":"Player Modeling via Multi-Armed Bandits","date":"2021-02-10","arxiv_id":"2102.05264","repositories_listed":0,"syntology":null},{"url":null,"slug":"regression-oracles-and-exploration-strategies","title":"Regression Oracles and Exploration Strategies for Short-Horizon Multi-Armed Bandits","date":"2021-02-10","arxiv_id":"2102.05263","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-gap-dependent-bounds-for-tabular","title":"Fine-Grained Gap-Dependent Bounds for Tabular MDPs via Adaptive Multi-Step Bootstrap","date":"2021-02-09","arxiv_id":"2102.04692","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandits-for-learning-to-explain-from","title":"Bandits for Learning to Explain from Explanations","date":"2021-02-07","arxiv_id":"2102.03815","repositories_listed":0,"syntology":null},{"url":null,"slug":"confidence-budget-matching-for-sequential","title":"Confidence-Budget Matching for Sequential Budgeted Learning","date":"2021-02-05","arxiv_id":"2102.03400","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-in-bandits-with-latent","title":"Transfer Learning in Bandits with Latent Continuity","date":"2021-02-04","arxiv_id":"2102.02472","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-submodular-welfare-and-matroid","title":"Recurrent Submodular Welfare and Matroid Blocking Bandits","date":"2021-01-30","arxiv_id":"2102.00321","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-and-scalable-model-selection-with","title":"Online and Scalable Model Selection with Multi-Armed Bandits","date":"2021-01-25","arxiv_id":"2101.10385","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalization-paradox-in-behavior-change","title":"Personalization Paradox in Behavior Change Apps: Lessons from a Social Comparison-Based Personalized App for Physical Activity","date":"2021-01-25","arxiv_id":"2101.10020","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-pure-exploration-for-combinatorial","title":"Efficient Pure Exploration for Combinatorial Bandits with Semi-Bandit Feedback","date":"2021-01-21","arxiv_id":"2101.08534","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-off-policy-evaluation-for-multi-armed","title":"Minimax Off-Policy Evaluation for Multi-Armed Bandits","date":"2021-01-19","arxiv_id":"2101.07781","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-allocation-in-noma-based-self","title":"Resource Allocation in NOMA-based Self-Organizing Networks using Stochastic Multi-Armed Bandits","date":"2021-01-16","arxiv_id":"2101.06340","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-learning-with-partial-information-to","title":"Survival of the strictest: Stable and unstable equilibria under regularized learning with partial information","date":"2021-01-12","arxiv_id":"2101.04667","repositories_listed":0,"syntology":null},{"url":null,"slug":"be-greedy-in-multi-armed-bandits","title":"Be Greedy in Multi-Armed Bandits","date":"2021-01-04","arxiv_id":"2101.01086","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-learning-under-adversarial-corruptions","title":"Online Learning under Adversarial Corruptions","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"online-limited-memory-neural-linear-bandits","title":"Online Limited Memory Neural-Linear Bandits","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"combinatorial-pure-exploration-with-full","title":"Combinatorial Pure Exploration with Full-bandit Feedback and Beyond: Solving Combinatorial Optimization under Uncertainty with Limited Observation","date":"2020-12-31","arxiv_id":"2012.15584","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-optimize-energy-efficiency-in","title":"Learning to Optimize Energy Efficiency in Energy Harvesting Wireless Sensor Networks","date":"2020-12-30","arxiv_id":"2012.15203","repositories_listed":0,"syntology":null},{"url":null,"slug":"lifelong-learning-in-multi-armed-bandits","title":"Lifelong Learning in Multi-Armed Bandits","date":"2020-12-28","arxiv_id":"2012.14264","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-regret-bound-for-non-stationary-multi-armed","title":"A Regret bound for Non-stationary Multi-Armed Bandits with Fairness Constraints","date":"2020-12-24","arxiv_id":"2012.13380","repositories_listed":0,"syntology":null},{"url":null,"slug":"expanding-on-repeated-consumer-search-using","title":"Expanding on Repeated Consumer Search Using Multi-Armed Bandits and Secretaries","date":"2020-12-22","arxiv_id":"2012.11900","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-one-size-fits-all-solution-to-conservative","title":"A One-Size-Fits-All Solution to Conservative Bandit Problems","date":"2020-12-14","arxiv_id":"2012.07341","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-linear-contextual-bandits-with","title":"Adversarial Linear Contextual Bandits with Graph-Structured Side Observations","date":"2020-12-10","arxiv_id":"2012.05756","repositories_listed":0,"syntology":null},{"url":null,"slug":"streaming-algorithms-for-stochastic-multi","title":"Streaming Algorithms for Stochastic Multi-armed Bandits","date":"2020-12-09","arxiv_id":"2012.05142","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-automatic-cash-via-rising-bandits","title":"Efficient Automatic CASH via Rising Bandits","date":"2020-12-08","arxiv_id":"2012.04371","repositories_listed":0,"syntology":null},{"url":null,"slug":"accurate-and-fast-federated-learning-via","title":"Accurate and Fast Federated Learning via Combinatorial Multi-Armed Bandits","date":"2020-12-06","arxiv_id":"2012.03270","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-thompson-sampling","title":"Distributed Thompson Sampling","date":"2020-12-03","arxiv_id":"2012.01789","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-contextual-bandits-with-deep","title":"Neural Contextual Bandits with Deep Representation and Shallow Exploration","date":"2020-12-03","arxiv_id":"2012.01780","repositories_listed":0,"syntology":null},{"url":null,"slug":"batched-coarse-ranking-in-multi-armed-bandits","title":"Batched Coarse Ranking in Multi-Armed Bandits","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"finding-all-epsilon-good-arms-in-stochastic","title":"Finding All $\\epsilon$-Good Arms in Stochastic Bandits","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-optimistic-algorithm-for-the","title":"A Tractable Online Learning Algorithm for the Multinomial Logit Contextual Bandit","date":"2020-11-28","arxiv_id":"2011.14033","repositories_listed":0,"syntology":null},{"url":null,"slug":"resonance-replacing-software-constants-with","title":"Resonance: Replacing Software Constants with Context-Aware Models in Real-time Communication","date":"2020-11-23","arxiv_id":"2011.12715","repositories_listed":0,"syntology":null},{"url":null,"slug":"fully-gap-dependent-bounds-for-multinomial","title":"Fully Gap-Dependent Bounds for Multinomial Logit Bandit","date":"2020-11-19","arxiv_id":"2011.09998","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-biased-maximum-likelihood-estimation-1","title":"Reward Biased Maximum Likelihood Estimation for Reinforcement Learning","date":"2020-11-16","arxiv_id":"2011.07738","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-reinforcement-learning-observing","title":"Active Reinforcement Learning: Observing Rewards at a Cost","date":"2020-11-13","arxiv_id":"2011.06709","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-offline-contextual-bandits-with","title":"Improving Offline Contextual Bandits with Distributional Robustness","date":"2020-11-13","arxiv_id":"2011.06835","repositories_listed":0,"syntology":null},{"url":null,"slug":"metric-free-individual-fairness-with","title":"Metric-Free Individual Fairness with Cooperative Contextual Bandits","date":"2020-11-13","arxiv_id":"2011.06738","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotic-convergence-of-thompson-sampling","title":"Asymptotic Convergence of Thompson Sampling","date":"2020-11-08","arxiv_id":"2011.03917","repositories_listed":0,"syntology":null},{"url":null,"slug":"random-walk-bandits","title":"Towards Fundamental Limits of Multi-armed Bandits with Random Walk Feedback","date":"2020-11-03","arxiv_id":"2011.01445","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-armed-bandits-with-censored-consumption","title":"Multi-Armed Bandits with Censored Consumption of Resources","date":"2020-11-02","arxiv_id":"2011.00813","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-no-sensing-adversarial-multi-player-multi","title":"On No-Sensing Adversarial Multi-player Multi-armed Bandits with Collision Communications","date":"2020-11-02","arxiv_id":"2011.01090","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-allocation-in-multi-armed-bandit","title":"Resource Allocation in Multi-armed Bandit Exploration: Overcoming Sublinear Scaling with Adaptive Parallelism","date":"2020-10-31","arxiv_id":"2011.00330","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-actively-learn-a-robust-approach-1","title":"Learning to Actively Learn: A Robust Approach","date":"2020-10-29","arxiv_id":"2010.15382","repositories_listed":0,"syntology":null},{"url":null,"slug":"tractable-contextual-bandits-beyond","title":"Tractable contextual bandits beyond realizability","date":"2020-10-25","arxiv_id":"2010.13013","repositories_listed":0,"syntology":null}],"record_sha256":"c98559462d94014d5eb935900586500cca3038a4ba653cbc0d522ce003f84bec","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}