{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multi-armed-bandits/papers/3","list_of":"/task/multi-armed-bandits","task":"Multi-Armed Bandits","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":13,"rows_per_page":100,"rows":[201,300],"of":1262,"counts":{"archive_papers_tagged":1262,"with_a_code_link":253,"where_syntology_ran_a_sample":55,"not_listed_spam_title":0,"listed":1262,"listed_where_code_ran":55,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":44,"every_run_a_failure_of_syntologys_instrument":11,"listed_with_a_run_with_no_instrument_failure":44,"listed_every_run_a_failure_of_syntologys_instrument":11,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multi-armed-bandits","prev":"/task/multi-armed-bandits/papers/2","next":"/task/multi-armed-bandits/papers/4","papers":[{"url":"/paper/hierarchical-adaptive-contextual-bandits-for","slug":"hierarchical-adaptive-contextual-bandits-for","title":"Hierarchical Adaptive Contextual Bandits for Resource Constraint based Recommendation","date":"2020-04-02","arxiv_id":"2004.01136","repositories_listed":1,"syntology":null},{"url":"/paper/adaptive-estimator-selection-for-off-policy","slug":"adaptive-estimator-selection-for-off-policy","title":"Adaptive Estimator Selection for Off-Policy Evaluation","date":"2020-02-18","arxiv_id":"2002.07729","repositories_listed":1,"syntology":null},{"url":"/paper/safe-exploration-for-optimizing-contextual","slug":"safe-exploration-for-optimizing-contextual","title":"Safe Exploration for Optimizing Contextual Bandits","date":"2020-02-02","arxiv_id":"2002.00467","repositories_listed":1,"syntology":null},{"url":"/paper/offline-contextual-bandits-with-high","slug":"offline-contextual-bandits-with-high","title":"Offline Contextual Bandits with High Probability Fairness Guarantees","date":"2019-12-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/thompson-sampling-for-multinomial-logit","slug":"thompson-sampling-for-multinomial-logit","title":"Thompson Sampling for Multinomial Logit Contextual Bandits","date":"2019-12-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/confidence-intervals-for-policy-evaluation-in","slug":"confidence-intervals-for-policy-evaluation-in","title":"Confidence Intervals for Policy Evaluation in Adaptive Experiments","date":"2019-11-07","arxiv_id":"1911.02768","repositories_listed":1,"syntology":null},{"url":"/paper/persistency-of-excitation-for-robustness-of","slug":"persistency-of-excitation-for-robustness-of","title":"Persistency of Excitation for Robustness of Neural Networks","date":"2019-11-04","arxiv_id":"1911.01043","repositories_listed":1,"syntology":{"n":4,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":0,"n_honours":4,"n_violates":0,"n_no_contract":0,"n_pointer_only":4,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 4 honoured, 0 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/persistency-of-excitation-for-robustness-of#ran","syntology_url":"https://syntology.ai/paper/1911.01043","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1911.01043"}},"official":{"repos":["nar-k/persistent-excitation"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/thompson-sampling-for-contextual-bandit","slug":"thompson-sampling-for-contextual-bandit","title":"Thompson Sampling for Contextual Bandit Problems with Auxiliary Safety Constraints","date":"2019-11-02","arxiv_id":"1911.00638","repositories_listed":1,"syntology":null},{"url":"/paper/thompson-sampling-via-local-uncertainty","slug":"thompson-sampling-via-local-uncertainty","title":"Thompson Sampling via Local Uncertainty","date":"2019-10-30","arxiv_id":"1910.13673","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/thompson-sampling-via-local-uncertainty#ran","syntology_url":"https://syntology.ai/paper/1910.13673","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1910.13673"}},"official":{"repos":["Zhendong-Wang/Thompson-Sampling-via-Local-Uncertainty"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/smoothness-adaptive-stochastic-bandits","slug":"smoothness-adaptive-stochastic-bandits","title":"Smoothness-Adaptive Contextual Bandits","date":"2019-10-22","arxiv_id":"1910.09714","repositories_listed":1,"syntology":{"n":7,"n_ran":7,"n_constructed":0,"n_ran_checked":7,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":7,"n_pointer_only":0,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 0 violated, 7 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/smoothness-adaptive-stochastic-bandits#ran","syntology_url":"https://syntology.ai/paper/1910.09714","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1910.09714"}},"official":{"repos":["armmn/Smoothness-Adaptive-Contextual-Bandits"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":0,"n_ran_no_instrument_failure":7,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/model-free-reinforcement-learning-in-infinite","slug":"model-free-reinforcement-learning-in-infinite","title":"Model-free Reinforcement Learning in Infinite-horizon Average-reward Markov Decision Processes","date":"2019-10-15","arxiv_id":"1910.07072","repositories_listed":1,"syntology":null},{"url":"/paper/neural-linear-bandits-overcoming-catastrophic","slug":"neural-linear-bandits-overcoming-catastrophic","title":"Neural Linear Bandits: Overcoming Catastrophic Forgetting through Likelihood Matching","date":"2019-09-25","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/practical-calculation-of-gittins-indices-for","slug":"practical-calculation-of-gittins-indices-for","title":"Practical Calculation of Gittins Indices for Multi-armed Bandits","date":"2019-09-11","arxiv_id":"1909.05075","repositories_listed":1,"syntology":null},{"url":"/paper/smooth-contextual-bandits-bridging-the","slug":"smooth-contextual-bandits-bridging-the","title":"Smooth Contextual Bandits: Bridging the Parametric and Non-differentiable Regret Regimes","date":"2019-09-05","arxiv_id":"1909.02553","repositories_listed":1,"syntology":null},{"url":"/paper/censored-semi-bandits-a-framework-for","slug":"censored-semi-bandits-a-framework-for","title":"Censored Semi-Bandits: A Framework for Resource Allocation with Censored Feedback","date":"2019-09-04","arxiv_id":"1909.01504","repositories_listed":1,"syntology":null},{"url":"/paper/doubly-robust-lasso-bandit","slug":"doubly-robust-lasso-bandit","title":"Doubly-Robust Lasso Bandit","date":"2019-07-26","arxiv_id":"1907.11362","repositories_listed":1,"syntology":null},{"url":"/paper/scaling-multi-armed-bandit-algorithms","slug":"scaling-multi-armed-bandit-algorithms","title":"Scaling Multi-Armed Bandit Algorithms","date":"2019-07-25","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/doubly-robust-off-policy-evaluation-with","slug":"doubly-robust-off-policy-evaluation-with","title":"Doubly robust off-policy evaluation with shrinkage","date":"2019-07-22","arxiv_id":"1907.09623","repositories_listed":1,"syntology":null},{"url":"/paper/balanced-off-policy-evaluation-general-action","slug":"balanced-off-policy-evaluation-general-action","title":"Balanced off-policy evaluation in general action spaces","date":"2019-06-09","arxiv_id":"1906.03694","repositories_listed":1,"syntology":null},{"url":"/paper/empirical-likelihood-for-contextual-bandits","slug":"empirical-likelihood-for-contextual-bandits","title":"Empirical Likelihood for Contextual Bandits","date":"2019-06-07","arxiv_id":"1906.03323","repositories_listed":1,"syntology":{"n":9,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":7,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 7 unverified","sample_list":"/paper/empirical-likelihood-for-contextual-bandits#ran","syntology_url":"https://syntology.ai/paper/1906.03323","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1906.03323"}},"official":{"repos":["pmineiro/elfcb"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":7,"ran_from_kinds":["official"]}}},{"url":"/paper/190600531","slug":"190600531","title":"Model selection for contextual bandits","date":"2019-06-03","arxiv_id":"1906.00531","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/190600531#ran","syntology_url":"https://syntology.ai/paper/1906.00531","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1906.00531"}},"official":{"repos":["akshaykr/oracle_cb"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/190600569","slug":"190600569","title":"Distribution oblivious, risk-aware algorithms for multi-armed bandits with unbounded rewards","date":"2019-06-03","arxiv_id":"1906.00569","repositories_listed":1,"syntology":null},{"url":"/paper/regret-bounds-for-thompson-sampling-in","slug":"regret-bounds-for-thompson-sampling-in","title":"Regret Bounds for Thompson Sampling in Episodic Restless Bandit Problems","date":"2019-05-29","arxiv_id":"1905.12673","repositories_listed":1,"syntology":null},{"url":"/paper/introduction-to-multi-armed-bandits","slug":"introduction-to-multi-armed-bandits","title":"Introduction to Multi-Armed Bandits","date":"2019-04-15","arxiv_id":"1904.07272","repositories_listed":1,"syntology":null},{"url":"/paper/batched-multi-armed-bandits-problem","slug":"batched-multi-armed-bandits-problem","title":"Batched Multi-armed Bandits Problem","date":"2019-04-03","arxiv_id":"1904.01763","repositories_listed":1,"syntology":null},{"url":"/paper/adaptive-sample-efficient-blackbox","slug":"adaptive-sample-efficient-blackbox","title":"From Complexity to Simplicity: Adaptive ES-Active Subspaces for Blackbox Optimization","date":"2019-03-07","arxiv_id":"1903.04268","repositories_listed":1,"syntology":null},{"url":"/paper/equal-opportunity-in-online-classification","slug":"equal-opportunity-in-online-classification","title":"Equal Opportunity in Online Classification with Partial Feedback","date":"2019-02-06","arxiv_id":"1902.02242","repositories_listed":1,"syntology":null},{"url":"/paper/the-assistive-multi-armed-bandit","slug":"the-assistive-multi-armed-bandit","title":"The Assistive Multi-Armed Bandit","date":"2019-01-24","arxiv_id":"1901.08654","repositories_listed":1,"syntology":null},{"url":"/paper/distributed-learning-and-optimal-assignment","slug":"distributed-learning-and-optimal-assignment","title":"Multiplayer Multi-armed Bandits for Optimal Assignment in Heterogeneous Networks","date":"2019-01-12","arxiv_id":"1901.03868","repositories_listed":1,"syntology":null},{"url":"/paper/warm-starting-contextual-bandits-robustly","slug":"warm-starting-contextual-bandits-robustly","title":"Warm-starting Contextual Bandits: Robustly Combining Supervised and Bandit Feedback","date":"2019-01-02","arxiv_id":"1901.00301","repositories_listed":1,"syntology":null},{"url":"/paper/practical-bayesian-learning-of-neural","slug":"practical-bayesian-learning-of-neural","title":"Practical Bayesian Learning of Neural Networks via Adaptive Optimisation Methods","date":"2018-11-08","arxiv_id":"1811.03679","repositories_listed":1,"syntology":null},{"url":"/paper/heteroscedastic-bandits-with-reneging","slug":"heteroscedastic-bandits-with-reneging","title":"Stay With Me: Lifetime Maximization Through Heteroscedastic Linear Bandits With Reneging","date":"2018-10-29","arxiv_id":"1810.12418","repositories_listed":1,"syntology":null},{"url":"/paper/decentralized-cooperative-stochastic-multi","slug":"decentralized-cooperative-stochastic-multi","title":"Decentralized Cooperative Stochastic Bandits","date":"2018-10-10","arxiv_id":"1810.04468","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":1,"n_instrument":2,"n_unverified":0,"n_honours":0,"n_violates":1,"n_no_contract":0,"n_pointer_only":3,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 1 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/decentralized-cooperative-stochastic-multi#ran","syntology_url":"https://syntology.ai/paper/1810.04468","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1810.04468"}},"official":{"repos":["damaru2/decentralized-bandits"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/modelling-users-theory-of-ais-mind-in","slug":"modelling-users-theory-of-ais-mind-in","title":"Machine Teaching of Active Sequential Learners","date":"2018-09-08","arxiv_id":"1809.02869","repositories_listed":1,"syntology":null},{"url":"/paper/nonparametric-gaussian-mixture-models-for-the","slug":"nonparametric-gaussian-mixture-models-for-the","title":"Nonparametric Gaussian Mixture Models for the Multi-Armed Bandit","date":"2018-08-08","arxiv_id":"1808.02932","repositories_listed":1,"syntology":null},{"url":"/paper/myopic-bayesian-design-of-experiments-via","slug":"myopic-bayesian-design-of-experiments-via","title":"Myopic Bayesian Design of Experiments via Posterior Sampling and Probabilistic Programming","date":"2018-05-25","arxiv_id":"1805.09964","repositories_listed":1,"syntology":null},{"url":"/paper/learning-contextual-bandits-in-a-non","slug":"learning-contextual-bandits-in-a-non","title":"Learning Contextual Bandits in a Non-stationary Environment","date":"2018-05-23","arxiv_id":"1805.09365","repositories_listed":1,"syntology":null},{"url":"/paper/adaptive-monte-carlo-optimization","slug":"adaptive-monte-carlo-optimization","title":"Bandit-Based Monte Carlo Optimization for Nearest Neighbors","date":"2018-05-21","arxiv_id":"1805.08321","repositories_listed":1,"syntology":null},{"url":"/paper/contextual-bandits-with-stochastic-experts","slug":"contextual-bandits-with-stochastic-experts","title":"Contextual Bandits with Stochastic Experts","date":"2018-02-23","arxiv_id":"1802.08737","repositories_listed":1,"syntology":null},{"url":"/paper/more-robust-doubly-robust-off-policy","slug":"more-robust-doubly-robust-off-policy","title":"More Robust Doubly Robust Off-policy Evaluation","date":"2018-02-10","arxiv_id":"1802.03493","repositories_listed":1,"syntology":null},{"url":"/paper/residual-loss-prediction-reinforcement","slug":"residual-loss-prediction-reinforcement","title":"Residual Loss Prediction: Reinforcement Learning With No Incremental Feedback","date":"2018-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/learning-structural-weight-uncertainty-for","slug":"learning-structural-weight-uncertainty-for","title":"Learning Structural Weight Uncertainty for Sequential Decision-Making","date":"2017-12-30","arxiv_id":"1801.00085","repositories_listed":1,"syntology":null},{"url":"/paper/medoids-in-almost-linear-time-via-multi-armed","slug":"medoids-in-almost-linear-time-via-multi-armed","title":"Medoids in almost linear time via multi-armed bandits","date":"2017-11-02","arxiv_id":"1711.00817","repositories_listed":1,"syntology":null},{"url":"/paper/variational-inference-for-the-multi-armed","slug":"variational-inference-for-the-multi-armed","title":"Variational inference for the multi-armed contextual bandit","date":"2017-09-10","arxiv_id":"1709.03163","repositories_listed":1,"syntology":null},{"url":"/paper/mostly-exploration-free-algorithms-for","slug":"mostly-exploration-free-algorithms-for","title":"Mostly Exploration-Free Algorithms for Contextual Bandits","date":"2017-04-28","arxiv_id":"1704.09011","repositories_listed":1,"syntology":null},{"url":"/paper/contextual-multi-armed-bandits-under-feature","slug":"contextual-multi-armed-bandits-under-feature","title":"Contextual Linear Bandits under Noisy Features: Towards Bayesian Oracles","date":"2017-03-03","arxiv_id":"1703.01347","repositories_listed":1,"syntology":null},{"url":"/paper/corralling-a-band-of-bandit-algorithms","slug":"corralling-a-band-of-bandit-algorithms","title":"Corralling a Band of Bandit Algorithms","date":"2016-12-19","arxiv_id":"1612.06246","repositories_listed":1,"syntology":null},{"url":"/paper/cascading-bandits-for-large-scale","slug":"cascading-bandits-for-large-scale","title":"Cascading Bandits for Large-Scale Recommendation Problems","date":"2016-03-17","arxiv_id":"1603.05359","repositories_listed":1,"syntology":null},{"url":"/paper/a-survey-on-contextual-multi-armed-bandits","slug":"a-survey-on-contextual-multi-armed-bandits","title":"A Survey on Contextual Multi-armed Bandits","date":"2015-08-13","arxiv_id":"1508.03326","repositories_listed":1,"syntology":null},{"url":"/paper/regulating-greed-over-time","slug":"regulating-greed-over-time","title":"Regulating Greed Over Time in Multi-Armed Bandits","date":"2015-05-21","arxiv_id":"1505.05629","repositories_listed":1,"syntology":null},{"url":"/paper/doubly-robust-policy-evaluation-and","slug":"doubly-robust-policy-evaluation-and","title":"Doubly Robust Policy Evaluation and Optimization","date":"2015-03-10","arxiv_id":"1503.02834","repositories_listed":1,"syntology":null},{"url":"/paper/taming-the-monster-a-fast-and-simple","slug":"taming-the-monster-a-fast-and-simple","title":"Taming the Monster: A Fast and Simple Algorithm for Contextual Bandits","date":"2014-02-04","arxiv_id":"1402.0555","repositories_listed":1,"syntology":null},{"url":"/paper/doubly-robust-policy-evaluation-and-learning","slug":"doubly-robust-policy-evaluation-and-learning","title":"Doubly Robust Policy Evaluation and Learning","date":"2011-03-23","arxiv_id":"1103.4601","repositories_listed":1,"syntology":null},{"url":null,"slug":"multi-armed-bandits-with-machine-learning","title":"Multi-Armed Bandits With Machine Learning-Generated Surrogate Rewards","date":"2025-06-20","arxiv_id":"2506.16658","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-general-framework-for-off-policy-learning","title":"A General Framework for Off-Policy Learning with Partially-Observed Reward","date":"2025-06-17","arxiv_id":"2506.14439","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-data-augmentation-for-thompson","title":"Adaptive Data Augmentation for Thompson Sampling","date":"2025-06-17","arxiv_id":"2506.14479","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-multi-objective-multi-armed","title":"Stochastic Multi-Objective Multi-Armed Bandits: Regret Definition and Algorithm","date":"2025-06-16","arxiv_id":"2506.13125","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-min-max-regret-in-grouped-multi","title":"Collaborative Min-Max Regret in Grouped Multi-Armed Bandits","date":"2025-06-12","arxiv_id":"2506.10313","repositories_listed":0,"syntology":null},{"url":null,"slug":"meet-me-at-the-arm-the-cooperative-multi","title":"Meet Me at the Arm: The Cooperative Multi-Armed Bandits Problem with Shareable Arms","date":"2025-06-11","arxiv_id":"2506.10127","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-regret-bounds-for-linear-bandits","title":"Improved Regret Bounds for Linear Bandits with Heavy-Tailed Rewards","date":"2025-06-05","arxiv_id":"2506.04775","repositories_listed":0,"syntology":null},{"url":null,"slug":"quick-draw-bandits-quickly-optimizing-in","title":"Quick-Draw Bandits: Quickly Optimizing in Nonstationary Environments with Extremely Many Arms","date":"2025-05-30","arxiv_id":"2505.24692","repositories_listed":0,"syntology":null},{"url":null,"slug":"cobra-contextual-bandit-algorithm-for","title":"COBRA: Contextual Bandit Algorithm for Ensuring Truthful Strategic Agents","date":"2025-05-29","arxiv_id":"2505.23720","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-enhanced-llm","title":"A Reinforcement-Learning-Enhanced LLM Framework for Automated A/B Testing in Personalized Marketing","date":"2025-05-27","arxiv_id":"2506.06316","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-clustering-of-linear-bandits","title":"Offline Clustering of Linear Bandits: Unlocking the Power of Clusters in Data-Limited Environments","date":"2025-05-25","arxiv_id":"2505.19043","repositories_listed":0,"syntology":null},{"url":null,"slug":"kl-regularization-itself-is-differentially","title":"KL-regularization Itself is Differentially Private in Bandits and RLHF","date":"2025-05-23","arxiv_id":"2505.18407","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-and-interpretable-contextual-bandits","title":"Scalable and Interpretable Contextual Bandits: A Literature Review and Retail Offer Prototype","date":"2025-05-22","arxiv_id":"2505.16918","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-domain-african-languages-translation-using","title":"In-Domain African Languages Translation Using LLMs and Multi-armed Bandits","date":"2025-05-21","arxiv_id":"2505.15069","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-best-arm-identification-under-fixed","title":"Optimal Best-Arm Identification under Fixed Confidence with Multiple Optima","date":"2025-05-21","arxiv_id":"2505.15643","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-dimensional-nonparametric-contextual","title":"High-dimensional Nonparametric Contextual Bandit Problem","date":"2025-05-20","arxiv_id":"2505.14102","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmenting-online-rl-with-offline-data-is-all","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","date":"2025-05-19","arxiv_id":"2505.13768","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-armed-bandits-meet-large-language","title":"Multi-Armed Bandits Meet Large Language Models","date":"2025-05-19","arxiv_id":"2505.13355","repositories_listed":0,"syntology":null},{"url":null,"slug":"batched-nonparametric-bandits-via-k-nearest","title":"Batched Nonparametric Bandits via k-Nearest Neighbor UCB","date":"2025-05-15","arxiv_id":"2505.10498","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-best-arm-identification-for","title":"Near Optimal Best Arm Identification for Clustered Bandits","date":"2025-05-15","arxiv_id":"2505.10147","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-robust-and-scalable-bayesian","title":"Adaptive, Robust and Scalable Bayesian Filtering for Online Learning","date":"2025-05-12","arxiv_id":"2505.07267","repositories_listed":0,"syntology":null},{"url":null,"slug":"navigating-the-rashomon-effect-how","title":"Navigating the Rashomon Effect: How Personalization Can Help Adjust Interpretable Machine Learning Models to Individual Users","date":"2025-05-11","arxiv_id":"2505.07100","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-budgeted-multi-armed-bandits-for-iot","title":"Adaptive Budgeted Multi-Armed Bandits for IoT with Dynamic Resource Constraints","date":"2025-05-05","arxiv_id":"2505.02640","repositories_listed":0,"syntology":null},{"url":null,"slug":"preference-centric-bandits-optimality-of","title":"Preference-centric Bandits: Optimality of Mixtures and Regret-efficient Algorithms","date":"2025-04-29","arxiv_id":"2504.20877","repositories_listed":0,"syntology":null},{"url":null,"slug":"access-probability-optimization-in-rach-a","title":"Access Probability Optimization in RACH: A Multi-Armed Bandits Approach","date":"2025-04-18","arxiv_id":"2504.14085","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-contextual-bandits-under-delayed","title":"Neural Contextual Bandits Under Delayed Feedback Constraints","date":"2025-04-16","arxiv_id":"2504.12086","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-problem-of-best-arm-retention","title":"On the Problem of Best Arm Retention","date":"2025-04-16","arxiv_id":"2504.11866","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-based-user-association-for-mmwave","title":"Learning-Based User Association for MmWave Vehicular Networks With Kernelized Contextual Bandits","date":"2025-04-15","arxiv_id":"2504.10959","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-more-efficient-robust-instance","title":"Towards More Efficient, Robust, Instance-adaptive, and Generalizable Sequential Decision making","date":"2025-04-12","arxiv_id":"2504.09192","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-classification-view-on-meta-learning","title":"A Classification View on Meta Learning Bandits","date":"2025-04-06","arxiv_id":"2504.04505","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-exploration-free-method-for-a-linear","title":"An Exploration-free Method for a Linear Stochastic Bandit Driven by a Linear Gaussian Dynamical System","date":"2025-04-04","arxiv_id":"2504.03926","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-near-optimal-algorithm-for-online","title":"Efficient Near-Optimal Algorithm for Online Shortest Paths in Directed Acyclic Graphs with Bandit Feedback Against Adaptive Adversaries","date":"2025-04-01","arxiv_id":"2504.00461","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-machine-learning","title":"Reinforcement Learning for Machine Learning Model Deployment: Evaluating Multi-Armed Bandits in ML Ops Environments","date":"2025-03-28","arxiv_id":"2503.22595","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiscale-contextual-bandits-for-long-term","title":"MultiScale Contextual Bandits for Long Term Objectives","date":"2025-03-22","arxiv_id":"2503.17674","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-additive-contextual-bandits-a","title":"Sparse Additive Contextual Bandits: A Nonparametric Approach for Online Decision-making with High-dimensional Covariates","date":"2025-03-21","arxiv_id":"2503.16941","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-nonparametric-contextual-bandits","title":"Sparse Nonparametric Contextual Bandits","date":"2025-03-20","arxiv_id":"2503.16382","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-benchmark-for-online-learning-with","title":"A New Benchmark for Online Learning with Budget-Balancing Constraints","date":"2025-03-19","arxiv_id":"2503.14796","repositories_listed":0,"syntology":null},{"url":null,"slug":"bi-criteria-optimization-for-combinatorial","title":"Bi-Criteria Optimization for Combinatorial Bandits: Sublinear Regret and Constraint Violation under Bandit Feedback","date":"2025-03-15","arxiv_id":"2503.12285","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-dependent-regret-lower-bounds-for","title":"Variance-Dependent Regret Lower Bounds for Contextual Bandits","date":"2025-03-15","arxiv_id":"2503.12020","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiplayer-information-asymmetric-contextual","title":"Multiplayer Information Asymmetric Contextual Bandits","date":"2025-03-11","arxiv_id":"2503.08961","repositories_listed":0,"syntology":null},{"url":null,"slug":"cost-aware-optimal-pairwise-pure-exploration","title":"Cost-Aware Optimal Pairwise Pure Exploration","date":"2025-03-10","arxiv_id":"2503.07877","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-dependent-regret-bounds-in-multi-armed","title":"Graph-Dependent Regret Bounds in Multi-Armed Bandits with Interference","date":"2025-03-10","arxiv_id":"2503.07555","repositories_listed":0,"syntology":null},{"url":null,"slug":"greedy-algorithm-for-structured-bandits-a","title":"Greedy Algorithm for Structured Bandits: A Sharp Characterization of Asymptotic Success / Failure","date":"2025-03-06","arxiv_id":"2503.04010","repositories_listed":0,"syntology":null},{"url":null,"slug":"tight-gap-dependent-memory-regret-trade-off","title":"Tight Gap-Dependent Memory-Regret Trade-Off for Single-Pass Streaming Stochastic Multi-Armed Bandits","date":"2025-03-04","arxiv_id":"2503.02428","repositories_listed":0,"syntology":null},{"url":null,"slug":"2503-00509","title":"Functional multi-armed bandit and the best function identification problems","date":"2025-03-01","arxiv_id":"2503.00509","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolution-of-information-in-interactive","title":"Evolution of Information in Interactive Decision Making: A Case Study for Multi-Armed Bandits","date":"2025-03-01","arxiv_id":"2503.00273","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-parametric-batched-global-multi-armed","title":"Semi-Parametric Batched Global Multi-Armed Bandits with Covariates","date":"2025-03-01","arxiv_id":"2503.00565","repositories_listed":0,"syntology":null}],"record_sha256":"05d9c803834f757bb7e40f3af11041ab7205c9fd983d0afd3bd5093d8602d34d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}