{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multi-armed-bandits/papers/11","list_of":"/task/multi-armed-bandits","task":"Multi-Armed Bandits","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":11,"pages_in_order":13,"rows_per_page":100,"rows":[1001,1100],"of":1262,"counts":{"archive_papers_tagged":1262,"with_a_code_link":253,"where_syntology_ran_a_sample":55,"not_listed_spam_title":0,"listed":1262,"listed_where_code_ran":55,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":44,"every_run_a_failure_of_syntologys_instrument":11,"listed_with_a_run_with_no_instrument_failure":44,"listed_every_run_a_failure_of_syntologys_instrument":11,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multi-armed-bandits","prev":"/task/multi-armed-bandits/papers/10","next":"/task/multi-armed-bandits/papers/12","papers":[{"url":null,"slug":"distributionally-robust-policy-evaluation-and","title":"Distributionally Robust Policy Evaluation and Learning in Offline Contextual Bandits","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-through-bias-revisiting-biased","title":"Exploration Through Bias: Revisiting Biased Maximum Likelihood Estimation in Stochastic Multi-Armed Bandits","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"gradient-free-online-learning-in-continuous","title":"Gradient-free Online Learning in Continuous Games with Delayed Rewards","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fair-contextual-multi-armed-bandits-theory","title":"Fair Contextual Multi-Armed Bandits: Theory and Experiments","date":"2019-12-13","arxiv_id":"1912.08055","repositories_listed":0,"syntology":null},{"url":null,"slug":"sublinear-optimal-policy-value-estimation-in","title":"Sublinear Optimal Policy Value Estimation in Contextual Bandits","date":"2019-12-12","arxiv_id":"1912.06111","repositories_listed":0,"syntology":null},{"url":null,"slug":"epsilon-best-arm-identification-in-pay-per","title":"Epsilon-Best-Arm Identification in Pay-Per-Reward Multi-Armed Bandits","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-in-generalized-linear-contextual","title":"Learning in Generalized Linear Contextual Bandits with Stochastic Delays","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"nonparametric-contextual-bandits-in-metric","title":"Nonparametric Contextual Bandits in Metric Spaces with Unknown Metric","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"surrogate-objectives-for-batch-policy","title":"Surrogate Objectives for Batch Policy Optimization in One-step Decision Making","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-combinatorial-conservative-bandits","title":"Contextual Combinatorial Conservative Bandits","date":"2019-11-26","arxiv_id":"1911.11337","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-ensemble-learning-for-online","title":"Automatic Ensemble Learning for Online Influence Maximization","date":"2019-11-25","arxiv_id":"1911.10728","repositories_listed":0,"syntology":null},{"url":null,"slug":"corruption-robust-exploration-in-episodic","title":"Corruption-robust exploration in episodic reinforcement learning","date":"2019-11-20","arxiv_id":"1911.08689","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-evolving-over-finite-time","title":"Contextual Bandits Evolving Over Finite Time","date":"2019-11-14","arxiv_id":"1911.05956","repositories_listed":0,"syntology":null},{"url":null,"slug":"unreliable-multi-armed-bandits-a-novel","title":"Unreliable Multi-Armed Bandits: A Novel Approach to Recommendation Systems","date":"2019-11-14","arxiv_id":"1911.06239","repositories_listed":0,"syntology":null},{"url":null,"slug":"triply-robust-off-policy-evaluation","title":"Triply Robust Off-Policy Evaluation","date":"2019-11-13","arxiv_id":"1911.05811","repositories_listed":0,"syntology":null},{"url":null,"slug":"incentivized-exploration-for-multi-armed","title":"Incentivized Exploration for Multi-Armed Bandits under Reward Drift","date":"2019-11-12","arxiv_id":"1911.05142","repositories_listed":0,"syntology":null},{"url":null,"slug":"problem-dependent-reinforcement-learning-1","title":"Problem Dependent Reinforcement Learning Bounds Which Can Identify Bandit Structure in MDPs","date":"2019-11-03","arxiv_id":"1911.00954","repositories_listed":0,"syntology":null},{"url":null,"slug":"trend-responsive-user-segmentation-enabling","title":"Trend-responsive User Segmentation Enabling Traceable Publishing Insights. A Case Study of a Real-world Large-scale News Recommendation System","date":"2019-10-28","arxiv_id":"1911.11070","repositories_listed":0,"syntology":null},{"url":null,"slug":"banditrank-learning-to-rank-using-contextual","title":"BanditRank: Learning to Rank Using Contextual Bandits","date":"2019-10-23","arxiv_id":"1910.10410","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-player-multi-armed-bandits-with-non","title":"Decentralized Heterogeneous Multi-Player Multi-Armed Bandits with Non-Zero Rewards on Collisions","date":"2019-10-21","arxiv_id":"1910.09089","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-user-mabs-with-user-dependent-rewards","title":"Multi-User MABs with User Dependent Rewards for Uncoordinated Spectrum Access","date":"2019-10-21","arxiv_id":"1910.09091","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-exploration-in-linear-contextual","title":"Adaptive Exploration in Linear Contextual Bandit","date":"2019-10-15","arxiv_id":"1910.06996","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-optimal-algorithm-for-adversarial-bandits","title":"An Optimal Algorithm for Adversarial Bandits with Arbitrary Delays","date":"2019-10-14","arxiv_id":"1910.06054","repositories_listed":0,"syntology":null},{"url":null,"slug":"batched-multi-armed-bandits-with-optimal","title":"Regret Bounds for Batched Bandits","date":"2019-10-11","arxiv_id":"1910.04959","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-preserving-contextual-bandits","title":"Privacy-Preserving Multi-Party Contextual Bandits","date":"2019-10-11","arxiv_id":"1910.05299","repositories_listed":0,"syntology":null},{"url":null,"slug":"social-learning-in-multi-agent-multi-armed","title":"Social Learning in Multi Agent Multi Armed Bandits","date":"2019-10-04","arxiv_id":"1910.02100","repositories_listed":0,"syntology":null},{"url":null,"slug":"decision-automation-for-electric-power","title":"Decision Automation for Electric Power Network Recovery","date":"2019-10-01","arxiv_id":"1910.00699","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-optimal-algorithm-in-multiplayer-multi","title":"An Optimal Algorithm for Multiplayer Multi-Armed Bandits","date":"2019-09-28","arxiv_id":"1909.13079","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-effective-exploration-strategies-for","title":"Learning Effective Exploration Strategies For Contextual Bandits","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neuralucb-contextual-bandits-with-neural","title":"NeuralUCB: Contextual Bandits with Neural Network-Based Exploration","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"automl-for-contextual-bandits","title":"AutoML for Contextual Bandits","date":"2019-09-07","arxiv_id":"1909.03212","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-near-optimal-change-detection-based","title":"A Near-Optimal Change-Detection Based Algorithm for Piecewise-Stationary Combinatorial Semi-Bandits","date":"2019-08-27","arxiv_id":"1908.10402","repositories_listed":0,"syntology":null},{"url":null,"slug":"nonparametric-contextual-bandits-in-an","title":"Nonparametric Contextual Bandits in an Unknown Metric Space","date":"2019-08-03","arxiv_id":"1908.01228","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameterized-exploration","title":"Parameterized Exploration","date":"2019-07-13","arxiv_id":"1907.06090","repositories_listed":0,"syntology":null},{"url":null,"slug":"productization-challenges-of-contextual-multi","title":"Productization Challenges of Contextual Multi-Armed Bandits","date":"2019-07-10","arxiv_id":"1907.04884","repositories_listed":0,"syntology":null},{"url":null,"slug":"individual-regret-in-cooperative","title":"Individual Regret in Cooperative Nonstochastic Multi-Armed Bandits","date":"2019-07-07","arxiv_id":"1907.03346","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandit-learning-through-biased-maximum","title":"Exploration Through Reward Biasing: Reward-Biased Maximum Likelihood Estimation for Stochastic Multi-Armed Bandits","date":"2019-07-02","arxiv_id":"1907.01287","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-fairness","title":"Multi-Armed Bandits with Fairness Constraints for Distributing Resources to Human Teammates","date":"2019-06-30","arxiv_id":"1907.00313","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-in-restless-multi-armed-bandits-via","title":"Learning in Restless Multi-Armed Bandits via Adaptive Arm Sequencing Rules","date":"2019-06-19","arxiv_id":"1906.08120","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-allocation-and-pricing-constant-regret","title":"Online Allocation and Pricing: Constant Regret via Bellman Inequalities","date":"2019-06-14","arxiv_id":"1906.06361","repositories_listed":0,"syntology":null},{"url":null,"slug":"bootstrapping-upper-confidence-bound","title":"Bootstrapping Upper Confidence Bound","date":"2019-06-12","arxiv_id":"1906.05247","repositories_listed":0,"syntology":null},{"url":null,"slug":"competing-bandits-in-matching-markets","title":"Competing Bandits in Matching Markets","date":"2019-06-12","arxiv_id":"1906.05363","repositories_listed":0,"syntology":null},{"url":null,"slug":"beam-learning-using-machine-learning-for","title":"Beam Learning -- Using Machine Learning for Finding Beam Directions","date":"2019-06-11","arxiv_id":"1906.04368","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-neural-network-with-kronecker-flow","title":"Stochastic Neural Network with Kronecker Flow","date":"2019-06-10","arxiv_id":"1906.04282","repositories_listed":0,"syntology":null},{"url":null,"slug":"distribution-dependent-and-time-uniform","title":"Distribution-dependent and Time-uniform Bounds for Piecewise i.i.d Bandits","date":"2019-05-30","arxiv_id":"1905.13159","repositories_listed":0,"syntology":null},{"url":null,"slug":"equipping-expertsbandits-with-long-term","title":"Equipping Experts/Bandits with Long-term Memory","date":"2019-05-30","arxiv_id":"1905.12950","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-generalized-linear-bandits","title":"Multi-Objective Generalized Linear Bandits","date":"2019-05-30","arxiv_id":"1905.12879","repositories_listed":0,"syntology":null},{"url":null,"slug":"rarely-switching-linear-bandits-optimization","title":"Rarely-switching linear bandits: optimization of causal effects for the real world","date":"2019-05-30","arxiv_id":"1905.13121","repositories_listed":0,"syntology":null},{"url":null,"slug":"differential-privacy-for-multi-armed-bandits","title":"Differential Privacy for Multi-armed Bandits: What Is It and What Is Its Cost?","date":"2019-05-29","arxiv_id":"1905.12298","repositories_listed":0,"syntology":null},{"url":null,"slug":"combinatorial-bandits-with-full-bandit","title":"Top-k Combinatorial Bandits with Full-Bandit Feedback","date":"2019-05-28","arxiv_id":"1905.12624","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-multi-armed-bandits-with-arm","title":"Achieving Fairness in Stochastic Multi-armed Bandit Problem","date":"2019-05-27","arxiv_id":"1905.11260","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-bias-of-the-sample-mean-in-multi-armed","title":"Are sample means in multi-armed bandits positively or negatively biased?","date":"2019-05-27","arxiv_id":"1905.11397","repositories_listed":0,"syntology":null},{"url":null,"slug":"osom-a-simultaneously-optimal-algorithm-for","title":"OSOM: A simultaneously optimal algorithm for multi-armed and linear contextual bandits","date":"2019-05-24","arxiv_id":"1905.10040","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-poisoning-attacks-on-stochastic-bandits","title":"Data Poisoning Attacks on Stochastic Bandits","date":"2019-05-16","arxiv_id":"1905.06494","repositories_listed":0,"syntology":null},{"url":null,"slug":"lessons-from-real-world-reinforcement","title":"Lessons from Contextual Bandit Learning in a Customer Support Bot","date":"2019-05-06","arxiv_id":"1905.02219","repositories_listed":0,"syntology":null},{"url":null,"slug":"tight-regret-bounds-for-infinite-armed-linear","title":"Tight Regret Bounds for Infinite-armed Linear Contextual Bandits","date":"2019-05-04","arxiv_id":"1905.01435","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learners-learning-dynamics-are-unlike","title":"Meta-learners' learning dynamics are unlike learners'","date":"2019-05-03","arxiv_id":"1905.01320","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-stochastic-multi-player-multi-armed","title":"Non-Stochastic Multi-Player Multi-Armed Bandits: Optimal Rate With Collision Information, Sublinear Without","date":"2019-04-28","arxiv_id":"1904.12233","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-decision-making-under-uncertainty","title":"Constrained Restless Bandits for Dynamic Scheduling in Cyber-Physical Systems","date":"2019-04-18","arxiv_id":"1904.08962","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-bandit-learning-how-much","title":"Distributed Bandit Learning: Near-Optimal Regret with Efficient Communication","date":"2019-04-12","arxiv_id":"1904.06309","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-learning-with-limited","title":"Collaborative Learning with Limited Interaction: Tight Bounds for Distributed Exploration in Multi-Armed Bandits","date":"2019-04-05","arxiv_id":"1904.03293","repositories_listed":0,"syntology":null},{"url":null,"slug":"190410040","title":"A Survey on Practical Applications of Multi-Armed and Contextual Bandits","date":"2019-04-02","arxiv_id":"1904.10040","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearly-minimax-optimal-regret-for-linearly","title":"Nearly Minimax-Optimal Regret for Linearly Parameterized Bandits","date":"2019-03-30","arxiv_id":"1904.00242","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learning-surrogate-models-for-sequential","title":"Meta-Learning surrogate models for sequential decision making","date":"2019-03-28","arxiv_id":"1903.11907","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-with-random-projection","title":"Contextual Bandits with Random Projection","date":"2019-03-20","arxiv_id":"1903.08600","repositories_listed":0,"syntology":null},{"url":null,"slug":"perturbed-history-exploration-in-stochastic","title":"Perturbed-History Exploration in Stochastic Multi-Armed Bandits","date":"2019-02-26","arxiv_id":"1902.10089","repositories_listed":0,"syntology":null},{"url":null,"slug":"better-algorithms-for-stochastic-bandits-with","title":"Better Algorithms for Stochastic Bandits with Adversarial Corruptions","date":"2019-02-22","arxiv_id":"1902.08647","repositories_listed":0,"syntology":null},{"url":null,"slug":"adalinucb-opportunistic-learning-for","title":"AdaLinUCB: Opportunistic Learning for Contextual Bandits","date":"2019-02-20","arxiv_id":"1902.07802","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-with-continuous-actions","title":"Contextual Bandits with Continuous Actions: Smoothing, Zooming, and Adapting","date":"2019-02-05","arxiv_id":"1902.01520","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-algorithm-for-non-stationary-contextual","title":"A New Algorithm for Non-stationary Contextual Bandits: Efficient, Optimal, and Parameter-free","date":"2019-02-03","arxiv_id":"1902.00980","repositories_listed":0,"syntology":null},{"url":null,"slug":"randomized-allocation-with-nonparametric","title":"Randomized Allocation with Nonparametric Estimation for Contextual Multi-Armed Bandits with Delayed Rewards","date":"2019-02-03","arxiv_id":"1902.00819","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-bias-risk-and-consistency-of-sample","title":"On the bias, risk and consistency of sample means in multi-armed bandits","date":"2019-02-02","arxiv_id":"1902.00746","repositories_listed":0,"syntology":null},{"url":null,"slug":"target-tracking-for-contextual-bandits","title":"Target Tracking for Contextual Bandits: Application to Demand Side Management","date":"2019-01-28","arxiv_id":"1901.09532","repositories_listed":0,"syntology":null},{"url":null,"slug":"almost-boltzmann-exploration","title":"Almost Boltzmann Exploration","date":"2019-01-25","arxiv_id":"1901.08708","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-neural-linear-bandits-overcoming","title":"Deep Neural Linear Bandits: Overcoming Catastrophic Forgetting through Likelihood Matching","date":"2019-01-24","arxiv_id":"1901.08612","repositories_listed":0,"syntology":null},{"url":null,"slug":"pac-identification-of-many-good-arms-in","title":"PAC Identification of Many Good Arms in Stochastic Multi-Armed Bandits","date":"2019-01-24","arxiv_id":"1901.08386","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-minimisation-in-multi-armed-bandits","title":"Regret Minimisation in Multi-Armed Bandits Using Bounded Arm Memory","date":"2019-01-24","arxiv_id":"1901.08387","repositories_listed":0,"syntology":null},{"url":null,"slug":"parallel-contextual-bandits-in-wireless","title":"Parallel Contextual Bandits in Wireless Handover Optimization","date":"2019-01-21","arxiv_id":"1902.01931","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-regularized-offline-learning","title":"Imitation-Regularized Offline Learning","date":"2019-01-15","arxiv_id":"1901.04723","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-aware-multi-armed-bandits-using","title":"Concentration bounds for CVaR estimation: The cases of light-tailed and heavy-tailed distributions","date":"2019-01-04","arxiv_id":"1901.00997","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-learning-and-stable","title":"Multi-player Multi-armed Bandits for Stable Allocation in Heterogeneous Ad-Hoc Networks","date":"2018-12-24","arxiv_id":"1812.11651","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-ai-learning-performance-in-multi-armed","title":"Human-AI Learning Performance in Multi-Armed Bandits","date":"2018-12-21","arxiv_id":"1812.09376","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-decisioning-meta-heuristic-framework","title":"Generalizable Meta-Heuristic based on Temporal Estimation of Rewards for Large Scale Blackbox Optimization","date":"2018-12-17","arxiv_id":"1812.06585","repositories_listed":0,"syntology":null},{"url":null,"slug":"balanced-linear-contextual-bandits","title":"Balanced Linear Contextual Bandits","date":"2018-12-15","arxiv_id":"1812.06227","repositories_listed":0,"syntology":null},{"url":null,"slug":"adares-adaptive-resource-management-for","title":"ADARES: Adaptive Resource Management for Virtual Machines","date":"2018-12-05","arxiv_id":"1812.01837","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bandit-approach-to-sequential-experimental","title":"A Bandit Approach to Sequential Experimental Design with False Discovery Control","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-combinatorial-multi-armed-bandits","title":"Contextual Combinatorial Multi-armed Bandits with Volatile Arms and Submodular Reward","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"why-so-gloomy-a-bayesian-explanation-of-human","title":"Why so gloomy? A Bayesian explanation of human pessimism bias in the multi-armed bandit task","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-bounds-for-stochastic-combinatorial","title":"Stochastic Top-$K$ Subset Bandits with Linear Space and Non-Linear Feedback","date":"2018-11-29","arxiv_id":"1811.11925","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-bandits-with-knapsacks","title":"Adversarial Bandits with Knapsacks","date":"2018-11-28","arxiv_id":"1811.11881","repositories_listed":0,"syntology":null},{"url":null,"slug":"kernel-based-multi-task-contextual-bandits-in","title":"Kernel-based Multi-Task Contextual Bandits in Cellular Network Configuration","date":"2018-11-27","arxiv_id":"1811.10902","repositories_listed":0,"syntology":null},{"url":null,"slug":"rotting-bandits-are-no-harder-than-stochastic","title":"Rotting bandits are not harder than stochastic ones","date":"2018-11-27","arxiv_id":"1811.11043","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandits-with-temporal-stochastic-constraints","title":"Bandits with Temporal Stochastic Constraints","date":"2018-11-22","arxiv_id":"1811.09026","repositories_listed":0,"syntology":null},{"url":null,"slug":"best-arm-identification-in-linked-bandits","title":"Best Arm Identification in Linked Bandits","date":"2018-11-19","arxiv_id":"1811.07476","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-exploration-in-multi-armed","title":"Decentralized Exploration in Multi-Armed Bandits -- Extended version","date":"2018-11-19","arxiv_id":"1811.07763","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-complexity-of-partition-identification","title":"Sample complexity of partition identification using multi-armed bandits","date":"2018-11-14","arxiv_id":"1811.05654","repositories_listed":0,"syntology":null},{"url":null,"slug":"garbage-in-reward-out-bootstrapping","title":"Garbage In, Reward Out: Bootstrapping Exploration in Multi-Armed Bandits","date":"2018-11-13","arxiv_id":"1811.05154","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-armed-bandits-with-compensation","title":"Multi-armed Bandits with Compensation","date":"2018-11-05","arxiv_id":"1811.01715","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-learning-with-feedback-graphs-and","title":"Online learning with feedback graphs and switching costs","date":"2018-10-23","arxiv_id":"1810.09666","repositories_listed":0,"syntology":null},{"url":null,"slug":"simple-regret-minimization-for-contextual","title":"Simple Regret Minimization for Contextual Bandits","date":"2018-10-17","arxiv_id":"1810.07371","repositories_listed":0,"syntology":null}],"record_sha256":"2c1baa0a92c32483ecb7e0b0326ca397af6d6f6cda9c033b4d2ef1c0a99a0226","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}