{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multi-armed-bandits/papers/6","list_of":"/task/multi-armed-bandits","task":"Multi-Armed Bandits","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":6,"pages_in_order":13,"rows_per_page":100,"rows":[501,600],"of":1262,"counts":{"archive_papers_tagged":1262,"with_a_code_link":253,"where_syntology_ran_a_sample":55,"not_listed_spam_title":0,"listed":1262,"listed_where_code_ran":55,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":44,"every_run_a_failure_of_syntologys_instrument":11,"listed_with_a_run_with_no_instrument_failure":44,"listed_every_run_a_failure_of_syntologys_instrument":11,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multi-armed-bandits","prev":"/task/multi-armed-bandits/papers/5","next":"/task/multi-armed-bandits/papers/7","papers":[{"url":null,"slug":"thompson-sampling-for-zero-inflated-count","title":"Thompson sampling for zero-inflated count outcomes with an application to the Drink Less mobile health study","date":"2023-11-24","arxiv_id":"2311.14359","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-high-dimensional-bandit","title":"Provably Efficient High-Dimensional Bandit Learning with Batched Feedbacks","date":"2023-11-22","arxiv_id":"2311.13180","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-on-cooperative-multi","title":"Adversarial Attacks on Cooperative Multi-agent Bandits","date":"2023-11-03","arxiv_id":"2311.01698","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-generalized-low-rank-tensor","title":"Efficient Generalized Low-Rank Tensor Contextual Bandits","date":"2023-11-03","arxiv_id":"2311.01771","repositories_listed":0,"syntology":null},{"url":null,"slug":"llms-augmented-contextual-bandit","title":"LLMs-augmented Contextual Bandit","date":"2023-11-03","arxiv_id":"2311.02268","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-linear-bandits-with-finite","title":"Federated Linear Bandits with Finite Adversarial Actions","date":"2023-11-02","arxiv_id":"2311.00973","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-dimensional-linear-bandits-with","title":"High-dimensional Linear Bandits with Knapsacks","date":"2023-11-02","arxiv_id":"2311.01327","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-improved-relaxation-for-oracle-efficient","title":"An Improved Relaxation for Oracle-Efficient Adversarial Contextual Bandits","date":"2023-10-29","arxiv_id":"2310.19025","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-risk-averse-framework-for-non-stationary","title":"A Risk-Averse Framework for Non-Stationary Stochastic Multi-Armed Bandits","date":"2023-10-24","arxiv_id":"2310.19821","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-for-evaluating-and","title":"Contextual Bandits for Evaluating and Improving Inventory Control Policies","date":"2023-10-24","arxiv_id":"2310.16096","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-for-large-action-spaces-2","title":"Off-Policy Evaluation for Large Action Spaces via Policy Convolution","date":"2023-10-24","arxiv_id":"2310.15433","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-zero-shot-learning-in-restless-multi","title":"Towards a Pretrained Model for Restless Bandits via Multi-arm Generalization","date":"2023-10-23","arxiv_id":"2310.14526","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-fair-contextual-bandits","title":"$α$-Fair Contextual Bandits","date":"2023-10-22","arxiv_id":"2310.14164","repositories_listed":0,"syntology":null},{"url":null,"slug":"pure-exploration-in-asynchronous-federated","title":"Pure Exploration in Asynchronous Federated Bandits","date":"2023-10-17","arxiv_id":"2310.11015","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-heterogeneous-spillover-effects-in","title":"Leveraging heterogeneous spillover in maximizing contextual bandit rewards","date":"2023-10-16","arxiv_id":"2310.10259","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-are-bandits-robust-to-misspecification","title":"Bad Values but Good Behavior: Learning Highly Misspecified Bandits and MDPs","date":"2023-10-13","arxiv_id":"2310.09358","repositories_listed":0,"syntology":null},{"url":null,"slug":"byzantine-resilient-decentralized-multi-armed","title":"Byzantine-Resilient Decentralized Multi-Armed Bandits","date":"2023-10-11","arxiv_id":"2310.07320","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-stationary-contextual-bandit-learning-via","title":"Non-Stationary Contextual Bandit Learning via Neural Predictive Ensemble Sampling","date":"2023-10-11","arxiv_id":"2310.07786","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensemble-active-learning-by-contextual","title":"Ensemble Active Learning by Contextual Bandits for AI Incubation in Manufacturing","date":"2023-10-10","arxiv_id":"2310.06306","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-analysis-of-whittle-index-based-q","title":"Finite-Time Analysis of Whittle Index based Q-Learning for Restless Multi-Armed Bandits with Neural Network Function Approximation","date":"2023-10-03","arxiv_id":"2310.02147","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-algorithms-for-adversarial-bandits","title":"Improved Algorithms for Adversarial Bandits with Unbounded Losses","date":"2023-10-03","arxiv_id":"2310.01756","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-contextual-bandits-go-kernelized","title":"Adversarial Contextual Bandits Go Kernelized","date":"2023-10-02","arxiv_id":"2310.01609","repositories_listed":0,"syntology":null},{"url":null,"slug":"discrete-choice-multi-armed-bandits","title":"Discrete Choice Multi-Armed Bandits","date":"2023-10-01","arxiv_id":"2310.00562","repositories_listed":0,"syntology":null},{"url":null,"slug":"diversify-and-conquer-bandits-and-diversity","title":"Diversify and Conquer: Bandits and Diversity for an Enhanced E-commerce Homepage Experience","date":"2023-09-25","arxiv_id":"2309.14046","repositories_listed":0,"syntology":null},{"url":null,"slug":"follow-ups-also-matter-improving-contextual","title":"Follow-ups Also Matter: Improving Contextual Bandits via Post-serving Contexts","date":"2023-09-25","arxiv_id":"2309.13896","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-selection-and-assignment-for-multi-modal","title":"Task Selection and Assignment for Multi-modal Multi-task Dialogue Act Classification with Non-stationary Multi-armed Bandits","date":"2023-09-18","arxiv_id":"2309.09832","repositories_listed":0,"syntology":null},{"url":null,"slug":"wasserstein-distributionally-robust-policy","title":"Wasserstein Distributionally Robust Policy Evaluation and Learning for Contextual Bandits","date":"2023-09-15","arxiv_id":"2309.08748","repositories_listed":0,"syntology":null},{"url":null,"slug":"doubly-high-dimensional-contextual-bandits-an","title":"Doubly High-Dimensional Contextual Bandits: An Interpretable Model for Joint Assortment-Pricing","date":"2023-09-14","arxiv_id":"2309.08634","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-best-arm-evades-near-optimal-multi-pass","title":"The Best Arm Evades: Near-optimal Multi-pass Streaming Lower Bounds for Pure Exploration in Multi-armed Bandits","date":"2023-09-06","arxiv_id":"2309.03145","repositories_listed":0,"syntology":null},{"url":null,"slug":"bypassing-the-simulator-near-optimal","title":"Bypassing the Simulator: Near-Optimal Adversarial Linear Contextual Bandits","date":"2023-09-02","arxiv_id":"2309.00814","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-and-concentrated-differential","title":"Concentrated Differential Privacy for Bandits","date":"2023-09-01","arxiv_id":"2309.00557","repositories_listed":0,"syntology":null},{"url":null,"slug":"pure-exploration-under-mediators-feedback","title":"Pure Exploration under Mediators' Feedback","date":"2023-08-29","arxiv_id":"2308.15552","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-graph-bandit-learning-with-side","title":"Stochastic Graph Bandit Learning with Side-Observations","date":"2023-08-29","arxiv_id":"2308.15107","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-how-to-price-charging-in-electric","title":"Learning How to Price Charging in Electric Ride-Hailing Markets","date":"2023-08-25","arxiv_id":"2308.13460","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-uniformly-optimal-algorithms-for-best-arm","title":"On Universally Optimal Algorithms for A/B Testing","date":"2023-08-23","arxiv_id":"2308.12000","repositories_listed":0,"syntology":null},{"url":null,"slug":"clustered-linear-contextual-bandits-with","title":"Clustered Linear Contextual Bandits with Knapsacks","date":"2023-08-21","arxiv_id":"2308.10722","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-neural-bandits","title":"Graph Neural Bandits","date":"2023-08-21","arxiv_id":"2308.10808","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptex-a-self-service-contextual-bandit","title":"AdaptEx: A Self-Service Contextual Bandit Platform","date":"2023-08-08","arxiv_id":"2308.08650","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-bandits-distributed","title":"Cooperative Multi-agent Bandits: Distributed Algorithms with Optimal Individual Regret and Constant Communication Costs","date":"2023-08-08","arxiv_id":"2308.04314","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-learning-in-partially","title":"Transfer Learning with Partially Observable Offline Data via Causal Bounds","date":"2023-08-07","arxiv_id":"2308.03572","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-and-imitation-learning-via","title":"Contextual Bandits and Imitation Learning via Preference-Based Active Queries","date":"2023-07-24","arxiv_id":"2307.12926","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-benefits-of-policy-learning-from","title":"Provable Benefits of Policy Learning from Human Preferences in Contextual Bandit Problems","date":"2023-07-24","arxiv_id":"2307.12975","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandits-with-deterministically-evolving","title":"Preferences Evolve And So Should Your Bandits: Bandits with Evolving States for Online Platforms","date":"2023-07-21","arxiv_id":"2307.11655","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-smart-charging-of-large-scale","title":"Decentralized Smart Charging of Large-Scale EVs using Adaptive Multi-Agent Multi-Armed Bandits","date":"2023-07-20","arxiv_id":"2307.10704","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-interpolating-experts-and-multi-armed","title":"On Interpolating Experts and Multi-Armed Bandits","date":"2023-07-14","arxiv_id":"2307.07264","repositories_listed":0,"syntology":null},{"url":null,"slug":"tracking-most-significant-shifts-in","title":"Tracking Most Significant Shifts in Nonparametric Contextual Bandits","date":"2023-07-11","arxiv_id":"2307.05341","repositories_listed":0,"syntology":null},{"url":null,"slug":"shap-k-efficient-and-probably-approximately","title":"SHAP@k:Efficient and Probably Approximately Correct (PAC) Identification of Top-k Features","date":"2023-07-10","arxiv_id":"2307.04850","repositories_listed":0,"syntology":null},{"url":null,"slug":"bof-ucb-a-bayesian-optimistic-frequentist","title":"BOF-UCB: A Bayesian-Optimistic Frequentist Algorithm for Non-Stationary Contextual Bandits","date":"2023-07-07","arxiv_id":"2307.03587","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learning-adversarial-bandit-algorithms","title":"Meta-Learning Adversarial Bandit Algorithms","date":"2023-07-05","arxiv_id":"2307.02295","repositories_listed":0,"syntology":null},{"url":null,"slug":"proportional-response-contextual-bandits-for","title":"Proportional Response: Contextual Bandits for Simple and Cumulative Regret Minimization","date":"2023-07-05","arxiv_id":"2307.02108","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-improved-exploration-in","title":"Thompson sampling for improved exploration in GFlowNets","date":"2023-06-30","arxiv_id":"2306.17693","repositories_listed":0,"syntology":null},{"url":null,"slug":"kernel-e-greedy-for-contextual-bandits","title":"Kernel $ε$-Greedy for Multi-Armed Bandits with Covariates","date":"2023-06-29","arxiv_id":"2306.17329","repositories_listed":0,"syntology":null},{"url":null,"slug":"pure-exploration-in-multi-armed-bandits-with-1","title":"Pure exploration in multi-armed bandits with low rank structure using oblivious sampler","date":"2023-06-28","arxiv_id":"2306.15856","repositories_listed":0,"syntology":null},{"url":null,"slug":"you-can-trade-your-experience-in-distributed","title":"You Can Trade Your Experience in Distributed Multi-Agent Multi-Armed Bandits","date":"2023-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"langevin-thompson-sampling-with-logarithmic","title":"Langevin Thompson Sampling with Logarithmic Communication: Bandits and Reinforcement Learning","date":"2023-06-15","arxiv_id":"2306.08803","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-fidelity-multi-armed-bandits-revisited","title":"Multi-Fidelity Multi-Armed Bandits Revisited","date":"2023-06-13","arxiv_id":"2306.07761","repositories_listed":0,"syntology":null},{"url":null,"slug":"oracle-efficient-pessimism-offline-policy","title":"Oracle-Efficient Pessimism: Offline Policy Optimization in Contextual Bandits","date":"2023-06-13","arxiv_id":"2306.07923","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-heterogeneous-collaborative-linear","title":"Optimal Multitask Linear Regression and Contextual Bandits under Sparse Heterogeneity","date":"2023-06-09","arxiv_id":"2306.06291","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-linear-contextual-bandits-with-user","title":"Federated Linear Contextual Bandits with User-level Differential Privacy","date":"2023-06-08","arxiv_id":"2306.05275","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentially-private-episodic-reinforcement","title":"Differentially Private Episodic Reinforcement Learning with Heavy-tailed Rewards","date":"2023-06-01","arxiv_id":"2306.01121","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-driven-reinforcement-learning","title":"Representation-Driven Reinforcement Learning","date":"2023-05-31","arxiv_id":"2305.19922","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-multi-agent-heterogeneous-multi","title":"Collaborative Multi-Agent Heterogeneous Multi-Armed Bandits","date":"2023-05-30","arxiv_id":"2305.18784","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-with-budgeted-information","title":"Contextual Bandits with Budgeted Information Reveal","date":"2023-05-29","arxiv_id":"2305.18511","repositories_listed":0,"syntology":null},{"url":null,"slug":"small-total-cost-constraints-in-contextual","title":"Small Total-Cost Constraints in Contextual Bandits with Knapsacks, with Application to Fairness","date":"2023-05-25","arxiv_id":"2305.15807","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-best-arm-identification-with","title":"Sequential Best-Arm Identification with Application to Brain-Computer Interface","date":"2023-05-17","arxiv_id":"2305.11908","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-training-of-multi-task-neural","title":"Efficient Training of Multi-task Combinarotial Neural Solver with Multi-armed Bandits","date":"2023-05-10","arxiv_id":"2305.06361","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-teaching-for-federated-multi-armed","title":"Reward Teaching for Federated Multi-armed Bandits","date":"2023-05-03","arxiv_id":"2305.02441","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-contextual-bandits-with-graph","title":"Stochastic Contextual Bandits with Graph-based Contexts","date":"2023-05-02","arxiv_id":"2305.01470","repositories_listed":0,"syntology":null},{"url":null,"slug":"first-and-second-order-bounds-for-adversarial","title":"First- and Second-Order Bounds for Adversarial Linear Contextual Bandits","date":"2023-05-01","arxiv_id":"2305.00832","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-regret-bounds-for","title":"Thompson Sampling Regret Bounds for Contextual Bandits with sub-Gaussian rewards","date":"2023-04-26","arxiv_id":"2304.13593","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-activation-of-halting-multi-armed","title":"Optimal Activation of Halting Multi-Armed Bandit Models","date":"2023-04-20","arxiv_id":"2304.10302","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-personalized-decision-support","title":"Learning Personalized Decision Support Policies","date":"2023-04-13","arxiv_id":"2304.06701","repositories_listed":0,"syntology":null},{"url":null,"slug":"smartchoices-augmenting-software-with-learned","title":"SmartChoices: Augmenting Software with Learned Implementations","date":"2023-04-12","arxiv_id":"2304.13033","repositories_listed":0,"syntology":null},{"url":null,"slug":"banditq-no-regret-learning-with-guaranteed","title":"BanditQ: Fair Bandits with Guaranteed Rewards","date":"2023-04-11","arxiv_id":"2304.05219","repositories_listed":0,"syntology":null},{"url":null,"slug":"full-gradient-deep-reinforcement-learning-for","title":"Full Gradient Deep Reinforcement Learning for Average-Reward Criterion","date":"2023-04-07","arxiv_id":"2304.03729","repositories_listed":0,"syntology":null},{"url":null,"slug":"sharp-deviations-bounds-for-dirichlet","title":"Sharp Deviations Bounds for Dirichlet Weighted Sums with Application to analysis of Bayesian algorithms","date":"2023-04-06","arxiv_id":"2304.03056","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-stochastic-bandit-learning-with","title":"Federated Learning for Heterogeneous Bandits with Unobserved Contexts","date":"2023-03-29","arxiv_id":"2303.17043","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-endpointing-with-deep-contextual","title":"Adaptive Endpointing with Deep Contextual Multi-armed Bandits","date":"2023-03-23","arxiv_id":"2303.13407","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-interplay-between-misspecification-and","title":"On the Interplay Between Misspecification and Sub-optimality Gap in Linear Contextual Bandits","date":"2023-03-16","arxiv_id":"2303.09390","repositories_listed":0,"syntology":null},{"url":null,"slug":"only-pay-for-what-is-uncertain-variance","title":"Only Pay for What Is Uncertain: Variance-Adaptive Thompson Sampling","date":"2023-03-16","arxiv_id":"2303.09033","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-dependent-regret-guarantees-against","title":"Data Dependent Regret Guarantees Against General Comparators for Full or Bandit Feedback","date":"2023-03-12","arxiv_id":"2303.06526","repositories_listed":0,"syntology":null},{"url":null,"slug":"queue-scheduling-with-adversarial-bandit","title":"Queue Scheduling with Adversarial Bandit Learning","date":"2023-03-03","arxiv_id":"2303.01745","repositories_listed":0,"syntology":null},{"url":null,"slug":"fairness-for-workers-who-pull-the-arms-an","title":"Fairness for Workers Who Pull the Arms: An Index Based Policy for Allocation of Restless Bandit Tasks","date":"2023-03-01","arxiv_id":"2303.00799","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-armed-bandits-with-generalized","title":"Multi-Armed Bandits with Generalized Temporally-Partitioned Rewards","date":"2023-03-01","arxiv_id":"2303.00620","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximately-stationary-bandits-with","title":"Approximately Stationary Bandits with Knapsacks","date":"2023-02-28","arxiv_id":"2302.14686","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotically-optimal-thompson-sampling","title":"The Choice of Noninformative Priors for Thompson Sampling in Multiparameter Bandit Models","date":"2023-02-28","arxiv_id":"2302.14407","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-best-of-both-worlds-guarantees-for","title":"Improved Best-of-Both-Worlds Guarantees for Multi-Armed Bandits: FTRL with General Regularizers and Multiple Optimal Arms","date":"2023-02-27","arxiv_id":"2302.13534","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-differentially-private-federated-linear","title":"On Differentially Private Federated Linear Contextual Bandits","date":"2023-02-27","arxiv_id":"2302.13945","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-velocity-estimation-using-light","title":"Active Velocity Estimation using Light Curtains via Self-Supervised Multi-Armed Bandits","date":"2023-02-24","arxiv_id":"2302.12597","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotically-unbiased-off-policy-policy","title":"Asymptotically Unbiased Off-Policy Policy Evaluation when Reusing Old Data in Nonstationary Environments","date":"2023-02-23","arxiv_id":"2302.11725","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-dependent-regret-bounds-for-linear","title":"Variance-Dependent Regret Bounds for Linear Bandits and Reinforcement Learning: Adaptivity and Computational Efficiency","date":"2023-02-21","arxiv_id":"2302.10371","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-blackbox-approach-to-best-of-both-worlds-in","title":"A Blackbox Approach to Best of Both Worlds in Bandits and Beyond","date":"2023-02-20","arxiv_id":"2302.09739","repositories_listed":0,"syntology":null},{"url":null,"slug":"estimating-optimal-policy-value-in-general","title":"Estimating Optimal Policy Value in General Linear Contextual Bandits","date":"2023-02-19","arxiv_id":"2302.09451","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-fairness-in-adaptive-social","title":"Improving Fairness in Adaptive Social Exergames via Shapley Bandits","date":"2023-02-18","arxiv_id":"2302.09298","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-continuous-hyperparameter-optimization","title":"Online Continuous Hyperparameter Optimization for Generalized Linear Contextual Bandits","date":"2023-02-18","arxiv_id":"2302.09440","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-approximation-approaches-to-group","title":"Stochastic Approximation Approaches to Group Distributionally Robust Optimization and Beyond","date":"2023-02-18","arxiv_id":"2302.09267","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-feedback-via-reduction-to-regression","title":"Practical Contextual Bandits with Feedback Graphs","date":"2023-02-17","arxiv_id":"2302.08631","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandit-social-learning-exploration-under","title":"Bandit Social Learning: Exploration under Myopic Behavior","date":"2023-02-15","arxiv_id":"2302.07425","repositories_listed":0,"syntology":null},{"url":null,"slug":"genetic-multi-armed-bandits-a-reinforcement","title":"Genetic multi-armed bandits: a reinforcement learning approach for discrete optimization via simulation","date":"2023-02-15","arxiv_id":"2302.07695","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-stationary-contextual-bandits-and","title":"Adversarial Rewards in Universal Learning for Contextual Bandits","date":"2023-02-14","arxiv_id":"2302.07186","repositories_listed":0,"syntology":null}],"record_sha256":"03bd6cd5e9698937716a3088576bc77eb06934cf50e902702e60eb0312d93b54","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}