{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multi-armed-bandits/papers/4","list_of":"/task/multi-armed-bandits","task":"Multi-Armed Bandits","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":4,"pages_in_order":13,"rows_per_page":100,"rows":[301,400],"of":1262,"counts":{"archive_papers_tagged":1262,"with_a_code_link":253,"where_syntology_ran_a_sample":55,"not_listed_spam_title":0,"listed":1262,"listed_where_code_ran":55,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":44,"every_run_a_failure_of_syntologys_instrument":11,"listed_with_a_run_with_no_instrument_failure":44,"listed_every_run_a_failure_of_syntologys_instrument":11,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multi-armed-bandits","prev":"/task/multi-armed-bandits/papers/3","next":"/task/multi-armed-bandits/papers/5","papers":[{"url":null,"slug":"towards-understanding-the-benefit-of","title":"Towards Understanding the Benefit of Multitask Representation Learning in Decision Process","date":"2025-03-01","arxiv_id":"2503.00345","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reasoner-dynamic-guidance-for-optimized","title":"Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models","date":"2025-02-27","arxiv_id":"2502.19918","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-multi-agent-bandits-with","title":"Heterogeneous Multi-Agent Bandits with Parsimonious Hints","date":"2025-02-22","arxiv_id":"2502.16128","repositories_listed":0,"syntology":null},{"url":null,"slug":"achieving-adaptivity-and-optimality-for-multi","title":"Achieving adaptivity and optimality for multi-armed bandits using Exponential-Kullback Leibler Maillard Sampling","date":"2025-02-20","arxiv_id":"2502.14379","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-k-max-bandits","title":"Continuous K-Max Bandits","date":"2025-02-19","arxiv_id":"2502.13467","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-and-optimal-policy-gradient","title":"Efficient and Optimal Policy Gradient Algorithm for Corrupted Multi-armed Bandits","date":"2025-02-19","arxiv_id":"2502.14146","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-linear-bandits-with-delay-as","title":"Contextual Linear Bandits with Delay as Payoff","date":"2025-02-18","arxiv_id":"2502.12528","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-selection-for-behavioral-learning-data","title":"Model selection for behavioral learning data and applications to contextual bandits","date":"2025-02-18","arxiv_id":"2502.13186","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-private-learning-in-linear","title":"Near-Optimal Private Learning in Linear Contextual Bandits","date":"2025-02-18","arxiv_id":"2502.13115","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-offline-contextual-bandits-with","title":"Improved Offline Contextual Bandits with Second-Order Bounds: Betting and Freezing","date":"2025-02-15","arxiv_id":"2502.10826","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-multi-agent-multi-armed-bandits","title":"Heterogeneous Multi-agent Multi-armed Bandits on Stochastic Block Models","date":"2025-02-11","arxiv_id":"2502.08003","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-rlhf-pipeline-a-unified","title":"Provably Efficient RLHF Pipeline: A Unified View from Contextual Bandits","date":"2025-02-11","arxiv_id":"2502.07193","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantile-multi-armed-bandits-with-1-bit","title":"Quantile Multi-Armed Bandits with 1-bit Feedback","date":"2025-02-10","arxiv_id":"2502.06678","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearly-optimal-sample-complexity-of-offline","title":"Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits","date":"2025-02-09","arxiv_id":"2502.06051","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearly-tight-bounds-for-cross-learning","title":"Nearly Tight Bounds for Cross-Learning Contextual Bandits with Graphical Feedback","date":"2025-02-07","arxiv_id":"2502.04678","repositories_listed":0,"syntology":null},{"url":null,"slug":"early-stopping-in-contextual-bandits-and","title":"Early Stopping in Contextual Bandits and Inferences","date":"2025-02-05","arxiv_id":"2502.02793","repositories_listed":0,"syntology":null},{"url":null,"slug":"catoni-contextual-bandits-are-robust-to-heavy","title":"Catoni Contextual Bandits are Robust to Heavy-tailed Rewards","date":"2025-02-04","arxiv_id":"2502.02486","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearly-tight-bounds-for-exploration-in","title":"Nearly Tight Bounds for Exploration in Streaming Multi-armed Bandits with Known Optimality Gap","date":"2025-02-03","arxiv_id":"2502.01067","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-online-advertising-with-multi","title":"Optimizing Online Advertising with Multi-Armed Bandits: Mitigating the Cold Start Problem under Auction Dynamics","date":"2025-02-03","arxiv_id":"2502.01867","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-prompt-optimization-for-llm-based","title":"Meta-Prompt Optimization for LLM-Based Sequential Decision Making","date":"2025-02-02","arxiv_id":"2502.00728","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-multi-armed-bandit-with-fully","title":"Multi-agent Multi-armed Bandit with Fully Heavy-tailed Dynamics","date":"2025-01-31","arxiv_id":"2501.19239","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearly-optimal-bandit-learning-in-stackelberg","title":"Nearly-Optimal Bandit Learning in Stackelberg Games with Side Information","date":"2025-01-31","arxiv_id":"2502.00204","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-learning-for-combinatorial-multi","title":"Offline Learning for Combinatorial Multi-armed Bandits","date":"2025-01-31","arxiv_id":"2501.19300","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-online-decision-making-with","title":"Contextual Online Decision Making with Infinite-Dimensional Functional Regression","date":"2025-01-30","arxiv_id":"2501.18359","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-the-log-1-d-2-barrier-better-batched","title":"Breaking the $\\log(1/Δ_2)$ Barrier: Better Batched Best Arm Identification with Adaptive Grids","date":"2025-01-29","arxiv_id":"2501.17370","repositories_listed":0,"syntology":null},{"url":null,"slug":"hd-cb-the-first-exploration-of","title":"HD-CB: The First Exploration of Hyperdimensional Computing for Contextual Bandits Problems","date":"2025-01-28","arxiv_id":"2501.16863","repositories_listed":0,"syntology":null},{"url":null,"slug":"restless-multi-armed-bandits-under-frequency","title":"Restless Multi-armed Bandits under Frequency and Window Constraints for Public Service Inspections","date":"2025-01-27","arxiv_id":"2502.00045","repositories_listed":0,"syntology":null},{"url":null,"slug":"decision-making-in-changing-environments","title":"Decision Making in Changing Environments: Robustness, Query-Based Learning, and Differential Privacy","date":"2025-01-24","arxiv_id":"2501.14928","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-multi-objective-best-arm","title":"Optimal Multi-Objective Best Arm Identification with Fixed Confidence","date":"2025-01-23","arxiv_id":"2501.13607","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-implementation-of-linearucb-through","title":"Efficient Implementation of LinearUCB through Algorithmic Improvements and Vector Computing Acceleration for Embedded Learning Systems","date":"2025-01-22","arxiv_id":"2501.13139","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-multi-player-multi-armed-1","title":"Heterogeneous Multi-Player Multi-Armed Bandits Robust To Adversarial Attacks","date":"2025-01-21","arxiv_id":"2501.17882","repositories_listed":0,"syntology":null},{"url":null,"slug":"multilinguality-in-llm-designed-reward","title":"Multilinguality in LLM-Designed Reward Functions for Restless Bandits: Effects on Task Performance and Fairness","date":"2025-01-20","arxiv_id":"2501.13120","repositories_listed":0,"syntology":null},{"url":null,"slug":"pairwise-elimination-with-instance-dependent","title":"Pairwise Elimination with Instance-Dependent Guarantees for Bandits with Cost Subsidy","date":"2025-01-17","arxiv_id":"2501.10290","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-risk-sensitive-satisficing-in","title":"Neural Risk-sensitive Satisficing in Contextual Bandits","date":"2025-01-15","arxiv_id":"2501.08612","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentially-private-kernelized-contextual","title":"Differentially Private Kernelized Contextual Bandits","date":"2025-01-13","arxiv_id":"2501.07046","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-horizon-single-pull-restless-bandits","title":"Finite-Horizon Single-Pull Restless Bandits: An Efficient Index Policy For Scarce Resource Allocation","date":"2025-01-10","arxiv_id":"2501.06103","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-statistical-complexity-of-offline","title":"On The Statistical Complexity of Offline Decision-Making","date":"2025-01-10","arxiv_id":"2501.06339","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-instrumental-value-for-data-production-and","title":"An Instrumental Value for Data Production and its Application to Data Pricing","date":"2024-12-24","arxiv_id":"2412.18140","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-approach-to-balance-convenience-and","title":"A Novel Approach to Balance Convenience and Nutrition in Meals With Long-Term Group Recommendations and Reasoning on Multimodal Recipes and its Implementation in BEACON","date":"2024-12-23","arxiv_id":"2412.17910","repositories_listed":0,"syntology":null},{"url":null,"slug":"lagrangian-index-policy-for-restless-bandits","title":"Lagrangian Index Policy for Restless Bandits with Average Reward","date":"2024-12-17","arxiv_id":"2412.12641","repositories_listed":0,"syntology":null},{"url":null,"slug":"maxinforl-boosting-exploration-in","title":"MaxInfoRL: Boosting exploration in reinforcement learning through information gain maximization","date":"2024-12-16","arxiv_id":"2412.12098","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-optimistic-algorithm-for-online-convex","title":"An Optimistic Algorithm for Online Convex Optimization with Adversarial Constraints","date":"2024-12-11","arxiv_id":"2412.08060","repositories_listed":0,"syntology":null},{"url":null,"slug":"conservative-contextual-bandits-beyond-linear","title":"Conservative Contextual Bandits: Beyond Linear Representations","date":"2024-12-09","arxiv_id":"2412.06165","repositories_listed":0,"syntology":null},{"url":null,"slug":"ucb-algorithms-for-multi-armed-bandits","title":"UCB algorithms for multi-armed bandits: Precise regret and adaptive inference","date":"2024-12-09","arxiv_id":"2412.06126","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-multi-armed-bandits-for-improved","title":"Coordinated Multi-Armed Bandits for Improved Spatial Reuse in Wi-Fi","date":"2024-12-04","arxiv_id":"2412.03076","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-acquisition-for-improving-model-fairness","title":"Data Acquisition for Improving Model Fairness using Reinforcement Learning","date":"2024-12-04","arxiv_id":"2412.03009","repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-reviews-of-bandit-problems-in-ai","title":"Selective Reviews of Bandit Problems in AI via a Statistical View","date":"2024-12-03","arxiv_id":"2412.02251","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-in-payment-processing-non","title":"Contextual Bandits in Payment Processing: Non-uniform Exploration and Supervised Learning at Adyen","date":"2024-11-30","arxiv_id":"2412.00569","repositories_listed":0,"syntology":null},{"url":null,"slug":"mechanism-design-with-multi-armed-bandit","title":"Achieving PAC Guarantees in Mechanism Design through Multi-Armed Bandits","date":"2024-11-30","arxiv_id":"2412.00345","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-estimation-with-adaptively","title":"Off-policy estimation with adaptively collected data: the power of online learning","date":"2024-11-19","arxiv_id":"2411.12786","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-stochastic-bandits-robust-to","title":"Multi-Agent Stochastic Bandits Robust to Adversarial Corruptions","date":"2024-11-12","arxiv_id":"2411.08167","repositories_listed":0,"syntology":null},{"url":null,"slug":"individual-regret-in-cooperative-stochastic","title":"Individual Regret in Cooperative Stochastic Multi-Armed Bandits","date":"2024-11-10","arxiv_id":"2411.06501","repositories_listed":0,"syntology":null},{"url":null,"slug":"sharp-analysis-for-kl-regularized-contextual","title":"Sharp Analysis for KL-Regularized Contextual Bandits and RLHF","date":"2024-11-07","arxiv_id":"2411.04625","repositories_listed":0,"syntology":null},{"url":null,"slug":"structure-matters-dynamic-policy-gradient","title":"Structure Matters: Dynamic Policy Gradient","date":"2024-11-07","arxiv_id":"2411.04913","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-stationary-learning-of-neural-networks","title":"Non-Stationary Learning of Neural Networks with Automatic Soft Parameter Reset","date":"2024-11-06","arxiv_id":"2411.04034","repositories_listed":0,"syntology":null},{"url":null,"slug":"rising-rested-bandits-lower-bounds-and","title":"Rising Rested Bandits: Lower Bounds and Efficient Algorithms","date":"2024-11-06","arxiv_id":"2411.14446","repositories_listed":0,"syntology":null},{"url":null,"slug":"mbexplainer-multilevel-bandit-based","title":"MBExplainer: Multilevel bandit-based explanations for downstream models with augmented graph embeddings","date":"2024-11-01","arxiv_id":"2411.00287","repositories_listed":0,"syntology":null},{"url":null,"slug":"fedmaba-towards-fair-federated-learning","title":"FedMABA: Towards Fair Federated Learning through Multi-Armed Bandits Allocation","date":"2024-10-26","arxiv_id":"2410.20141","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-explore-with-lagrangians-for","title":"Learning to Explore with Lagrangians for Bandits under Unknown Linear Constraints","date":"2024-10-24","arxiv_id":"2410.18844","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-streaming-algorithms-for-multi-armed","title":"Optimal Streaming Algorithms for Multi-Armed Bandits","date":"2024-10-23","arxiv_id":"2410.17835","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-maximization-for-pure-exploration","title":"Reward Maximization for Pure Exploration: Minimax Optimal Good Arm Identification for Nonparametric Multi-Armed Bandits","date":"2024-10-21","arxiv_id":"2410.15564","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-with-arm-request-costs-and","title":"Contextual Bandits with Arm Request Costs and Delays","date":"2024-10-17","arxiv_id":"2410.13109","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-prior-free-black-box-non-stationary","title":"Is Prior-Free Black-Box Non-Stationary Reinforcement Learning Feasible?","date":"2024-10-17","arxiv_id":"2410.13772","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-does-variance-shape-the-regret-in","title":"How Does Variance Shape the Regret in Contextual Bandits?","date":"2024-10-16","arxiv_id":"2410.12713","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparative-performance-of-collaborative","title":"Comparative Performance of Collaborative Bandit Algorithms: Effect of Sparsity and Exploration Intensity","date":"2024-10-15","arxiv_id":"2410.12086","repositories_listed":0,"syntology":null},{"url":null,"slug":"combinatorial-multi-armed-bandits-arm","title":"Combinatorial Multi-armed Bandits: Arm Selection via Group Testing","date":"2024-10-14","arxiv_id":"2410.10679","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-with-non-stationary","title":"Contextual Bandits with Non-Stationary Correlated Rewards for User Association in MmWave Vehicular Networks","date":"2024-10-08","arxiv_id":"2410.05785","repositories_listed":0,"syntology":null},{"url":null,"slug":"diminishing-exploration-a-minimalist-approach","title":"Diminishing Exploration: A Minimalist Approach to Piecewise Stationary Multi-Armed Bandits","date":"2024-10-08","arxiv_id":"2410.05734","repositories_listed":0,"syntology":null},{"url":"/paper/evolve-evaluating-and-optimizing-llms-for","slug":"evolve-evaluating-and-optimizing-llms-for","title":"EVOLvE: Evaluating and Optimizing LLMs For Exploration","date":"2024-10-08","arxiv_id":"2410.06238","repositories_listed":0,"syntology":{"n":5,"n_ran":5,"n_constructed":0,"n_ran_checked":5,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":5,"n_pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/evolve-evaluating-and-optimizing-llms-for#ran","syntology_url":"https://syntology.ai/paper/2410.06238","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2410.06238"}},"official":null}},{"url":null,"slug":"stochastic-bandits-for-egalitarian-assignment","title":"Stochastic Bandits for Egalitarian Assignment","date":"2024-10-08","arxiv_id":"2410.05856","repositories_listed":0,"syntology":null},{"url":"/paper/dopl-direct-online-preference-learning-for","slug":"dopl-direct-online-preference-learning-for","title":"DOPL: Direct Online Preference Learning for Restless Bandits with Preference Feedback","date":"2024-10-07","arxiv_id":"2410.05527","repositories_listed":0,"syntology":{"n":7,"n_ran":6,"n_constructed":0,"n_ran_checked":2,"n_instrument":4,"n_unverified":1,"n_honours":2,"n_violates":0,"n_no_contract":0,"n_pointer_only":7,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 2 honoured, 0 violated, 0 with no contract checked; 4 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/dopl-direct-online-preference-learning-for#ran","syntology_url":"https://syntology.ai/paper/2410.05527","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2410.05527"}},"official":null}},{"url":null,"slug":"high-probability-bound-for-cross-learning","title":"High Probability Bound for Cross-Learning Contextual Bandits with Unknown Context Distributions","date":"2024-10-05","arxiv_id":"2410.04080","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-optimal-trust-aware-multi-armed","title":"Minimax-optimal trust-aware multi-armed bandits","date":"2024-10-04","arxiv_id":"2410.03651","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-posterior-sampling-with-a-diffusion","title":"Online Posterior Sampling with a Diffusion Prior","date":"2024-10-04","arxiv_id":"2410.03919","repositories_listed":0,"syntology":null},{"url":null,"slug":"uniinf-best-of-both-worlds-algorithm-for","title":"uniINF: Best-of-Both-Worlds Algorithm for Parameter-Free Heavy-Tailed MABs","date":"2024-10-04","arxiv_id":"2410.03284","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-lai-s-upper-confidence-bound-in-multi","title":"On Lai's Upper Confidence Bound in Multi-Armed Bandits","date":"2024-10-03","arxiv_id":"2410.02279","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-and-sample-efficient-multi-task","title":"Fast and Sample Efficient Multi-Task Representation Learning in Stochastic Contextual Bandits","date":"2024-10-02","arxiv_id":"2410.02068","repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-the-kumaraswamy-distribution","title":"Stabilizing the Kumaraswamy Distribution","date":"2024-10-01","arxiv_id":"2410.00660","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimism-in-the-face-of-ambiguity-principle","title":"Optimism in the Face of Ambiguity Principle for Multi-Armed Bandits","date":"2024-09-30","arxiv_id":"2409.20440","repositories_listed":0,"syntology":null},{"url":null,"slug":"linear-contextual-bandits-with-interference","title":"Linear Contextual Bandits with Interference","date":"2024-09-24","arxiv_id":"2409.15682","repositories_listed":0,"syntology":null},{"url":null,"slug":"second-order-bounds-for-contextual-bandits","title":"Second Order Bounds for Contextual Bandits with Function Approximation","date":"2024-09-24","arxiv_id":"2409.16197","repositories_listed":0,"syntology":null},{"url":null,"slug":"designing-an-interpretable-interface-for","title":"Designing an Interpretable Interface for Contextual Bandits","date":"2024-09-23","arxiv_id":"2409.15143","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-feature-selection-method-for","title":"Causal Feature Selection Method for Contextual Multi-Armed Bandits in Recommender System","date":"2024-09-20","arxiv_id":"2409.13888","repositories_listed":0,"syntology":null},{"url":null,"slug":"partially-observable-contextual-bandits-with","title":"Partially Observable Contextual Bandits with Linear Payoffs","date":"2024-09-17","arxiv_id":"2409.11521","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hybrid-meta-learning-and-multi-armed-bandit","title":"A Hybrid Meta-Learning and Multi-Armed Bandit Approach for Context-Specific Multi-Objective Recommendation Optimization","date":"2024-09-13","arxiv_id":"2409.08752","repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-ensemble-for-variance-dependent-regret","title":"Batch Ensemble for Variance Dependent Regret in Stochastic Bandits","date":"2024-09-13","arxiv_id":"2409.08570","repositories_listed":0,"syntology":null},{"url":null,"slug":"batched-online-contextual-sparse-bandits-with","title":"Batched Online Contextual Sparse Bandits with Sequential Inclusion of Features","date":"2024-09-13","arxiv_id":"2409.09199","repositories_listed":0,"syntology":null},{"url":null,"slug":"modified-meta-thompson-sampling-for-linear","title":"Modified Meta-Thompson Sampling for Linear Bandits and Its Bayes Regret Analysis","date":"2024-09-10","arxiv_id":"2409.06329","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-q-learning-algorithms-for-restless","title":"Faster Q-Learning Algorithms for Restless Bandits","date":"2024-09-06","arxiv_id":"2409.05908","repositories_listed":0,"syntology":null},{"url":null,"slug":"whittle-index-learning-algorithms-for","title":"Whittle Index Learning Algorithms for Restless Bandits with Constant Stepsizes","date":"2024-09-06","arxiv_id":"2409.04605","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-thompson-sampling-via-information","title":"Improving Thompson Sampling via Information Relaxation for Budgeted Multi-armed Bandits","date":"2024-08-28","arxiv_id":"2408.15535","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandit-with-herding-effects","title":"Contextual Bandit with Herding Effects: Algorithms and Recommendation Applications","date":"2024-08-26","arxiv_id":"2408.14432","repositories_listed":0,"syntology":null},{"url":null,"slug":"representative-arm-identification-a-fixed","title":"Representative Arm Identification: A fixed confidence approach to identify cluster representatives","date":"2024-08-26","arxiv_id":"2408.14195","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-fair-division-with-contextual-bandits","title":"Online Fair Division with Contextual Bandits","date":"2024-08-23","arxiv_id":"2408.12845","repositories_listed":0,"syntology":null},{"url":null,"slug":"balancing-act-prioritization-strategies-for","title":"Balancing Act: Prioritization Strategies for LLM-Designed Restless Bandit Rewards","date":"2024-08-22","arxiv_id":"2408.12112","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-product-image-generation-and","title":"Dynamic Product Image Generation and Recommendation at Scale for Personalized E-commerce","date":"2024-08-22","arxiv_id":"2408.12392","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-multi-armed-bandits-with","title":"Multi-agent Multi-armed Bandits with Stochastic Sharable Arm Capacities","date":"2024-08-20","arxiv_id":"2408.10865","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-for-unbounded-context","title":"Contextual Bandits for Unbounded Context Distributions","date":"2024-08-19","arxiv_id":"2408.09655","repositories_listed":0,"syntology":null},{"url":null,"slug":"gino-q-learning-an-asymptotically-optimal","title":"GINO-Q: Learning an Asymptotically Optimal Index Policy for Restless Multi-armed Bandits","date":"2024-08-19","arxiv_id":"2408.09882","repositories_listed":0,"syntology":null},{"url":null,"slug":"reciprocal-learning","title":"Reciprocal Learning","date":"2024-08-12","arxiv_id":"2408.06257","repositories_listed":0,"syntology":null}],"record_sha256":"942a66b8e95fe8757e325c1a3261d25b190a715d3f37ce187c9e8ef9eb74ad07","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}