{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multi-armed-bandits/papers/5","list_of":"/task/multi-armed-bandits","task":"Multi-Armed Bandits","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":5,"pages_in_order":13,"rows_per_page":100,"rows":[401,500],"of":1262,"counts":{"archive_papers_tagged":1262,"with_a_code_link":253,"where_syntology_ran_a_sample":55,"not_listed_spam_title":0,"listed":1262,"listed_where_code_ran":55,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":44,"every_run_a_failure_of_syntologys_instrument":11,"listed_with_a_run_with_no_instrument_failure":44,"listed_every_run_a_failure_of_syntologys_instrument":11,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multi-armed-bandits","prev":"/task/multi-armed-bandits/papers/4","next":"/task/multi-armed-bandits/papers/6","papers":[{"url":null,"slug":"empathic-responding-for-digital-interpersonal","title":"Empathic Responding for Digital Interpersonal Emotion Regulation via Content Recommendation","date":"2024-08-05","arxiv_id":"2408.07704","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-learning-for-autonomous-management-of","title":"Online Learning for Autonomous Management of Intent-based 6G Networks","date":"2024-07-25","arxiv_id":"2407.17767","repositories_listed":0,"syntology":null},{"url":null,"slug":"identifiable-latent-bandits-combining","title":"Identifiable latent bandits: Combining observational data and exploration for personalized healthcare","date":"2024-07-23","arxiv_id":"2407.16239","repositories_listed":0,"syntology":null},{"url":null,"slug":"satisficing-exploration-for-deep","title":"Satisficing Exploration for Deep Reinforcement Learning","date":"2024-07-16","arxiv_id":"2407.12185","repositories_listed":0,"syntology":null},{"url":"/paper/on-speeding-up-language-model-evaluation","slug":"on-speeding-up-language-model-evaluation","title":"On Speeding Up Language Model Evaluation","date":"2024-07-08","arxiv_id":"2407.06172","repositories_listed":0,"syntology":{"n":2,"n_ran":2,"n_constructed":1,"n_ran_checked":1,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"2 ran (of which 1 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/on-speeding-up-language-model-evaluation#ran","syntology_url":"https://syntology.ai/paper/2407.06172","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2407.06172"}},"official":null}},{"url":null,"slug":"open-problem-tight-bounds-for-kernelized","title":"Open Problem: Tight Bounds for Kernelized Multi-Armed Bandits with Bernoulli Rewards","date":"2024-07-08","arxiv_id":"2407.06321","repositories_listed":0,"syntology":null},{"url":null,"slug":"honor-among-bandits-no-regret-learning-for","title":"Honor Among Bandits: No-Regret Learning for Online Fair Division","date":"2024-07-01","arxiv_id":"2407.01795","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-contextual-combinatorial-bandit-approach-to","title":"A Contextual Combinatorial Bandit Approach to Negotiation","date":"2024-06-30","arxiv_id":"2407.00567","repositories_listed":0,"syntology":null},{"url":null,"slug":"classical-bandit-algorithms-for-entanglement","title":"Classical Bandit Algorithms for Entanglement Detection in Parameterized Qubit States","date":"2024-06-28","arxiv_id":"2406.19738","repositories_listed":0,"syntology":null},{"url":null,"slug":"eduqate-generating-adaptive-curricula-through","title":"EduQate: Generating Adaptive Curricula through RMABs in Education Settings","date":"2024-06-20","arxiv_id":"2406.14122","repositories_listed":0,"syntology":null},{"url":null,"slug":"beacon-balancing-convenience-and-nutrition-in","title":"BEACON: Balancing Convenience and Nutrition in Meals With Long-Term Group Recommendations and Reasoning on Multimodal Recipes","date":"2024-06-19","arxiv_id":"2406.13714","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-data-selection-1","title":"Towards Bayesian Data Selection","date":"2024-06-18","arxiv_id":"2406.12560","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-reward-conditioned-policies-for","title":"Improving Reward-Conditioned Policies for Multi-Armed Bandits using Normalized Weight Functions","date":"2024-06-16","arxiv_id":"2406.10795","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-adaptive-method-for-non-stationary","title":"An Adaptive Method for Contextual Stochastic Multi-armed Bandits with Rewards Generated by a Linear Dynamical System","date":"2024-06-14","arxiv_id":"2406.10418","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-domain-adaptive-neural-contextual","title":"Towards Domain Adaptive Neural Contextual Bandits","date":"2024-06-13","arxiv_id":"2406.09564","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-federated-online-restless-bandit-framework","title":"A Federated Online Restless Bandit Framework for Cooperative Resource Allocation","date":"2024-06-12","arxiv_id":"2406.07992","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotically-optimal-regret-for-black-box","title":"Asymptotically Optimal Regret for Black-Box Predict-then-Optimize","date":"2024-06-12","arxiv_id":"2406.07866","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-complexity-reduction-via-policy","title":"Sample Complexity Reduction via Policy Difference Estimation in Tabular Reinforcement Learning","date":"2024-06-11","arxiv_id":"2406.06856","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-continuum-bandits-static-versus","title":"A conversion theorem and minimax optimality for continuum contextual bandits","date":"2024-06-09","arxiv_id":"2406.05714","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-upper-confidence-bounds-with-near","title":"Data-Driven Upper Confidence Bounds with Near-Optimal Regret for Heavy-Tailed Bandits","date":"2024-06-09","arxiv_id":"2406.05710","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptively-learning-to-select-rank-in-online","title":"Adaptively Learning to Select-Rank in Online Platforms","date":"2024-06-07","arxiv_id":"2406.05017","repositories_listed":0,"syntology":null},{"url":null,"slug":"combinatorial-multivariant-multi-armed","title":"Combinatorial Multivariant Multi-Armed Bandits with Applications to Episodic Reinforcement Learning and Beyond","date":"2024-06-03","arxiv_id":"2406.01386","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-rewards-in-restless-multi-armed","title":"Global Rewards in Restless Multi-Armed Bandits","date":"2024-06-02","arxiv_id":"2406.00738","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-batch-sequential-halving-algorithm-without","title":"A Batch Sequential Halving Algorithm without Performance Degradation","date":"2024-06-01","arxiv_id":"2406.00424","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategic-linear-contextual-bandits","title":"Strategic Linear Contextual Bandits","date":"2024-06-01","arxiv_id":"2406.00551","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-regret-learning-for-fair-multi-agent","title":"No-Regret Learning for Fair Multi-Agent Social Welfare Optimization","date":"2024-05-31","arxiv_id":"2405.20678","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-memory-regret-trade-off-for","title":"Understanding Memory-Regret Trade-Off for Streaming Stochastic Multi-Armed Bandits","date":"2024-05-30","arxiv_id":"2405.19752","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-oracle-efficient-learning-for","title":"Offline Oracle-Efficient Learning for Contextual MDPs via Layerwise Exploration-Exploitation Tradeoff","date":"2024-05-28","arxiv_id":"2405.17796","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-sharpe-ratio-risk-adjusted","title":"Optimizing Sharpe Ratio: Risk-Adjusted Decision-Making in Multi-Armed Bandits","date":"2024-05-28","arxiv_id":"2406.06552","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-player-approaches-for-dueling-bandits","title":"Multi-Player Approaches for Dueling Bandits","date":"2024-05-25","arxiv_id":"2405.16168","repositories_listed":0,"syntology":null},{"url":null,"slug":"indexed-minimum-empirical-divergence-based","title":"Indexed Minimum Empirical Divergence-Based Algorithms for Linear Bandits","date":"2024-05-24","arxiv_id":"2405.15200","repositories_listed":0,"syntology":null},{"url":null,"slug":"budgeted-recommendation-with-delayed-feedback","title":"Budgeted Recommendation with Delayed Feedback","date":"2024-05-19","arxiv_id":"2405.11417","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-regret-is-not-enough-bandits-with-general","title":"No-Regret is not enough! Bandits with General Constraints through Adaptive Regret Minimization","date":"2024-05-10","arxiv_id":"2405.06575","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-combinatorial-multi-agent-multi","title":"Federated Combinatorial Multi-Agent Multi-Armed Bandits","date":"2024-05-09","arxiv_id":"2405.05950","repositories_listed":0,"syntology":null},{"url":null,"slug":"imprecise-multi-armed-bandits","title":"Imprecise Multi-Armed Bandits","date":"2024-05-09","arxiv_id":"2405.05673","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-biased-information-multi-armed","title":"Leveraging (Biased) Information: Multi-armed Bandits with Offline Data","date":"2024-05-04","arxiv_id":"2405.02594","repositories_listed":0,"syntology":null},{"url":null,"slug":"mathematics-of-statistical-sequential","title":"Mathematics of statistical sequential decision-making: concentration, risk-awareness and modelling in stochastic bandits, with applications to bariatric surgery","date":"2024-05-03","arxiv_id":"2405.01994","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-reinforcement-learning-for-2","title":"Provably Efficient Reinforcement Learning for Adversarial Restless Multi-Armed Bandits with Unknown Transitions and Bandit Feedback","date":"2024-05-02","arxiv_id":"2405.00950","repositories_listed":0,"syntology":null},{"url":null,"slug":"recommenadation-aided-caching-using","title":"Recommenadation aided Caching using Combinatorial Multi-armed Bandits","date":"2024-04-30","arxiv_id":"2405.00080","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-exploration-from-exploitation","title":"Disentangling Exploration from Exploitation","date":"2024-04-29","arxiv_id":"2404.19116","repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-reinforcement-learning-for-delay","title":"Structured Reinforcement Learning for Delay-Optimal Data Transmission in Dense mmWave Networks","date":"2024-04-25","arxiv_id":"2404.16920","repositories_listed":0,"syntology":null},{"url":null,"slug":"feel-good-thompson-sampling-for-contextual-1","title":"Feel-Good Thompson Sampling for Contextual Dueling Bandits","date":"2024-04-09","arxiv_id":"2404.06013","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-importance-of-uncertainty-in-decision","title":"On the Importance of Uncertainty in Decision-Making with Large Language Models","date":"2024-04-03","arxiv_id":"2404.02649","repositories_listed":0,"syntology":null},{"url":null,"slug":"doubly-robust-off-policy-evaluation-with-1","title":"Doubly-Robust Off-Policy Evaluation with Estimated Logging Policy","date":"2024-04-02","arxiv_id":"2404.01830","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearly-tight-approximation-guarantees-for-the","title":"Nearly-tight Approximation Guarantees for the Improving Multi-Armed Bandits Problem","date":"2024-04-01","arxiv_id":"2404.01198","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-correction-of-pseudo-log-likelihood-method","title":"A Correction of Pseudo Log-Likelihood Method","date":"2024-03-26","arxiv_id":"2403.18127","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-restless-multi-armed-bandits-with","title":"Contextual Restless Multi-Armed Bandits with Application to Demand Response Decision-Making","date":"2024-03-22","arxiv_id":"2403.15640","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-in-sequential-multi-armed-bandits","title":"Transfer in Sequential Multi-armed Bandits via Reward Samples","date":"2024-03-19","arxiv_id":"2403.12428","repositories_listed":0,"syntology":null},{"url":null,"slug":"phasic-diversity-optimization-for-population","title":"Phasic Diversity Optimization for Population-Based Reinforcement Learning","date":"2024-03-17","arxiv_id":"2403.11114","repositories_listed":0,"syntology":null},{"url":null,"slug":"e-neural-thompson-sampling-of-deep-brain","title":"ε-Neural Thompson Sampling of Deep Brain Stimulation for Parkinson Disease Treatment","date":"2024-03-11","arxiv_id":"2403.06814","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-cram-method-for-efficient-simultaneous","title":"Cramming Contextual Bandits for On-policy Statistical Evaluation","date":"2024-03-11","arxiv_id":"2403.07031","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-public-health-intervention-planning","title":"Efficient Public Health Intervention Planning Using Decomposition-Based Decision-Focused Learning","date":"2024-03-08","arxiv_id":"2403.05683","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-note-on-high-probability-analysis-of","title":"A General Reduction for High-Probability Analysis with General Light-Tailed Distributions","date":"2024-03-05","arxiv_id":"2403.02873","repositories_listed":0,"syntology":null},{"url":null,"slug":"lc-tsalis-inf-generalized-best-of-both-worlds","title":"LC-Tsallis-INF: Generalized Best-of-Both-Worlds Linear Contextual Bandits","date":"2024-03-05","arxiv_id":"2403.03219","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-learning-rate-for-follow-the","title":"Adaptive Learning Rate for Follow-the-Regularized-Leader: Competitive Analysis and Best-of-Both-Worlds","date":"2024-03-01","arxiv_id":"2403.00715","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-linear-contextual-bandits-with","title":"Federated Linear Contextual Bandits with Heterogeneous Clients","date":"2024-02-29","arxiv_id":"2403.00116","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-gender-fairness-in-machine","title":"Investigating Gender Fairness in Machine Learning-driven Personalized Care for Chronic Pain","date":"2024-02-29","arxiv_id":"2402.19226","repositories_listed":0,"syntology":null},{"url":null,"slug":"batched-nonparametric-contextual-bandits","title":"Batched Nonparametric Contextual Bandits","date":"2024-02-27","arxiv_id":"2402.17732","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-offline-decision-making-possible-with-only","title":"Is Offline Decision Making Possible with Only Few Samples? Reliable Decisions in Data-Starved Bandits via Trust Region Enhancement","date":"2024-02-24","arxiv_id":"2402.15703","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-armed-bandits-with-abstention","title":"Multi-Armed Bandits with Abstention","date":"2024-02-23","arxiv_id":"2402.15127","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimisic-information-directed-sampling","title":"Optimistic Information Directed Sampling","date":"2024-02-23","arxiv_id":"2402.15411","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-decision-language-model-dlm-for-dynamic","title":"A Decision-Language Model (DLM) for Dynamic Restless Multi-Armed Bandit Tasks in Public Health","date":"2024-02-22","arxiv_id":"2402.14807","repositories_listed":0,"syntology":null},{"url":null,"slug":"stealthy-adversarial-attacks-on-stochastic","title":"Stealthy Adversarial Attacks on Stochastic Multi-Armed Bandits","date":"2024-02-21","arxiv_id":"2402.13487","repositories_listed":0,"syntology":null},{"url":null,"slug":"incentivized-exploration-via-filtered","title":"Incentivized Exploration via Filtered Posterior Sampling","date":"2024-02-20","arxiv_id":"2402.13338","repositories_listed":0,"syntology":null},{"url":null,"slug":"best-arm-identification-for-prompt-learning","title":"Efficient Prompt Optimization Through the Lens of Best Arm Identification","date":"2024-02-15","arxiv_id":"2402.09723","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-models-meet-contextual-bandits-with","title":"Diffusion Models Meet Contextual Bandits with Large Action Spaces","date":"2024-02-15","arxiv_id":"2402.10028","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-in-partially-observable","title":"Thompson Sampling in Partially Observable Contextual Bandits","date":"2024-02-15","arxiv_id":"2402.10289","repositories_listed":0,"syntology":null},{"url":null,"slug":"flash-federated-learning-across-simultaneous","title":"FLASH: Federated Learning Across Simultaneous Heterogeneities","date":"2024-02-13","arxiv_id":"2402.08769","repositories_listed":0,"syntology":null},{"url":null,"slug":"thresholding-data-shapley-for-data-cleansing","title":"Thresholding Data Shapley for Data Cleansing Using Multi-Armed Bandits","date":"2024-02-13","arxiv_id":"2402.08209","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-multinomial-logit-bandits-with","title":"Contextual Multinomial Logit Bandits with General Value Functions","date":"2024-02-12","arxiv_id":"2402.08126","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-contextual-bandits-with-uninformed","title":"Efficient Contextual Bandits with Uninformed Feedback Graphs","date":"2024-02-12","arxiv_id":"2402.08127","repositories_listed":0,"syntology":null},{"url":null,"slug":"replicability-is-asymptotically-free-in-multi","title":"Replicability is Asymptotically Free in Multi-armed Bandits","date":"2024-02-12","arxiv_id":"2402.07391","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-contextual-bandits-with-graph-1","title":"Stochastic contextual bandits with graph feedback: from independence number to MAS number","date":"2024-02-12","arxiv_id":"2402.18591","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-benefits-of-being-distributional-second","title":"More Benefits of Being Distributional: Second-Order Bounds for Reinforcement Learning","date":"2024-02-11","arxiv_id":"2402.07198","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-ucb-type-algorithms-for-stochastic","title":"Fast UCB-type algorithms for stochastic bandits with heavy and super heavy symmetric noise","date":"2024-02-10","arxiv_id":"2402.07062","repositories_listed":0,"syntology":null},{"url":null,"slug":"tree-ensembles-for-contextual-bandits","title":"Tree Ensembles for Contextual Bandits","date":"2024-02-10","arxiv_id":"2402.06963","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bayesian-approach-to-online-learning-for","title":"Context in Public Health for Underserved Communities: A Bayesian Approach to Online Restless Bandits","date":"2024-02-07","arxiv_id":"2402.04933","repositories_listed":0,"syntology":null},{"url":null,"slug":"fairness-and-privacy-guarantees-in-federated","title":"Fairness and Privacy Guarantees in Federated Contextual Bandits","date":"2024-02-05","arxiv_id":"2402.03531","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-armed-bandits-with-interference","title":"Multi-Armed Bandits with Interference","date":"2024-02-02","arxiv_id":"2402.01845","repositories_listed":0,"syntology":null},{"url":null,"slug":"query-efficient-correlation-clustering-with","title":"Query-Efficient Correlation Clustering with Noisy Oracle","date":"2024-02-02","arxiv_id":"2402.01400","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-multi-task-learning-for","title":"Distributed Multi-Task Learning for Stochastic Bandits with Context Distribution and Stage-wise Constraints","date":"2024-01-21","arxiv_id":"2401.11563","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-regret-for-bandits-made-possible-two","title":"Adaptive Regret for Bandits Made Possible: Two Queries Suffice","date":"2024-01-17","arxiv_id":"2401.09278","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-quantum-natural-policy-gradients","title":"On Quantum Natural Policy Gradients","date":"2024-01-16","arxiv_id":"2401.08307","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-with-stage-wise","title":"Contextual Bandits with Stage-wise Constraints","date":"2024-01-15","arxiv_id":"2401.08016","repositories_listed":0,"syntology":null},{"url":null,"slug":"reliability-optimized-user-admission-control","title":"Reliability-Optimized User Admission Control for URLLC Traffic: A Neural Contextual Bandit Approach","date":"2024-01-05","arxiv_id":"2401.03059","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-cross-learning-for-contextual-bandits-1","title":"Optimal cross-learning for contextual bandits with unknown context distributions","date":"2024-01-03","arxiv_id":"2401.01857","repositories_listed":0,"syntology":null},{"url":null,"slug":"best-of-both-worlds-linear-contextual-bandits","title":"Best-of-Both-Worlds Linear Contextual Bandits","date":"2023-12-27","arxiv_id":"2312.16489","repositories_listed":0,"syntology":null},{"url":null,"slug":"foundations-of-reinforcement-learning-and","title":"Foundations of Reinforcement Learning and Interactive Decision Making","date":"2023-12-27","arxiv_id":"2312.16730","repositories_listed":0,"syntology":null},{"url":null,"slug":"diversity-based-recruitment-in-crowdsensing","title":"Diversity-Based Recruitment in Crowdsensing By Combinatorial Multi-Armed Bandits","date":"2023-12-25","arxiv_id":"2312.15729","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-inflated-bandits","title":"Zero-Inflated Bandits","date":"2023-12-25","arxiv_id":"2312.15595","repositories_listed":0,"syntology":null},{"url":null,"slug":"best-of-both-worlds-algorithms-for-linear","title":"Best-of-Both-Worlds Algorithms for Linear Contextual Bandits","date":"2023-12-24","arxiv_id":"2312.15433","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-contextual-bandits-for-personalized","title":"Neural Contextual Bandits for Personalized Recommendation","date":"2023-12-21","arxiv_id":"2312.14037","repositories_listed":0,"syntology":null},{"url":null,"slug":"combinatorial-gaussian-process-bandits-in","title":"Bayesian Analysis of Combinatorial Gaussian Process Bandits","date":"2023-12-20","arxiv_id":"2312.12676","repositories_listed":0,"syntology":null},{"url":null,"slug":"distribution-dependent-rates-for-multi","title":"Distribution-Dependent Rates for Multi-Distribution Learning","date":"2023-12-20","arxiv_id":"2312.13130","repositories_listed":0,"syntology":null},{"url":null,"slug":"observation-augmented-contextual-multi-armed","title":"Observation-Augmented Contextual Multi-Armed Bandits for Robotic Search and Exploration","date":"2023-12-19","arxiv_id":"2312.12583","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-restless-multi-armed-bandits-with-long","title":"Online Restless Multi-Armed Bandits with Long-Term Fairness Constraints","date":"2023-12-16","arxiv_id":"2312.10303","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hierarchical-nearest-neighbour-approach-to","title":"A Hierarchical Nearest Neighbour Approach to Contextual Bandits","date":"2023-12-14","arxiv_id":"2312.09332","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-and-performance-incentivizing","title":"Robust and Performance Incentivizing Algorithms for Multi-Armed Bandits with Strategic Agents","date":"2023-12-13","arxiv_id":"2312.07929","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-with-online-neural","title":"Contextual Bandits with Online Neural Regression","date":"2023-12-12","arxiv_id":"2312.07145","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-optimization-via-kernelized-multi","title":"Distributed Optimization via Kernelized Multi-armed Bandits","date":"2023-12-07","arxiv_id":"2312.04719","repositories_listed":0,"syntology":null}],"record_sha256":"13463ed01844d031995285760581674afd43e378e629e51727a1e218a9dde599","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}