{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/thompson-sampling/papers/3","list_of":"/task/thompson-sampling","task":"Thompson Sampling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":7,"rows_per_page":100,"rows":[201,300],"of":655,"counts":{"archive_papers_tagged":655,"with_a_code_link":135,"where_syntology_ran_a_sample":30,"not_listed_spam_title":0,"listed":655,"listed_where_code_ran":30,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":23,"every_run_a_failure_of_syntologys_instrument":7,"listed_with_a_run_with_no_instrument_failure":23,"listed_every_run_a_failure_of_syntologys_instrument":7,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/thompson-sampling","prev":"/task/thompson-sampling/papers/2","next":"/task/thompson-sampling/papers/4","papers":[{"url":null,"slug":"graph-neural-thompson-sampling","title":"Graph Neural Thompson Sampling","date":"2024-06-15","arxiv_id":"2406.10686","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-federated-online-restless-bandit-framework","title":"A Federated Online Restless Bandit Framework for Cooperative Resource Allocation","date":"2024-06-12","arxiv_id":"2406.07992","repositories_listed":0,"syntology":null},{"url":null,"slug":"disco-an-end-to-end-bandit-framework-for","title":"DISCO: An End-to-End Bandit Framework for Personalised Discount Allocation","date":"2024-06-10","arxiv_id":"2406.06433","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-stage-resource-allocation-in","title":"Two-Stage Resource Allocation in Reconfigurable Intelligent Surface Assisted Hybrid Networks via Multi-Player Bandits","date":"2024-06-09","arxiv_id":"2406.05780","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptively-learning-to-select-rank-in-online","title":"Adaptively Learning to Select-Rank in Online Platforms","date":"2024-06-07","arxiv_id":"2406.05017","repositories_listed":0,"syntology":null},{"url":null,"slug":"speculative-decoding-via-early-exiting-for","title":"Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism","date":"2024-06-06","arxiv_id":"2406.03853","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-thompson-sampling-for-learning","title":"Approximate Thompson Sampling for Learning Linear Quadratic Regulators with $O(\\sqrt{T})$ Regret","date":"2024-05-29","arxiv_id":"2405.19380","repositories_listed":0,"syntology":null},{"url":null,"slug":"posterior-sampling-via-autoregressive","title":"Posterior Sampling via Autoregressive Generation","date":"2024-05-29","arxiv_id":"2405.19466","repositories_listed":0,"syntology":null},{"url":null,"slug":"cost-efficient-knowledge-based-question","title":"Cost-efficient Knowledge-based Question Answering with Large Language Models","date":"2024-05-27","arxiv_id":"2405.17337","repositories_listed":0,"syntology":null},{"url":null,"slug":"code-repair-with-llms-gives-an-exploration","title":"Code Repair with LLMs gives an Exploration-Exploitation Tradeoff","date":"2024-05-26","arxiv_id":"2405.17503","repositories_listed":0,"syntology":null},{"url":null,"slug":"indexed-minimum-empirical-divergence-based","title":"Indexed Minimum Empirical Divergence-Based Algorithms for Linear Bandits","date":"2024-05-24","arxiv_id":"2405.15200","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-algorithmic-collusion-in-two-player","title":"No Algorithmic Collusion in Two-Player Blindfolded Game with Thompson Sampling","date":"2024-05-23","arxiv_id":"2405.17463","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-training-and-generalization","title":"Understanding the Training and Generalization of Pretrained Transformer for Sequential Decision Making","date":"2024-05-23","arxiv_id":"2405.14219","repositories_listed":0,"syntology":null},{"url":null,"slug":"smart-routing-with-precise-link-estimation","title":"Smart Routing with Precise Link Estimation: DSEE-Based Anypath Routing for Reliable Wireless Networking","date":"2024-05-16","arxiv_id":"2405.10377","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-and-enhancing-queue-sampling-for","title":"Analyzing and Enhancing Queue Sampling for Energy-Efficient Remote Control of Bandits","date":"2024-05-15","arxiv_id":"2405.09430","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-infinite-horizon","title":"Thompson Sampling for Infinite-Horizon Discounted Decision Processes","date":"2024-05-14","arxiv_id":"2405.08253","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-optimization-with-llm-based","title":"Bayesian Optimization with LLM-Based Acquisition Functions for Natural Language Preference Elicitation","date":"2024-05-02","arxiv_id":"2405.00981","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-and-adaptive-posterior-sampling","title":"Efficient and Adaptive Posterior Sampling Algorithms for Bandits","date":"2024-05-02","arxiv_id":"2405.01010","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-guided-generation-of-synthetic","title":"Bayesian-Guided Generation of Synthetic Microbiomes with Minimized Pathogenicity","date":"2024-04-29","arxiv_id":"2405.00070","repositories_listed":0,"syntology":null},{"url":"/paper/randomized-exploration-in-cooperative-multi","slug":"randomized-exploration-in-cooperative-multi","title":"Randomized Exploration in Cooperative Multi-Agent Reinforcement Learning","date":"2024-04-16","arxiv_id":"2404.10728","repositories_listed":0,"syntology":{"n":11,"n_ran":11,"n_constructed":0,"n_ran_checked":11,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":11,"n_pointer_only":0,"phrase":"11 ran (of which 0 constructed an object rather than computing a result; 11 with no instrument failure: 0 honoured, 0 violated, 11 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/randomized-exploration-in-cooperative-multi#ran","syntology_url":"https://syntology.ai/paper/2404.10728","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2404.10728"}},"official":null}},{"url":null,"slug":"feel-good-thompson-sampling-for-contextual-1","title":"Feel-Good Thompson Sampling for Contextual Dueling Bandits","date":"2024-04-09","arxiv_id":"2404.06013","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-based-reset-policy","title":"A Reinforcement Learning based Reset Policy for CDCL SAT Solvers","date":"2024-04-04","arxiv_id":"2404.03753","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-importance-of-uncertainty-in-decision","title":"On the Importance of Uncertainty in Decision-Making with Large Language Models","date":"2024-04-03","arxiv_id":"2404.02649","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learning-in-bandits-within-shared-affine","title":"Meta Learning in Bandits within Shared Affine Subspaces","date":"2024-03-31","arxiv_id":"2404.00688","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-resource-constrained-stochastic-scheduling","title":"A resource-constrained stochastic scheduling algorithm for homeless street outreach and gleaning edible food","date":"2024-03-15","arxiv_id":"2403.10638","repositories_listed":0,"syntology":null},{"url":null,"slug":"e-neural-thompson-sampling-of-deep-brain","title":"ε-Neural Thompson Sampling of Deep Brain Stimulation for Parkinson Disease Treatment","date":"2024-03-11","arxiv_id":"2403.06814","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-cram-method-for-efficient-simultaneous","title":"Cramming Contextual Bandits for On-policy Statistical Evaluation","date":"2024-03-11","arxiv_id":"2403.07031","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimizing-the-thompson-sampling-regret-to","title":"TS-RSR: A provably efficient approach for batch Bayesian Optimization","date":"2024-03-07","arxiv_id":"2403.04764","repositories_listed":0,"syntology":null},{"url":null,"slug":"chained-information-theoretic-bounds-and","title":"Chained Information-Theoretic bounds and Tight Regret Rate for Linear Bandit Problems","date":"2024-03-05","arxiv_id":"2403.03361","repositories_listed":0,"syntology":null},{"url":null,"slug":"epsilon-greedy-thompson-sampling-to-bayesian","title":"Epsilon-Greedy Thompson Sampling to Bayesian Optimization","date":"2024-03-01","arxiv_id":"2403.00540","repositories_listed":0,"syntology":null},{"url":null,"slug":"influencing-bandits-arm-selection-for","title":"Influencing Bandits: Arm Selection for Preference Shaping","date":"2024-02-29","arxiv_id":"2403.00036","repositories_listed":0,"syntology":null},{"url":null,"slug":"covariance-adaptive-least-squares-algorithm","title":"Towards Efficient and Optimal Covariance-Adaptive Algorithms for Combinatorial Semi-Bandits","date":"2024-02-23","arxiv_id":"2402.15171","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-adaptive-experiments-a-unified","title":"Optimizing Adaptive Experiments: A Unified Approach to Regret Minimization and Best-Arm Identification","date":"2024-02-16","arxiv_id":"2402.10592","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-models-meet-contextual-bandits-with","title":"Diffusion Models Meet Contextual Bandits with Large Action Spaces","date":"2024-02-15","arxiv_id":"2402.10028","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-in-partially-observable","title":"Thompson Sampling in Partially Observable Contextual Bandits","date":"2024-02-15","arxiv_id":"2402.10289","repositories_listed":0,"syntology":null},{"url":null,"slug":"tree-ensembles-for-contextual-bandits","title":"Tree Ensembles for Contextual Bandits","date":"2024-02-10","arxiv_id":"2402.06963","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bayesian-approach-to-online-learning-for","title":"Context in Public Health for Underserved Communities: A Bayesian Approach to Online Restless Bandits","date":"2024-02-07","arxiv_id":"2402.04933","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-thompson-sampling-for-no-regret","title":"Optimistic Thompson Sampling for No-Regret Learning in Unknown Games","date":"2024-02-07","arxiv_id":"2402.09456","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-for-llms","title":"Efficient Exploration for LLMs","date":"2024-02-01","arxiv_id":"2402.00396","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-stochastic-bandits-with-1","title":"Thompson Sampling for Stochastic Bandits with Noisy Contexts: An Information-Theoretic Regret Analysis","date":"2024-01-21","arxiv_id":"2401.11565","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-approximate-bayesian-learning-for","title":"Model-Free Approximate Bayesian Learning for Large-Scale Conversion Funnel Optimization","date":"2024-01-12","arxiv_id":"2401.06710","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-multi-agent-active-search-and","title":"Decentralized Multi-Agent Active Search and Tracking when Targets Outnumber Agents","date":"2024-01-06","arxiv_id":"2401.03154","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-sample-efficiency-of-high","title":"Improving sample efficiency of high dimensional Bayesian optimization with MCMC","date":"2024-01-05","arxiv_id":"2401.02650","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-inflated-bandits","title":"Zero-Inflated Bandits","date":"2023-12-25","arxiv_id":"2312.15595","repositories_listed":0,"syntology":null},{"url":null,"slug":"best-arm-identification-in-batched-multi","title":"Best Arm Identification in Batched Multi-armed Bandit Problems","date":"2023-12-21","arxiv_id":"2312.13875","repositories_listed":0,"syntology":null},{"url":null,"slug":"combinatorial-gaussian-process-bandits-in","title":"Bayesian Analysis of Combinatorial Gaussian Process Bandits","date":"2023-12-20","arxiv_id":"2312.12676","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-based-dynamic-hierarchical-transformer","title":"Sample-based Dynamic Hierarchical Transformer with Layer and Head Flexibility via Contextual Bandit","date":"2023-12-05","arxiv_id":"2312.03038","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-sliding-regret-in-stochastic-bandits","title":"The Sliding Regret in Stochastic Bandits: Discriminating Index and Randomized Policies","date":"2023-11-30","arxiv_id":"2311.18437","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-zero-inflated-count","title":"Thompson sampling for zero-inflated count outcomes with an application to the Drink Less mobile health study","date":"2023-11-24","arxiv_id":"2311.14359","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-inference-in-reinforcement","title":"Probabilistic Inference in Reinforcement Learning Done Right","date":"2023-11-22","arxiv_id":"2311.13294","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-distributed-neural-linear-thompson-sampling","title":"A Distributed Neural Linear Thompson Sampling Framework to Achieve URLLC in Industrial IoT","date":"2023-11-21","arxiv_id":"2401.06135","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-via-linearly-perturbed-loss","title":"Exploration via linearly perturbed loss minimisation","date":"2023-11-13","arxiv_id":"2311.07565","repositories_listed":0,"syntology":null},{"url":null,"slug":"posterior-sampling-based-bayesian","title":"Posterior Sampling-Based Bayesian Optimization with Tighter Bayesian Regret Bounds","date":"2023-11-07","arxiv_id":"2311.03760","repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-bayesian-optimization-for-replicable","title":"Batch Bayesian Optimization for Replicable Experimental Design","date":"2023-11-02","arxiv_id":"2311.01195","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-directed-algorithm-design-for-efficient","title":"Dual-Directed Algorithm Design for Efficient Pure Exploration","date":"2023-10-30","arxiv_id":"2310.19319","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-bayesian-regret-bounds-for-thompson","title":"Improved Bayesian Regret Bounds for Thompson Sampling in Reinforcement Learning","date":"2023-10-30","arxiv_id":"2310.20007","repositories_listed":0,"syntology":null},{"url":null,"slug":"little-exploration-is-all-you-need","title":"Little Exploration is All You Need","date":"2023-10-26","arxiv_id":"2310.17538","repositories_listed":0,"syntology":null},{"url":null,"slug":"making-rl-with-preference-based-feedback","title":"Making RL with Preference-based Feedback Efficient via Randomization","date":"2023-10-23","arxiv_id":"2310.14554","repositories_listed":0,"syntology":null},{"url":null,"slug":"parallel-bayesian-optimization-using","title":"Parallel Bayesian Optimization Using Satisficing Thompson Sampling for Time-Sensitive Black-Box Optimization","date":"2023-10-19","arxiv_id":"2310.12526","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-exploration-is-no-harder-than","title":"Optimal Exploration is no harder than Thompson Sampling","date":"2023-10-09","arxiv_id":"2310.06069","repositories_listed":0,"syntology":null},{"url":null,"slug":"module-wise-adaptive-distillation-for","title":"Module-wise Adaptive Distillation for Multimodality Foundation Models","date":"2023-10-06","arxiv_id":"2310.04550","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-bandits-model-to-deep-deterministic","title":"From Bandits Model to Deep Deterministic Policy Gradient, Reinforcement Learning with Contextual Information","date":"2023-10-01","arxiv_id":"2310.00642","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-exploration-with-best-challenger","title":"Thompson Exploration with Best Challenger Rule in Best Arm Identification","date":"2023-10-01","arxiv_id":"2310.00539","repositories_listed":0,"syntology":null},{"url":null,"slug":"monte-carlo-tree-search-with-uncertainty","title":"Monte-Carlo tree search with uncertainty propagation via optimal transport","date":"2023-09-19","arxiv_id":"2309.10737","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-selection-and-assignment-for-multi-modal","title":"Task Selection and Assignment for Multi-modal Multi-task Dialogue Act Classification with Non-stationary Multi-armed Bandits","date":"2023-09-18","arxiv_id":"2309.09832","repositories_listed":0,"syntology":null},{"url":null,"slug":"gym-saturation-gymnasium-environments-for","title":"gym-saturation: Gymnasium environments for saturation provers (System description)","date":"2023-09-16","arxiv_id":"2309.09022","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-regret-analysis-of-thompson","title":"Generalized Regret Analysis of Thompson Sampling using Fractional Posteriors","date":"2023-09-12","arxiv_id":"2309.06349","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-real-valued","title":"Thompson Sampling for Real-Valued Combinatorial Pure Exploration of Multi-Armed Bandit","date":"2023-08-20","arxiv_id":"2308.10238","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptex-a-self-service-contextual-bandit","title":"AdaptEx: A Self-Service Contextual Bandit Platform","date":"2023-08-08","arxiv_id":"2308.08650","repositories_listed":0,"syntology":null},{"url":null,"slug":"bag-of-policies-for-distributional-deep","title":"Bag of Policies for Distributional Deep Exploration","date":"2023-08-03","arxiv_id":"2308.01759","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-information-for-efficient","title":"Approximate information for efficient exploration-exploitation strategies","date":"2023-07-04","arxiv_id":"2307.01563","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-under-bernoulli-rewards","title":"Thompson Sampling under Bernoulli Rewards with Local Differential Privacy","date":"2023-07-03","arxiv_id":"2307.00863","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-improved-exploration-in","title":"Thompson sampling for improved exploration in GFlowNets","date":"2023-06-30","arxiv_id":"2306.17693","repositories_listed":0,"syntology":null},{"url":null,"slug":"geometry-aware-approaches-for-balancing","title":"Geometry-Aware Approaches for Balancing Performance and Theoretical Guarantees in Linear Bandits","date":"2023-06-26","arxiv_id":"2306.14872","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-neural-contextual-bandit-for","title":"Scalable Neural Contextual Bandit for Recommender Systems","date":"2023-06-26","arxiv_id":"2306.14834","repositories_listed":0,"syntology":null},{"url":null,"slug":"langevin-thompson-sampling-with-logarithmic","title":"Langevin Thompson Sampling with Logarithmic Communication: Bandits and Reinforcement Learning","date":"2023-06-15","arxiv_id":"2306.08803","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-learning-of-optimal-policies-in","title":"Bayesian Learning of Optimal Policies in Markov Decision Processes with Countably Infinite State-Space","date":"2023-06-05","arxiv_id":"2306.02574","repositories_listed":0,"syntology":null},{"url":null,"slug":"incentivizing-exploration-with-linear","title":"Incentivizing Exploration with Linear Contexts and Combinatorial Actions","date":"2023-06-03","arxiv_id":"2306.01990","repositories_listed":0,"syntology":null},{"url":null,"slug":"combinatorial-neural-bandits","title":"Combinatorial Neural Bandits","date":"2023-05-31","arxiv_id":"2306.00242","repositories_listed":0,"syntology":null},{"url":null,"slug":"2305-14704","title":"Practical Batch Bayesian Sampling Algorithms for Online Adaptive Traffic Experimentation","date":"2023-05-24","arxiv_id":"2305.14704","repositories_listed":0,"syntology":null},{"url":null,"slug":"discounted-thompson-sampling-for-non","title":"Discounted Thompson Sampling for Non-Stationary Bandit Problems","date":"2023-05-18","arxiv_id":"2305.10718","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-best-arm-identification-with","title":"Sequential Best-Arm Identification with Application to Brain-Computer Interface","date":"2023-05-17","arxiv_id":"2305.11908","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-parameterized-markov","title":"Thompson Sampling for Parameterized Markov Decision Processes with Uninformative Actions","date":"2023-05-13","arxiv_id":"2305.07844","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-improved-regret-analysis-for-ucb-n-and-ts","title":"An improved regret analysis for UCB-N and TS-N","date":"2023-05-06","arxiv_id":"2305.04093","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-regret-bounds-for","title":"Thompson Sampling Regret Bounds for Contextual Bandits with sub-Gaussian rewards","date":"2023-04-26","arxiv_id":"2304.13593","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-recommender-system-approach-for-very-large","title":"Efficiently Tackling Million-Dimensional Multiobjective Problems: A Direction Sampling and Fine-Tuning Approach","date":"2023-04-08","arxiv_id":"2304.04067","repositories_listed":0,"syntology":null},{"url":null,"slug":"sharp-deviations-bounds-for-dirichlet","title":"Sharp Deviations Bounds for Dirichlet Weighted Sums with Application to analysis of Bayesian algorithms","date":"2023-04-06","arxiv_id":"2304.03056","repositories_listed":0,"syntology":null},{"url":null,"slug":"guts-generalized-uncertainty-aware-thompson","title":"GUTS: Generalized Uncertainty-Aware Thompson Sampling for Multi-Agent Active Search","date":"2023-04-04","arxiv_id":"2304.02075","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-experimentation-at-scale-bayesian","title":"Adaptive Experimentation at Scale: A Computational Framework for Flexible Batches","date":"2023-03-21","arxiv_id":"2303.11582","repositories_listed":0,"syntology":null},{"url":null,"slug":"only-pay-for-what-is-uncertain-variance","title":"Only Pay for What Is Uncertain: Variance-Adaptive Thompson Sampling","date":"2023-03-16","arxiv_id":"2303.09033","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-general-recipe-for-the-analysis-of","title":"A General Recipe for the Analysis of Randomized Multi-Armed Bandit Algorithms","date":"2023-03-10","arxiv_id":"2303.06058","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-and-efficient-coordinating","title":"A Unified and Efficient Coordinating Framework for Autonomous DBMS Tuning","date":"2023-03-10","arxiv_id":"2303.05710","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-linear-bandit-problems","title":"Thompson Sampling for Linear Bandit Problems with Normal-Gamma Priors","date":"2023-03-06","arxiv_id":"2303.03348","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotically-optimal-thompson-sampling","title":"The Choice of Noninformative Priors for Thompson Sampling in Multiparameter Bandit Models","date":"2023-02-28","arxiv_id":"2302.14407","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-combinatorial-thompson-sampling-meets","title":"When Combinatorial Thompson Sampling meets Approximation Regret","date":"2023-02-22","arxiv_id":"2302.11182","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-continuous-hyperparameter-optimization","title":"Online Continuous Hyperparameter Optimization for Generalized Linear Contextual Bandits","date":"2023-02-18","arxiv_id":"2302.09440","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bandit-approach-to-online-pricing-for","title":"A Bandit Approach to Online Pricing for Heterogeneous Edge Resource Allocation","date":"2023-02-14","arxiv_id":"2302.06953","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-how-to-infer-partial-mdps-for-in","title":"Learning How to Infer Partial MDPs for In-Context Adaptation and Exploration","date":"2023-02-08","arxiv_id":"2302.04250","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-demonstrations-to-improve-online","title":"Leveraging Demonstrations to Improve Online Learning: Quality Matters","date":"2023-02-07","arxiv_id":"2302.03319","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimality-of-thompson-sampling-with","title":"Optimality of Thompson Sampling with Noninformative Priors for Pareto Bandits","date":"2023-02-03","arxiv_id":"2302.01544","repositories_listed":0,"syntology":null}],"record_sha256":"467999c91fceeeae8a411eaf6ffb847e454d2e35770eda838026cf8ec8aeb4f8","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}