{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/thompson-sampling/papers/2","list_of":"/task/thompson-sampling","task":"Thompson Sampling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":7,"rows_per_page":100,"rows":[101,200],"of":655,"counts":{"archive_papers_tagged":655,"with_a_code_link":135,"where_syntology_ran_a_sample":30,"not_listed_spam_title":0,"listed":655,"listed_where_code_ran":30,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":23,"every_run_a_failure_of_syntologys_instrument":7,"listed_with_a_run_with_no_instrument_failure":23,"listed_every_run_a_failure_of_syntologys_instrument":7,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/thompson-sampling","prev":"/task/thompson-sampling","next":"/task/thompson-sampling/papers/3","papers":[{"url":"/paper/odds-ratio-thompson-sampling-to-control-for","slug":"odds-ratio-thompson-sampling-to-control-for","title":"Odds-Ratio Thompson Sampling to Control for Time-Varying Effect","date":"2020-03-04","arxiv_id":"2003.01905","repositories_listed":1,"syntology":null},{"url":"/paper/on-isometry-robustness-of-deep-3d-point-cloud","slug":"on-isometry-robustness-of-deep-3d-point-cloud","title":"On Isometry Robustness of Deep 3D Point Cloud Models under Adversarial Attacks","date":"2020-02-27","arxiv_id":"2002.12222","repositories_listed":1,"syntology":{"n":3,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":3,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/on-isometry-robustness-of-deep-3d-point-cloud#ran","syntology_url":"https://syntology.ai/paper/2002.12222","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2002.12222"}},"official":{"repos":["skywalker6174/3d-isometry-robust"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/thompson-sampling-for-multinomial-logit","slug":"thompson-sampling-for-multinomial-logit","title":"Thompson Sampling for Multinomial Logit Contextual Bandits","date":"2019-12-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/bayesian-optimization-for-categorical-and","slug":"bayesian-optimization-for-categorical-and","title":"Bayesian Optimization for Categorical and Category-Specific Continuous Inputs","date":"2019-11-28","arxiv_id":"1911.12473","repositories_listed":1,"syntology":null},{"url":"/paper/thompson-sampling-for-factored-multi-agent","slug":"thompson-sampling-for-factored-multi-agent","title":"Multi-Agent Thompson Sampling for Bandit Applications with Sparse Neighbourhood Structures","date":"2019-11-22","arxiv_id":"1911.10120","repositories_listed":1,"syntology":null},{"url":"/paper/thompson-sampling-for-contextual-bandit","slug":"thompson-sampling-for-contextual-bandit","title":"Thompson Sampling for Contextual Bandit Problems with Auxiliary Safety Constraints","date":"2019-11-02","arxiv_id":"1911.00638","repositories_listed":1,"syntology":null},{"url":"/paper/thompson-sampling-via-local-uncertainty","slug":"thompson-sampling-via-local-uncertainty","title":"Thompson Sampling via Local Uncertainty","date":"2019-10-30","arxiv_id":"1910.13673","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/thompson-sampling-via-local-uncertainty#ran","syntology_url":"https://syntology.ai/paper/1910.13673","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1910.13673"}},"official":{"repos":["Zhendong-Wang/Thompson-Sampling-via-Local-Uncertainty"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/old-dog-learns-new-tricks-randomized-ucb-for","slug":"old-dog-learns-new-tricks-randomized-ucb-for","title":"Old Dog Learns New Tricks: Randomized UCB for Bandit Problems","date":"2019-10-11","arxiv_id":"1910.04928","repositories_listed":1,"syntology":{"n":6,"n_ran":6,"n_constructed":0,"n_ran_checked":3,"n_instrument":3,"n_unverified":0,"n_honours":3,"n_violates":0,"n_no_contract":0,"n_pointer_only":6,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 3 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/old-dog-learns-new-tricks-randomized-ucb-for#ran","syntology_url":"https://syntology.ai/paper/1910.04928","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1910.04928"}},"official":{"repos":["vaswanis/randucb"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/scaling-multi-armed-bandit-algorithms","slug":"scaling-multi-armed-bandit-algorithms","title":"Scaling Multi-Armed Bandit Algorithms","date":"2019-07-25","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/adaptive-thompson-sampling-stacks-for-memory","slug":"adaptive-thompson-sampling-stacks-for-memory","title":"Adaptive Thompson Sampling Stacks for Memory Bounded Open-Loop Planning","date":"2019-07-11","arxiv_id":"1907.05861","repositories_listed":1,"syntology":null},{"url":"/paper/regret-bounds-for-thompson-sampling-in","slug":"regret-bounds-for-thompson-sampling-in","title":"Regret Bounds for Thompson Sampling in Episodic Restless Bandit Problems","date":"2019-05-29","arxiv_id":"1905.12673","repositories_listed":1,"syntology":null},{"url":"/paper/memory-bounded-open-loop-planning-in-large","slug":"memory-bounded-open-loop-planning-in-large","title":"Memory Bounded Open-Loop Planning in Large POMDPs using Thompson Sampling","date":"2019-05-10","arxiv_id":"1905.04020","repositories_listed":1,"syntology":null},{"url":"/paper/sample-efficient-model-free-reinforcement","slug":"sample-efficient-model-free-reinforcement","title":"Sample-Efficient Model-Free Reinforcement Learning with Off-Policy Critics","date":"2019-03-11","arxiv_id":"1903.04193","repositories_listed":1,"syntology":null},{"url":"/paper/thompson-sampling-with-information-relaxation","slug":"thompson-sampling-with-information-relaxation","title":"Thompson Sampling with Information Relaxation Penalties","date":"2019-02-12","arxiv_id":"1902.04251","repositories_listed":1,"syntology":null},{"url":"/paper/thompson-sampling-for-a-fatigue-aware-online","slug":"thompson-sampling-for-a-fatigue-aware-online","title":"Thompson Sampling for a Fatigue-aware Online Recommendation System","date":"2019-01-23","arxiv_id":"1901.07734","repositories_listed":1,"syntology":null},{"url":"/paper/information-directed-exploration-for-deep","slug":"information-directed-exploration-for-deep","title":"Information-Directed Exploration for Deep Reinforcement Learning","date":"2018-12-18","arxiv_id":"1812.07544","repositories_listed":1,"syntology":null},{"url":"/paper/merge-double-thompson-sampling-for-large","slug":"merge-double-thompson-sampling-for-large","title":"MergeDTS: A Method for Effective Large-Scale Online Ranker Evaluation","date":"2018-12-11","arxiv_id":"1812.04412","repositories_listed":1,"syntology":null},{"url":"/paper/bandit-learning-with-implicit-feedback","slug":"bandit-learning-with-implicit-feedback","title":"Bandit Learning with Implicit Feedback","date":"2018-12-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/practical-bayesian-learning-of-neural","slug":"practical-bayesian-learning-of-neural","title":"Practical Bayesian Learning of Neural Networks via Adaptive Optimisation Methods","date":"2018-11-08","arxiv_id":"1811.03679","repositories_listed":1,"syntology":null},{"url":"/paper/nonparametric-gaussian-mixture-models-for-the","slug":"nonparametric-gaussian-mixture-models-for-the","title":"Nonparametric Gaussian Mixture Models for the Multi-Armed Bandit","date":"2018-08-08","arxiv_id":"1808.02932","repositories_listed":1,"syntology":null},{"url":"/paper/sequential-importance-sampling-bandits","slug":"sequential-importance-sampling-bandits","title":"Sequential Monte Carlo Bandits","date":"2018-08-08","arxiv_id":"1808.02933","repositories_listed":1,"syntology":null},{"url":"/paper/myopic-bayesian-design-of-experiments-via","slug":"myopic-bayesian-design-of-experiments-via","title":"Myopic Bayesian Design of Experiments via Posterior Sampling and Probabilistic Programming","date":"2018-05-25","arxiv_id":"1805.09964","repositories_listed":1,"syntology":null},{"url":"/paper/efficient-exploration-through-bayesian-deep-q","slug":"efficient-exploration-through-bayesian-deep-q","title":"Efficient Exploration through Bayesian Deep Q-Networks","date":"2018-02-13","arxiv_id":"1802.04412","repositories_listed":1,"syntology":null},{"url":"/paper/bayesian-bandits-balancing-the-exploration","slug":"bayesian-bandits-balancing-the-exploration","title":"Bayesian bandits: balancing the exploration-exploitation tradeoff via double sampling","date":"2017-09-10","arxiv_id":"1709.03162","repositories_listed":1,"syntology":null},{"url":"/paper/variational-inference-for-the-multi-armed","slug":"variational-inference-for-the-multi-armed","title":"Variational inference for the multi-armed contextual bandit","date":"2017-09-10","arxiv_id":"1709.03163","repositories_listed":1,"syntology":null},{"url":"/paper/asynchronous-parallel-bayesian-optimisation","slug":"asynchronous-parallel-bayesian-optimisation","title":"Asynchronous Parallel Bayesian Optimisation via Thompson Sampling","date":"2017-05-25","arxiv_id":"1705.09236","repositories_listed":1,"syntology":null},{"url":"/paper/aixijs-a-software-demo-for-general","slug":"aixijs-a-software-demo-for-general","title":"AIXIjs: A Software Demo for General Reinforcement Learning","date":"2017-05-22","arxiv_id":"1705.07615","repositories_listed":1,"syntology":null},{"url":"/paper/mostly-exploration-free-algorithms-for","slug":"mostly-exploration-free-algorithms-for","title":"Mostly Exploration-Free Algorithms for Contextual Bandits","date":"2017-04-28","arxiv_id":"1704.09011","repositories_listed":1,"syntology":null},{"url":"/paper/stacked-thompson-bandits","slug":"stacked-thompson-bandits","title":"Stacked Thompson Bandits","date":"2017-02-28","arxiv_id":"1702.08726","repositories_listed":1,"syntology":null},{"url":"/paper/double-thompson-sampling-for-dueling-bandits","slug":"double-thompson-sampling-for-dueling-bandits","title":"Double Thompson Sampling for Dueling Bandits","date":"2016-04-25","arxiv_id":"1604.07101","repositories_listed":1,"syntology":null},{"url":"/paper/cascading-bandits-for-large-scale","slug":"cascading-bandits-for-large-scale","title":"Cascading Bandits for Large-Scale Recommendation Problems","date":"2016-03-17","arxiv_id":"1603.05359","repositories_listed":1,"syntology":null},{"url":"/paper/simple-bayesian-algorithms-for-best-arm","slug":"simple-bayesian-algorithms-for-best-arm","title":"Simple Bayesian Algorithms for Best Arm Identification","date":"2016-02-26","arxiv_id":"1602.08448","repositories_listed":1,"syntology":null},{"url":"/paper/incentivizing-exploration-in-reinforcement","slug":"incentivizing-exploration-in-reinforcement","title":"Incentivizing Exploration In Reinforcement Learning With Deep Predictive Models","date":"2015-07-03","arxiv_id":"1507.00814","repositories_listed":1,"syntology":null},{"url":"/paper/optimal-regret-analysis-of-thompson-sampling","slug":"optimal-regret-analysis-of-thompson-sampling","title":"Optimal Regret Analysis of Thompson Sampling in Stochastic Multi-armed Bandit Problem with Multiple Plays","date":"2015-06-02","arxiv_id":"1506.00779","repositories_listed":1,"syntology":null},{"url":"/paper/thompson-sampling-an-asymptotically-optimal","slug":"thompson-sampling-an-asymptotically-optimal","title":"Thompson Sampling: An Asymptotically Optimal Finite Time Analysis","date":"2012-05-18","arxiv_id":"1205.4217","repositories_listed":1,"syntology":null},{"url":null,"slug":"robust-policy-switching-for-antifragile","title":"Robust Policy Switching for Antifragile Reinforcement Learning for UAV Deconfliction in Adversarial Environments","date":"2025-06-26","arxiv_id":"2506.21127","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-attribution-with-multi-armed-bandit","title":"Context Attribution with Multi-Armed Bandit Optimization","date":"2025-06-24","arxiv_id":"2506.19977","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-data-augmentation-for-thompson","title":"Adaptive Data Augmentation for Thompson Sampling","date":"2025-06-17","arxiv_id":"2506.14479","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-optimization-with-inexact","title":"Bayesian Optimization with Inexact Acquisition: Is Random Grid Search Sufficient?","date":"2025-06-13","arxiv_id":"2506.11831","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-kernelized-bandit-algorithms-via","title":"Efficient kernelized bandit algorithms via exploration distributions","date":"2025-06-11","arxiv_id":"2506.10091","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotically-optimal-linear-best-feasible","title":"Asymptotically Optimal Linear Best Feasible Arm Identification with Fixed Budget","date":"2025-06-03","arxiv_id":"2506.02386","repositories_listed":0,"syntology":null},{"url":null,"slug":"simplifying-bayesian-optimization-via-in","title":"Simplifying Bayesian Optimization Via In-Context Direct Optimum Sampling","date":"2025-05-29","arxiv_id":"2505.23913","repositories_listed":0,"syntology":null},{"url":null,"slug":"stable-thompson-sampling-valid-inference-via","title":"Stable Thompson Sampling: Valid Inference via Variance Inflation","date":"2025-05-29","arxiv_id":"2505.23260","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-in-online-rlhf-with-general","title":"Thompson Sampling in Online RLHF with General Function Approximation","date":"2025-05-29","arxiv_id":"2505.23927","repositories_listed":0,"syntology":null},{"url":null,"slug":"practical-adversarial-attacks-on-stochastic","title":"Practical Adversarial Attacks on Stochastic Bandits via Fake Data Injection","date":"2025-05-28","arxiv_id":"2505.21938","repositories_listed":0,"syntology":null},{"url":null,"slug":"deconfounded-warm-start-thompson-sampling","title":"Deconfounded Warm-Start Thompson Sampling with Applications to Precision Medicine","date":"2025-05-22","arxiv_id":"2505.17283","repositories_listed":0,"syntology":null},{"url":null,"slug":"generator-mediated-bandits-thompson-sampling","title":"Generator-Mediated Bandits: Thompson Sampling for GenAI-Powered Adaptive Interventions","date":"2025-05-22","arxiv_id":"2505.16311","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-and-interpretable-contextual-bandits","title":"Scalable and Interpretable Contextual Bandits: A Literature Review and Retail Offer Prototype","date":"2025-05-22","arxiv_id":"2505.16918","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-domain-african-languages-translation-using","title":"In-Domain African Languages Translation Using LLMs and Multi-armed Bandits","date":"2025-05-21","arxiv_id":"2505.15069","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-decision-making-under-model","title":"Dynamic Decision-Making under Model Misspecification","date":"2025-05-20","arxiv_id":"2505.14913","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-like-algorithms-for","title":"Thompson Sampling-like Algorithms for Stochastic Rising Bandits","date":"2025-05-17","arxiv_id":"2505.12092","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-offline-data-from-similar-systems","title":"Leveraging Offline Data from Similar Systems for Online Linear Quadratic Control","date":"2025-05-14","arxiv_id":"2505.09057","repositories_listed":0,"syntology":null},{"url":null,"slug":"connecting-thompson-sampling-and-ucb-towards","title":"Connecting Thompson Sampling and UCB: Towards More Efficient Trade-offs Between Privacy and Regret","date":"2025-05-05","arxiv_id":"2505.02383","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-learning-of-the-optimal-action-value","title":"Bayesian learning of the optimal action-value function in a Markov decision process","date":"2025-05-03","arxiv_id":"2505.01859","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-contextual-bandits-under-delayed","title":"Neural Contextual Bandits Under Delayed Feedback Constraints","date":"2025-04-16","arxiv_id":"2504.12086","repositories_listed":0,"syntology":null},{"url":null,"slug":"counterfactual-inference-under-thompson","title":"Counterfactual Inference under Thompson Sampling","date":"2025-04-03","arxiv_id":"2504.08773","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-nonparametric-contextual-bandits","title":"Sparse Nonparametric Contextual Bandits","date":"2025-03-20","arxiv_id":"2503.16382","repositories_listed":0,"syntology":null},{"url":null,"slug":"achieving-adaptivity-and-optimality-for-multi","title":"Achieving adaptivity and optimality for multi-armed bandits using Exponential-Kullback Leibler Maillard Sampling","date":"2025-02-20","arxiv_id":"2502.14379","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-adversarial-analysis-of-thompson-sampling","title":"An Adversarial Analysis of Thompson Sampling for Full-information Online Learning: from Finite to Infinite Action Spaces","date":"2025-02-20","arxiv_id":"2502.14790","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-search-and-value-models","title":"Uncertainty-Aware Search and Value Models: Mitigating Search Scaling Flaws in LLMs","date":"2025-02-16","arxiv_id":"2502.11155","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-and-why-randomised-exploration-works-in","title":"When and why randomised exploration works (in linear bandits)","date":"2025-02-13","arxiv_id":"2502.08870","repositories_listed":0,"syntology":null},{"url":null,"slug":"kabb-knowledge-aware-bayesian-bandits-for","title":"KABB: Knowledge-Aware Bayesian Bandits for Dynamic Expert Coordination in Multi-Agent Systems","date":"2025-02-11","arxiv_id":"2502.07350","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-thompson-sampling-via-generation","title":"Contextual Thompson Sampling via Generation of Missing Data","date":"2025-02-10","arxiv_id":"2502.07064","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-information-theoretic-analysis-of-thompson-2","title":"An Information-Theoretic Analysis of Thompson Sampling with Infinite Action Spaces","date":"2025-02-04","arxiv_id":"2502.02140","repositories_listed":0,"syntology":null},{"url":null,"slug":"best-policy-learning-from-trajectory","title":"Active RLHF via Best Policy Learning from Trajectory Preference Feedback","date":"2025-01-31","arxiv_id":"2501.18873","repositories_listed":0,"syntology":null},{"url":"/paper/fedrts-federated-robust-pruning-via","slug":"fedrts-federated-robust-pruning-via","title":"FedRTS: Federated Robust Pruning via Combinatorial Thompson Sampling","date":"2025-01-31","arxiv_id":"2501.19122","repositories_listed":0,"syntology":{"n":3,"n_ran":2,"n_constructed":0,"n_ran_checked":1,"n_instrument":1,"n_unverified":1,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":3,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/fedrts-federated-robust-pruning-via#ran","syntology_url":"https://syntology.ai/paper/2501.19122","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2501.19122"}},"official":null}},{"url":null,"slug":"evade-event-based-variational-thompson-1","title":"EVaDE : Event-Based Variational Thompson Sampling for Model-Based Reinforcement Learning","date":"2025-01-16","arxiv_id":"2501.09611","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastically-constrained-best-arm","title":"Stochastically Constrained Best Arm Identification with Thompson Sampling","date":"2025-01-07","arxiv_id":"2501.03877","repositories_listed":0,"syntology":null},{"url":null,"slug":"truthful-mechanisms-for-linear-bandit-games","title":"Truthful mechanisms for linear bandit games with private contexts","date":"2025-01-07","arxiv_id":"2501.03865","repositories_listed":0,"syntology":null},{"url":null,"slug":"wapts-a-weighted-allocation-probability","title":"WAPTS: A Weighted Allocation Probability Adjusted Thompson Sampling Algorithm for High-Dimensional and Sparse Experiment Settings","date":"2025-01-07","arxiv_id":"2501.03999","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-improved-regret-bounds-in-bayesian","title":"On Improved Regret Bounds In Bayesian Optimization with Gaussian Noise","date":"2024-12-25","arxiv_id":"2412.18789","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-bayesian-deep-reinforcement","title":"Generalized Bayesian deep reinforcement learning","date":"2024-12-16","arxiv_id":"2412.11743","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-information-theoretic-analysis-of-thompson-1","title":"An Information-Theoretic Analysis of Thompson Sampling for Logistic Bandits","date":"2024-12-03","arxiv_id":"2412.02861","repositories_listed":0,"syntology":null},{"url":"/paper/bots-batch-bayesian-optimization-of-extended","slug":"bots-batch-bayesian-optimization-of-extended","title":"BOTS: Batch Bayesian Optimization of Extended Thompson Sampling for Severely Episode-Limited RL Settings","date":"2024-11-30","arxiv_id":"2412.00308","repositories_listed":0,"syntology":{"n":9,"n_ran":3,"n_constructed":2,"n_ran_checked":2,"n_instrument":1,"n_unverified":6,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":9,"phrase":"3 ran (of which 2 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 1 where Syntology's instrument failed) · 6 unverified","sample_list":"/paper/bots-batch-bayesian-optimization-of-extended#ran","syntology_url":"https://syntology.ai/paper/2412.00308","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2412.00308"}},"official":null}},{"url":null,"slug":"epinet-for-content-cold-start","title":"Epinet for Content Cold Start","date":"2024-11-20","arxiv_id":"2412.04484","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-and-learning-in-risk-aware-restless","title":"Planning and Learning in Risk-Aware Restless Multi-Arm Bandit Problem","date":"2024-10-30","arxiv_id":"2410.23029","repositories_listed":0,"syntology":null},{"url":null,"slug":"banditcat-and-autoirt-machine-learning","title":"BanditCAT and AutoIRT: Machine Learning Approaches to Computerized Adaptive Testing and Item Calibration","date":"2024-10-28","arxiv_id":"2410.21033","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-collaborative-bandits-with-thompson","title":"Bayesian Collaborative Bandits with Thompson Sampling for Improved Outreach in Maternal Health Program","date":"2024-10-28","arxiv_id":"2410.21405","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-thompson-sampling-algorithms-against","title":"Robust Thompson Sampling Algorithms Against Reward Poisoning Attacks","date":"2024-10-25","arxiv_id":"2410.19705","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligning-ai-agents-via-information-directed","title":"Aligning AI Agents via Information-Directed Sampling","date":"2024-10-18","arxiv_id":"2410.14807","repositories_listed":0,"syntology":null},{"url":null,"slug":"combinatorial-multi-armed-bandits-arm","title":"Combinatorial Multi-armed Bandits: Arm Selection via Group Testing","date":"2024-10-14","arxiv_id":"2410.10679","repositories_listed":0,"syntology":null},{"url":null,"slug":"gaussian-process-thompson-sampling-via","title":"Gaussian Process Thompson Sampling via Rootfinding","date":"2024-10-10","arxiv_id":"2410.08071","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-with-non-stationary","title":"Contextual Bandits with Non-Stationary Correlated Rewards for User Association in MmWave Vehicular Networks","date":"2024-10-08","arxiv_id":"2410.05785","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-model-based-reinforcement-learning-2","title":"Efficient Model-Based Reinforcement Learning Through Optimistic Thompson Sampling","date":"2024-10-07","arxiv_id":"2410.04988","repositories_listed":0,"syntology":null},{"url":null,"slug":"partially-observable-contextual-bandits-with","title":"Partially Observable Contextual Bandits with Linear Payoffs","date":"2024-09-17","arxiv_id":"2409.11521","repositories_listed":0,"syntology":null},{"url":null,"slug":"modified-meta-thompson-sampling-for-linear","title":"Modified Meta-Thompson Sampling for Linear Bandits and Its Bayes Regret Analysis","date":"2024-09-10","arxiv_id":"2409.06329","repositories_listed":0,"syntology":null},{"url":null,"slug":"sliding-window-thompson-sampling-for-non","title":"Sliding-Window Thompson Sampling for Non-Stationary Settings","date":"2024-09-08","arxiv_id":"2409.05181","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-combinatorial-bandits-for-budget","title":"Multi-Task Combinatorial Bandits for Budget Allocation","date":"2024-08-31","arxiv_id":"2409.00561","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-extremely-data-efficient-and-generative","title":"An Extremely Data-efficient and Generative LLM-based Reinforcement Learning Agent for Recommenders","date":"2024-08-28","arxiv_id":"2408.16032","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-thompson-sampling-via-information","title":"Improving Thompson Sampling via Information Relaxation for Budgeted Multi-armed Bandits","date":"2024-08-28","arxiv_id":"2408.15535","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandit-with-herding-effects","title":"Contextual Bandit with Herding Effects: Algorithms and Recommendation Applications","date":"2024-08-26","arxiv_id":"2408.14432","repositories_listed":0,"syntology":null},{"url":null,"slug":"mathematical-programming-for-adaptive","title":"Optimization-Driven Adaptive Experimentation","date":"2024-08-08","arxiv_id":"2408.04570","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-dueling-bandits","title":"Neural Dueling Bandits: Preference-Based Optimization with Human Feedback","date":"2024-07-24","arxiv_id":"2407.17112","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-itself-is-differentially","title":"Thompson Sampling Itself is Differentially Private","date":"2024-07-20","arxiv_id":"2407.14879","repositories_listed":0,"syntology":null},{"url":null,"slug":"drl-based-joint-resource-scheduling-of-embb","title":"DRL-based Joint Resource Scheduling of eMBB and URLLC in O-RAN","date":"2024-07-16","arxiv_id":"2407.11558","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-bandit-algorithms-with-approximate","title":"Bayesian Bandit Algorithms with Approximate Inference in Stochastic Linear Bandits","date":"2024-06-20","arxiv_id":"2406.14071","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-user-association-and-pairing-in-multi","title":"Joint User Association and Pairing in Multi-UAV-Assisted NOMA Networks: A Decaying-Epsilon Thompson Sampling Framework","date":"2024-06-20","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"preferential-multi-objective-bayesian","title":"Preferential Multi-Objective Bayesian Optimization","date":"2024-06-20","arxiv_id":"2406.14699","repositories_listed":0,"syntology":null},{"url":null,"slug":"memory-sequence-length-of-data-sampling","title":"Memory Sequence Length of Data Sampling Impacts the Adaptation of Meta-Reinforcement Learning Agents","date":"2024-06-18","arxiv_id":"2406.12359","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-reward-conditioned-policies-for","title":"Improving Reward-Conditioned Policies for Multi-Armed Bandits using Normalized Weight Functions","date":"2024-06-16","arxiv_id":"2406.10795","repositories_listed":0,"syntology":null}],"record_sha256":"79547bc31aa829d1c14630b5f6f2573de897cace700079a4557ddb6c115b2126","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}