{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/thompson-sampling/papers/6","list_of":"/task/thompson-sampling","task":"Thompson Sampling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":6,"pages_in_order":7,"rows_per_page":100,"rows":[501,600],"of":655,"counts":{"archive_papers_tagged":655,"with_a_code_link":135,"where_syntology_ran_a_sample":30,"not_listed_spam_title":0,"listed":655,"listed_where_code_ran":30,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":23,"every_run_a_failure_of_syntologys_instrument":7,"listed_with_a_run_with_no_instrument_failure":23,"listed_every_run_a_failure_of_syntologys_instrument":7,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/thompson-sampling","prev":"/task/thompson-sampling/papers/5","next":"/task/thompson-sampling/papers/7","papers":[{"url":null,"slug":"thompson-sampling-in-non-episodic-restless","title":"Thompson Sampling in Non-Episodic Restless Bandits","date":"2019-10-12","arxiv_id":"1910.05654","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-analysis-of-causal-bandit-problems","title":"Regret Analysis of Bandit Problems with Causal Background Knowledge","date":"2019-10-11","arxiv_id":"1910.04938","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-dynamic-assortment-optimization-in-the","title":"Robust Dynamic Assortment Optimization in the Presence of Outlier Customers","date":"2019-10-09","arxiv_id":"1910.04183","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-copula-approach-for-hyperparameter-transfer-1","title":"A Quantile-based Approach for Hyperparameter Transfer Learning","date":"2019-09-30","arxiv_id":"1909.13595","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-copula-approach-for-hyperparameter-transfer","title":"A Copula approach for hyperparameter transfer learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-multivariate-bandit-algorithm-with","title":"Efficient Multivariate Bandit Algorithm with Path Planning","date":"2019-09-06","arxiv_id":"1909.02705","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-arm-wise-randomization-approach-to","title":"An Arm-Wise Randomization Approach to Combinatorial Linear Semi-Bandits","date":"2019-09-05","arxiv_id":"1909.02251","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-inference-for-advertising-auctions","title":"Online Causal Inference for Advertising in Real-Time Bidding Auctions","date":"2019-08-22","arxiv_id":"1908.08600","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-batched-multi-armed-bandit-approach-to-news","title":"A Batched Multi-Armed Bandit Approach to News Headline Testing","date":"2019-08-17","arxiv_id":"1908.06256","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bayesian-choice-model-for-eliminating","title":"A Bayesian Choice Model for Eliminating Feedback Loops","date":"2019-08-15","arxiv_id":"1908.05640","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-and-approximate-inference","title":"Thompson Sampling with Approximate Inference","date":"2019-08-14","arxiv_id":"1908.04970","repositories_listed":0,"syntology":null},{"url":null,"slug":"convergence-rates-of-posterior-distributions","title":"Convergence Rates of Posterior Distributions in Markov Decision Process","date":"2019-07-22","arxiv_id":"1907.09083","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-on-symmetric-stable-bandits","title":"Thompson Sampling on Symmetric $α$-Stable Bandits","date":"2019-07-08","arxiv_id":"1907.03821","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-combinatorial-network","title":"Thompson Sampling for Combinatorial Network Optimization in Unknown Environments","date":"2019-07-07","arxiv_id":"1907.04201","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixed-variable-bayesian-optimization","title":"Mixed-Variable Bayesian Optimization","date":"2019-07-02","arxiv_id":"1907.01329","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandit-learning-for-diversified-interactive","title":"Bandit Learning for Diversified Interactive Recommendation","date":"2019-07-01","arxiv_id":"1907.01647","repositories_listed":0,"syntology":null},{"url":null,"slug":"revised-progressive-hedging-algorithm-based","title":"Revised Progressive-Hedging-Algorithm Based Two-layer Solution Scheme for Bayesian Reinforcement Learning","date":"2019-06-21","arxiv_id":"1906.09035","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-spectrum-gaussian-process-for-bayesian","title":"Sparse Spectrum Gaussian Process for Bayesian Optimization","date":"2019-06-21","arxiv_id":"1906.08898","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-adversarial-bit","title":"Thompson Sampling for Adversarial Bit Prediction","date":"2019-06-21","arxiv_id":"1906.09059","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-neural-network-with-kronecker-flow","title":"Stochastic Neural Network with Kronecker Flow","date":"2019-06-10","arxiv_id":"1906.04282","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-intrinsic-robustness-of-stochastic","title":"The Intrinsic Robustness of Stochastic Bandits to Strategic Manipulation","date":"2019-06-04","arxiv_id":"1906.01528","repositories_listed":0,"syntology":null},{"url":null,"slug":"connections-between-mirror-descent-thompson","title":"Connections Between Mirror Descent, Thompson Sampling and the Information Ratio","date":"2019-05-28","arxiv_id":"1905.11817","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-regret-bounds-for-thompson-sampling-and","title":"Feedback graph regret bounds for Thompson Sampling and UCB","date":"2019-05-23","arxiv_id":"1905.09898","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-model-selection-framework-an","title":"Adaptive Model Selection Framework: An Application to Airline Pricing","date":"2019-05-21","arxiv_id":"1905.08874","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-sensor-placement-for-continuous","title":"Adaptive Sensor Placement for Continuous Spaces","date":"2019-05-16","arxiv_id":"1905.06821","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-performance-of-thompson-sampling-on","title":"On the Performance of Thompson Sampling on Logistic Bandits","date":"2019-05-12","arxiv_id":"1905.04654","repositories_listed":0,"syntology":null},{"url":null,"slug":"autosem-automatic-task-selection-and-mixing","title":"AutoSeM: Automatic Task Selection and Mixing in Multi-Task Learning","date":"2019-04-08","arxiv_id":"1904.04153","repositories_listed":0,"syntology":null},{"url":null,"slug":"randomised-bayesian-least-squares-policy","title":"Randomised Bayesian Least-Squares Policy Iteration","date":"2019-04-06","arxiv_id":"1904.03535","repositories_listed":0,"syntology":null},{"url":null,"slug":"sampling-acquisition-functions-for-batch","title":"Sampling Acquisition Functions for Batch Bayesian Optimization","date":"2019-03-22","arxiv_id":"1903.09434","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-multi-armed-bandit-designs-for-phase-i","title":"On Multi-Armed Bandit Designs for Dose-Finding Clinical Trials","date":"2019-03-17","arxiv_id":"1903.07082","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-thompson-sampling-for-wireless","title":"Constrained Thompson Sampling for Wireless Link Optimization","date":"2019-02-28","arxiv_id":"1902.11102","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-dynamic-pricing-learning-across","title":"Meta Dynamic Pricing: Transfer Learning Across Experiments","date":"2019-02-28","arxiv_id":"1902.10918","repositories_listed":0,"syntology":null},{"url":null,"slug":"fully-distributed-bayesian-optimization-with","title":"Fully Distributed Bayesian Optimization with Stochastic Policies","date":"2019-02-26","arxiv_id":"1902.09992","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-armed-bandit-strategies-for-non","title":"Multi-Armed Bandit Strategies for Non-Stationary Reward Distributions and Delayed Feedback Processes","date":"2019-02-22","arxiv_id":"1902.08593","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-thompson-sampling-via-optimal","title":"Scalable Thompson Sampling via Optimal Transport","date":"2019-02-19","arxiv_id":"1902.07239","repositories_listed":0,"syntology":null},{"url":null,"slug":"klucb-approach-to-copeland-bandits","title":"KLUCB Approach to Copeland Bandits","date":"2019-02-07","arxiv_id":"1902.02778","repositories_listed":0,"syntology":null},{"url":null,"slug":"first-order-regret-analysis-of-thompson","title":"First-Order Bayesian Regret Analysis of Thompson Sampling","date":"2019-02-02","arxiv_id":"1902.00681","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-multi-armed-bandit-algorithm-for","title":"Contextual Multi-armed Bandit Algorithm for Semiparametric Reward Model","date":"2019-01-31","arxiv_id":"1901.11221","repositories_listed":0,"syntology":null},{"url":null,"slug":"parallel-contextual-bandits-in-wireless","title":"Parallel Contextual Bandits in Wireless Handover Optimization","date":"2019-01-21","arxiv_id":"1902.01931","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-noncompliant-bandits","title":"Thompson Sampling for Noncompliant Bandits","date":"2018-12-03","arxiv_id":"1812.00856","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-learning-for-dynamic-coding-in","title":"Optimal Learning for Dynamic Coding in Deadline-Constrained Multi-Channel Networks","date":"2018-11-27","arxiv_id":"1811.10829","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-pursuit-evasion","title":"Thompson Sampling for Pursuit-Evasion Problems","date":"2018-11-11","arxiv_id":"1811.04471","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-correlation-in-finite-armed","title":"A Unified Approach to Translate Classical Bandit Algorithms to the Structured Bandit Setting","date":"2018-10-18","arxiv_id":"1810.08164","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-bayesian-optimization-and-lipschitz","title":"Combining Bayesian Optimization and Lipschitz Optimization","date":"2018-10-10","arxiv_id":"1810.04336","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-multi-armed-bandits-for-causal","title":"Contextual Multi-Armed Bandits for Causal Marketing","date":"2018-10-02","arxiv_id":"1810.01859","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-cascading-bandits","title":"Thompson Sampling Algorithms for Cascading Bandits","date":"2018-10-02","arxiv_id":"1810.01187","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-linear-bandits-through-matrix","title":"Efficient Linear Bandits through Matrix Sketching","date":"2018-09-28","arxiv_id":"1809.11033","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-behavioral-constraints-in","title":"Incorporating Behavioral Constraints in Online AI Systems","date":"2018-09-15","arxiv_id":"1809.05720","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-thompson-sampling-for","title":"Analysis of Thompson Sampling for Combinatorial Multi-armed Bandit with Probabilistically Triggered Arms","date":"2018-09-07","arxiv_id":"1809.02707","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-grey-box-fuzz-testing-with-thompson","title":"Adaptive Grey-Box Fuzz-Testing with Thompson Sampling","date":"2018-08-24","arxiv_id":"1808.08256","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-contextual-multi-armed-bandits","title":"Deep Contextual Multi-armed Bandits","date":"2018-07-25","arxiv_id":"1807.09809","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-optimal-algorithm-for-stochastic-and","title":"Tsallis-INF: An Optimal Algorithm for Stochastic and Adversarial Bandits","date":"2018-07-19","arxiv_id":"1807.07623","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimization-of-a-ssps-header-bidding","title":"Optimization of a SSP's Header Bidding Strategy using Thompson Sampling","date":"2018-07-09","arxiv_id":"1807.03299","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-regret-bounds-for-thompson-sampling","title":"Improved Regret Bounds for Thompson Sampling in Linear Quadratic Control Problems","date":"2018-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-differential-privacy-of-thompson","title":"On The Differential Privacy of Thompson Sampling With Gaussian Prior","date":"2018-06-24","arxiv_id":"1806.09192","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-test-for-the-lowest-mean-from","title":"Sequential Test for the Lowest Mean: From Thompson to Murphy Sampling","date":"2018-06-04","arxiv_id":"1806.00973","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-information-theoretic-analysis-for","title":"An Information-Theoretic Analysis for Thompson Sampling with Many Actions","date":"2018-05-30","arxiv_id":"1805.11845","repositories_listed":0,"syntology":null},{"url":null,"slug":"new-insights-into-bootstrapping-for-bandits","title":"New Insights into Bootstrapping for Bandits","date":"2018-05-24","arxiv_id":"1805.09793","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-thompson-sampling-for-graphical","title":"Analysis of Thompson Sampling for Graphical Bandits Without the Graphs","date":"2018-05-23","arxiv_id":"1805.08930","repositories_listed":0,"syntology":null},{"url":null,"slug":"pg-ts-improved-thompson-sampling-for-logistic","title":"PG-TS: Improved Thompson Sampling for Logistic Contextual Bandits","date":"2018-05-18","arxiv_id":"1805.07458","repositories_listed":0,"syntology":null},{"url":null,"slug":"profitable-bandits","title":"Profitable Bandits","date":"2018-05-08","arxiv_id":"1805.02908","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-reinforcement-learning-with-monte","title":"Active Reinforcement Learning with Monte-Carlo Tree Search","date":"2018-03-13","arxiv_id":"1803.04926","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-combinatorial-semi","title":"Thompson Sampling for Combinatorial Semi-Bandits","date":"2018-03-13","arxiv_id":"1803.04623","repositories_listed":0,"syntology":null},{"url":null,"slug":"satisficing-in-time-sensitive-bandit-learning","title":"Satisficing in Time-Sensitive Bandit Learning","date":"2018-03-07","arxiv_id":"1803.02855","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-dynamic-pricing","title":"Thompson Sampling for Dynamic Pricing","date":"2018-02-08","arxiv_id":"1802.03050","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-directed-sampling-and-bandits","title":"Information Directed Sampling and Bandits with Heteroscedastic Noise","date":"2018-01-29","arxiv_id":"1801.09667","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-search-for-high-recall-a-non","title":"Active Search for High Recall: a Non-Stationary Extension of Thompson Sampling","date":"2017-12-27","arxiv_id":"1712.09550","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-adaptive-estimation-for-dynamic-bernoulli","title":"On Adaptive Estimation for Dynamic Bernoulli Bandits","date":"2017-12-08","arxiv_id":"1712.03134","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-posterior-sampling-for","title":"Optimistic posterior sampling for reinforcement learning: worst-case regret bounds","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-with-double-uncertain","title":"Efficient exploration with Double Uncertain Value Networks","date":"2017-11-29","arxiv_id":"1711.10789","repositories_listed":0,"syntology":null},{"url":null,"slug":"customized-nonlinear-bandits-for-online","title":"Customized Nonlinear Bandits for Online Response Selection in Neural Conversation Models","date":"2017-11-22","arxiv_id":"1711.08493","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-best-arm-identification-for","title":"Bayesian Best-Arm Identification for Selecting Influenza Mitigation Strategies","date":"2017-11-16","arxiv_id":"1711.06299","repositories_listed":0,"syntology":null},{"url":null,"slug":"bbq-networks-efficient-exploration-in-deep","title":"BBQ-Networks: Efficient Exploration in Deep Reinforcement Learning for Task-Oriented Dialogue Systems","date":"2017-11-15","arxiv_id":"1711.05715","repositories_listed":0,"syntology":null},{"url":null,"slug":"estimating-prediction-error-for-complex","title":"Estimating prediction error for complex samples","date":"2017-11-13","arxiv_id":"1711.04877","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-ucbv-an-almost-optimal-algorithm","title":"Efficient-UCBV: An Almost Optimal Algorithm using Variance Estimates","date":"2017-11-09","arxiv_id":"1711.03591","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-directed-sampling-for-stochastic","title":"Information Directed Sampling for Stochastic Bandits with Graph Feedback","date":"2017-11-08","arxiv_id":"1711.03198","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-effect-of-communication-on-noncooperative","title":"The Effect of Communication on Noncooperative Multiplayer Multi-Armed Bandit Problems","date":"2017-11-05","arxiv_id":"1711.01628","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-probabilistic-bisection-for","title":"Generalized Probabilistic Bisection for Stochastic Root-Finding","date":"2017-11-02","arxiv_id":"1711.00843","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimal-exploration-in-structured-stochastic","title":"Minimal Exploration in Structured Stochastic Bandits","date":"2017-11-01","arxiv_id":"1711.00400","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-matrix-completion","title":"Sequential Matrix Completion","date":"2017-10-23","arxiv_id":"1710.08045","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-of-thompson-sampling-with-parameter-h","title":"A study of Thompson Sampling with Parameter h","date":"2017-10-05","arxiv_id":"1710.02174","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-unknown-markov-decision-processes-a","title":"Learning Unknown Markov Decision Processes: A Thompson Sampling Approach","date":"2017-09-14","arxiv_id":"1709.04570","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-exploration-exploitation-tradeoff","title":"Adaptive Exploration-Exploitation Tradeoff for Opportunistic Bandits","date":"2017-09-12","arxiv_id":"1709.04004","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-price-with-reference-effects","title":"Learning to Price with Reference Effects","date":"2017-08-29","arxiv_id":"1708.09020","repositories_listed":0,"syntology":null},{"url":null,"slug":"racing-thompson-an-efficient-algorithm-for","title":"Racing Thompson: an Efficient Algorithm for Thompson Sampling with Non-conjugate Priors","date":"2017-08-16","arxiv_id":"1708.04781","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-guided-stochastic-searching","title":"Thompson Sampling Guided Stochastic Searching on the Line for Deceptive Environments with Applications to Root-Finding Problems","date":"2017-08-05","arxiv_id":"1708.01791","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-techniques-for-outer","title":"Reinforcement learning techniques for Outer Loop Link Adaptation in 4G/5G systems","date":"2017-08-03","arxiv_id":"1708.00994","repositories_listed":0,"syntology":null},{"url":null,"slug":"streaming-kernel-regression-with-provably","title":"Streaming kernel regression with provably adaptive mean, variance, and regularization","date":"2017-08-02","arxiv_id":"1708.00768","repositories_listed":0,"syntology":null},{"url":null,"slug":"counterfactual-data-fusion-for-online","title":"Counterfactual Data-Fusion for Online Reinforcement Learners","date":"2017-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"taming-non-stationary-bandits-a-bayesian","title":"Taming Non-stationary Bandits: A Bayesian Approach","date":"2017-07-31","arxiv_id":"1707.09727","repositories_listed":0,"syntology":null},{"url":null,"slug":"combinatorial-multi-armed-bandit-with","title":"Combinatorial Multi-armed Bandit with Probabilistically Triggered Arms: A Case with Bounded Regret","date":"2017-07-24","arxiv_id":"1707.07443","repositories_listed":0,"syntology":null},{"url":null,"slug":"calibrated-fairness-in-bandits","title":"Calibrated Fairness in Bandits","date":"2017-07-06","arxiv_id":"1707.01875","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-practical-method-for-solving-contextual","title":"A Practical Method for Solving Contextual Bandit Problems Using Decision Trees","date":"2017-06-14","arxiv_id":"1706.04687","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandit-models-of-human-behavior-reward","title":"Bandit Models of Human Behavior: Reward Processing in Mental Disorders","date":"2017-06-07","arxiv_id":"1706.02897","repositories_listed":0,"syntology":null},{"url":null,"slug":"parallel-and-distributed-thompson-sampling","title":"Parallel and Distributed Thompson Sampling for Large-scale Accelerated Exploration of Chemical Space","date":"2017-06-06","arxiv_id":"1706.01825","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-the-mnl-bandit","title":"Thompson Sampling for the MNL-Bandit","date":"2017-06-03","arxiv_id":"1706.00977","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-generalized-linear-bandits-online","title":"Scalable Generalized Linear Bandits: Online Computation and Hashing","date":"2017-06-01","arxiv_id":"1706.00136","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multi-armed-bandit-to-smartly-select-a","title":"A Multi-Armed Bandit to Smartly Select a Training Set from Big Medical Data","date":"2017-05-23","arxiv_id":"1705.08111","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensemble-sampling","title":"Ensemble Sampling","date":"2017-05-20","arxiv_id":"1705.07347","repositories_listed":0,"syntology":null},{"url":null,"slug":"posterior-sampling-for-reinforcement-learning","title":"Posterior sampling for reinforcement learning: worst-case regret bounds","date":"2017-05-19","arxiv_id":"1705.07041","repositories_listed":0,"syntology":null}],"record_sha256":"ebb605aab322718925bf9ede1d4c9d63be0047177472ed682abe15242724a69d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}