{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/thompson-sampling/papers/5","list_of":"/task/thompson-sampling","task":"Thompson Sampling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":5,"pages_in_order":7,"rows_per_page":100,"rows":[401,500],"of":655,"counts":{"archive_papers_tagged":655,"with_a_code_link":135,"where_syntology_ran_a_sample":30,"not_listed_spam_title":0,"listed":655,"listed_where_code_ran":30,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":23,"every_run_a_failure_of_syntologys_instrument":7,"listed_with_a_run_with_no_instrument_failure":23,"listed_every_run_a_failure_of_syntologys_instrument":7,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/thompson-sampling","prev":"/task/thompson-sampling/papers/4","next":"/task/thompson-sampling/papers/6","papers":[{"url":null,"slug":"asymptotically-optimal-bandits-under-weighted","title":"Asymptotically Optimal Bandits under Weighted Information","date":"2021-05-28","arxiv_id":"2105.14114","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-approximations-for-thompson","title":"Diffusion Approximations for Thompson Sampling","date":"2021-05-19","arxiv_id":"2105.09232","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-gaussian-entropic-risk","title":"Thompson Sampling for Gaussian Entropic Risk Bandits","date":"2021-05-14","arxiv_id":"2105.06960","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-dimensional-near-optimal-experiment","title":"High-dimensional near-optimal experiment design for drug discovery via Bayesian sparse sampling","date":"2021-04-23","arxiv_id":"2104.11834","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-and-whom-to-collaborate-with-in-a","title":"When and Whom to Collaborate with in a Changing Environment: A Collaborative Dynamic Bandit Solution","date":"2021-04-14","arxiv_id":"2104.07150","repositories_listed":0,"syntology":null},{"url":null,"slug":"blind-exploration-and-exploitation-of","title":"Blind Exploration and Exploitation of Stochastic Experts","date":"2021-04-02","arxiv_id":"2104.01078","repositories_listed":0,"syntology":null},{"url":null,"slug":"challenges-in-statistical-analysis-of-data","title":"Challenges in Statistical Analysis of Data Collected by a Bandit Algorithm: An Empirical Exploration in Applications to Adaptively Randomized Experiments","date":"2021-03-22","arxiv_id":"2103.12198","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-contextual-bandit-learning-for","title":"Constrained Contextual Bandit Learning for Adaptive Radar Waveform Selection","date":"2021-03-09","arxiv_id":"2103.05541","repositories_listed":0,"syntology":null},{"url":null,"slug":"doubly-adaptive-thompson-sampling-for-multi","title":"Online Multi-Armed Bandits with Adaptive Inference","date":"2021-02-25","arxiv_id":"2102.13202","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-meta-reinforcement-learning-using","title":"Model-based Meta Reinforcement Learning using Graph Structured Surrogate Models","date":"2021-02-16","arxiv_id":"2102.08291","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-algorithms-for-private-online","title":"Near-Optimal Algorithms for Differentially Private Online Learning in a Stochastic Environment","date":"2021-02-16","arxiv_id":"2102.07929","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-randomized-elliptical-potential-lemma","title":"The Elliptical Potential Lemma for General Distributions with an Application to Linear Thompson Sampling","date":"2021-02-16","arxiv_id":"2102.07987","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-thompson-sampling","title":"Meta-Thompson Sampling","date":"2021-02-11","arxiv_id":"2102.06129","repositories_listed":0,"syntology":null},{"url":null,"slug":"doubly-robust-thompson-sampling-for-linear","title":"Doubly robust Thompson sampling for linear payoffs","date":"2021-02-01","arxiv_id":"2102.01229","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-asymptotics-for-sequential","title":"Weak Signal Asymptotics for Sequentially Randomized Experiments","date":"2021-01-25","arxiv_id":"2101.09855","repositories_listed":0,"syntology":null},{"url":null,"slug":"tsec-a-framework-for-online-experimentation","title":"TSEC: a framework for online experimentation under experimental constraints","date":"2021-01-17","arxiv_id":"2101.06592","repositories_listed":0,"syntology":null},{"url":null,"slug":"deciding-what-to-learn-a-rate-distortion","title":"Deciding What to Learn: A Rate-Distortion Approach","date":"2021-01-15","arxiv_id":"2101.06197","repositories_listed":0,"syntology":null},{"url":null,"slug":"etat-de-l-art-sur-l-application-des-bandits","title":"Etat de l'art sur l'application des bandits multi-bras","date":"2021-01-04","arxiv_id":"2101.00001","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-with-informed","title":"Meta-Reinforcement Learning With Informed Policy Regularization","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"aging-bandits-regret-analysis-and-order","title":"Aging Bandits: Regret Analysis and Order-Optimal Learning Algorithm for Wireless Networks with Stochastic Arrivals","date":"2020-12-16","arxiv_id":"2012.08682","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-subspaces-using","title":"Reinforcement Learning with Subspaces using Free Energy Paradigm","date":"2020-12-13","arxiv_id":"2012.07091","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-thompson-sampling","title":"Distributed Thompson Sampling","date":"2020-12-03","arxiv_id":"2012.01789","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-stationary-latent-bandits","title":"Non-Stationary Latent Bandits","date":"2020-12-01","arxiv_id":"2012.00386","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-efficiency-in-hierarchical-reinforcement","title":"On Efficiency in Hierarchical Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"distilled-thompson-sampling-practical-and","title":"Distilled Thompson Sampling: Practical and Efficient Thompson Sampling via Imitation Learning","date":"2020-11-29","arxiv_id":"2011.14266","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-biased-maximum-likelihood-estimation-1","title":"Reward Biased Maximum Likelihood Estimation for Reinforcement Learning","date":"2020-11-16","arxiv_id":"2011.07738","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-constrained-thompson-sampling-for-cvar","title":"Risk-Constrained Thompson Sampling for CVaR Bandits","date":"2020-11-16","arxiv_id":"2011.08046","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-grasp-exploration-by-leveraging","title":"Accelerating Grasp Exploration by Leveraging Learned Priors","date":"2020-11-11","arxiv_id":"2011.05661","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-linear-quadratic-mean","title":"Thompson sampling for linear quadratic mean-field teams","date":"2020-11-09","arxiv_id":"2011.04686","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotic-convergence-of-thompson-sampling","title":"Asymptotic Convergence of Thompson Sampling","date":"2020-11-08","arxiv_id":"2011.03917","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-combinatorial-allocation","title":"Adaptive Combinatorial Allocation","date":"2020-11-04","arxiv_id":"2011.02330","repositories_listed":0,"syntology":null},{"url":null,"slug":"greedy-k-center-from-noisy-distance-samples","title":"Greedy k-Center from Noisy Distance Samples","date":"2020-11-03","arxiv_id":"2011.01973","repositories_listed":0,"syntology":null},{"url":null,"slug":"screening-for-an-infectious-disease-as-a","title":"Screening for an Infectious Disease as a Problem in Stochastic Control","date":"2020-11-01","arxiv_id":"2011.00635","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandit-policies-for-reliable-cellular-network","title":"Bandit Policies for Reliable Cellular Network Handovers in Extreme Mobility","date":"2020-10-28","arxiv_id":"2010.15237","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-worst-case-regret-bounds-for","title":"Improved Worst-Case Regret Bounds for Randomized Least-Squares Value Iteration","date":"2020-10-23","arxiv_id":"2010.12163","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-efficient-and","title":"Reinforcement Learning for Efficient and Tuning-Free Link Adaptation","date":"2020-10-16","arxiv_id":"2010.08651","repositories_listed":0,"syntology":null},{"url":null,"slug":"double-linear-thompson-sampling-for-context","title":"Double-Linear Thompson Sampling for Context-Attentive Bandits","date":"2020-10-15","arxiv_id":"2010.09473","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-learning-and-distributed-control-for","title":"Online Learning and Distributed Control for Residential Demand Response","date":"2020-10-11","arxiv_id":"2010.05153","repositories_listed":0,"syntology":null},{"url":null,"slug":"effects-of-model-misspecification-on-bayesian","title":"Effects of Model Misspecification on Bayesian Bandits: Case Studies in UX Optimization","date":"2020-10-07","arxiv_id":"2010.04010","repositories_listed":0,"syntology":null},{"url":null,"slug":"stage-wise-conservative-linear-bandits","title":"Stage-wise Conservative Linear Bandits","date":"2020-09-30","arxiv_id":"2010.00081","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-model-based-optimization-with-right","title":"Neural Model-based Optimization with Right-Censored Observations","date":"2020-09-29","arxiv_id":"2009.13828","repositories_listed":0,"syntology":null},{"url":null,"slug":"position-based-multiple-play-bandits-with","title":"Position-Based Multiple-Play Bandits with Thompson Sampling","date":"2020-09-28","arxiv_id":"2009.13181","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandit-change-point-detection-for-real-time","title":"Bandit Change-Point Detection for Real-Time Monitoring High-Dimensional Data Under Sampling Control","date":"2020-09-24","arxiv_id":"2009.11891","repositories_listed":0,"syntology":null},{"url":null,"slug":"partially-observable-online-change-detection","title":"Partially Observable Online Change Detection via Smooth-Sparse Decomposition","date":"2020-09-22","arxiv_id":"2009.10645","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandits-under-the-influence-extended-version","title":"Bandits Under The Influence (Extended Version)","date":"2020-09-21","arxiv_id":"2009.10135","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-discovery-for-causal-bandits-utilizing","title":"Causal Bandits without prior knowledge using separating sets","date":"2020-09-16","arxiv_id":"2009.07916","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-unsupervised-sequential","title":"Thompson Sampling for Unsupervised Sequential Selection","date":"2020-09-16","arxiv_id":"2009.07554","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-change-detection-based-thompson-sampling","title":"A Change-Detection Based Thompson Sampling Framework for Non-Stationary Bandits","date":"2020-09-06","arxiv_id":"2009.02791","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-online-learning-for-cognitive-radar","title":"Efficient Online Learning for Cognitive Radar-Cellular Coexistence via Contextual Thompson Sampling","date":"2020-08-24","arxiv_id":"2008.10149","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-bandits-for-advertising-budget","title":"Contextual Bandits for Advertising Budget Allocation","date":"2020-08-22","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-adversarial-attack-on-ucb","title":"Near Optimal Adversarial Attacks on Stochastic Bandits and Defenses with Smoothed Responses","date":"2020-08-21","arxiv_id":"2008.09312","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-trajectory","title":"Reinforcement Learning with Trajectory Feedback","date":"2020-08-13","arxiv_id":"2008.06036","repositories_listed":0,"syntology":null},{"url":null,"slug":"lenient-regret-for-multi-armed-bandits","title":"Lenient Regret for Multi-Armed Bandits","date":"2020-08-10","arxiv_id":"2008.03959","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligentpooling-practical-thompson","title":"IntelligentPooling: Practical Thompson Sampling for mHealth","date":"2020-07-31","arxiv_id":"2008.01571","repositories_listed":0,"syntology":null},{"url":null,"slug":"greedy-bandits-with-sampled-context","title":"Greedy Bandits with Sampled Context","date":"2020-07-27","arxiv_id":"2007.16001","repositories_listed":0,"syntology":null},{"url":null,"slug":"influence-diagram-bandits-variational","title":"Influence Diagram Bandits: Variational Thompson Sampling for Structured Bandit Problems","date":"2020-07-09","arxiv_id":"2007.04915","repositories_listed":0,"syntology":null},{"url":null,"slug":"variable-selection-via-thompson-sampling","title":"Variable Selection via Thompson Sampling","date":"2020-07-01","arxiv_id":"2007.00187","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-optimization-of-thompson","title":"Policy Gradient Optimization of Thompson Sampling Policies","date":"2020-06-30","arxiv_id":"2006.16507","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-multi-agent-active-search","title":"Asynchronous Multi Agent Active Search","date":"2020-06-25","arxiv_id":"2006.14718","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-by-repetition-stochastic-multi-armed","title":"Learning by Repetition: Stochastic Multi-armed Bandits under Priming Effect","date":"2020-06-18","arxiv_id":"2006.10356","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-and-design-of-thompson-sampling-for","title":"Analysis and Design of Thompson Sampling for Stochastic Partial Monitoring","date":"2020-06-17","arxiv_id":"2006.09668","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-thompson-sampling-for-real-time","title":"Constrained Thompson Sampling for Real-Time Electricity Pricing with Grid Reliability Constraints","date":"2020-06-17","arxiv_id":"1908.07964","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-bandits-revisited","title":"Latent Bandits Revisited","date":"2020-06-15","arxiv_id":"2006.08714","repositories_listed":0,"syntology":null},{"url":null,"slug":"hypermodels-for-exploration-1","title":"Hypermodels for Exploration","date":"2020-06-12","arxiv_id":"2006.07464","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-worst-case-regret-of-linear-thompson","title":"On Frequentist Regret of Linear Thompson Sampling","date":"2020-06-11","arxiv_id":"2006.06790","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-efficiency-of-thompson-sampling","title":"Statistical Efficiency of Thompson Sampling for Combinatorial Semi-Bandits","date":"2020-06-11","arxiv_id":"2006.06613","repositories_listed":0,"syntology":null},{"url":null,"slug":"ts-ucb-improving-on-thompson-sampling-with","title":"TS-UCB: Improving on Thompson Sampling With Little to No Additional Computation","date":"2020-06-11","arxiv_id":"2006.06372","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-thompson-sampling-using-sparse","title":"Scalable Thompson Sampling using Sparse Gaussian Process Models","date":"2020-06-09","arxiv_id":"2006.05356","repositories_listed":0,"syntology":null},{"url":null,"slug":"random-hypervolume-scalarizations-for","title":"Random Hypervolume Scalarizations for Provable Multi-Objective Black Box Optimization","date":"2020-06-08","arxiv_id":"2006.04655","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-efficient-algorithm-for-generalized-linear","title":"An Efficient Algorithm For Generalized Linear Bandit: Online Stochastic Gradient Descent and Thompson Sampling","date":"2020-06-07","arxiv_id":"2006.04012","repositories_listed":0,"syntology":null},{"url":null,"slug":"concurrent-decentralized-channel-allocation","title":"Concurrent Decentralized Channel Allocation and Access Point Selection using Multi-Armed Bandits in multi BSS WLANs","date":"2020-06-05","arxiv_id":"2006.03350","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-for-combinatorial-semi-2","title":"Thompson Sampling for Combinatorial Semi-bandits with Sleeping Arms and Long-Term Fairness Constraints","date":"2020-05-14","arxiv_id":"2005.06725","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-rank-in-the-position-based-model","title":"Learning to Rank in the Position Based Model with Bandit Feedback","date":"2020-04-27","arxiv_id":"2004.13106","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-thompson-sampling-algorithm-with","title":"Online Learning with Cumulative Oversampling: Application to Budgeted Influence Maximization","date":"2020-04-24","arxiv_id":"2004.11963","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-operator-selection-based-on-dynamic","title":"Adaptive Operator Selection Based on Dynamic Thompson Sampling for MOEA/D","date":"2020-04-22","arxiv_id":"2004.10874","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-no-regret-learning-in-repeated-first","title":"Optimal No-regret Learning in Repeated First-price Auctions","date":"2020-03-22","arxiv_id":"2003.09795","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reliability-aware-multi-armed-bandit","title":"A Reliability-aware Multi-armed Bandit Approach to Learn and Select Users in Demand Response","date":"2020-03-20","arxiv_id":"2003.09505","repositories_listed":0,"syntology":null},{"url":null,"slug":"delay-adaptive-learning-in-generalized-linear","title":"Delay-Adaptive Learning in Generalized Linear Contextual Bandits","date":"2020-03-11","arxiv_id":"2003.05174","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-residential-demand-response-via","title":"Online Residential Demand Response via Contextual Multi-Armed Bandits","date":"2020-03-07","arxiv_id":"2003.03627","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-online-learning-framework-for-energy","title":"An Online Learning Framework for Energy-Efficient Navigation of Electric Vehicles","date":"2020-03-03","arxiv_id":"2003.01416","repositories_listed":0,"syntology":null},{"url":null,"slug":"mots-minimax-optimal-thompson-sampling","title":"MOTS: Minimax Optimal Thompson Sampling","date":"2020-03-03","arxiv_id":"2003.01803","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-of-zero-sum-stochastic","title":"Efficient exploration of zero-sum stochastic games","date":"2020-02-24","arxiv_id":"2002.10524","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-thompson-sampling-with-langevin-algorithms","title":"On Thompson Sampling with Langevin Algorithms","date":"2020-02-23","arxiv_id":"2002.10002","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-bootstrap-exploration-for-bandit","title":"Residual Bootstrap Exploration for Bandit Algorithms","date":"2020-02-19","arxiv_id":"2002.08436","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-general-framework-to-analyze-stochastic","title":"A General Theory of the Stochastic Linear Bandit and Its Applications","date":"2020-02-12","arxiv_id":"2002.05152","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-complexity-of-incentivized-exploration","title":"The Price of Incentivizing Exploration: A Characterization via Thompson Sampling and Sample Complexity","date":"2020-02-03","arxiv_id":"2002.00558","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-quantile-and-expectile-optimisation","title":"Bayesian Quantile and Expectile Optimisation","date":"2020-01-12","arxiv_id":"2001.04833","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-thompson-sampling-for-smoother-than","title":"On Thompson Sampling for Smoother-than-Lipschitz Bandits","date":"2020-01-08","arxiv_id":"2001.02323","repositories_listed":0,"syntology":null},{"url":"/paper/making-sense-of-reinforcement-learning-and-1","slug":"making-sense-of-reinforcement-learning-and-1","title":"Making Sense of Reinforcement Learning and Probabilistic Inference","date":"2020-01-03","arxiv_id":"2001.00805","repositories_listed":0,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/making-sense-of-reinforcement-learning-and-1#ran","syntology_url":"https://syntology.ai/paper/2001.00805","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2001.00805"}},"official":null}},{"url":null,"slug":"solving-bernoulli-rank-one-bandits-with","title":"Solving Bernoulli Rank-One Bandits with Unimodal Thompson Sampling","date":"2019-12-06","arxiv_id":"1912.03074","repositories_listed":0,"syntology":null},{"url":null,"slug":"ordinal-bayesian-optimisation","title":"Ordinal Bayesian Optimisation","date":"2019-12-05","arxiv_id":"1912.02493","repositories_listed":0,"syntology":null},{"url":null,"slug":"thompson-sampling-and-approximate-inference-1","title":"Thompson Sampling and Approximate Inference","date":"2019-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-ensemble-learning-for-online","title":"Automatic Ensemble Learning for Online Influence Maximization","date":"2019-11-25","arxiv_id":"1911.10728","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-theoretic-confidence-bounds-for-1","title":"Information-Theoretic Confidence Bounds for Reinforcement Learning","date":"2019-11-21","arxiv_id":"1911.09724","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-aware-dynamic-assets-selection-for","title":"Adaptive Portfolio by Solving Multi-armed Bandit via Thompson Sampling","date":"2019-11-13","arxiv_id":"1911.05309","repositories_listed":0,"syntology":null},{"url":null,"slug":"incentivized-exploration-for-multi-armed","title":"Incentivized Exploration for Multi-Armed Bandits under Reward Drift","date":"2019-11-12","arxiv_id":"1911.05142","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-linear-thompson-sampling","title":"Safe Linear Thompson Sampling with Side Information","date":"2019-11-06","arxiv_id":"1911.02156","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-batch-bayesian-optimization","title":"On Batch Bayesian Optimization","date":"2019-11-04","arxiv_id":"1911.01032","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-online-learning-in-kernelized-markov","title":"On Online Learning in Kernelized Markov Decision Processes","date":"2019-11-04","arxiv_id":"1911.01871","repositories_listed":0,"syntology":null},{"url":null,"slug":"fixed-confidence-guarantees-for-bayesian-best","title":"Fixed-Confidence Guarantees for Bayesian Best-Arm Identification","date":"2019-10-24","arxiv_id":"1910.10945","repositories_listed":0,"syntology":null}],"record_sha256":"013b96627df487475f6a88febf802295af30d66b5d5f4c5ab54fff9ff0304dca","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}