{"url":"/method/alphazero","slug":"alphazero","name":"AlphaZero","full_name":"AlphaZero","full_name_withheld":false,"description_markdown":"**AlphaZero** is a reinforcement learning agent for playing board games such as Go, chess, and shogi. ","description_state":"present","introduced_year":null,"introduced_by":{"title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","paper":"/paper/mastering-chess-and-shogi-by-self-play-with-a","first_author":"David Silver","n_authors":13,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/mastering-chess-and-shogi-by-self-play-with-a"},"source":{"url":"http://arxiv.org/abs/1712.01815v1","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Reinforcement Learning","area_id":"reinforcement-learning","collection":"Board Game Models","url":"/methods/category/board-game-models","pwc_aliases":[]}],"n_papers_tagged":114,"archive_num_papers":114,"papers_newest_first":[{"paper":"/paper/alphazero-edu-making-alphazero-accessible-to","title":"AlphaZero-Edu: Making AlphaZero Accessible to Everyone","date":"2025-04-20","arxiv_id":"2504.14636","n_code_links":1,"syntology":null},{"paper":"/paper/assistancezero-scalably-solving-assistance","title":"AssistanceZero: Scalably Solving Assistance Games","date":"2025-04-09","arxiv_id":"2504.07091","n_code_links":1,"syntology":null},{"paper":null,"title":"Reinforcement Learning and Life Cycle Assessment for a Circular Economy -- Towards Progressive Computer Science","date":"2025-03-13","arxiv_id":"2503.10822","n_code_links":0,"syntology":null},{"paper":null,"title":"Alignment, Agency and Autonomy in Frontier AI: A Systems Engineering Perspective","date":"2025-02-20","arxiv_id":"2503.05748","n_code_links":0,"syntology":null},{"paper":"/paper/playing-hex-and-counter-wargames-using","title":"Playing Hex and Counter Wargames using Reinforcement Learning and Recurrent Neural Networks","date":"2025-02-19","arxiv_id":"2502.13918","n_code_links":1,"syntology":null},{"paper":"/paper/on-the-emergence-of-thinking-in-llms-i","title":"On the Emergence of Thinking in LLMs I: Searching for the Right Intuition","date":"2025-02-10","arxiv_id":"2502.06773","n_code_links":4,"syntology":{"ran":0,"of":13,"unverified":13,"pointer_only":0}},{"paper":null,"title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","date":"2024-12-23","arxiv_id":"2412.17397","n_code_links":0,"syntology":null},{"paper":"/paper/alphazero-neural-scaling-and-zipf-s-law-a","title":"AlphaZero Neural Scaling and Zipf's Law: a Tale of Board Games and Power Laws","date":"2024-12-16","arxiv_id":"2412.11979","n_code_links":1,"syntology":{"ran":0,"of":8,"unverified":8,"pointer_only":0}},{"paper":null,"title":"Mastering NIM and Impartial Games with Weak Neural Networks: An AlphaZero-inspired Multi-Frame Approach","date":"2024-11-10","arxiv_id":"2411.06403","n_code_links":0,"syntology":null},{"paper":"/paper/enhancing-chess-reinforcement-learning-with","title":"Enhancing Chess Reinforcement Learning with Graph Representation","date":"2024-10-31","arxiv_id":"2410.23753","n_code_links":1,"syntology":null},{"paper":"/paper/bayes-adaptive-monte-carlo-tree-search-for","title":"Bayes Adaptive Monte Carlo Tree Search for Offline Model-based Reinforcement Learning","date":"2024-10-15","arxiv_id":"2410.11234","n_code_links":1,"syntology":{"ran":2,"of":2,"unverified":0,"pointer_only":0}},{"paper":null,"title":"ResTNet: Defense against Adversarial Policies via Transformer in Computer Go","date":"2024-10-07","arxiv_id":"2410.05347","n_code_links":0,"syntology":null},{"paper":"/paper/maia-2-a-unified-model-for-human-ai-alignment","title":"Maia-2: A Unified Model for Human-AI Alignment in Chess","date":"2024-09-30","arxiv_id":"2409.20553","n_code_links":2,"syntology":{"ran":8,"of":18,"unverified":10,"pointer_only":11}},{"paper":"/paper/mastering-chess-with-a-transformer-model","title":"Mastering Chess with a Transformer Model","date":"2024-09-18","arxiv_id":"2409.12272","n_code_links":1,"syntology":null},{"paper":"/paper/flexible-game-playing-ai-with-alphavit","title":"AlphaViT: A Flexible Game-Playing AI for Multiple Games and Variable Board Sizes","date":"2024-08-25","arxiv_id":"2408.13871","n_code_links":1,"syntology":null},{"paper":null,"title":"ShortCircuit: AlphaZero-Driven Circuit Design","date":"2024-08-19","arxiv_id":"2408.09858","n_code_links":0,"syntology":null},{"paper":null,"title":"Structure and Reduction of MCTS for Explainable-AI","date":"2024-08-10","arxiv_id":"2408.05488","n_code_links":0,"syntology":null},{"paper":null,"title":"Provably Efficient Long-Horizon Exploration in Monte Carlo Tree Search through State Occupancy Regularization","date":"2024-07-07","arxiv_id":"2407.05511","n_code_links":0,"syntology":null},{"paper":null,"title":"AlphaZeroES: Direct score maximization outperforms planning loss minimization","date":"2024-06-12","arxiv_id":"2406.08687","n_code_links":0,"syntology":null},{"paper":null,"title":"Learning to Play 7 Wonders Duel Without Human Supervision","date":"2024-06-02","arxiv_id":"2406.00741","n_code_links":0,"syntology":null},{"paper":null,"title":"Model Predictive Control and Reinforcement Learning: A Unified Framework Based on Dynamic Programming","date":"2024-06-02","arxiv_id":"2406.00592","n_code_links":0,"syntology":null},{"paper":null,"title":"Super-Exponential Regret for UCT, AlphaGo and Variants","date":"2024-05-07","arxiv_id":"2405.04407","n_code_links":0,"syntology":null},{"paper":null,"title":"Model-based reinforcement learning for protein backbone design","date":"2024-05-03","arxiv_id":"2405.01983","n_code_links":0,"syntology":null},{"paper":"/paper/monte-carlo-tree-search-boosts-reasoning-via","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","date":"2024-05-01","arxiv_id":"2405.00451","n_code_links":2,"syntology":{"ran":1,"of":2,"unverified":1,"pointer_only":0}},{"paper":"/paper/policy-mirror-descent-with-lookahead","title":"Policy Mirror Descent with Lookahead","date":"2024-03-21","arxiv_id":"2403.14156","n_code_links":1,"syntology":null},{"paper":"/paper/smx-sequential-monte-carlo-planning-for","title":"SPO: Sequential Monte Carlo Policy Optimisation","date":"2024-02-12","arxiv_id":"2402.07963","n_code_links":1,"syntology":{"ran":0,"of":5,"unverified":5,"pointer_only":0}},{"paper":"/paper/grandmaster-level-chess-without-search","title":"Amortized Planning with Large-Scale Transformers: A Case Study on Chess","date":"2024-02-07","arxiv_id":"2402.04494","n_code_links":1,"syntology":{"ran":5,"of":7,"unverified":2,"pointer_only":0}},{"paper":null,"title":"Mastering Zero-Shot Interactions in Cooperative and Competitive Simultaneous Games","date":"2024-02-05","arxiv_id":"2402.03136","n_code_links":0,"syntology":null},{"paper":null,"title":"Discovering Mathematical Formulas from Data via GPT-guided Monte Carlo Tree Search","date":"2024-01-24","arxiv_id":"2401.14424","n_code_links":0,"syntology":null},{"paper":"/paper/decision-making-in-non-stationary-1","title":"Decision Making in Non-Stationary Environments with Policy-Augmented Search","date":"2024-01-06","arxiv_id":"2401.03197","n_code_links":1,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/board-games","name":"Board Games","papers":26},{"task":"/task/reinforcement-learning-1","name":"Reinforcement Learning (RL)","papers":26},{"task":"/task/reinforcement-learning-2","name":"reinforcement-learning","papers":22},{"task":"/task/reinforcement-learning","name":"Reinforcement Learning","papers":20},{"task":"/task/decision-making","name":"Decision Making","papers":15},{"task":"/task/atari-games","name":"Atari Games","papers":8},{"task":"/task/deep-reinforcement-learning","name":"Deep Reinforcement Learning","papers":8},{"task":"/task/game-of-go","name":"Game of Go","papers":8},{"task":"/task/game-of-chess","name":"Game of Chess","papers":6},{"task":"/task/sequential-decision-making","name":"Sequential Decision Making","papers":5},{"task":null,"name":"GPU","papers":4},{"task":"/task/model-based-reinforcement-learning","name":"Model-based Reinforcement Learning","papers":4},{"task":"/task/math","name":"Math","papers":3},{"task":"/task/q-learning","name":"Q-Learning","papers":3},{"task":null,"name":"CPU","papers":2},{"task":"/task/combinatorial-optimization","name":"Combinatorial Optimization","papers":2},{"task":"/task/gsm8k","name":"GSM8K","papers":2},{"task":"/task/game-of-shogi","name":"Game of Shogi","papers":2},{"task":"/task/graph-neural-network","name":"Graph Neural Network","papers":2},{"task":"/task/model-predictive-control","name":"Model Predictive Control","papers":2}],"tasks_shown":20,"n_tasks":65,"usage_by_year":[{"year":"2017","papers":1},{"year":"2018","papers":4},{"year":"2019","papers":13},{"year":"2020","papers":16},{"year":"2021","papers":16},{"year":"2022","papers":12},{"year":"2023","papers":22},{"year":"2024","papers":24},{"year":"2025","papers":6}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/alphazero"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}