{"url":"/method/stochastic-weight-averaging","slug":"stochastic-weight-averaging","name":"Stochastic Weight Averaging","full_name":"Stochastic Weight Averaging","full_name_withheld":false,"description_markdown":"**Stochastic Weight Averaging** is an optimization procedure that averages multiple points along the trajectory of [SGD](https://paperswithcode.com/method/sgd), with a cyclical or constant learning rate. On the one hand it averages weights, but it also has the property that, with a cyclical or constant learning rate, SGD proposals are approximately sampling from the loss surface of the network, leading to stochastic weights and helping to discover broader optima.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Averaging Weights Leads to Wider Optima and Better Generalization","paper":"/paper/averaging-weights-leads-to-wider-optima-and","first_author":"Pavel Izmailov","n_authors":5,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/averaging-weights-leads-to-wider-optima-and"},"source":{"url":"http://arxiv.org/abs/1803.05407v3","title":"Averaging Weights Leads to Wider Optima and Better Generalization","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/timgaripov/swa/blob/f54af44f7af3cadd628412bbc34383e94e56ae53/train.py#L154","code_snippet_url_on_a_code_host":true,"categories":[{"area":"General","area_id":"general","collection":"Stochastic Optimization","url":"/methods/category/stochastic-optimization","pwc_aliases":[]}],"n_papers_tagged":45,"archive_num_papers":45,"papers_newest_first":[{"paper":null,"title":"An Effective End-to-End Solution for Multimodal Action Recognition","date":"2025-06-11","arxiv_id":"2506.09345","n_code_links":0,"syntology":null},{"paper":null,"title":"Federated EndoViT: Pretraining Vision Transformers via Federated Learning on Endoscopic Image Collections","date":"2025-04-23","arxiv_id":"2504.16612","n_code_links":0,"syntology":null},{"paper":null,"title":"Understanding Flatness in Generative Models: Its Role and Benefits","date":"2025-03-14","arxiv_id":"2503.11078","n_code_links":0,"syntology":null},{"paper":null,"title":"SeWA: Selective Weight Average via Probabilistic Masking","date":"2025-02-14","arxiv_id":"2502.10119","n_code_links":0,"syntology":null},{"paper":"/paper/divide-and-conquer-grounding-a-bleeding-areas","title":"Divide and Conquer: Grounding a Bleeding Areas in Gastrointestinal Image with Two-Stage Model","date":"2024-12-21","arxiv_id":"2412.16723","n_code_links":1,"syntology":null},{"paper":null,"title":"A Unified Analysis for Finite Weight Averaging","date":"2024-11-20","arxiv_id":"2411.13169","n_code_links":0,"syntology":null},{"paper":"/paper/adaptive-stochastic-weight-averaging","title":"Adaptive Stochastic Weight Averaging","date":"2024-06-27","arxiv_id":"2406.19092","n_code_links":1,"syntology":null},{"paper":"/paper/scaling-laws-and-compute-optimal-training","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","date":"2024-05-28","arxiv_id":"2405.18392","n_code_links":4,"syntology":{"ran":7,"of":13,"unverified":6,"pointer_only":4}},{"paper":"/paper/gaussian-stochastic-weight-averaging-for","title":"Gaussian Stochastic Weight Averaging for Bayesian Low-Rank Adaptation of Large Language Models","date":"2024-05-06","arxiv_id":"2405.03425","n_code_links":1,"syntology":{"ran":4,"of":7,"unverified":3,"pointer_only":0}},{"paper":"/paper/post-hoc-reversal-are-we-selecting-models","title":"Post-Hoc Reversal: Are We Selecting Models Prematurely?","date":"2024-04-11","arxiv_id":"2404.07815","n_code_links":1,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":1}},{"paper":"/paper/instance-segmentation-under-occlusions-via","title":"Instance Segmentation under Occlusions via Location-aware Copy-Paste Data Augmentation","date":"2023-10-27","arxiv_id":"2310.17949","n_code_links":1,"syntology":null},{"paper":null,"title":"SimBIG: Field-level Simulation-Based Inference of Galaxy Clustering","date":"2023-10-23","arxiv_id":"2310.15256","n_code_links":0,"syntology":null},{"paper":"/paper/weight-averaging-improves-knowledge","title":"Weight Averaging Improves Knowledge Distillation under Domain Shift","date":"2023-09-20","arxiv_id":"2309.11446","n_code_links":1,"syntology":null},{"paper":null,"title":"A Novel Training Framework for Physics-informed Neural Networks: Towards Real-time Applications in Ultrafast Ultrasound Blood Flow Imaging","date":"2023-09-09","arxiv_id":"2309.04755","n_code_links":0,"syntology":null},{"paper":null,"title":"Fine-grained building roof instance segmentation based on domain adapted pretraining and composite dual-backbone","date":"2023-08-10","arxiv_id":"2308.05358","n_code_links":0,"syntology":null},{"paper":"/paper/the-split-matters-flat-minima-methods-for","title":"The Split Matters: Flat Minima Methods for Improving the Performance of GNNs","date":"2023-06-15","arxiv_id":"2306.09121","n_code_links":1,"syntology":null},{"paper":"/paper/decoupled-training-for-long-tailed","title":"Decoupled Training for Long-Tailed Classification With Stochastic Representations","date":"2023-04-19","arxiv_id":"2304.09426","n_code_links":0,"syntology":{"ran":3,"of":14,"unverified":11,"pointer_only":0}},{"paper":null,"title":"Training trajectories, mini-batch losses and the curious role of the learning rate","date":"2023-01-05","arxiv_id":"2301.02312","n_code_links":0,"syntology":null},{"paper":null,"title":"Frequency Regularization for Improving Adversarial Robustness","date":"2022-12-24","arxiv_id":"2212.12732","n_code_links":0,"syntology":null},{"paper":null,"title":"Improving Generalization of Pre-trained Language Models via Stochastic Weight Averaging","date":"2022-12-12","arxiv_id":"2212.05956","n_code_links":0,"syntology":null},{"paper":"/paper/deep-combinatorial-aggregation","title":"Deep Combinatorial Aggregation","date":"2022-10-12","arxiv_id":"2210.06436","n_code_links":1,"syntology":{"ran":0,"of":2,"unverified":2,"pointer_only":2}},{"paper":null,"title":"ARQ-based Average Consensus over Directed Network Topologies with Unreliable Communication Links","date":"2022-09-29","arxiv_id":"2209.14699","n_code_links":0,"syntology":null},{"paper":"/paper/robust-simulation-based-inference-in","title":"Robust Simulation-Based Inference in Cosmology with Bayesian Neural Networks","date":"2022-07-18","arxiv_id":"2207.08435","n_code_links":1,"syntology":{"ran":2,"of":5,"unverified":3,"pointer_only":5}},{"paper":"/paper/trainable-weight-averaging-for-fast","title":"Trainable Weight Averaging: A General Approach for Subspace Training","date":"2022-05-26","arxiv_id":"2205.13104","n_code_links":1,"syntology":{"ran":5,"of":8,"unverified":3,"pointer_only":0}},{"paper":null,"title":"UNBUS: Uncertainty-aware Deep Botnet Detection System in Presence of Perturbed Samples","date":"2022-04-18","arxiv_id":"2204.09502","n_code_links":0,"syntology":null},{"paper":"/paper/improving-generalization-in-federated","title":"Improving Generalization in Federated Learning by Seeking Flat Minima","date":"2022-03-22","arxiv_id":"2203.11834","n_code_links":1,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":0}},{"paper":"/paper/pfge-parsimonious-fast-geometric-ensembling","title":"PFGE: Parsimonious Fast Geometric Ensembling of DNNs","date":"2022-02-14","arxiv_id":"2202.06658","n_code_links":1,"syntology":null},{"paper":"/paper/questions-for-flat-minima-optimization-of","title":"When Do Flat Minima Optimizers Work?","date":"2022-02-01","arxiv_id":"2202.00661","n_code_links":1,"syntology":null},{"paper":null,"title":"SpectraNet: Learned Recognition of Artificial Satellites From High Contrast Spectroscopic Imagery","date":"2022-01-10","arxiv_id":"2201.03614","n_code_links":0,"syntology":null},{"paper":"/paper/stochastic-weight-averaging-revisited","title":"Stochastic Weight Averaging Revisited","date":"2022-01-03","arxiv_id":"2201.00519","n_code_links":1,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/image-classification","name":"Image Classification","papers":7},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":6},{"task":"/task/image-classification","name":"image-classification","papers":4},{"task":"/task/bayesian-inference","name":"Bayesian Inference","papers":3},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":3},{"task":"/task/domain-generalization","name":"Domain Generalization","papers":3},{"task":"/task/knowledge-distillation","name":"Knowledge Distillation","papers":3},{"task":"/task/object","name":"Object","papers":3},{"task":"/task/segmentation","name":"Segmentation","papers":3},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":3},{"task":"/task/federated-learning","name":"Federated Learning","papers":2},{"task":"/task/generalization-bounds","name":"Generalization Bounds","papers":2},{"task":"/task/instance-segmentation","name":"Instance Segmentation","papers":2},{"task":"/task/knowledge-graphs","name":"Knowledge Graphs","papers":2},{"task":"/task/node-classification","name":"Node Classification","papers":2},{"task":"/task/object-detection","name":"Object Detection","papers":2},{"task":"/task/question-answering","name":"Question Answering","papers":2},{"task":"/task/representation-learning","name":"Representation Learning","papers":2},{"task":"/task/text-classification","name":"Text Classification","papers":2},{"task":"/task/uncertainty-quantification","name":"Uncertainty Quantification","papers":2}],"tasks_shown":20,"n_tasks":69,"usage_by_year":[{"year":"2018","papers":1},{"year":"2019","papers":3},{"year":"2020","papers":3},{"year":"2021","papers":8},{"year":"2022","papers":12},{"year":"2023","papers":8},{"year":"2024","papers":6},{"year":"2025","papers":4}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/stochastic-weight-averaging"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}