{"url":"/method/sharpness-aware-minimization","slug":"sharpness-aware-minimization","name":"Sharpness-Aware Minimization","full_name":"Sharpness-Aware Minimization","full_name_withheld":false,"description_markdown":"**Sharpness-Aware Minimization**, or **SAM**, is a procedure that improves model generalization by simultaneously minimizing loss value and loss sharpness. SAM functions by seeking parameters that lie in neighborhoods having uniformly low loss value (rather than parameters that only themselves have low loss value).","description_state":"present","introduced_year":null,"introduced_by":{"title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","paper":"/paper/sharpness-aware-minimization-for-efficiently-1","first_author":"Pierre Foret","n_authors":4,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/sharpness-aware-minimization-for-efficiently-1"},"source":{"url":"https://arxiv.org/abs/2010.01412v3","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Optimization","url":"/methods/category/optimization","pwc_aliases":[]}],"n_papers_tagged":142,"archive_num_papers":142,"papers_newest_first":[{"paper":"/paper/samo-a-lightweight-sharpness-aware-approach","title":"SAMO: A Lightweight Sharpness-Aware Approach for Multi-Task Optimization with Joint Global-Local Perturbation","date":"2025-07-10","arxiv_id":"2507.07883","n_code_links":1,"syntology":{"ran":0,"of":1,"unverified":1,"pointer_only":0}},{"paper":"/paper/sharpness-aware-machine-unlearning","title":"Sharpness-Aware Machine Unlearning","date":"2025-06-16","arxiv_id":"2506.13715","n_code_links":0,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":0}},{"paper":null,"title":"From Sharpness to Better Generalization for Speech Deepfake Detection","date":"2025-06-13","arxiv_id":"2506.11532","n_code_links":0,"syntology":null},{"paper":null,"title":"Towards Understanding The Calibration Benefits of Sharpness-Aware Minimization","date":"2025-05-29","arxiv_id":"2505.23866","n_code_links":0,"syntology":null},{"paper":null,"title":"An Analysis of Concept Bottleneck Models: Measuring, Understanding, and Mitigating the Impact of Noisy Annotations","date":"2025-05-22","arxiv_id":"2505.16705","n_code_links":0,"syntology":null},{"paper":"/paper/improving-generalization-of-medical-image","title":"Improving Generalization of Medical Image Registration Foundation Model","date":"2025-05-10","arxiv_id":"2505.06527","n_code_links":1,"syntology":null},{"paper":null,"title":"Learning from Loss Landscape: Generalizable Mixed-Precision Quantization via Adaptive Sharpness-Aware Gradient Aligning","date":"2025-05-08","arxiv_id":"2505.04877","n_code_links":0,"syntology":null},{"paper":null,"title":"Focal-SAM: Focal Sharpness-Aware Minimization for Long-Tailed Classification","date":"2025-05-03","arxiv_id":"2505.01660","n_code_links":0,"syntology":null},{"paper":null,"title":"Federated EndoViT: Pretraining Vision Transformers via Federated Learning on Endoscopic Image Collections","date":"2025-04-23","arxiv_id":"2504.16612","n_code_links":0,"syntology":null},{"paper":"/paper/mitigating-parameter-interference-in-model","title":"Mitigating Parameter Interference in Model Merging via Sharpness-Aware Fine-Tuning","date":"2025-04-20","arxiv_id":"2504.14662","n_code_links":1,"syntology":{"ran":0,"of":2,"unverified":2,"pointer_only":2}},{"paper":null,"title":"DGSAM: Domain Generalization via Individual Sharpness-Aware Minimization","date":"2025-03-30","arxiv_id":"2503.23430","n_code_links":0,"syntology":null},{"paper":null,"title":"FairSAM: Fair Classification on Corrupted Data Through Sharpness-Aware Minimization","date":"2025-03-29","arxiv_id":"2503.22934","n_code_links":0,"syntology":null},{"paper":null,"title":"The Devil is in Low-Level Features for Cross-Domain Few-Shot Segmentation","date":"2025-03-27","arxiv_id":"2503.21150","n_code_links":0,"syntology":null},{"paper":null,"title":"Training Diagonal Linear Networks with Stochastic Sharpness-Aware Minimization","date":"2025-03-14","arxiv_id":"2503.11891","n_code_links":0,"syntology":null},{"paper":null,"title":"Understanding Flatness in Generative Models: Its Role and Benefits","date":"2025-03-14","arxiv_id":"2503.11078","n_code_links":0,"syntology":null},{"paper":null,"title":"Effective LLM Knowledge Learning via Model Generalization","date":"2025-03-05","arxiv_id":"2503.03705","n_code_links":0,"syntology":null},{"paper":null,"title":"LORENZA: Enhancing Generalization in Low-Rank Gradient LLM Training via Efficient Zeroth-Order Adaptive SAM","date":"2025-02-26","arxiv_id":"2502.19571","n_code_links":0,"syntology":null},{"paper":null,"title":"Monge SAM: Robust Reparameterization-Invariant Sharpness-Aware Minimization Based on Loss Geometry","date":"2025-02-12","arxiv_id":"2502.08448","n_code_links":0,"syntology":null},{"paper":"/paper/towards-llm-unlearning-resilient-to","title":"Towards LLM Unlearning Resilient to Relearning Attacks: A Sharpness-Aware Minimization Perspective and Beyond","date":"2025-02-07","arxiv_id":"2502.05374","n_code_links":1,"syntology":{"ran":2,"of":7,"unverified":5,"pointer_only":0}},{"paper":"/paper/gcsam-gradient-centralized-sharpness-aware","title":"GCSAM: Gradient Centralized Sharpness Aware Minimization","date":"2025-01-20","arxiv_id":"2501.11584","n_code_links":1,"syntology":null},{"paper":null,"title":"Weight Averaging for Out-of-Distribution Generalization and Few-Shot Domain Adaptation","date":"2025-01-14","arxiv_id":"2501.08361","n_code_links":0,"syntology":null},{"paper":null,"title":"Preconditioned Sharpness-Aware Minimization: Unifying Analysis and a Novel Learning Algorithm","date":"2025-01-11","arxiv_id":"2501.06603","n_code_links":0,"syntology":null},{"paper":null,"title":"SAFER: Sharpness Aware layer-selective Finetuning for Enhanced Robustness in vision transformers","date":"2025-01-02","arxiv_id":"2501.01529","n_code_links":0,"syntology":null},{"paper":null,"title":"Uncertainty-Guided Cross Attention Ensemble Mean Teacher for Semi-supervised Medical Image Segmentation","date":"2024-12-19","arxiv_id":"2412.15380","n_code_links":0,"syntology":null},{"paper":null,"title":"Seeking Consistent Flat Minima for Better Domain Generalization via Refining Loss Landscapes","date":"2024-12-18","arxiv_id":"2412.13573","n_code_links":0,"syntology":null},{"paper":"/paper/sse-sam-balancing-head-and-tail-classes","title":"SSE-SAM: Balancing Head and Tail Classes Gradually through Stage-Wise SAM","date":"2024-12-18","arxiv_id":"2412.13715","n_code_links":1,"syntology":null},{"paper":null,"title":"Meta Curvature-Aware Minimization for Domain Generalization","date":"2024-12-16","arxiv_id":"2412.11542","n_code_links":0,"syntology":null},{"paper":null,"title":"GAQAT: gradient-adaptive quantization-aware training for domain generalization","date":"2024-12-07","arxiv_id":"2412.05551","n_code_links":0,"syntology":null},{"paper":null,"title":"Towards Understanding the Role of Sharpness-Aware Minimization Algorithms for Out-of-Distribution Generalization","date":"2024-12-06","arxiv_id":"2412.05169","n_code_links":0,"syntology":null},{"paper":"/paper/beyond-local-sharpness-communication","title":"Beyond Local Sharpness: Communication-Efficient Global Sharpness-aware Minimization for Federated Learning","date":"2024-12-04","arxiv_id":"2412.03752","n_code_links":2,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/image-classification","name":"Image Classification","papers":19},{"task":"/task/image-classification","name":"image-classification","papers":13},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":10},{"task":"/task/domain-generalization","name":"Domain Generalization","papers":10},{"task":"/task/federated-learning","name":"Federated Learning","papers":8},{"task":"/task/model","name":"model","papers":7},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":6},{"task":"/task/computational-efficiency","name":"Computational Efficiency","papers":5},{"task":"/task/quantization","name":"Quantization","papers":5},{"task":"/task/segmentation","name":"Segmentation","papers":5},{"task":"/task/deep-learning","name":"Deep Learning","papers":4},{"task":"/task/adversarial-robustness","name":"Adversarial Robustness","papers":3},{"task":"/task/attribute","name":"Attribute","papers":3},{"task":"/task/classification-1","name":"Classification","papers":3},{"task":"/task/image-segmentation","name":"Image Segmentation","papers":3},{"task":"/task/language-modeling","name":"Language Modeling","papers":3},{"task":"/task/language-modelling","name":"Language Modelling","papers":3},{"task":"/task/long-tail-learning","name":"Long-tail Learning","papers":3},{"task":"/task/node-classification","name":"Node Classification","papers":3},{"task":"/task/out-of-distribution-detection","name":"Out-of-Distribution Detection","papers":3}],"tasks_shown":20,"n_tasks":115,"usage_by_year":[{"year":"2020","papers":1},{"year":"2021","papers":10},{"year":"2022","papers":27},{"year":"2023","papers":34},{"year":"2024","papers":47},{"year":"2025","papers":23}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/sharpness-aware-minimization"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}