{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/method/sharpness-aware-minimization/papers/2","list_of":"/method/sharpness-aware-minimization","method":"Sharpness-Aware Minimization","archive":{"snapshot":"2025-07-28"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"date (newest first), then slug","page":2,"pages_in_order":2,"rows_per_page":100,"rows":[101,142],"of":142,"counts":{"archive_papers_tagged":142,"with_a_code_link":70,"where_syntology_ran_a_sample":34,"not_listed_spam_title":0,"listed":142,"listed_where_code_ran":34,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":32,"every_run_a_failure_of_syntologys_instrument":2,"listed_with_a_run_with_no_instrument_failure":32,"listed_every_run_a_failure_of_syntologys_instrument":2,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/method/sharpness-aware-minimization","prev":"/method/sharpness-aware-minimization","next":null,"papers":[{"paper":"/paper/gradient-norm-aware-minimization-seeks-first","slug":"gradient-norm-aware-minimization-seeks-first","title":"Gradient Norm Aware Minimization Seeks First-Order Flatness and Improves Generalization","date":"2023-03-03","arxiv_id":"2303.03108","n_code_links":1,"syntology":null},{"paper":null,"slug":"msam-micro-batch-averaged-sharpness-aware","title":"mSAM: Micro-Batch-Averaged Sharpness-Aware Minimization","date":"2023-02-19","arxiv_id":"2302.09693","n_code_links":0,"syntology":null},{"paper":null,"slug":"exploring-the-effect-of-multi-step-ascent-in","title":"Exploring the Effect of Multi-step Ascent in Sharpness-Aware Minimization","date":"2023-01-27","arxiv_id":"2302.10181","n_code_links":0,"syntology":null},{"paper":"/paper/class-conditional-sharpness-aware","slug":"class-conditional-sharpness-aware","title":"Class-Conditional Sharpness-Aware Minimization for Deep Long-Tailed Recognition","date":"2023-01-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/escaping-saddle-points-for-effective","slug":"escaping-saddle-points-for-effective","title":"Escaping Saddle Points for Effective Generalization on Class-Imbalanced Data","date":"2022-12-28","arxiv_id":"2212.13827","n_code_links":1,"syntology":null},{"paper":null,"slug":"improved-deep-neural-network-generalization","title":"Improved Deep Neural Network Generalization Using m-Sharpness-Aware Minimization","date":"2022-12-07","arxiv_id":"2212.04343","n_code_links":0,"syntology":null},{"paper":"/paper/efficient-generalization-improvement-guided","slug":"efficient-generalization-improvement-guided","title":"Efficient Generalization Improvement Guided by Random Weight Perturbation","date":"2022-11-21","arxiv_id":"2211.11489","n_code_links":1,"syntology":null},{"paper":null,"slug":"sharpness-aware-training-for-accurate","title":"SAMSON: Sharpness-Aware Minimization Scaled by Outlier Normalization for Improving DNN Generalization and Robustness","date":"2022-11-18","arxiv_id":"2211.11561","n_code_links":0,"syntology":null},{"paper":"/paper/fully-attentive-and-interpretable-vision-and","slug":"fully-attentive-and-interpretable-vision-and","title":"Fully-attentive and interpretable: vision and video vision transformers for pain detection","date":"2022-10-27","arxiv_id":"2210.15769","n_code_links":1,"syntology":null},{"paper":null,"slug":"sharpness-aware-minimization-for-worst-case","title":"Sufficient Invariant Learning for Distribution Shift","date":"2022-10-24","arxiv_id":"2210.13533","n_code_links":0,"syntology":null},{"paper":null,"slug":"ga-sam-gradient-strength-based-adaptive","title":"GA-SAM: Gradient-Strength based Adaptive Sharpness-Aware Minimization for Improved Generalization","date":"2022-10-13","arxiv_id":"2210.06895","n_code_links":0,"syntology":null},{"paper":"/paper/improving-sharpness-aware-minimization-with","slug":"improving-sharpness-aware-minimization-with","title":"Improving Sharpness-Aware Minimization with Fisher Mask for Better Generalization on Language Models","date":"2022-10-11","arxiv_id":"2210.05497","n_code_links":1,"syntology":null},{"paper":"/paper/make-sharpness-aware-minimization-stronger-a","slug":"make-sharpness-aware-minimization-stronger-a","title":"Make Sharpness-Aware Minimization Stronger: A Sparsified Perturbation Approach","date":"2022-10-11","arxiv_id":"2210.05177","n_code_links":2,"syntology":{"ran":1,"of":5,"n_ran_checked":1,"n_instrument":0,"unverified":4,"pointer_only":0,"phrase":"1 ran (of which 1 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 4 unverified; the one sample that ran constructed an object rather than computing a result","official":{"repos":["mi-peng/sparse-sharpness-aware-minimization"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":3,"ran_from_kinds":["listed"]}}},{"paper":null,"slug":"understanding-gradient-regularization-in-deep","title":"Understanding Gradient Regularization in Deep Learning: Efficient Finite-Difference Computation and Implicit Bias","date":"2022-10-06","arxiv_id":"2210.02720","n_code_links":0,"syntology":null},{"paper":null,"slug":"the-dynamics-of-sharpness-aware-minimization","title":"The Dynamics of Sharpness-Aware Minimization: Bouncing Across Ravines and Drifting Towards Wide Minima","date":"2022-10-04","arxiv_id":"2210.01513","n_code_links":0,"syntology":null},{"paper":"/paper/towards-bridging-the-performance-gaps-of","slug":"towards-bridging-the-performance-gaps-of","title":"Towards Bridging the Performance Gaps of Joint Energy-based Models","date":"2022-09-16","arxiv_id":"2209.07959","n_code_links":1,"syntology":{"ran":2,"of":6,"n_ran_checked":2,"n_instrument":0,"unverified":4,"pointer_only":6,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 2 honoured, 0 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 4 unverified","official":{"repos":["sndnyang/sadajem"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":4,"ran_from_kinds":["official","unlocated"]}}},{"paper":"/paper/model-generalization-a-sharpness-aware","slug":"model-generalization-a-sharpness-aware","title":"Model Generalization: A Sharpness Aware Optimization Perspective","date":"2022-08-14","arxiv_id":"2208.06915","n_code_links":1,"syntology":null},{"paper":null,"slug":"on-the-maximum-hessian-eigenvalue-and","title":"On the Maximum Hessian Eigenvalue and Generalization","date":"2022-06-21","arxiv_id":"2206.10654","n_code_links":0,"syntology":null},{"paper":"/paper/sharp-maml-sharpness-aware-model-agnostic","slug":"sharp-maml-sharpness-aware-model-agnostic","title":"Sharp-MAML: Sharpness-Aware Model-Agnostic Meta Learning","date":"2022-06-08","arxiv_id":"2206.03996","n_code_links":1,"syntology":null},{"paper":"/paper/sharpness-aware-training-for-free","slug":"sharpness-aware-training-for-free","title":"Sharpness-Aware Training for Free","date":"2022-05-27","arxiv_id":"2205.14083","n_code_links":1,"syntology":{"ran":0,"of":1,"n_ran_checked":0,"n_instrument":0,"unverified":1,"pointer_only":0,"phrase":"0 ran · 1 unverified","official":{"repos":["angusdujw/saf"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"paper":null,"slug":"train-flat-then-compress-sharpness-aware","title":"Train Flat, Then Compress: Sharpness-Aware Minimization Learns More Compressible Models","date":"2022-05-25","arxiv_id":"2205.12694","n_code_links":0,"syntology":null},{"paper":"/paper/temporally-precise-action-spotting-in-soccer","slug":"temporally-precise-action-spotting-in-soccer","title":"Temporally Precise Action Spotting in Soccer Videos Using Dense Detection Anchors","date":"2022-05-20","arxiv_id":"2205.10450","n_code_links":1,"syntology":null},{"paper":"/paper/improving-generalization-in-federated","slug":"improving-generalization-in-federated","title":"Improving Generalization in Federated Learning by Seeking Flat Minima","date":"2022-03-22","arxiv_id":"2203.11834","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":0,"n_instrument":1,"unverified":0,"pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["debcaldarola/fedsam"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"ss-sam-stochastic-scheduled-sharpness-aware","title":"Randomized Sharpness-Aware Training for Boosting Computational Efficiency in Deep Learning","date":"2022-03-18","arxiv_id":"2203.09962","n_code_links":0,"syntology":null},{"paper":null,"slug":"deepad-a-robust-deep-learning-model-of","title":"DeepAD: A Robust Deep Learning Model of Alzheimer's Disease Progression for Real-World Clinical Applications","date":"2022-03-17","arxiv_id":"2203.09096","n_code_links":0,"syntology":null},{"paper":"/paper/surrogate-gap-minimization-improves-sharpness-1","slug":"surrogate-gap-minimization-improves-sharpness-1","title":"Surrogate Gap Minimization Improves Sharpness-Aware Training","date":"2022-03-15","arxiv_id":"2203.08065","n_code_links":2,"syntology":null},{"paper":"/paper/towards-efficient-and-scalable-sharpness","slug":"towards-efficient-and-scalable-sharpness","title":"Towards Efficient and Scalable Sharpness-Aware Minimization","date":"2022-03-05","arxiv_id":"2203.02714","n_code_links":4,"syntology":{"ran":1,"of":1,"n_ran_checked":1,"n_instrument":0,"unverified":0,"pointer_only":1,"phrase":"1 ran (of which 1 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified; the one sample that ran constructed an object rather than computing a result","official":null}},{"paper":null,"slug":"color-space-based-hover-net-for-nuclei","title":"Color Space-based HoVer-Net for Nuclei Instance Segmentation and Classification","date":"2022-03-03","arxiv_id":"2203.01940","n_code_links":0,"syntology":null},{"paper":"/paper/penalizing-gradient-norm-for-efficiently","slug":"penalizing-gradient-norm-for-efficiently","title":"Penalizing Gradient Norm for Efficiently Improving Generalization in Deep Learning","date":"2022-02-08","arxiv_id":"2202.03599","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":0,"n_instrument":1,"unverified":0,"pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["zhaoyang-0204/gnp"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/questions-for-flat-minima-optimization-of","slug":"questions-for-flat-minima-optimization-of","title":"When Do Flat Minima Optimizers Work?","date":"2022-02-01","arxiv_id":"2202.00661","n_code_links":1,"syntology":null},{"paper":null,"slug":"d-sam-sharpness-aware-minimization-with-1","title":"δ-SAM: Sharpness-Aware Minimization with Dynamic Reweighting","date":"2022-01-16","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"d-sam-sharpness-aware-minimization-with","title":"Sharpness-Aware Minimization with Dynamic Reweighting","date":"2021-12-16","arxiv_id":"2112.08772","n_code_links":0,"syntology":null},{"paper":"/paper/sharpness-aware-quantization-for-deep-neural","slug":"sharpness-aware-quantization-for-deep-neural","title":"Sharpness-aware Quantization for Deep Neural Networks","date":"2021-11-24","arxiv_id":"2111.12273","n_code_links":4,"syntology":{"ran":6,"of":11,"n_ran_checked":6,"n_instrument":0,"unverified":5,"pointer_only":0,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 5 unverified","official":{"repos":["zhuang-group/saq","zip-group/saq","ziplab/saq"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":6,"n_unverified":5,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"convolutional-nets-versus-vision-transformers","title":"Convolutional Nets Versus Vision Transformers for Diabetic Foot Ulcer Classification","date":"2021-11-12","arxiv_id":"2111.06894","n_code_links":0,"syntology":null},{"paper":null,"slug":"sharpness-aware-minimization-improves","title":"Sharpness-Aware Minimization Improves Language Model Generalization","date":"2021-10-16","arxiv_id":"2110.08529","n_code_links":0,"syntology":null},{"paper":"/paper/update-in-unit-gradient","slug":"update-in-unit-gradient","title":"Perturbated Gradients Updating within Unit Space for Deep Learning","date":"2021-10-01","arxiv_id":"2110.00199","n_code_links":1,"syntology":null},{"paper":null,"slug":"mistake-driven-image-classification-with","title":"Mistake-driven Image Classification with FastGAN and SpinalNet","date":"2021-09-29","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"sharpness-aware-minimization-in-large-batch","title":"Sharpness-Aware Minimization in Large-Batch Training: Training Vision Transformer In Minutes","date":"2021-09-29","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"uor-at-semeval-2021-task-12-on-crowd","title":"UOR at SemEval-2021 Task 12: On Crowd Annotations; Learning with Disagreements to optimise crowd truth","date":"2021-08-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"slug":"using-early-learning-regularization-to","title":"Using Early-Learning Regularization to Classify Real-World Noisy Data","date":"2021-05-27","arxiv_id":"2105.13244","n_code_links":0,"syntology":null},{"paper":"/paper/asam-adaptive-sharpness-aware-minimization","slug":"asam-adaptive-sharpness-aware-minimization","title":"ASAM: Adaptive Sharpness-Aware Minimization for Scale-Invariant Learning of Deep Neural Networks","date":"2021-02-23","arxiv_id":"2102.11600","n_code_links":2,"syntology":null},{"paper":"/paper/sharpness-aware-minimization-for-efficiently-1","slug":"sharpness-aware-minimization-for-efficiently-1","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","date":"2020-10-03","arxiv_id":"2010.01412","n_code_links":18,"syntology":{"ran":15,"of":20,"n_ran_checked":13,"n_instrument":2,"unverified":5,"pointer_only":6,"phrase":"15 ran (of which 6 constructed an object rather than computing a result; 13 with no instrument failure: 0 honoured, 0 violated, 13 with no contract checked; 2 where Syntology's instrument failed) · 5 unverified","official":{"repos":["google-research/sam"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":0,"n_ran_no_instrument_failure":7,"n_unverified":2,"ran_from_kinds":["listed","official"]}}}],"record_sha256":"c13a3b737edd1b2ea4968266a720da5a1dcbba116a6461c3ab085376fda52aa1","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}