{"url":"/method/soups","slug":"soups","name":"Soups","full_name":"Model Soups","full_name_withheld":false,"description_markdown":"Compress an ensemble of models into a single one by averaging their weights (under certain pre-conditions).","description_state":"present","introduced_year":null,"introduced_by":{"title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","paper":"/paper/model-soups-averaging-weights-of-multiple","first_author":"Mitchell Wortsman","n_authors":11,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/model-soups-averaging-weights-of-multiple"},"source":{"url":"https://arxiv.org/abs/2203.05482v3","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Model Compression","url":"/methods/category/model-compression","pwc_aliases":[]}],"n_papers_tagged":19,"archive_num_papers":19,"papers_newest_first":[{"paper":null,"title":"UC-MOA: Utility-Conditioned Multi-Objective Alignment for Distributional Pareto-Optimality","date":"2025-03-10","arxiv_id":"2503.10669","n_code_links":0,"syntology":null},{"paper":"/paper/local-superior-soups-a-catalyst-for-model","title":"Local Superior Soups: A Catalyst for Model Merging in Cross-Silo Federated Learning","date":"2024-10-31","arxiv_id":"2410.23660","n_code_links":1,"syntology":{"ran":3,"of":12,"unverified":9,"pointer_only":12}},{"paper":"/paper/merging-in-a-bottle-differentiable-adaptive","title":"Merging in a Bottle: Differentiable Adaptive Merging (DAM) and the Path from Averaging to Automation","date":"2024-10-10","arxiv_id":"2410.08371","n_code_links":1,"syntology":null},{"paper":null,"title":"Robust Biharmonic Skinning Using Geometric Fields","date":"2024-06-01","arxiv_id":"2406.00238","n_code_links":0,"syntology":null},{"paper":null,"title":"Cross-Dataset Generalization For Retinal Lesions Segmentation","date":"2024-05-14","arxiv_id":"2405.08329","n_code_links":0,"syntology":null},{"paper":null,"title":"How Much You Ate? Food Portion Estimation on Spoons","date":"2024-05-12","arxiv_id":"2405.08717","n_code_links":0,"syntology":null},{"paper":"/paper/fissionfusion-fast-geometric-generation-and","title":"FissionFusion: Fast Geometric Generation and Hierarchical Souping for Medical Image Analysis","date":"2024-03-20","arxiv_id":"2403.13341","n_code_links":1,"syntology":null},{"paper":null,"title":"RADIN: Souping on a Budget","date":"2024-01-31","arxiv_id":"2401.17790","n_code_links":0,"syntology":null},{"paper":null,"title":"Partial Fine-Tuning: A Successor to Full Fine-Tuning for Vision Transformers","date":"2023-12-25","arxiv_id":"2312.15681","n_code_links":0,"syntology":null},{"paper":"/paper/descriptor-and-word-soups-overcoming-the","title":"Descriptor and Word Soups: Overcoming the Parameter Efficiency Accuracy Tradeoff for Out-of-Distribution Few-shot Learning","date":"2023-11-21","arxiv_id":"2311.13612","n_code_links":1,"syntology":null},{"paper":"/paper/sparse-model-soups-a-recipe-for-improved","title":"Sparse Model Soups: A Recipe for Improved Pruning via Model Averaging","date":"2023-06-29","arxiv_id":"2306.16788","n_code_links":1,"syntology":null},{"paper":"/paper/graph-ladling-shockingly-simple-parallel-gnn","title":"Graph Ladling: Shockingly Simple Parallel GNN Training without Intermediate Communication","date":"2023-06-18","arxiv_id":"2306.10466","n_code_links":1,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":0}},{"paper":null,"title":"Pre-training Language Model as a Multi-perspective Course Learner","date":"2023-05-06","arxiv_id":"2305.03981","n_code_links":0,"syntology":null},{"paper":null,"title":"Seasoning Model Soups for Robustness to Adversarial and Natural Distribution Shifts","date":"2023-02-20","arxiv_id":"2302.10164","n_code_links":0,"syntology":null},{"paper":"/paper/candidate-soups-fusing-candidate-results","title":"Candidate Soups: Fusing Candidate Results Improves Translation Quality for Non-Autoregressive Translation","date":"2023-01-27","arxiv_id":"2301.11503","n_code_links":1,"syntology":null},{"paper":"/paper/model-soups-to-increase-inference-without","title":"Model soups to increase inference without increasing compute time","date":"2023-01-24","arxiv_id":"2301.10092","n_code_links":1,"syntology":null},{"paper":null,"title":"Revisiting adapters with adversarial training","date":"2022-10-10","arxiv_id":"2210.04886","n_code_links":0,"syntology":null},{"paper":"/paper/bag-of-tricks-for-domain-adaptive-multi","title":"Bag of Tricks for Domain Adaptive Multi-Object Tracking","date":"2022-05-31","arxiv_id":"2205.15609","n_code_links":1,"syntology":null},{"paper":"/paper/model-soups-averaging-weights-of-multiple","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","date":"2022-03-10","arxiv_id":"2203.05482","n_code_links":6,"syntology":{"ran":5,"of":17,"unverified":12,"pointer_only":0}}],"papers_shown":19,"tasks":[{"task":"/task/domain-generalization","name":"Domain Generalization","papers":2},{"task":"/task/ensemble-learning","name":"Ensemble Learning","papers":1},{"task":"/task/federated-learning","name":"Federated Learning","papers":1},{"task":"/task/few-shot-learning","name":"Few-Shot Learning","papers":1},{"task":null,"name":"GPU","papers":1},{"task":"/task/graph-sampling","name":"Graph Sampling","papers":1},{"task":"/task/image-classification","name":"Image Classification","papers":1},{"task":"/task/language-modeling","name":"Language Modeling","papers":1},{"task":"/task/language-modelling","name":"Language Modelling","papers":1},{"task":"/task/masked-language-modeling","name":"Masked Language Modeling","papers":1},{"task":"/task/medical-image-analysis","name":"Medical Image Analysis","papers":1},{"task":"/task/model-compression","name":"Model Compression","papers":1},{"task":"/task/multi-object-tracking","name":"Multi-Object Tracking","papers":1},{"task":"/task/object-tracking","name":"Object Tracking","papers":1},{"task":"/task/out-of-distribution-generalization","name":"Out-of-Distribution Generalization","papers":1},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":1},{"task":"/task/translation","name":"Translation","papers":1},{"task":"/task/unsupervised-domain-adaptation","name":"Unsupervised Domain Adaptation","papers":1},{"task":"/task/graph-partitioning","name":"graph partitioning","papers":1},{"task":"/task/image-classification","name":"image-classification","papers":1}],"tasks_shown":20,"n_tasks":22,"usage_by_year":[{"year":"2022","papers":3},{"year":"2023","papers":8},{"year":"2024","papers":7},{"year":"2025","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/soups"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}