{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/when-vision-transformers-outperform-resnets","title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","arxiv_id":"2106.01548","date":"2021-06-03","proceeding":"ICLR 2022 4","authors":["Xiangning Chen","Cho-Jui Hsieh","Boqing Gong"],"abstract":"Vision Transformers (ViTs) and MLPs signal further efforts on replacing hand-wired features or inductive biases with general-purpose neural architectures. Existing works empower the models by massive data, such as large-scale pre-training and/or repeated strong data augmentations, and still report optimization-related problems (e.g., sensitivity to initialization and learning rates). Hence, this paper investigates ViTs and MLP-Mixers from the lens of loss geometry, intending to improve the models' data efficiency at training and generalization at inference. Visualization and Hessian reveal extremely sharp local minima of converged models. By promoting smoothness with a recently proposed sharpness-aware optimizer, we substantially improve the accuracy and robustness of ViTs and MLP-Mixers on various tasks spanning supervised, adversarial, contrastive, and transfer learning (e.g., +5.3\\% and +11.0\\% top-1 accuracy on ImageNet for ViT-B/16 and Mixer-B/16, respectively, with the simple Inception-style preprocessing). We show that the improved smoothness attributes to sparser active neurons in the first few layers. The resultant ViTs outperform ResNets of similar size and throughput when trained from scratch on ImageNet without large-scale pre-training or strong data augmentations. Model checkpoints are available at \\url{https://github.com/google-research/vision_transformer}.","url_abs":"https://arxiv.org/abs/2106.01548v3","url_pdf":"https://arxiv.org/pdf/2106.01548v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"when-vision-transformers-outperform-resnets","repo_url":"https://github.com/google-research/vision_transformer","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"jax","reach":null},{"paper_slug":"when-vision-transformers-outperform-resnets","repo_url":"https://github.com/ttt496/VisionTransformer","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"jax","reach":null}],"tasks":[{"task_slug":"domain-generalization","task_name":"Domain Generalization"},{"task_slug":"fine-grained-image-classification","task_name":"Fine-Grained Image Classification"},{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"transfer-learning","task_name":"Transfer Learning"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/domain-generalization-on-imagenet-c","task":"Domain Generalization","dataset":"ImageNet-C","model":"ViT-B/16-SAM","rank_in_archive_order":44,"of":47,"metrics":{"Top 1 Accuracy":"56.5"},"uses_additional_data":false},{"leaderboard":"/sota/domain-generalization-on-imagenet-c","task":"Domain Generalization","dataset":"ImageNet-C","model":"ResNet-152x2-SAM","rank_in_archive_order":45,"of":47,"metrics":{"Top 1 Accuracy":"55"},"uses_additional_data":false},{"leaderboard":"/sota/domain-generalization-on-imagenet-c","task":"Domain Generalization","dataset":"ImageNet-C","model":"Mixer-B/8-SAM","rank_in_archive_order":47,"of":47,"metrics":{"Top 1 Accuracy":"48.9"},"uses_additional_data":false},{"leaderboard":"/sota/domain-generalization-on-imagenet-r","task":"Domain Generalization","dataset":"ImageNet-R","model":"ResNet-152x2-SAM","rank_in_archive_order":37,"of":39,"metrics":{"Top-1 Error Rate":"71.9"},"uses_additional_data":false},{"leaderboard":"/sota/domain-generalization-on-imagenet-r","task":"Domain Generalization","dataset":"ImageNet-R","model":"ViT-B/16-SAM","rank_in_archive_order":38,"of":39,"metrics":{"Top-1 Error Rate":"73.6"},"uses_additional_data":false},{"leaderboard":"/sota/domain-generalization-on-imagenet-r","task":"Domain Generalization","dataset":"ImageNet-R","model":"Mixer-B/8-SAM","rank_in_archive_order":39,"of":39,"metrics":{"Top-1 Error Rate":"76.5"},"uses_additional_data":false},{"leaderboard":"/sota/fine-grained-image-classification-on-oxford-2","task":"Fine-Grained Image Classification","dataset":"Oxford-IIIT Pets","model":"ResNet-152-SAM","rank_in_archive_order":10,"of":19,"metrics":{"Accuracy":"93.3"},"uses_additional_data":false},{"leaderboard":"/sota/fine-grained-image-classification-on-oxford-2","task":"Fine-Grained Image Classification","dataset":"Oxford-IIIT Pets","model":"ViT-B/16- SAM","rank_in_archive_order":11,"of":19,"metrics":{"Accuracy":"93.1"},"uses_additional_data":false},{"leaderboard":"/sota/fine-grained-image-classification-on-oxford-2","task":"Fine-Grained Image Classification","dataset":"Oxford-IIIT Pets","model":"ViT-S/16- SAM","rank_in_archive_order":12,"of":19,"metrics":{"Accuracy":"92.9"},"uses_additional_data":false},{"leaderboard":"/sota/fine-grained-image-classification-on-oxford-2","task":"Fine-Grained Image Classification","dataset":"Oxford-IIIT Pets","model":"Mixer-B/16- SAM","rank_in_archive_order":13,"of":19,"metrics":{"Accuracy":"92.5"},"uses_additional_data":false},{"leaderboard":"/sota/fine-grained-image-classification-on-oxford-2","task":"Fine-Grained Image Classification","dataset":"Oxford-IIIT Pets","model":"ResNet-50-SAM","rank_in_archive_order":14,"of":19,"metrics":{"Accuracy":"91.6"},"uses_additional_data":false},{"leaderboard":"/sota/fine-grained-image-classification-on-oxford-2","task":"Fine-Grained Image Classification","dataset":"Oxford-IIIT Pets","model":"Mixer-S/16- SAM","rank_in_archive_order":15,"of":19,"metrics":{"Accuracy":"88.7"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-cifar-10","task":"Image Classification","dataset":"CIFAR-10","model":"ViT-B/16- SAM","rank_in_archive_order":35,"of":265,"metrics":{"Percentage correct":"98.6"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-cifar-10","task":"Image Classification","dataset":"CIFAR-10","model":"ResNet-152-SAM","rank_in_archive_order":51,"of":265,"metrics":{"Percentage correct":"98.2"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-cifar-10","task":"Image Classification","dataset":"CIFAR-10","model":"ViT-S/16- SAM","rank_in_archive_order":52,"of":265,"metrics":{"Percentage correct":"98.2"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-cifar-10","task":"Image Classification","dataset":"CIFAR-10","model":"Mixer-B/16- SAM","rank_in_archive_order":70,"of":265,"metrics":{"Percentage correct":"97.8"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-cifar-10","task":"Image Classification","dataset":"CIFAR-10","model":"ResNet-50-SAM","rank_in_archive_order":86,"of":265,"metrics":{"Percentage correct":"97.4"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-cifar-10","task":"Image Classification","dataset":"CIFAR-10","model":"Mixer-S/16- SAM","rank_in_archive_order":120,"of":265,"metrics":{"Percentage correct":"96.1"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-cifar-100","task":"Image Classification","dataset":"CIFAR-100","model":"ViT-B/16- SAM","rank_in_archive_order":33,"of":211,"metrics":{"Percentage correct":"89.1"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-cifar-100","task":"Image Classification","dataset":"CIFAR-100","model":"ViT-S/16- SAM","rank_in_archive_order":42,"of":211,"metrics":{"Percentage correct":"87.6"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-cifar-100","task":"Image Classification","dataset":"CIFAR-100","model":"Mixer-B/16- SAM","rank_in_archive_order":53,"of":211,"metrics":{"Percentage correct":"86.4"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-cifar-100","task":"Image Classification","dataset":"CIFAR-100","model":"ResNet-50-SAM","rank_in_archive_order":66,"of":211,"metrics":{"Percentage correct":"85.2"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-cifar-100","task":"Image Classification","dataset":"CIFAR-100","model":"Mixer-S/16- SAM","rank_in_archive_order":105,"of":211,"metrics":{"Percentage correct":"82.4"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-flowers-102","task":"Image Classification","dataset":"Flowers-102","model":"ViT-B/16- SAM","rank_in_archive_order":44,"of":52,"metrics":{"Accuracy":"91.8"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-flowers-102","task":"Image Classification","dataset":"Flowers-102","model":"ViT-S/16- SAM","rank_in_archive_order":45,"of":52,"metrics":{"Accuracy":"91.5"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-flowers-102","task":"Image Classification","dataset":"Flowers-102","model":"ResNet-152-SAM","rank_in_archive_order":46,"of":52,"metrics":{"Accuracy":"91.1"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-flowers-102","task":"Image Classification","dataset":"Flowers-102","model":"ResNet-50-SAM","rank_in_archive_order":47,"of":52,"metrics":{"Accuracy":"90"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-flowers-102","task":"Image Classification","dataset":"Flowers-102","model":"Mixer-B/16- SAM","rank_in_archive_order":48,"of":52,"metrics":{"Accuracy":"90"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-flowers-102","task":"Image Classification","dataset":"Flowers-102","model":"Mixer-S/16- SAM","rank_in_archive_order":50,"of":52,"metrics":{"Accuracy":"87.9"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-imagenet","task":"Image Classification","dataset":"ImageNet","model":"ResNet-152x2-SAM","rank_in_archive_order":666,"of":1060,"metrics":{"Number of params":"236M","Top 1 Accuracy":"81.1%"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-imagenet","task":"Image Classification","dataset":"ImageNet","model":"ViT-B/16-SAM","rank_in_archive_order":731,"of":1060,"metrics":{"Number of params":"87M","Top 1 Accuracy":"79.9%"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-imagenet","task":"Image Classification","dataset":"ImageNet","model":"Mixer-B/8-SAM","rank_in_archive_order":795,"of":1060,"metrics":{"Number of params":"64M","Top 1 Accuracy":"79%"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-imagenet-real","task":"Image Classification","dataset":"ImageNet ReaL","model":"ResNet-152x2-SAM","rank_in_archive_order":37,"of":57,"metrics":{"Accuracy":"86.4%"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-imagenet-real","task":"Image Classification","dataset":"ImageNet ReaL","model":"ViT-B/16-SAM","rank_in_archive_order":43,"of":57,"metrics":{"Accuracy":"85.2%"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-imagenet-real","task":"Image Classification","dataset":"ImageNet ReaL","model":"Mixer-B/8-SAM","rank_in_archive_order":45,"of":57,"metrics":{"Accuracy":"84.4%"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-imagenet-v2","task":"Image Classification","dataset":"ImageNet V2","model":"ResNet-152x2-SAM","rank_in_archive_order":26,"of":33,"metrics":{"Top 1 Accuracy":"69.6"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-imagenet-v2","task":"Image Classification","dataset":"ImageNet V2","model":"ViT-B/16-SAM","rank_in_archive_order":30,"of":33,"metrics":{"Top 1 Accuracy":"67.5"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-imagenet-v2","task":"Image Classification","dataset":"ImageNet V2","model":"Mixer-B/8-SAM","rank_in_archive_order":32,"of":33,"metrics":{"Top 1 Accuracy":"65.5"},"uses_additional_data":true}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2106.01548","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}