{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/understanding-the-robustness-in-vision","title":"Understanding The Robustness in Vision Transformers","arxiv_id":"2204.12451","date":"2022-04-26","proceeding":null,"authors":["Daquan Zhou","Zhiding Yu","Enze Xie","Chaowei Xiao","Anima Anandkumar","Jiashi Feng","Jose M. Alvarez"],"abstract":"Recent studies show that Vision Transformers(ViTs) exhibit strong robustness against various corruptions. Although this property is partly attributed to the self-attention mechanism, there is still a lack of systematic understanding. In this paper, we examine the role of self-attention in learning robust representations. Our study is motivated by the intriguing properties of the emerging visual grouping in Vision Transformers, which indicates that self-attention may promote robustness through improved mid-level representations. We further propose a family of fully attentional networks (FANs) that strengthen this capability by incorporating an attentional channel processing design. We validate the design comprehensively on various hierarchical backbones. Our model achieves a state-of-the-art 87.1% accuracy and 35.8% mCE on ImageNet-1k and ImageNet-C with 76.8M parameters. We also demonstrate state-of-the-art accuracy and robustness in two downstream tasks: semantic segmentation and object detection. Code is available at: https://github.com/NVlabs/FAN.","url_abs":"https://arxiv.org/abs/2204.12451v4","url_pdf":"https://arxiv.org/pdf/2204.12451v4.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"understanding-the-robustness-in-vision","repo_url":"https://github.com/nvlabs/fan","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"understanding-the-robustness-in-vision","repo_url":"https://github.com/NVlabs/STL","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"NOASSERTION"}}],"tasks":[{"task_slug":"domain-generalization","task_name":"Domain Generalization"},{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"object-detection","task_name":"Object Detection"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"},{"task_slug":"object-detection-1","task_name":"object-detection"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/domain-generalization-on-imagenet-a","task":"Domain Generalization","dataset":"ImageNet-A","model":"FAN-Hybrid-L(IN-21K, 384)","rank_in_archive_order":7,"of":39,"metrics":{"Top-1 accuracy %":"74.5"},"uses_additional_data":true},{"leaderboard":"/sota/domain-generalization-on-imagenet-c","task":"Domain Generalization","dataset":"ImageNet-C","model":"FAN-L-Hybrid (IN-22k)","rank_in_archive_order":8,"of":47,"metrics":{"Number of params":"77M","Top 1 Accuracy":"73.6","mean Corruption Error (mCE)":"35.8"},"uses_additional_data":true},{"leaderboard":"/sota/domain-generalization-on-imagenet-c","task":"Domain Generalization","dataset":"ImageNet-C","model":"FAN-B-Hybrid (IN-22k)","rank_in_archive_order":14,"of":47,"metrics":{"Number of params":"50M","Top 1 Accuracy":"70.5","mean Corruption Error (mCE)":"41.0"},"uses_additional_data":true},{"leaderboard":"/sota/domain-generalization-on-imagenet-c","task":"Domain Generalization","dataset":"ImageNet-C","model":"FAN-L-Hybrid","rank_in_archive_order":20,"of":47,"metrics":{"Number of params":"77M","Top 1 Accuracy":"67.7","mean Corruption Error (mCE)":"43.0"},"uses_additional_data":false},{"leaderboard":"/sota/domain-generalization-on-imagenet-r","task":"Domain Generalization","dataset":"ImageNet-R","model":"FAN-Hybrid-L(IN-21K, 384))","rank_in_archive_order":4,"of":39,"metrics":{"Top-1 Error Rate":"28.9"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-imagenet","task":"Image Classification","dataset":"ImageNet","model":"FAN-L-Hybrid++","rank_in_archive_order":105,"of":1060,"metrics":{"Number of params":"76.8M","Top 1 Accuracy":"87.1%"},"uses_additional_data":false},{"leaderboard":"/sota/object-detection-on-coco-minival","task":"Object Detection","dataset":"COCO minival","model":"FAN-L-Hybrid","rank_in_archive_order":51,"of":220,"metrics":{"box AP":"55.1"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-cityscapes-val","task":"Semantic Segmentation","dataset":"Cityscapes val","model":"FAN-L-Hybrid","rank_in_archive_order":36,"of":99,"metrics":{"mIoU":"82.3"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-densepass","task":"Semantic Segmentation","dataset":"DensePASS","model":"FAN (MiT-B1)","rank_in_archive_order":11,"of":36,"metrics":{"mIoU":"42.54%"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2204.12451","atlas_url":"https://app.syntology.ai/?focus=2204.12451","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}