{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/improved-multiscale-vision-transformers-for","title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","arxiv_id":"2112.01526","date":"2021-12-02","proceeding":"CVPR 2022 1","authors":["Yanghao Li","Chao-yuan Wu","Haoqi Fan","Karttikeya Mangalam","Bo Xiong","Jitendra Malik","Christoph Feichtenhofer"],"abstract":"In this paper, we study Multiscale Vision Transformers (MViTv2) as a unified architecture for image and video classification, as well as object detection. We present an improved version of MViT that incorporates decomposed relative positional embeddings and residual pooling connections. We instantiate this architecture in five sizes and evaluate it for ImageNet classification, COCO detection and Kinetics video recognition where it outperforms prior work. We further compare MViTv2s' pooling attention to window attention mechanisms where it outperforms the latter in accuracy/compute. Without bells-and-whistles, MViTv2 has state-of-the-art performance in 3 domains: 88.8% accuracy on ImageNet classification, 58.7 boxAP on COCO object detection as well as 86.1% on Kinetics-400 video classification. Code and models are available at https://github.com/facebookresearch/mvit.","url_abs":"https://arxiv.org/abs/2112.01526v2","url_pdf":"https://arxiv.org/pdf/2112.01526v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"improved-multiscale-vision-transformers-for","repo_url":"https://github.com/facebookresearch/SlowFast","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}},{"paper_slug":"improved-multiscale-vision-transformers-for","repo_url":"https://github.com/facebookresearch/mvit","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}},{"paper_slug":"improved-multiscale-vision-transformers-for","repo_url":"https://github.com/facebookresearch/detectron2/tree/main/projects/MViTv2","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null},{"paper_slug":"improved-multiscale-vision-transformers-for","repo_url":"https://github.com/3dperceptionlab/visual-wetlandbirds","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"improved-multiscale-vision-transformers-for","repo_url":"https://github.com/JunweiLiang/aicity_action","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok"}},{"paper_slug":"improved-multiscale-vision-transformers-for","repo_url":"https://github.com/rajatmodi62/occludedactionbenchmark","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok"}},{"paper_slug":"improved-multiscale-vision-transformers-for","repo_url":"https://github.com/rwightman/pytorch-image-models","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"improved-multiscale-vision-transformers-for","repo_url":"https://github.com/open-mmlab/mmclassification","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}},{"paper_slug":"improved-multiscale-vision-transformers-for","repo_url":"https://gitlab.com/birder/birder","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"action-classification","task_name":"Action Classification"},{"task_slug":"action-recognition-in-videos","task_name":"Action Recognition"},{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"instance-segmentation","task_name":"Instance Segmentation"},{"task_slug":"object","task_name":"Object"},{"task_slug":"object-detection","task_name":"Object Detection"},{"task_slug":"video-classification","task_name":"Video Classification"},{"task_slug":"video-recognition","task_name":"Video Recognition"}],"methods":[{"method_slug":"mvit","method_name":"MViT"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/action-classification-on-kinetics-400","task":"Action Classification","dataset":"Kinetics-400","model":"MViTv2-L (ImageNet-21k pretrain)","rank_in_archive_order":51,"of":207,"metrics":{"Acc@1":"86.1","Acc@5":"97.0"},"uses_additional_data":true},{"leaderboard":"/sota/action-classification-on-kinetics-400","task":"Action Classification","dataset":"Kinetics-400","model":"MViT-B (train from scratch)","rank_in_archive_order":207,"of":207,"metrics":{"FLOPs (G) x views":"225x5"},"uses_additional_data":false},{"leaderboard":"/sota/action-classification-on-kinetics-600","task":"Action Classification","dataset":"Kinetics-600","model":"MViTv2-L (ImageNet-21k pretrain)","rank_in_archive_order":23,"of":65,"metrics":{"Top-1 Accuracy":"87.9","Top-5 Accuracy":"97.9"},"uses_additional_data":false},{"leaderboard":"/sota/action-classification-on-kinetics-600","task":"Action Classification","dataset":"Kinetics-600","model":"MViTv2-L (train from scratch)","rank_in_archive_order":30,"of":65,"metrics":{"Top-1 Accuracy":"85.5"},"uses_additional_data":false},{"leaderboard":"/sota/action-classification-on-kinetics-600","task":"Action Classification","dataset":"Kinetics-600","model":"MViTv2-B (train from scratch)","rank_in_archive_order":64,"of":65,"metrics":{"Top-5 Accuracy":"97.2"},"uses_additional_data":false},{"leaderboard":"/sota/action-classification-on-kinetics-600","task":"Action Classification","dataset":"Kinetics-600","model":"MViT-L (train from scratch)","rank_in_archive_order":65,"of":65,"metrics":{"GFLOPs":"206x5"},"uses_additional_data":false},{"leaderboard":"/sota/action-classification-on-kinetics-700","task":"Action Classification","dataset":"Kinetics-700","model":"MViTv2-L (ImageNet-21k pretrain)","rank_in_archive_order":16,"of":36,"metrics":{"Top-1 Accuracy":"79.4","Top-5 Accuracy":"94.9"},"uses_additional_data":true},{"leaderboard":"/sota/action-classification-on-kinetics-700","task":"Action Classification","dataset":"Kinetics-700","model":"MoViNet-A6","rank_in_archive_order":17,"of":36,"metrics":{"Top-1 Accuracy":"79.4"},"uses_additional_data":false},{"leaderboard":"/sota/action-classification-on-kinetics-700","task":"Action Classification","dataset":"Kinetics-700","model":"MViTv2-B","rank_in_archive_order":19,"of":36,"metrics":{"Top-1 Accuracy":"76.6","Top-5 Accuracy":"93.2"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-on-ava-v2-2","task":"Action Recognition","dataset":"AVA v2.2","model":"MViTv2-L (IN21k, K700)","rank_in_archive_order":18,"of":38,"metrics":{"mAP":"34.4"},"uses_additional_data":true},{"leaderboard":"/sota/action-recognition-in-videos-on-something","task":"Action Recognition","dataset":"Something-Something V2","model":"MViTv2-L (IN-21K + Kinetics400 pretrain)","rank_in_archive_order":21,"of":123,"metrics":{"Parameters":"213.1","Top-1 Accuracy":"73.3","Top-5 Accuracy":"94.1"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-in-videos-on-something","task":"Action Recognition","dataset":"Something-Something V2","model":"MViT-B (IN-21K + Kinetics400 pretrain)","rank_in_archive_order":26,"of":123,"metrics":{"GFLOPs":"225x3","Top-1 Accuracy":"72.1"},"uses_additional_data":true},{"leaderboard":"/sota/action-recognition-in-videos-on-something","task":"Action Recognition","dataset":"Something-Something V2","model":"MViTv2-B (IN-21K + Kinetics400 pretrain)","rank_in_archive_order":120,"of":123,"metrics":{"Parameters":"51.1","Top-5 Accuracy":"93.4"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-in-videos-on-something","task":"Action Recognition","dataset":"Something-Something V2","model":"MViT-L (IN-21K + Kinetics400 pretrain)","rank_in_archive_order":123,"of":123,"metrics":{"GFLOPs":"2828x3"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-imagenet","task":"Image Classification","dataset":"ImageNet","model":"MViTv2-H (512 res, ImageNet-21k pretrain)","rank_in_archive_order":31,"of":1060,"metrics":{"GFLOPs":"763.5","Number of params":"667M","Top 1 Accuracy":"88.8%"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-imagenet","task":"Image Classification","dataset":"ImageNet","model":"MViTv2-L (384 res, ImageNet-21k pretrain)","rank_in_archive_order":47,"of":1060,"metrics":{"GFLOPs":"140.7","Number of params":"218M","Top 1 Accuracy":"88.4%"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-imagenet","task":"Image Classification","dataset":"ImageNet","model":"MViTv2-H (mageNet-21k pretrain)","rank_in_archive_order":65,"of":1060,"metrics":{"GFLOPs":"120.6","Number of params":"667M","Top 1 Accuracy":"88%"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-imagenet","task":"Image Classification","dataset":"ImageNet","model":"MViTv2-L (384 res)","rank_in_archive_order":161,"of":1060,"metrics":{"GFLOPs":"140.2","Number of params":"218M","Top 1 Accuracy":"86.3%"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-imagenet","task":"Image Classification","dataset":"ImageNet","model":"MViTv2-T","rank_in_archive_order":550,"of":1060,"metrics":{"GFLOPs":"4.7","Number of params":"24M","Top 1 Accuracy":"82.3%"},"uses_additional_data":false},{"leaderboard":"/sota/instance-segmentation-on-coco-minival","task":"Instance Segmentation","dataset":"COCO minival","model":"MViTv2-L (Cascade Mask R-CNN, multi-scale, IN21k pre-train)","rank_in_archive_order":23,"of":93,"metrics":{"mask AP":"50.5"},"uses_additional_data":false},{"leaderboard":"/sota/instance-segmentation-on-coco-minival","task":"Instance Segmentation","dataset":"COCO minival","model":"MViTv2-H (Cascade Mask R-CNN, single-scale, IN21k pre-train)","rank_in_archive_order":36,"of":93,"metrics":{"mask AP":"48.5"},"uses_additional_data":false},{"leaderboard":"/sota/instance-segmentation-on-coco-minival","task":"Instance Segmentation","dataset":"COCO minival","model":"MViTv2-L (Cascade Mask R-CNN, single-scale)","rank_in_archive_order":39,"of":93,"metrics":{"mask AP":"47.1"},"uses_additional_data":false},{"leaderboard":"/sota/instance-segmentation-on-coco-minival","task":"Instance Segmentation","dataset":"COCO minival","model":"MViT-L (Mask R-CNN, single-scale)","rank_in_archive_order":44,"of":93,"metrics":{"mask AP":"46.2"},"uses_additional_data":false},{"leaderboard":"/sota/object-detection-on-coco-minival","task":"Object Detection","dataset":"COCO minival","model":"MViTv2-L (Cascade Mask R-CNN, multi-scale, IN21k pre-train)","rank_in_archive_order":34,"of":220,"metrics":{"box AP":"58.7"},"uses_additional_data":false},{"leaderboard":"/sota/object-detection-on-coco-minival","task":"Object Detection","dataset":"COCO minival","model":"MViTv2-H (Cascade Mask R-CNN, single-scale, IN21k pre-train)","rank_in_archive_order":46,"of":220,"metrics":{"box AP":"56.1"},"uses_additional_data":false},{"leaderboard":"/sota/object-detection-on-coco-minival","task":"Object Detection","dataset":"COCO minival","model":"MViTv2-L (Cascade Mask R-CNN, single-scale)","rank_in_archive_order":57,"of":220,"metrics":{"box AP":"54.3"},"uses_additional_data":false},{"leaderboard":"/sota/object-detection-on-coco-minival","task":"Object Detection","dataset":"COCO minival","model":"MViT-L (Mask R-CNN, single-scale, IN21k pre-train)","rank_in_archive_order":64,"of":220,"metrics":{"box AP":"52.7"},"uses_additional_data":false},{"leaderboard":"/sota/object-detection-on-coco-o","task":"Object Detection","dataset":"COCO-O","model":"MViTV2-H\n(Cascade Mask R-CNN)","rank_in_archive_order":16,"of":45,"metrics":{"Average mAP":"30.9","Effective Robustness":"5.62"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2112.01526","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}