{"url":"/method/mobilevitv2","slug":"mobilevitv2","name":"MobileViTv2","full_name":"MobileViTv2","full_name_withheld":false,"description_markdown":"MobileViTv2 is a vision transformer that is tuned to mobile device. MobileViTv2 introduced a separable self-attention method to reduce cost than MobileViT","description_state":"present","introduced_year":null,"introduced_by":{"title":"Separable Self-attention for Mobile Vision Transformers","paper":"/paper/separable-self-attention-for-mobile-vision","first_author":"Sachin Mehta","n_authors":2,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/separable-self-attention-for-mobile-vision"},"source":{"url":"https://arxiv.org/abs/2206.02680v1","title":"Separable Self-attention for Mobile Vision Transformers","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Light-weight neural networks","url":"/methods/category/light-weight-neural-networks","pwc_aliases":[]},{"area":"Computer Vision","area_id":"computer-vision","collection":"Vision Transformers","url":"/methods/category/vision-transformers","pwc_aliases":["vision-transformer"]}],"n_papers_tagged":5,"archive_num_papers":5,"papers_newest_first":[{"paper":"/paper/on-board-satellite-image-classification-for","title":"Onboard Satellite Image Classification for Earth Observation: A Comparative Study of ViT Models","date":"2024-09-05","arxiv_id":"2409.03901","n_code_links":1,"syntology":null},{"paper":"/paper/shvit-single-head-vision-transformer-with","title":"SHViT: Single-Head Vision Transformer with Memory Efficient Macro Design","date":"2024-01-29","arxiv_id":"2401.16456","n_code_links":1,"syntology":{"ran":7,"of":8,"unverified":1,"pointer_only":8}},{"paper":"/paper/q-hyvit-post-training-quantization-for-hybrid","title":"Q-HyViT: Post-Training Quantization of Hybrid Vision Transformers with Bridge Block Reconstruction for IoT Systems","date":"2023-03-22","arxiv_id":"2303.12557","n_code_links":1,"syntology":null},{"paper":"/paper/mobilevitv3-mobile-friendly-vision","title":"MobileViTv3: Mobile-Friendly Vision Transformer with Simple and Effective Fusion of Local, Global and Input Features","date":"2022-09-30","arxiv_id":"2209.15159","n_code_links":2,"syntology":null},{"paper":"/paper/separable-self-attention-for-mobile-vision","title":"Separable Self-attention for Mobile Vision Transformers","date":"2022-06-06","arxiv_id":"2206.02680","n_code_links":8,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":1}}],"papers_shown":5,"tasks":[{"task":"/task/image-classification","name":"Image Classification","papers":4},{"task":"/task/object-detection","name":"Object Detection","papers":3},{"task":null,"name":"CPU","papers":1},{"task":"/task/computational-efficiency","name":"Computational Efficiency","papers":1},{"task":"/task/earth-observation","name":"Earth Observation","papers":1},{"task":null,"name":"GPU","papers":1},{"task":"/task/instance-segmentation","name":"Instance Segmentation","papers":1},{"task":"/task/quantization","name":"Quantization","papers":1},{"task":"/task/remote-sensing-image-classification","name":"Remote Sensing Image Classification","papers":1},{"task":"/task/satellite-image-classification","name":"Satellite Image Classification","papers":1},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":1},{"task":"/task/image-classification","name":"image-classification","papers":1},{"task":"/task/object-detection-1","name":"object-detection","papers":1}],"tasks_shown":13,"n_tasks":13,"usage_by_year":[{"year":"2022","papers":2},{"year":"2023","papers":1},{"year":"2024","papers":2}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/mobilevitv2"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}