{"url":"/method/pvtv2","slug":"pvtv2","name":"PVTv2","full_name":"Pyramid Vision Transformer v2","full_name_withheld":false,"description_markdown":"**Pyramid Vision Transformer v2** (PVTv2) is a type of [Vision Transformer](https://paperswithcode.com/method/vision-transformer) for detection and segmentation tasks. It improves on [PVTv1](https://paperswithcode.com/method/pvt) through several design improvements: (1) overlapping patch embedding, (2) convolutional feed-forward networks, and (3) linear complexity attention layers that are orthogonal to the PVTv1 framework.","description_state":"present","introduced_year":null,"introduced_by":{"title":"PVT v2: Improved Baselines with Pyramid Vision Transformer","paper":"/paper/pvtv2-improved-baselines-with-pyramid-vision","first_author":"Wenhai Wang","n_authors":9,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/pvtv2-improved-baselines-with-pyramid-vision"},"source":{"url":"https://arxiv.org/abs/2106.13797v7","title":"PVT v2: Improved Baselines with Pyramid Vision Transformer","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/whai362/PVT/blob/v2/detection/pvt_v2.py","code_snippet_url_on_a_code_host":true,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Image Models","url":"/methods/category/image-models","pwc_aliases":[]},{"area":"Computer Vision","area_id":"computer-vision","collection":"Vision Transformers","url":"/methods/category/vision-transformers","pwc_aliases":["vision-transformer"]}],"n_papers_tagged":4,"archive_num_papers":4,"papers_newest_first":[{"paper":"/paper/improving-existing-segmentators-performance","title":"Improving existing segmentators performance with zero-shot segmentators","date":"2023-07-26","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/locality-guidance-for-improving-vision","title":"Locality Guidance for Improving Vision Transformers on Tiny Datasets","date":"2022-07-20","arxiv_id":"2207.10026","n_code_links":1,"syntology":{"ran":0,"of":1,"unverified":1,"pointer_only":0}},{"paper":null,"title":"PVT-COV19D: Pyramid Vision Transformer for COVID-19 Diagnosis","date":"2022-06-30","arxiv_id":"2206.15069","n_code_links":0,"syntology":null},{"paper":"/paper/pvtv2-improved-baselines-with-pyramid-vision","title":"PVT v2: Improved Baselines with Pyramid Vision Transformer","date":"2021-06-25","arxiv_id":"2106.13797","n_code_links":18,"syntology":null}],"papers_shown":4,"tasks":[{"task":"/task/covid-19-detection","name":"COVID-19 Diagnosis","papers":1},{"task":"/task/camouflaged-object-segmentation","name":"Camouflaged Object Segmentation","papers":1},{"task":"/task/image-classification","name":"Image Classification","papers":1},{"task":"/task/object-detection","name":"Object Detection","papers":1},{"task":"/task/panoptic-segmentation","name":"Panoptic Segmentation","papers":1},{"task":"/task/segmentation","name":"Segmentation","papers":1},{"task":"/task/zero-shot-generalization","name":"Zero-shot Generalization","papers":1}],"tasks_shown":7,"n_tasks":7,"usage_by_year":[{"year":"2021","papers":1},{"year":"2022","papers":2},{"year":"2023","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/pvtv2"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}