{"url":"/method/cpvt","slug":"cpvt","name":"CPVT","full_name":"Conditional Position Encoding Vision Transformer","full_name_withheld":false,"description_markdown":"**CPVT**, or **Conditional Position Encoding Vision Transformer**, is a type of [vision transformer](https://paperswithcode.com/methods/category/vision-transformer) which utilizes [conditional positional encoding](https://paperswithcode.com/method/conditional-positional-encoding). Other than the new encodings, it follows the same architecture of [ViT](https://paperswithcode.com/method/vision-transformer) and [DeiT](https://paperswithcode.com/method/deit).","description_state":"present","introduced_year":null,"introduced_by":{"title":"Conditional Positional Encodings for Vision Transformers","paper":"/paper/do-we-really-need-explicit-position-encodings","first_author":"Xiangxiang Chu","n_authors":5,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/do-we-really-need-explicit-position-encodings"},"source":{"url":"https://arxiv.org/abs/2102.10882v3","title":"Conditional Positional Encodings for Vision Transformers","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Vision Transformers","url":"/methods/category/vision-transformers","pwc_aliases":["vision-transformer"]}],"n_papers_tagged":2,"archive_num_papers":2,"papers_newest_first":[{"paper":"/paper/spectral-convolutional-transformer","title":"Heracles: A Hybrid SSM-Transformer Model for High-Resolution Image and Time-Series Analysis","date":"2024-03-26","arxiv_id":"2403.18063","n_code_links":2,"syntology":{"ran":4,"of":4,"unverified":0,"pointer_only":4}},{"paper":"/paper/do-we-really-need-explicit-position-encodings","title":"Conditional Positional Encodings for Vision Transformers","date":"2021-02-22","arxiv_id":"2102.10882","n_code_links":2,"syntology":null}],"papers_shown":2,"tasks":[{"task":"/task/automl","name":"AutoML","papers":1},{"task":"/task/classification-1","name":"Classification","papers":1},{"task":"/task/classification","name":"General Classification","papers":1},{"task":"/task/image-classification","name":"Image Classification","papers":1},{"task":"/task/inductive-bias","name":"Inductive Bias","papers":1},{"task":"/task/instance-segmentation","name":"Instance Segmentation","papers":1},{"task":"/task/mamba","name":"Mamba","papers":1},{"task":null,"name":"Position","papers":1},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":1},{"task":"/task/state-space-models","name":"State Space Models","papers":1},{"task":"/task/time-series-1","name":"Time Series","papers":1},{"task":"/task/time-series","name":"Time Series Analysis","papers":1},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":1},{"task":"/task/translation","name":"Translation","papers":1},{"task":"/task/image-classification","name":"image-classification","papers":1}],"tasks_shown":15,"n_tasks":15,"usage_by_year":[{"year":"2021","papers":1},{"year":"2024","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/cpvt"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}