{"url":"/method/conditional-positional-encoding","slug":"conditional-positional-encoding","name":"Conditional Positional Encoding","full_name":"Conditional Positional Encoding","full_name_withheld":false,"description_markdown":"**Conditional Positional Encoding**, or **CPE**, is a type of positional encoding for [vision transformers](https://paperswithcode.com/methods/category/vision-transformer). Unlike previous fixed or learnable positional encodings, which are predefined and independent of input tokens, CPE is dynamically generated and conditioned on the local neighborhood of the input tokens. As a result, CPE aims to generalize to the input sequences that are longer than what the model has ever seen during training. CPE can also keep the desired translation-invariance in the image classification task. CPE can be implemented with a [Position\r\nEncoding Generator](https://paperswithcode.com/method/positional-encoding-generator) (PEG) and incorporated into the current [Transformer framework](https://paperswithcode.com/methods/category/transformers).","description_state":"present","introduced_year":null,"introduced_by":{"title":"Conditional Positional Encodings for Vision Transformers","paper":"/paper/do-we-really-need-explicit-position-encodings","first_author":"Xiangxiang Chu","n_authors":5,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/do-we-really-need-explicit-position-encodings"},"source":{"url":"https://arxiv.org/abs/2102.10882v3","title":"Conditional Positional Encodings for Vision Transformers","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Position Embeddings","url":"/methods/category/position-embeddings","pwc_aliases":[]}],"n_papers_tagged":7,"archive_num_papers":7,"papers_newest_first":[{"paper":"/paper/writevit-handwritten-text-generation-with","title":"WriteViT: Handwritten Text Generation with Vision Transformer","date":"2025-05-19","arxiv_id":"2505.13235","n_code_links":1,"syntology":null},{"paper":"/paper/cbramod-a-criss-cross-brain-foundation-model","title":"CBraMod: A Criss-Cross Brain Foundation Model for EEG Decoding","date":"2024-12-10","arxiv_id":"2412.07236","n_code_links":1,"syntology":{"ran":2,"of":5,"unverified":3,"pointer_only":0}},{"paper":"/paper/serialized-point-mamba-a-serialized-point","title":"Serialized Point Mamba: A Serialized Point Cloud Mamba Segmentation Model","date":"2024-07-17","arxiv_id":"2407.12319","n_code_links":0,"syntology":null},{"paper":"/paper/spectral-convolutional-transformer","title":"Heracles: A Hybrid SSM-Transformer Model for High-Resolution Image and Time-Series Analysis","date":"2024-03-26","arxiv_id":"2403.18063","n_code_links":2,"syntology":{"ran":4,"of":4,"unverified":0,"pointer_only":4}},{"paper":"/paper/v4d-voxel-for-4d-novel-view-synthesis","title":"V4d: voxel for 4d novel view synthesis","date":"2022-05-28","arxiv_id":"2205.14332","n_code_links":1,"syntology":null},{"paper":"/paper/twins-revisiting-spatial-attention-design-in","title":"Twins: Revisiting the Design of Spatial Attention in Vision Transformers","date":"2021-04-28","arxiv_id":"2104.13840","n_code_links":9,"syntology":{"ran":0,"of":2,"unverified":2,"pointer_only":2}},{"paper":"/paper/do-we-really-need-explicit-position-encodings","title":"Conditional Positional Encodings for Vision Transformers","date":"2021-02-22","arxiv_id":"2102.10882","n_code_links":2,"syntology":null}],"papers_shown":7,"tasks":[{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":3},{"task":"/task/image-classification","name":"Image Classification","papers":2},{"task":"/task/instance-segmentation","name":"Instance Segmentation","papers":2},{"task":"/task/mamba","name":"Mamba","papers":2},{"task":"/task/3d-instance-segmentation-1","name":"3D Instance Segmentation","papers":1},{"task":"/task/3d-reconstruction","name":"3D Reconstruction","papers":1},{"task":"/task/3d-semantic-segmentation","name":"3D Semantic Segmentation","papers":1},{"task":"/task/automl","name":"AutoML","papers":1},{"task":"/task/classification-1","name":"Classification","papers":1},{"task":"/task/computational-efficiency","name":"Computational Efficiency","papers":1},{"task":"/task/eeg-1","name":"EEG","papers":1},{"task":"/task/eeg-decoding","name":"Eeg Decoding","papers":1},{"task":"/task/classification","name":"General Classification","papers":1},{"task":"/task/handwriting-generation","name":"Handwriting generation","papers":1},{"task":"/task/inductive-bias","name":"Inductive Bias","papers":1},{"task":"/task/lidar-semantic-segmentation","name":"LIDAR Semantic Segmentation","papers":1},{"task":"/task/novel-view-synthesis","name":"Novel View Synthesis","papers":1},{"task":"/task/point-cloud-segmentation","name":"Point Cloud Segmentation","papers":1},{"task":null,"name":"Position","papers":1},{"task":"/task/segmentation","name":"Segmentation","papers":1}],"tasks_shown":20,"n_tasks":27,"usage_by_year":[{"year":"2021","papers":2},{"year":"2022","papers":1},{"year":"2024","papers":3},{"year":"2025","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/conditional-positional-encoding"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}