{"url":"/method/positional-encoding-generator","slug":"positional-encoding-generator","name":"Positional Encoding Generator","full_name":"Positional Encoding Generator","full_name_withheld":false,"description_markdown":"**Positional Encoding Generator**, or **PEG**, is a module used in the [Conditional Position Encoding](https://paperswithcode.com/method/conditional-positional-encoding) position embeddings. It dynamically produce the positional encodings conditioned on the local neighborhood of an input token. To condition on the local neighbors, we first reshape the flattened input sequence $X \\in \\mathbb{R}^{B \\times N \\times C}$ of DeiT back to $X^{\\prime} \\in \\mathbb{R}^{B \\times H \\times W \\times C}$ in the 2 -D image space. Then, a function (denoted by $\\mathcal{F}$ in the Figure) is repeatedly applied to the local patch in $X^{\\prime}$ to produce the conditional positional encodings $E^{B \\times H \\times W \\times C} .$ PEG can be efficiently implemented with a 2-D convolution with kernel $k(k \\geq 3)$ and $\\frac{k-1}{2}$ zero paddings. Note that the zero paddings here are important to make the model be aware of the absolute positions, and $\\mathcal{F}$ can be of various forms such as separable convolutions and many others.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Conditional Positional Encodings for Vision Transformers","paper":"/paper/do-we-really-need-explicit-position-encodings","first_author":"Xiangxiang Chu","n_authors":5,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/do-we-really-need-explicit-position-encodings"},"source":{"url":"https://arxiv.org/abs/2102.10882v3","title":"Conditional Positional Encodings for Vision Transformers","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Miscellaneous Components","url":"/methods/category/miscellaneous-components","pwc_aliases":[]}],"n_papers_tagged":8,"archive_num_papers":8,"papers_newest_first":[{"paper":"/paper/writevit-handwritten-text-generation-with","title":"WriteViT: Handwritten Text Generation with Vision Transformer","date":"2025-05-19","arxiv_id":"2505.13235","n_code_links":1,"syntology":null},{"paper":"/paper/cbramod-a-criss-cross-brain-foundation-model","title":"CBraMod: A Criss-Cross Brain Foundation Model for EEG Decoding","date":"2024-12-10","arxiv_id":"2412.07236","n_code_links":1,"syntology":{"ran":2,"of":5,"unverified":3,"pointer_only":0}},{"paper":"/paper/serialized-point-mamba-a-serialized-point","title":"Serialized Point Mamba: A Serialized Point Cloud Mamba Segmentation Model","date":"2024-07-17","arxiv_id":"2407.12319","n_code_links":0,"syntology":null},{"paper":"/paper/csta-cnn-based-spatiotemporal-attention-for","title":"CSTA: CNN-based Spatiotemporal Attention for Video Summarization","date":"2024-05-20","arxiv_id":"2405.11905","n_code_links":1,"syntology":{"ran":7,"of":8,"unverified":1,"pointer_only":0}},{"paper":"/paper/spectral-convolutional-transformer","title":"Heracles: A Hybrid SSM-Transformer Model for High-Resolution Image and Time-Series Analysis","date":"2024-03-26","arxiv_id":"2403.18063","n_code_links":2,"syntology":{"ran":4,"of":4,"unverified":0,"pointer_only":4}},{"paper":"/paper/v4d-voxel-for-4d-novel-view-synthesis","title":"V4d: voxel for 4d novel view synthesis","date":"2022-05-28","arxiv_id":"2205.14332","n_code_links":1,"syntology":null},{"paper":"/paper/twins-revisiting-spatial-attention-design-in","title":"Twins: Revisiting the Design of Spatial Attention in Vision Transformers","date":"2021-04-28","arxiv_id":"2104.13840","n_code_links":9,"syntology":{"ran":0,"of":2,"unverified":2,"pointer_only":2}},{"paper":"/paper/do-we-really-need-explicit-position-encodings","title":"Conditional Positional Encodings for Vision Transformers","date":"2021-02-22","arxiv_id":"2102.10882","n_code_links":2,"syntology":null}],"papers_shown":8,"tasks":[{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":3},{"task":"/task/image-classification","name":"Image Classification","papers":2},{"task":"/task/instance-segmentation","name":"Instance Segmentation","papers":2},{"task":"/task/mamba","name":"Mamba","papers":2},{"task":"/task/3d-instance-segmentation-1","name":"3D Instance Segmentation","papers":1},{"task":"/task/3d-reconstruction","name":"3D Reconstruction","papers":1},{"task":"/task/3d-semantic-segmentation","name":"3D Semantic Segmentation","papers":1},{"task":"/task/automl","name":"AutoML","papers":1},{"task":"/task/classification-1","name":"Classification","papers":1},{"task":"/task/computational-efficiency","name":"Computational Efficiency","papers":1},{"task":"/task/eeg-1","name":"EEG","papers":1},{"task":"/task/eeg-decoding","name":"Eeg Decoding","papers":1},{"task":"/task/classification","name":"General Classification","papers":1},{"task":"/task/handwriting-generation","name":"Handwriting generation","papers":1},{"task":"/task/inductive-bias","name":"Inductive Bias","papers":1},{"task":"/task/lidar-semantic-segmentation","name":"LIDAR Semantic Segmentation","papers":1},{"task":"/task/novel-view-synthesis","name":"Novel View Synthesis","papers":1},{"task":"/task/point-cloud-segmentation","name":"Point Cloud Segmentation","papers":1},{"task":null,"name":"Position","papers":1},{"task":"/task/segmentation","name":"Segmentation","papers":1}],"tasks_shown":20,"n_tasks":29,"usage_by_year":[{"year":"2021","papers":2},{"year":"2022","papers":1},{"year":"2024","papers":4},{"year":"2025","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/positional-encoding-generator"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}