{"url":"/method/mix-ffn","slug":"mix-ffn","name":"Mix-FFN","full_name":"Mix-FFN","full_name_withheld":false,"description_markdown":"**Mix-FFN** is a feedforward layer used in the [SegFormer](https://paperswithcode.com/method/segformer) architecture. [ViT](https://www.paperswithcode.com/method/vision-transformer) uses [positional encoding](https://paperswithcode.com/methods/category/position-embeddings) (PE) to introduce the location information. However, the resolution of $\\mathrm{PE}$ is fixed. Therefore, when the test resolution is different from the training one, the positional code needs to be interpolated and this often leads to dropped accuracy. To alleviate this problem, [CPVT](https://www.paperswithcode.com/method/cpvt) uses $3 \\times 3$ Conv together with the PE to implement a data-driven PE. The authors of Mix-FFN argue that positional encoding is actually not necessary for semantic segmentation. Instead, they use Mix-FFN which considers the effect of zero padding to leak location information, by directly using a $3 \\times 3$ Conv in the feed-forward network (FFN). Mix-FFN can be formulated as:\r\n\r\n$$\r\n\\mathbf{x}\\_{\\text {out }}=\\operatorname{MLP}\\left(\\operatorname{GELU}\\left(\\operatorname{Conv}\\_{3 \\times 3}\\left(\\operatorname{MLP}\\left(\\mathbf{x}\\_{i n}\\right)\\right)\\right)\\right)+\\mathbf{x}\\_{i n}\r\n$$\r\n\r\nwhere $\\mathbf{x}\\_{i n}$ is the feature from a self-attention module. Mix-FFN mixes a $3 \\times 3$ convolution and an MLP into each FFN.","description_state":"present","introduced_year":null,"introduced_by":{"title":"SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers","paper":"/paper/segformer-simple-and-efficient-design-for","first_author":"Enze Xie","n_authors":6,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/segformer-simple-and-efficient-design-for"},"source":{"url":"https://arxiv.org/abs/2105.15203v3","title":"SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Feedforward Networks","url":"/methods/category/feedforward-networks","pwc_aliases":[]}],"n_papers_tagged":47,"archive_num_papers":47,"papers_newest_first":[{"paper":"/paper/from-pixels-to-damage-severity-estimating","title":"From Pixels to Damage Severity: Estimating Earthquake Impacts Using Semantic Segmentation of Social Media Images","date":"2025-07-03","arxiv_id":"2507.02781","n_code_links":0,"syntology":null},{"paper":null,"title":"Leveraging Modified Ex Situ Tomography Data for Segmentation of In Situ Synchrotron X-Ray Computed Tomography","date":"2025-04-27","arxiv_id":"2504.19200","n_code_links":0,"syntology":null},{"paper":null,"title":"SAR Object Detection with Self-Supervised Pretraining and Curriculum-Aware Sampling","date":"2025-04-17","arxiv_id":"2504.13310","n_code_links":0,"syntology":null},{"paper":"/paper/improving-underwater-semantic-segmentation","title":"Improving underwater semantic segmentation with underwater image quality attention and muti-scale aggregation attention","date":"2025-03-30","arxiv_id":"2503.23422","n_code_links":1,"syntology":null},{"paper":null,"title":"Comprehensive Evaluation of OCT-based Automated Segmentation of Retinal Layer, Fluid and Hyper-Reflective Foci: Impact on Diabetic Retinopathy Severity Assessment","date":"2025-03-03","arxiv_id":"2503.01248","n_code_links":0,"syntology":null},{"paper":"/paper/cross-model-transferability-of-adversarial","title":"Cross-Model Transferability of Adversarial Patches in Real-time Segmentation for Autonomous Driving","date":"2025-02-22","arxiv_id":"2502.16012","n_code_links":1,"syntology":null},{"paper":null,"title":"Global Average Feature Augmentation for Robust Semantic Segmentation with Transformers","date":"2024-12-02","arxiv_id":"2412.01941","n_code_links":0,"syntology":null},{"paper":null,"title":"SynDiff-AD: Improving Semantic Segmentation and End-to-End Autonomous Driving with Synthetic Data from Latent Diffusion Models","date":"2024-11-25","arxiv_id":"2411.16776","n_code_links":0,"syntology":null},{"paper":"/paper/habaek-high-performance-water-segmentation","title":"Habaek: High-performance water segmentation through dataset expansion and inductive bias optimization","date":"2024-10-21","arxiv_id":"2410.15794","n_code_links":1,"syntology":null},{"paper":null,"title":"Risk Assessment for Autonomous Landing in Urban Environments using Semantic Segmentation","date":"2024-10-16","arxiv_id":"2410.12988","n_code_links":0,"syntology":null},{"paper":null,"title":"Adapting Segment Anything Model to Melanoma Segmentation in Microscopy Slide Images","date":"2024-10-03","arxiv_id":"2410.02207","n_code_links":0,"syntology":null},{"paper":null,"title":"Semantic Segmentation of Unmanned Aerial Vehicle Remote Sensing Images using SegFormer","date":"2024-10-01","arxiv_id":"2410.01092","n_code_links":0,"syntology":null},{"paper":null,"title":"AMBER -- Advanced SegFormer for Multi-Band Image Segmentation: an application to Hyperspectral Imaging","date":"2024-09-14","arxiv_id":"2409.09386","n_code_links":0,"syntology":null},{"paper":null,"title":"SHARP-Net: A Refined Pyramid Network for Deficiency Segmentation in Culverts and Sewer Pipes","date":"2024-08-02","arxiv_id":"2408.08879","n_code_links":0,"syntology":null},{"paper":"/paper/magicbathynet-a-multimodal-remote-sensing","title":"MagicBathyNet: A Multimodal Remote Sensing Dataset for Bathymetry Prediction and Pixel-based Classification in Shallow Waters","date":"2024-05-24","arxiv_id":"2405.15477","n_code_links":1,"syntology":null},{"paper":"/paper/segformer-efficient-token-merging-strategies","title":"Segformer++: Efficient Token-Merging Strategies for High-Resolution Semantic Segmentation","date":"2024-05-23","arxiv_id":"2405.14467","n_code_links":2,"syntology":null},{"paper":"/paper/wmh-seg-transformer-based-u-net-for-robust","title":"wmh_seg: Transformer based U-Net for Robust and Automatic White Matter Hyperintensity Segmentation across 1.5T, 3T and 7T","date":"2024-02-20","arxiv_id":"2402.12701","n_code_links":1,"syntology":null},{"paper":null,"title":"Kitchen Food Waste Image Segmentation and Classification for Compost Nutrients Estimation","date":"2024-01-26","arxiv_id":"2401.15175","n_code_links":0,"syntology":null},{"paper":"/paper/cabuar-california-burned-areas-dataset-for","title":"CaBuAr: California Burned Areas dataset for delineation","date":"2024-01-21","arxiv_id":"2401.11519","n_code_links":1,"syntology":null},{"paper":"/paper/u-mixformer-unet-like-transformer-with-mix","title":"U-MixFormer: UNet-like Transformer with Mix-Attention for Efficient Semantic Segmentation","date":"2023-12-11","arxiv_id":"2312.06272","n_code_links":1,"syntology":null},{"paper":null,"title":"Enhancing Transformer-Based Segmentation for Breast Cancer Diagnosis using Auto-Augmentation and Search Optimisation Techniques","date":"2023-11-18","arxiv_id":"2311.11065","n_code_links":0,"syntology":null},{"paper":null,"title":"Depth-guided Free-space Segmentation for a Mobile Robot","date":"2023-11-03","arxiv_id":"2311.01966","n_code_links":0,"syntology":null},{"paper":"/paper/minesegsat-an-automated-system-to-evaluate","title":"MineSegSAT: An automated system to evaluate mining disturbed area extents from Sentinel-2 imagery","date":"2023-11-03","arxiv_id":"2311.01676","n_code_links":1,"syntology":null},{"paper":"/paper/robust-burned-area-delineation-through","title":"Robust Burned Area Delineation through Multitask Learning","date":"2023-09-15","arxiv_id":"2309.08368","n_code_links":2,"syntology":null},{"paper":"/paper/dacl10k-benchmark-for-semantic-bridge-damage","title":"dacl10k: Benchmark for Semantic Bridge Damage Segmentation","date":"2023-09-01","arxiv_id":"2309.00460","n_code_links":1,"syntology":null},{"paper":"/paper/fosp-focus-and-separation-network-for-early","title":"FoSp: Focus and Separation Network for Early Smoke Segmentation","date":"2023-06-07","arxiv_id":"2306.04474","n_code_links":1,"syntology":null},{"paper":null,"title":"SAM for Poultry Science","date":"2023-05-17","arxiv_id":"2305.10254","n_code_links":0,"syntology":null},{"paper":"/paper/concurrent-misclassification-and-out-of","title":"Concurrent Misclassification and Out-of-Distribution Detection for Semantic Segmentation via Energy-Based Normalizing Flow","date":"2023-05-16","arxiv_id":"2305.09610","n_code_links":1,"syntology":null},{"paper":null,"title":"Radious: Unveiling the Enigma of Dental Radiology with BEIT Adaptor and Mask2Former in Semantic Segmentation","date":"2023-05-10","arxiv_id":"2305.06236","n_code_links":0,"syntology":null},{"paper":"/paper/implications-of-the-convergence-of-language","title":"Do Vision and Language Models Share Concepts? A Vector Space Alignment Study","date":"2023-02-13","arxiv_id":"2302.06555","n_code_links":1,"syntology":{"ran":0,"of":2,"unverified":2,"pointer_only":0}}],"papers_shown":30,"tasks":[{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":33},{"task":"/task/segmentation","name":"Segmentation","papers":22},{"task":"/task/decoder","name":"Decoder","papers":7},{"task":"/task/autonomous-driving","name":"Autonomous Driving","papers":4},{"task":"/task/image-segmentation","name":"Image Segmentation","papers":4},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":3},{"task":"/task/diversity","name":"Diversity","papers":3},{"task":null,"name":"GPU","papers":3},{"task":"/task/image-classification","name":"Image Classification","papers":3},{"task":"/task/instance-segmentation","name":"Instance Segmentation","papers":3},{"task":"/task/object-detection","name":"Object Detection","papers":3},{"task":"/task/object-detection-1","name":"object-detection","papers":3},{"task":"/task/2d-semantic-segmentation","name":"2D Semantic Segmentation","papers":2},{"task":"/task/burned-area-delineation","name":"Burned Area Delineation","papers":2},{"task":null,"name":"CPU","papers":2},{"task":"/task/change-detection","name":"Change Detection","papers":2},{"task":"/task/disaster-response","name":"Disaster Response","papers":2},{"task":"/task/land-cover-classification","name":"Land Cover Classification","papers":2},{"task":"/task/object","name":"Object","papers":2},{"task":"/task/prediction","name":"Prediction","papers":2}],"tasks_shown":20,"n_tasks":57,"usage_by_year":[{"year":"2021","papers":4},{"year":"2022","papers":10},{"year":"2023","papers":14},{"year":"2024","papers":13},{"year":"2025","papers":6}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/mix-ffn"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}