{"url":"/method/metaformer","slug":"metaformer","name":"MetaFormer","full_name":"MetaFormer","full_name_withheld":false,"description_markdown":"MetaFormer is a general architecture abstracted from Transformers by not specifying the token mixer.","description_state":"present","introduced_year":null,"introduced_by":{"title":"MetaFormer Is Actually What You Need for Vision","paper":"/paper/metaformer-is-actually-what-you-need-for","first_author":"Weihao Yu","n_authors":8,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/metaformer-is-actually-what-you-need-for"},"source":{"url":"https://arxiv.org/abs/2111.11418v3","title":"MetaFormer Is Actually What You Need for Vision","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Image Models","url":"/methods/category/image-models","pwc_aliases":[]}],"n_papers_tagged":20,"archive_num_papers":20,"papers_newest_first":[{"paper":null,"title":"EMF: Event Meta Formers for Event-based Real-time Traffic Object Detection","date":"2025-04-05","arxiv_id":"2504.04124","n_code_links":0,"syntology":null},{"paper":"/paper/foundation-models-for-seismic-data-processing","title":"Foundation Models For Seismic Data Processing: An Extensive Review","date":"2025-03-31","arxiv_id":"2503.24166","n_code_links":1,"syntology":null},{"paper":null,"title":"SDTrack: A Baseline for Event-based Tracking via Spiking Neural Networks","date":"2025-03-09","arxiv_id":"2503.08703","n_code_links":0,"syntology":null},{"paper":null,"title":"Static Key Attention in Vision","date":"2024-12-09","arxiv_id":"2412.07049","n_code_links":0,"syntology":null},{"paper":null,"title":"Aberration Correcting Vision Transformers for High-Fidelity Metalens Imaging","date":"2024-12-05","arxiv_id":"2412.04591","n_code_links":0,"syntology":null},{"paper":null,"title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","date":"2024-11-28","arxiv_id":"2411.18995","n_code_links":0,"syntology":null},{"paper":"/paper/metaformer-and-cnn-hybrid-model-for-polyp","title":"MetaFormer and CNN Hybrid Model for Polyp Image Segmentation","date":"2024-09-16","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/metaseg-metaformer-based-global-contexts","title":"MetaSeg: MetaFormer-based Global Contexts-aware Network for Efficient Semantic Segmentation","date":"2024-08-14","arxiv_id":"2408.07576","n_code_links":1,"syntology":null},{"paper":null,"title":"ParFormer: A Vision Transformer with Parallel Mixer and Sparse Channel Attention Patch Embedding","date":"2024-03-22","arxiv_id":"2403.15004","n_code_links":0,"syntology":null},{"paper":"/paper/hyenapixel-global-image-context-with","title":"HyenaPixel: Global Image Context with Convolutions","date":"2024-02-29","arxiv_id":"2402.19305","n_code_links":1,"syntology":null},{"paper":null,"title":"Decision ConvFormer: Local Filtering in MetaFormer is Sufficient for Decision Making","date":"2023-10-04","arxiv_id":"2310.03022","n_code_links":0,"syntology":null},{"paper":"/paper/spanet-frequency-balancing-token-mixer-using","title":"SPANet: Frequency-balancing Token Mixer using Spectral Pooling Aggregation Modulation","date":"2023-08-22","arxiv_id":"2308.11568","n_code_links":1,"syntology":null},{"paper":"/paper/pretraining-is-all-you-need-a-multi-atlas","title":"Pretraining is All You Need: A Multi-Atlas Enhanced Transformer Framework for Autism Spectrum Disorder Classification","date":"2023-07-04","arxiv_id":"2307.01759","n_code_links":1,"syntology":null},{"paper":null,"title":"M^2UNet: MetaFormer Multi-scale Upsampling Network for Polyp Segmentation","date":"2023-06-14","arxiv_id":"2306.08600","n_code_links":0,"syntology":null},{"paper":"/paper/a-mask-free-neural-network-for-monaural","title":"A Mask Free Neural Network for Monaural Speech Enhancement","date":"2023-06-07","arxiv_id":"2306.04286","n_code_links":2,"syntology":{"ran":2,"of":2,"unverified":0,"pointer_only":2}},{"paper":null,"title":"DeformableFormer: Classification of Endoscopic Ultrasound Guided Fine Needle Biopsy in Pancreatic Diseases","date":"2023-04-21","arxiv_id":"2304.10791","n_code_links":0,"syntology":null},{"paper":"/paper/fft-based-dynamic-token-mixer-for-vision","title":"FFT-based Dynamic Token Mixer for Vision","date":"2023-03-07","arxiv_id":"2303.03932","n_code_links":1,"syntology":null},{"paper":"/paper/metaformer-baselines-for-vision","title":"MetaFormer Baselines for Vision","date":"2022-10-24","arxiv_id":"2210.13452","n_code_links":8,"syntology":{"ran":0,"of":4,"unverified":4,"pointer_only":0}},{"paper":"/paper/metaformer-a-unified-meta-framework-for-fine","title":"MetaFormer: A Unified Meta Framework for Fine-Grained Recognition","date":"2022-03-05","arxiv_id":"2203.02751","n_code_links":2,"syntology":{"ran":1,"of":14,"unverified":13,"pointer_only":0}},{"paper":"/paper/metaformer-is-actually-what-you-need-for","title":"MetaFormer Is Actually What You Need for Vision","date":"2021-11-22","arxiv_id":"2111.11418","n_code_links":18,"syntology":{"ran":2,"of":3,"unverified":1,"pointer_only":0}}],"papers_shown":20,"tasks":[{"task":"/task/image-classification","name":"Image Classification","papers":8},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":8},{"task":"/task/object-detection","name":"Object Detection","papers":6},{"task":"/task/object-detection-1","name":"object-detection","papers":4},{"task":"/task/image-segmentation","name":"Image Segmentation","papers":3},{"task":"/task/medical-image-segmentation","name":"Medical Image Segmentation","papers":3},{"task":"/task/image-classification","name":"image-classification","papers":3},{"task":"/task/decoder","name":"Decoder","papers":2},{"task":"/task/segmentation","name":"Segmentation","papers":2},{"task":"/task/specificity","name":"Specificity","papers":2},{"task":"/task/3d-reconstruction","name":"3D Reconstruction","papers":1},{"task":"/task/all","name":"All","papers":1},{"task":"/task/attribute","name":"Attribute","papers":1},{"task":"/task/autonomous-driving","name":"Autonomous Driving","papers":1},{"task":"/task/benchmarking","name":"Benchmarking","papers":1},{"task":"/task/computational-efficiency","name":"Computational Efficiency","papers":1},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":1},{"task":"/task/decision-making","name":"Decision Making","papers":1},{"task":"/task/denoising","name":"Denoising","papers":1},{"task":"/task/domain-generalization","name":"Domain Generalization","papers":1}],"tasks_shown":20,"n_tasks":31,"usage_by_year":[{"year":"2021","papers":1},{"year":"2022","papers":2},{"year":"2023","papers":7},{"year":"2024","papers":7},{"year":"2025","papers":3}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/metaformer"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}