{"url":"/method/swin-transformer","slug":"swin-transformer","name":"Swin Transformer","full_name":"Swin Transformer","full_name_withheld":false,"description_markdown":"The **Swin Transformer** is a type of [Vision Transformer](https://paperswithcode.com/method/vision-transformer). It builds hierarchical feature maps by merging image patches (shown in gray) in deeper layers and has linear computation complexity to input image size due to computation of self-attention only within each local window (shown in red). It can thus serve as a general-purpose backbone for both image classification and dense recognition tasks. In contrast, previous vision Transformers produce feature maps of a single low resolution and have quadratic computation complexity to input image size due to computation of self-attention globally.","description_state":"present","introduced_year":null,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":"https://arxiv.org/abs/2103.14030v2","title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/microsoft/Swin-Transformer/blob/2622619f70760b60a42b996f5fcbe7c9d2e7ca57/models/swin_transformer.py#L458","code_snippet_url_on_a_code_host":true,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Vision Transformers","url":"/methods/category/vision-transformers","pwc_aliases":["vision-transformer"]}],"n_papers_tagged":416,"archive_num_papers":null,"papers_newest_first":[{"paper":"/paper/2506-08357","title":"MD-ViSCo: A Unified Model for Multi-Directional Vital Sign Waveform Conversion","date":"2025-06-10","arxiv_id":"2506.08357","n_code_links":1,"syntology":null},{"paper":null,"title":"MedMoE: Modality-Specialized Mixture of Experts for Medical Vision-Language Understanding","date":"2025-06-10","arxiv_id":"2506.08356","n_code_links":0,"syntology":null},{"paper":null,"title":"Multi-modal brain MRI synthesis based on SwinUNETR","date":"2025-06-03","arxiv_id":"2506.02467","n_code_links":0,"syntology":null},{"paper":"/paper/deep-modeling-and-optimization-of-medical","title":"Deep Modeling and Optimization of Medical Image Classification","date":"2025-05-29","arxiv_id":"2505.23040","n_code_links":1,"syntology":null},{"paper":"/paper/agrifm-a-multi-source-temporal-remote-sensing","title":"AgriFM: A Multi-source Temporal Remote Sensing Foundation Model for Crop Mapping","date":"2025-05-27","arxiv_id":"2505.21357","n_code_links":1,"syntology":null},{"paper":null,"title":"Structured Initialization for Vision Transformers","date":"2025-05-26","arxiv_id":"2505.19985","n_code_links":0,"syntology":null},{"paper":null,"title":"Explainable Anatomy-Guided AI for Prostate MRI: Foundation Models and In Silico Clinical Trials for Virtual Biopsy-based Risk Assessment","date":"2025-05-23","arxiv_id":"2505.17971","n_code_links":0,"syntology":null},{"paper":null,"title":"Fusion of Foundation and Vision Transformer Model Features for Dermatoscopic Image Classification","date":"2025-05-22","arxiv_id":"2505.16338","n_code_links":0,"syntology":null},{"paper":null,"title":"Swin Transformer for Robust CGI Images Detection: Intra- and Inter-Dataset Analysis across Multiple Color Spaces","date":"2025-05-22","arxiv_id":"2505.16253","n_code_links":0,"syntology":null},{"paper":null,"title":"Multi-Channel Swin Transformer Framework for Bearing Remaining Useful Life Prediction","date":"2025-05-20","arxiv_id":"2505.14897","n_code_links":0,"syntology":null},{"paper":null,"title":"CheX-DS: Improving Chest X-ray Image Classification with Ensemble Learning Based on DenseNet and Swin Transformer","date":"2025-05-16","arxiv_id":"2505.11168","n_code_links":0,"syntology":null},{"paper":null,"title":"A Deep Learning-Driven Inhalation Injury Grading Assistant Using Bronchoscopy Images","date":"2025-05-13","arxiv_id":"2505.08517","n_code_links":0,"syntology":null},{"paper":null,"title":"Technical Report for ICRA 2025 GOOSE 2D Semantic Segmentation Challenge: Leveraging Color Shift Correction, RoPE-Swin Backbone, and Quantile-based Label Denoising Strategy for Robust Outdoor Scene Understanding","date":"2025-05-11","arxiv_id":"2505.06991","n_code_links":0,"syntology":null},{"paper":"/paper/dfen-dual-feature-equalization-network-for","title":"DFEN: Dual Feature Equalization Network for Medical Image Segmentation","date":"2025-05-09","arxiv_id":"2505.05913","n_code_links":1,"syntology":null},{"paper":null,"title":"Balancing Accuracy, Calibration, and Efficiency in Active Learning with Vision Transformers Under Label Noise","date":"2025-05-07","arxiv_id":"2505.04375","n_code_links":0,"syntology":null},{"paper":null,"title":"SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer","date":"2025-05-07","arxiv_id":"2505.04394","n_code_links":0,"syntology":null},{"paper":null,"title":"Enhancing DR Classification with Swin Transformer and Shifted Window Attention","date":"2025-04-20","arxiv_id":"2504.15317","n_code_links":0,"syntology":null},{"paper":null,"title":"SatelliteCalculator: A Multi-Task Vision Foundation Model for Quantitative Remote Sensing Inversion","date":"2025-04-18","arxiv_id":"2504.13442","n_code_links":0,"syntology":null},{"paper":"/paper/towards-accurate-and-interpretable","title":"Towards Accurate and Interpretable Neuroblastoma Diagnosis via Contrastive Multi-scale Pathological Image Analysis","date":"2025-04-18","arxiv_id":"2504.13754","n_code_links":1,"syntology":null},{"paper":"/paper/deep-learning-based-bathymetry-retrieval","title":"Deep Learning-based Bathymetry Retrieval without In-situ Depths using Remote Sensing Imagery and SfM-MVS DSMs with Data Gaps","date":"2025-04-15","arxiv_id":"2504.11416","n_code_links":1,"syntology":null},{"paper":"/paper/foundation-models-for-seismic-data-processing","title":"Foundation Models For Seismic Data Processing: An Extensive Review","date":"2025-03-31","arxiv_id":"2503.24166","n_code_links":1,"syntology":null},{"paper":null,"title":"Camera Model Identification with SPAIR-Swin and Entropy based Non-Homogeneous Patches","date":"2025-03-28","arxiv_id":"2503.22120","n_code_links":0,"syntology":null},{"paper":null,"title":"Context-Aware Semantic Segmentation: Enhancing Pixel-Level Understanding with Large Language Models for Advanced Vision Applications","date":"2025-03-25","arxiv_id":"2503.19276","n_code_links":0,"syntology":null},{"paper":"/paper/inatag-multi-class-classification-models","title":"iNatAg: Multi-Class Classification Models Enabled by a Large-Scale Benchmark Dataset with 4.7M Images of 2,959 Crop and Weed Species","date":"2025-03-25","arxiv_id":"2503.20068","n_code_links":1,"syntology":null},{"paper":"/paper/binarized-mamba-transformer-for-lightweight","title":"Binarized Mamba-Transformer for Lightweight Quad Bayer HybridEVS Demosaicing","date":"2025-03-20","arxiv_id":"2503.16134","n_code_links":1,"syntology":null},{"paper":null,"title":"Alzheimer's Disease Classification Using Retinal OCT: TransnetOCT and Swin Transformer Models","date":"2025-03-14","arxiv_id":"2503.11511","n_code_links":0,"syntology":null},{"paper":null,"title":"Finding the Muses: Identifying Coresets through Loss Trajectories","date":"2025-03-12","arxiv_id":"2503.09721","n_code_links":0,"syntology":null},{"paper":null,"title":"QUIET-SR: Quantum Image Enhancement Transformer for Single Image Super-Resolution","date":"2025-03-11","arxiv_id":"2503.08759","n_code_links":0,"syntology":null},{"paper":null,"title":"Fish2Mesh Transformer: 3D Human Mesh Recovery from Egocentric Vision","date":"2025-03-08","arxiv_id":"2503.06089","n_code_links":0,"syntology":null},{"paper":"/paper/scalefusionnet-transformer-guided-multi-scale","title":"ScaleFusionNet: Transformer-Guided Multi-Scale Feature Fusion for Skin Lesion Segmentation","date":"2025-03-05","arxiv_id":"2503.03327","n_code_links":1,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":91},{"task":"/task/image-classification","name":"Image Classification","papers":55},{"task":"/task/object-detection","name":"Object Detection","papers":50},{"task":"/task/decoder","name":"Decoder","papers":47},{"task":"/task/segmentation","name":"Segmentation","papers":47},{"task":"/task/image-classification","name":"image-classification","papers":39},{"task":"/task/object-detection-1","name":"object-detection","papers":35},{"task":"/task/image-segmentation","name":"Image Segmentation","papers":29},{"task":"/task/instance-segmentation","name":"Instance Segmentation","papers":25},{"task":"/task/super-resolution","name":"Super-Resolution","papers":23},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":23},{"task":"/task/medical-image-segmentation","name":"Medical Image Segmentation","papers":22},{"task":"/task/classification-1","name":"Classification","papers":21},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":20},{"task":"/task/object","name":"Object","papers":19},{"task":"/task/diagnostic","name":"Diagnostic","papers":15},{"task":"/task/denoising","name":"Denoising","papers":13},{"task":"/task/image-super-resolution","name":"Image Super-Resolution","papers":13},{"task":null,"name":"GPU","papers":12},{"task":"/task/image-restoration","name":"Image Restoration","papers":12}],"tasks_shown":20,"n_tasks":353,"usage_by_year":[{"year":"2021","papers":45},{"year":"2022","papers":107},{"year":"2023","papers":109},{"year":"2024","papers":106},{"year":"2025","papers":49}],"row_source":"embedded","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/swin-transformer"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}