{"url":"/method/axial-attention","slug":"axial-attention","name":"Axial Attention","full_name":"Axial Attention","full_name_withheld":false,"description_markdown":"**Axial Attention** is a simple generalization of self-attention that naturally aligns with the multiple dimensions of the tensors in both the encoding and the decoding settings. It was first proposed in [CCNet](https://paperswithcode.com/method/ccnet) [1] named as criss-cross attention, which harvests the contextual information of all the pixels on its criss-cross path. By taking a further recurrent operation, each pixel can finally capture the full-image dependencies. Ho et al [2] extents CCNet to process multi-dimensional data.  The proposed structure of the layers allows for the vast majority of the context to be computed in parallel during decoding without introducing any independence assumptions. It serves as the basic building block for developing self-attention-based autoregressive models for high-dimensional data tensors, e.g., Axial Transformers. It has been applied in [AlphaFold](https://paperswithcode.com/method/alphafold) [3] for interpreting protein sequences.\r\n\r\n[1] Zilong Huang, Xinggang Wang, Lichao Huang, Chang Huang, Yunchao Wei, Wenyu Liu. CCNet: Criss-Cross Attention for Semantic Segmentation. ICCV, 2019.\r\n\r\n[2] Jonathan Ho, Nal Kalchbrenner, Dirk Weissenborn, Tim Salimans. arXiv:1912.12180\r\n\r\n[3] Jumper J, Evans R, Pritzel A, Green T, Figurnov M, Ronneberger O, Tunyasuvunakool K, Bates R, Žídek A, Potapenko A, Bridgland A. Highly accurate protein structure prediction with AlphaFold. Nature. 2021 Jul 15:1-1.","description_state":"present","introduced_year":null,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":"https://arxiv.org/abs/1912.12180v1","title":"Axial Attention in Multidimensional Transformers","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Image Model Blocks","url":"/methods/category/image-model-blocks","pwc_aliases":[]}],"n_papers_tagged":59,"archive_num_papers":null,"papers_newest_first":[{"paper":"/paper/universal-biological-sequence-reranking-for","title":"Universal Biological Sequence Reranking for Improved De Novo Peptide Sequencing","date":"2025-05-23","arxiv_id":"2505.17552","n_code_links":1,"syntology":null},{"paper":"/paper/unet-with-axial-transformer-a-neural-weather","title":"UNet with Axial Transformer : A Neural Weather Model for Precipitation Nowcasting","date":"2025-04-28","arxiv_id":"2504.19408","n_code_links":1,"syntology":null},{"paper":null,"title":"MATEY: multiscale adaptive foundation models for spatiotemporal physical systems","date":"2024-12-29","arxiv_id":"2412.20601","n_code_links":0,"syntology":null},{"paper":null,"title":"Ensemble Learning and 3D Pix2Pix for Comprehensive Brain Tumor Analysis in Multimodal MRI","date":"2024-12-16","arxiv_id":"2412.11849","n_code_links":0,"syntology":null},{"paper":null,"title":"ParseCaps: An Interpretable Parsing Capsule Network for Medical Image Diagnosis","date":"2024-11-03","arxiv_id":"2411.01564","n_code_links":0,"syntology":null},{"paper":null,"title":"Axial Attention Transformer Networks: A New Frontier in Breast Cancer Detection","date":"2024-09-18","arxiv_id":"2409.12347","n_code_links":0,"syntology":null},{"paper":null,"title":"EFCNet: Every Feature Counts for Small Medical Object Segmentation","date":"2024-06-26","arxiv_id":"2406.18201","n_code_links":0,"syntology":null},{"paper":"/paper/progressive-frequency-aware-network-for","title":"Progressive Frequency-Aware Network for Laparoscopic Image Desmoking","date":"2023-12-19","arxiv_id":"2312.12023","n_code_links":1,"syntology":null},{"paper":"/paper/mcanet-medical-image-segmentation-with-multi","title":"MCANet: Medical Image Segmentation with Multi-Scale Cross-Axis Attention","date":"2023-12-14","arxiv_id":"2312.08866","n_code_links":1,"syntology":null},{"paper":"/paper/integrated-image-and-location-analysis-for","title":"Integrated Image and Location Analysis for Wound Classification: A Deep Learning Approach","date":"2023-08-23","arxiv_id":"2308.11877","n_code_links":1,"syntology":null},{"paper":"/paper/scalable-deep-learning-for-rna-secondary","title":"Scalable Deep Learning for RNA Secondary Structure Prediction","date":"2023-07-14","arxiv_id":"2307.10073","n_code_links":1,"syntology":{"ran":6,"of":6,"unverified":0,"pointer_only":0}},{"paper":"/paper/axial-lob-high-frequency-trading-with-axial","title":"Axial-LOB: High-Frequency Trading with Axial Attention","date":"2022-12-04","arxiv_id":"2212.01807","n_code_links":1,"syntology":null},{"paper":"/paper/revisiting-image-pyramid-structure-for-high","title":"Revisiting Image Pyramid Structure for High Resolution Salient Object Detection","date":"2022-09-20","arxiv_id":"2209.09475","n_code_links":3,"syntology":{"ran":3,"of":11,"unverified":8,"pointer_only":0}},{"paper":"/paper/gem-2-next-generation-molecular-property","title":"GEM-2: Next Generation Molecular Property Prediction Network by Modeling Full-range Many-body Interactions","date":"2022-08-11","arxiv_id":"2208.05863","n_code_links":1,"syntology":null},{"paper":null,"title":"CANet: Channel Extending and Axial Attention Catching Network for Multi-structure Kidney Segmentation","date":"2022-08-10","arxiv_id":"2208.05241","n_code_links":0,"syntology":null},{"paper":"/paper/cobevt-cooperative-bird-s-eye-view-semantic","title":"CoBEVT: Cooperative Bird's Eye View Semantic Segmentation with Sparse Transformers","date":"2022-07-05","arxiv_id":"2207.02202","n_code_links":2,"syntology":{"ran":0,"of":3,"unverified":3,"pointer_only":0}},{"paper":null,"title":"DAtRNet: Disentangling Fashion Attribute Embedding for Substitute Item Retrieval","date":"2022-06-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/document-level-relation-extraction-with-4","title":"Document-Level Relation Extraction with Adaptive Focal Loss and Knowledge Distillation","date":"2022-03-21","arxiv_id":"2203.10900","n_code_links":1,"syntology":null},{"paper":"/paper/extending-nn-unet-for-brain-tumor","title":"Extending nn-UNet for brain tumor segmentation","date":"2021-12-09","arxiv_id":"2112.04653","n_code_links":1,"syntology":null},{"paper":null,"title":"Modelling and Analysis of Magnetic Fields from Skeletal Muscle for Valuable Physiological Measurements","date":"2021-04-05","arxiv_id":"2104.02036","n_code_links":0,"syntology":null},{"paper":null,"title":"Physical model simulator-trained neural network for computational 3D phase imaging of multiple-scattering samples","date":"2021-03-29","arxiv_id":"2103.15795","n_code_links":0,"syntology":null},{"paper":null,"title":"Motion Estimation for Optical Coherence Elastography Using Signal Phase and Intensity","date":"2021-03-19","arxiv_id":"2103.10784","n_code_links":0,"syntology":null},{"paper":null,"title":"Missing Cone Artifacts Removal in ODT using Unsupervised Deep Learning in Projection Domain","date":"2021-03-16","arxiv_id":"2103.09022","n_code_links":0,"syntology":null},{"paper":null,"title":"A learning-based view extrapolation method for axial super-resolution","date":"2021-03-11","arxiv_id":"2103.06510","n_code_links":0,"syntology":null},{"paper":null,"title":"Deep learning can differentiate IDH-mutant from IDH-wild type GBM","date":"2021-02-24","arxiv_id":"2102.13205","n_code_links":0,"syntology":null},{"paper":null,"title":"Axial Residual Networks for CycleGAN-based Voice Conversion","date":"2021-02-16","arxiv_id":"2102.08075","n_code_links":0,"syntology":null},{"paper":"/paper/colorization-transformer-1","title":"Colorization Transformer","date":"2021-02-08","arxiv_id":"2102.04432","n_code_links":2,"syntology":null},{"paper":"/paper/caa-channelized-axial-attention-for-semantic","title":"Channelized Axial Attention for Semantic Segmentation -- Considering Channel Relation within Spatial Attention for Semantic Segmentation","date":"2021-01-19","arxiv_id":"2101.07434","n_code_links":1,"syntology":null},{"paper":"/paper/unsupervised-domain-adaptation-from-axial","title":"Unsupervised Domain Adaptation from Axial to Short-Axis Multi-Slice Cardiac MR Images by Incorporating Pretrained Task Networks","date":"2021-01-19","arxiv_id":"2101.07653","n_code_links":1,"syntology":null},{"paper":null,"title":"VideoGen: Generative Modeling of Videos using VQ-VAE and Transformers","date":"2021-01-01","arxiv_id":null,"n_code_links":0,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/segmentation","name":"Segmentation","papers":11},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":7},{"task":"/task/deep-learning","name":"Deep Learning","papers":5},{"task":null,"name":"Generative Adversarial Network","papers":4},{"task":"/task/image-segmentation","name":"Image Segmentation","papers":4},{"task":"/task/computational-efficiency","name":"Computational Efficiency","papers":3},{"task":"/task/decoder","name":"Decoder","papers":3},{"task":"/task/image-classification","name":"Image Classification","papers":3},{"task":"/task/medical-image-segmentation","name":"Medical Image Segmentation","papers":3},{"task":"/task/object-detection","name":"Object Detection","papers":3},{"task":"/task/ssim","name":"SSIM","papers":3},{"task":"/task/tumor-segmentation","name":"Tumor Segmentation","papers":3},{"task":"/task/image-classification","name":"image-classification","papers":3},{"task":"/task/3d-object-detection","name":"3D Object Detection","papers":2},{"task":"/task/brain-tumor-segmentation","name":"Brain Tumor Segmentation","papers":2},{"task":"/task/diagnostic","name":"Diagnostic","papers":2},{"task":"/task/image-reconstruction","name":"Image Reconstruction","papers":2},{"task":"/task/motion-estimation","name":"Motion Estimation","papers":2},{"task":null,"name":"Position","papers":2},{"task":null,"name":"Relation","papers":2}],"tasks_shown":20,"n_tasks":91,"usage_by_year":[{"year":"2019","papers":2},{"year":"2020","papers":27},{"year":"2021","papers":12},{"year":"2022","papers":7},{"year":"2023","papers":4},{"year":"2024","papers":5},{"year":"2025","papers":2}],"row_source":"embedded","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/axial-attention"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}