{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/segnext-rethinking-convolutional-attention","title":"SegNeXt: Rethinking Convolutional Attention Design for Semantic Segmentation","arxiv_id":"2209.08575","date":"2022-09-18","proceeding":null,"authors":["Meng-Hao Guo","Cheng-Ze Lu","Qibin Hou","ZhengNing Liu","Ming-Ming Cheng","Shi-Min Hu"],"abstract":"We present SegNeXt, a simple convolutional network architecture for semantic segmentation. Recent transformer-based models have dominated the field of semantic segmentation due to the efficiency of self-attention in encoding spatial information. In this paper, we show that convolutional attention is a more efficient and effective way to encode contextual information than the self-attention mechanism in transformers. By re-examining the characteristics owned by successful segmentation models, we discover several key components leading to the performance improvement of segmentation models. This motivates us to design a novel convolutional attention network that uses cheap convolutional operations. Without bells and whistles, our SegNeXt significantly improves the performance of previous state-of-the-art methods on popular benchmarks, including ADE20K, Cityscapes, COCO-Stuff, Pascal VOC, Pascal Context, and iSAID. Notably, SegNeXt outperforms EfficientNet-L2 w/ NAS-FPN and achieves 90.6% mIoU on the Pascal VOC 2012 test leaderboard using only 1/10 parameters of it. On average, SegNeXt achieves about 2.0% mIoU improvements compared to the state-of-the-art methods on the ADE20K datasets with the same or fewer computations. Code is available at https://github.com/uyzhang/JSeg (Jittor) and https://github.com/Visual-Attention-Network/SegNeXt (Pytorch).","url_abs":"https://arxiv.org/abs/2209.08575v1","url_pdf":"https://arxiv.org/pdf/2209.08575v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"segnext-rethinking-convolutional-attention","repo_url":"https://github.com/visual-attention-network/segnext","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}},{"paper_slug":"segnext-rethinking-convolutional-attention","repo_url":"https://github.com/open-mmlab/mmsegmentation","is_official":0,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}},{"paper_slug":"segnext-rethinking-convolutional-attention","repo_url":"https://github.com/open-edge-platform/geti","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}},{"paper_slug":"segnext-rethinking-convolutional-attention","repo_url":"https://github.com/Jittor/JSeg","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}},{"paper_slug":"segnext-rethinking-convolutional-attention","repo_url":"https://github.com/open-edge-platform/training_extensions","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}}],"tasks":[{"task_slug":"real-time-semantic-segmentation","task_name":"Real-Time Semantic Segmentation"},{"task_slug":"segmentation","task_name":"Segmentation"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"}],"methods":[{"method_slug":"average-pooling","method_name":"Average Pooling"},{"method_slug":"batch-normalization","method_name":"Batch Normalization"},{"method_slug":"convolution","method_name":"Convolution"},{"method_slug":"global-average-pooling","method_name":"Global Average Pooling"},{"method_slug":"nas-fpn","method_name":"NAS-FPN"},{"method_slug":"relu","method_name":"ReLU"},{"method_slug":"test","method_name":"Test"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/real-time-semantic-segmentation-on-cityscapes-1","task":"Real-Time Semantic Segmentation","dataset":"Cityscapes val","model":"SegNext-T-Seg100","rank_in_archive_order":4,"of":24,"metrics":{"Frame (fps)":"28.1","mIoU":"79.8%"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-ddd17","task":"Semantic Segmentation","dataset":"DDD17","model":"SegNeXt-B","rank_in_archive_order":4,"of":9,"metrics":{"mIoU":"71.46"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-dsec","task":"Semantic Segmentation","dataset":"DSEC","model":"SegNeXt-B","rank_in_archive_order":5,"of":9,"metrics":{"mIoU":"71.55"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-isaid","task":"Semantic Segmentation","dataset":"iSAID","model":"SegNeXt-L","rank_in_archive_order":1,"of":19,"metrics":{"mIoU":"70.3"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-isaid","task":"Semantic Segmentation","dataset":"iSAID","model":"SegNeXt-B","rank_in_archive_order":2,"of":19,"metrics":{"mIoU":"69.9"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-isaid","task":"Semantic Segmentation","dataset":"iSAID","model":"SegNeXt-S","rank_in_archive_order":4,"of":19,"metrics":{"mIoU":"68.8"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-isaid","task":"Semantic Segmentation","dataset":"iSAID","model":"SegNeXt-T","rank_in_archive_order":6,"of":19,"metrics":{"mIoU":"68.3"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2209.08575","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}