{"url":"/sota/semantic-segmentation-on-ade20k-val","task":{"name":"Semantic Segmentation","url":"/task/semantic-segmentation","note":null},"dataset":{"name":"ADE20K val","url":"/dataset/ade20k"},"category":"Computer Vision","categories":["Computer Code","Computer Vision","Medical","Robots"],"category_note":null,"description":null,"description_from":null,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["mIoU","Pixel Accuracy"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"mIoU":null,"Pixel Accuracy":"higher"}},"counts":{"rows":95,"rows_with_code":86,"rows_with_paper_page":94,"rows_dated":94,"rows_using_additional_data":6},"rows":[{"rank_in_archive_order":1,"model":"BEiT-3","metrics":{"mIoU":"62.8"},"uses_additional_data":true,"paper_date":"2022-08-22","paper":"/paper/image-as-a-foreign-language-beit-pretraining","paper_url":"https://arxiv.org/abs/2208.10442v2","paper_title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","code":"https://github.com/microsoft/unilm/tree/master/beit","n_code_links":2,"syntology":null},{"rank_in_archive_order":2,"model":"ViT-CoMer","metrics":{"mIoU":"62.1"},"uses_additional_data":false,"paper_date":"2024-03-13","paper":"/paper/vit-comer-vision-transformer-with","paper_url":"https://openreview.net/forum?id=srPMwpkWbR&invitationId=thecvf.com/CVPR/2024/Conference/Submission1221/-/Camera_Ready_Revision&referrer=%5BAuthor%20Console%5D(%2Fgroup%3Fid%3Dthecvf.com%2FCVPR%2F2024%2FConference%2FAuthors%23author-tasks)","paper_title":"ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions","code":"https://github.com/Traffic-X/ViT-CoMer","n_code_links":2,"syntology":null},{"rank_in_archive_order":3,"model":"EVA","metrics":{"mIoU":"61.5"},"uses_additional_data":false,"paper_date":"2022-11-14","paper":"/paper/eva-exploring-the-limits-of-masked-visual","paper_url":"https://arxiv.org/abs/2211.07636v2","paper_title":"EVA: Exploring the Limits of Masked Visual Representation Learning at Scale","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"FD-SwinV2-G","metrics":{"mIoU":"61.4"},"uses_additional_data":true,"paper_date":"2022-05-27","paper":"/paper/contrastive-learning-rivals-masked-image","paper_url":"https://arxiv.org/abs/2205.14141v3","paper_title":"Contrastive Learning Rivals Masked Image Modeling in Fine-tuning via Feature Distillation","code":"https://github.com/SwinTransformer/Feature-Distillation","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":5,"model":"MaskDINO-SwinL","metrics":{"mIoU":"60.8"},"uses_additional_data":true,"paper_date":"2022-06-06","paper":"/paper/mask-dino-towards-a-unified-transformer-based-1","paper_url":"https://arxiv.org/abs/2206.02777v3","paper_title":"Mask DINO: Towards A Unified Transformer-based Framework for Object Detection and Segmentation","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":10,"syntology":{"n_ran":11,"n_unverified":2,"n_samples":13,"n_pointer_only_licence":13}},{"rank_in_archive_order":6,"model":"OneFormer (InternImage-H, emb_dim=256, multi-scale, 896x896)","metrics":{"mIoU":"60.8"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/oneformer-one-transformer-to-rule-universal","paper_url":"https://arxiv.org/abs/2211.06220v2","paper_title":"OneFormer: One Transformer to Rule Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"ViT-Adapter-L (Mask2Former, BEiT pretrain)","metrics":{"mIoU":"60.5"},"uses_additional_data":true,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":8,"model":"SERNet-Former_v2","metrics":{"mIoU":"59.35"},"uses_additional_data":true,"paper_date":"2024-01-28","paper":"/paper/sernet-former-semantic-segmentation-by","paper_url":"https://arxiv.org/abs/2401.15741v7","paper_title":"SERNet-Former: Semantic Segmentation by Efficient Residual Network with Attention-Boosting Gates and Attention-Fusion Networks","code":"https://github.com/serdarch/sernet-former","n_code_links":2,"syntology":null},{"rank_in_archive_order":9,"model":"OneFormer (DiNAT-L, multi-scale, 896x896)","metrics":{"mIoU":"58.6"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/oneformer-one-transformer-to-rule-universal","paper_url":"https://arxiv.org/abs/2211.06220v2","paper_title":"OneFormer: One Transformer to Rule Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"ViT-Adapter-L (UperNet, BEiT pretrain)","metrics":{"mIoU":"58.4"},"uses_additional_data":true,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":11,"model":"OneFormer (DiNAT-L, multi-scale, 640x640)","metrics":{"mIoU":"58.4"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/oneformer-one-transformer-to-rule-universal","paper_url":"https://arxiv.org/abs/2211.06220v2","paper_title":"OneFormer: One Transformer to Rule Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":12,"model":"RSSeg-ViT-L(BEiT pretrain)","metrics":{"mIoU":"58.4"},"uses_additional_data":false,"paper_date":"2022-12-28","paper":"/paper/representation-separation-for-semantic","paper_url":"https://arxiv.org/abs/2212.13764v1","paper_title":"Representation Separation for Semantic Segmentation with Vision Transformers","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":13,"model":"EoMT (DINOv2-L, single-scale, 512x512)","metrics":{"mIoU":"58.4"},"uses_additional_data":false,"paper_date":"2025-03-24","paper":"/paper/your-vit-is-secretly-an-image-segmentation-1","paper_url":"https://arxiv.org/abs/2503.19108v1","paper_title":"Your ViT is Secretly an Image Segmentation Model","code":"https://github.com/tue-mps/eomt","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":14,"model":"OneFormer (Swin-L, multi-scale, 896x896)","metrics":{"mIoU":"58.3"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/oneformer-one-transformer-to-rule-universal","paper_url":"https://arxiv.org/abs/2211.06220v2","paper_title":"OneFormer: One Transformer to Rule Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":15,"model":"SeMask (SeMask Swin-L FaPN-Mask2Former)","metrics":{"mIoU":"58.2"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":16,"model":"SeMask (SeMask Swin-L MSFaPN-Mask2Former)","metrics":{"mIoU":"58.2"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"DiNAT-L (Mask2Former)","metrics":{"mIoU":"58.1"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":18,"model":"Mask2Former (Swin-L-FaPN, multiscale)","metrics":{"mIoU":"57.7"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/masked-attention-mask-transformer-for","paper_url":"https://arxiv.org/abs/2112.01527v3","paper_title":"Masked-attention Mask Transformer for Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"OneFormer (Swin-L, multi-scale, 640x640)","metrics":{"mIoU":"57.7"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/oneformer-one-transformer-to-rule-universal","paper_url":"https://arxiv.org/abs/2211.06220v2","paper_title":"OneFormer: One Transformer to Rule Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":20,"model":"SeMask (SeMask Swin-L Mask2Former)","metrics":{"mIoU":"57.5"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":21,"model":"SenFormer (BEiT-L)","metrics":{"mIoU":"57.1"},"uses_additional_data":false,"paper_date":"2021-11-26","paper":"/paper/efficient-self-ensemble-framework-for-1","paper_url":"https://arxiv.org/abs/2111.13280v2","paper_title":"Efficient Self-Ensemble for Semantic Segmentation","code":"https://github.com/WalBouss/SenFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":22,"model":"BEiT-L (ViT+UperNet, ImageNet-22k pretrain)","metrics":{"mIoU":"57.0"},"uses_additional_data":false,"paper_date":"2021-06-15","paper":"/paper/beit-bert-pre-training-of-image-transformers","paper_url":"https://arxiv.org/abs/2106.08254v2","paper_title":"BEiT: BERT Pre-Training of Image Transformers","code":"https://github.com/huggingface/transformers","n_code_links":14,"syntology":{"n_ran":6,"n_unverified":5,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":23,"model":"SeMask (SeMask Swin-L MSFaPN-Mask2Former, single-scale)","metrics":{"mIoU":"57.0"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":24,"model":"FaPN (MaskFormer, Swin-L, ImageNet-22k pretrain)","metrics":{"mIoU":"56.7"},"uses_additional_data":false,"paper_date":"2021-08-16","paper":"/paper/fapn-feature-aligned-pyramid-network-for","paper_url":"https://arxiv.org/abs/2108.07058v2","paper_title":"FaPN: Feature-aligned Pyramid Network for Dense Image Prediction","code":"https://github.com/sithu31296/semantic-segmentation","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":25,"model":"Mask2Former (Swin-L-FaPN)","metrics":{"mIoU":"56.4"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/masked-attention-mask-transformer-for","paper_url":"https://arxiv.org/abs/2112.01527v3","paper_title":"Masked-attention Mask Transformer for Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":26,"model":"SeMask (SeMask Swin-L MaskFormer)","metrics":{"mIoU":"56.2"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":27,"model":"CSWin-L (UperNet, ImageNet-22k pretrain)","metrics":{"mIoU":"55.7"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/cswin-transformer-a-general-vision","paper_url":"https://arxiv.org/abs/2107.00652v3","paper_title":"CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":28,"model":"MaskFormer (Swin-L, ImageNet-22k pretrain)","metrics":{"mIoU":"55.6"},"uses_additional_data":false,"paper_date":"2021-07-13","paper":"/paper/per-pixel-classification-is-not-all-you-need","paper_url":"https://arxiv.org/abs/2107.06278v2","paper_title":"Per-Pixel Classification is Not All You Need for Semantic Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":3,"syntology":null},{"rank_in_archive_order":29,"model":"DeiT-L","metrics":{"mIoU":"55.6"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/deit-iii-revenge-of-the-vit","paper_url":"https://arxiv.org/abs/2204.07118v1","paper_title":"DeiT III: Revenge of the ViT","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":null},{"rank_in_archive_order":30,"model":"Focal-L (UperNet, ImageNet-22k pretrain)","metrics":{"mIoU":"55.4"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/focal-self-attention-for-local-global","paper_url":"https://arxiv.org/abs/2107.00641v1","paper_title":"Focal Self-attention for Local-Global Interactions in Vision Transformers","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification/Focal_Transformer","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":31,"model":"SegViT ViT-Large","metrics":{"mIoU":"55.2"},"uses_additional_data":false,"paper_date":"2022-10-12","paper":"/paper/segvit-semantic-segmentation-with-plain","paper_url":"https://arxiv.org/abs/2210.05844v2","paper_title":"SegViT: Semantic Segmentation with Plain Vision Transformers","code":"https://github.com/zbwxp/SegVit","n_code_links":1,"syntology":null},{"rank_in_archive_order":32,"model":"PatchDiverse + Swin-L (multi-scale test, upernet, ImageNet22k pretrain)","metrics":{"mIoU":"54.4%"},"uses_additional_data":false,"paper_date":"2021-04-26","paper":"/paper/improve-vision-transformers-training-by","paper_url":"https://arxiv.org/abs/2104.12753v3","paper_title":"Vision Transformers with Patch Diversification","code":"https://github.com/ChengyueGongR/PatchVisionTransformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":33,"model":"K-Net","metrics":{"mIoU":"54.3"},"uses_additional_data":false,"paper_date":"2021-06-28","paper":"/paper/k-net-towards-unified-image-segmentation","paper_url":"https://arxiv.org/abs/2106.14855v2","paper_title":"K-Net: Towards Unified Image Segmentation","code":"https://github.com/zwwwayne/k-net","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":34,"model":"DEPICT-SA (ViT-L 640x640 multi-scale)","metrics":{"mIoU":"54.3"},"uses_additional_data":false,"paper_date":"2024-11-05","paper":"/paper/rethinking-decoders-for-transformer-based","paper_url":"https://arxiv.org/abs/2411.03033v3","paper_title":"Rethinking Decoders for Transformer-based Semantic Segmentation: A Compression Perspective","code":"https://github.com/qishuaiwen/depict","n_code_links":1,"syntology":null},{"rank_in_archive_order":35,"model":"SenFormer (Swin-L)","metrics":{"mIoU":"54.2"},"uses_additional_data":false,"paper_date":"2021-11-26","paper":"/paper/efficient-self-ensemble-framework-for-1","paper_url":"https://arxiv.org/abs/2111.13280v2","paper_title":"Efficient Self-Ensemble for Semantic Segmentation","code":"https://github.com/WalBouss/SenFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":36,"model":"DeiT-B","metrics":{"mIoU":"54.1"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/deit-iii-revenge-of-the-vit","paper_url":"https://arxiv.org/abs/2204.07118v1","paper_title":"DeiT III: Revenge of the ViT","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":null},{"rank_in_archive_order":37,"model":"MixMIM-L","metrics":{"mIoU":"53.8"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/mixmim-mixed-and-masked-image-modeling-for","paper_url":"https://arxiv.org/abs/2205.13137v4","paper_title":"MixMAE: Mixed and Masked Autoencoder for Efficient Pretraining of Hierarchical Vision Transformers","code":"https://github.com/sense-x/mixmim","n_code_links":1,"syntology":null},{"rank_in_archive_order":38,"model":"Seg-L-Mask/16 (MS, ViT-L)","metrics":{"mIoU":"53.63"},"uses_additional_data":false,"paper_date":"2021-05-12","paper":"/paper/segmenter-transformer-for-semantic","paper_url":"https://arxiv.org/abs/2105.05633v3","paper_title":"Segmenter: Transformer for Semantic Segmentation","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":39,"model":"Swin-L (UperNet, ImageNet-22k pretrain)","metrics":{"mIoU":"53.5"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":40,"model":"SeMask (SeMask Swin-L FPN)","metrics":{"mIoU":"53.5"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":41,"model":"PatchConvNet-L120 (UperNet)","metrics":{"mIoU":"52.9"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":42,"model":"DEPICT-SA (ViT-L 640x640 single-scale)","metrics":{"mIoU":"52.9"},"uses_additional_data":false,"paper_date":"2024-11-05","paper":"/paper/rethinking-decoders-for-transformer-based","paper_url":"https://arxiv.org/abs/2411.03033v3","paper_title":"Rethinking Decoders for Transformer-based Semantic Segmentation: A Compression Perspective","code":"https://github.com/qishuaiwen/depict","n_code_links":1,"syntology":null},{"rank_in_archive_order":43,"model":"PatchConvNet-B120 (UperNet)","metrics":{"mIoU":"52.8"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":44,"model":"SegFormer-B5(MS, 87M #Params, ImageNet-1K pretrain)","metrics":{"mIoU":"51.8"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/segformer-simple-and-efficient-design-for","paper_url":"https://arxiv.org/abs/2105.15203v3","paper_title":"SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers","code":"https://github.com/huggingface/transformers","n_code_links":28,"syntology":{"n_ran":48,"n_unverified":38,"n_samples":86,"n_pointer_only_licence":15}},{"rank_in_archive_order":45,"model":"Light-Ham (VAN-Huge, 61M, IN-1k, MS)","metrics":{"mIoU":"51.5"},"uses_additional_data":false,"paper_date":"2021-09-09","paper":"/paper/is-attention-better-than-matrix-decomposition-1","paper_url":"https://arxiv.org/abs/2109.04553v2","paper_title":"Is Attention Better Than Matrix Decomposition?","code":"https://github.com/Gsunshine/Enjoy-Hamburger","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":46,"model":"CrossFormer (ImageNet1k-pretrain, UPerNet, multi-scale test)","metrics":{"Pixel Accuracy":"84.0%","mIoU":"51.4%"},"uses_additional_data":false,"paper_date":"2021-07-31","paper":"/paper/crossformer-a-versatile-vision-transformer","paper_url":"https://arxiv.org/abs/2108.00154v2","paper_title":"CrossFormer: A Versatile Vision Transformer Hinging on Cross-scale Attention","code":"https://github.com/cheerss/CrossFormer","n_code_links":4,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":47,"model":"PatchConvNet-B60 (UperNet)","metrics":{"mIoU":"51.1"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":48,"model":"Light-Ham (VAN-Large, 46M, IN-1k, MS)","metrics":{"mIoU":"51.0"},"uses_additional_data":false,"paper_date":"2021-09-09","paper":"/paper/is-attention-better-than-matrix-decomposition-1","paper_url":"https://arxiv.org/abs/2109.04553v2","paper_title":"Is Attention Better Than Matrix Decomposition?","code":"https://github.com/Gsunshine/Enjoy-Hamburger","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":49,"model":"UperNet Shuffle-B","metrics":{"mIoU":"50.5"},"uses_additional_data":false,"paper_date":"2021-06-07","paper":"/paper/shuffle-transformer-rethinking-spatial","paper_url":"https://arxiv.org/abs/2106.03650v1","paper_title":"Shuffle Transformer: Rethinking Spatial Shuffle for Vision Transformer","code":"https://github.com/alibaba/EasyCV","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":7,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":50,"model":"ELSA-Swin-S","metrics":{"mIoU":"50.3"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/elsa-enhanced-local-self-attention-for-vision","paper_url":"https://arxiv.org/abs/2112.12786v1","paper_title":"ELSA: Enhanced Local Self-Attention for Vision Transformer","code":"https://github.com/damo-cv/elsa","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":51,"model":"MixMIM-B","metrics":{"mIoU":"50.3"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/mixmim-mixed-and-masked-image-modeling-for","paper_url":"https://arxiv.org/abs/2205.13137v4","paper_title":"MixMAE: Mixed and Masked Autoencoder for Efficient Pretraining of Hierarchical Vision Transformers","code":"https://github.com/sense-x/mixmim","n_code_links":1,"syntology":null},{"rank_in_archive_order":52,"model":"Twins-SVT-L (UperNet, ImageNet-1k pretrain)","metrics":{"mIoU":"50.2"},"uses_additional_data":false,"paper_date":"2021-04-28","paper":"/paper/twins-revisiting-spatial-attention-design-in","paper_url":"https://arxiv.org/abs/2104.13840v4","paper_title":"Twins: Revisiting the Design of Spatial Attention in Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":53,"model":"Seg-B-Mask/16 (MS, ViT-B)","metrics":{"mIoU":"50.0"},"uses_additional_data":false,"paper_date":"2021-05-12","paper":"/paper/segmenter-transformer-for-semantic","paper_url":"https://arxiv.org/abs/2105.05633v3","paper_title":"Segmenter: Transformer for Semantic Segmentation","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":54,"model":"Swin-B (UperNet, ImageNet-1k pretrain)","metrics":{"mIoU":"49.7"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":55,"model":"gSwin-S","metrics":{"Pixel Accuracy":"83.43","mIoU":"49.69"},"uses_additional_data":false,"paper_date":"2022-08-24","paper":"/paper/gswin-gated-mlp-vision-model-with","paper_url":"https://arxiv.org/abs/2208.11718v1","paper_title":"gSwin: Gated MLP Vision Model with Hierarchical Structure of Shifted Window","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":56,"model":"Seg-B/8 (MS, ViT-B)","metrics":{"Pixel Accuracy":"83.37","mIoU":"49.61"},"uses_additional_data":false,"paper_date":"2021-05-12","paper":"/paper/segmenter-transformer-for-semantic","paper_url":"https://arxiv.org/abs/2105.05633v3","paper_title":"Segmenter: Transformer for Semantic Segmentation","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":57,"model":"UperNet Shuffle-S","metrics":{"mIoU":"49.6"},"uses_additional_data":false,"paper_date":"2021-06-07","paper":"/paper/shuffle-transformer-rethinking-spatial","paper_url":"https://arxiv.org/abs/2106.03650v1","paper_title":"Shuffle Transformer: Rethinking Spatial Shuffle for Vision Transformer","code":"https://github.com/alibaba/EasyCV","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":7,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":58,"model":"Light-Ham (VAN-Base, 27M, IN-1k, MS)","metrics":{"mIoU":"49.6"},"uses_additional_data":false,"paper_date":"2021-09-09","paper":"/paper/is-attention-better-than-matrix-decomposition-1","paper_url":"https://arxiv.org/abs/2109.04553v2","paper_title":"Is Attention Better Than Matrix Decomposition?","code":"https://github.com/Gsunshine/Enjoy-Hamburger","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":59,"model":"PatchConvNet-S60 (UperNet)","metrics":{"mIoU":"49.3"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":60,"model":"DPT-Hybrid","metrics":{"Pixel Accuracy":"83.11","mIoU":"49.02"},"uses_additional_data":false,"paper_date":"2021-03-24","paper":"/paper/vision-transformers-for-dense-prediction","paper_url":"https://arxiv.org/abs/2103.13413v1","paper_title":"Vision Transformers for Dense Prediction","code":"https://github.com/huggingface/transformers","n_code_links":15,"syntology":{"n_ran":54,"n_unverified":62,"n_samples":116,"n_pointer_only_licence":15}},{"rank_in_archive_order":61,"model":"DaViT-S (UperNet)","metrics":{"mIoU":"48.8"},"uses_additional_data":false,"paper_date":"2022-04-07","paper":"/paper/davit-dual-attention-vision-transformers","paper_url":"https://arxiv.org/abs/2204.03645v1","paper_title":"DaViT: Dual Attention Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":8,"n_unverified":7,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":62,"model":"ResNeSt-200","metrics":{"mIoU":"48.36"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":63,"model":"HRNetV2 + OCR + RMI (PaddleClas pretrained)","metrics":{"mIoU":"47.98"},"uses_additional_data":false,"paper_date":"2019-09-24","paper":"/paper/object-contextual-representations-for","paper_url":"https://arxiv.org/abs/1909.11065v6","paper_title":"Segmentation Transformer: Object-Contextual Representations for Semantic Segmentation","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":11,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":1}},{"rank_in_archive_order":64,"model":"gSwin-T","metrics":{"Pixel Accuracy":"82.60","mIoU":"47.63"},"uses_additional_data":false,"paper_date":"2022-08-24","paper":"/paper/gswin-gated-mlp-vision-model-with","paper_url":"https://arxiv.org/abs/2208.11718v1","paper_title":"gSwin: Gated MLP Vision Model with Hierarchical Structure of Shifted Window","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":65,"model":"ResNeSt-269","metrics":{"mIoU":"47.60"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":66,"model":"UperNet Shuffle-T","metrics":{"mIoU":"47.6"},"uses_additional_data":false,"paper_date":"2021-06-07","paper":"/paper/shuffle-transformer-rethinking-spatial","paper_url":"https://arxiv.org/abs/2106.03650v1","paper_title":"Shuffle Transformer: Rethinking Spatial Shuffle for Vision Transformer","code":"https://github.com/alibaba/EasyCV","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":7,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":67,"model":"DCNAS","metrics":{"mIoU":"47.12"},"uses_additional_data":false,"paper_date":"2020-03-26","paper":"/paper/dcnas-densely-connected-neural-architecture","paper_url":"https://arxiv.org/abs/2003.11883v2","paper_title":"DCNAS: Densely Connected Neural Architecture Search for Semantic Image Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":68,"model":"ResNeSt-101","metrics":{"mIoU":"46.91"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":69,"model":"Seg-S-Mask/16 (MS, ViT-S)","metrics":{"mIoU":"46.9"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":70,"model":"Swin-S (RPE w/ GAB)","metrics":{"mIoU":"46.41"},"uses_additional_data":false,"paper_date":"2023-05-08","paper":"/paper/understanding-gaussian-attention-bias-of","paper_url":"https://arxiv.org/abs/2305.04722v1","paper_title":"Understanding Gaussian Attention Bias of Vision Transformers Using Effective Receptive Fields","code":"https://github.com/kmbmjn/GaussianAttentionBias","n_code_links":1,"syntology":null},{"rank_in_archive_order":71,"model":"DaViT-B (UperNet)","metrics":{"mIoU":"46.3"},"uses_additional_data":false,"paper_date":"2022-04-07","paper":"/paper/davit-dual-attention-vision-transformers","paper_url":"https://arxiv.org/abs/2204.03645v1","paper_title":"DaViT: Dual Attention Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":8,"n_unverified":7,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":72,"model":"CPN(ResNet-101)","metrics":{"mIoU":"46.27"},"uses_additional_data":false,"paper_date":"2020-04-03","paper":"/paper/context-prior-for-scene-segmentation","paper_url":"https://arxiv.org/abs/2004.01547v1","paper_title":"Context Prior for Scene Segmentation","code":"https://github.com/ycszen/ContextPrior","n_code_links":2,"syntology":null},{"rank_in_archive_order":73,"model":"MultiMAE (ViT-B)","metrics":{"mIoU":"46.2"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/multimae-multi-modal-multi-task-masked","paper_url":"https://arxiv.org/abs/2204.01678v1","paper_title":"MultiMAE: Multi-modal Multi-task Masked Autoencoders","code":"https://github.com/EPFL-VILAB/MultiMAE","n_code_links":1,"syntology":null},{"rank_in_archive_order":74,"model":"PyConvSegNet-152","metrics":{"Pixel Accuracy":"82.49","mIoU":"45.99"},"uses_additional_data":false,"paper_date":"2020-06-20","paper":"/paper/pyramidal-convolution-rethinking","paper_url":"https://arxiv.org/abs/2006.11538v1","paper_title":"Pyramidal Convolution: Rethinking Convolutional Neural Networks for Visual Recognition","code":"https://github.com/iduta/pyconv","n_code_links":3,"syntology":null},{"rank_in_archive_order":75,"model":"DNL","metrics":{"mIoU":"45.97"},"uses_additional_data":false,"paper_date":"2020-06-11","paper":"/paper/disentangled-non-local-neural-networks","paper_url":"https://arxiv.org/abs/2006.06668v2","paper_title":"Disentangled Non-Local Neural Networks","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":76,"model":"CTNet","metrics":{"mIoU":"45.94"},"uses_additional_data":false,"paper_date":"2021-04-20","paper":"/paper/ctnet-context-based-tandem-network-for","paper_url":"https://arxiv.org/abs/2104.09805v1","paper_title":"CTNet: Context-based Tandem Network for Semantic Segmentation","code":"https://github.com/syp2ysy/CTNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":77,"model":"ACNet (ResNet-101)","metrics":{"mIoU":"45.90"},"uses_additional_data":false,"paper_date":"2019-11-05","paper":"/paper/adaptive-context-network-for-scene-parsing-1","paper_url":"https://arxiv.org/abs/1911.01664v1","paper_title":"Adaptive Context Network for Scene Parsing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":78,"model":"ACNet(ResNet-101)","metrics":{"mIoU":"45.90"},"uses_additional_data":false,"paper_date":"2019-11-05","paper":"/paper/adaptive-context-network-for-scene-parsing-1","paper_url":"https://arxiv.org/abs/1911.01664v1","paper_title":"Adaptive Context Network for Scene Parsing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":79,"model":"OCR (HRNetV2-W48)","metrics":{"mIoU":"45.66"},"uses_additional_data":false,"paper_date":"2019-09-24","paper":"/paper/object-contextual-representations-for","paper_url":"https://arxiv.org/abs/1909.11065v6","paper_title":"Segmentation Transformer: Object-Contextual Representations for Semantic Segmentation","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":11,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":1}},{"rank_in_archive_order":80,"model":"EANet (ResNet-101)","metrics":{"mIoU":"45.33"},"uses_additional_data":false,"paper_date":"2021-05-05","paper":"/paper/beyond-self-attention-external-attention","paper_url":"https://arxiv.org/abs/2105.02358v2","paper_title":"Beyond Self-attention: External Attention using Two Linear Layers for Visual Tasks","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":7,"syntology":null},{"rank_in_archive_order":81,"model":"OCR (ResNet-101)","metrics":{"mIoU":"45.28"},"uses_additional_data":false,"paper_date":"2019-09-24","paper":"/paper/object-contextual-representations-for","paper_url":"https://arxiv.org/abs/1909.11065v6","paper_title":"Segmentation Transformer: Object-Contextual Representations for Semantic Segmentation","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":11,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":1}},{"rank_in_archive_order":82,"model":"Asymmetric ALNN","metrics":{"mIoU":"45.24"},"uses_additional_data":false,"paper_date":"2019-08-21","paper":"/paper/asymmetric-non-local-neural-networks-for","paper_url":"https://arxiv.org/abs/1908.07678v5","paper_title":"Asymmetric Non-local Neural Networks for Semantic Segmentation","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":83,"model":"gSwin-VT","metrics":{"Pixel Accuracy":"81.79","mIoU":"45.07"},"uses_additional_data":false,"paper_date":"2022-08-24","paper":"/paper/gswin-gated-mlp-vision-model-with","paper_url":"https://arxiv.org/abs/2208.11718v1","paper_title":"gSwin: Gated MLP Vision Model with Hierarchical Structure of Shifted Window","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":84,"model":"LaU-regression-loss","metrics":{"mIoU":"45.02"},"uses_additional_data":false,"paper_date":"2019-11-13","paper":"/paper/location-aware-upsampling-for-semantic","paper_url":"https://arxiv.org/abs/1911.05250v2","paper_title":"Location-aware Upsampling for Semantic Segmentation","code":"https://github.com/HolmesShuan/Location-aware-Upsampling-for-Semantic-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":85,"model":"EncNet (ResNet-101)","metrics":{"mIoU":"44.65"},"uses_additional_data":false,"paper_date":"2018-03-23","paper":"/paper/context-encoding-for-semantic-segmentation","paper_url":"http://arxiv.org/abs/1803.08904v1","paper_title":"Context Encoding for Semantic Segmentation","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":12,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":7}},{"rank_in_archive_order":86,"model":"SGR (ResNet-101)","metrics":{"mIoU":"44.32"},"uses_additional_data":false,"paper_date":"2018-12-01","paper":"/paper/symbolic-graph-reasoning-meets-convolutions","paper_url":"http://papers.nips.cc/paper/7456-symbolic-graph-reasoning-meets-convolutions","paper_title":"Symbolic Graph Reasoning Meets Convolutions","code":"https://github.com/julianschoep/SGRLayer","n_code_links":1,"syntology":null},{"rank_in_archive_order":87,"model":"Auto-DeepLab-L","metrics":{"Pixel Accuracy":"81.72","mIoU":"43.98"},"uses_additional_data":false,"paper_date":"2019-01-10","paper":"/paper/auto-deeplab-hierarchical-neural-architecture","paper_url":"http://arxiv.org/abs/1901.02985v2","paper_title":"Auto-DeepLab: Hierarchical Neural Architecture Search for Semantic Image Segmentation","code":"https://github.com/tensorflow/models","n_code_links":12,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":1}},{"rank_in_archive_order":88,"model":"PSANet (ResNet-101)","metrics":{"mIoU":"43.77"},"uses_additional_data":false,"paper_date":"2018-09-01","paper":"/paper/psanet-point-wise-spatial-attention-network","paper_url":"http://openaccess.thecvf.com/content_ECCV_2018/html/Hengshuang_Zhao_PSANet_Point-wise_Spatial_ECCV_2018_paper.html","paper_title":"PSANet: Point-wise Spatial Attention Network for Scene Parsing","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":4,"syntology":null},{"rank_in_archive_order":89,"model":"DSSPN (ResNet-101)","metrics":{"mIoU":"43.68"},"uses_additional_data":false,"paper_date":"2018-03-16","paper":"/paper/dynamic-structured-semantic-propagation","paper_url":"http://arxiv.org/abs/1803.06067v1","paper_title":"Dynamic-structured Semantic Propagation Network","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":90,"model":"PSPNet (ResNet-152)","metrics":{"mIoU":"43.51%"},"uses_additional_data":false,"paper_date":"2016-12-04","paper":"/paper/pyramid-scene-parsing-network","paper_url":"http://arxiv.org/abs/1612.01105v2","paper_title":"Pyramid Scene Parsing Network","code":"https://github.com/tensorflow/models","n_code_links":67,"syntology":{"n_ran":7,"n_unverified":22,"n_samples":29,"n_pointer_only_licence":5}},{"rank_in_archive_order":91,"model":"PSPNet (ResNet-101)","metrics":{"mIoU":"43.29%"},"uses_additional_data":false,"paper_date":"2016-12-04","paper":"/paper/pyramid-scene-parsing-network","paper_url":"http://arxiv.org/abs/1612.01105v2","paper_title":"Pyramid Scene Parsing Network","code":"https://github.com/tensorflow/models","n_code_links":67,"syntology":{"n_ran":7,"n_unverified":22,"n_samples":29,"n_pointer_only_licence":5}},{"rank_in_archive_order":92,"model":"HRNetV2 (HRNetV2-W48)","metrics":{"mIoU":"42.99"},"uses_additional_data":false,"paper_date":"2019-04-09","paper":"/paper/high-resolution-representations-for-labeling","paper_url":"http://arxiv.org/abs/1904.04514v1","paper_title":"High-Resolution Representations for Labeling Pixels and Regions","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":39,"syntology":{"n_ran":3,"n_unverified":15,"n_samples":18,"n_pointer_only_licence":5}},{"rank_in_archive_order":93,"model":"UperNet (ResNet-101)","metrics":{"mIoU":"42.66"},"uses_additional_data":false,"paper_date":"2018-07-26","paper":"/paper/unified-perceptual-parsing-for-scene","paper_url":"http://arxiv.org/abs/1807.10221v1","paper_title":"Unified Perceptual Parsing for Scene Understanding","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":25,"syntology":{"n_ran":9,"n_unverified":19,"n_samples":28,"n_pointer_only_licence":0}},{"rank_in_archive_order":94,"model":"RefineNet (ResNet-152)","metrics":{"mIoU":"40.70"},"uses_additional_data":false,"paper_date":"2016-11-20","paper":"/paper/refinenet-multi-path-refinement-networks-for","paper_url":"http://arxiv.org/abs/1611.06612v3","paper_title":"RefineNet: Multi-Path Refinement Networks for High-Resolution Semantic Segmentation","code":"https://github.com/guosheng/refinenet","n_code_links":13,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":1}},{"rank_in_archive_order":95,"model":"RefineNet (ResNet-101)","metrics":{"mIoU":"40.20"},"uses_additional_data":false,"paper_date":"2016-11-20","paper":"/paper/refinenet-multi-path-refinement-networks-for","paper_url":"http://arxiv.org/abs/1611.06612v3","paper_title":"RefineNet: Multi-Path Refinement Networks for High-Resolution Semantic Segmentation","code":"https://github.com/guosheng/refinenet","n_code_links":13,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":1}}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,795 of the 9,581 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9581,"papers_checked":6795,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":2785},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":54,"rows_with_any_sample_ran":43,"distinct_papers_with_graph_line":32,"distinct_papers_with_any_sample_ran":27,"samples_over_distinct_papers":{"n_ran":294,"n_unverified":379,"n_samples":673,"n_pointer_only_licence":144,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":463,"n_unverified":660,"n_samples":1123,"n_pointer_only_licence":247,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}