{"url":"/sota/semantic-segmentation-on-cityscapes-val","task":{"name":"Semantic Segmentation","url":"/task/semantic-segmentation","note":null},"dataset":{"name":"Cityscapes val","url":"/dataset/cityscapes"},"category":"Computer Vision","categories":["Computer Code","Computer Vision","Medical","Robots"],"category_note":null,"description":null,"description_from":null,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["mIoU","FPS","Validation mIoU"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"mIoU":null,"FPS":null,"Validation mIoU":null}},"counts":{"rows":99,"rows_with_code":93,"rows_with_paper_page":98,"rows_dated":98,"rows_using_additional_data":15},"rows":[{"rank_in_archive_order":1,"model":"ViT-P (InternImage-H)","metrics":{"mIoU":"87.4"},"uses_additional_data":true,"paper_date":"2025-05-26","paper":"/paper/the-missing-point-in-vision-transformers-for","paper_url":"https://arxiv.org/abs/2505.19795v1","paper_title":"The Missing Point in Vision Transformers for Universal Image Segmentation","code":"https://github.com/sajjad-sh33/vit-p","n_code_links":1,"syntology":null},{"rank_in_archive_order":2,"model":"SERNet-Former","metrics":{"Validation mIoU":"87.35","mIoU":"87.35"},"uses_additional_data":false,"paper_date":"2024-01-28","paper":"/paper/sernet-former-semantic-segmentation-by","paper_url":"https://arxiv.org/abs/2401.15741v7","paper_title":"SERNet-Former: Semantic Segmentation by Efficient Residual Network with Attention-Boosting Gates and Attention-Fusion Networks","code":"https://github.com/serdarch/sernet-former","n_code_links":2,"syntology":null},{"rank_in_archive_order":3,"model":"MetaPrompt-SD","metrics":{"mIoU":"87.1"},"uses_additional_data":true,"paper_date":"2023-12-22","paper":"/paper/harnessing-diffusion-models-for-visual","paper_url":"https://arxiv.org/abs/2312.14733v1","paper_title":"Harnessing Diffusion Models for Visual Perception with Meta Prompts","code":"https://github.com/fudan-zvg/meta-prompts","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"InternImage-H","metrics":{"mIoU":"87"},"uses_additional_data":true,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"HRNetV2-OCR+PSA","metrics":{"mIoU":"86.93"},"uses_additional_data":true,"paper_date":"2021-07-02","paper":"/paper/polarized-self-attention-towards-high-quality-1","paper_url":"https://arxiv.org/abs/2107.00782v2","paper_title":"Polarized Self-Attention: Towards High-quality Pixel-wise Regression","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":6,"syntology":null},{"rank_in_archive_order":6,"model":"InternImage-XL","metrics":{"mIoU":"86.4"},"uses_additional_data":true,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"HRNet-OCR","metrics":{"mIoU":"86.3"},"uses_additional_data":true,"paper_date":"2020-05-21","paper":"/paper/hierarchical-multi-scale-attention-for","paper_url":"https://arxiv.org/abs/2005.10821v1","paper_title":"Hierarchical Multi-Scale Attention for Semantic Segmentation","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":8,"n_samples":9,"n_pointer_only_licence":1}},{"rank_in_archive_order":8,"model":"Depth Anything","metrics":{"mIoU":"86.2"},"uses_additional_data":false,"paper_date":"2024-01-19","paper":"/paper/depth-anything-unleashing-the-power-of-large","paper_url":"https://arxiv.org/abs/2401.10891v2","paper_title":"Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data","code":"https://github.com/LiheYoung/Depth-Anything","n_code_links":7,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"OneFormer (ConvNeXt-XL, Mapillary, multi-scale)","metrics":{"mIoU":"85.8"},"uses_additional_data":true,"paper_date":"2022-11-10","paper":"/paper/oneformer-one-transformer-to-rule-universal","paper_url":"https://arxiv.org/abs/2211.06220v2","paper_title":"OneFormer: One Transformer to Rule Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"ViT-Adapter-L","metrics":{"mIoU":"85.8"},"uses_additional_data":true,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":11,"model":"SeMask (SeMask Swin-L Mask2Former)","metrics":{"mIoU":"84.98"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":12,"model":"Sequential Ensemble (MiT-B5 + HRNet)","metrics":{"mIoU":"84.8"},"uses_additional_data":false,"paper_date":"2022-10-08","paper":"/paper/sequential-ensembling-for-semantic","paper_url":"https://arxiv.org/abs/2210.05387v1","paper_title":"Sequential Ensembling for Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":13,"model":"Soft Labells (HRnet)","metrics":{"mIoU":"84.8"},"uses_additional_data":false,"paper_date":"2023-02-27","paper":"/paper/soft-labelling-for-semantic-segmentation","paper_url":"https://arxiv.org/abs/2302.13961v3","paper_title":"Soft labelling for semantic segmentation: Bringing coherence to label down-sampling","code":"https://github.com/vpulab/soft-labels-ss","n_code_links":1,"syntology":null},{"rank_in_archive_order":14,"model":"OneFormer (ConvNeXt-XL, multi-scale)","metrics":{"mIoU":"84.6"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/oneformer-one-transformer-to-rule-universal","paper_url":"https://arxiv.org/abs/2211.06220v2","paper_title":"OneFormer: One Transformer to Rule Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":15,"model":"DiNAT-L (Mask2Former)","metrics":{"mIoU":"84.5"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":16,"model":"OneFormer (Swin-L, multi-scale)","metrics":{"mIoU":"84.4"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/oneformer-one-transformer-to-rule-universal","paper_url":"https://arxiv.org/abs/2211.06220v2","paper_title":"OneFormer: One Transformer to Rule Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":17,"model":"VPNeXt","metrics":{"mIoU":"84.4"},"uses_additional_data":false,"paper_date":"2025-02-23","paper":"/paper/vpnext-rethinking-dense-decoding-for-plain","paper_url":"https://arxiv.org/abs/2502.16654v1","paper_title":"VPNeXt -- Rethinking Dense Decoding for Plain Vision Transformer","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":18,"model":"VOLO-D4 (MS, ImageNet1k pretrain)","metrics":{"mIoU":"84.3"},"uses_additional_data":false,"paper_date":"2021-06-24","paper":"/paper/volo-vision-outlooker-for-visual-recognition","paper_url":"https://arxiv.org/abs/2106.13112v2","paper_title":"VOLO: Vision Outlooker for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"Mask2Former (Swin-L)","metrics":{"mIoU":"84.3"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/masked-attention-mask-transformer-for","paper_url":"https://arxiv.org/abs/2112.01527v3","paper_title":"Masked-attention Mask Transformer for Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":20,"model":"EoMT (DINOv2-L, single-scale, 1024x1024)","metrics":{"FPS":"25","Validation mIoU":"84.2","mIoU":"84.2"},"uses_additional_data":false,"paper_date":"2025-03-24","paper":"/paper/your-vit-is-secretly-an-image-segmentation-1","paper_url":"https://arxiv.org/abs/2503.19108v1","paper_title":"Your ViT is Secretly an Image Segmentation Model","code":"https://github.com/tue-mps/eomt","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"SegFormer (MiT-B5, Mapillary)","metrics":{"mIoU":"84.0"},"uses_additional_data":true,"paper_date":"2021-05-31","paper":"/paper/segformer-simple-and-efficient-design-for","paper_url":"https://arxiv.org/abs/2105.15203v3","paper_title":"SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers","code":"https://github.com/huggingface/transformers","n_code_links":28,"syntology":{"n_ran":48,"n_unverified":38,"n_samples":86,"n_pointer_only_licence":15}},{"rank_in_archive_order":22,"model":"DDP (ConvNeXt-L, step-3)","metrics":{"mIoU":"83.9"},"uses_additional_data":false,"paper_date":"2023-03-30","paper":"/paper/ddp-diffusion-model-for-dense-visual","paper_url":"https://arxiv.org/abs/2303.17559v2","paper_title":"DDP: Diffusion Model for Dense Visual Prediction","code":"https://github.com/jiyuanfeng/ddp","n_code_links":1,"syntology":null},{"rank_in_archive_order":23,"model":"HRNetV2 + OCR + RMI (PaddleClas pretrained)","metrics":{"mIoU":"83.6"},"uses_additional_data":false,"paper_date":"2019-09-24","paper":"/paper/object-contextual-representations-for","paper_url":"https://arxiv.org/abs/1909.11065v6","paper_title":"Segmentation Transformer: Object-Contextual Representations for Semantic Segmentation","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":11,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":1}},{"rank_in_archive_order":24,"model":"PatchDiverse + Swin-L (multi-scale test, upernet, ImageNet22k pretrain)","metrics":{"mIoU":"83.6%"},"uses_additional_data":false,"paper_date":"2021-04-26","paper":"/paper/improve-vision-transformers-training-by","paper_url":"https://arxiv.org/abs/2104.12753v3","paper_title":"Vision Transformers with Patch Diversification","code":"https://github.com/ChengyueGongR/PatchVisionTransformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"SynBoost","metrics":{"mIoU":"83.5"},"uses_additional_data":false,"paper_date":"2021-03-09","paper":"/paper/pixel-wise-anomaly-detection-in-complex","paper_url":"https://arxiv.org/abs/2103.05445v1","paper_title":"Pixel-wise Anomaly Detection in Complex Driving Scenes","code":"https://github.com/giandbt/synboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":26,"model":"HRNetV2+OCR+CBL(ImageNet pretrained)","metrics":{"mIoU":"83.4"},"uses_additional_data":false,"paper_date":"2023-07-05","paper":"/paper/conditional-boundary-loss-for-semantic","paper_url":"https://ieeexplore.ieee.org/document/10173725","paper_title":"Conditional Boundary Loss for Semantic Segmentation","code":"https://github.com/dywu98/CBL-Conditional-Boundary-Loss","n_code_links":1,"syntology":null},{"rank_in_archive_order":27,"model":"EfficientViT-B3 (r1184x2368)","metrics":{"mIoU":"83.2"},"uses_additional_data":false,"paper_date":"2022-05-29","paper":"/paper/efficientvit-enhanced-linear-attention-for","paper_url":"https://arxiv.org/abs/2205.14756v6","paper_title":"EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":28,"model":"HRViT-b3 (SegFormer, SS)","metrics":{"mIoU":"83.16%"},"uses_additional_data":false,"paper_date":"2021-11-01","paper":"/paper/hrvit-multi-scale-high-resolution-vision","paper_url":"https://arxiv.org/abs/2111.01236v2","paper_title":"Multi-Scale High-Resolution Vision Transformer for Semantic Segmentation","code":"https://github.com/facebookresearch/HRViT","n_code_links":1,"syntology":null},{"rank_in_archive_order":29,"model":"SpineNet-S143+ (single-scale test)","metrics":{"mIoU":"83.04%"},"uses_additional_data":false,"paper_date":"2021-03-23","paper":"/paper/dilated-spinenet-for-semantic-segmentation","paper_url":"https://arxiv.org/abs/2103.12270v1","paper_title":"Dilated SpineNet for Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":30,"model":"HRViT-b2 (SegFormer, SS)","metrics":{"mIoU":"82.81%"},"uses_additional_data":false,"paper_date":"2021-11-01","paper":"/paper/hrvit-multi-scale-high-resolution-vision","paper_url":"https://arxiv.org/abs/2111.01236v2","paper_title":"Multi-Scale High-Resolution Vision Transformer for Semantic Segmentation","code":"https://github.com/facebookresearch/HRViT","n_code_links":1,"syntology":null},{"rank_in_archive_order":31,"model":"FAN-L-Hybrid+STL","metrics":{"mIoU":"82.8"},"uses_additional_data":false,"paper_date":"2024-01-08","paper":"/paper/fully-attentional-networks-with-self-emerging-1","paper_url":"https://arxiv.org/abs/2401.03844v1","paper_title":"Fully Attentional Networks with Self-emerging Token Labeling","code":"https://github.com/NVlabs/STL","n_code_links":1,"syntology":null},{"rank_in_archive_order":32,"model":"ResNeSt-200","metrics":{"mIoU":"82.7"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":33,"model":"WaveMix","metrics":{"mIoU":"82.7"},"uses_additional_data":false,"paper_date":"2022-05-28","paper":"/paper/wavemix-lite-a-resource-efficient-neural","paper_url":"https://arxiv.org/abs/2205.14375v5","paper_title":"WaveMix: A Resource-efficient Neural Network for Image Analysis","code":"https://github.com/pranavphoenix/WaveMix","n_code_links":1,"syntology":null},{"rank_in_archive_order":34,"model":"CMX (B4)","metrics":{"mIoU":"82.6"},"uses_additional_data":false,"paper_date":"2022-03-09","paper":"/paper/cmx-cross-modal-fusion-for-rgb-x-semantic","paper_url":"https://arxiv.org/abs/2203.04838v5","paper_title":"CMX: Cross-Modal Fusion for RGB-X Semantic Segmentation with Transformers","code":"https://github.com/huaaaliu/rgbx_semantic_segmentation","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":35,"model":"WaveMix-256/16 (Level-4)","metrics":{"mIoU":"82.60"},"uses_additional_data":false,"paper_date":"2022-05-28","paper":"/paper/wavemix-lite-a-resource-efficient-neural","paper_url":"https://arxiv.org/abs/2205.14375v5","paper_title":"WaveMix: A Resource-efficient Neural Network for Image Analysis","code":"https://github.com/pranavphoenix/WaveMix","n_code_links":1,"syntology":null},{"rank_in_archive_order":36,"model":"FAN-L-Hybrid","metrics":{"mIoU":"82.3"},"uses_additional_data":false,"paper_date":"2022-04-26","paper":"/paper/understanding-the-robustness-in-vision","paper_url":"https://arxiv.org/abs/2204.12451v4","paper_title":"Understanding The Robustness in Vision Transformers","code":"https://github.com/nvlabs/fan","n_code_links":2,"syntology":null},{"rank_in_archive_order":37,"model":"SETR-PUP (80k, MS)","metrics":{"mIoU":"82.15"},"uses_additional_data":false,"paper_date":"2020-12-31","paper":"/paper/rethinking-semantic-segmentation-from-a","paper_url":"https://arxiv.org/abs/2012.15840v3","paper_title":"Rethinking Semantic Segmentation from a Sequence-to-Sequence Perspective with Transformers","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":5,"syntology":null},{"rank_in_archive_order":38,"model":"DSNet-Base(single-scale)","metrics":{"mIoU":"82.0"},"uses_additional_data":false,"paper_date":"2024-06-06","paper":"/paper/dsnet-a-novel-way-to-use-atrous-convolutions","paper_url":"https://arxiv.org/abs/2406.03702v1","paper_title":"DSNet: A Novel Way to Use Atrous Convolutions in Semantic Segmentation","code":"https://github.com/takaniwa/dsnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":39,"model":"EANet","metrics":{"mIoU":"81.7%"},"uses_additional_data":false,"paper_date":"2021-05-05","paper":"/paper/beyond-self-attention-external-attention","paper_url":"https://arxiv.org/abs/2105.02358v2","paper_title":"Beyond Self-attention: External Attention using Two Linear Layers for Visual Tasks","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":7,"syntology":null},{"rank_in_archive_order":40,"model":"HRViT-b1 (SegFormer, SS)","metrics":{"mIoU":"81.63%"},"uses_additional_data":false,"paper_date":"2021-11-01","paper":"/paper/hrvit-multi-scale-high-resolution-vision","paper_url":"https://arxiv.org/abs/2111.01236v2","paper_title":"Multi-Scale High-Resolution Vision Transformer for Semantic Segmentation","code":"https://github.com/facebookresearch/HRViT","n_code_links":1,"syntology":null},{"rank_in_archive_order":41,"model":"CMX (B2)","metrics":{"mIoU":"81.6"},"uses_additional_data":false,"paper_date":"2022-03-09","paper":"/paper/cmx-cross-modal-fusion-for-rgb-x-semantic","paper_url":"https://arxiv.org/abs/2203.04838v5","paper_title":"CMX: Cross-Modal Fusion for RGB-X Semantic Segmentation with Transformers","code":"https://github.com/huaaaliu/rgbx_semantic_segmentation","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":42,"model":"Trans4Trans","metrics":{"mIoU":"81.54%"},"uses_additional_data":false,"paper_date":"2021-08-20","paper":"/paper/trans4trans-efficient-transformer-for-1","paper_url":"https://arxiv.org/abs/2108.09174v1","paper_title":"Trans4Trans: Efficient Transformer for Transparent Object and Semantic Scene Segmentation in Real-World Navigation Assistance","code":"https://github.com/jamycheung/Trans4Trans","n_code_links":1,"syntology":null},{"rank_in_archive_order":43,"model":"Panoptic-DeepLab","metrics":{"mIoU":"81.5%"},"uses_additional_data":false,"paper_date":"2019-11-22","paper":"/paper/panoptic-deeplab-a-simple-strong-and-fast","paper_url":"https://arxiv.org/abs/1911.10194v3","paper_title":"Panoptic-DeepLab: A Simple, Strong, and Fast Baseline for Bottom-Up Panoptic Segmentation","code":"https://github.com/tensorflow/models/tree/master/official/projects/panoptic","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":6,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":44,"model":"Soft Labells (Deeplab)","metrics":{"mIoU":"81.5"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":45,"model":"HRNetV2 (HRNetV2-W48)","metrics":{"mIoU":"81.1"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":46,"model":"Trans4PASS (Small)","metrics":{"mIoU":"81.1%"},"uses_additional_data":false,"paper_date":"2022-03-02","paper":"/paper/bending-reality-distortion-aware-transformers","paper_url":"https://arxiv.org/abs/2203.01452v2","paper_title":"Bending Reality: Distortion-aware Transformers for Adapting to Panoramic Semantic Segmentation","code":"https://github.com/jamycheung/trans4pass","n_code_links":1,"syntology":null},{"rank_in_archive_order":47,"model":"DEPICT-SA (ViT-L multi-scale)","metrics":{"mIoU":"81.0"},"uses_additional_data":false,"paper_date":"2024-11-05","paper":"/paper/rethinking-decoders-for-transformer-based","paper_url":"https://arxiv.org/abs/2411.03033v3","paper_title":"Rethinking Decoders for Transformer-based Semantic Segmentation: A Compression Perspective","code":"https://github.com/qishuaiwen/depict","n_code_links":1,"syntology":null},{"rank_in_archive_order":48,"model":"OCR (ResNet-101-FCN)","metrics":{"mIoU":"80.6"},"uses_additional_data":false,"paper_date":"2019-09-24","paper":"/paper/object-contextual-representations-for","paper_url":"https://arxiv.org/abs/1909.11065v6","paper_title":"Segmentation Transformer: Object-Contextual Representations for Semantic Segmentation","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":11,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":1}},{"rank_in_archive_order":49,"model":"RepVGG-B2","metrics":{"mIoU":"80.57%"},"uses_additional_data":false,"paper_date":"2021-01-11","paper":"/paper/repvgg-making-vgg-style-convnets-great-again","paper_url":"https://arxiv.org/abs/2101.03697v3","paper_title":"RepVGG: Making VGG-style ConvNets Great Again","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":25,"syntology":{"n_ran":13,"n_unverified":3,"n_samples":16,"n_pointer_only_licence":6}},{"rank_in_archive_order":50,"model":"DSNet(single-scale)","metrics":{"FPS":"81.9","mIoU":"80.4"},"uses_additional_data":false,"paper_date":"2024-06-06","paper":"/paper/dsnet-a-novel-way-to-use-atrous-convolutions","paper_url":"https://arxiv.org/abs/2406.03702v1","paper_title":"DSNet: A Novel Way to Use Atrous Convolutions in Semantic Segmentation","code":"https://github.com/takaniwa/dsnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":51,"model":"SeMask (SeMask Swin-L FPN)","metrics":{"mIoU":"80.39"},"uses_additional_data":true,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":52,"model":"Auto-DeepLab-L","metrics":{"mIoU":"80.33%"},"uses_additional_data":false,"paper_date":"2019-01-10","paper":"/paper/auto-deeplab-hierarchical-neural-architecture","paper_url":"http://arxiv.org/abs/1901.02985v2","paper_title":"Auto-DeepLab: Hierarchical Neural Architecture Search for Semantic Image Segmentation","code":"https://github.com/tensorflow/models","n_code_links":12,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":1}},{"rank_in_archive_order":53,"model":"SML","metrics":{"mIoU":"80.33"},"uses_additional_data":false,"paper_date":"2021-07-23","paper":"/paper/standardized-max-logits-a-simple-yet","paper_url":"https://arxiv.org/abs/2107.11264v4","paper_title":"Standardized Max Logits: A Simple yet Effective Approach for Identifying Unexpected Road Obstacles in Urban-Scene Segmentation","code":"https://github.com/shjung13/standardized-max-logits","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":54,"model":"Multiscale DEQ (MDEQ-XL)","metrics":{"mIoU":"80.3%"},"uses_additional_data":false,"paper_date":"2020-06-15","paper":"/paper/multiscale-deep-equilibrium-models","paper_url":"https://arxiv.org/abs/2006.08656v2","paper_title":"Multiscale Deep Equilibrium Models","code":"https://github.com/locuslab/deq","n_code_links":4,"syntology":{"n_ran":10,"n_unverified":4,"n_samples":14,"n_pointer_only_licence":4}},{"rank_in_archive_order":55,"model":"HRNetV2 (HRNetV2-W40)","metrics":{"mIoU":"80.2"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":56,"model":"PSPNet (Dilated-ResNet-101)","metrics":{"mIoU":"79.7"},"uses_additional_data":false,"paper_date":"2016-12-04","paper":"/paper/pyramid-scene-parsing-network","paper_url":"http://arxiv.org/abs/1612.01105v2","paper_title":"Pyramid Scene Parsing Network","code":"https://github.com/tensorflow/models","n_code_links":67,"syntology":{"n_ran":7,"n_unverified":22,"n_samples":29,"n_pointer_only_licence":5}},{"rank_in_archive_order":57,"model":"DeepLabv3+ (Dilated-Xception-71)","metrics":{"mIoU":"79.6"},"uses_additional_data":false,"paper_date":"2018-02-07","paper":"/paper/encoder-decoder-with-atrous-separable","paper_url":"http://arxiv.org/abs/1802.02611v3","paper_title":"Encoder-Decoder with Atrous Separable Convolution for Semantic Image Segmentation","code":"https://github.com/tensorflow/models/tree/master/research/deeplab","n_code_links":78,"syntology":{"n_ran":43,"n_unverified":29,"n_samples":72,"n_pointer_only_licence":40}},{"rank_in_archive_order":58,"model":"Trans4PASS (Tiny)","metrics":{"mIoU":"79.1%"},"uses_additional_data":false,"paper_date":"2022-03-02","paper":"/paper/bending-reality-distortion-aware-transformers","paper_url":"https://arxiv.org/abs/2203.01452v2","paper_title":"Bending Reality: Distortion-aware Transformers for Adapting to Panoramic Semantic Segmentation","code":"https://github.com/jamycheung/trans4pass","n_code_links":1,"syntology":null},{"rank_in_archive_order":59,"model":"DEPICT-SA (ViT-L single-scale)","metrics":{"mIoU":"78.8"},"uses_additional_data":false,"paper_date":"2024-11-05","paper":"/paper/rethinking-decoders-for-transformer-based","paper_url":"https://arxiv.org/abs/2411.03033v3","paper_title":"Rethinking Decoders for Transformer-based Semantic Segmentation: A Compression Perspective","code":"https://github.com/qishuaiwen/depict","n_code_links":1,"syntology":null},{"rank_in_archive_order":60,"model":"SemanticFPN P2-P5 + PointRend","metrics":{"mIoU":"78.6"},"uses_additional_data":false,"paper_date":"2019-12-17","paper":"/paper/pointrend-image-segmentation-as-rendering","paper_url":"https://arxiv.org/abs/1912.08193v2","paper_title":"PointRend: Image Segmentation as Rendering","code":"https://github.com/facebookresearch/detectron2/tree/master/projects/PointRend","n_code_links":14,"syntology":{"n_ran":5,"n_unverified":13,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":61,"model":"DeepLabv3 (Dilated-ResNet-101)","metrics":{"mIoU":"78.5%"},"uses_additional_data":false,"paper_date":"2017-06-17","paper":"/paper/rethinking-atrous-convolution-for-semantic","paper_url":"http://arxiv.org/abs/1706.05587v3","paper_title":"Rethinking Atrous Convolution for Semantic Image Segmentation","code":"https://github.com/tensorflow/models","n_code_links":77,"syntology":{"n_ran":3,"n_unverified":4,"n_samples":7,"n_pointer_only_licence":3}},{"rank_in_archive_order":62,"model":"StreamDEQ (8 iterations)","metrics":{"FPS":"1.1","mIoU":"78.2"},"uses_additional_data":false,"paper_date":"2022-04-28","paper":"/paper/streaming-multiscale-deep-equilibrium-models","paper_url":"https://arxiv.org/abs/2204.13492v4","paper_title":"Representation Recycling for Streaming Video Analysis","code":"https://github.com/ufukertenli/streamdeq-code","n_code_links":1,"syntology":null},{"rank_in_archive_order":63,"model":"Multiscale DEQ (MDEQ-large)","metrics":{"mIoU":"77.8%"},"uses_additional_data":false,"paper_date":"2020-06-15","paper":"/paper/multiscale-deep-equilibrium-models","paper_url":"https://arxiv.org/abs/2006.08656v2","paper_title":"Multiscale Deep Equilibrium Models","code":"https://github.com/locuslab/deq","n_code_links":4,"syntology":{"n_ran":10,"n_unverified":4,"n_samples":14,"n_pointer_only_licence":4}},{"rank_in_archive_order":64,"model":"HALO","metrics":{"mIoU":"77.8"},"uses_additional_data":false,"paper_date":"2023-06-19","paper":"/paper/hyperbolic-active-learning-for-semantic","paper_url":"https://arxiv.org/abs/2306.11180v5","paper_title":"Hyperbolic Active Learning for Semantic Segmentation under Domain Shift","code":"https://github.com/paolomandica/HALO","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":5,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":65,"model":"DetCon_B","metrics":{"mIoU":"77.0%"},"uses_additional_data":true,"paper_date":"2021-03-19","paper":"/paper/efficient-visual-pretraining-with-contrastive","paper_url":"https://arxiv.org/abs/2103.10957v2","paper_title":"Efficient Visual Pretraining with Contrastive Detection","code":"https://github.com/deepmind/detcon","n_code_links":2,"syntology":null},{"rank_in_archive_order":66,"model":"EEEA-Net-C2 (ours)","metrics":{"mIoU":"76.8"},"uses_additional_data":false,"paper_date":"2021-08-13","paper":"/paper/eeea-net-an-early-exit-evolutionary-neural","paper_url":"https://arxiv.org/abs/2108.06156v1","paper_title":"EEEA-Net: An Early Exit Evolutionary Neural Architecture Search","code":"https://github.com/chakkritte/eeea-net","n_code_links":1,"syntology":null},{"rank_in_archive_order":67,"model":"WaveMixLite-256/16","metrics":{"mIoU":"76.79"},"uses_additional_data":false,"paper_date":"2022-10-13","paper":"/paper/wavemix-lite-a-resource-efficient-neural-1","paper_url":"https://openreview.net/forum?id=y_icnxeeUcl","paper_title":"WaveMix-Lite: A Resource-efficient Neural Network for Image Analysis","code":"https://github.com/pranavphoenix/WaveMix","n_code_links":1,"syntology":null},{"rank_in_archive_order":68,"model":"SwinMTL","metrics":{"mIoU":"76.41"},"uses_additional_data":false,"paper_date":"2024-03-15","paper":"/paper/swinmtl-a-shared-architecture-for","paper_url":"https://arxiv.org/abs/2403.10662v1","paper_title":"SwinMTL: A Shared Architecture for Simultaneous Depth Estimation and Semantic Segmentation from Monocular Camera Images","code":"https://github.com/pardistaghavi/swinmtl","n_code_links":1,"syntology":null},{"rank_in_archive_order":69,"model":"CSFNet-2","metrics":{"FPS":"72.3 (3090)","mIoU":"76.36"},"uses_additional_data":false,"paper_date":"2024-07-01","paper":"/paper/csfnet-a-cosine-similarity-fusion-network-for","paper_url":"https://arxiv.org/abs/2407.01328v1","paper_title":"CSFNet: A Cosine Similarity Fusion Network for Real-Time RGB-X Semantic Segmentation of Driving Scenes","code":"https://github.com/Danial-Qashqai/CSFNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":70,"model":"RepMLPNet-D256","metrics":{"mIoU":"76.27"},"uses_additional_data":false,"paper_date":"2021-12-21","paper":"/paper/repmlpnet-hierarchical-vision-mlp-with-re","paper_url":"https://arxiv.org/abs/2112.11081v2","paper_title":"RepMLPNet: Hierarchical Vision MLP with Re-parameterized Locality","code":"https://github.com/towhee-io/towhee","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":71,"model":"Dilated-ResNet (Dilated-ResNet-101)","metrics":{"mIoU":"75.7"},"uses_additional_data":false,"paper_date":"2015-12-10","paper":"/paper/deep-residual-learning-for-image-recognition","paper_url":"http://arxiv.org/abs/1512.03385v1","paper_title":"Deep Residual Learning for Image Recognition","code":"https://github.com/tensorflow/models/tree/master/research/deeplab","n_code_links":484,"syntology":{"n_ran":230,"n_unverified":147,"n_samples":377,"n_pointer_only_licence":187}},{"rank_in_archive_order":72,"model":"UNet++ (ResNet-101)","metrics":{"mIoU":"75.5"},"uses_additional_data":false,"paper_date":"2018-07-18","paper":"/paper/unet-a-nested-u-net-architecture-for-medical","paper_url":"http://arxiv.org/abs/1807.10165v1","paper_title":"UNet++: A Nested U-Net Architecture for Medical Image Segmentation","code":"https://github.com/qubvel/segmentation_models.pytorch","n_code_links":34,"syntology":{"n_ran":5,"n_unverified":23,"n_samples":28,"n_pointer_only_licence":2}},{"rank_in_archive_order":73,"model":"SqueezeNAS (LAT XLarge)","metrics":{"mIoU":"75.2%"},"uses_additional_data":true,"paper_date":"2019-08-05","paper":"/paper/squeezenas-fast-neural-architecture-search","paper_url":"https://arxiv.org/abs/1908.01748v2","paper_title":"SqueezeNAS: Fast neural architecture search for faster semantic segmentation","code":"https://github.com/ashaw596/squeezenas","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":74,"model":"ReLICv2","metrics":{"mIoU":"75.2"},"uses_additional_data":false,"paper_date":"2022-01-13","paper":"/paper/pushing-the-limits-of-self-supervised-resnets","paper_url":"https://arxiv.org/abs/2201.05119v2","paper_title":"Pushing the limits of self-supervised ResNets: Can we outperform supervised learning without labels on ImageNet?","code":"https://github.com/google-deepmind/relicv2","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":14,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":75,"model":"CSFNet-1","metrics":{"FPS":"106.1 (3090)","mIoU":"74.73"},"uses_additional_data":false,"paper_date":"2024-07-01","paper":"/paper/csfnet-a-cosine-similarity-fusion-network-for","paper_url":"https://arxiv.org/abs/2407.01328v1","paper_title":"CSFNet: A Cosine Similarity Fusion Network for Real-Time RGB-X Semantic Segmentation of Driving Scenes","code":"https://github.com/Danial-Qashqai/CSFNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":76,"model":"GSCNN (ResNet-101)","metrics":{"mIoU":"74.7%"},"uses_additional_data":false,"paper_date":"2019-07-12","paper":"/paper/gated-scnn-gated-shape-cnns-for-semantic","paper_url":"https://arxiv.org/abs/1907.05740v1","paper_title":"Gated-SCNN: Gated Shape CNNs for Semantic Segmentation","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":4,"syntology":null},{"rank_in_archive_order":77,"model":"BYOL","metrics":{"mIoU":"74.6"},"uses_additional_data":true,"paper_date":"2022-01-13","paper":"/paper/pushing-the-limits-of-self-supervised-resnets","paper_url":"https://arxiv.org/abs/2201.05119v2","paper_title":"Pushing the limits of self-supervised ResNets: Can we outperform supervised learning without labels on ImageNet?","code":"https://github.com/google-deepmind/relicv2","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":14,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":78,"model":"WASPnet (ours)","metrics":{"mIoU":"74%"},"uses_additional_data":false,"paper_date":"2019-12-06","paper":"/paper/waterfall-atrous-spatial-pooling-architecture","paper_url":"https://arxiv.org/abs/1912.03183v1","paper_title":"Waterfall Atrous Spatial Pooling Architecture for Efficient Semantic Segmentation","code":"https://github.com/bmartacho/WASP","n_code_links":1,"syntology":null},{"rank_in_archive_order":79,"model":"SqueezeNAS (LAT Large)","metrics":{"mIoU":"73.6%"},"uses_additional_data":true,"paper_date":"2019-08-05","paper":"/paper/squeezenas-fast-neural-architecture-search","paper_url":"https://arxiv.org/abs/1908.01748v2","paper_title":"SqueezeNAS: Fast neural architecture search for faster semantic segmentation","code":"https://github.com/ashaw596/squeezenas","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":80,"model":"FasterSeg","metrics":{"mIoU":"73.1%"},"uses_additional_data":false,"paper_date":"2019-12-23","paper":"/paper/fasterseg-searching-for-faster-real-time-1","paper_url":"https://arxiv.org/abs/1912.10917v2","paper_title":"FasterSeg: Searching for Faster Real-time Semantic Segmentation","code":"https://github.com/TAMU-VITA/FasterSeg","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":11,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":81,"model":"GSCNN (ResNet-50)","metrics":{"mIoU":"73.0%"},"uses_additional_data":false,"paper_date":"2019-07-12","paper":"/paper/gated-scnn-gated-shape-cnns-for-semantic","paper_url":"https://arxiv.org/abs/1907.05740v1","paper_title":"Gated-SCNN: Gated Shape CNNs for Semantic Segmentation","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":4,"syntology":null},{"rank_in_archive_order":82,"model":"Aerial-PASS (ResNet-18)","metrics":{"mIoU":"72.8%"},"uses_additional_data":false,"paper_date":"2021-05-15","paper":"/paper/aerial-pass-panoramic-annular-scene","paper_url":"https://arxiv.org/abs/2105.07209v1","paper_title":"Aerial-PASS: Panoramic Annular Scene Segmentation in Drone Videos","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":83,"model":"RFNet (ResNet-18)","metrics":{"mIoU":"72.5%"},"uses_additional_data":false,"paper_date":"2020-02-24","paper":"/paper/real-time-fusion-network-for-rgb-d-semantic","paper_url":"https://arxiv.org/abs/2002.10570v2","paper_title":"Real-time Fusion Network for RGB-D Semantic Segmentation Incorporating Unexpected Obstacle Detection for Road-driving Images","code":"https://github.com/AHupuJR/RFNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":84,"model":"ERFNet (PyTorch)","metrics":{"mIoU":"72.1%"},"uses_additional_data":false,"paper_date":"2017-10-09","paper":"/paper/erfnet-efficient-residual-factorized-convnet","paper_url":"https://ieeexplore.ieee.org/abstract/document/8063438","paper_title":"ERFNet: Efficient Residual Factorized ConvNet for Real-time Semantic Segmentation","code":"https://github.com/osmr/imgclsmob","n_code_links":13,"syntology":null},{"rank_in_archive_order":85,"model":"SwaftNet (ResNet-18)","metrics":{"mIoU":"72.1%"},"uses_additional_data":false,"paper_date":"2019-09-17","paper":"/paper/ds-pass-detail-sensitive-panoramic-annular","paper_url":"https://arxiv.org/abs/1909.07721v2","paper_title":"DS-PASS: Detail-Sensitive Panoramic Annular Semantic Segmentation through SwaftNet for Surrounding Sensing","code":"https://github.com/elnino9ykl/DS-PASS","n_code_links":1,"syntology":null},{"rank_in_archive_order":86,"model":"StreamDEQ (4 iterations)","metrics":{"FPS":"1.9","mIoU":"71.5"},"uses_additional_data":false,"paper_date":"2022-04-28","paper":"/paper/streaming-multiscale-deep-equilibrium-models","paper_url":"https://arxiv.org/abs/2204.13492v4","paper_title":"Representation Recycling for Streaming Video Analysis","code":"https://github.com/ufukertenli/streamdeq-code","n_code_links":1,"syntology":null},{"rank_in_archive_order":87,"model":"Template-Based NAS-arch1","metrics":{"mIoU":"69.5%"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/template-based-automatic-search-of-compact","paper_url":"https://arxiv.org/abs/1904.02365v2","paper_title":"Template-Based Automatic Search of Compact Semantic Segmentation Architectures","code":"https://github.com/drsleep/nas-segm-pytorch","n_code_links":1,"syntology":null},{"rank_in_archive_order":88,"model":"Fast-SCNN + Coarse + ImageNet","metrics":{"mIoU":"69.19"},"uses_additional_data":false,"paper_date":"2019-02-12","paper":"/paper/fast-scnn-fast-semantic-segmentation-network","paper_url":"http://arxiv.org/abs/1902.04502v1","paper_title":"Fast-SCNN: Fast Semantic Segmentation Network","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":24,"syntology":{"n_ran":0,"n_unverified":32,"n_samples":32,"n_pointer_only_licence":0}},{"rank_in_archive_order":89,"model":"LDFNet","metrics":{"mIoU":"68.48%"},"uses_additional_data":false,"paper_date":"2018-09-24","paper":"/paper/incorporating-luminance-depth-and-color","paper_url":"https://arxiv.org/abs/1809.09077v3","paper_title":"Incorporating Luminance, Depth and Color Information by a Fusion-based Network for Semantic Segmentation","code":"https://github.com/shangweihung/LDFNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":90,"model":"Template-Based NAS-arch0","metrics":{"mIoU":"68.1%"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/template-based-automatic-search-of-compact","paper_url":"https://arxiv.org/abs/1904.02365v2","paper_title":"Template-Based Automatic Search of Compact Semantic Segmentation Architectures","code":"https://github.com/drsleep/nas-segm-pytorch","n_code_links":1,"syntology":null},{"rank_in_archive_order":91,"model":"SqueezeNAS (LAT Small)","metrics":{"mIoU":"68.0%"},"uses_additional_data":true,"paper_date":"2019-08-05","paper":"/paper/squeezenas-fast-neural-architecture-search","paper_url":"https://arxiv.org/abs/1908.01748v2","paper_title":"SqueezeNAS: Fast neural architecture search for faster semantic segmentation","code":"https://github.com/ashaw596/squeezenas","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":92,"model":"ContextNet","metrics":{"mIoU":"65.9%"},"uses_additional_data":false,"paper_date":"2018-05-11","paper":"/paper/contextnet-exploring-context-and-detail-for","paper_url":"http://arxiv.org/abs/1805.04554v4","paper_title":"ContextNet: Exploring Context and Detail for Semantic Segmentation in Real-time","code":"https://github.com/osmr/imgclsmob","n_code_links":2,"syntology":null},{"rank_in_archive_order":93,"model":"DiCENet","metrics":{"mIoU":"63.4"},"uses_additional_data":false,"paper_date":"2019-06-08","paper":"/paper/dicenet-dimension-wise-convolutions-for","paper_url":"https://arxiv.org/abs/1906.03516v3","paper_title":"DiCENet: Dimension-wise Convolutions for Efficient Networks","code":"https://github.com/osmr/imgclsmob","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":94,"model":"DCT-EDANet","metrics":{"mIoU":"61.6"},"uses_additional_data":false,"paper_date":"2019-07-23","paper":"/paper/exploring-semantic-segmentation-on-the-dct","paper_url":"https://arxiv.org/abs/1907.10015v2","paper_title":"Exploring Semantic Segmentation on the DCT Representation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":95,"model":"StreamDEQ (2 iterations)","metrics":{"FPS":"2.9","mIoU":"57.9"},"uses_additional_data":false,"paper_date":"2022-04-28","paper":"/paper/streaming-multiscale-deep-equilibrium-models","paper_url":"https://arxiv.org/abs/2204.13492v4","paper_title":"Representation Recycling for Streaming Video Analysis","code":"https://github.com/ufukertenli/streamdeq-code","n_code_links":1,"syntology":null},{"rank_in_archive_order":96,"model":"StreamDEQ (1 iterations)","metrics":{"FPS":"4.3","mIoU":"45.5"},"uses_additional_data":false,"paper_date":"2022-04-28","paper":"/paper/streaming-multiscale-deep-equilibrium-models","paper_url":"https://arxiv.org/abs/2204.13492v4","paper_title":"Representation Recycling for Streaming Video Analysis","code":"https://github.com/ufukertenli/streamdeq-code","n_code_links":1,"syntology":null},{"rank_in_archive_order":97,"model":"MRFP+(Ours) Resnet50","metrics":{"mIoU":"42.4"},"uses_additional_data":false,"paper_date":"2023-11-30","paper":"/paper/mrfp-learning-generalizable-semantic","paper_url":"https://arxiv.org/abs/2311.18331v2","paper_title":"MRFP: Learning Generalizable Semantic Segmentation from Sim-2-Real with Multi-Resolution Feature Perturbation","code":"https://github.com/airl-iisc/MRFP","n_code_links":1,"syntology":null},{"rank_in_archive_order":98,"model":"Resnet50","metrics":{"mIoU":"34.66"},"uses_additional_data":false,"paper_date":"2023-11-30","paper":"/paper/mrfp-learning-generalizable-semantic","paper_url":"https://arxiv.org/abs/2311.18331v2","paper_title":"MRFP: Learning Generalizable Semantic Segmentation from Sim-2-Real with Multi-Resolution Feature Perturbation","code":"https://github.com/airl-iisc/MRFP","n_code_links":1,"syntology":null},{"rank_in_archive_order":99,"model":"SegFormer-B0","metrics":{"Validation mIoU":"76.2"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/segformer-simple-and-efficient-design-for","paper_url":"https://arxiv.org/abs/2105.15203v3","paper_title":"SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers","code":"https://github.com/huggingface/transformers","n_code_links":28,"syntology":{"n_ran":48,"n_unverified":38,"n_samples":86,"n_pointer_only_licence":15}}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,264 of the 9,581 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9581,"papers_checked":6264,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":3316},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":43,"rows_with_any_sample_ran":32,"distinct_papers_with_graph_line":32,"distinct_papers_with_any_sample_ran":26,"samples_over_distinct_papers":{"n_ran":410,"n_unverified":475,"n_samples":885,"n_pointer_only_licence":307,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":479,"n_unverified":589,"n_samples":1068,"n_pointer_only_licence":343,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}