{"url":"/sota/semantic-segmentation-on-ade20k","task":{"name":"Semantic Segmentation","url":"/task/semantic-segmentation","note":null},"dataset":{"name":"ADE20K","url":"/dataset/ade20k"},"category":"Computer Vision","categories":["Computer Code","Computer Vision","Medical","Robots"],"category_note":null,"description":null,"description_from":null,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Validation mIoU","Test Score","Params (M)","GFLOPs (512 x 512)","GFLOPs","Mean IoU (class)"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Validation mIoU":null,"Test Score":"higher","Params (M)":"lower","GFLOPs (512 x 512)":null,"GFLOPs":null,"Mean IoU (class)":"higher"}},"counts":{"rows":235,"rows_with_code":226,"rows_with_paper_page":235,"rows_dated":235,"rows_using_additional_data":18},"rows":[{"rank_in_archive_order":1,"model":"ViT-P (InternImage-H)","metrics":{"Params (M)":"1610","Validation mIoU":"63.6"},"uses_additional_data":true,"paper_date":"2025-05-26","paper":"/paper/the-missing-point-in-vision-transformers-for","paper_url":"https://arxiv.org/abs/2505.19795v1","paper_title":"The Missing Point in Vision Transformers for Universal Image Segmentation","code":"https://github.com/sajjad-sh33/vit-p","n_code_links":1,"syntology":null},{"rank_in_archive_order":2,"model":"ONE-PEACE","metrics":{"Params (M)":"1500","Validation mIoU":"63.0"},"uses_additional_data":true,"paper_date":"2023-05-18","paper":"/paper/one-peace-exploring-one-general","paper_url":"https://arxiv.org/abs/2305.11172v1","paper_title":"ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities","code":"https://github.com/modelscope/modelscope","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"InternImage-H","metrics":{"GFLOPs":"4635","Params (M)":"1310","Validation mIoU":"62.9"},"uses_additional_data":true,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"M3I Pre-training (InternImage-H)","metrics":{"Params (M)":"1310","Validation mIoU":"62.9"},"uses_additional_data":true,"paper_date":"2022-11-17","paper":"/paper/towards-all-in-one-pre-training-via","paper_url":"https://arxiv.org/abs/2211.09807v2","paper_title":"Towards All-in-one Pre-training via Maximizing Multi-modal Mutual Information","code":"https://github.com/OpenGVLab/M3I-Pretraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":5,"model":"BEiT-3","metrics":{"Params (M)":"1900","Validation mIoU":"62.8"},"uses_additional_data":true,"paper_date":"2022-08-22","paper":"/paper/image-as-a-foreign-language-beit-pretraining","paper_url":"https://arxiv.org/abs/2208.10442v2","paper_title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","code":"https://github.com/microsoft/unilm/tree/master/beit","n_code_links":2,"syntology":null},{"rank_in_archive_order":6,"model":"EVA","metrics":{"Params (M)":"1074","Validation mIoU":"62.3"},"uses_additional_data":true,"paper_date":"2022-11-14","paper":"/paper/eva-exploring-the-limits-of-masked-visual","paper_url":"https://arxiv.org/abs/2211.07636v2","paper_title":"EVA: Exploring the Limits of Masked Visual Representation Learning at Scale","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"ViT-P (OneFormer, InternImage-H)","metrics":{"Params (M)":"1400","Validation mIoU":"61.6"},"uses_additional_data":false,"paper_date":"2025-05-26","paper":"/paper/the-missing-point-in-vision-transformers-for","paper_url":"https://arxiv.org/abs/2505.19795v1","paper_title":"The Missing Point in Vision Transformers for Universal Image Segmentation","code":"https://github.com/sajjad-sh33/vit-p","n_code_links":1,"syntology":null},{"rank_in_archive_order":8,"model":"ViT-Adapter-L (Mask2Former, BEiTv2 pretrain)","metrics":{"Params (M)":"571","Validation mIoU":"61.5"},"uses_additional_data":true,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":9,"model":"FD-SwinV2-G","metrics":{"Params (M)":"3000","Validation mIoU":"61.4"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/contrastive-learning-rivals-masked-image","paper_url":"https://arxiv.org/abs/2205.14141v3","paper_title":"Contrastive Learning Rivals Masked Image Modeling in Fine-tuning via Feature Distillation","code":"https://github.com/SwinTransformer/Feature-Distillation","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":10,"model":"RevCol-H (Mask2Former)","metrics":{"Params (M)":"2439","Validation mIoU":"61.0"},"uses_additional_data":true,"paper_date":"2022-12-22","paper":"/paper/reversible-column-networks","paper_url":"https://arxiv.org/abs/2212.11696v3","paper_title":"Reversible Column Networks","code":"https://github.com/megvii-research/revcol","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":3,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"MasK DINO (SwinL, multi-scale)","metrics":{"Params (M)":"223","Validation mIoU":"60.8"},"uses_additional_data":true,"paper_date":"2022-06-06","paper":"/paper/mask-dino-towards-a-unified-transformer-based-1","paper_url":"https://arxiv.org/abs/2206.02777v3","paper_title":"Mask DINO: Towards A Unified Transformer-based Framework for Object Detection and Segmentation","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":10,"syntology":{"n_ran":11,"n_unverified":2,"n_samples":13,"n_pointer_only_licence":13}},{"rank_in_archive_order":12,"model":"ViT-Adapter-L (Mask2Former, BEiT pretrain)","metrics":{"Params (M)":"571","Validation mIoU":"60.5"},"uses_additional_data":true,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":13,"model":"DINOv2 (ViT-g/14 frozen model, w/ ViT-Adapter + Mask2former)","metrics":{"Params (M)":"1080","Validation mIoU":"60.2"},"uses_additional_data":false,"paper_date":"2023-04-14","paper":"/paper/dinov2-learning-robust-visual-features","paper_url":"https://arxiv.org/abs/2304.07193v2","paper_title":"DINOv2: Learning Robust Visual Features without Supervision","code":"https://github.com/huggingface/transformers","n_code_links":26,"syntology":{"n_ran":21,"n_unverified":25,"n_samples":46,"n_pointer_only_licence":12}},{"rank_in_archive_order":14,"model":"ViT-P (OneFormer, DiNAT-L)","metrics":{"Params (M)":"309","Validation mIoU":"59.9"},"uses_additional_data":false,"paper_date":"2025-05-26","paper":"/paper/the-missing-point-in-vision-transformers-for","paper_url":"https://arxiv.org/abs/2505.19795v1","paper_title":"The Missing Point in Vision Transformers for Universal Image Segmentation","code":"https://github.com/sajjad-sh33/vit-p","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"SwinV2-G(UperNet)","metrics":{"Validation mIoU":"59.9"},"uses_additional_data":true,"paper_date":"2021-11-18","paper":"/paper/swin-transformer-v2-scaling-up-capacity-and","paper_url":"https://arxiv.org/abs/2111.09883v2","paper_title":"Swin Transformer V2: Scaling Up Capacity and Resolution","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":23,"syntology":{"n_ran":3,"n_unverified":27,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":16,"model":"PIIP-LH6B(UperNet)","metrics":{"Validation mIoU":"59.9"},"uses_additional_data":false,"paper_date":"2024-06-06","paper":"/paper/parameter-inverted-image-pyramid-networks","paper_url":"https://arxiv.org/abs/2406.04330v2","paper_title":"Parameter-Inverted Image Pyramid Networks","code":"https://github.com/opengvlab/piip","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"SERNet-Former","metrics":{"Validation mIoU":"59.35"},"uses_additional_data":false,"paper_date":"2024-01-28","paper":"/paper/sernet-former-semantic-segmentation-by","paper_url":"https://arxiv.org/abs/2401.15741v7","paper_title":"SERNet-Former: Semantic Segmentation by Efficient Residual Network with Attention-Boosting Gates and Attention-Fusion Networks","code":"https://github.com/serdarch/sernet-former","n_code_links":2,"syntology":null},{"rank_in_archive_order":18,"model":"FocalNet-L (Mask2Former)","metrics":{"Validation mIoU":"58.5"},"uses_additional_data":true,"paper_date":"2022-03-22","paper":"/paper/focal-modulation-networks","paper_url":"https://arxiv.org/abs/2203.11926v3","paper_title":"Focal Modulation Networks","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"ViT-Adapter-L (UperNet, BEiT pretrain)","metrics":{"Params (M)":"451","Validation mIoU":"58.4"},"uses_additional_data":false,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":20,"model":"RSSeg-ViT-L (BEiT pretrain)","metrics":{"Params (M)":"330","Validation mIoU":"58.4"},"uses_additional_data":false,"paper_date":"2022-12-28","paper":"/paper/representation-separation-for-semantic","paper_url":"https://arxiv.org/abs/2212.13764v1","paper_title":"Representation Separation for Semantic Segmentation with Vision Transformers","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":21,"model":"EoMT (DINOv2-L, single-scale, 512x512)","metrics":{"GFLOPs":"721","GFLOPs (512 x 512)":"721","Mean IoU (class)":"58.4","Params (M)":"316","Validation mIoU":"58.4"},"uses_additional_data":false,"paper_date":"2025-03-24","paper":"/paper/your-vit-is-secretly-an-image-segmentation-1","paper_url":"https://arxiv.org/abs/2503.19108v1","paper_title":"Your ViT is Secretly an Image Segmentation Model","code":"https://github.com/tue-mps/eomt","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":22,"model":"SegViT-v2 (BEiT-v2-Large)","metrics":{"GFLOPs (512 x 512)":"637.9","Validation mIoU":"58.2"},"uses_additional_data":false,"paper_date":"2023-06-09","paper":"/paper/segvitv2-exploring-efficient-and-continual","paper_url":"https://arxiv.org/abs/2306.06289v2","paper_title":"SegViTv2: Exploring Efficient and Continual Semantic Segmentation with Plain Vision Transformers","code":"https://github.com/zbwxp/SegVit","n_code_links":1,"syntology":null},{"rank_in_archive_order":23,"model":"SeMask (SeMask Swin-L FaPN-Mask2Former)","metrics":{"Validation mIoU":"58.2"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":24,"model":"SeMask (SeMask Swin-L MSFaPN-Mask2Former)","metrics":{"Validation mIoU":"58.2"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"DiNAT-L (Mask2Former)","metrics":{"Validation mIoU":"58.1"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":26,"model":"HorNet-L (Mask2Former)","metrics":{"Validation mIoU":"57.9"},"uses_additional_data":false,"paper_date":"2022-07-28","paper":"/paper/hornet-efficient-high-order-spatial","paper_url":"https://arxiv.org/abs/2207.14284v3","paper_title":"HorNet: Efficient High-Order Spatial Interactions with Recursive Gated Convolutions","code":"https://github.com/open-mmlab/mmclassification","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":27,"model":"Mask2Former (SwinL-FaPN)","metrics":{"Validation mIoU":"57.7"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/masked-attention-mask-transformer-for","paper_url":"https://arxiv.org/abs/2112.01527v3","paper_title":"Masked-attention Mask Transformer for Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":28,"model":"FASeg (SwinL)","metrics":{"Validation mIoU":"57.7"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/dynamic-focus-aware-positional-queries-for","paper_url":"https://arxiv.org/abs/2204.01244v3","paper_title":"Dynamic Focus-aware Positional Queries for Semantic Segmentation","code":"https://github.com/ziplab/faseg","n_code_links":2,"syntology":null},{"rank_in_archive_order":29,"model":"RR (BEiT-L)","metrics":{"Validation mIoU":"57.7"},"uses_additional_data":false,"paper_date":"2022-04-05","paper":"/paper/region-rebalance-for-long-tailed-semantic","paper_url":"https://arxiv.org/abs/2204.01969v1","paper_title":"Region Rebalance for Long-Tailed Semantic Segmentation","code":"https://github.com/dvlab-research/parametric-contrastive-learning","n_code_links":5,"syntology":null},{"rank_in_archive_order":30,"model":"MOAT-4 (IN-22K pretraining, single-scale)","metrics":{"Params (M)":"496","Validation mIoU":"57.6"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":31,"model":"Frozen Backbone, SwinV2-G-ext22K (Mask2Former)","metrics":{"Validation mIoU":"57.6"},"uses_additional_data":false,"paper_date":"2022-11-03","paper":"/paper/could-giant-pretrained-image-models-extract","paper_url":"https://arxiv.org/abs/2211.02043v1","paper_title":"Could Giant Pretrained Image Models Extract Universal Representations?","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":32,"model":"SeMask (SeMask Swin-L Mask2Former)","metrics":{"Validation mIoU":"57.5"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":33,"model":"Mask2Former (SwinL)","metrics":{"Validation mIoU":"57.3"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/masked-attention-mask-transformer-for","paper_url":"https://arxiv.org/abs/2112.01527v3","paper_title":"Masked-attention Mask Transformer for Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":34,"model":"SenFormer (BEiT-L)","metrics":{"Validation mIoU":"57.1"},"uses_additional_data":true,"paper_date":"2021-11-26","paper":"/paper/efficient-self-ensemble-framework-for-1","paper_url":"https://arxiv.org/abs/2111.13280v2","paper_title":"Efficient Self-Ensemble for Semantic Segmentation","code":"https://github.com/WalBouss/SenFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":35,"model":"BEiT-L (ViT+UperNet)","metrics":{"Validation mIoU":"57.0"},"uses_additional_data":false,"paper_date":"2021-06-15","paper":"/paper/beit-bert-pre-training-of-image-transformers","paper_url":"https://arxiv.org/abs/2106.08254v2","paper_title":"BEiT: BERT Pre-Training of Image Transformers","code":"https://github.com/huggingface/transformers","n_code_links":14,"syntology":{"n_ran":6,"n_unverified":5,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":36,"model":"SeMask(SeMask Swin-L MSFaPN-Mask2Former, single-scale)","metrics":{"Validation mIoU":"57.0"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":37,"model":"MetaPrompt-SD","metrics":{"Validation mIoU":"56.8"},"uses_additional_data":false,"paper_date":"2023-12-22","paper":"/paper/harnessing-diffusion-models-for-visual","paper_url":"https://arxiv.org/abs/2312.14733v1","paper_title":"Harnessing Diffusion Models for Visual Perception with Meta Prompts","code":"https://github.com/fudan-zvg/meta-prompts","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":38,"model":"FaPN (MaskFormer, Swin-L, ImageNet-22k pretrain)","metrics":{"Validation mIoU":"56.7"},"uses_additional_data":false,"paper_date":"2021-08-16","paper":"/paper/fapn-feature-aligned-pyramid-network-for","paper_url":"https://arxiv.org/abs/2108.07058v2","paper_title":"FaPN: Feature-aligned Pyramid Network for Dense Image Prediction","code":"https://github.com/sithu31296/semantic-segmentation","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":39,"model":"MOAT-3 (IN-22K pretraining, single-scale)","metrics":{"Params (M)":"198","Validation mIoU":"56.5"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":40,"model":"Mask2Former (Swin-L-FaPN)","metrics":{"Validation mIoU":"56.4"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/masked-attention-mask-transformer-for","paper_url":"https://arxiv.org/abs/2112.01527v3","paper_title":"Masked-attention Mask Transformer for Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":41,"model":"SeMask (SeMask Swin-L MaskFormer)","metrics":{"Validation mIoU":"56.2"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":42,"model":"dBOT ViT-L (CLIP)","metrics":{"Validation mIoU":"56.2"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":43,"model":"Mask2Former+CBL(Swin-B)","metrics":{"Validation mIoU":"56.1"},"uses_additional_data":false,"paper_date":"2023-07-05","paper":"/paper/conditional-boundary-loss-for-semantic","paper_url":"https://ieeexplore.ieee.org/document/10173725","paper_title":"Conditional Boundary Loss for Semantic Segmentation","code":"https://github.com/dywu98/CBL-Conditional-Boundary-Loss","n_code_links":1,"syntology":null},{"rank_in_archive_order":44,"model":"TADP","metrics":{"Validation mIoU":"55.9"},"uses_additional_data":false,"paper_date":"2023-09-29","paper":"/paper/text-image-alignment-for-diffusion-based","paper_url":"https://arxiv.org/abs/2310.00031v3","paper_title":"Text-image Alignment for Diffusion-based Perception","code":"https://github.com/damaggu/tadp","n_code_links":2,"syntology":null},{"rank_in_archive_order":45,"model":"CSWin-L (UperNet, ImageNet-22k pretrain)","metrics":{"Validation mIoU":"55.70"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/cswin-transformer-a-general-vision","paper_url":"https://arxiv.org/abs/2107.00652v3","paper_title":"CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":46,"model":"UniRepLKNet-XL","metrics":{"Validation mIoU":"55.6"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":47,"model":"Focal-L (UperNet, ImageNet-22k pretrain)","metrics":{"Validation mIoU":"55.40"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/focal-self-attention-for-local-global","paper_url":"https://arxiv.org/abs/2107.00641v1","paper_title":"Focal Self-attention for Local-Global Interactions in Vision Transformers","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification/Focal_Transformer","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":48,"model":"InternImage-XL","metrics":{"GFLOPs":"3142","Params (M)":"368","Validation mIoU":"55.3"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":49,"model":"dBOT ViT-L","metrics":{"Validation mIoU":"55.2"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":50,"model":"Mask2Former(Swin-B)","metrics":{"Validation mIoU":"55.1"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/masked-attention-mask-transformer-for","paper_url":"https://arxiv.org/abs/2112.01527v3","paper_title":"Masked-attention Mask Transformer for Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":51,"model":"ConvNeXt V2-H (FCMAE)","metrics":{"Validation mIoU":"55"},"uses_additional_data":false,"paper_date":"2023-01-02","paper":"/paper/convnext-v2-co-designing-and-scaling-convnets","paper_url":"https://arxiv.org/abs/2301.00808v1","paper_title":"ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoencoders","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":17,"syntology":{"n_ran":10,"n_unverified":4,"n_samples":14,"n_pointer_only_licence":9}},{"rank_in_archive_order":52,"model":"UniRepLKNet-L++","metrics":{"Validation mIoU":"55"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":53,"model":"DiNAT-Large (UperNet)","metrics":{"Validation mIoU":"54.9"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":54,"model":"MaskFormer+CBL(Swin-B)","metrics":{"Validation mIoU":"54.9"},"uses_additional_data":false,"paper_date":"2023-07-05","paper":"/paper/conditional-boundary-loss-for-semantic","paper_url":"https://ieeexplore.ieee.org/document/10173725","paper_title":"Conditional Boundary Loss for Semantic Segmentation","code":"https://github.com/dywu98/CBL-Conditional-Boundary-Loss","n_code_links":1,"syntology":null},{"rank_in_archive_order":55,"model":"TransNeXt-Base (IN-1K pretrain, Mask2Former, 512)","metrics":{"Params (M)":"109","Validation mIoU":"54.7"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/transnext-robust-foveal-visual-perception-for","paper_url":"https://arxiv.org/abs/2311.17132v3","paper_title":"TransNeXt: Robust Foveal Visual Perception for Vision Transformers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":56,"model":"MOAT-2 (IN-22K pretraining, single-scale)","metrics":{"Params (M)":"81","Validation mIoU":"54.7"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":57,"model":"CAE (ViT-L, UperNet)","metrics":{"Validation mIoU":"54.7"},"uses_additional_data":false,"paper_date":"2022-02-07","paper":"/paper/context-autoencoder-for-self-supervised","paper_url":"https://arxiv.org/abs/2202.03026v3","paper_title":"Context Autoencoder for Self-Supervised Representation Learning","code":"https://github.com/open-mmlab/mmselfsup","n_code_links":6,"syntology":null},{"rank_in_archive_order":58,"model":"VAN-B6","metrics":{"Validation mIoU":"54.7"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":59,"model":"DiNAT_s-Large (UperNet)","metrics":{"Validation mIoU":"54.6"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":60,"model":"DDP (Swin-L, step-3)","metrics":{"Params (M)":"207","Validation mIoU":"54.4"},"uses_additional_data":false,"paper_date":"2023-03-30","paper":"/paper/ddp-diffusion-model-for-dense-visual","paper_url":"https://arxiv.org/abs/2303.17559v2","paper_title":"DDP: Diffusion Model for Dense Visual Prediction","code":"https://github.com/jiyuanfeng/ddp","n_code_links":1,"syntology":null},{"rank_in_archive_order":61,"model":"PatchDiverse + Swin-L (multi-scale test, upernet, ImageNet22k pretrain)","metrics":{"Validation mIoU":"54.4"},"uses_additional_data":false,"paper_date":"2021-04-26","paper":"/paper/improve-vision-transformers-training-by","paper_url":"https://arxiv.org/abs/2104.12753v3","paper_title":"Vision Transformers with Patch Diversification","code":"https://github.com/ChengyueGongR/PatchVisionTransformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":62,"model":"VOLO-D5","metrics":{"Validation mIoU":"54.3"},"uses_additional_data":false,"paper_date":"2021-06-24","paper":"/paper/volo-vision-outlooker-for-visual-recognition","paper_url":"https://arxiv.org/abs/2106.13112v2","paper_title":"VOLO: Vision Outlooker for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":63,"model":"K-Net","metrics":{"Validation mIoU":"54.3"},"uses_additional_data":false,"paper_date":"2021-06-28","paper":"/paper/k-net-towards-unified-image-segmentation","paper_url":"https://arxiv.org/abs/2106.14855v2","paper_title":"K-Net: Towards Unified Image Segmentation","code":"https://github.com/zwwwayne/k-net","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":64,"model":"GPaCo (Swin-L)","metrics":{"Validation mIoU":"54.3"},"uses_additional_data":false,"paper_date":"2022-09-26","paper":"/paper/generalized-parametric-contrastive-learning","paper_url":"https://arxiv.org/abs/2209.12400v2","paper_title":"Generalized Parametric Contrastive Learning","code":"https://github.com/dvlab-research/parametric-contrastive-learning","n_code_links":4,"syntology":null},{"rank_in_archive_order":65,"model":"SenFormer (Swin-L)","metrics":{"Validation mIoU":"54.2"},"uses_additional_data":true,"paper_date":"2021-11-26","paper":"/paper/efficient-self-ensemble-framework-for-1","paper_url":"https://arxiv.org/abs/2111.13280v2","paper_title":"Efficient Self-Ensemble for Semantic Segmentation","code":"https://github.com/WalBouss/SenFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":66,"model":"Swin V2-H","metrics":{"Validation mIoU":"54.2"},"uses_additional_data":false,"paper_date":"2023-01-02","paper":"/paper/convnext-v2-co-designing-and-scaling-convnets","paper_url":"https://arxiv.org/abs/2301.00808v1","paper_title":"ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoencoders","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":17,"syntology":{"n_ran":10,"n_unverified":4,"n_samples":14,"n_pointer_only_licence":9}},{"rank_in_archive_order":67,"model":"InternImage-L","metrics":{"GFLOPs":"2526","Params (M)":"256","Validation mIoU":"54.1"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":68,"model":"TransNeXt-Small (IN-1K pretrain, Mask2Former, 512)","metrics":{"Params (M)":"69","Validation mIoU":"54.1"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/transnext-robust-foveal-visual-perception-for","paper_url":"https://arxiv.org/abs/2311.17132v3","paper_title":"TransNeXt: Robust Foveal Visual Perception for Vision Transformers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":69,"model":"ConvNeXt-XL++","metrics":{"GFLOPs (512 x 512)":"3335","Params (M)":"391","Validation mIoU":"54"},"uses_additional_data":false,"paper_date":"2022-01-10","paper":"/paper/a-convnet-for-the-2020s","paper_url":"https://arxiv.org/abs/2201.03545v2","paper_title":"A ConvNet for the 2020s","code":"https://github.com/keras-team/keras/blob/master/keras/applications/convnext.py","n_code_links":54,"syntology":{"n_ran":54,"n_unverified":26,"n_samples":80,"n_pointer_only_licence":11}},{"rank_in_archive_order":70,"model":"Sequential Ensemble (SegFormer)","metrics":{"Params (M)":"216.3","Validation mIoU":"54"},"uses_additional_data":false,"paper_date":"2022-10-08","paper":"/paper/sequential-ensembling-for-semantic","paper_url":"https://arxiv.org/abs/2210.05387v1","paper_title":"Sequential Ensembling for Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":71,"model":"MogaNet-XL (UperNet)","metrics":{"Validation mIoU":"54"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":72,"model":"UniRepLKNet-B++","metrics":{"Validation mIoU":"53.9"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":73,"model":"MaskFormer(Swin-B)","metrics":{"Validation mIoU":"53.8"},"uses_additional_data":false,"paper_date":"2021-07-13","paper":"/paper/per-pixel-classification-is-not-all-you-need","paper_url":"https://arxiv.org/abs/2107.06278v2","paper_title":"Per-Pixel Classification is Not All You Need for Semantic Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":3,"syntology":null},{"rank_in_archive_order":74,"model":"ConvNeXt-L++","metrics":{"GFLOPs (512 x 512)":"2458","Params (M)":"235","Validation mIoU":"53.7"},"uses_additional_data":false,"paper_date":"2022-01-10","paper":"/paper/a-convnet-for-the-2020s","paper_url":"https://arxiv.org/abs/2201.03545v2","paper_title":"A ConvNet for the 2020s","code":"https://github.com/keras-team/keras/blob/master/keras/applications/convnext.py","n_code_links":54,"syntology":{"n_ran":54,"n_unverified":26,"n_samples":80,"n_pointer_only_licence":11}},{"rank_in_archive_order":75,"model":"SwinV2-G-HTC++ Liu et al. ([2021a])","metrics":{"Validation mIoU":"53.7"},"uses_additional_data":false,"paper_date":"2021-11-18","paper":"/paper/swin-transformer-v2-scaling-up-capacity-and","paper_url":"https://arxiv.org/abs/2111.09883v2","paper_title":"Swin Transformer V2: Scaling Up Capacity and Resolution","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":23,"syntology":{"n_ran":3,"n_unverified":27,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":76,"model":"ConvNeXt V2-L","metrics":{"Validation mIoU":"53.7"},"uses_additional_data":false,"paper_date":"2023-01-02","paper":"/paper/convnext-v2-co-designing-and-scaling-convnets","paper_url":"https://arxiv.org/abs/2301.00808v1","paper_title":"ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoencoders","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":17,"syntology":{"n_ran":10,"n_unverified":4,"n_samples":14,"n_pointer_only_licence":9}},{"rank_in_archive_order":77,"model":"Seg-L-Mask/16 (MS)","metrics":{"Validation mIoU":"53.63"},"uses_additional_data":false,"paper_date":"2021-05-12","paper":"/paper/segmenter-transformer-for-semantic","paper_url":"https://arxiv.org/abs/2105.05633v3","paper_title":"Segmenter: Transformer for Semantic Segmentation","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":78,"model":"MAE (ViT-L, UperNet)","metrics":{"Validation mIoU":"53.6"},"uses_additional_data":false,"paper_date":"2021-11-11","paper":"/paper/masked-autoencoders-are-scalable-vision","paper_url":"https://arxiv.org/abs/2111.06377v2","paper_title":"Masked Autoencoders Are Scalable Vision Learners","code":"https://github.com/facebookresearch/mae","n_code_links":58,"syntology":{"n_ran":71,"n_unverified":66,"n_samples":137,"n_pointer_only_licence":73}},{"rank_in_archive_order":79,"model":"SeMask (SeMask Swin-L FPN)","metrics":{"Validation mIoU":"53.52"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":80,"model":"Swin-L (UperNet, ImageNet-22k pretrain)","metrics":{"Test Score":"62.8","Validation mIoU":"53.50"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":81,"model":"Swin-L","metrics":{"Validation mIoU":"53.5"},"uses_additional_data":false,"paper_date":"2023-01-02","paper":"/paper/convnext-v2-co-designing-and-scaling-convnets","paper_url":"https://arxiv.org/abs/2301.00808v1","paper_title":"ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoencoders","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":17,"syntology":{"n_ran":10,"n_unverified":4,"n_samples":14,"n_pointer_only_licence":9}},{"rank_in_archive_order":82,"model":"TransNeXt-Tiny (IN-1K pretrain, Mask2Former, 512)","metrics":{"Params (M)":"47.5","Validation mIoU":"53.4"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/transnext-robust-foveal-visual-perception-for","paper_url":"https://arxiv.org/abs/2311.17132v3","paper_title":"TransNeXt: Robust Foveal Visual Perception for Vision Transformers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":83,"model":"ConvNeXt-B++","metrics":{"GFLOPs (512 x 512)":"1828","Params (M)":"122","Validation mIoU":"53.1"},"uses_additional_data":false,"paper_date":"2022-01-10","paper":"/paper/a-convnet-for-the-2020s","paper_url":"https://arxiv.org/abs/2201.03545v2","paper_title":"A ConvNet for the 2020s","code":"https://github.com/keras-team/keras/blob/master/keras/applications/convnext.py","n_code_links":54,"syntology":{"n_ran":54,"n_unverified":26,"n_samples":80,"n_pointer_only_licence":11}},{"rank_in_archive_order":84,"model":"PatchConvNet-L120 (UperNet)","metrics":{"Validation mIoU":"52.9"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":85,"model":"dBOT ViT-B (CLIP)","metrics":{"Validation mIoU":"52.9"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":86,"model":"PatchConvNet-B120\n(UperNet)","metrics":{"Validation mIoU":"52.8"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":87,"model":"Swin-B","metrics":{"Validation mIoU":"52.8"},"uses_additional_data":false,"paper_date":"2023-01-02","paper":"/paper/convnext-v2-co-designing-and-scaling-convnets","paper_url":"https://arxiv.org/abs/2301.00808v1","paper_title":"ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoencoders","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":17,"syntology":{"n_ran":10,"n_unverified":4,"n_samples":14,"n_pointer_only_licence":9}},{"rank_in_archive_order":88,"model":"UniRepLKNet-S++","metrics":{"Validation mIoU":"52.7"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":89,"model":"ConvNeXt V2-B","metrics":{"Validation mIoU":"52.1"},"uses_additional_data":false,"paper_date":"2023-01-02","paper":"/paper/convnext-v2-co-designing-and-scaling-convnets","paper_url":"https://arxiv.org/abs/2301.00808v1","paper_title":"ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoencoders","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":17,"syntology":{"n_ran":10,"n_unverified":4,"n_samples":14,"n_pointer_only_licence":9}},{"rank_in_archive_order":90,"model":"DeBiFormer-B (IN1k pretrain, Upernet 160k)","metrics":{"Validation mIoU":"52.0"},"uses_additional_data":false,"paper_date":"2024-10-11","paper":"/paper/debiformer-vision-transformer-with-deformable","paper_url":"https://arxiv.org/abs/2410.08582v1","paper_title":"DeBiFormer: Vision Transformer with Deformable Agent Bi-level Routing Attention","code":"https://github.com/maclong01/DeBiFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":91,"model":"LV-ViT-L (UperNet, MS)","metrics":{"Params (M)":"209","Validation mIoU":"51.8"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/token-labeling-training-a-85-5-top-1-accuracy","paper_url":"https://arxiv.org/abs/2104.10858v3","paper_title":"All Tokens Matter: Token Labeling for Training Better Vision Transformers","code":"https://github.com/zihangJiang/TokenLabeling","n_code_links":7,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":3}},{"rank_in_archive_order":92,"model":"SegFormer-B5","metrics":{"Params (M)":"84.7","Validation mIoU":"51.8"},"uses_additional_data":true,"paper_date":"2021-05-31","paper":"/paper/segformer-simple-and-efficient-design-for","paper_url":"https://arxiv.org/abs/2105.15203v3","paper_title":"SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers","code":"https://github.com/huggingface/transformers","n_code_links":28,"syntology":{"n_ran":48,"n_unverified":38,"n_samples":86,"n_pointer_only_licence":15}},{"rank_in_archive_order":93,"model":"BiFormer-B (IN1k pretrain, Upernet 160k)","metrics":{"Validation mIoU":"51.7"},"uses_additional_data":false,"paper_date":"2023-03-15","paper":"/paper/biformer-vision-transformer-with-bi-level","paper_url":"https://arxiv.org/abs/2303.08810v1","paper_title":"BiFormer: Vision Transformer with Bi-Level Routing Attention","code":"https://github.com/rayleizhu/biformer","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":0,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":94,"model":"ConvNeXt V2-L (Supervised)","metrics":{"Validation mIoU":"51.6"},"uses_additional_data":false,"paper_date":"2023-01-02","paper":"/paper/convnext-v2-co-designing-and-scaling-convnets","paper_url":"https://arxiv.org/abs/2301.00808v1","paper_title":"ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoencoders","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":17,"syntology":{"n_ran":10,"n_unverified":4,"n_samples":14,"n_pointer_only_licence":9}},{"rank_in_archive_order":95,"model":"Light-Ham (VAN-Huge)","metrics":{"GFLOPs (512 x 512)":"71.8","Params (M)":"61.1","Validation mIoU":"51.5"},"uses_additional_data":false,"paper_date":"2021-09-09","paper":"/paper/is-attention-better-than-matrix-decomposition-1","paper_url":"https://arxiv.org/abs/2109.04553v2","paper_title":"Is Attention Better Than Matrix Decomposition?","code":"https://github.com/Gsunshine/Enjoy-Hamburger","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":96,"model":"DAT-B++","metrics":{"Validation mIoU":"51.5"},"uses_additional_data":false,"paper_date":"2023-09-04","paper":"/paper/dat-spatially-dynamic-vision-transformer-with","paper_url":"https://arxiv.org/abs/2309.01430v1","paper_title":"DAT++: Spatially Dynamic Vision Transformer with Deformable Attention","code":"https://github.com/leaplabthu/dat","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":8,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":97,"model":"CrossFormer (ImageNet1k-pretrain, UPerNet, multi-scale test)","metrics":{"Validation mIoU":"51.4"},"uses_additional_data":false,"paper_date":"2021-07-31","paper":"/paper/crossformer-a-versatile-vision-transformer","paper_url":"https://arxiv.org/abs/2108.00154v2","paper_title":"CrossFormer: A Versatile Vision Transformer Hinging on Cross-scale Attention","code":"https://github.com/cheerss/CrossFormer","n_code_links":4,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":98,"model":"InternImage-B","metrics":{"GFLOPs":"1185","Params (M)":"128","Validation mIoU":"51.3"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":99,"model":"DAT-S++","metrics":{"Validation mIoU":"51.2"},"uses_additional_data":false,"paper_date":"2023-09-04","paper":"/paper/dat-spatially-dynamic-vision-transformer-with","paper_url":"https://arxiv.org/abs/2309.01430v1","paper_title":"DAT++: Spatially Dynamic Vision Transformer with Deformable Attention","code":"https://github.com/leaplabthu/dat","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":8,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":100,"model":"ActiveMLP-L(UperNet)","metrics":{"Params (M)":"108","Validation mIoU":"51.1"},"uses_additional_data":false,"paper_date":"2022-03-11","paper":"/paper/activemlp-an-mlp-like-architecture-with","paper_url":"https://arxiv.org/abs/2203.06108v2","paper_title":"Active Token Mixer","code":"https://github.com/microsoft/TokenMixers","n_code_links":2,"syntology":null},{"rank_in_archive_order":101,"model":"SegFormer-B4","metrics":{"Params (M)":"64.1","Validation mIoU":"51.1"},"uses_additional_data":true,"paper_date":"2021-05-31","paper":"/paper/segformer-simple-and-efficient-design-for","paper_url":"https://arxiv.org/abs/2105.15203v3","paper_title":"SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers","code":"https://github.com/huggingface/transformers","n_code_links":28,"syntology":{"n_ran":48,"n_unverified":38,"n_samples":86,"n_pointer_only_licence":15}},{"rank_in_archive_order":102,"model":"PatchConvNet-B60 (UperNet)","metrics":{"Validation mIoU":"51.1"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":103,"model":"Light-Ham (VAN-Large)","metrics":{"GFLOPs (512 x 512)":"55.0","Params (M)":"45.6","Validation mIoU":"51.0"},"uses_additional_data":false,"paper_date":"2021-09-09","paper":"/paper/is-attention-better-than-matrix-decomposition-1","paper_url":"https://arxiv.org/abs/2109.04553v2","paper_title":"Is Attention Better Than Matrix Decomposition?","code":"https://github.com/Gsunshine/Enjoy-Hamburger","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":104,"model":"TEC (Vit-B, Upernet)","metrics":{"Validation mIoU":"51.0"},"uses_additional_data":false,"paper_date":"2022-10-20","paper":"/paper/towards-sustainable-self-supervised-learning","paper_url":"https://arxiv.org/abs/2210.11016v1","paper_title":"Towards Sustainable Self-supervised Learning","code":"https://github.com/sail-sg/tec","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":2,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":105,"model":"UniRepLKNet-S","metrics":{"Validation mIoU":"51"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":106,"model":"SeMask (SeMask Swin-B FPN)","metrics":{"Params (M)":"96","Validation mIoU":"50.98"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":107,"model":"InternImage-S","metrics":{"GFLOPs":"1017","Params (M)":"80","Validation mIoU":"50.9"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":108,"model":"MogaNet-L (UperNet)","metrics":{"GFLOPs (512 x 512)":"1176","Validation mIoU":"50.9"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":109,"model":"dBOT ViT-B","metrics":{"Validation mIoU":"50.8"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":110,"model":"Upernet-BiFormer-S (IN1k pretrain, Upernet 160k)","metrics":{"Validation mIoU":"50.8"},"uses_additional_data":false,"paper_date":"2023-03-15","paper":"/paper/biformer-vision-transformer-with-bi-level","paper_url":"https://arxiv.org/abs/2303.08810v1","paper_title":"BiFormer: Vision Transformer with Bi-Level Routing Attention","code":"https://github.com/rayleizhu/biformer","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":0,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":111,"model":"UperNet Shuffle-B","metrics":{"Validation mIoU":"50.5"},"uses_additional_data":false,"paper_date":"2021-06-07","paper":"/paper/shuffle-transformer-rethinking-spatial","paper_url":"https://arxiv.org/abs/2106.03650v1","paper_title":"Shuffle Transformer: Rethinking Spatial Shuffle for Vision Transformer","code":"https://github.com/alibaba/EasyCV","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":7,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":112,"model":"ConvNeXt V1-L","metrics":{"Validation mIoU":"50.5"},"uses_additional_data":false,"paper_date":"2023-01-02","paper":"/paper/convnext-v2-co-designing-and-scaling-convnets","paper_url":"https://arxiv.org/abs/2301.00808v1","paper_title":"ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoencoders","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":17,"syntology":{"n_ran":10,"n_unverified":4,"n_samples":14,"n_pointer_only_licence":9}},{"rank_in_archive_order":113,"model":"DiNAT-Base (UperNet)","metrics":{"Validation mIoU":"50.4"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":114,"model":"ELSA-Swin-S","metrics":{"Validation mIoU":"50.3"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/elsa-enhanced-local-self-attention-for-vision","paper_url":"https://arxiv.org/abs/2112.12786v1","paper_title":"ELSA: Enhanced Local Self-Attention for Vision Transformer","code":"https://github.com/damo-cv/elsa","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":115,"model":"DAT-T++","metrics":{"Validation mIoU":"50.3"},"uses_additional_data":false,"paper_date":"2023-09-04","paper":"/paper/dat-spatially-dynamic-vision-transformer-with","paper_url":"https://arxiv.org/abs/2309.01430v1","paper_title":"DAT++: Spatially Dynamic Vision Transformer with Deformable Attention","code":"https://github.com/leaplabthu/dat","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":8,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":116,"model":"SETR-MLA (160k, MS)","metrics":{"Validation mIoU":"50.28"},"uses_additional_data":false,"paper_date":"2020-12-31","paper":"/paper/rethinking-semantic-segmentation-from-a","paper_url":"https://arxiv.org/abs/2012.15840v3","paper_title":"Rethinking Semantic Segmentation from a Sequence-to-Sequence Perspective with Transformers","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":5,"syntology":null},{"rank_in_archive_order":117,"model":"VAN-Large (HamNet)","metrics":{"Params (M)":"55","Validation mIoU":"50.2"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":118,"model":"HRViT-b3 (SegFormer, SS)","metrics":{"GFLOPs (512 x 512)":"67.9","Params (M)":"28.7","Validation mIoU":"50.2"},"uses_additional_data":false,"paper_date":"2021-11-01","paper":"/paper/hrvit-multi-scale-high-resolution-vision","paper_url":"https://arxiv.org/abs/2111.01236v2","paper_title":"Multi-Scale High-Resolution Vision Transformer for Semantic Segmentation","code":"https://github.com/facebookresearch/HRViT","n_code_links":1,"syntology":null},{"rank_in_archive_order":119,"model":"Twins-SVT-L (UperNet, ImageNet-1k pretrain)","metrics":{"Validation mIoU":"50.2"},"uses_additional_data":false,"paper_date":"2021-04-28","paper":"/paper/twins-revisiting-spatial-attention-design-in","paper_url":"https://arxiv.org/abs/2104.13840v4","paper_title":"Twins: Revisiting the Design of Spatial Attention in Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":120,"model":"MogaNet-B (UperNet)","metrics":{"GFLOPs (512 x 512)":"1050","Validation mIoU":"50.1"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":121,"model":"Seg-B-Mask/16(MS, ViT-B)","metrics":{"Validation mIoU":"50.0"},"uses_additional_data":false,"paper_date":"2021-05-12","paper":"/paper/segmenter-transformer-for-semantic","paper_url":"https://arxiv.org/abs/2105.05633v3","paper_title":"Segmenter: Transformer for Semantic Segmentation","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":122,"model":"iBOT (ViT-B/16)","metrics":{"Validation mIoU":"50.0"},"uses_additional_data":false,"paper_date":"2021-11-15","paper":"/paper/ibot-image-bert-pre-training-with-online","paper_url":"https://arxiv.org/abs/2111.07832v3","paper_title":"iBOT: Image BERT Pre-Training with Online Tokenizer","code":"https://github.com/bytedance/ibot","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":123,"model":"ConvNeXt-B","metrics":{"GFLOPs (512 x 512)":"1170","Params (M)":"122","Validation mIoU":"49.9"},"uses_additional_data":false,"paper_date":"2022-01-10","paper":"/paper/a-convnet-for-the-2020s","paper_url":"https://arxiv.org/abs/2201.03545v2","paper_title":"A ConvNet for the 2020s","code":"https://github.com/keras-team/keras/blob/master/keras/applications/convnext.py","n_code_links":54,"syntology":{"n_ran":54,"n_unverified":26,"n_samples":80,"n_pointer_only_licence":11}},{"rank_in_archive_order":124,"model":"DiNAT-Small (UperNet)","metrics":{"Validation mIoU":"49.9"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":125,"model":"ConvNeXt V1-B","metrics":{"Validation mIoU":"49.9"},"uses_additional_data":false,"paper_date":"2023-01-02","paper":"/paper/convnext-v2-co-designing-and-scaling-convnets","paper_url":"https://arxiv.org/abs/2301.00808v1","paper_title":"ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoencoders","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":17,"syntology":{"n_ran":10,"n_unverified":4,"n_samples":14,"n_pointer_only_licence":9}},{"rank_in_archive_order":126,"model":"NAT-Base","metrics":{"GFLOPs (512 x 512)":"1137","Params (M)":"123","Validation mIoU":"49.7"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2204.07143v5","paper_title":"Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":127,"model":"Swin-B (UperNet, ImageNet-1k pretrain)","metrics":{"Validation mIoU":"49.7"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":128,"model":"Seg-B/8 (MS, ViT-B)","metrics":{"Validation mIoU":"49.61"},"uses_additional_data":false,"paper_date":"2021-05-12","paper":"/paper/segmenter-transformer-for-semantic","paper_url":"https://arxiv.org/abs/2105.05633v3","paper_title":"Segmenter: Transformer for Semantic Segmentation","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":129,"model":"ConvNeXt-S","metrics":{"GFLOPs (512 x 512)":"1027","Params (M)":"82","Validation mIoU":"49.6"},"uses_additional_data":false,"paper_date":"2022-01-10","paper":"/paper/a-convnet-for-the-2020s","paper_url":"https://arxiv.org/abs/2201.03545v2","paper_title":"A ConvNet for the 2020s","code":"https://github.com/keras-team/keras/blob/master/keras/applications/convnext.py","n_code_links":54,"syntology":{"n_ran":54,"n_unverified":26,"n_samples":80,"n_pointer_only_licence":11}},{"rank_in_archive_order":130,"model":"Light-Ham (VAN-Base)","metrics":{"GFLOPs (512 x 512)":"34.4","Params (M)":"27.4","Validation mIoU":"49.6"},"uses_additional_data":false,"paper_date":"2021-09-09","paper":"/paper/is-attention-better-than-matrix-decomposition-1","paper_url":"https://arxiv.org/abs/2109.04553v2","paper_title":"Is Attention Better Than Matrix Decomposition?","code":"https://github.com/Gsunshine/Enjoy-Hamburger","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":131,"model":"NAT-Small","metrics":{"GFLOPs (512 x 512)":"1010","Params (M)":"82","Validation mIoU":"49.5"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2204.07143v5","paper_title":"Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":132,"model":"DaViT-B","metrics":{"Validation mIoU":"49.4"},"uses_additional_data":false,"paper_date":"2022-04-07","paper":"/paper/davit-dual-attention-vision-transformers","paper_url":"https://arxiv.org/abs/2204.03645v1","paper_title":"DaViT: Dual Attention Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":8,"n_unverified":7,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":133,"model":"DAT-B (UperNet)","metrics":{"Params (M)":"121","Validation mIoU":"49.38"},"uses_additional_data":false,"paper_date":"2022-01-03","paper":"/paper/vision-transformer-with-deformable-attention","paper_url":"https://arxiv.org/abs/2201.00520v3","paper_title":"Vision Transformer with Deformable Attention","code":"https://github.com/leaplabthu/dat","n_code_links":2,"syntology":{"n_ran":8,"n_unverified":2,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":134,"model":"PatchConvNet-S60 (UperNet)","metrics":{"Validation mIoU":"49.3"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":135,"model":"ColorMAE-Green-ViTB-1600","metrics":{"Validation mIoU":"49.3"},"uses_additional_data":false,"paper_date":"2024-07-17","paper":"/paper/colormae-exploring-data-independent-masking","paper_url":"https://arxiv.org/abs/2407.13036v1","paper_title":"ColorMAE: Exploring data-independent masking strategies in Masked AutoEncoders","code":"https://github.com/carlosh93/ColorMAE","n_code_links":1,"syntology":null},{"rank_in_archive_order":136,"model":"MogaNet-S (UperNet)","metrics":{"GFLOPs (512 x 512)":"946","Validation mIoU":"49.2"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":137,"model":"Shift-B (UperNet)","metrics":{"Validation mIoU":"49.2"},"uses_additional_data":false,"paper_date":"2022-01-26","paper":"/paper/when-shift-operation-meets-vision-transformer","paper_url":"https://arxiv.org/abs/2201.10801v1","paper_title":"When Shift Operation Meets Vision Transformer: An Extremely Simple Alternative to Attention Mechanism","code":"https://github.com/keras-team/keras-io/blob/master/examples/vision/shiftvit.py","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":138,"model":"UniRepLKNet-T","metrics":{"Validation mIoU":"49.1"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":139,"model":"DPT-Hybrid","metrics":{"Validation mIoU":"49.02"},"uses_additional_data":false,"paper_date":"2021-03-24","paper":"/paper/vision-transformers-for-dense-prediction","paper_url":"https://arxiv.org/abs/2103.13413v1","paper_title":"Vision Transformers for Dense Prediction","code":"https://github.com/huggingface/transformers","n_code_links":15,"syntology":{"n_ran":54,"n_unverified":62,"n_samples":116,"n_pointer_only_licence":15}},{"rank_in_archive_order":140,"model":"GC ViT-B","metrics":{"GFLOPs (512 x 512)":"1348","Params (M)":"125","Validation mIoU":"49"},"uses_additional_data":false,"paper_date":"2022-06-20","paper":"/paper/global-context-vision-transformers","paper_url":"https://arxiv.org/abs/2206.09959v5","paper_title":"Global Context Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":17,"n_unverified":19,"n_samples":36,"n_pointer_only_licence":15}},{"rank_in_archive_order":141,"model":"A2MIM (ViT-B)","metrics":{"Validation mIoU":"49"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/architecture-agnostic-masked-image-modeling","paper_url":"https://arxiv.org/abs/2205.13943v4","paper_title":"Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN","code":"https://github.com/open-mmlab/mmpretrain","n_code_links":3,"syntology":null},{"rank_in_archive_order":142,"model":"EfficientViT-B3 (r512)","metrics":{"Validation mIoU":"49"},"uses_additional_data":false,"paper_date":"2022-05-29","paper":"/paper/efficientvit-enhanced-linear-attention-for","paper_url":"https://arxiv.org/abs/2205.14756v6","paper_title":"EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":143,"model":"DiNAT-Tiny (UperNet)","metrics":{"Validation mIoU":"48.8"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":144,"model":"HRViT-b2 (SegFormer, SS)","metrics":{"GFLOPs (512 x 512)":"28.0","Params (M)":"20.8","Validation mIoU":"48.76"},"uses_additional_data":false,"paper_date":"2021-11-01","paper":"/paper/hrvit-multi-scale-high-resolution-vision","paper_url":"https://arxiv.org/abs/2111.01236v2","paper_title":"Multi-Scale High-Resolution Vision Transformer for Semantic Segmentation","code":"https://github.com/facebookresearch/HRViT","n_code_links":1,"syntology":null},{"rank_in_archive_order":145,"model":"NAT-Tiny","metrics":{"GFLOPs (512 x 512)":"934","Params (M)":"58","Validation mIoU":"48.4"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2204.07143v5","paper_title":"Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":146,"model":"XCiT-M24/8 (UperNet)","metrics":{"Validation mIoU":"48.4"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/xcit-cross-covariance-image-transformers","paper_url":"https://arxiv.org/abs/2106.09681v2","paper_title":"XCiT: Cross-Covariance Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":11,"n_samples":14,"n_pointer_only_licence":3}},{"rank_in_archive_order":147,"model":"ResNeSt-200","metrics":{"Validation mIoU":"48.36"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":148,"model":"DAT-S (UperNet)","metrics":{"Params (M)":"81","Validation mIoU":"48.31"},"uses_additional_data":false,"paper_date":"2022-01-03","paper":"/paper/vision-transformer-with-deformable-attention","paper_url":"https://arxiv.org/abs/2201.00520v3","paper_title":"Vision Transformer with Deformable Attention","code":"https://github.com/leaplabthu/dat","n_code_links":2,"syntology":{"n_ran":8,"n_unverified":2,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":149,"model":"GC ViT-S","metrics":{"GFLOPs (512 x 512)":"1163","Params (M)":"84","Validation mIoU":"48.3"},"uses_additional_data":false,"paper_date":"2022-06-20","paper":"/paper/global-context-vision-transformers","paper_url":"https://arxiv.org/abs/2206.09959v5","paper_title":"Global Context Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":17,"n_unverified":19,"n_samples":36,"n_pointer_only_licence":15}},{"rank_in_archive_order":150,"model":"InternImage-T","metrics":{"GFLOPs":"944","Params (M)":"59","Validation mIoU":"48.1"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":151,"model":"VAN-Large","metrics":{"Params (M)":"49","Validation mIoU":"48.1"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":152,"model":"XCiT-S24/8 (UperNet)","metrics":{"Validation mIoU":"48.1"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/xcit-cross-covariance-image-transformers","paper_url":"https://arxiv.org/abs/2106.09681v2","paper_title":"XCiT: Cross-Covariance Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":11,"n_samples":14,"n_pointer_only_licence":3}},{"rank_in_archive_order":153,"model":"MaskFormer(ResNet-101)","metrics":{"Validation mIoU":"48.1"},"uses_additional_data":false,"paper_date":"2021-07-13","paper":"/paper/per-pixel-classification-is-not-all-you-need","paper_url":"https://arxiv.org/abs/2107.06278v2","paper_title":"Per-Pixel Classification is Not All You Need for Semantic Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":3,"syntology":null},{"rank_in_archive_order":154,"model":"MAE (ViT-B, UperNet)","metrics":{"Validation mIoU":"48.1"},"uses_additional_data":false,"paper_date":"2021-11-11","paper":"/paper/masked-autoencoders-are-scalable-vision","paper_url":"https://arxiv.org/abs/2111.06377v2","paper_title":"Masked Autoencoders Are Scalable Vision Learners","code":"https://github.com/facebookresearch/mae","n_code_links":58,"syntology":{"n_ran":71,"n_unverified":66,"n_samples":137,"n_pointer_only_licence":73}},{"rank_in_archive_order":155,"model":"HRNetV2 + OCR + RMI (PaddleClas pretrained)","metrics":{"Validation mIoU":"47.98"},"uses_additional_data":false,"paper_date":"2019-09-24","paper":"/paper/object-contextual-representations-for","paper_url":"https://arxiv.org/abs/1909.11065v6","paper_title":"Segmentation Transformer: Object-Contextual Representations for Semantic Segmentation","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":11,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":1}},{"rank_in_archive_order":156,"model":"Shift-B","metrics":{"Validation mIoU":"47.9"},"uses_additional_data":false,"paper_date":"2022-01-26","paper":"/paper/when-shift-operation-meets-vision-transformer","paper_url":"https://arxiv.org/abs/2201.10801v1","paper_title":"When Shift Operation Meets Vision Transformer: An Extremely Simple Alternative to Attention Mechanism","code":"https://github.com/keras-team/keras-io/blob/master/examples/vision/shiftvit.py","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":157,"model":"Shift-S","metrics":{"Validation mIoU":"47.8"},"uses_additional_data":false,"paper_date":"2022-01-26","paper":"/paper/when-shift-operation-meets-vision-transformer","paper_url":"https://arxiv.org/abs/2201.10801v1","paper_title":"When Shift Operation Meets Vision Transformer: An Extremely Simple Alternative to Attention Mechanism","code":"https://github.com/keras-team/keras-io/blob/master/examples/vision/shiftvit.py","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":158,"model":"MogaNet-S (Semantic FPN)","metrics":{"GFLOPs (512 x 512)":"189","Validation mIoU":"47.7"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":159,"model":"SeMask (SeMask Swin-S FPN)","metrics":{"Params (M)":"56","Validation mIoU":"47.63"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":160,"model":"ResNeSt-269","metrics":{"Validation mIoU":"47.60"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":161,"model":"UperNet Shuffle-T","metrics":{"Validation mIoU":"47.6"},"uses_additional_data":false,"paper_date":"2021-06-07","paper":"/paper/shuffle-transformer-rethinking-spatial","paper_url":"https://arxiv.org/abs/2106.03650v1","paper_title":"Shuffle Transformer: Rethinking Spatial Shuffle for Vision Transformer","code":"https://github.com/alibaba/EasyCV","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":7,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":162,"model":"CondNet(ResNest-101)","metrics":{"Validation mIoU":"47.54"},"uses_additional_data":false,"paper_date":"2021-09-21","paper":"/paper/condnet-conditional-classifier-for-scene","paper_url":"https://arxiv.org/abs/2109.10322v1","paper_title":"CondNet: Conditional Classifier for Scene Segmentation","code":"https://github.com/sithu31296/semantic-segmentation","n_code_links":2,"syntology":null},{"rank_in_archive_order":163,"model":"tiny-MOAT-3 (IN-1K pretraining, single scale)","metrics":{"Params (M)":"24","Validation mIoU":"47.5"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":164,"model":"CondNet(ResNet-101)","metrics":{"Validation mIoU":"47.38"},"uses_additional_data":false,"paper_date":"2021-09-21","paper":"/paper/condnet-conditional-classifier-for-scene","paper_url":"https://arxiv.org/abs/2109.10322v1","paper_title":"CondNet: Conditional Classifier for Scene Segmentation","code":"https://github.com/sithu31296/semantic-segmentation","n_code_links":2,"syntology":null},{"rank_in_archive_order":165,"model":"DiNAT-Mini (UperNet)","metrics":{"Validation mIoU":"47.2"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":166,"model":"DCNAS","metrics":{"Validation mIoU":"47.12"},"uses_additional_data":false,"paper_date":"2020-03-26","paper":"/paper/dcnas-densely-connected-neural-architecture","paper_url":"https://arxiv.org/abs/2003.11883v2","paper_title":"DCNAS: Densely Connected Neural Architecture Search for Semantic Image Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":167,"model":"XCiT-S24/8 (Semantic-FPN)","metrics":{"Validation mIoU":"47.1"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/xcit-cross-covariance-image-transformers","paper_url":"https://arxiv.org/abs/2106.09681v2","paper_title":"XCiT: Cross-Covariance Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":11,"n_samples":14,"n_pointer_only_licence":3}},{"rank_in_archive_order":168,"model":"ResNeSt-101","metrics":{"Validation mIoU":"46.91"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":169,"model":"XCiT-M24/8 (Semantic-FPN)","metrics":{"Validation mIoU":"46.9"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/xcit-cross-covariance-image-transformers","paper_url":"https://arxiv.org/abs/2106.09681v2","paper_title":"XCiT: Cross-Covariance Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":11,"n_samples":14,"n_pointer_only_licence":3}},{"rank_in_archive_order":170,"model":"HamNet (ResNet-101)","metrics":{"Validation mIoU":"46.8"},"uses_additional_data":false,"paper_date":"2021-09-09","paper":"/paper/is-attention-better-than-matrix-decomposition-1","paper_url":"https://arxiv.org/abs/2109.04553v2","paper_title":"Is Attention Better Than Matrix Decomposition?","code":"https://github.com/Gsunshine/Enjoy-Hamburger","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":171,"model":"Sequential Ensemble (DeepLabv3+)","metrics":{"Validation mIoU":"46.8"},"uses_additional_data":false,"paper_date":"2022-10-08","paper":"/paper/sequential-ensembling-for-semantic","paper_url":"https://arxiv.org/abs/2210.05387v1","paper_title":"Sequential Ensembling for Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":172,"model":"ConvNeXt-T","metrics":{"GFLOPs (512 x 512)":"939","Params (M)":"60","Validation mIoU":"46.7"},"uses_additional_data":false,"paper_date":"2022-01-10","paper":"/paper/a-convnet-for-the-2020s","paper_url":"https://arxiv.org/abs/2201.03545v2","paper_title":"A ConvNet for the 2020s","code":"https://github.com/keras-team/keras/blob/master/keras/applications/convnext.py","n_code_links":54,"syntology":{"n_ran":54,"n_unverified":26,"n_samples":80,"n_pointer_only_licence":11}},{"rank_in_archive_order":173,"model":"VAN-Base (Semantic-FPN)","metrics":{"Validation mIoU":"46.7"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":174,"model":"XCiT-S12/8 (UperNet)","metrics":{"Validation mIoU":"46.6"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/xcit-cross-covariance-image-transformers","paper_url":"https://arxiv.org/abs/2106.09681v2","paper_title":"XCiT: Cross-Covariance Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":11,"n_samples":14,"n_pointer_only_licence":3}},{"rank_in_archive_order":175,"model":"GC ViT-T","metrics":{"GFLOPs (512 x 512)":"947","Params (M)":"58","Validation mIoU":"46.5"},"uses_additional_data":false,"paper_date":"2022-06-20","paper":"/paper/global-context-vision-transformers","paper_url":"https://arxiv.org/abs/2206.09959v5","paper_title":"Global Context Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":17,"n_unverified":19,"n_samples":36,"n_pointer_only_licence":15}},{"rank_in_archive_order":176,"model":"NAT-Mini","metrics":{"GFLOPs (512 x 512)":"900","Params (M)":"50","Validation mIoU":"46.4"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2204.07143v5","paper_title":"Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":177,"model":"Shift-T","metrics":{"Validation mIoU":"46.3"},"uses_additional_data":false,"paper_date":"2022-01-26","paper":"/paper/when-shift-operation-meets-vision-transformer","paper_url":"https://arxiv.org/abs/2201.10801v1","paper_title":"When Shift Operation Meets Vision Transformer: An Extremely Simple Alternative to Attention Mechanism","code":"https://github.com/keras-team/keras-io/blob/master/examples/vision/shiftvit.py","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":178,"model":"DaViT-T","metrics":{"Validation mIoU":"46.3"},"uses_additional_data":false,"paper_date":"2022-04-07","paper":"/paper/davit-dual-attention-vision-transformers","paper_url":"https://arxiv.org/abs/2204.03645v1","paper_title":"DaViT: Dual Attention Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":8,"n_unverified":7,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":179,"model":"CPN(ResNet-101)","metrics":{"Validation mIoU":"46.27"},"uses_additional_data":false,"paper_date":"2020-04-03","paper":"/paper/context-prior-for-scene-segmentation","paper_url":"https://arxiv.org/abs/2004.01547v1","paper_title":"Context Prior for Scene Segmentation","code":"https://github.com/ycszen/ContextPrior","n_code_links":2,"syntology":null},{"rank_in_archive_order":180,"model":"MultiMAE (ViT-B)","metrics":{"Validation mIoU":"46.2"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/multimae-multi-modal-multi-task-masked","paper_url":"https://arxiv.org/abs/2204.01678v1","paper_title":"MultiMAE: Multi-modal Multi-task Masked Autoencoders","code":"https://github.com/EPFL-VILAB/MultiMAE","n_code_links":1,"syntology":null},{"rank_in_archive_order":181,"model":"DRAN(ResNet-101)","metrics":{"Validation mIoU":"46.18"},"uses_additional_data":false,"paper_date":"2020-08-05","paper":"/paper/scene-segmentation-with-dual-relation-aware","paper_url":"https://ieeexplore.ieee.org/document/9154612","paper_title":"Scene Segmentation with Dual Relation-aware Attention Network","code":"https://github.com/junfu1115/DRAN","n_code_links":1,"syntology":null},{"rank_in_archive_order":182,"model":"PyConvSegNet-152","metrics":{"Test Score":"56.52","Validation mIoU":"45.99"},"uses_additional_data":false,"paper_date":"2020-06-20","paper":"/paper/pyramidal-convolution-rethinking","paper_url":"https://arxiv.org/abs/2006.11538v1","paper_title":"Pyramidal Convolution: Rethinking Convolutional Neural Networks for Visual Recognition","code":"https://github.com/iduta/pyconv","n_code_links":3,"syntology":null},{"rank_in_archive_order":183,"model":"DNL","metrics":{"Validation mIoU":"45.97"},"uses_additional_data":false,"paper_date":"2020-06-11","paper":"/paper/disentangled-non-local-neural-networks","paper_url":"https://arxiv.org/abs/2006.06668v2","paper_title":"Disentangled Non-Local Neural Networks","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":184,"model":"ACNet (ResNet-101)","metrics":{"Validation mIoU":"45.90"},"uses_additional_data":false,"paper_date":"2019-11-05","paper":"/paper/adaptive-context-network-for-scene-parsing-1","paper_url":"https://arxiv.org/abs/1911.01664v1","paper_title":"Adaptive Context Network for Scene Parsing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":185,"model":"ACNet\n(ResNet-101)","metrics":{"Validation mIoU":"45.90"},"uses_additional_data":false,"paper_date":"2019-11-05","paper":"/paper/adaptive-context-network-for-scene-parsing-1","paper_url":"https://arxiv.org/abs/1911.01664v1","paper_title":"Adaptive Context Network for Scene Parsing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":186,"model":"HRViT-b1 (SegFormer, SS)","metrics":{"GFLOPs (512 x 512)":"14.6","Params (M)":"8.2","Validation mIoU":"45.88"},"uses_additional_data":false,"paper_date":"2021-11-01","paper":"/paper/hrvit-multi-scale-high-resolution-vision","paper_url":"https://arxiv.org/abs/2111.01236v2","paper_title":"Multi-Scale High-Resolution Vision Transformer for Semantic Segmentation","code":"https://github.com/facebookresearch/HRViT","n_code_links":1,"syntology":null},{"rank_in_archive_order":187,"model":"OCR(HRNetV2-W48)","metrics":{"Validation mIoU":"45.66"},"uses_additional_data":false,"paper_date":"2019-09-24","paper":"/paper/object-contextual-representations-for","paper_url":"https://arxiv.org/abs/1909.11065v6","paper_title":"Segmentation Transformer: Object-Contextual Representations for Semantic Segmentation","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":11,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":1}},{"rank_in_archive_order":188,"model":"SPNet (ResNet-101)","metrics":{"Validation mIoU":"45.6"},"uses_additional_data":false,"paper_date":"2020-03-30","paper":"/paper/2003-13328","paper_url":"https://arxiv.org/abs/2003.13328v1","paper_title":"Strip Pooling: Rethinking Spatial Pooling for Scene Parsing","code":"https://github.com/Andrew-Qibin/SPNet","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":9,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":189,"model":"Swin-T (UPerNet) MoBY","metrics":{"Validation mIoU":"45.58"},"uses_additional_data":false,"paper_date":"2021-05-10","paper":"/paper/self-supervised-learning-with-swin","paper_url":"https://arxiv.org/abs/2105.04553v2","paper_title":"Self-Supervised Learning with Swin Transformers","code":"https://github.com/microsoft/Swin-Transformer","n_code_links":6,"syntology":null},{"rank_in_archive_order":190,"model":"DAT-T (UperNet)","metrics":{"Params (M)":"60","Validation mIoU":"45.54"},"uses_additional_data":false,"paper_date":"2022-01-03","paper":"/paper/vision-transformer-with-deformable-attention","paper_url":"https://arxiv.org/abs/2201.00520v3","paper_title":"Vision Transformer with Deformable Attention","code":"https://github.com/leaplabthu/dat","n_code_links":2,"syntology":{"n_ran":8,"n_unverified":2,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":191,"model":"iBOT (ViT-S/16)","metrics":{"Validation mIoU":"45.4"},"uses_additional_data":false,"paper_date":"2021-11-15","paper":"/paper/ibot-image-bert-pre-training-with-online","paper_url":"https://arxiv.org/abs/2111.07832v3","paper_title":"iBOT: Image BERT Pre-Training with Online Tokenizer","code":"https://github.com/bytedance/ibot","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":192,"model":"EANet\n(ResNet-101)","metrics":{"Validation mIoU":"45.33"},"uses_additional_data":false,"paper_date":"2021-05-05","paper":"/paper/beyond-self-attention-external-attention","paper_url":"https://arxiv.org/abs/2105.02358v2","paper_title":"Beyond Self-attention: External Attention using Two Linear Layers for Visual Tasks","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":7,"syntology":null},{"rank_in_archive_order":193,"model":"OCR (ResNet-101)","metrics":{"Validation mIoU":"45.28"},"uses_additional_data":false,"paper_date":"2019-09-24","paper":"/paper/object-contextual-representations-for","paper_url":"https://arxiv.org/abs/1909.11065v6","paper_title":"Segmentation Transformer: Object-Contextual Representations for Semantic Segmentation","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":11,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":1}},{"rank_in_archive_order":194,"model":"Asymmetric ALNN","metrics":{"Validation mIoU":"45.24"},"uses_additional_data":false,"paper_date":"2019-08-21","paper":"/paper/asymmetric-non-local-neural-networks-for","paper_url":"https://arxiv.org/abs/1908.07678v5","paper_title":"Asymmetric Non-local Neural Networks for Semantic Segmentation","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":195,"model":"Light-Ham (VAN-Small, D=256)","metrics":{"GFLOPs (512 x 512)":"15.8","Params (M)":"13.8","Validation mIoU":"45.2"},"uses_additional_data":false,"paper_date":"2021-09-09","paper":"/paper/is-attention-better-than-matrix-decomposition-1","paper_url":"https://arxiv.org/abs/2109.04553v2","paper_title":"Is Attention Better Than Matrix Decomposition?","code":"https://github.com/Gsunshine/Enjoy-Hamburger","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":196,"model":"LaU-regression-loss","metrics":{"Test Score":"56.32","Validation mIoU":"45.02"},"uses_additional_data":false,"paper_date":"2019-11-13","paper":"/paper/location-aware-upsampling-for-semantic","paper_url":"https://arxiv.org/abs/1911.05250v2","paper_title":"Location-aware Upsampling for Semantic Segmentation","code":"https://github.com/HolmesShuan/Location-aware-Upsampling-for-Semantic-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":197,"model":"PSPNet","metrics":{"Test Score":"55.38","Validation mIoU":"44.94"},"uses_additional_data":false,"paper_date":"2016-12-04","paper":"/paper/pyramid-scene-parsing-network","paper_url":"http://arxiv.org/abs/1612.01105v2","paper_title":"Pyramid Scene Parsing Network","code":"https://github.com/tensorflow/models","n_code_links":67,"syntology":{"n_ran":7,"n_unverified":22,"n_samples":29,"n_pointer_only_licence":5}},{"rank_in_archive_order":198,"model":"tiny-MOAT-2 (IN-1K pretraining, single scale)","metrics":{"Params (M)":"13","Validation mIoU":"44.9"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":199,"model":"CFNet(ResNet-101)","metrics":{"Validation mIoU":"44.89"},"uses_additional_data":false,"paper_date":"2019-06-01","paper":"/paper/co-occurrent-features-in-semantic","paper_url":"http://openaccess.thecvf.com/content_CVPR_2019/html/Zhang_Co-Occurrent_Features_in_Semantic_Segmentation_CVPR_2019_paper.html","paper_title":"Co-Occurrent Features in Semantic Segmentation","code":"https://github.com/zhanghang1989/PyTorch-Encoding","n_code_links":2,"syntology":null},{"rank_in_archive_order":200,"model":"EncNet","metrics":{"Test Score":"55.67","Validation mIoU":"44.65"},"uses_additional_data":false,"paper_date":"2018-03-23","paper":"/paper/context-encoding-for-semantic-segmentation","paper_url":"http://arxiv.org/abs/1803.08904v1","paper_title":"Context Encoding for Semantic Segmentation","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":12,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":7}},{"rank_in_archive_order":201,"model":"LaU-offset-loss","metrics":{"Test Score":"56.41","Validation mIoU":"44.55"},"uses_additional_data":false,"paper_date":"2019-11-13","paper":"/paper/location-aware-upsampling-for-semantic","paper_url":"https://arxiv.org/abs/1911.05250v2","paper_title":"Location-aware Upsampling for Semantic Segmentation","code":"https://github.com/HolmesShuan/Location-aware-Upsampling-for-Semantic-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":202,"model":"EncNet + JPU","metrics":{"Test Score":"55.84","Validation mIoU":"44.34"},"uses_additional_data":false,"paper_date":"2019-03-28","paper":"/paper/fastfcn-rethinking-dilated-convolution-in-the","paper_url":"http://arxiv.org/abs/1903.11816v1","paper_title":"FastFCN: Rethinking Dilated Convolution in the Backbone for Semantic Segmentation","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":12,"syntology":null},{"rank_in_archive_order":203,"model":"SGR (ResNet-101)","metrics":{"Validation mIoU":"44.32"},"uses_additional_data":false,"paper_date":"2018-12-01","paper":"/paper/symbolic-graph-reasoning-meets-convolutions","paper_url":"http://papers.nips.cc/paper/7456-symbolic-graph-reasoning-meets-convolutions","paper_title":"Symbolic Graph Reasoning Meets Convolutions","code":"https://github.com/julianschoep/SGRLayer","n_code_links":1,"syntology":null},{"rank_in_archive_order":204,"model":"XCiT-S12/8 (Semantic-FPN)","metrics":{"Validation mIoU":"44.2"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/xcit-cross-covariance-image-transformers","paper_url":"https://arxiv.org/abs/2106.09681v2","paper_title":"XCiT: Cross-Covariance Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":11,"n_samples":14,"n_pointer_only_licence":3}},{"rank_in_archive_order":205,"model":"Auto-DeepLab-L","metrics":{"Validation mIoU":"43.98"},"uses_additional_data":false,"paper_date":"2019-01-10","paper":"/paper/auto-deeplab-hierarchical-neural-architecture","paper_url":"http://arxiv.org/abs/1901.02985v2","paper_title":"Auto-DeepLab: Hierarchical Neural Architecture Search for Semantic Image Segmentation","code":"https://github.com/tensorflow/models","n_code_links":12,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":1}},{"rank_in_archive_order":206,"model":"PSANet (ResNet-101)","metrics":{"Validation mIoU":"43.77"},"uses_additional_data":false,"paper_date":"2018-09-01","paper":"/paper/psanet-point-wise-spatial-attention-network","paper_url":"http://openaccess.thecvf.com/content_ECCV_2018/html/Hengshuang_Zhao_PSANet_Point-wise_Spatial_ECCV_2018_paper.html","paper_title":"PSANet: Point-wise Spatial Attention Network for Scene Parsing","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":4,"syntology":null},{"rank_in_archive_order":207,"model":"DSSPN (ResNet-101)","metrics":{"Validation mIoU":"43.68"},"uses_additional_data":false,"paper_date":"2018-03-16","paper":"/paper/dynamic-structured-semantic-propagation","paper_url":"http://arxiv.org/abs/1803.06067v1","paper_title":"Dynamic-structured Semantic Propagation Network","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":208,"model":"PSPNet (ResNet-152)","metrics":{"Validation mIoU":"43.51"},"uses_additional_data":false,"paper_date":"2016-12-04","paper":"/paper/pyramid-scene-parsing-network","paper_url":"http://arxiv.org/abs/1612.01105v2","paper_title":"Pyramid Scene Parsing Network","code":"https://github.com/tensorflow/models","n_code_links":67,"syntology":{"n_ran":7,"n_unverified":22,"n_samples":29,"n_pointer_only_licence":5}},{"rank_in_archive_order":209,"model":"PSPNet\n(ResNet-101)","metrics":{"Validation mIoU":"43.29"},"uses_additional_data":false,"paper_date":"2016-12-04","paper":"/paper/pyramid-scene-parsing-network","paper_url":"http://arxiv.org/abs/1612.01105v2","paper_title":"Pyramid Scene Parsing Network","code":"https://github.com/tensorflow/models","n_code_links":67,"syntology":{"n_ran":7,"n_unverified":22,"n_samples":29,"n_pointer_only_licence":5}},{"rank_in_archive_order":210,"model":"HRNetV2","metrics":{"Validation mIoU":"43.2"},"uses_additional_data":false,"paper_date":"2019-04-09","paper":"/paper/high-resolution-representations-for-labeling","paper_url":"http://arxiv.org/abs/1904.04514v1","paper_title":"High-Resolution Representations for Labeling Pixels and Regions","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":39,"syntology":{"n_ran":3,"n_unverified":15,"n_samples":18,"n_pointer_only_licence":5}},{"rank_in_archive_order":211,"model":"SeMask (SeMask Swin-T FPN)","metrics":{"Params (M)":"35","Validation mIoU":"43.16"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/semask-semantically-masked-transformers-for-1","paper_url":"https://arxiv.org/abs/2112.12782v3","paper_title":"SeMask: Semantically Masked Transformers for Semantic Segmentation","code":"https://github.com/Picsart-AI-Research/SeMask-Segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":212,"model":"tiny-MOAT-1 (IN-1K pretraining, single scale)","metrics":{"Params (M)":"8","Validation mIoU":"43.1"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":213,"model":"VAN-Small","metrics":{"Params (M)":"18","Validation mIoU":"42.9"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":214,"model":"PoolFormer-M48","metrics":{"Validation mIoU":"42.7"},"uses_additional_data":false,"paper_date":"2021-11-22","paper":"/paper/metaformer-is-actually-what-you-need-for","paper_url":"https://arxiv.org/abs/2111.11418v3","paper_title":"MetaFormer Is Actually What You Need for Vision","code":"https://github.com/huggingface/transformers","n_code_links":18,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":215,"model":"UperNet (ResNet-101)","metrics":{"Validation mIoU":"42.66"},"uses_additional_data":false,"paper_date":"2018-07-26","paper":"/paper/unified-perceptual-parsing-for-scene","paper_url":"http://arxiv.org/abs/1807.10221v1","paper_title":"Unified Perceptual Parsing for Scene Understanding","code":"https://github.com/open-mmlab/mmsegmentation","n_code_links":25,"syntology":{"n_ran":9,"n_unverified":19,"n_samples":28,"n_pointer_only_licence":0}},{"rank_in_archive_order":216,"model":"tiny-MOAT-0 (IN-1K pretraining, single scale)","metrics":{"Params (M)":"6","Validation mIoU":"41.2"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":217,"model":"RefineNet","metrics":{"Validation mIoU":"40.7"},"uses_additional_data":false,"paper_date":"2016-11-20","paper":"/paper/refinenet-multi-path-refinement-networks-for","paper_url":"http://arxiv.org/abs/1611.06612v3","paper_title":"RefineNet: Multi-Path Refinement Networks for High-Resolution Semantic Segmentation","code":"https://github.com/guosheng/refinenet","n_code_links":13,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":1}},{"rank_in_archive_order":218,"model":"FBNetV5","metrics":{"Validation mIoU":"40.4"},"uses_additional_data":false,"paper_date":"2021-11-19","paper":"/paper/fbnetv5-neural-architecture-search-for","paper_url":"https://arxiv.org/abs/2111.10007v3","paper_title":"FBNetV5: Neural Architecture Search for Multiple Tasks in One Run","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":219,"model":"ConvMLP-L","metrics":{"Validation mIoU":"40"},"uses_additional_data":false,"paper_date":"2021-09-09","paper":"/paper/convmlp-hierarchical-convolutional-mlps-for","paper_url":"https://arxiv.org/abs/2109.04454v2","paper_title":"ConvMLP: Hierarchical Convolutional MLPs for Vision","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":220,"model":"ConvMLP-M","metrics":{"Validation mIoU":"38.6"},"uses_additional_data":false,"paper_date":"2021-09-09","paper":"/paper/convmlp-hierarchical-convolutional-mlps-for","paper_url":"https://arxiv.org/abs/2109.04454v2","paper_title":"ConvMLP: Hierarchical Convolutional MLPs for Vision","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":221,"model":"VAN-Tiny","metrics":{"Params (M)":"8","Validation mIoU":"38.5"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":222,"model":"A2MIM (ResNet-50)","metrics":{"Validation mIoU":"38.3"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/architecture-agnostic-masked-image-modeling","paper_url":"https://arxiv.org/abs/2205.13943v4","paper_title":"Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN","code":"https://github.com/open-mmlab/mmpretrain","n_code_links":3,"syntology":null},{"rank_in_archive_order":223,"model":"iBOT (ViT-B/16) (linear head)","metrics":{"Validation mIoU":"38.3"},"uses_additional_data":false,"paper_date":"2021-11-15","paper":"/paper/ibot-image-bert-pre-training-with-online","paper_url":"https://arxiv.org/abs/2111.07832v3","paper_title":"iBOT: Image BERT Pre-Training with Online Tokenizer","code":"https://github.com/bytedance/ibot","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":224,"model":"SegFormer-B0","metrics":{"Params (M)":"3.8","Validation mIoU":"37.4"},"uses_additional_data":true,"paper_date":"2021-05-31","paper":"/paper/segformer-simple-and-efficient-design-for","paper_url":"https://arxiv.org/abs/2105.15203v3","paper_title":"SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers","code":"https://github.com/huggingface/transformers","n_code_links":28,"syntology":{"n_ran":48,"n_unverified":38,"n_samples":86,"n_pointer_only_licence":15}},{"rank_in_archive_order":225,"model":"MUXNet-m + PPM","metrics":{"Validation mIoU":"35.8"},"uses_additional_data":false,"paper_date":"2020-03-31","paper":"/paper/muxconv-information-multiplexing-in","paper_url":"https://arxiv.org/abs/2003.13880v2","paper_title":"MUXConv: Information Multiplexing in Convolutional Neural Networks","code":"https://github.com/human-analysis/MUXConv","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":226,"model":"ConvMLP-S","metrics":{"Validation mIoU":"35.8"},"uses_additional_data":false,"paper_date":"2021-09-09","paper":"/paper/convmlp-hierarchical-convolutional-mlps-for","paper_url":"https://arxiv.org/abs/2109.04454v2","paper_title":"ConvMLP: Hierarchical Convolutional MLPs for Vision","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":227,"model":"MUXNet-m + C1","metrics":{"Validation mIoU":"32.42"},"uses_additional_data":false,"paper_date":"2020-03-31","paper":"/paper/muxconv-information-multiplexing-in","paper_url":"https://arxiv.org/abs/2003.13880v2","paper_title":"MUXConv: Information Multiplexing in Convolutional Neural Networks","code":"https://github.com/human-analysis/MUXConv","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":228,"model":"DilatedNet","metrics":{"Validation mIoU":"32.31"},"uses_additional_data":false,"paper_date":"2015-11-23","paper":"/paper/multi-scale-context-aggregation-by-dilated","paper_url":"http://arxiv.org/abs/1511.07122v3","paper_title":"Multi-Scale Context Aggregation by Dilated Convolutions","code":"https://github.com/fyu/dilation","n_code_links":9,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":2}},{"rank_in_archive_order":229,"model":"FCN","metrics":{"Validation mIoU":"29.39"},"uses_additional_data":true,"paper_date":"2014-11-14","paper":"/paper/fully-convolutional-networks-for-semantic-1","paper_url":"http://arxiv.org/abs/1411.4038v2","paper_title":"Fully Convolutional Networks for Semantic Segmentation","code":"https://github.com/pochih/fcn-pytorch","n_code_links":51,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":230,"model":"SegNet","metrics":{"Validation mIoU":"21.64"},"uses_additional_data":false,"paper_date":"2015-11-02","paper":"/paper/segnet-a-deep-convolutional-encoder-decoder","paper_url":"http://arxiv.org/abs/1511.00561v3","paper_title":"SegNet: A Deep Convolutional Encoder-Decoder Architecture for Image Segmentation","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":74,"syntology":{"n_ran":9,"n_unverified":35,"n_samples":44,"n_pointer_only_licence":10}},{"rank_in_archive_order":231,"model":"InternImage-H (M3I Pre-training)","metrics":{"Params (M)":"1310"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":232,"model":"FastViT-MA36","metrics":{"Mean IoU (class)":"44.6"},"uses_additional_data":false,"paper_date":"2023-03-24","paper":"/paper/fastvit-a-fast-hybrid-vision-transformer","paper_url":"https://arxiv.org/abs/2303.14189v2","paper_title":"FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":233,"model":"FastViT-SA36","metrics":{"Mean IoU (class)":"42.9"},"uses_additional_data":false,"paper_date":"2023-03-24","paper":"/paper/fastvit-a-fast-hybrid-vision-transformer","paper_url":"https://arxiv.org/abs/2303.14189v2","paper_title":"FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":234,"model":"FastViT-SA24","metrics":{"Mean IoU (class)":"41"},"uses_additional_data":false,"paper_date":"2023-03-24","paper":"/paper/fastvit-a-fast-hybrid-vision-transformer","paper_url":"https://arxiv.org/abs/2303.14189v2","paper_title":"FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":235,"model":"FastViT-SA12","metrics":{"Mean IoU (class)":"38"},"uses_additional_data":false,"paper_date":"2023-03-24","paper":"/paper/fastvit-a-fast-hybrid-vision-transformer","paper_url":"https://arxiv.org/abs/2303.14189v2","paper_title":"FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":5}}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":156,"rows_with_any_sample_ran":137,"distinct_papers_with_graph_line":67,"distinct_papers_with_any_sample_ran":59,"samples_over_distinct_papers":{"n_ran":572,"n_unverified":666,"n_samples":1238,"n_pointer_only_licence":304,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":1464,"n_unverified":1500,"n_samples":2964,"n_pointer_only_licence":712,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}