{"url":"/sota/semantic-segmentation-on-nyu-depth-v2","task":{"name":"Semantic Segmentation","url":"/task/semantic-segmentation","note":null},"dataset":{"name":"NYU Depth v2","url":"/dataset/nyuv2"},"category":"Computer Vision","categories":["Computer Code","Computer Vision","Medical","Robots"],"category_note":null,"description":null,"description_from":null,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Mean IoU","Mean Accuracy"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Mean IoU":"higher","Mean Accuracy":"higher"}},"counts":{"rows":121,"rows_with_code":86,"rows_with_paper_page":121,"rows_dated":121,"rows_using_additional_data":5},"rows":[{"rank_in_archive_order":1,"model":"OmniVec2","metrics":{"Mean IoU":"63.6"},"uses_additional_data":true,"paper_date":"2024-01-01","paper":"/paper/omnivec2-a-novel-transformer-based-network","paper_url":"http://openaccess.thecvf.com//content/CVPR2024/html/Srivastava_OmniVec2_-_A_Novel_Transformer_based_Network_for_Large_Scale_CVPR_2024_paper.html","paper_title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":2,"model":"DiffusionMMS (DAT++-S)","metrics":{"Mean IoU":"61.5"},"uses_additional_data":false,"paper_date":"2024-09-23","paper":"/paper/diffusion-based-rgb-d-semantic-segmentation","paper_url":"https://arxiv.org/abs/2409.15117v2","paper_title":"Diffusion-based RGB-D Semantic Segmentation with Deformable Attention Transformer","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":3,"model":"DepthMatch (DINOv2-S)","metrics":{"Mean IoU":"61.4"},"uses_additional_data":true,"paper_date":"2025-05-26","paper":"/paper/depthmatch-semi-supervised-rgb-d-scene","paper_url":"https://arxiv.org/abs/2505.20041v1","paper_title":"DepthMatch: Semi-Supervised RGB-D Scene Parsing through Depth-Guided Regularization","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":4,"model":"GeminiFusion (Swin-Large)","metrics":{"Mean IoU":"60.9"},"uses_additional_data":true,"paper_date":"2024-06-03","paper":"/paper/geminifusion-efficient-pixel-wise-multimodal","paper_url":"https://arxiv.org/abs/2406.01210v2","paper_title":"GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer","code":"https://github.com/jiadingcn/geminifusion","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":3,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"OmniVec","metrics":{"Mean IoU":"60.8"},"uses_additional_data":true,"paper_date":"2023-11-07","paper":"/paper/omnivec-learning-robust-representations-with","paper_url":"https://arxiv.org/abs/2311.05709v1","paper_title":"OmniVec: Learning robust representations with cross modal sharing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":6,"model":"GeminiFusion (Swin-Large)","metrics":{"Mean IoU":"60.2"},"uses_additional_data":false,"paper_date":"2024-06-03","paper":"/paper/geminifusion-efficient-pixel-wise-multimodal","paper_url":"https://arxiv.org/abs/2406.01210v2","paper_title":"GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer","code":"https://github.com/jiadingcn/geminifusion","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":3,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"DPLNet","metrics":{"Mean IoU":"59.3"},"uses_additional_data":false,"paper_date":"2023-12-01","paper":"/paper/efficient-multimodal-semantic-segmentation","paper_url":"https://arxiv.org/abs/2312.00360v2","paper_title":"Efficient Multimodal Semantic Segmentation via Dual-Prompt Learning","code":"https://github.com/shaohuadong2021/dplnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":8,"model":"HDBFormer","metrics":{"Mean IoU":"59.3%"},"uses_additional_data":false,"paper_date":"2025-04-18","paper":"/paper/hdbformer-efficient-rgb-d-semantic","paper_url":"https://arxiv.org/abs/2504.13579v1","paper_title":"HDBFormer: Efficient RGB-D Semantic Segmentation with A Heterogeneous Dual-Branch Framework","code":"https://github.com/weishuobin/hdbformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":9,"model":"EMSANet (2x ResNet-34 NBt1D, PanopticNDT version, finetuned)","metrics":{"Mean IoU":"59.02"},"uses_additional_data":false,"paper_date":"2023-09-24","paper":"/paper/panopticndt-efficient-and-robust-panoptic","paper_url":"https://arxiv.org/abs/2309.13635v2","paper_title":"PanopticNDT: Efficient and Robust Panoptic Mapping","code":"https://github.com/tui-nicr/emsanet","n_code_links":4,"syntology":{"n_ran":3,"n_unverified":9,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"DFormerv2-L","metrics":{"Mean IoU":"58.4%"},"uses_additional_data":false,"paper_date":"2025-04-07","paper":"/paper/dformerv2-geometry-self-attention-for-rgbd","paper_url":"https://arxiv.org/abs/2504.04701v1","paper_title":"DFormerv2: Geometry Self-Attention for RGBD Semantic Segmentation","code":"https://github.com/VCIP-RGBD/DFormer","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"SwinMTL","metrics":{"Mean IoU":"58.14%"},"uses_additional_data":false,"paper_date":"2024-03-15","paper":"/paper/swinmtl-a-shared-architecture-for","paper_url":"https://arxiv.org/abs/2403.10662v1","paper_title":"SwinMTL: A Shared Architecture for Simultaneous Depth Estimation and Semantic Segmentation from Monocular Camera Images","code":"https://github.com/pardistaghavi/swinmtl","n_code_links":1,"syntology":null},{"rank_in_archive_order":12,"model":"PolyMaX(ConvNeXt-L)","metrics":{"Mean IoU":"58.08%"},"uses_additional_data":false,"paper_date":"2023-11-09","paper":"/paper/polymax-general-dense-prediction-with-mask","paper_url":"https://arxiv.org/abs/2311.05770v1","paper_title":"PolyMaX: General Dense Prediction with Mask Transformer","code":"https://github.com/google-research/deeplab2","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":13,"model":"HSPFormer(PVT v2-B4)","metrics":{"Mean IoU":"57.8%"},"uses_additional_data":false,"paper_date":"2025-01-16","paper":"/paper/hspformer-hierarchical-spatial-perception","paper_url":"https://doi.org/10.1109/TITS.2025.3525542","paper_title":"HSPFormer: Hierarchical Spatial Perception Transformer for Semantic Segmentation","code":"https://github.com/SY-Ch/HSPFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":14,"model":"GeminiFusion (MiT-B5)","metrics":{"Mean IoU":"57.7"},"uses_additional_data":false,"paper_date":"2024-06-03","paper":"/paper/geminifusion-efficient-pixel-wise-multimodal","paper_url":"https://arxiv.org/abs/2406.01210v2","paper_title":"GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer","code":"https://github.com/jiadingcn/geminifusion","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":3,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":15,"model":"DFormerv2-B","metrics":{"Mean IoU":"57.7%"},"uses_additional_data":false,"paper_date":"2025-04-07","paper":"/paper/dformerv2-geometry-self-attention-for-rgbd","paper_url":"https://arxiv.org/abs/2504.04701v1","paper_title":"DFormerv2: Geometry Self-Attention for RGBD Semantic Segmentation","code":"https://github.com/VCIP-RGBD/DFormer","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":16,"model":"DFormer-L","metrics":{"Mean IoU":"57.2%"},"uses_additional_data":false,"paper_date":"2023-09-18","paper":"/paper/dformer-rethinking-rgbd-representation","paper_url":"https://arxiv.org/abs/2309.09668v2","paper_title":"DFormer: Rethinking RGBD Representation Learning for Semantic Segmentation","code":"https://github.com/VCIP-RGBD/DFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"CMX (B5)","metrics":{"Mean IoU":"56.9%"},"uses_additional_data":false,"paper_date":"2022-03-09","paper":"/paper/cmx-cross-modal-fusion-for-rgb-x-semantic","paper_url":"https://arxiv.org/abs/2203.04838v5","paper_title":"CMX: Cross-Modal Fusion for RGB-X Semantic Segmentation with Transformers","code":"https://github.com/huaaaliu/rgbx_semantic_segmentation","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":18,"model":"CMNeXt (B4)","metrics":{"Mean IoU":"56.9%"},"uses_additional_data":false,"paper_date":"2023-03-02","paper":"/paper/delivering-arbitrary-modal-semantic","paper_url":"https://arxiv.org/abs/2303.01480v1","paper_title":"Delivering Arbitrary-Modal Semantic Segmentation","code":"https://github.com/jamycheung/DELIVER","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":0,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"OMNIVORE (Swin-L, finetuned)","metrics":{"Mean IoU":"56.8%"},"uses_additional_data":false,"paper_date":"2022-01-20","paper":"/paper/omnivore-a-single-model-for-many-visual","paper_url":"https://arxiv.org/abs/2201.08377v2","paper_title":"Omnivore: A Single Model for Many Visual Modalities","code":"https://github.com/towhee-io/towhee","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":20,"model":"GeminiFusion (MiT-B3)","metrics":{"Mean IoU":"56.8"},"uses_additional_data":false,"paper_date":"2024-06-03","paper":"/paper/geminifusion-efficient-pixel-wise-multimodal","paper_url":"https://arxiv.org/abs/2406.01210v2","paper_title":"GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer","code":"https://github.com/jiadingcn/geminifusion","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":3,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"CMX (B4)","metrics":{"Mean IoU":"56.3%"},"uses_additional_data":false,"paper_date":"2022-03-09","paper":"/paper/cmx-cross-modal-fusion-for-rgb-x-semantic","paper_url":"https://arxiv.org/abs/2203.04838v5","paper_title":"CMX: Cross-Modal Fusion for RGB-X Semantic Segmentation with Transformers","code":"https://github.com/huaaaliu/rgbx_semantic_segmentation","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":22,"model":"MultiMAE (ViT-B)","metrics":{"Mean IoU":"56.0%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/multimae-multi-modal-multi-task-masked","paper_url":"https://arxiv.org/abs/2204.01678v1","paper_title":"MultiMAE: Multi-modal Multi-task Masked Autoencoders","code":"https://github.com/EPFL-VILAB/MultiMAE","n_code_links":1,"syntology":null},{"rank_in_archive_order":23,"model":"DFormerv2-S","metrics":{"Mean IoU":"56.0%"},"uses_additional_data":false,"paper_date":"2025-04-07","paper":"/paper/dformerv2-geometry-self-attention-for-rgbd","paper_url":"https://arxiv.org/abs/2504.04701v1","paper_title":"DFormerv2: Geometry Self-Attention for RGBD Semantic Segmentation","code":"https://github.com/VCIP-RGBD/DFormer","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":24,"model":"SMMCL (SegNeXt-B)","metrics":{"Mean IoU":"55.8%"},"uses_additional_data":false,"paper_date":"2023-08-23","paper":"/paper/understanding-dark-scenes-by-contrasting","paper_url":"https://arxiv.org/abs/2308.12320v2","paper_title":"Understanding Dark Scenes by Contrasting Multi-Modal Observations","code":"https://github.com/palmdong/smmcl","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"DFormer-B","metrics":{"Mean IoU":"55.6%"},"uses_additional_data":false,"paper_date":"2023-09-18","paper":"/paper/dformer-rethinking-rgbd-representation","paper_url":"https://arxiv.org/abs/2309.09668v2","paper_title":"DFormer: Rethinking RGBD Representation Learning for Semantic Segmentation","code":"https://github.com/VCIP-RGBD/DFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":26,"model":"ComPtr (Swin-B)","metrics":{"Mean IoU":"55.5%"},"uses_additional_data":false,"paper_date":"2023-07-23","paper":"/paper/comptr-towards-diverse-bi-source-dense","paper_url":"https://arxiv.org/abs/2307.12349v1","paper_title":"ComPtr: Towards Diverse Bi-source Dense Prediction Tasks via A Simple yet General Complementary Transformer","code":"https://github.com/lartpang/comptr","n_code_links":1,"syntology":null},{"rank_in_archive_order":27,"model":"AsymFormer","metrics":{"Mean IoU":"55.3%"},"uses_additional_data":false,"paper_date":"2023-09-25","paper":"/paper/asymformer-asymmetrical-cross-modal","paper_url":"https://arxiv.org/abs/2309.14065v7","paper_title":"AsymFormer: Asymmetrical Cross-Modal Representation Learning for Mobile Platform Real-Time RGB-D Semantic Segmentation","code":"https://github.com/Fourier7754/AsymFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":28,"model":"OMNIVORE (Swin-B, finetuned)","metrics":{"Mean IoU":"55.1%"},"uses_additional_data":false,"paper_date":"2022-01-20","paper":"/paper/omnivore-a-single-model-for-many-visual","paper_url":"https://arxiv.org/abs/2201.08377v2","paper_title":"Omnivore: A Single Model for Many Visual Modalities","code":"https://github.com/towhee-io/towhee","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":29,"model":"HAPNet","metrics":{"Mean Accuracy":"68.8","Mean IoU":"55.0"},"uses_additional_data":false,"paper_date":"2024-04-04","paper":"/paper/hapnet-toward-superior-rgb-thermal-scene","paper_url":"https://arxiv.org/abs/2404.03527v2","paper_title":"HAPNet: Toward Superior RGB-Thermal Scene Parsing via Hybrid, Asymmetric, and Progressive Heterogeneous Feature Fusion","code":"https://github.com/LiJiahang617/HAPNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":30,"model":"CMX (B2)","metrics":{"Mean IoU":"54.4%"},"uses_additional_data":false,"paper_date":"2022-03-09","paper":"/paper/cmx-cross-modal-fusion-for-rgb-x-semantic","paper_url":"https://arxiv.org/abs/2203.04838v5","paper_title":"CMX: Cross-Modal Fusion for RGB-X Semantic Segmentation with Transformers","code":"https://github.com/huaaaliu/rgbx_semantic_segmentation","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":31,"model":"TokenFusion (S)","metrics":{"Mean IoU":"54.2%"},"uses_additional_data":false,"paper_date":"2022-04-19","paper":"/paper/multimodal-token-fusion-for-vision","paper_url":"https://arxiv.org/abs/2204.08721v2","paper_title":"Multimodal Token Fusion for Vision Transformers","code":"https://github.com/huawei-noah/noah-research/tree/master/TokenFusion","n_code_links":11,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":1}},{"rank_in_archive_order":32,"model":"SMMCL (SegFormer-B2)","metrics":{"Mean IoU":"53.7%"},"uses_additional_data":false,"paper_date":"2023-08-23","paper":"/paper/understanding-dark-scenes-by-contrasting","paper_url":"https://arxiv.org/abs/2308.12320v2","paper_title":"Understanding Dark Scenes by Contrasting Multi-Modal Observations","code":"https://github.com/palmdong/smmcl","n_code_links":1,"syntology":null},{"rank_in_archive_order":33,"model":"DFormer-S","metrics":{"Mean IoU":"53.6%"},"uses_additional_data":false,"paper_date":"2023-09-18","paper":"/paper/dformer-rethinking-rgbd-representation","paper_url":"https://arxiv.org/abs/2309.09668v2","paper_title":"DFormer: Rethinking RGBD Representation Learning for Semantic Segmentation","code":"https://github.com/VCIP-RGBD/DFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":34,"model":"InvPT","metrics":{"Mean IoU":"53.56%"},"uses_additional_data":false,"paper_date":"2022-03-15","paper":"/paper/inverted-pyramid-multi-task-transformer-for","paper_url":"https://arxiv.org/abs/2203.07997v3","paper_title":"InvPT: Inverted Pyramid Multi-task Transformer for Dense Scene Understanding","code":"https://github.com/prismformore/InvPT","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":35,"model":"HS3-Fuse (ResNet-101)","metrics":{"Mean IoU":"53.5%"},"uses_additional_data":false,"paper_date":"2021-11-03","paper":"/paper/hs3-learning-with-proper-task-complexity-in","paper_url":"https://arxiv.org/abs/2111.02333v1","paper_title":"HS3: Learning with Proper Task Complexity in Hierarchically Supervised Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":36,"model":"PDCNet (ResNet-101)","metrics":{"Mean IoU":"53.5%"},"uses_additional_data":false,"paper_date":"2023-02-23","paper":"/paper/pixel-difference-convolutional-network-for","paper_url":"https://arxiv.org/abs/2302.11951v1","paper_title":"Pixel Difference Convolutional Network for RGB-D Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":37,"model":"EMSANet (2x ResNet-34 NBt1D, finetuned)","metrics":{"Mean IoU":"53.34%"},"uses_additional_data":true,"paper_date":"2022-07-10","paper":"/paper/efficient-multi-task-rgb-d-scene-analysis-for","paper_url":"https://arxiv.org/abs/2207.04526v1","paper_title":"Efficient Multi-Task RGB-D Scene Analysis for Indoor Environments","code":"https://github.com/tui-nicr/emsanet","n_code_links":2,"syntology":null},{"rank_in_archive_order":38,"model":"DCANet (ResNet-101)","metrics":{"Mean IoU":"53.3%"},"uses_additional_data":false,"paper_date":"2022-10-13","paper":"/paper/dcanet-differential-convolution-attention","paper_url":"https://arxiv.org/abs/2210.06747v1","paper_title":"DCANet: Differential Convolution Attention Network for RGB-D Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":39,"model":"TokenFusion (Ti)","metrics":{"Mean IoU":"53.3%"},"uses_additional_data":false,"paper_date":"2022-04-19","paper":"/paper/multimodal-token-fusion-for-vision","paper_url":"https://arxiv.org/abs/2204.08721v2","paper_title":"Multimodal Token Fusion for Vision Transformers","code":"https://github.com/huawei-noah/noah-research/tree/master/TokenFusion","n_code_links":11,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":1}},{"rank_in_archive_order":40,"model":"InverseForm (ResNet-101)","metrics":{"Mean IoU":"53.1%"},"uses_additional_data":false,"paper_date":"2021-04-06","paper":"/paper/inverseform-a-loss-function-for-structured","paper_url":"https://arxiv.org/abs/2104.02745v2","paper_title":"InverseForm: A Loss Function for Structured Boundary-Aware Segmentation","code":"https://github.com/Qualcomm-AI-research/InverseForm","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":41,"model":"CAINet (MobileNet-V2)","metrics":{"Mean IoU":"52.6%"},"uses_additional_data":false,"paper_date":"2024-01-03","paper":"/paper/context-aware-interaction-network-for-rgb-t","paper_url":"https://arxiv.org/abs/2401.01624v1","paper_title":"Context-Aware Interaction Network for RGB-T Semantic Segmentation","code":"https://github.com/yinglv1106/cainet","n_code_links":1,"syntology":null},{"rank_in_archive_order":42,"model":"CEN-PSPNet (ResNet-152)","metrics":{"Mean IoU":"52.5%"},"uses_additional_data":false,"paper_date":"2021-12-04","paper":"/paper/channel-exchanging-networks-for-multimodal","paper_url":"https://arxiv.org/abs/2112.02252v2","paper_title":"Channel Exchanging Networks for Multimodal and Multitask Dense Image Prediction","code":"https://github.com/yikaiw/CEN","n_code_links":1,"syntology":null},{"rank_in_archive_order":43,"model":"AMF (ResNet-50)","metrics":{"Mean IoU":"52.5%"},"uses_additional_data":false,"paper_date":"2022-01-05","paper":"/paper/attention-based-dual-supervised-decoder-for","paper_url":"https://arxiv.org/abs/2201.01427v2","paper_title":"Attention-based Dual Supervised Decoder for RGBD Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":44,"model":"SMMCL (ResNet-101)","metrics":{"Mean IoU":"52.5%"},"uses_additional_data":false,"paper_date":"2023-08-23","paper":"/paper/understanding-dark-scenes-by-contrasting","paper_url":"https://arxiv.org/abs/2308.12320v2","paper_title":"Understanding Dark Scenes by Contrasting Multi-Modal Observations","code":"https://github.com/palmdong/smmcl","n_code_links":1,"syntology":null},{"rank_in_archive_order":45,"model":"SA-Gate","metrics":{"Mean IoU":"52.4%"},"uses_additional_data":false,"paper_date":"2020-07-17","paper":"/paper/bi-directional-cross-modality-feature","paper_url":"https://arxiv.org/abs/2007.09183v1","paper_title":"Bi-directional Cross-Modality Feature Propagation with Separation-and-Aggregation Gate for RGB-D Semantic Segmentation","code":"https://github.com/charlesCXK/RGBD_Semantic_Segmentation_PyTorch","n_code_links":2,"syntology":null},{"rank_in_archive_order":46,"model":"Warp-Refine","metrics":{"Mean IoU":"52.2%"},"uses_additional_data":false,"paper_date":"2021-09-28","paper":"/paper/warp-refine-propagation-semi-supervised-auto","paper_url":"https://arxiv.org/abs/2109.13432v1","paper_title":"Warp-Refine Propagation: Semi-Supervised Auto-labeling via Cycle-consistency","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":47,"model":"FSFNet","metrics":{"Mean IoU":"52.0%"},"uses_additional_data":false,"paper_date":"2021-05-10","paper":"/paper/deep-feature-selection-and-fusion-for-rgb-d","paper_url":"https://arxiv.org/abs/2105.04102v1","paper_title":"Deep feature selection-and-fusion for RGB-D semantic segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":48,"model":"VCD+ACNet (ResNet-50)","metrics":{"Mean IoU":"51.9%"},"uses_additional_data":false,"paper_date":"2020-06-01","paper":"/paper/variational-context-deformable-convnets-for","paper_url":"http://openaccess.thecvf.com/content_CVPR_2020/html/Xiong_Variational_Context-Deformable_ConvNets_for_Indoor_Scene_Parsing_CVPR_2020_paper.html","paper_title":"Variational Context-Deformable ConvNets for Indoor Scene Parsing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":49,"model":"MIPANet (ResNet50)","metrics":{"Mean IoU":"51.9%"},"uses_additional_data":false,"paper_date":"2023-11-19","paper":"/paper/optimizing-rgb-d-semantic-segmentation","paper_url":"https://arxiv.org/abs/2311.11312v2","paper_title":"Optimizing rgb-d semantic segmentation through multi-modal interaction and pooling attention","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":50,"model":"DFormer-T","metrics":{"Mean IoU":"51.8%"},"uses_additional_data":false,"paper_date":"2023-09-18","paper":"/paper/dformer-rethinking-rgbd-representation","paper_url":"https://arxiv.org/abs/2309.09668v2","paper_title":"DFormer: Rethinking RGBD Representation Learning for Semantic Segmentation","code":"https://github.com/VCIP-RGBD/DFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":51,"model":"ShapeConv (ResNext-101)","metrics":{"Mean IoU":"51.3%"},"uses_additional_data":false,"paper_date":"2021-08-24","paper":"/paper/shapeconv-shape-aware-convolutional-layer-for","paper_url":"https://arxiv.org/abs/2108.10528v1","paper_title":"ShapeConv: Shape-aware Convolutional Layer for Indoor RGB-D Semantic Segmentation","code":"https://github.com/hanchaoleng/shapeconv","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":52,"model":"EMSAFormer (SwinV2-T-128-Multi-Aug)","metrics":{"Mean IoU":"51.26%"},"uses_additional_data":false,"paper_date":"2023-06-08","paper":"/paper/efficient-multi-task-scene-analysis-with-rgb","paper_url":"https://arxiv.org/abs/2306.05242v1","paper_title":"Efficient Multi-Task Scene Analysis with RGB-D Transformers","code":"https://github.com/tui-nicr/nicr-scene-analysis-datasets","n_code_links":2,"syntology":null},{"rank_in_archive_order":53,"model":"Z-ACN (ResNet-101)","metrics":{"Mean IoU":"51.24%"},"uses_additional_data":false,"paper_date":"2022-06-08","paper":"/paper/depth-adapted-cnns-for-rgb-d-semantic","paper_url":"https://arxiv.org/abs/2206.03939v1","paper_title":"Depth-Adapted CNNs for RGB-D Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":54,"model":"AsymFusion (ResNet-152)","metrics":{"Mean IoU":"51.2%"},"uses_additional_data":false,"paper_date":"2021-08-11","paper":"/paper/learning-deep-multimodal-feature","paper_url":"https://arxiv.org/abs/2108.05009v1","paper_title":"Learning Deep Multimodal Feature Representation with Asymmetric Multi-layer Fusion","code":"https://github.com/yikaiw/AsymFusion","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":11,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":55,"model":"DynMM (ResNet-50)","metrics":{"Mean IoU":"51.0%"},"uses_additional_data":false,"paper_date":"2022-03-31","paper":"/paper/dynamic-multimodal-fusion","paper_url":"https://arxiv.org/abs/2204.00102v2","paper_title":"Dynamic Multimodal Fusion","code":"https://github.com/zihuixue/dynmm","n_code_links":1,"syntology":null},{"rank_in_archive_order":56,"model":"SGNet (ResNet-101)","metrics":{"Mean IoU":"51.0%"},"uses_additional_data":false,"paper_date":"2020-04-09","paper":"/paper/spatial-information-guided-convolution-for","paper_url":"https://arxiv.org/abs/2004.04534v2","paper_title":"Spatial Information Guided Convolution for Real-Time RGBD Semantic Segmentation","code":"https://github.com/LinZhuoChen/SGNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":57,"model":"PSD-ResNet50","metrics":{"Mean IoU":"51.0%"},"uses_additional_data":false,"paper_date":"2020-06-01","paper":"/paper/pattern-structure-diffusion-for-multi-task","paper_url":"http://openaccess.thecvf.com/content_CVPR_2020/html/Zhou_Pattern-Structure_Diffusion_for_Multi-Task_Learning_CVPR_2020_paper.html","paper_title":"Pattern-Structure Diffusion for Multi-Task Learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":58,"model":"Malleable 2.5D (ResNet-101)","metrics":{"Mean IoU":"50.9%"},"uses_additional_data":false,"paper_date":"2020-07-18","paper":"/paper/malleable-2-5d-convolution-learning-receptive","paper_url":"https://arxiv.org/abs/2007.09365v1","paper_title":"Malleable 2.5D Convolution: Learning Receptive Fields along the Depth-axis for RGB-D Scene Parsing","code":"https://github.com/charlesCXK/RGBD_Semantic_Segmentation_PyTorch","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":10,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":59,"model":"ICM","metrics":{"Mean IoU":"50.70"},"uses_additional_data":false,"paper_date":"2019-06-01","paper":"/paper/scene-parsing-via-integrated-classification","paper_url":"http://openaccess.thecvf.com/content_CVPR_2019/html/Shi_Scene_Parsing_via_Integrated_Classification_Model_and_Variance-Based_Regularization_CVPR_2019_paper.html","paper_title":"Scene Parsing via Integrated Classification Model and Variance-Based Regularization","code":"https://github.com/shihengcan/ICM-matcaffe","n_code_links":1,"syntology":null},{"rank_in_archive_order":60,"model":"SANet","metrics":{"Mean IoU":"50.7%"},"uses_additional_data":false,"paper_date":"2020-11-04","paper":"/paper/multi-layer-feature-aggregation-for-deep","paper_url":"https://arxiv.org/abs/2011.02572v1","paper_title":"Multi-layer Feature Aggregation for Deep Scene Parsing Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":61,"model":"VCD+RedNet (ResNet-50)","metrics":{"Mean IoU":"50.7%"},"uses_additional_data":false,"paper_date":"2020-06-01","paper":"/paper/variational-context-deformable-convnets-for","paper_url":"http://openaccess.thecvf.com/content_CVPR_2020/html/Xiong_Variational_Context-Deformable_ConvNets_for_Indoor_Scene_Parsing_CVPR_2020_paper.html","paper_title":"Variational Context-Deformable ConvNets for Indoor Scene Parsing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":62,"model":"HaarNet","metrics":{"Mean IoU":"50.7%"},"uses_additional_data":false,"paper_date":"2023-10-11","paper":"/paper/haarnet-large-scale-linear-morphological","paper_url":"https://arxiv.org/abs/2310.07669v1","paper_title":"HaarNet: Large-scale Linear-Morphological Hybrid Network for RGB-D Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":63,"model":"PAP (ResNet-50)","metrics":{"Mean IoU":"50.4%"},"uses_additional_data":false,"paper_date":"2019-06-08","paper":"/paper/pattern-affinitive-propagation-across-depth-1","paper_url":"https://arxiv.org/abs/1906.03525v1","paper_title":"Pattern-Affinitive Propagation across Depth, Surface Normal and Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":64,"model":"Cerberus","metrics":{"Mean IoU":"50.4%"},"uses_additional_data":false,"paper_date":"2021-11-24","paper":"/paper/cerberus-transformer-joint-semantic","paper_url":"https://arxiv.org/abs/2111.12608v2","paper_title":"Cerberus Transformer: Joint Semantic, Affordance and Attribute Parsing","code":"https://github.com/open-air-sun/cerberus","n_code_links":1,"syntology":null},{"rank_in_archive_order":65,"model":"ESANet (R34-NBt1D)","metrics":{"Mean IoU":"50.30"},"uses_additional_data":false,"paper_date":"2020-11-13","paper":"/paper/efficient-rgb-d-semantic-segmentation-for","paper_url":"https://arxiv.org/abs/2011.06961v3","paper_title":"Efficient RGB-D Semantic Segmentation for Indoor Scene Analysis","code":"https://github.com/TUI-NICR/ESANet","n_code_links":4,"syntology":null},{"rank_in_archive_order":66,"model":"Z-ACN (ResNet-50)","metrics":{"Mean IoU":"50.05%"},"uses_additional_data":false,"paper_date":"2022-06-08","paper":"/paper/depth-adapted-cnns-for-rgb-d-semantic","paper_url":"https://arxiv.org/abs/2206.03939v1","paper_title":"Depth-Adapted CNNs for RGB-D Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":67,"model":"Malleable 2.5D (ResNet-50)","metrics":{"Mean IoU":"49.7%"},"uses_additional_data":false,"paper_date":"2020-07-18","paper":"/paper/malleable-2-5d-convolution-learning-receptive","paper_url":"https://arxiv.org/abs/2007.09365v1","paper_title":"Malleable 2.5D Convolution: Learning Receptive Fields along the Depth-axis for RGB-D Scene Parsing","code":"https://github.com/charlesCXK/RGBD_Semantic_Segmentation_PyTorch","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":10,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":68,"model":"MMANet","metrics":{"Mean IoU":"49.62%"},"uses_additional_data":false,"paper_date":"2023-04-17","paper":"/paper/mmanet-margin-aware-distillation-and-modality","paper_url":"https://arxiv.org/abs/2304.08028v1","paper_title":"MMANet: Margin-aware Distillation and Modality-aware Regularization for Incomplete Multimodal Learning","code":"https://github.com/shicaiwei123/mmanet","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":14,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":69,"model":"SGACNet (R34-NBt1D)","metrics":{"Mean IoU":"49.4%"},"uses_additional_data":false,"paper_date":"2023-08-11","paper":"/paper/spatial-information-guided-adaptive-context","paper_url":"https://arxiv.org/abs/2308.06024v1","paper_title":"Spatial-information Guided Adaptive Context-aware Network for Efficient RGB-D Semantic Segmentation","code":"https://github.com/mvme-hbut/sgacnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":70,"model":"ComPtr (Swin-T)","metrics":{"Mean IoU":"49.2%"},"uses_additional_data":false,"paper_date":"2023-07-23","paper":"/paper/comptr-towards-diverse-bi-source-dense","paper_url":"https://arxiv.org/abs/2307.12349v1","paper_title":"ComPtr: Towards Diverse Bi-source Dense Prediction Tasks via A Simple yet General Complementary Transformer","code":"https://github.com/lartpang/comptr","n_code_links":1,"syntology":null},{"rank_in_archive_order":71,"model":"Z-ACN (ResNet-34)","metrics":{"Mean IoU":"49.15%"},"uses_additional_data":false,"paper_date":"2022-06-08","paper":"/paper/depth-adapted-cnns-for-rgb-d-semantic","paper_url":"https://arxiv.org/abs/2206.03939v1","paper_title":"Depth-Adapted CNNs for RGB-D Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":72,"model":"UMT","metrics":{"Mean IoU":"49.14%"},"uses_additional_data":false,"paper_date":"2021-06-21","paper":"/paper/improving-multi-modal-learning-with-uni-modal","paper_url":"https://arxiv.org/abs/2106.11059v1","paper_title":"Improving Multi-Modal Learning with Uni-Modal Teachers","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":73,"model":"MTI-Net (HRNet-48)","metrics":{"Mean IoU":"49.0"},"uses_additional_data":false,"paper_date":"2020-01-19","paper":"/paper/mti-net-multi-scale-task-interaction-networks","paper_url":"https://arxiv.org/abs/2001.06902v5","paper_title":"MTI-Net: Multi-Scale Task Interaction Networks for Multi-Task Learning","code":"https://github.com/SimonVandenhende/Multi-Task-Learning-PyTorch","n_code_links":1,"syntology":null},{"rank_in_archive_order":74,"model":"ShapeConv (ResNet-101)","metrics":{"Mean IoU":"49.0%"},"uses_additional_data":false,"paper_date":"2021-08-24","paper":"/paper/shapeconv-shape-aware-convolutional-layer-for","paper_url":"https://arxiv.org/abs/2108.10528v1","paper_title":"ShapeConv: Shape-aware Convolutional Layer for Indoor RGB-D Semantic Segmentation","code":"https://github.com/hanchaoleng/shapeconv","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":75,"model":"MKE","metrics":{"Mean IoU":"48.88%"},"uses_additional_data":false,"paper_date":"2021-03-26","paper":"/paper/multimodal-knowledge-expansion","paper_url":"https://arxiv.org/abs/2103.14431v3","paper_title":"Multimodal Knowledge Expansion","code":"https://github.com/zihuixue/mke","n_code_links":1,"syntology":null},{"rank_in_archive_order":76,"model":"ShapeConv (ResNet-50)","metrics":{"Mean IoU":"48.8%"},"uses_additional_data":false,"paper_date":"2021-08-24","paper":"/paper/shapeconv-shape-aware-convolutional-layer-for","paper_url":"https://arxiv.org/abs/2108.10528v1","paper_title":"ShapeConv: Shape-aware Convolutional Layer for Indoor RGB-D Semantic Segmentation","code":"https://github.com/hanchaoleng/shapeconv","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":77,"model":"mmFormer","metrics":{"Mean IoU":"48.45%"},"uses_additional_data":false,"paper_date":"2022-06-06","paper":"/paper/mmformer-multimodal-medical-transformer-for","paper_url":"https://arxiv.org/abs/2206.02425v2","paper_title":"mmFormer: Multimodal Medical Transformer for Incomplete Multimodal Learning of Brain Tumor Segmentation","code":"https://github.com/yaozhang93/mmformer","n_code_links":1,"syntology":{"n_ran":13,"n_unverified":4,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":78,"model":"ACNet","metrics":{"Mean IoU":"48.3%"},"uses_additional_data":false,"paper_date":"2019-05-24","paper":"/paper/acnet-attention-based-network-to-exploit","paper_url":"https://arxiv.org/abs/1905.10089v1","paper_title":"ACNet: Attention Based Network to Exploit Complementary Features for RGBD Semantic Segmentation","code":"https://github.com/anheidelonghu/ACNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":79,"model":"SGACNet (R18-NBt1D)","metrics":{"Mean IoU":"48.2%"},"uses_additional_data":false,"paper_date":"2023-08-11","paper":"/paper/spatial-information-guided-adaptive-context","paper_url":"https://arxiv.org/abs/2308.06024v1","paper_title":"Spatial-information Guided Adaptive Context-aware Network for Efficient RGB-D Semantic Segmentation","code":"https://github.com/mvme-hbut/sgacnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":80,"model":"ESANet (R18-NBt1D )","metrics":{"Mean IoU":"48.17"},"uses_additional_data":false,"paper_date":"2020-11-13","paper":"/paper/efficient-rgb-d-semantic-segmentation-for","paper_url":"https://arxiv.org/abs/2011.06961v3","paper_title":"Efficient RGB-D Semantic Segmentation for Indoor Scene Analysis","code":"https://github.com/TUI-NICR/ESANet","n_code_links":4,"syntology":null},{"rank_in_archive_order":81,"model":"RFNet","metrics":{"Mean IoU":"48.13%"},"uses_additional_data":false,"paper_date":"2021-01-01","paper":"/paper/rfnet-region-aware-fusion-network-for","paper_url":"http://openaccess.thecvf.com//content/ICCV2021/html/Ding_RFNet_Region-Aware_Fusion_Network_for_Incomplete_Multi-Modal_Brain_Tumor_Segmentation_ICCV_2021_paper.html","paper_title":"RFNet: Region-Aware Fusion Network for Incomplete Multi-Modal Brain Tumor Segmentation","code":"https://github.com/dyh127/RFNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":82,"model":"TupleInfoNCE","metrics":{"Mean IoU":"48.1%"},"uses_additional_data":false,"paper_date":"2021-07-06","paper":"/paper/contrastive-multimodal-fusion-with","paper_url":"https://arxiv.org/abs/2107.02575v1","paper_title":"Contrastive Multimodal Fusion with TupleInfoNCE","code":"https://github.com/hoi4d/TupleInfoNCE","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":83,"model":"DDSC (ResNet-101)","metrics":{"Mean IoU":"48.1%"},"uses_additional_data":false,"paper_date":"2018-06-01","paper":"/paper/dense-decoder-shortcut-connections-for-single","paper_url":"http://openaccess.thecvf.com/content_cvpr_2018/html/Bilinski_Dense_Decoder_Shortcut_CVPR_2018_paper.html","paper_title":"Dense Decoder Shortcut Connections for Single-Pass Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":84,"model":"CFN","metrics":{"Mean IoU":"47.7%"},"uses_additional_data":false,"paper_date":"2017-10-01","paper":"/paper/cascaded-feature-network-for-semantic","paper_url":"http://openaccess.thecvf.com/content_iccv_2017/html/Lin_Cascaded_Feature_Network_ICCV_2017_paper.html","paper_title":"Cascaded Feature Network for Semantic Segmentation of RGB-D Images","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":85,"model":"FDNet (DenseNet264)","metrics":{"Mean IoU":"47.4%"},"uses_additional_data":false,"paper_date":"2019-05-22","paper":"/paper/learning-fully-dense-neural-networks-for","paper_url":"https://arxiv.org/abs/1905.08929v1","paper_title":"Learning Fully Dense Neural Networks for Image Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":86,"model":"RedNet","metrics":{"Mean IoU":"47.2%"},"uses_additional_data":false,"paper_date":"2018-06-04","paper":"/paper/rednet-residual-encoder-decoder-network-for","paper_url":"http://arxiv.org/abs/1806.01054v2","paper_title":"RedNet: Residual Encoder-Decoder Network for indoor RGB-D Semantic Segmentation","code":"https://github.com/JindongJiang/RedNet","n_code_links":8,"syntology":{"n_ran":3,"n_unverified":6,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":87,"model":"Z-ACN (ResNet-18)","metrics":{"Mean IoU":"47.02%"},"uses_additional_data":false,"paper_date":"2022-06-08","paper":"/paper/depth-adapted-cnns-for-rgb-d-semantic","paper_url":"https://arxiv.org/abs/2206.03939v1","paper_title":"Depth-Adapted CNNs for RGB-D Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":88,"model":"TRL (ResNet-101)","metrics":{"Mean IoU":"46.8%"},"uses_additional_data":false,"paper_date":"2018-09-01","paper":"/paper/joint-task-recursive-learning-for-semantic","paper_url":"http://openaccess.thecvf.com/content_ECCV_2018/html/Zhenyu_Zhang_Joint_Task-Recursive_Learning_ECCV_2018_paper.html","paper_title":"Joint Task-Recursive Learning for Semantic Segmentation and Depth Estimation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":89,"model":"RefineNet (ResNet-101)","metrics":{"Mean IoU":"46.5%"},"uses_additional_data":false,"paper_date":"2016-11-20","paper":"/paper/refinenet-multi-path-refinement-networks-for","paper_url":"http://arxiv.org/abs/1611.06612v3","paper_title":"RefineNet: Multi-Path Refinement Networks for High-Resolution Semantic Segmentation","code":"https://github.com/guosheng/refinenet","n_code_links":13,"syntology":{"n_ran":3,"n_unverified":4,"n_samples":7,"n_pointer_only_licence":1}},{"rank_in_archive_order":90,"model":"PGT (Swin-S)","metrics":{"Mean IoU":"46.43"},"uses_additional_data":false,"paper_date":"2023-07-28","paper":"/paper/prompt-guided-transformer-for-multi-task","paper_url":"https://arxiv.org/abs/2307.15362v1","paper_title":"Prompt Guided Transformer for Multi-Task Dense Prediction","code":"https://github.com/innovator-zero/MTDP_Lib","n_code_links":1,"syntology":null},{"rank_in_archive_order":91,"model":"ATRC","metrics":{"Mean IoU":"46.33%"},"uses_additional_data":false,"paper_date":"2021-04-28","paper":"/paper/exploring-relational-context-for-multi-task","paper_url":"https://arxiv.org/abs/2104.13874v2","paper_title":"Exploring Relational Context for Multi-Task Dense Prediction","code":"https://github.com/brdav/atrc","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":92,"model":"LS-DeconvNet","metrics":{"Mean IoU":"45.9%"},"uses_additional_data":false,"paper_date":"2017-07-01","paper":"/paper/locality-sensitive-deconvolution-networks","paper_url":"http://openaccess.thecvf.com/content_cvpr_2017/html/Cheng_Locality-Sensitive_Deconvolution_Networks_CVPR_2017_paper.html","paper_title":"Locality-Sensitive Deconvolution Networks With Gated Fusion for RGB-D Indoor Semantic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":93,"model":"VCD+DeepLab (VGG16)","metrics":{"Mean IoU":"45.3"},"uses_additional_data":false,"paper_date":"2020-06-01","paper":"/paper/variational-context-deformable-convnets-for","paper_url":"http://openaccess.thecvf.com/content_CVPR_2020/html/Xiong_Variational_Context-Deformable_ConvNets_for_Indoor_Scene_Parsing_CVPR_2020_paper.html","paper_title":"Variational Context-Deformable ConvNets for Indoor Scene Parsing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":94,"model":"SOSD-Net","metrics":{"Mean IoU":"45.0%"},"uses_additional_data":false,"paper_date":"2021-01-19","paper":"/paper/sosd-net-joint-semantic-object-segmentation","paper_url":"https://arxiv.org/abs/2101.07422v1","paper_title":"SOSD-Net: Joint Semantic Object Segmentation and Depth Estimation from Monocular images","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":95,"model":"MMAF-Net-152","metrics":{"Mean IoU":"44.8%"},"uses_additional_data":false,"paper_date":"2019-12-25","paper":"/paper/multi-modal-attention-based-fusion-model-for","paper_url":"https://arxiv.org/abs/1912.11691v1","paper_title":"Multi-Modal Attention-based Fusion Model for Semantic Segmentation of RGB-Depth Images","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":96,"model":"RecurrentSceneParsing","metrics":{"Mean IoU":"44.5%"},"uses_additional_data":false,"paper_date":"2017-05-20","paper":"/paper/recurrent-scene-parsing-with-perspective","paper_url":"http://arxiv.org/abs/1705.07238v2","paper_title":"Recurrent Scene Parsing with Perspective Understanding in the Loop","code":"https://github.com/aimerykong/Recurrent-Scene-Parsing-with-Perspective-Understanding-in-the-loop","n_code_links":1,"syntology":null},{"rank_in_archive_order":97,"model":"Light-Weight-RefineNet-152","metrics":{"Mean IoU":"44.4%"},"uses_additional_data":false,"paper_date":"2018-10-08","paper":"/paper/light-weight-refinenet-for-real-time-semantic","paper_url":"http://arxiv.org/abs/1810.03272v1","paper_title":"Light-Weight RefineNet for Real-Time Semantic Segmentation","code":"https://github.com/DrSleep/light-weight-refinenet","n_code_links":2,"syntology":null},{"rank_in_archive_order":98,"model":"Depth-aware CNN","metrics":{"Mean IoU":"43.9%"},"uses_additional_data":false,"paper_date":"2018-03-19","paper":"/paper/depth-aware-cnn-for-rgb-d-segmentation","paper_url":"http://arxiv.org/abs/1803.06791v1","paper_title":"Depth-aware CNN for RGB-D Segmentation","code":"https://github.com/laughtervv/DepthAwareCNN","n_code_links":4,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":99,"model":"Light-Weight-RefineNet-101","metrics":{"Mean IoU":"43.6%"},"uses_additional_data":false,"paper_date":"2018-10-08","paper":"/paper/light-weight-refinenet-for-real-time-semantic","paper_url":"http://arxiv.org/abs/1810.03272v1","paper_title":"Light-Weight RefineNet for Real-Time Semantic Segmentation","code":"https://github.com/DrSleep/light-weight-refinenet","n_code_links":2,"syntology":null},{"rank_in_archive_order":100,"model":"TD2-PSP50","metrics":{"Mean IoU":"43.5"},"uses_additional_data":false,"paper_date":"2020-04-03","paper":"/paper/temporally-distributed-networks-for-fast","paper_url":"https://arxiv.org/abs/2004.01800v2","paper_title":"Temporally Distributed Networks for Fast Video Semantic Segmentation","code":"https://github.com/feinanshan/TDNet","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":101,"model":"NDDR-CNN","metrics":{"Mean IoU":"43.3%"},"uses_additional_data":false,"paper_date":"2018-01-25","paper":"/paper/nddr-cnn-layer-wise-feature-fusing-in-multi","paper_url":"http://arxiv.org/abs/1801.08297v4","paper_title":"NDDR-CNN: Layerwise Feature Fusing in Multi-Task CNNs by Neural Discriminative Dimensionality Reduction","code":"https://github.com/ethanygao/NDDR-CNN","n_code_links":1,"syntology":null},{"rank_in_archive_order":102,"model":"3DGNN","metrics":{"Mean IoU":"43.1%"},"uses_additional_data":false,"paper_date":"2017-10-01","paper":"/paper/3d-graph-neural-networks-for-rgbd-semantic","paper_url":"http://openaccess.thecvf.com/content_iccv_2017/html/Qi_3D_Graph_Neural_ICCV_2017_paper.html","paper_title":"3D Graph Neural Networks for RGBD Semantic Segmentation","code":"https://github.com/yanx27/3DGNN_pytorch","n_code_links":2,"syntology":null},{"rank_in_archive_order":103,"model":"CI-Net","metrics":{"Mean IoU":"42.6%"},"uses_additional_data":false,"paper_date":"2021-07-29","paper":"/paper/ci-net-contextual-information-for-joint","paper_url":"https://arxiv.org/abs/2107.13800v2","paper_title":"CI-Net: Contextual Information for Joint Semantic Segmentation and Depth Estimation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":104,"model":"Multi-Task Light-Weight-RefineNet","metrics":{"Mean IoU":"42.0%"},"uses_additional_data":false,"paper_date":"2018-09-13","paper":"/paper/real-time-joint-semantic-segmentation-and","paper_url":"http://arxiv.org/abs/1809.04766v2","paper_title":"Real-Time Joint Semantic Segmentation and Depth Estimation Using Asymmetric Annotations","code":"https://github.com/DrSleep/multi-task-refinenet","n_code_links":4,"syntology":{"n_ran":6,"n_unverified":0,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":105,"model":"Light-Weight-RefineNet-50","metrics":{"Mean IoU":"41.7%"},"uses_additional_data":false,"paper_date":"2018-10-08","paper":"/paper/light-weight-refinenet-for-real-time-semantic","paper_url":"http://arxiv.org/abs/1810.03272v1","paper_title":"Light-Weight RefineNet for Real-Time Semantic Segmentation","code":"https://github.com/DrSleep/light-weight-refinenet","n_code_links":2,"syntology":null},{"rank_in_archive_order":106,"model":"PGT (Swin-T)","metrics":{"Mean IoU":"41.61"},"uses_additional_data":false,"paper_date":"2023-07-28","paper":"/paper/prompt-guided-transformer-for-multi-task","paper_url":"https://arxiv.org/abs/2307.15362v1","paper_title":"Prompt Guided Transformer for Multi-Task Dense Prediction","code":"https://github.com/innovator-zero/MTDP_Lib","n_code_links":1,"syntology":null},{"rank_in_archive_order":107,"model":"MTML","metrics":{"Mean IoU":"41.51%"},"uses_additional_data":false,"paper_date":"2022-10-13","paper":"/paper/multi-task-meta-learning-learn-how-to-adapt","paper_url":"https://arxiv.org/abs/2210.06989v4","paper_title":"Multi-Task Meta Learning: learn how to adapt to unseen tasks","code":"https://github.com/ricupa/mtml-learn-how-to-adapt-to-unseen-tasks","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":108,"model":"RAN","metrics":{"Mean IoU":"41.2%"},"uses_additional_data":false,"paper_date":"2017-07-20","paper":"/paper/semantic-segmentation-with-reverse-attention","paper_url":"http://arxiv.org/abs/1707.06426v1","paper_title":"Semantic Segmentation with Reverse Attention","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":109,"model":"DenseMTL","metrics":{"Mean IoU":"40.84%"},"uses_additional_data":false,"paper_date":"2022-06-17","paper":"/paper/cross-task-attention-mechanism-for-dense","paper_url":"https://arxiv.org/abs/2206.08927v2","paper_title":"DenseMTL: Cross-task Attention Mechanism for Dense Multi-task Learning","code":"https://github.com/astra-vision/densemtl","n_code_links":2,"syntology":null},{"rank_in_archive_order":110,"model":"STD2P","metrics":{"Mean IoU":"40.1%"},"uses_additional_data":false,"paper_date":"2016-04-08","paper":"/paper/std2p-rgbd-semantic-segmentation-using-spatio","paper_url":"http://arxiv.org/abs/1604.02388v3","paper_title":"STD2P: RGBD Semantic Segmentation Using Spatio-Temporal Data-Driven Pooling","code":"https://github.com/SSAW14/STD2P","n_code_links":1,"syntology":null},{"rank_in_archive_order":111,"model":"MaskSup","metrics":{"Mean IoU":"39.31%"},"uses_additional_data":false,"paper_date":"2022-10-03","paper":"/paper/masked-supervised-learning-for-semantic","paper_url":"https://arxiv.org/abs/2210.00923v2","paper_title":"Masked Supervised Learning for Semantic Segmentation","code":"https://github.com/hasibzunair/masksup-segmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":112,"model":"HeMIS","metrics":{"Mean IoU":"37.77%"},"uses_additional_data":false,"paper_date":"2016-07-18","paper":"/paper/hemis-hetero-modal-image-segmentation","paper_url":"http://arxiv.org/abs/1607.05194v1","paper_title":"HeMIS: Hetero-Modal Image Segmentation","code":"https://github.com/momih/pc-hemis","n_code_links":1,"syntology":null},{"rank_in_archive_order":113,"model":"TD4-PSP18","metrics":{"Mean IoU":"37.4"},"uses_additional_data":false,"paper_date":"2020-04-03","paper":"/paper/temporally-distributed-networks-for-fast","paper_url":"https://arxiv.org/abs/2004.01800v2","paper_title":"Temporally Distributed Networks for Fast Video Semantic Segmentation","code":"https://github.com/feinanshan/TDNet","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":114,"model":"Bayesian DenseNet","metrics":{"Mean IoU":"37.3%"},"uses_additional_data":false,"paper_date":"2017-03-15","paper":"/paper/what-uncertainties-do-we-need-in-bayesian","paper_url":"http://arxiv.org/abs/1703.04977v2","paper_title":"What Uncertainties Do We Need in Bayesian Deep Learning for Computer Vision?","code":"https://github.com/kyle-dorman/bayesian-neural-network-blogpost","n_code_links":11,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":115,"model":"HN-network","metrics":{"Mean IoU":"33.49%"},"uses_additional_data":false,"paper_date":"2020-02-06","paper":"/paper/rgb-based-semantic-segmentation-using-self","paper_url":"https://arxiv.org/abs/2002.02200v1","paper_title":"RGB-based Semantic Segmentation Using Self-Supervised Depth Pre-Training","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":116,"model":"CompL","metrics":{"Mean IoU":"33.48%"},"uses_additional_data":false,"paper_date":"2022-10-13","paper":"/paper/composite-learning-for-robust-and-effective","paper_url":"https://arxiv.org/abs/2210.07239v1","paper_title":"Composite Learning for Robust and Effective Dense Predictions","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":117,"model":"Dilated FCN-2s RGB","metrics":{"Mean IoU":"32.3%"},"uses_additional_data":false,"paper_date":"2017-07-26","paper":"/paper/efficient-yet-deep-convolutional-neural","paper_url":"http://arxiv.org/abs/1707.08254v3","paper_title":"Efficient Yet Deep Convolutional Neural Networks for Semantic Segmentation","code":"https://github.com/SharifAmit/DilatedFCNSegmentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":118,"model":"AdaShare","metrics":{"Mean IoU":"29.6%"},"uses_additional_data":false,"paper_date":"2019-11-27","paper":"/paper/adashare-learning-what-to-share-for-efficient","paper_url":"https://arxiv.org/abs/1911.12423v2","paper_title":"AdaShare: Learning What To Share For Efficient Deep Multi-Task Learning","code":"https://github.com/sunxm2357/AdaShare","n_code_links":2,"syntology":null},{"rank_in_archive_order":119,"model":"EDNAS+JAReD","metrics":{"Mean IoU":"22.1%"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/toward-edge-efficient-dense-predictions-with","paper_url":"https://arxiv.org/abs/2210.01384v1","paper_title":"Toward Edge-Efficient Dense Predictions with Synergistic Multi-Task Neural Architecture Search","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":120,"model":"Cross-stitch","metrics":{"Mean IoU":"19.3%"},"uses_additional_data":false,"paper_date":"2016-04-12","paper":"/paper/cross-stitch-networks-for-multi-task-learning","paper_url":"http://arxiv.org/abs/1604.03539v1","paper_title":"Cross-stitch Networks for Multi-task Learning","code":"https://github.com/helloyide/Cross-stitch-Networks-for-Multi-task-Learning","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":121,"model":"FCN-32s RGB-HHA","metrics":{"Mean Accuracy":"44"},"uses_additional_data":false,"paper_date":"2016-05-20","paper":"/paper/fully-convolutional-networks-for-semantic","paper_url":"http://arxiv.org/abs/1605.06211v1","paper_title":"Fully Convolutional Networks for Semantic Segmentation","code":"https://github.com/pytorch/vision","n_code_links":37,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,885 of the 9,623 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9623,"papers_checked":6885,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":2737},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":38,"rows_with_any_sample_ran":28,"distinct_papers_with_graph_line":25,"distinct_papers_with_any_sample_ran":19,"samples_over_distinct_papers":{"n_ran":70,"n_unverified":95,"n_samples":165,"n_pointer_only_licence":16,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":106,"n_unverified":131,"n_samples":237,"n_pointer_only_licence":18,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}