{"url":"/sota/instance-segmentation-on-coco","task":{"name":"Instance Segmentation","url":"/task/instance-segmentation","note":null},"dataset":{"name":"COCO test-dev","url":"/dataset/coco"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":"**Instance Segmentation** is a computer vision task that involves identifying and separating individual objects within an image, including detecting the boundaries of each object and assigning a unique label to each object. The goal of instance segmentation is to produce a pixel-wise segmentation map of the image, where each pixel is assigned to a specific object instance.\r\n\r\nImage Credit: [Deep Occlusion-Aware Instance Segmentation with Overlapping BiLayers, CVPR'21](https://github.com/lkeab/BCNet)","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["mask AP","AP50","AP75","APS","APM","APL"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"mask AP":"higher","AP50":null,"AP75":null,"APS":null,"APM":null,"APL":null}},"counts":{"rows":112,"rows_with_code":107,"rows_with_paper_page":112,"rows_dated":112,"rows_using_additional_data":20},"rows":[{"rank_in_archive_order":1,"model":"Co-DETR","metrics":{"AP50":"80.2","AP75":"63.4","APL":"72.0","APM":"60.1","APS":"41.6","mask AP":"57.1"},"uses_additional_data":true,"paper_date":"2022-11-22","paper":"/paper/detrs-with-collaborative-hybrid-assignments","paper_url":"https://arxiv.org/abs/2211.12860v5","paper_title":"DETRs with Collaborative Hybrid Assignments Training","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"CBNetV2 (EVA02, single-scale)","metrics":{"AP50":"80.3","AP75":"62.1","APL":"70.9","APM":"59.3","APS":"39.7","mask AP":"56.1"},"uses_additional_data":true,"paper_date":"2021-07-01","paper":"/paper/cbnetv2-a-composite-backbone-network","paper_url":"https://arxiv.org/abs/2107.00420v7","paper_title":"CBNet: A Composite Backbone Network Architecture for Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"EVA","metrics":{"AP50":"80.0","APL":"72.4","APM":"58.0","APS":"36.3","mask AP":"55.5"},"uses_additional_data":true,"paper_date":"2022-11-14","paper":"/paper/eva-exploring-the-limits-of-masked-visual","paper_url":"https://arxiv.org/abs/2211.07636v2","paper_title":"EVA: Exploring the Limits of Masked Visual Representation Learning at Scale","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"FD-SwinV2-G","metrics":{"mask AP":"55.4"},"uses_additional_data":true,"paper_date":"2022-05-27","paper":"/paper/contrastive-learning-rivals-masked-image","paper_url":"https://arxiv.org/abs/2205.14141v3","paper_title":"Contrastive Learning Rivals Masked Image Modeling in Fine-tuning via Feature Distillation","code":"https://github.com/SwinTransformer/Feature-Distillation","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":5,"model":"Mask Frozen-DETR","metrics":{"AP50":"79.3","AP75":"61.4","APL":"70.4","APM":"58.4","APS":"37.8","mask AP":"55.3"},"uses_additional_data":true,"paper_date":"2023-08-07","paper":"/paper/mask-frozen-detr-high-quality-instance","paper_url":"https://arxiv.org/abs/2308.03747v1","paper_title":"Mask Frozen-DETR: High Quality Instance Segmentation with One GPU","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":6,"model":"BEiT-3","metrics":{"mask AP":"54.8"},"uses_additional_data":false,"paper_date":"2022-08-22","paper":"/paper/image-as-a-foreign-language-beit-pretraining","paper_url":"https://arxiv.org/abs/2208.10442v2","paper_title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","code":"https://github.com/microsoft/unilm/tree/master/beit","n_code_links":2,"syntology":null},{"rank_in_archive_order":7,"model":"MasK DINO (SwinL, multi-scale)","metrics":{"mask AP":"54.7"},"uses_additional_data":true,"paper_date":"2022-06-06","paper":"/paper/mask-dino-towards-a-unified-transformer-based-1","paper_url":"https://arxiv.org/abs/2206.02777v3","paper_title":"Mask DINO: Towards A Unified Transformer-based Framework for Object Detection and Segmentation","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":10,"syntology":{"n_ran":11,"n_unverified":2,"n_samples":13,"n_pointer_only_licence":13}},{"rank_in_archive_order":8,"model":"ViT-Adapter-L (HTC++, BEiTv2, O365, multi-scale)","metrics":{"mask AP":"54.5"},"uses_additional_data":true,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":9,"model":"GLEE-Pro","metrics":{"mask AP":"54.5"},"uses_additional_data":true,"paper_date":"2023-12-14","paper":"/paper/general-object-foundation-model-for-images","paper_url":"https://arxiv.org/abs/2312.09158v1","paper_title":"General Object Foundation Model for Images and Videos at Scale","code":"https://github.com/FoundationVision/GLEE","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"SwinV2-G (HTC++)","metrics":{"mask AP":"54.4"},"uses_additional_data":true,"paper_date":"2021-11-18","paper":"/paper/swin-transformer-v2-scaling-up-capacity-and","paper_url":"https://arxiv.org/abs/2111.09883v2","paper_title":"Swin Transformer V2: Scaling Up Capacity and Resolution","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":23,"syntology":{"n_ran":3,"n_unverified":27,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"GLEE-Plus","metrics":{"mask AP":"53.3"},"uses_additional_data":true,"paper_date":"2023-12-14","paper":"/paper/general-object-foundation-model-for-images","paper_url":"https://arxiv.org/abs/2312.09158v1","paper_title":"General Object Foundation Model for Images and Videos at Scale","code":"https://github.com/FoundationVision/GLEE","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":12,"model":"Soft Teacher + Swin-L (HTC++, multi-scale)","metrics":{"mask AP":"53.0"},"uses_additional_data":true,"paper_date":"2021-06-16","paper":"/paper/end-to-end-semi-supervised-object-detection","paper_url":"https://arxiv.org/abs/2106.09018v3","paper_title":"End-to-End Semi-Supervised Object Detection with Soft Teacher","code":"https://github.com/microsoft/SoftTeacher","n_code_links":8,"syntology":null},{"rank_in_archive_order":13,"model":"ViT-Adapter-L (HTC++, BEiTv2 pretrain, multi-scale)","metrics":{"mask AP":"53.0"},"uses_additional_data":false,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":14,"model":"Mask DINO (SwinL, single -scale)","metrics":{"mask AP":"52.8"},"uses_additional_data":false,"paper_date":"2022-06-06","paper":"/paper/mask-dino-towards-a-unified-transformer-based-1","paper_url":"https://arxiv.org/abs/2206.02777v3","paper_title":"Mask DINO: Towards A Unified Transformer-based Framework for Object Detection and Segmentation","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":10,"syntology":{"n_ran":11,"n_unverified":2,"n_samples":13,"n_pointer_only_licence":13}},{"rank_in_archive_order":15,"model":"ViT-Adapter-L (HTC++, BEiT pretrain, multi-scale)","metrics":{"mask AP":"52.5"},"uses_additional_data":false,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":16,"model":"CBNetV2 (Dual-Swin-L HTC, multi-scale)","metrics":{"mask AP":"52.3"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/cbnetv2-a-composite-backbone-network","paper_url":"https://arxiv.org/abs/2107.00420v7","paper_title":"CBNet: A Composite Backbone Network Architecture for Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":17,"model":"UNINEXT-H","metrics":{"AP50":"76.2","AP75":"56.7","APL":"67.5","APM":"55.9","APS":"33.3","mask AP":"51.8"},"uses_additional_data":true,"paper_date":"2023-03-12","paper":"/paper/universal-instance-perception-as-object","paper_url":"https://arxiv.org/abs/2303.06674v2","paper_title":"Universal Instance Perception as Object Discovery and Retrieval","code":"https://github.com/MasterBin-IIAU/UNINEXT","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":18,"model":"CBNetV2 (Dual-Swin-L HTC, single-scale)","metrics":{"mask AP":"51.6"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/cbnetv2-a-composite-backbone-network","paper_url":"https://arxiv.org/abs/2107.00420v7","paper_title":"CBNet: A Composite Backbone Network Architecture for Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"Focal-L (HTC++, multi-scale)","metrics":{"AP50":"75.4","AP75":"56.5","APL":"64.2","APS":"35.6","mask AP":"51.3"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/focal-self-attention-for-local-global","paper_url":"https://arxiv.org/abs/2107.00641v1","paper_title":"Focal Self-attention for Local-Global Interactions in Vision Transformers","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification/Focal_Transformer","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":20,"model":"Swin-L (HTC++, multi scale)","metrics":{"mask AP":"51.1"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":21,"model":"Mask2Former (Swin-L, single scale)","metrics":{"AP50":"74.9","AP75":"54.9","APL":"71.2","APM":"53.8","APS":"29.1","mask AP":"50.5"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/masked-attention-mask-transformer-for","paper_url":"https://arxiv.org/abs/2112.01527v3","paper_title":"Masked-attention Mask Transformer for Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":22,"model":"Swin-L (HTC++, single scale)","metrics":{"mask AP":"50.2"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":23,"model":"ISTR-SMT (Swin-L, single scale)","metrics":{"mask AP":"49.7"},"uses_additional_data":false,"paper_date":"2021-05-03","paper":"/paper/istr-end-to-end-instance-segmentation-with","paper_url":"https://arxiv.org/abs/2105.00637v2","paper_title":"ISTR: End-to-End Instance Segmentation with Transformers","code":"https://github.com/hujiecpp/ISTR","n_code_links":1,"syntology":null},{"rank_in_archive_order":24,"model":"QueryInst (single scale)","metrics":{"AP50":"74.2","AP75":"53.8","APL":"63.2","APM":"51.8","APS":"31.5","mask AP":"49.1"},"uses_additional_data":false,"paper_date":"2021-05-05","paper":"/paper/queryinst-parallelly-supervised-mask-query","paper_url":"https://arxiv.org/abs/2105.01928v3","paper_title":"Instances as Queries","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":25,"model":"Cascade Eff-B7 NAS-FPN (1280, self-training Copy Paste, single-scale)","metrics":{"mask AP":"49.1"},"uses_additional_data":true,"paper_date":"2020-12-13","paper":"/paper/simple-copy-paste-is-a-strong-data","paper_url":"https://arxiv.org/abs/2012.07177v2","paper_title":"Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation","code":"https://github.com/PaddlePaddle/PaddleOCR","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":26,"model":"dBOT ViT-L (CLIP)","metrics":{"mask AP":"48.8"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":27,"model":"MogaNet-XL (Cascade Mask R-CNN)","metrics":{"mask AP":"48.8"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":28,"model":"DetectoRS (ResNeXt-101-64x4d, multi-scale)","metrics":{"AP50":"72.0","AP75":"53.3","APL":"61.5","APM":"50.9","APS":"31.6","mask AP":"48.5"},"uses_additional_data":false,"paper_date":"2020-06-03","paper":"/paper/detectors-detecting-objects-with-recursive-1","paper_url":"https://arxiv.org/abs/2006.02334v2","paper_title":"DetectoRS: Detecting Objects with Recursive Feature Pyramid and Switchable Atrous Convolution","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":29,"model":"dBOT ViT-L","metrics":{"mask AP":"48.3"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":30,"model":"DiffusionInst-SwinL","metrics":{"mask AP":"48.3"},"uses_additional_data":false,"paper_date":"2022-12-06","paper":"/paper/diffusioninst-diffusion-model-for-instance","paper_url":"https://arxiv.org/abs/2212.02773v3","paper_title":"DiffusionInst: Diffusion Model for Instance Segmentation","code":"https://github.com/chenhaoxing/DiffusionInst","n_code_links":2,"syntology":{"n_ran":11,"n_unverified":5,"n_samples":16,"n_pointer_only_licence":0}},{"rank_in_archive_order":31,"model":"GLEE-Lite","metrics":{"mask AP":"48.3"},"uses_additional_data":true,"paper_date":"2023-12-14","paper":"/paper/general-object-foundation-model-for-images","paper_url":"https://arxiv.org/abs/2312.09158v1","paper_title":"General Object Foundation Model for Images and Videos at Scale","code":"https://github.com/FoundationVision/GLEE","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":32,"model":"DiffusionInst-SwinB","metrics":{"mask AP":"47.6"},"uses_additional_data":false,"paper_date":"2022-12-06","paper":"/paper/diffusioninst-diffusion-model-for-instance","paper_url":"https://arxiv.org/abs/2212.02773v3","paper_title":"DiffusionInst: Diffusion Model for Instance Segmentation","code":"https://github.com/chenhaoxing/DiffusionInst","n_code_links":2,"syntology":{"n_ran":11,"n_unverified":5,"n_samples":16,"n_pointer_only_licence":0}},{"rank_in_archive_order":33,"model":"DetectoRS (ResNeXt-101-32x4d, multi-scale)","metrics":{"AP50":"71.1","AP75":"51.6","APL":"59.6","APM":"49.5","APS":"30.3","mask AP":"47.1"},"uses_additional_data":false,"paper_date":"2020-06-03","paper":"/paper/detectors-detecting-objects-with-recursive-1","paper_url":"https://arxiv.org/abs/2006.02334v2","paper_title":"DetectoRS: Detecting Objects with Recursive Feature Pyramid and Switchable Atrous Convolution","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":34,"model":"Cascade Eff-B7 NAS-FPN (1280)","metrics":{"mask AP":"46.9"},"uses_additional_data":false,"paper_date":"2020-12-13","paper":"/paper/simple-copy-paste-is-a-strong-data","paper_url":"https://arxiv.org/abs/2012.07177v2","paper_title":"Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation","code":"https://github.com/PaddlePaddle/PaddleOCR","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":35,"model":"SOLQ (Swin-L, single scale)","metrics":{"mask AP":"46.7"},"uses_additional_data":false,"paper_date":"2021-06-04","paper":"/paper/solq-segmenting-objects-by-learning-queries","paper_url":"https://arxiv.org/abs/2106.02351v3","paper_title":"SOLQ: Segmenting Objects by Learning Queries","code":"https://github.com/megvii-research/SOLQ","n_code_links":1,"syntology":null},{"rank_in_archive_order":36,"model":"dBOT ViT-B","metrics":{"mask AP":"46.3"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":37,"model":"dBOT ViT-B (CLIP)","metrics":{"mask AP":"46.2"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":38,"model":"Mask R-CNN (SpineNet-190, 1536x1536)","metrics":{"mask AP":"46.1"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/spinenet-learning-scale-permuted-backbone-for","paper_url":"https://arxiv.org/abs/1912.05027v3","paper_title":"SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/modeling/backbones","n_code_links":13,"syntology":null},{"rank_in_archive_order":39,"model":"MogaNet-L (Cascade Mask R-CNN)","metrics":{"mask AP":"46.1"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":40,"model":"MogaNet-B (Cascade Mask R-CNN)","metrics":{"mask AP":"46"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":41,"model":"Swin-B + Cascade Mask R-CNN (tri-layer modelling)","metrics":{"mask AP":"45.9"},"uses_additional_data":false,"paper_date":"2022-10-18","paper":"/paper/a-tri-layer-plugin-to-improve-occluded","paper_url":"https://arxiv.org/abs/2210.10046v1","paper_title":"A Tri-Layer Plugin to Improve Occluded Detection","code":"https://github.com/Championchess/Tri-Layer_Plugin_Occluded_Detection","n_code_links":1,"syntology":null},{"rank_in_archive_order":42,"model":"GCNet (ResNeXt-101 + DCN + cascade + GC r4)","metrics":{"AP50":"68.9","AP75":"49.6","mask AP":"45.4"},"uses_additional_data":false,"paper_date":"2020-12-24","paper":"/paper/global-context-networks","paper_url":"https://arxiv.org/abs/2012.13375v1","paper_title":"Global Context Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":null},{"rank_in_archive_order":43,"model":"MogaNet-S (Cascade Mask R-CNN)","metrics":{"mask AP":"45.1"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":44,"model":"gSwin-S","metrics":{"mask AP":"45.03"},"uses_additional_data":false,"paper_date":"2022-08-24","paper":"/paper/gswin-gated-mlp-vision-model-with","paper_url":"https://arxiv.org/abs/2208.11718v1","paper_title":"gSwin: Gated MLP Vision Model with Hierarchical Structure of Shifted Window","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":45,"model":"iBOT (ViT-B/16)","metrics":{"mask AP":"44.2"},"uses_additional_data":true,"paper_date":"2021-11-15","paper":"/paper/ibot-image-bert-pre-training-with-online","paper_url":"https://arxiv.org/abs/2111.07832v3","paper_title":"iBOT: Image BERT Pre-Training with Online Tokenizer","code":"https://github.com/bytedance/ibot","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":46,"model":"gSwin-T","metrics":{"mask AP":"44.16"},"uses_additional_data":false,"paper_date":"2022-08-24","paper":"/paper/gswin-gated-mlp-vision-model-with","paper_url":"https://arxiv.org/abs/2208.11718v1","paper_title":"gSwin: Gated MLP Vision Model with Hierarchical Structure of Shifted Window","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":47,"model":"MogaNet-L (Mask R-CNN 1x)","metrics":{"mask AP":"44.1"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":48,"model":"A2MIM (ViT-B)","metrics":{"mask AP":"43.5"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/architecture-agnostic-masked-image-modeling","paper_url":"https://arxiv.org/abs/2205.13943v4","paper_title":"Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN","code":"https://github.com/open-mmlab/mmpretrain","n_code_links":3,"syntology":null},{"rank_in_archive_order":49,"model":"Cascade Mask R-CNN (ResNeXt152, CBNet)","metrics":{"mask AP":"43.3"},"uses_additional_data":false,"paper_date":"2019-09-09","paper":"/paper/cbnet-a-novel-composite-backbone-network","paper_url":"https://arxiv.org/abs/1909.03625v1","paper_title":"CBNet: A Novel Composite Backbone Network Architecture for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":1}},{"rank_in_archive_order":50,"model":"MogaNet-B (Mask R-CNN 1x)","metrics":{"mask AP":"43.2"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":51,"model":"ResNeSt101","metrics":{"mask AP":"43%"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":52,"model":"gSwin-VT","metrics":{"mask AP":"42.87"},"uses_additional_data":false,"paper_date":"2022-08-24","paper":"/paper/gswin-gated-mlp-vision-model-with","paper_url":"https://arxiv.org/abs/2208.11718v1","paper_title":"gSwin: Gated MLP Vision Model with Hierarchical Structure of Shifted Window","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":53,"model":"iBOT (ViT-S/16)","metrics":{"mask AP":"42.6"},"uses_additional_data":true,"paper_date":"2021-11-15","paper":"/paper/ibot-image-bert-pre-training-with-online","paper_url":"https://arxiv.org/abs/2111.07832v3","paper_title":"iBOT: Image BERT Pre-Training with Online Tokenizer","code":"https://github.com/bytedance/ibot","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":54,"model":"Mask Transfiner(ResNet101-FPN)","metrics":{"mask AP":"42.2"},"uses_additional_data":false,"paper_date":"2021-11-26","paper":"/paper/mask-transfiner-for-high-quality-instance","paper_url":"https://arxiv.org/abs/2111.13673v1","paper_title":"Mask Transfiner for High-Quality Instance Segmentation","code":"https://github.com/SysCV/transfiner","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":55,"model":"MogaNet-S (Mask R-CNN 1x)","metrics":{"mask AP":"42.2"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":56,"model":"PANet","metrics":{"mask AP":"42.0"},"uses_additional_data":false,"paper_date":"2018-03-05","paper":"/paper/path-aggregation-network-for-instance","paper_url":"http://arxiv.org/abs/1803.01534v4","paper_title":"Path Aggregation Network for Instance Segmentation","code":"https://github.com/ultralytics/yolov5","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":1}},{"rank_in_archive_order":57,"model":"CenterMask + VoVNet99","metrics":{"APL":"54.3","APM":"44.4","APS":"24.4","mask AP":"41.8"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":58,"model":"SOLOv2(Res-DCN-101-FPN)","metrics":{"AP50":"63.2","AP75":"45.1","APL":"61.6","APM":"45.0","APS":"18.0","mask AP":"41.7"},"uses_additional_data":false,"paper_date":"2020-03-23","paper":"/paper/solov2-dynamic-faster-and-stronger","paper_url":"https://arxiv.org/abs/2003.10152v3","paper_title":"SOLOv2: Dynamic and Fast Instance Segmentation","code":"https://github.com/open-mmlab/mmdetection","n_code_links":18,"syntology":{"n_ran":15,"n_unverified":23,"n_samples":38,"n_pointer_only_licence":24}},{"rank_in_archive_order":59,"model":"BCNet(ResNeXt-101  + FPN+ FCOS)","metrics":{"mask AP":"41.7"},"uses_additional_data":false,"paper_date":"2021-03-23","paper":"/paper/deep-occlusion-aware-instance-segmentation","paper_url":"https://arxiv.org/abs/2103.12340v1","paper_title":"Deep Occlusion-Aware Instance Segmentation with Overlapping BiLayers","code":"https://github.com/lkeab/BCNet","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":5,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":60,"model":"GCNet (ResNeXt-101 + DCN + cascade + GC r16)","metrics":{"mask AP":"41.5%"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/gcnet-non-local-networks-meet-squeeze","paper_url":"http://arxiv.org/abs/1904.11492v1","paper_title":"GCNet: Non-local Networks Meet Squeeze-Excitation Networks and Beyond","code":"https://github.com/open-mmlab/mmdetection","n_code_links":9,"syntology":null},{"rank_in_archive_order":61,"model":"DiffusionInst-ResNet101","metrics":{"mask AP":"41.5"},"uses_additional_data":false,"paper_date":"2022-12-06","paper":"/paper/diffusioninst-diffusion-model-for-instance","paper_url":"https://arxiv.org/abs/2212.02773v3","paper_title":"DiffusionInst: Diffusion Model for Instance Segmentation","code":"https://github.com/chenhaoxing/DiffusionInst","n_code_links":2,"syntology":{"n_ran":11,"n_unverified":5,"n_samples":16,"n_pointer_only_licence":0}},{"rank_in_archive_order":62,"model":"BlendMask (ResNet-101 + DCN interval=3)","metrics":{"AP50":"63.1","AP75":"44.6","APL":"54.5","APM":"44.1","APS":"22.7","mask AP":"41.3"},"uses_additional_data":false,"paper_date":"2020-01-02","paper":"/paper/blendmask-top-down-meets-bottom-up-for","paper_url":"https://arxiv.org/abs/2001.00309v3","paper_title":"BlendMask: Top-Down Meets Bottom-Up for Instance Segmentation","code":"https://github.com/aim-uofa/AdelaiDet","n_code_links":9,"syntology":null},{"rank_in_archive_order":63,"model":"HTC + ResNeXt-101-FPN + DCN","metrics":{"mask AP":"41.2"},"uses_additional_data":true,"paper_date":"2019-01-22","paper":"/paper/hybrid-task-cascade-for-instance-segmentation","paper_url":"http://arxiv.org/abs/1901.07518v2","paper_title":"Hybrid Task Cascade for Instance Segmentation","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":11,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":64,"model":"HTC + ResNeXt-101-FPN","metrics":{"mask AP":"41.2%"},"uses_additional_data":false,"paper_date":"2019-01-22","paper":"/paper/hybrid-task-cascade-for-instance-segmentation","paper_url":"http://arxiv.org/abs/1901.07518v2","paper_title":"Hybrid Task Cascade for Instance Segmentation","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":11,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":65,"model":"SOLQ (ResNet101, single scale)","metrics":{"mask AP":"40.9"},"uses_additional_data":false,"paper_date":"2021-06-04","paper":"/paper/solq-segmenting-objects-by-learning-queries","paper_url":"https://arxiv.org/abs/2106.02351v3","paper_title":"SOLQ: Segmenting Objects by Learning Queries","code":"https://github.com/megvii-research/SOLQ","n_code_links":1,"syntology":null},{"rank_in_archive_order":66,"model":"VoVNetV1-57","metrics":{"mask AP":"40.8%"},"uses_additional_data":false,"paper_date":"2019-04-22","paper":"/paper/an-energy-and-gpu-computation-efficient","paper_url":"http://arxiv.org/abs/1904.09730v1","paper_title":"An Energy and GPU-Computation Efficient Backbone Network for Real-Time Object Detection","code":"https://github.com/osmr/imgclsmob","n_code_links":12,"syntology":null},{"rank_in_archive_order":67,"model":"K-Net-N256 (ResNet-101)","metrics":{"AP50":"63.3","APL":"59","APM":"43.3","APS":"18.8","mask AP":"40.6%"},"uses_additional_data":false,"paper_date":"2021-06-28","paper":"/paper/k-net-towards-unified-image-segmentation","paper_url":"https://arxiv.org/abs/2106.14855v2","paper_title":"K-Net: Towards Unified Image Segmentation","code":"https://github.com/zwwwayne/k-net","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":68,"model":"CenterMask + VoVNetV2-99 (single-scale)","metrics":{"AP50":"62.3","AP75":"44.1","APL":"57.0","APM":"42.8","APS":"20.1","mask AP":"40.6"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":69,"model":"SOLO(Res-DCN-101-FPN)","metrics":{"AP50":"62.7","AP75":"43.3","APL":"58.9","APM":"43.3","APS":"17.6","mask AP":"40.4"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/solo-segmenting-objects-by-locations","paper_url":"https://arxiv.org/abs/1912.04488v3","paper_title":"SOLO: Segmenting Objects by Locations","code":"https://github.com/open-mmlab/mmdetection","n_code_links":24,"syntology":null},{"rank_in_archive_order":70,"model":"SOLO (ResNet-DCN-101-FPN)","metrics":{"AP50":"62.7%","AP75":"43.3%","APL":"58.9%","APM":"43.3%","APS":"17.6%","mask AP":"40.4%"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/solo-segmenting-objects-by-locations","paper_url":"https://arxiv.org/abs/1912.04488v3","paper_title":"SOLO: Segmenting Objects by Locations","code":"https://github.com/open-mmlab/mmdetection","n_code_links":24,"syntology":null},{"rank_in_archive_order":71,"model":"D2Det (ResNet-101, single-scale test)","metrics":{"AP50":"61.5","AP75":"43.7","APL":"54.0","APM":"43.0","APS":"21.7","mask AP":"40.2"},"uses_additional_data":false,"paper_date":"2020-06-01","paper":"/paper/d2det-towards-high-quality-object-detection","paper_url":"http://openaccess.thecvf.com/content_CVPR_2020/html/Cao_D2Det_Towards_High_Quality_Object_Detection_and_Instance_Segmentation_CVPR_2020_paper.html","paper_title":"D2Det: Towards High Quality Object Detection and Instance Segmentation","code":"https://github.com/JialeCao001/D2Det","n_code_links":1,"syntology":null},{"rank_in_archive_order":72,"model":"K-Net (ResNet-101)","metrics":{"AP50":"62.8","APL":"58.8","APM":"42.7","APS":"18.7","mask AP":"40.1%"},"uses_additional_data":false,"paper_date":"2021-06-28","paper":"/paper/k-net-towards-unified-image-segmentation","paper_url":"https://arxiv.org/abs/2106.14855v2","paper_title":"K-Net: Towards Unified Image Segmentation","code":"https://github.com/zwwwayne/k-net","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":73,"model":"ISTR (ResNet101-FPN-3x, single-scale)","metrics":{"APL":"52.3","APM":"41.9","APS":"22.8","mask AP":"39.9%"},"uses_additional_data":false,"paper_date":"2021-05-03","paper":"/paper/istr-end-to-end-instance-segmentation-with","paper_url":"https://arxiv.org/abs/2105.00637v2","paper_title":"ISTR: End-to-End Instance Segmentation with Transformers","code":"https://github.com/hujiecpp/ISTR","n_code_links":1,"syntology":null},{"rank_in_archive_order":74,"model":"BCNet(ResNet-101-FPN + Faster RCNN)","metrics":{"AP50":"61.5","AP75":"43.1","APL":"51.1","APM":"42.4","APS":"22.7","mask AP":"39.8"},"uses_additional_data":false,"paper_date":"2021-03-23","paper":"/paper/deep-occlusion-aware-instance-segmentation","paper_url":"https://arxiv.org/abs/2103.12340v1","paper_title":"Deep Occlusion-Aware Instance Segmentation with Overlapping BiLayers","code":"https://github.com/lkeab/BCNet","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":5,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":75,"model":"VoVNetV1-39","metrics":{"mask AP":"39.7%"},"uses_additional_data":false,"paper_date":"2019-04-22","paper":"/paper/an-energy-and-gpu-computation-efficient","paper_url":"http://arxiv.org/abs/1904.09730v1","paper_title":"An Energy and GPU-Computation Efficient Backbone Network for Real-Time Object Detection","code":"https://github.com/osmr/imgclsmob","n_code_links":12,"syntology":null},{"rank_in_archive_order":76,"model":"SOLQ (ResNet50, single scale)","metrics":{"mask AP":"39.7"},"uses_additional_data":false,"paper_date":"2021-06-04","paper":"/paper/solq-segmenting-objects-by-learning-queries","paper_url":"https://arxiv.org/abs/2106.02351v3","paper_title":"SOLQ: Segmenting Objects by Learning Queries","code":"https://github.com/megvii-research/SOLQ","n_code_links":1,"syntology":null},{"rank_in_archive_order":77,"model":"CenterMask + X101-32x8d (single-scale)","metrics":{"AP50":"61.2","AP75":"42.9","APS":"19.7","mask AP":"39.6"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":78,"model":"BCNet(ResNet-101-FPN + FCOS)","metrics":{"AP50":"61.2","AP75":"42.7","APL":"51.0","APM":"42.3","APS":"22.3","mask AP":"39.6"},"uses_additional_data":false,"paper_date":"2021-03-23","paper":"/paper/deep-occlusion-aware-instance-segmentation","paper_url":"https://arxiv.org/abs/2103.12340v1","paper_title":"Deep Occlusion-Aware Instance Segmentation with Overlapping BiLayers","code":"https://github.com/lkeab/BCNet","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":5,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":79,"model":"MS R-CNN + ResNet-101 DCN + FPN","metrics":{"mask AP":"39.6%"},"uses_additional_data":false,"paper_date":"2019-03-01","paper":"/paper/mask-scoring-r-cnn","paper_url":"http://arxiv.org/abs/1903.00241v1","paper_title":"Mask Scoring R-CNN","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":80,"model":"Cascade R-CNN (ResNet-101-FPN, map-guided)","metrics":{"AP50":"61.4%","AP75":"42.9%","APL":"52.1%","APM":"42.5%","APS":"21.2%","mask AP":"39.5%"},"uses_additional_data":false,"paper_date":"2019-08-21","paper":"/paper/instaboost-boosting-instance-segmentation-via","paper_url":"https://arxiv.org/abs/1908.07801v1","paper_title":"InstaBoost: Boosting Instance Segmentation via Probability Map Guided Copy-Pasting","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":null},{"rank_in_archive_order":81,"model":"CPMask","metrics":{"AP50":"60.8","AP75":"42.2","APL":"50.1","APM":"41.8","APS":"22.2","mask AP":"39.2"},"uses_additional_data":false,"paper_date":"2020-07-24","paper":"/paper/commonality-parsing-network-across-shape-and","paper_url":"https://arxiv.org/abs/2007.12387v1","paper_title":"Commonality-Parsing Network across Shape and Appearance for Partially Supervised Instance Segmentation","code":"https://github.com/fanq15/FewX","n_code_links":1,"syntology":null},{"rank_in_archive_order":82,"model":"MogaNet-T (Mask R-CNN 1x)","metrics":{"mask AP":"39.1"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":83,"model":"PolarMask++ (ResNeXt-101-DCN)","metrics":{"AP50":"64.1","AP75":"40.0","APL":"52.0","APM":"40.2","APS":"22.2","mask AP":"38.7"},"uses_additional_data":true,"paper_date":"2021-05-05","paper":"/paper/polarmask-enhanced-polar-representation-for","paper_url":"https://arxiv.org/abs/2105.02184v1","paper_title":"PolarMask++: Enhanced Polar Representation for Single-Shot Instance Segmentation and Beyond","code":"https://github.com/xieenze/PolarMask","n_code_links":1,"syntology":null},{"rank_in_archive_order":84,"model":"ISDA (ours)","metrics":{"AP50":"62","AP75":"41.1","APM":"41.2","APS":"17","mask AP":"38.7"},"uses_additional_data":false,"paper_date":"2022-02-23","paper":"/paper/isda-position-aware-instance-segmentation","paper_url":"https://arxiv.org/abs/2202.12251v1","paper_title":"ISDA: Position-Aware Instance Segmentation with Deformable Attention","code":"https://github.com/yingkaining/isda","n_code_links":1,"syntology":null},{"rank_in_archive_order":85,"model":"ISTR (ResNet50-FPN-3x, single-scale)","metrics":{"APL":"50.6","APM":"40.4","APS":"22.1","mask AP":"38.6%"},"uses_additional_data":false,"paper_date":"2021-05-03","paper":"/paper/istr-end-to-end-instance-segmentation-with","paper_url":"https://arxiv.org/abs/2105.00637v2","paper_title":"ISTR: End-to-End Instance Segmentation with Transformers","code":"https://github.com/hujiecpp/ISTR","n_code_links":1,"syntology":null},{"rank_in_archive_order":86,"model":"CenterMask + ResNet-101-FPN","metrics":{"mask AP":"38.3"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":87,"model":"SipMask (ResNet-101, single-scale test)","metrics":{"AP50":"60.2","AP75":"40.8","APL":"54.3","APM":"40.8","APS":"17.8","mask AP":"38.1"},"uses_additional_data":false,"paper_date":"2020-07-29","paper":"/paper/sipmask-spatial-information-preservation-for","paper_url":"https://arxiv.org/abs/2007.14772v1","paper_title":"SipMask: Spatial Information Preservation for Fast Image and Video Instance Segmentation","code":"https://github.com/JialeCao001/SipMask","n_code_links":1,"syntology":null},{"rank_in_archive_order":88,"model":"MaskLab+ (ResNet-101, JFT)","metrics":{"mask AP":"38.1%"},"uses_additional_data":true,"paper_date":"2017-12-13","paper":"/paper/masklab-instance-segmentation-by-refining","paper_url":"http://arxiv.org/abs/1712.04837v1","paper_title":"MaskLab: Instance Segmentation by Refining Object Detection with Semantic and Direction Features","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":89,"model":"EmbedMask (ResNet-101-FPN)","metrics":{"AP50":"59.1%","AP75":"40.3%","APL":"53%","APM":"40.4%","APS":"17.9%","mask AP":"37.7%"},"uses_additional_data":false,"paper_date":"2019-12-04","paper":"/paper/embedmask-embedding-coupling-for-one-stage","paper_url":"https://arxiv.org/abs/1912.01954v2","paper_title":"EmbedMask: Embedding Coupling for One-stage Instance Segmentation","code":"https://github.com/yinghdb/EmbedMask","n_code_links":3,"syntology":null},{"rank_in_archive_order":90,"model":"EmbedMask(R-101-FPN)","metrics":{"AP50":"59.1","AP75":"40.3","APM":"40.4","APS":"17.9","mask AP":"37.7"},"uses_additional_data":false,"paper_date":"2019-12-04","paper":"/paper/embedmask-embedding-coupling-for-one-stage","paper_url":"https://arxiv.org/abs/1912.01954v2","paper_title":"EmbedMask: Embedding Coupling for One-stage Instance Segmentation","code":"https://github.com/yinghdb/EmbedMask","n_code_links":3,"syntology":null},{"rank_in_archive_order":91,"model":"MogaNet-XT","metrics":{"mask AP":"37.6"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":92,"model":"TensorMask (ResNet-101-FPN)","metrics":{"mask AP":"37.3%"},"uses_additional_data":false,"paper_date":"2019-03-28","paper":"/paper/tensormask-a-foundation-for-dense-object","paper_url":"https://arxiv.org/abs/1903.12174v2","paper_title":"TensorMask: A Foundation for Dense Object Segmentation","code":"https://github.com/facebookresearch/detectron2/tree/master/projects/TensorMask","n_code_links":2,"syntology":null},{"rank_in_archive_order":93,"model":"Mask R-CNN (ResNeXt-101-FPN)","metrics":{"AP50":"60.0","AP75":"39.4","APL":"53.5","APM":"39.9","APS":"16.9","mask AP":"37.1"},"uses_additional_data":false,"paper_date":"2017-03-20","paper":"/paper/mask-r-cnn","paper_url":"http://arxiv.org/abs/1703.06870v3","paper_title":"Mask R-CNN","code":"https://github.com/tensorflow/models/tree/master/official/vision","n_code_links":179,"syntology":{"n_ran":42,"n_unverified":98,"n_samples":140,"n_pointer_only_licence":23}},{"rank_in_archive_order":94,"model":"DiffusionInst-ResNet50","metrics":{"mask AP":"37.1"},"uses_additional_data":false,"paper_date":"2022-12-06","paper":"/paper/diffusioninst-diffusion-model-for-instance","paper_url":"https://arxiv.org/abs/2212.02773v3","paper_title":"DiffusionInst: Diffusion Model for Instance Segmentation","code":"https://github.com/chenhaoxing/DiffusionInst","n_code_links":2,"syntology":{"n_ran":11,"n_unverified":5,"n_samples":16,"n_pointer_only_licence":0}},{"rank_in_archive_order":95,"model":"VirTex Mask R-CNN (ResNet-50-FPN)","metrics":{"AP50":"58.4","AP75":"39.7","mask AP":"36.9"},"uses_additional_data":false,"paper_date":"2020-06-11","paper":"/paper/virtex-learning-visual-representations-from","paper_url":"https://arxiv.org/abs/2006.06666v3","paper_title":"VirTex: Learning Visual Representations from Textual Annotations","code":"https://github.com/kdexd/virtex","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":96,"model":"RDSNet (data aug)","metrics":{"AP50":"57.9%","AP75":"39.0%","APL":"51.6%","APM":"39.5%","APS":"16.4%","mask AP":"36.4%"},"uses_additional_data":false,"paper_date":"2019-12-11","paper":"/paper/rdsnet-a-new-deep-architecture-for-reciprocal","paper_url":"https://arxiv.org/abs/1912.05070v1","paper_title":"RDSNet: A New Deep Architecture for Reciprocal Object Detection and Instance Segmentation","code":"https://github.com/wangsr126/RDSNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":97,"model":"MogaNet-T","metrics":{"mask AP":"35.8"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":98,"model":"A2MIM (ResNet-50 2x)","metrics":{"mask AP":"34.9"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/architecture-agnostic-masked-image-modeling","paper_url":"https://arxiv.org/abs/2205.13943v4","paper_title":"Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN","code":"https://github.com/open-mmlab/mmpretrain","n_code_links":3,"syntology":null},{"rank_in_archive_order":99,"model":"E2EC DLA-34","metrics":{"AP50":"52.9","AP75":"35.9","mask AP":"33.8"},"uses_additional_data":false,"paper_date":"2022-03-08","paper":"/paper/e2ec-an-end-to-end-contour-based-method-for","paper_url":"https://arxiv.org/abs/2203.04074v1","paper_title":"E2EC: An End-to-End Contour-based Method for High-Quality High-Speed Instance Segmentation","code":"https://github.com/zhang-tao-whu/e2ec","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":2,"n_samples":10,"n_pointer_only_licence":10}},{"rank_in_archive_order":100,"model":"FCIS+++  +OHEM","metrics":{"AP50":"54.5%","mask AP":"33.6%"},"uses_additional_data":false,"paper_date":"2016-11-23","paper":"/paper/fully-convolutional-instance-aware-semantic","paper_url":"http://arxiv.org/abs/1611.07709v2","paper_title":"Fully Convolutional Instance-aware Semantic Segmentation","code":"https://github.com/divamgupta/image-segmentation-keras","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":101,"model":"Mask R-CNN (Bottleneck-injected ResNet-50, FPN)","metrics":{"mask AP":"33.6"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/torchdistill-a-modular-configuration-driven","paper_url":"https://arxiv.org/abs/2011.12913v2","paper_title":"torchdistill: A Modular, Configuration-Driven Framework for Knowledge Distillation","code":"https://github.com/yoshitomo-matsubara/torchdistill","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":16,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":102,"model":"PolarMask (ResNeXt-101-FPN)","metrics":{"AP50":"55.4%","AP75":"33.8%","APL":"46.3%","APM":"35.1%","APS":"15.5%","mask AP":"32.9%"},"uses_additional_data":false,"paper_date":"2019-09-29","paper":"/paper/polarmask-single-shot-instance-segmentation","paper_url":"https://arxiv.org/abs/1909.13226v4","paper_title":"PolarMask: Single Shot Instance Segmentation with Polar Representation","code":"https://github.com/xieenze/PolarMask","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":103,"model":"PolarMask (ResNet-101-FPN)","metrics":{"AP50":"51.9%","AP75":"31%","APL":"42.8%","APM":"32.4%","APS":"13.4%","mask AP":"30.4%"},"uses_additional_data":false,"paper_date":"2019-09-29","paper":"/paper/polarmask-single-shot-instance-segmentation","paper_url":"https://arxiv.org/abs/1909.13226v4","paper_title":"PolarMask: Single Shot Instance Segmentation with Polar Representation","code":"https://github.com/xieenze/PolarMask","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":104,"model":"YOLACT (ResNet-50-FPN)","metrics":{"mask AP":"29.8%"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/yolact-real-time-instance-segmentation","paper_url":"https://arxiv.org/abs/1904.02689v2","paper_title":"YOLACT: Real-time Instance Segmentation","code":"https://github.com/open-mmlab/mmdetection","n_code_links":48,"syntology":{"n_ran":10,"n_unverified":11,"n_samples":21,"n_pointer_only_licence":6}},{"rank_in_archive_order":105,"model":"FCIS  +OHEM","metrics":{"AP50":"49.5%","APL":"50.0%","APM":"31.3%","APS":"7.1%","mask AP":"29.2%"},"uses_additional_data":false,"paper_date":"2016-11-23","paper":"/paper/fully-convolutional-instance-aware-semantic","paper_url":"http://arxiv.org/abs/1611.07709v2","paper_title":"Fully Convolutional Instance-aware Semantic Segmentation","code":"https://github.com/divamgupta/image-segmentation-keras","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":106,"model":"MultiPath Network","metrics":{"mask AP":"25.0%"},"uses_additional_data":false,"paper_date":"2016-04-07","paper":"/paper/a-multipath-network-for-object-detection","paper_url":"http://arxiv.org/abs/1604.02135v2","paper_title":"A MultiPath Network for Object Detection","code":"https://github.com/facebookresearch/multipathnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":107,"model":"InternImage-H","metrics":{"AP50":"80.8","AP75":"62.2","APL":"70.3","APM":"58.9","APS":"41.0"},"uses_additional_data":true,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":108,"model":"ResNeSt-200 (multi-scale)","metrics":{"AP50":"70.2","AP75":"51.5","APL":"60.6","APM":"49.6","APS":"30.0"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":109,"model":"CenterMask + VoVNetV2-99 (multi-scale)","metrics":{"AP50":"66.2","AP75":"47.4","APS":"27.2"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":110,"model":"CenterMask + VoVNetV2-57 (single-scale)","metrics":{"AP50":"60.8","APM":"41.7","APS":"19.4"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":111,"model":"MNC","metrics":{"AP50":"44.3%"},"uses_additional_data":false,"paper_date":"2015-12-14","paper":"/paper/instance-aware-semantic-segmentation-via","paper_url":"http://arxiv.org/abs/1512.04412v1","paper_title":"Instance-aware Semantic Segmentation via Multi-task Network Cascades","code":"https://github.com/daijifeng001/MNC","n_code_links":2,"syntology":null},{"rank_in_archive_order":112,"model":"ISDA (ResNet-50)","metrics":{"APL":"55.7"},"uses_additional_data":false,"paper_date":"2022-02-23","paper":"/paper/isda-position-aware-instance-segmentation","paper_url":"https://arxiv.org/abs/2202.12251v1","paper_title":"ISDA: Position-Aware Instance Segmentation with Deformable Attention","code":"https://github.com/yingkaining/isda","n_code_links":1,"syntology":null}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":72,"rows_with_any_sample_ran":57,"distinct_papers_with_graph_line":36,"distinct_papers_with_any_sample_ran":27,"samples_over_distinct_papers":{"n_ran":280,"n_unverified":403,"n_samples":683,"n_pointer_only_licence":160,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":604,"n_unverified":660,"n_samples":1264,"n_pointer_only_licence":253,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}