{"url":"/sota/instance-segmentation-on-coco-minival","task":{"name":"Instance Segmentation","url":"/task/instance-segmentation","note":null},"dataset":{"name":"COCO minival","url":"/dataset/coco"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":"**Instance Segmentation** is a computer vision task that involves identifying and separating individual objects within an image, including detecting the boundaries of each object and assigning a unique label to each object. The goal of instance segmentation is to produce a pixel-wise segmentation map of the image, where each pixel is assigned to a specific object instance.\r\n\r\nImage Credit: [Deep Occlusion-Aware Instance Segmentation with Overlapping BiLayers, CVPR'21](https://github.com/lkeab/BCNet)","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["mask AP","AP50","AP75","APL","APM","APS","GFLOPs","Params (M)","box AP"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"mask AP":"higher","AP50":null,"AP75":null,"APL":null,"APM":null,"APS":null,"GFLOPs":null,"Params (M)":"lower","box AP":"higher"}},"counts":{"rows":93,"rows_with_code":89,"rows_with_paper_page":93,"rows_dated":93,"rows_using_additional_data":13},"rows":[{"rank_in_archive_order":1,"model":"Co-DETR","metrics":{"AP50":"79.7","AP75":"62.8","APL":"74.6","APM":"59.7","APS":"38.9","mask AP":"56.6"},"uses_additional_data":true,"paper_date":"2022-11-22","paper":"/paper/detrs-with-collaborative-hybrid-assignments","paper_url":"https://arxiv.org/abs/2211.12860v5","paper_title":"DETRs with Collaborative Hybrid Assignments Training","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"ViT-CoMer-L (Mask RCNN, DINOv2)","metrics":{"mask AP":"55.9"},"uses_additional_data":false,"paper_date":"2024-03-13","paper":"/paper/vit-comer-vision-transformer-with","paper_url":"https://openreview.net/forum?id=srPMwpkWbR&invitationId=thecvf.com/CVPR/2024/Conference/Submission1221/-/Camera_Ready_Revision&referrer=%5BAuthor%20Console%5D(%2Fgroup%3Fid%3Dthecvf.com%2FCVPR%2F2024%2FConference%2FAuthors%23author-tasks)","paper_title":"ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions","code":"https://github.com/Traffic-X/ViT-CoMer","n_code_links":2,"syntology":null},{"rank_in_archive_order":3,"model":"InternImage-H","metrics":{"AP50":"80.1","AP75":"61.5","APL":"74.4","APM":"58.4","APS":"37.9","mask AP":"55.4"},"uses_additional_data":true,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"EVA","metrics":{"AP50":"79.4","AP75":"60.9","APL":"72.0","APM":"58.4","APS":"37.6","mask AP":"55.0"},"uses_additional_data":true,"paper_date":"2022-11-14","paper":"/paper/eva-exploring-the-limits-of-masked-visual","paper_url":"https://arxiv.org/abs/2211.07636v2","paper_title":"EVA: Exploring the Limits of Masked Visual Representation Learning at Scale","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"Mask Frozen-DETR","metrics":{"AP50":"78.9","AP75":"60.8","APL":"72.9","APM":"58.4 ","APS":"37.2","mask AP":"54.9"},"uses_additional_data":true,"paper_date":"2023-08-07","paper":"/paper/mask-frozen-detr-high-quality-instance","paper_url":"https://arxiv.org/abs/2308.03747v1","paper_title":"Mask Frozen-DETR: High Quality Instance Segmentation with One GPU","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":6,"model":"MasK DINO (SwinL, multi-scale)","metrics":{"mask AP":"54.5"},"uses_additional_data":true,"paper_date":"2022-06-06","paper":"/paper/mask-dino-towards-a-unified-transformer-based-1","paper_url":"https://arxiv.org/abs/2206.02777v3","paper_title":"Mask DINO: Towards A Unified Transformer-based Framework for Object Detection and Segmentation","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":10,"syntology":{"n_ran":11,"n_unverified":2,"n_samples":13,"n_pointer_only_licence":13}},{"rank_in_archive_order":7,"model":"ViT-Adapter-L (HTC++, BEiTv2, O365, multi-scale)","metrics":{"mask AP":"54.2"},"uses_additional_data":true,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":8,"model":"GLEE-Pro","metrics":{"mask AP":"54.2"},"uses_additional_data":true,"paper_date":"2023-12-14","paper":"/paper/general-object-foundation-model-for-images","paper_url":"https://arxiv.org/abs/2312.09158v1","paper_title":"General Object Foundation Model for Images and Videos at Scale","code":"https://github.com/FoundationVision/GLEE","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"SwinV2-G (HTC++)","metrics":{"mask AP":"53.7"},"uses_additional_data":true,"paper_date":"2021-11-18","paper":"/paper/swin-transformer-v2-scaling-up-capacity-and","paper_url":"https://arxiv.org/abs/2111.09883v2","paper_title":"Swin Transformer V2: Scaling Up Capacity and Resolution","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":23,"syntology":{"n_ran":3,"n_unverified":27,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"ViTDet, ViT-H Cascade (multiscale)","metrics":{"mask AP":"53.1"},"uses_additional_data":false,"paper_date":"2022-03-30","paper":"/paper/exploring-plain-vision-transformer-backbones","paper_url":"https://arxiv.org/abs/2203.16527v2","paper_title":"Exploring Plain Vision Transformer Backbones for Object Detection","code":"https://github.com/facebookresearch/detectron2/tree/main/projects/ViTDet","n_code_links":11,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"GLEE-Plus","metrics":{"mask AP":"53.0"},"uses_additional_data":true,"paper_date":"2023-12-14","paper":"/paper/general-object-foundation-model-for-images","paper_url":"https://arxiv.org/abs/2312.09158v1","paper_title":"General Object Foundation Model for Images and Videos at Scale","code":"https://github.com/FoundationVision/GLEE","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":12,"model":"Mask DINO (SwinL)","metrics":{"mask AP":"52.6"},"uses_additional_data":false,"paper_date":"2022-06-06","paper":"/paper/mask-dino-towards-a-unified-transformer-based-1","paper_url":"https://arxiv.org/abs/2206.02777v3","paper_title":"Mask DINO: Towards A Unified Transformer-based Framework for Object Detection and Segmentation","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":10,"syntology":{"n_ran":11,"n_unverified":2,"n_samples":13,"n_pointer_only_licence":13}},{"rank_in_archive_order":13,"model":"Soft Teacher + Swin-L(HTC++, multi-scale)","metrics":{"mask AP":"52.5"},"uses_additional_data":true,"paper_date":"2021-06-16","paper":"/paper/end-to-end-semi-supervised-object-detection","paper_url":"https://arxiv.org/abs/2106.09018v3","paper_title":"End-to-End Semi-Supervised Object Detection with Soft Teacher","code":"https://github.com/microsoft/SoftTeacher","n_code_links":8,"syntology":null},{"rank_in_archive_order":14,"model":"ViT-Adapter-L (HTC++, BEiTv2 pretrain, multi-scale)","metrics":{"mask AP":"52.5"},"uses_additional_data":false,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":15,"model":"ViT-Adapter-L (HTC++, BEiT pretrain, multi-scale)","metrics":{"mask AP":"52.2"},"uses_additional_data":false,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":16,"model":"ViTDet, ViT-H Cascade","metrics":{"mask AP":"52"},"uses_additional_data":false,"paper_date":"2022-03-30","paper":"/paper/exploring-plain-vision-transformer-backbones","paper_url":"https://arxiv.org/abs/2203.16527v2","paper_title":"Exploring Plain Vision Transformer Backbones for Object Detection","code":"https://github.com/facebookresearch/detectron2/tree/main/projects/ViTDet","n_code_links":11,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":17,"model":"Soft Teacher + Swin-L(HTC++, single-scale)","metrics":{"mask AP":"51.9"},"uses_additional_data":true,"paper_date":"2021-06-16","paper":"/paper/end-to-end-semi-supervised-object-detection","paper_url":"https://arxiv.org/abs/2106.09018v3","paper_title":"End-to-End Semi-Supervised Object Detection with Soft Teacher","code":"https://github.com/microsoft/SoftTeacher","n_code_links":8,"syntology":null},{"rank_in_archive_order":18,"model":"CBNetV2 (Dual-Swin-L HTC, multi-scale)","metrics":{"mask AP":"51.8"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/cbnetv2-a-composite-backbone-network","paper_url":"https://arxiv.org/abs/2107.00420v7","paper_title":"CBNet: A Composite Backbone Network Architecture for Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"Frozen Backbone, SwinV2-G-ext22K (HTC)","metrics":{"mask AP":"51.6"},"uses_additional_data":false,"paper_date":"2022-11-03","paper":"/paper/could-giant-pretrained-image-models-extract","paper_url":"https://arxiv.org/abs/2211.02043v1","paper_title":"Could Giant Pretrained Image Models Extract Universal Representations?","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":20,"model":"CBNetV2 (Dual-Swin-L HTC, multi-scale)","metrics":{"mask AP":"51"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/cbnetv2-a-composite-backbone-network","paper_url":"https://arxiv.org/abs/2107.00420v7","paper_title":"CBNet: A Composite Backbone Network Architecture for Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"Focal-L (HTC++, multi-scale)","metrics":{"mask AP":"50.9"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/focal-self-attention-for-local-global","paper_url":"https://arxiv.org/abs/2107.00641v1","paper_title":"Focal Self-attention for Local-Global Interactions in Vision Transformers","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification/Focal_Transformer","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":22,"model":"DiNAT-L (single-scale, Mask2Former)","metrics":{"AP50":"75.0","mask AP":"50.8"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":23,"model":"MViTv2-L (Cascade Mask R-CNN, multi-scale, IN21k pre-train)","metrics":{"mask AP":"50.5"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":24,"model":"Swin-L (HTC++, multi scale)","metrics":{"mask AP":"50.4"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":25,"model":"MOAT-3 (IN-22K pretraining, single-scale)","metrics":{"mask AP":"50.3"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":26,"model":"Mask2Former (Swin-L)","metrics":{"mask AP":"50.1"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/masked-attention-mask-transformer-for","paper_url":"https://arxiv.org/abs/2112.01527v3","paper_title":"Masked-attention Mask Transformer for Universal Image Segmentation","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":27,"model":"Swin-L (HTC++, single scale)","metrics":{"mask AP":"49.5"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":28,"model":"MOAT-2 (IN-22K pretraining, single-scale)","metrics":{"mask AP":"49.3"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":29,"model":"MOAT-1 (IN-1K pretraining, single-scale)","metrics":{"mask AP":"49.0"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":30,"model":"QueryInst (single scale)","metrics":{"AP50":"74.0","AP75":"53.9","APL":"68.3","APM":"52.6","APS":"30.8","mask AP":"48.9"},"uses_additional_data":false,"paper_date":"2021-05-05","paper":"/paper/queryinst-parallelly-supervised-mask-query","paper_url":"https://arxiv.org/abs/2105.01928v3","paper_title":"Instances as Queries","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":31,"model":"Cascade Eff-B7 NAS-FPN (1280, self-training Copy Paste, single-scale)","metrics":{"mask AP":"48.9"},"uses_additional_data":true,"paper_date":"2020-12-13","paper":"/paper/simple-copy-paste-is-a-strong-data","paper_url":"https://arxiv.org/abs/2012.07177v2","paper_title":"Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation","code":"https://github.com/PaddlePaddle/PaddleOCR","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":32,"model":"InternImage-XL","metrics":{"GFLOPs":"1782","Params (M)":"387","mask AP":"48.8"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":33,"model":"CenterNet2 (Swin-L w/ X-Paste + Copy-Paste)","metrics":{"mask AP":"48.8"},"uses_additional_data":false,"paper_date":"2022-12-07","paper":"/paper/x-paste-revisit-copy-paste-at-scale-with-clip","paper_url":"https://arxiv.org/abs/2212.03863v2","paper_title":"X-Paste: Revisiting Scalable Copy-Paste for Instance Segmentation using CLIP and StableDiffusion","code":"https://github.com/aim-uofa/DiverGen","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":34,"model":"Heira-L","metrics":{"mask AP":"48.6"},"uses_additional_data":false,"paper_date":"2023-06-01","paper":"/paper/hiera-a-hierarchical-vision-transformer","paper_url":"https://arxiv.org/abs/2306.00989v1","paper_title":"Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles","code":"https://github.com/huggingface/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":35,"model":"InternImage-L","metrics":{"GFLOPs":"1399","Params (M)":"277","box AP":"56.1","mask AP":"48.5"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":36,"model":"MViTv2-H (Cascade Mask R-CNN, single-scale, IN21k pre-train)","metrics":{"mask AP":"48.5"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":37,"model":"GLEE-Lite","metrics":{"mask AP":"48.4"},"uses_additional_data":true,"paper_date":"2023-12-14","paper":"/paper/general-object-foundation-model-for-images","paper_url":"https://arxiv.org/abs/2312.09158v1","paper_title":"General Object Foundation Model for Images and Videos at Scale","code":"https://github.com/FoundationVision/GLEE","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":38,"model":"MOAT-0 (IN-1K pretraining, single-scale)","metrics":{"mask AP":"47.4"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":39,"model":"MViTv2-L (Cascade Mask R-CNN, single-scale)","metrics":{"mask AP":"47.1"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":40,"model":"MPViT-B (Cascade Mask R-CNN, multi-scale, IN1k pre-train)","metrics":{"mask AP":"47.0"},"uses_additional_data":false,"paper_date":"2021-12-21","paper":"/paper/mpvit-multi-path-vision-transformer-for-dense","paper_url":"https://arxiv.org/abs/2112.11010v2","paper_title":"MPViT: Multi-Path Vision Transformer for Dense Prediction","code":"https://github.com/towhee-io/towhee","n_code_links":3,"syntology":null},{"rank_in_archive_order":41,"model":"tiny-MOAT-3 (IN-1K pretraining, single-scale)","metrics":{"mask AP":"47.0"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":42,"model":"Cascade Eff-B7 NAS-FPN (1280)","metrics":{"mask AP":"46.8"},"uses_additional_data":false,"paper_date":"2020-12-13","paper":"/paper/simple-copy-paste-is-a-strong-data","paper_url":"https://arxiv.org/abs/2012.07177v2","paper_title":"Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation","code":"https://github.com/PaddlePaddle/PaddleOCR","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":43,"model":"ResNeSt-200 (multi-scale)","metrics":{"mask AP":"46.25"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":44,"model":"MViT-L (Mask R-CNN, single-scale)","metrics":{"mask AP":"46.2"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":45,"model":"RetinaNet (SpineNet-190, 1536x1536)","metrics":{"mask AP":"46.1"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/spinenet-learning-scale-permuted-backbone-for","paper_url":"https://arxiv.org/abs/1912.05027v3","paper_title":"SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/modeling/backbones","n_code_links":13,"syntology":null},{"rank_in_archive_order":46,"model":"MPViT-B (Cascade R-CNN, sinlge-scale, IN-1K pre-train)","metrics":{"mask AP":"45.8"},"uses_additional_data":false,"paper_date":"2021-12-21","paper":"/paper/mpvit-multi-path-vision-transformer-for-dense","paper_url":"https://arxiv.org/abs/2112.11010v2","paper_title":"MPViT: Multi-Path Vision Transformer for Dense Prediction","code":"https://github.com/towhee-io/towhee","n_code_links":3,"syntology":null},{"rank_in_archive_order":47,"model":"Mask R-CNN (ViL Base, multi-scale, 3x lr)","metrics":{"AP75":"49.9","mask AP":"45.7"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/2103-15358","paper_url":"https://arxiv.org/abs/2103.15358v2","paper_title":"Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding","code":"https://github.com/microsoft/esvit","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":48,"model":"Mask R-CNN (ViL Base, 1x lr)","metrics":{"AP50":"67.2","AP75":"49.3","mask AP":"45.1"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/2103-15358","paper_url":"https://arxiv.org/abs/2103.15358v2","paper_title":"Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding","code":"https://github.com/microsoft/esvit","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":49,"model":"tiny-MOAT-2 (IN-1K pretraining, single-scale)","metrics":{"mask AP":"45.0"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":50,"model":"GCNet (ResNeXt-101 + DCN + cascade + GC r4)","metrics":{"AP50":"67.9","AP75":"48.4","mask AP":"44.7"},"uses_additional_data":false,"paper_date":"2020-12-24","paper":"/paper/global-context-networks","paper_url":"https://arxiv.org/abs/2012.13375v1","paper_title":"Global Context Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":null},{"rank_in_archive_order":51,"model":"tiny-MOAT-1 (IN-1K pretraining, single-scale)","metrics":{"mask AP":"44.6"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":52,"model":"InternImage-S","metrics":{"GFLOPs":"340","Params (M)":"69","box AP":"49.7","mask AP":"44.5"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":53,"model":"ResNeSt-200-DCN (single-scale)","metrics":{"mask AP":"44.5"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":54,"model":"ELSA-S (Cascade Mask RCNN)","metrics":{"AP50":"67.8","AP75":"47.8","mask AP":"44.4"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/elsa-enhanced-local-self-attention-for-vision","paper_url":"https://arxiv.org/abs/2112.12786v1","paper_title":"ELSA: Enhanced Local Self-Attention for Vision Transformer","code":"https://github.com/damo-cv/elsa","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":55,"model":"BoTNet 200 (Mask R-CNN, single scale, 72 epochs)","metrics":{"mask AP":"44.4"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":56,"model":"DaViT-T (Mask R-CNN, 36 epochs)","metrics":{"mask AP":"44.3"},"uses_additional_data":false,"paper_date":"2022-04-07","paper":"/paper/davit-dual-attention-vision-transformers","paper_url":"https://arxiv.org/abs/2204.03645v1","paper_title":"DaViT: Dual Attention Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":8,"n_unverified":7,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":57,"model":"ResNeSt-200 (single-scale)","metrics":{"mask AP":"44.21"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":58,"model":"InternImage-T","metrics":{"GFLOPs":"270","Params (M)":"49","box AP":"49.1","mask AP":"43.7"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":59,"model":"BoTNet 152 (Mask R-CNN, single scale, 72 epochs)","metrics":{"mask AP":"43.7"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":60,"model":"XCiT-M24/8","metrics":{"mask AP":"43.7"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/xcit-cross-covariance-image-transformers","paper_url":"https://arxiv.org/abs/2106.09681v2","paper_title":"XCiT: Cross-Covariance Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":11,"n_samples":14,"n_pointer_only_licence":3}},{"rank_in_archive_order":61,"model":"tiny-MOAT-0 (IN-1K pretraining, single-scale)","metrics":{"mask AP":"43.3"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":62,"model":"ELSA-S (Mask RCNN)","metrics":{"AP50":"67.3","AP75":"46.4","mask AP":"43.0"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/elsa-enhanced-local-self-attention-for-vision","paper_url":"https://arxiv.org/abs/2112.12786v1","paper_title":"ELSA: Enhanced Local Self-Attention for Vision Transformer","code":"https://github.com/damo-cv/elsa","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":63,"model":"XCiT-S24/8","metrics":{"mask AP":"43.0"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/xcit-cross-covariance-image-transformers","paper_url":"https://arxiv.org/abs/2106.09681v2","paper_title":"XCiT: Cross-Covariance Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":11,"n_samples":14,"n_pointer_only_licence":3}},{"rank_in_archive_order":64,"model":"CenterMask-VoVNetV2-99 (multi-scale)","metrics":{"mask AP":"42.5"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":65,"model":"ResNeSt-101 (single-scale)","metrics":{"mask AP":"41.56"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":66,"model":"SIW","metrics":{"mask AP":"41.4"},"uses_additional_data":false,"paper_date":"2022-02-04","paper":"/paper/the-devil-is-in-the-labels-semantic","paper_url":"https://arxiv.org/abs/2202.02002v2","paper_title":"Scaling up Multi-domain Semantic Segmentation with Sentence Embeddings","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":67,"model":"Res2Net-101+HTC","metrics":{"mask AP":"41.3"},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/res2net-a-new-multi-scale-backbone","paper_url":"https://arxiv.org/abs/1904.01169v3","paper_title":"Res2Net: A New Multi-scale Backbone Architecture","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":34,"syntology":{"n_ran":3,"n_unverified":6,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":68,"model":"HTC (HRNetV2p-W48)","metrics":{"mask AP":"41.0"},"uses_additional_data":false,"paper_date":"2019-02-25","paper":"/paper/deep-high-resolution-representation-learning","paper_url":"http://arxiv.org/abs/1902.09212v1","paper_title":"Deep High-Resolution Representation Learning for Human Pose Estimation","code":"https://github.com/open-mmlab/mmdetection","n_code_links":39,"syntology":{"n_ran":8,"n_unverified":17,"n_samples":25,"n_pointer_only_licence":0}},{"rank_in_archive_order":69,"model":"HTC (HRNetV2p-W48)","metrics":{"mask AP":"41.0"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":70,"model":"GCNet (ResNeXt-101 + DCN + cascade + GC r16)","metrics":{"mask AP":"40.9"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/gcnet-non-local-networks-meet-squeeze","paper_url":"http://arxiv.org/abs/1904.11492v1","paper_title":"GCNet: Non-local Networks Meet Squeeze-Excitation Networks and Beyond","code":"https://github.com/open-mmlab/mmdetection","n_code_links":9,"syntology":null},{"rank_in_archive_order":71,"model":"BoTNet 50 (72 epochs)","metrics":{"mask AP":"40.7"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":72,"model":"R3-CNN (ResNet-50-FPN, DCN)","metrics":{"AP50":"61.3","AP75":"44","APL":"56.1","APM":"43.6","APS":"22.3","mask AP":"40.4"},"uses_additional_data":false,"paper_date":"2021-04-03","paper":"/paper/recursively-refined-r-cnn-instance","paper_url":"https://arxiv.org/abs/2104.01329v2","paper_title":"Recursively Refined R-CNN: Instance Segmentation with Self-RoI Rebalancing","code":"https://github.com/IMPLabUniPr/mmdetection","n_code_links":1,"syntology":null},{"rank_in_archive_order":73,"model":"Mask R-CNN (ResNext-152, +1 NL)","metrics":{"mask AP":"40.3"},"uses_additional_data":false,"paper_date":"2017-11-21","paper":"/paper/non-local-neural-networks","paper_url":"http://arxiv.org/abs/1711.07971v3","paper_title":"Non-local Neural Networks","code":"https://github.com/facebookresearch/detectron","n_code_links":32,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":74,"model":"Mask R-CNN-FPN (AOGNet-40M)","metrics":{"AP50":"63.2","AP75":"43.3","mask AP":"40.2"},"uses_additional_data":false,"paper_date":"2019-08-04","paper":"/paper/attentive-normalization","paper_url":"https://arxiv.org/abs/1908.01259v3","paper_title":"Attentive Normalization","code":"https://github.com/iVMCL/AOGNet-v2","n_code_links":2,"syntology":null},{"rank_in_archive_order":75,"model":"R3-CNN (ResNet-50-FPN, GC-Net)","metrics":{"AP50":"61.1","AP75":"43.5","APM":"42.8","APS":"22.6","mask AP":"40.2"},"uses_additional_data":false,"paper_date":"2021-04-03","paper":"/paper/recursively-refined-r-cnn-instance","paper_url":"https://arxiv.org/abs/2104.01329v2","paper_title":"Recursively Refined R-CNN: Instance Segmentation with Self-RoI Rebalancing","code":"https://github.com/IMPLabUniPr/mmdetection","n_code_links":1,"syntology":null},{"rank_in_archive_order":76,"model":"CenterMask-VoVNetV2-99-3x","metrics":{"mask AP":"40.2"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":77,"model":"R3-CNN (ResNet-50-FPN, GRoIE)","metrics":{"AP50":"58.8","AP75":"42.3","APL":"54.3","APM":"42.1","APS":"20.7","mask AP":"39.1"},"uses_additional_data":false,"paper_date":"2021-04-03","paper":"/paper/recursively-refined-r-cnn-instance","paper_url":"https://arxiv.org/abs/2104.01329v2","paper_title":"Recursively Refined R-CNN: Instance Segmentation with Self-RoI Rebalancing","code":"https://github.com/IMPLabUniPr/mmdetection","n_code_links":1,"syntology":null},{"rank_in_archive_order":78,"model":"Mask Scoring R-CNN (ResNet-101-FPN-DCN)","metrics":{"mask AP":"39.1"},"uses_additional_data":false,"paper_date":"2019-03-01","paper":"/paper/mask-scoring-r-cnn","paper_url":"http://arxiv.org/abs/1903.00241v1","paper_title":"Mask Scoring R-CNN","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":79,"model":"Mask R-CNN-FPN (ResNeXt-101, GN+WS)","metrics":{"AP50":"61.07","AP75":"40.82","APL":"56.08","APM":"41.73","APS":"18.32","mask AP":"38.34"},"uses_additional_data":false,"paper_date":"2019-03-25","paper":"/paper/weight-standardization","paper_url":"https://arxiv.org/abs/1903.10520v2","paper_title":"Micro-Batch Training with Batch-Channel Normalization and Weight Standardization","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":7,"syntology":null},{"rank_in_archive_order":80,"model":"R3-CNN (ResNet-50-FPN)","metrics":{"AP50":"58","AP75":"41.4","APL":"52.8","APM":"41","APS":"20.4","mask AP":"38.2"},"uses_additional_data":false,"paper_date":"2021-04-03","paper":"/paper/recursively-refined-r-cnn-instance","paper_url":"https://arxiv.org/abs/2104.01329v2","paper_title":"Recursively Refined R-CNN: Instance Segmentation with Self-RoI Rebalancing","code":"https://github.com/IMPLabUniPr/mmdetection","n_code_links":1,"syntology":null},{"rank_in_archive_order":81,"model":"HTC (ResNet-50)","metrics":{"mask AP":"38.2"},"uses_additional_data":false,"paper_date":"2019-01-22","paper":"/paper/hybrid-task-cascade-for-instance-segmentation","paper_url":"http://arxiv.org/abs/1901.07518v2","paper_title":"Hybrid Task Cascade for Instance Segmentation","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":11,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":82,"model":"Mask Scoring R-CNN (ResNet-101 FPN)","metrics":{"mask AP":"38.2"},"uses_additional_data":false,"paper_date":"2019-03-01","paper":"/paper/mask-scoring-r-cnn","paper_url":"http://arxiv.org/abs/1903.00241v1","paper_title":"Mask Scoring R-CNN","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":83,"model":"PANet (ResNet-50)","metrics":{"mask AP":"37.8"},"uses_additional_data":false,"paper_date":"2018-03-05","paper":"/paper/path-aggregation-network-for-instance","paper_url":"http://arxiv.org/abs/1803.01534v4","paper_title":"Path Aggregation Network for Instance Segmentation","code":"https://github.com/ultralytics/yolov5","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":1}},{"rank_in_archive_order":84,"model":"GCnet (ResNet-50-FPN, GRoIE)","metrics":{"AP50":"59.3","AP75":"39.8","APL":"51.2","APM":"41","APS":"20.2","mask AP":"37.2"},"uses_additional_data":false,"paper_date":"2020-04-28","paper":"/paper/a-novel-region-of-interest-extraction-layer","paper_url":"https://arxiv.org/abs/2004.13665v2","paper_title":"A novel Region of Interest Extraction Layer for Instance Segmentation","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":null},{"rank_in_archive_order":85,"model":"Mask R-CNN (FPN, X-volution, SA)","metrics":{"APL":"53.1","APM":"40","APS":"19.2","mask AP":"37.2"},"uses_additional_data":false,"paper_date":"2021-06-04","paper":"/paper/x-volution-on-the-unification-of-convolution","paper_url":"https://arxiv.org/abs/2106.02253v2","paper_title":"X-volution: On the unification of convolution and self-attention","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":86,"model":"Mask R-CNN (ResNet-101, +1 NL)","metrics":{"mask AP":"37.1"},"uses_additional_data":false,"paper_date":"2017-11-21","paper":"/paper/non-local-neural-networks","paper_url":"http://arxiv.org/abs/1711.07971v3","paper_title":"Non-local Neural Networks","code":"https://github.com/facebookresearch/detectron","n_code_links":32,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":87,"model":"Mask Scoring R-CNN (ResNet-50 FPN)","metrics":{"mask AP":"36.0"},"uses_additional_data":false,"paper_date":"2019-03-01","paper":"/paper/mask-scoring-r-cnn","paper_url":"http://arxiv.org/abs/1903.00241v1","paper_title":"Mask Scoring R-CNN","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":88,"model":"Mask R-CNN (ResNet-50-FPN, GRoIE)","metrics":{"AP50":"57.1","AP75":"38.0","APL":"48.7","APM":"39","APS":"19.1","mask AP":"35.8"},"uses_additional_data":false,"paper_date":"2020-04-28","paper":"/paper/a-novel-region-of-interest-extraction-layer","paper_url":"https://arxiv.org/abs/2004.13665v2","paper_title":"A novel Region of Interest Extraction Layer for Instance Segmentation","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":null},{"rank_in_archive_order":89,"model":"Faster R-CNN (Res2Net-50)","metrics":{"AP50":"57.6","APL":"53.7","APM":"37.9","APS":"15.7","mask AP":"35.6"},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/res2net-a-new-multi-scale-backbone","paper_url":"https://arxiv.org/abs/1904.01169v3","paper_title":"Res2Net: A New Multi-scale Backbone Architecture","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":34,"syntology":{"n_ran":3,"n_unverified":6,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":90,"model":"Mask R-CNN (ResNet-50, +1 NL)","metrics":{"mask AP":"35.5"},"uses_additional_data":false,"paper_date":"2017-11-21","paper":"/paper/non-local-neural-networks","paper_url":"http://arxiv.org/abs/1711.07971v3","paper_title":"Non-local Neural Networks","code":"https://github.com/facebookresearch/detectron","n_code_links":32,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":91,"model":"Mask R-CNN (ResNet-50, ACNet)","metrics":{"mask AP":"35.2"},"uses_additional_data":false,"paper_date":"2019-04-07","paper":"/paper/adaptively-connected-neural-networks","paper_url":"http://arxiv.org/abs/1904.03579v1","paper_title":"Adaptively Connected Neural Networks","code":"https://github.com/wanggrun/Adaptively-Connected-Neural-Networks","n_code_links":1,"syntology":null},{"rank_in_archive_order":92,"model":"YOLACT-550 (ResNet-50)","metrics":{"mask AP":"29.9"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/yolact-real-time-instance-segmentation","paper_url":"https://arxiv.org/abs/1904.02689v2","paper_title":"YOLACT: Real-time Instance Segmentation","code":"https://github.com/open-mmlab/mmdetection","n_code_links":48,"syntology":{"n_ran":10,"n_unverified":11,"n_samples":21,"n_pointer_only_licence":6}},{"rank_in_archive_order":93,"model":"InternImage-B","metrics":{"GFLOPs":"501","Params (M)":"115"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":56,"rows_with_any_sample_ran":53,"distinct_papers_with_graph_line":30,"distinct_papers_with_any_sample_ran":27,"samples_over_distinct_papers":{"n_ran":227,"n_unverified":330,"n_samples":557,"n_pointer_only_licence":133,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":475,"n_unverified":649,"n_samples":1124,"n_pointer_only_licence":296,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}