{"url":"/sota/object-detection-on-coco-minival","task":{"name":"Object Detection","url":"/task/object-detection","note":null},"dataset":{"name":"COCO minival","url":"/dataset/coco"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":null,"description_from":null,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["box AP","AP50","AP75","APS","APM","APL","Params (M)"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"box AP":"higher","AP50":null,"AP75":null,"APS":null,"APM":null,"APL":null,"Params (M)":"lower"}},"counts":{"rows":220,"rows_with_code":217,"rows_with_paper_page":220,"rows_dated":220,"rows_using_additional_data":25},"rows":[{"rank_in_archive_order":1,"model":"PE_spatial (DETA)","metrics":{"Params (M)":"1900","box AP":"66.0"},"uses_additional_data":true,"paper_date":"2025-04-17","paper":"/paper/perception-encoder-the-best-visual-embeddings","paper_url":"https://arxiv.org/abs/2504.13181v1","paper_title":"Perception Encoder: The best visual embeddings are not at the output of the network","code":"https://github.com/facebookresearch/perception_models","n_code_links":1,"syntology":{"n_ran":12,"n_unverified":6,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"Co-DETR","metrics":{"Params (M)":"314","box AP":"65.9"},"uses_additional_data":true,"paper_date":"2022-11-22","paper":"/paper/detrs-with-collaborative-hybrid-assignments","paper_url":"https://arxiv.org/abs/2211.12860v5","paper_title":"DETRs with Collaborative Hybrid Assignments Training","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"M3I Pre-training (InternImage-H)","metrics":{"box AP":"65.0"},"uses_additional_data":true,"paper_date":"2022-11-17","paper":"/paper/towards-all-in-one-pre-training-via","paper_url":"https://arxiv.org/abs/2211.09807v2","paper_title":"Towards All-in-one Pre-training via Maximizing Multi-modal Mutual Information","code":"https://github.com/OpenGVLab/M3I-Pretraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":4,"model":"InternImage-H","metrics":{"box AP":"65.0"},"uses_additional_data":true,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"Co-DETR (Swin-L)","metrics":{"Params (M)":"218","box AP":"64.7"},"uses_additional_data":true,"paper_date":"2022-11-22","paper":"/paper/detrs-with-collaborative-hybrid-assignments","paper_url":"https://arxiv.org/abs/2211.12860v5","paper_title":"DETRs with Collaborative Hybrid Assignments Training","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":6,"model":"Focal-Stable-DINO (Focal-Huge, no TTA)","metrics":{"AP50":"81.5","AP75":"71.4","APL":"78.5","APM":"68.5","APS":"50.4","Params (M)":"689","box AP":"64.6"},"uses_additional_data":true,"paper_date":"2023-04-25","paper":"/paper/a-strong-and-reproducible-object-detector","paper_url":"https://arxiv.org/abs/2304.13027v1","paper_title":"A Strong and Reproducible Object Detector with Only Public Datasets","code":"https://github.com/microsoft/FocalNet","n_code_links":3,"syntology":null},{"rank_in_archive_order":7,"model":"EVA","metrics":{"AP50":"82.1","AP75":"70.8","APL":"78.5","APM":"68.4","APS":"49.4","box AP":"64.5"},"uses_additional_data":true,"paper_date":"2022-11-14","paper":"/paper/eva-exploring-the-limits-of-masked-visual","paper_url":"https://arxiv.org/abs/2211.07636v2","paper_title":"EVA: Exploring the Limits of Masked Visual Representation Learning at Scale","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"ViT-CoMer","metrics":{"Params (M)":"363","box AP":"64.3"},"uses_additional_data":false,"paper_date":"2024-03-13","paper":"/paper/vit-comer-vision-transformer-with","paper_url":"https://openreview.net/forum?id=srPMwpkWbR&invitationId=thecvf.com/CVPR/2024/Conference/Submission1221/-/Camera_Ready_Revision&referrer=%5BAuthor%20Console%5D(%2Fgroup%3Fid%3Dthecvf.com%2FCVPR%2F2024%2FConference%2FAuthors%23author-tasks)","paper_title":"ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions","code":"https://github.com/Traffic-X/ViT-CoMer","n_code_links":2,"syntology":null},{"rank_in_archive_order":9,"model":"FocalNet-H (DINO)","metrics":{"box AP":"64.2"},"uses_additional_data":true,"paper_date":"2022-03-22","paper":"/paper/focal-modulation-networks","paper_url":"https://arxiv.org/abs/2203.11926v3","paper_title":"Focal Modulation Networks","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"InternImage-XL","metrics":{"box AP":"64.2"},"uses_additional_data":true,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"CP-DETR-L Swin-L(Fine tuning separately in COCO)","metrics":{"box AP":"64.1"},"uses_additional_data":true,"paper_date":"2024-12-13","paper":"/paper/cp-detr-concept-prompt-guide-detr-toward","paper_url":"https://arxiv.org/abs/2412.09799v1","paper_title":"CP-DETR: Concept Prompt Guide DETR Toward Stronger Universal Object Detection","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":12,"model":"RevCol-H(DINO)","metrics":{"box AP":"63.8"},"uses_additional_data":true,"paper_date":"2022-12-22","paper":"/paper/reversible-column-networks","paper_url":"https://arxiv.org/abs/2212.11696v3","paper_title":"Reversible Column Networks","code":"https://github.com/megvii-research/revcol","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":3,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":13,"model":"DINO (Swin-L)","metrics":{"box AP":"63.2"},"uses_additional_data":false,"paper_date":"2022-03-07","paper":"/paper/dino-detr-with-improved-denoising-anchor-1","paper_url":"https://arxiv.org/abs/2203.03605v4","paper_title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","code":"https://github.com/IDEA-Research/Grounded-Segment-Anything","n_code_links":16,"syntology":{"n_ran":7,"n_unverified":8,"n_samples":15,"n_pointer_only_licence":5}},{"rank_in_archive_order":14,"model":"Grounding DINO","metrics":{"box AP":"63.0"},"uses_additional_data":true,"paper_date":"2023-03-09","paper":"/paper/grounding-dino-marrying-dino-with-grounded","paper_url":"https://arxiv.org/abs/2303.05499v5","paper_title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","code":"https://github.com/huggingface/transformers","n_code_links":10,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":15,"model":"SwinV2-G (HTC++)","metrics":{"box AP":"62.5"},"uses_additional_data":true,"paper_date":"2021-11-18","paper":"/paper/swin-transformer-v2-scaling-up-capacity-and","paper_url":"https://arxiv.org/abs/2111.09883v2","paper_title":"Swin Transformer V2: Scaling Up Capacity and Resolution","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":23,"syntology":{"n_ran":3,"n_unverified":27,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":16,"model":"Florence-CoSwin-H","metrics":{"box AP":"62"},"uses_additional_data":true,"paper_date":"2021-11-22","paper":"/paper/florence-a-new-foundation-model-for-computer","paper_url":"https://arxiv.org/abs/2111.11432v1","paper_title":"Florence: A New Foundation Model for Computer Vision","code":"https://github.com/microsoft/unicl","n_code_links":2,"syntology":null},{"rank_in_archive_order":17,"model":"GLEE-Pro","metrics":{"box AP":"62.0"},"uses_additional_data":true,"paper_date":"2023-12-14","paper":"/paper/general-object-foundation-model-for-images","paper_url":"https://arxiv.org/abs/2312.09158v1","paper_title":"General Object Foundation Model for Images and Videos at Scale","code":"https://github.com/FoundationVision/GLEE","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":18,"model":"ViTDet, ViT-H Cascade (multiscale)","metrics":{"box AP":"61.3"},"uses_additional_data":false,"paper_date":"2022-03-30","paper":"/paper/exploring-plain-vision-transformer-backbones","paper_url":"https://arxiv.org/abs/2203.16527v2","paper_title":"Exploring Plain Vision Transformer Backbones for Object Detection","code":"https://github.com/facebookresearch/detectron2/tree/main/projects/ViTDet","n_code_links":11,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"GLIP (Swin-L, multi-scale)","metrics":{"box AP":"60.8"},"uses_additional_data":true,"paper_date":"2021-12-07","paper":"/paper/grounded-language-image-pre-training","paper_url":"https://arxiv.org/abs/2112.03857v2","paper_title":"Grounded Language-Image Pre-training","code":"https://github.com/microsoft/GLIP","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":20,"model":"Soft Teacher + Swin-L (HTC++, multi-scale)","metrics":{"box AP":"60.7"},"uses_additional_data":true,"paper_date":"2021-06-16","paper":"/paper/end-to-end-semi-supervised-object-detection","paper_url":"https://arxiv.org/abs/2106.09018v3","paper_title":"End-to-End Semi-Supervised Object Detection with Soft Teacher","code":"https://github.com/microsoft/SoftTeacher","n_code_links":8,"syntology":null},{"rank_in_archive_order":21,"model":"UNINEXT-H","metrics":{"AP50":"77.5","AP75":"66.7","APL":"75.3","APM":"64.8","APS":"45.1","box AP":"60.6"},"uses_additional_data":true,"paper_date":"2023-03-12","paper":"/paper/universal-instance-perception-as-object","paper_url":"https://arxiv.org/abs/2303.06674v2","paper_title":"Universal Instance Perception as Object Discovery and Retrieval","code":"https://github.com/MasterBin-IIAU/UNINEXT","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":22,"model":"ViT-Adapter-L (HTC++, BEiTv2 pretrain, multi-scale)","metrics":{"box AP":"60.5"},"uses_additional_data":false,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":23,"model":"ViTDet, ViT-H Cascade","metrics":{"box AP":"60.4"},"uses_additional_data":false,"paper_date":"2022-03-30","paper":"/paper/exploring-plain-vision-transformer-backbones","paper_url":"https://arxiv.org/abs/2203.16527v2","paper_title":"Exploring Plain Vision Transformer Backbones for Object Detection","code":"https://github.com/facebookresearch/detectron2/tree/main/projects/ViTDet","n_code_links":11,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":24,"model":"GLEE-Plus","metrics":{"box AP":"60.4"},"uses_additional_data":true,"paper_date":"2023-12-14","paper":"/paper/general-object-foundation-model-for-images","paper_url":"https://arxiv.org/abs/2312.09158v1","paper_title":"General Object Foundation Model for Images and Videos at Scale","code":"https://github.com/FoundationVision/GLEE","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":25,"model":"DyHead (Swin-L, multi scale, self-training)","metrics":{"AP50":"78.2","APL":"74.2","box AP":"60.3"},"uses_additional_data":true,"paper_date":"2021-06-15","paper":"/paper/dynamic-head-unifying-object-detection-heads","paper_url":"https://arxiv.org/abs/2106.08322v1","paper_title":"Dynamic Head: Unifying Object Detection Heads with Attentions","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":26,"model":"ViT-Adapter-L (HTC++, BEiT pretrain, multi-scale)","metrics":{"box AP":"60.2"},"uses_additional_data":false,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":27,"model":"Soft Teacher+Swin-L(HTC++, single scale)","metrics":{"box AP":"60.1"},"uses_additional_data":true,"paper_date":"2021-06-16","paper":"/paper/end-to-end-semi-supervised-object-detection","paper_url":"https://arxiv.org/abs/2106.09018v3","paper_title":"End-to-End Semi-Supervised Object Detection with Soft Teacher","code":"https://github.com/microsoft/SoftTeacher","n_code_links":8,"syntology":null},{"rank_in_archive_order":28,"model":"CBNetV2 (Dual-Swin-L HTC, multi-scale)","metrics":{"box AP":"59.6"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/cbnetv2-a-composite-backbone-network","paper_url":"https://arxiv.org/abs/2107.00420v7","paper_title":"CBNet: A Composite Backbone Network Architecture for Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":29,"model":"Frozen Backbone, SwinV2-G-ext22K (HTC)","metrics":{"box AP":"59.3"},"uses_additional_data":false,"paper_date":"2022-11-03","paper":"/paper/could-giant-pretrained-image-models-extract","paper_url":"https://arxiv.org/abs/2211.02043v1","paper_title":"Could Giant Pretrained Image Models Extract Universal Representations?","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":30,"model":"HorNet-L","metrics":{"box AP":"59.2"},"uses_additional_data":false,"paper_date":"2022-07-28","paper":"/paper/hornet-efficient-high-order-spatial","paper_url":"https://arxiv.org/abs/2207.14284v3","paper_title":"HorNet: Efficient High-Order Spatial Interactions with Recursive Gated Convolutions","code":"https://github.com/open-mmlab/mmclassification","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":31,"model":"MOAT-3 (IN-22K pretraining, single-scale)","metrics":{"box AP":"59.2"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":32,"model":"CBNetV2 (Dual-Swin-L HTC, multi-scale)","metrics":{"box AP":"59.1"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/cbnetv2-a-composite-backbone-network","paper_url":"https://arxiv.org/abs/2107.00420v7","paper_title":"CBNet: A Composite Backbone Network Architecture for Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":33,"model":"Focal-L (DyHead, multi-scale)","metrics":{"AP50":"77.2","APL":"73.4","box AP":"58.7"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/focal-self-attention-for-local-global","paper_url":"https://arxiv.org/abs/2107.00641v1","paper_title":"Focal Self-attention for Local-Global Interactions in Vision Transformers","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification/Focal_Transformer","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":34,"model":"MViTv2-L (Cascade Mask R-CNN, multi-scale, IN21k pre-train)","metrics":{"box AP":"58.7"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":35,"model":"MOAT-2 (IN-22K pretraining, single-scale)","metrics":{"box AP":"58.5"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":36,"model":"DyHead (Swin-L, multi scale)","metrics":{"AP50":"76.8","APL":"73.2","APM":"62.2","APS":"44.5","box AP":"58.4"},"uses_additional_data":false,"paper_date":"2021-06-15","paper":"/paper/dynamic-head-unifying-object-detection-heads","paper_url":"https://arxiv.org/abs/2106.08322v1","paper_title":"Dynamic Head: Unifying Object Detection Heads with Attentions","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":37,"model":"Swin-L (HTC++, multi scale)","metrics":{"box AP":"58"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":38,"model":"MOAT-1 (IN-1K pretraining, single-scale)","metrics":{"box AP":"57.7"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":39,"model":"UM-MAE(HTC++, Swin-L, IN1K)","metrics":{"box AP":"57.4"},"uses_additional_data":false,"paper_date":"2022-05-20","paper":"/paper/uniform-masking-enabling-mae-pre-training-for","paper_url":"https://arxiv.org/abs/2205.10063v1","paper_title":"Uniform Masking: Enabling MAE Pre-training for Pyramid-based Vision Transformers with Locality","code":"https://github.com/implus/um-mae","n_code_links":1,"syntology":null},{"rank_in_archive_order":40,"model":"YOLOv6-L6(46 fps, 1280, V100)","metrics":{"AP50":"74.5","box AP":"57.2"},"uses_additional_data":false,"paper_date":"2023-01-13","paper":"/paper/yolov6-v3-0-a-full-scale-reloading","paper_url":"https://arxiv.org/abs/2301.05586v1","paper_title":"YOLOv6 v3.0: A Full-Scale Reloading","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":41,"model":"Swin-L (HTC++, single scale)","metrics":{"box AP":"57.1"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":42,"model":"TransNeXt-Base (IN-1K pretrain, DINO 1x)","metrics":{"box AP":"57.1"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/transnext-robust-foveal-visual-perception-for","paper_url":"https://arxiv.org/abs/2311.17132v3","paper_title":"TransNeXt: Robust Foveal Visual Perception for Vision Transformers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":43,"model":"Cascade Eff-B7 NAS-FPN (1280, self-training Copy Paste, single-scale)","metrics":{"box AP":"57.0"},"uses_additional_data":true,"paper_date":"2020-12-13","paper":"/paper/simple-copy-paste-is-a-strong-data","paper_url":"https://arxiv.org/abs/2012.07177v2","paper_title":"Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation","code":"https://github.com/PaddlePaddle/PaddleOCR","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":44,"model":"TransNeXt-Small (IN-1K pretrain, DINO 1x)","metrics":{"box AP":"56.6"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/transnext-robust-foveal-visual-perception-for","paper_url":"https://arxiv.org/abs/2311.17132v3","paper_title":"TransNeXt: Robust Foveal Visual Perception for Vision Transformers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":45,"model":"QueryInst (single scale)","metrics":{"AP50":"75.8","AP75":"61.7","APL":"71.5","APM":"59.8","APS":"40.2","box AP":"56.1"},"uses_additional_data":false,"paper_date":"2021-05-05","paper":"/paper/queryinst-parallelly-supervised-mask-query","paper_url":"https://arxiv.org/abs/2105.01928v3","paper_title":"Instances as Queries","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":46,"model":"MViTv2-H (Cascade Mask R-CNN, single-scale, IN21k pre-train)","metrics":{"box AP":"56.1"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":47,"model":"MOAT-0 (IN-1K pretraining, single-scale)","metrics":{"box AP":"55.9"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":48,"model":"TransNeXt-Tiny (IN-1K pretrain, DINO 1x)","metrics":{"box AP":"55.7"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/transnext-robust-foveal-visual-perception-for","paper_url":"https://arxiv.org/abs/2311.17132v3","paper_title":"TransNeXt: Robust Foveal Visual Perception for Vision Transformers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":49,"model":"YOLOv4-P7 CSP-P7 (single-scale, 16 fps)","metrics":{"AP50":"73.3","AP75":"60.7","APL":"67.4","APM":"59.5","APS":"38.1","box AP":"55.4"},"uses_additional_data":false,"paper_date":"2020-11-16","paper":"/paper/scaled-yolov4-scaling-cross-stage-partial","paper_url":"https://arxiv.org/abs/2011.08036v2","paper_title":"Scaled-YOLOv4: Scaling Cross Stage Partial Network","code":"https://github.com/AlexeyAB/darknet","n_code_links":41,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":50,"model":"tiny-MOAT-3 (IN-1K pretraining, single-scale)","metrics":{"box AP":"55.2"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":51,"model":"FAN-L-Hybrid","metrics":{"box AP":"55.1"},"uses_additional_data":false,"paper_date":"2022-04-26","paper":"/paper/understanding-the-robustness-in-vision","paper_url":"https://arxiv.org/abs/2204.12451v4","paper_title":"Understanding The Robustness in Vision Transformers","code":"https://github.com/nvlabs/fan","n_code_links":2,"syntology":null},{"rank_in_archive_order":52,"model":"Hiera-L","metrics":{"box AP":"55"},"uses_additional_data":false,"paper_date":"2023-06-01","paper":"/paper/hiera-a-hierarchical-vision-transformer","paper_url":"https://arxiv.org/abs/2306.00989v1","paper_title":"Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles","code":"https://github.com/huggingface/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":53,"model":"GLEE-Lite","metrics":{"box AP":"55.0"},"uses_additional_data":true,"paper_date":"2023-12-14","paper":"/paper/general-object-foundation-model-for-images","paper_url":"https://arxiv.org/abs/2312.09158v1","paper_title":"General Object Foundation Model for Images and Videos at Scale","code":"https://github.com/FoundationVision/GLEE","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":54,"model":"TEC(VIT-B, Mask-RCNN)","metrics":{"box AP":"54.6"},"uses_additional_data":false,"paper_date":"2022-10-20","paper":"/paper/towards-sustainable-self-supervised-learning","paper_url":"https://arxiv.org/abs/2210.11016v1","paper_title":"Towards Sustainable Self-supervised Learning","code":"https://github.com/sail-sg/tec","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":2,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":55,"model":"Cascade Eff-B7 NAS-FPN (1280)","metrics":{"box AP":"54.5"},"uses_additional_data":false,"paper_date":"2020-12-13","paper":"/paper/simple-copy-paste-is-a-strong-data","paper_url":"https://arxiv.org/abs/2012.07177v2","paper_title":"Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation","code":"https://github.com/PaddlePaddle/PaddleOCR","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":56,"model":"CAE (ViT-L, Mask R-CNN, 1x schedule)","metrics":{"box AP":"54.5"},"uses_additional_data":false,"paper_date":"2022-02-07","paper":"/paper/context-autoencoder-for-self-supervised","paper_url":"https://arxiv.org/abs/2202.03026v3","paper_title":"Context Autoencoder for Self-Supervised Representation Learning","code":"https://github.com/open-mmlab/mmselfsup","n_code_links":6,"syntology":null},{"rank_in_archive_order":57,"model":"MViTv2-L (Cascade Mask R-CNN, single-scale)","metrics":{"box AP":"54.3"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":58,"model":"SpineNet-190 (1280, with Self-training on OpenImages, single-scale)","metrics":{"box AP":"54.2"},"uses_additional_data":true,"paper_date":"2020-06-11","paper":"/paper/rethinking-pre-training-and-self-training","paper_url":"https://arxiv.org/abs/2006.06882v2","paper_title":"Rethinking Pre-training and Self-training","code":"https://github.com/tensorflow/tpu/tree/master/models/official/detection/projects/self_training","n_code_links":2,"syntology":null},{"rank_in_archive_order":59,"model":"Cascade RCNN-RS (SpineNet-143L, single scale)","metrics":{"APL":"70.6","APM":"56.7","APS":"34.5","box AP":"53.6"},"uses_additional_data":false,"paper_date":"2021-06-30","paper":"/paper/simple-training-strategies-and-model-scaling","paper_url":"https://arxiv.org/abs/2107.00057v1","paper_title":"Simple Training Strategies and Model Scaling for Object Detection","code":"https://github.com/tensorflow/tpu","n_code_links":1,"syntology":null},{"rank_in_archive_order":60,"model":"UniverseNet-20.08d (Res2Net-101, DCN, multi-scale)","metrics":{"AP50":"70.8","AP75":"58.9","APL":"68.1","APM":"57.5","APS":"36.9","box AP":"53.5"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/usb-universal-scale-object-detection","paper_url":"https://arxiv.org/abs/2103.14027v3","paper_title":"USB: Universal-Scale Object Detection Benchmark","code":"https://github.com/shinya7y/UniverseNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":61,"model":"MAE (ViT-L, Mask R-CNN)","metrics":{"box AP":"53.3"},"uses_additional_data":false,"paper_date":"2021-11-11","paper":"/paper/masked-autoencoders-are-scalable-vision","paper_url":"https://arxiv.org/abs/2111.06377v2","paper_title":"Masked Autoencoders Are Scalable Vision Learners","code":"https://github.com/facebookresearch/mae","n_code_links":58,"syntology":{"n_ran":71,"n_unverified":66,"n_samples":137,"n_pointer_only_licence":73}},{"rank_in_archive_order":62,"model":"Cascade RCNN-RS (ResNet-200, single scale)","metrics":{"APL":"70.3","APM":"56.2","APS":"33.9","box AP":"53.1"},"uses_additional_data":false,"paper_date":"2021-06-30","paper":"/paper/simple-training-strategies-and-model-scaling","paper_url":"https://arxiv.org/abs/2107.00057v1","paper_title":"Simple Training Strategies and Model Scaling for Object Detection","code":"https://github.com/tensorflow/tpu","n_code_links":1,"syntology":null},{"rank_in_archive_order":63,"model":"tiny-MOAT-2 (IN-1K pretraining, single-scale)","metrics":{"box AP":"53.0"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":64,"model":"MViT-L (Mask R-CNN, single-scale, IN21k pre-train)","metrics":{"box AP":"52.7"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":65,"model":"ResNeSt-200 (multi-scale)","metrics":{"AP50":"71.00","AP75":"57.07","APL":"66.29","APM":"56.36","APS":"36.80","box AP":"52.47"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":66,"model":"ActiveMLP-B (Cascade Mask R-CNN)","metrics":{"box AP":"52.3"},"uses_additional_data":false,"paper_date":"2022-03-11","paper":"/paper/activemlp-an-mlp-like-architecture-with","paper_url":"https://arxiv.org/abs/2203.06108v2","paper_title":"Active Token Mixer","code":"https://github.com/microsoft/TokenMixers","n_code_links":2,"syntology":null},{"rank_in_archive_order":67,"model":"RetinaNet (SpineNet-190, 1536x1536)","metrics":{"box AP":"52.2"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/spinenet-learning-scale-permuted-backbone-for","paper_url":"https://arxiv.org/abs/1912.05027v3","paper_title":"SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/modeling/backbones","n_code_links":13,"syntology":null},{"rank_in_archive_order":68,"model":"EfficientDet-D7 (1536)","metrics":{"box AP":"52.1"},"uses_additional_data":false,"paper_date":"2019-11-20","paper":"/paper/efficientdet-scalable-and-efficient-object","paper_url":"https://arxiv.org/abs/1911.09070v7","paper_title":"EfficientDet: Scalable and Efficient Object Detection","code":"https://github.com/tensorflow/models/tree/master/research/object_detection","n_code_links":64,"syntology":{"n_ran":11,"n_unverified":59,"n_samples":70,"n_pointer_only_licence":3}},{"rank_in_archive_order":69,"model":"tiny-MOAT-1 (IN-1K pretraining, single-scale)","metrics":{"box AP":"51.9"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":70,"model":"GCNet (ResNeXt-101 + DCN + cascade + GC r4)","metrics":{"AP50":"70.4","AP75":"56.1","box AP":"51.8"},"uses_additional_data":false,"paper_date":"2020-12-24","paper":"/paper/global-context-networks","paper_url":"https://arxiv.org/abs/2012.13375v1","paper_title":"Global Context Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":null},{"rank_in_archive_order":71,"model":"ELSA-S (Cascade Mask RCNN)","metrics":{"AP50":"70.5","AP75":"56.0","box AP":"51.6"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/elsa-enhanced-local-self-attention-for-vision","paper_url":"https://arxiv.org/abs/2112.12786v1","paper_title":"ELSA: Enhanced Local Self-Attention for Vision Transformer","code":"https://github.com/damo-cv/elsa","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":72,"model":"FocalNet-T (LRF, Cascade Mask R-CNN)","metrics":{"AP50":"70.3","AP75":"56.0","box AP":"51.5"},"uses_additional_data":false,"paper_date":"2022-03-22","paper":"/paper/focal-modulation-networks","paper_url":"https://arxiv.org/abs/2203.11926v3","paper_title":"Focal Modulation Networks","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":73,"model":"DINO-5scale (24 epoch)","metrics":{"AP50":"69.1","AP75":"56","APL":"65.8","APM":"54.2","APS":"34.5","box AP":"51.3"},"uses_additional_data":false,"paper_date":"2022-03-07","paper":"/paper/dino-detr-with-improved-denoising-anchor-1","paper_url":"https://arxiv.org/abs/2203.03605v4","paper_title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","code":"https://github.com/IDEA-Research/Grounded-Segment-Anything","n_code_links":16,"syntology":{"n_ran":7,"n_unverified":8,"n_samples":15,"n_pointer_only_licence":5}},{"rank_in_archive_order":74,"model":"DINO-5scale (36 epoch)","metrics":{"AP50":"69","AP75":"55.8","APL":"65.3","APM":"54.3","APS":"35","box AP":"51.2"},"uses_additional_data":false,"paper_date":"2022-03-07","paper":"/paper/dino-detr-with-improved-denoising-anchor-1","paper_url":"https://arxiv.org/abs/2203.03605v4","paper_title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","code":"https://github.com/IDEA-Research/Grounded-Segment-Anything","n_code_links":16,"syntology":{"n_ran":7,"n_unverified":8,"n_samples":15,"n_pointer_only_licence":5}},{"rank_in_archive_order":75,"model":"ResNeSt-200-DCN (single-scale)","metrics":{"AP50":"69.53","AP75":"55.40","APL":"65.83","APM":"54.66","APS":"32.67","box AP":"50.91"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":76,"model":"UniverseNet-20.08d (Res2Net-101, DCN, single-scale)","metrics":{"AP50":"69.5","AP75":"55.4","APL":"65.8","APM":"55.5","APS":"33.5","box AP":"50.9"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/usb-universal-scale-object-detection","paper_url":"https://arxiv.org/abs/2103.14027v3","paper_title":"USB: Universal-Scale Object Detection Benchmark","code":"https://github.com/shinya7y/UniverseNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":77,"model":"ResNeSt-200 (single-scale)","metrics":{"AP50":"68.78","AP75":"55.17","APL":"63.9","APM":"54.2","box AP":"50.54"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":78,"model":"tiny-MOAT-0 (IN-1K pretraining, single-scale)","metrics":{"box AP":"50.5"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":79,"model":"MAE (ViT-B, Mask R-CNN)","metrics":{"box AP":"50.3"},"uses_additional_data":false,"paper_date":"2021-11-11","paper":"/paper/masked-autoencoders-are-scalable-vision","paper_url":"https://arxiv.org/abs/2111.06377v2","paper_title":"Masked Autoencoders Are Scalable Vision Learners","code":"https://github.com/facebookresearch/mae","n_code_links":58,"syntology":{"n_ran":71,"n_unverified":66,"n_samples":137,"n_pointer_only_licence":73}},{"rank_in_archive_order":80,"model":"Sparse R-CNN (PVTv2-B2)","metrics":{"AP50":"69.5","AP75":"54.9","box AP":"50.1"},"uses_additional_data":false,"paper_date":"2021-06-25","paper":"/paper/pvtv2-improved-baselines-with-pyramid-vision","paper_url":"https://arxiv.org/abs/2106.13797v7","paper_title":"PVT v2: Improved Baselines with Pyramid Vision Transformer","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":18,"syntology":null},{"rank_in_archive_order":81,"model":"Pix2seq (ViT-L)","metrics":{"box AP":"50.0"},"uses_additional_data":true,"paper_date":"2021-09-22","paper":"/paper/pix2seq-a-language-modeling-framework-for","paper_url":"https://arxiv.org/abs/2109.10852v2","paper_title":"Pix2seq: A Language Modeling Framework for Object Detection","code":"https://github.com/google-research/pix2seq","n_code_links":6,"syntology":{"n_ran":10,"n_unverified":2,"n_samples":12,"n_pointer_only_licence":10}},{"rank_in_archive_order":82,"model":"DaViT-T (Mask R-CNN, 36 epochs)","metrics":{"box AP":"49.9"},"uses_additional_data":false,"paper_date":"2022-04-07","paper":"/paper/davit-dual-attention-vision-transformers","paper_url":"https://arxiv.org/abs/2204.03645v1","paper_title":"DaViT: Dual Attention Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":8,"n_unverified":7,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":83,"model":"BoTNet 200 (Mask R-CNN, single scale, 72 epochs)","metrics":{"AP50":"71.3","AP75":"54.6","box AP":"49.7"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":84,"model":"BoTNet 152 (Mask R-CNN, single scale, 72 epochs)","metrics":{"AP50":"71","AP75":"54.2","box AP":"49.5"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":85,"model":"DN-Deformable-DETR-R50++","metrics":{"AP50":"67.6","AP75":"53.8","APL":"65.4","APM":"52.6","APS":"31.3","Params (M)":"47","box AP":"49.5"},"uses_additional_data":false,"paper_date":"2022-03-02","paper":"/paper/dn-detr-accelerate-detr-training-by","paper_url":"https://arxiv.org/abs/2203.01305v3","paper_title":"DN-DETR: Accelerate DETR Training by Introducing Query DeNoising","code":"https://github.com/IDEACVR/DINO","n_code_links":17,"syntology":{"n_ran":15,"n_unverified":7,"n_samples":22,"n_pointer_only_licence":9}},{"rank_in_archive_order":86,"model":"REGO-Deformable DETR-X101","metrics":{"AP50":"67.5","AP75":"53.1","APL":"65","APM":"52.6","APS":"30","box AP":"49.1"},"uses_additional_data":false,"paper_date":"2021-12-09","paper":"/paper/recurrent-glimpse-based-decoder-for-detection","paper_url":"https://arxiv.org/abs/2112.04632v2","paper_title":"Recurrent Glimpse-based Decoder for Detection with Transformer","code":"https://github.com/zhechen/deformable-detr-rego","n_code_links":1,"syntology":null},{"rank_in_archive_order":87,"model":"CenterMask+VoVNet99 (multi-scale)","metrics":{"AP50":"67.8","box AP":"48.6"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":88,"model":"Mask R-CNN (ResNeXt-152-FPN, cascade)","metrics":{"AP50":"66.8","AP75":"52.9","box AP":"48.6"},"uses_additional_data":false,"paper_date":"2018-11-21","paper":"/paper/rethinking-imagenet-pre-training","paper_url":"http://arxiv.org/abs/1811.08883v1","paper_title":"Rethinking ImageNet Pre-training","code":"https://github.com/tensorpack/tensorpack/tree/master/examples/FasterRCNN","n_code_links":1,"syntology":null},{"rank_in_archive_order":89,"model":"UniverseNet-20.08 (Res2Net-50, DCN, single-scale)","metrics":{"AP50":"67.0","AP75":"52.6","APL":"62.7","APM":"52.7","APS":"30.6","box AP":"48.5"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/usb-universal-scale-object-detection","paper_url":"https://arxiv.org/abs/2103.14027v3","paper_title":"USB: Universal-Scale Object Detection Benchmark","code":"https://github.com/shinya7y/UniverseNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":90,"model":"XCiT-M24/8","metrics":{"box AP":"48.5"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/xcit-cross-covariance-image-transformers","paper_url":"https://arxiv.org/abs/2106.09681v2","paper_title":"XCiT: Cross-Covariance Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":11,"n_samples":14,"n_pointer_only_licence":3}},{"rank_in_archive_order":91,"model":"ELSA-S (Mask RCNN)","metrics":{"AP50":"70.4","AP75":"52.9","box AP":"48.3"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/elsa-enhanced-local-self-attention-for-vision","paper_url":"https://arxiv.org/abs/2112.12786v1","paper_title":"ELSA: Enhanced Local Self-Attention for Vision Transformer","code":"https://github.com/damo-cv/elsa","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":92,"model":"XCiT-S24/8","metrics":{"box AP":"48.1"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/xcit-cross-covariance-image-transformers","paper_url":"https://arxiv.org/abs/2106.09681v2","paper_title":"XCiT: Cross-Covariance Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":11,"n_samples":14,"n_pointer_only_licence":3}},{"rank_in_archive_order":93,"model":"GCNet (ResNeXt-101 + DCN + cascade + GC r16)","metrics":{"AP50":"66.9","AP75":"52.2","box AP":"47.9"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/gcnet-non-local-networks-meet-squeeze","paper_url":"http://arxiv.org/abs/1904.11492v1","paper_title":"GCNet: Non-local Networks Meet Squeeze-Excitation Networks and Beyond","code":"https://github.com/open-mmlab/mmdetection","n_code_links":9,"syntology":null},{"rank_in_archive_order":94,"model":"MAE-Det(MAE-Det-L+GFLV2)","metrics":{"AP50":"65.5","AP75":"52.2","APL":"61.1","APM":"51.9","APS":"30.3","box AP":"47.8"},"uses_additional_data":false,"paper_date":"2021-11-26","paper":"/paper/revisiting-efficient-object-detection","paper_url":"https://arxiv.org/abs/2111.13336v5","paper_title":"MAE-DET: Revisiting Maximum Entropy Principle in Zero-Shot NAS for Efficient Object Detection","code":"https://github.com/alibaba/lightweight-neural-architecture-search","n_code_links":1,"syntology":null},{"rank_in_archive_order":95,"model":"Res2Net101+HTC","metrics":{"AP50":"66.5","AP75":"51.3","APL":"62.1","APM":"51.6","APS":"28.6","box AP":"47.5"},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/res2net-a-new-multi-scale-backbone","paper_url":"https://arxiv.org/abs/1904.01169v3","paper_title":"Res2Net: A New Multi-scale Backbone Architecture","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":34,"syntology":{"n_ran":3,"n_unverified":6,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":96,"model":"Mask R-CNN (ResNet-101-FPN, GN, Cascade)","metrics":{"box AP":"47.4"},"uses_additional_data":false,"paper_date":"2018-11-21","paper":"/paper/rethinking-imagenet-pre-training","paper_url":"http://arxiv.org/abs/1811.08883v1","paper_title":"Rethinking ImageNet Pre-training","code":"https://github.com/tensorpack/tensorpack/tree/master/examples/FasterRCNN","n_code_links":1,"syntology":null},{"rank_in_archive_order":97,"model":"Pix2seq (R50-C4)","metrics":{"box AP":"47.3"},"uses_additional_data":false,"paper_date":"2021-09-22","paper":"/paper/pix2seq-a-language-modeling-framework-for","paper_url":"https://arxiv.org/abs/2109.10852v2","paper_title":"Pix2seq: A Language Modeling Framework for Object Detection","code":"https://github.com/google-research/pix2seq","n_code_links":6,"syntology":{"n_ran":10,"n_unverified":2,"n_samples":12,"n_pointer_only_licence":10}},{"rank_in_archive_order":98,"model":"Pix2seq (ViT-B)","metrics":{"box AP":"47.1"},"uses_additional_data":false,"paper_date":"2021-09-22","paper":"/paper/pix2seq-a-language-modeling-framework-for","paper_url":"https://arxiv.org/abs/2109.10852v2","paper_title":"Pix2seq: A Language Modeling Framework for Object Detection","code":"https://github.com/google-research/pix2seq","n_code_links":6,"syntology":{"n_ran":10,"n_unverified":2,"n_samples":12,"n_pointer_only_licence":10}},{"rank_in_archive_order":99,"model":"HTC (HRNetV2p-W48)","metrics":{"APL":"62.2","APM":"50.3","APS":"28.8","box AP":"47.0"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":100,"model":"PatchConvNet-S120 (Mask R-CNN)","metrics":{"box AP":"47.0"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":101,"model":"RPDet (ResNeXt-101-DCN, multi-scale)","metrics":{"box AP":"46.8"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/reppoints-point-set-representation-for-object","paper_url":"https://arxiv.org/abs/1904.11490v2","paper_title":"RepPoints: Point Set Representation for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":102,"model":"DAB-DETR-DC5-R101","metrics":{"AP50":"67","AP75":"50.2","APL":"64.1","APM":"50.5","APS":"28.1","Params (M)":"63","box AP":"46.6"},"uses_additional_data":false,"paper_date":"2022-01-28","paper":"/paper/dab-detr-dynamic-anchor-boxes-are-better-1","paper_url":"https://arxiv.org/abs/2201.12329v4","paper_title":"DAB-DETR: Dynamic Anchor Boxes are Better Queries for DETR","code":"https://github.com/IDEA-Research/detrex","n_code_links":8,"syntology":{"n_ran":6,"n_unverified":5,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":103,"model":"DyHead (ResNet-101)","metrics":{"box AP":"46.5"},"uses_additional_data":false,"paper_date":"2021-06-15","paper":"/paper/dynamic-head-unifying-object-detection-heads","paper_url":"https://arxiv.org/abs/2106.08322v1","paper_title":"Dynamic Head: Unifying Object Detection Heads with Attentions","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":104,"model":"Mask R-CNN (ResNeXt-152-FPN)","metrics":{"AP50":"67.1","AP75":"51.1","box AP":"46.4"},"uses_additional_data":false,"paper_date":"2018-11-21","paper":"/paper/rethinking-imagenet-pre-training","paper_url":"http://arxiv.org/abs/1811.08883v1","paper_title":"Rethinking ImageNet Pre-training","code":"https://github.com/tensorpack/tensorpack/tree/master/examples/FasterRCNN","n_code_links":1,"syntology":null},{"rank_in_archive_order":105,"model":"RPDet (ResNet-101-DCN, multi-scale)","metrics":{"box AP":"46.4"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/reppoints-point-set-representation-for-object","paper_url":"https://arxiv.org/abs/1904.11490v2","paper_title":"RepPoints: Point Set Representation for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":106,"model":"PatchConvNet-S60 (Mask R-CNN)","metrics":{"box AP":"46.4"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":107,"model":"Cascade Mask R-CNN (ResNet-50)","metrics":{"AP50":"64.3","AP75":"50.5","box AP":"46.3"},"uses_additional_data":false,"paper_date":"2015-12-10","paper":"/paper/deep-residual-learning-for-image-recognition","paper_url":"http://arxiv.org/abs/1512.03385v1","paper_title":"Deep Residual Learning for Image Recognition","code":"https://github.com/tensorflow/models/tree/master/research/deeplab","n_code_links":484,"syntology":{"n_ran":230,"n_unverified":147,"n_samples":377,"n_pointer_only_licence":187}},{"rank_in_archive_order":108,"model":"HoughNet (HG-104, MS)","metrics":{"AP50":"64.6","AP75":"50.3","APL":"59.7","APM":"48.8","APS":"30.0","box AP":"46.1"},"uses_additional_data":false,"paper_date":"2020-07-05","paper":"/paper/houghnet-integrating-near-and-long-range","paper_url":"https://arxiv.org/abs/2007.02355v3","paper_title":"HoughNet: Integrating near and long-range evidence for bottom-up object detection","code":"https://github.com/giddyyupp/coco-minitrain","n_code_links":2,"syntology":null},{"rank_in_archive_order":109,"model":"Mask R-CNN (HRNetV2p-W48, cascade)","metrics":{"APL":"60.1","APS":"27.5","box AP":"46.0"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":110,"model":"Conditional DETR-DC5-R101","metrics":{"AP50":"66.8","AP75":"49.5","APL":"63.3","APM":"50.3","APS":"27.2","Params (M)":"63","box AP":"45.9"},"uses_additional_data":false,"paper_date":"2021-08-13","paper":"/paper/conditional-detr-for-fast-training","paper_url":"https://arxiv.org/abs/2108.06152v3","paper_title":"Conditional DETR for Fast Training Convergence","code":"https://github.com/huggingface/transformers","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":4,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":111,"model":"BoTNet 50 (72 epochs)","metrics":{"box AP":"45.9"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":112,"model":"Sparse R-CNN (ResNet-101, learnable proposals, random crop aug, FPN)","metrics":{"AP50":"64.6","AP75":"49.5","APL":"61.6","APM":"48.3","APS":"28.3","box AP":"45.6"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/sparse-r-cnn-end-to-end-object-detection-with","paper_url":"https://arxiv.org/abs/2011.12450v2","paper_title":"Sparse R-CNN: End-to-End Object Detection with Learnable Proposals","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":null},{"rank_in_archive_order":113,"model":"CenterMask+VoVNetV2-99 (single-scale)","metrics":{"APL":"58.8","APS":"29.2","box AP":"45.6"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":114,"model":"HTC (HRNetV2p-W32)","metrics":{"APL":"59.5","APM":"48.4","APS":"27.0","box AP":"45.3"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":115,"model":"Anchor DETR-DC5-R101","metrics":{"AP50":"65.7","AP75":"48.8","APL":"61.6","APM":"49.4","APS":"25.8","box AP":"45.1"},"uses_additional_data":false,"paper_date":"2021-09-15","paper":"/paper/anchor-detr-query-design-for-transformer","paper_url":"https://arxiv.org/abs/2109.07107v2","paper_title":"Anchor DETR: Query Design for Transformer-Based Object Detection","code":"https://github.com/megvii-research/AnchorDETR","n_code_links":2,"syntology":null},{"rank_in_archive_order":116,"model":"Conditional DETR-DC5-R50","metrics":{"AP50":"65.4","AP75":"48.5","APL":"62.2","APM":"49","APS":"25.3","Params (M)":"44","box AP":"45.1"},"uses_additional_data":false,"paper_date":"2021-08-13","paper":"/paper/conditional-detr-for-fast-training","paper_url":"https://arxiv.org/abs/2108.06152v3","paper_title":"Conditional DETR for Fast Training Convergence","code":"https://github.com/huggingface/transformers","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":4,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":117,"model":"Mask R-CNN (ResNeXt-152 + 1 NL)","metrics":{"AP50":"67.8","AP75":"48.9","box AP":"45.0"},"uses_additional_data":false,"paper_date":"2017-11-21","paper":"/paper/non-local-neural-networks","paper_url":"http://arxiv.org/abs/1711.07971v3","paper_title":"Non-local Neural Networks","code":"https://github.com/facebookresearch/detectron","n_code_links":32,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":118,"model":"Pix2seq (R101-DC5)","metrics":{"AP50":"63.2","AP75":"48.6","APL":"60.4","APM":"48.9","APS":"28.2","box AP":"45.0"},"uses_additional_data":false,"paper_date":"2021-09-22","paper":"/paper/pix2seq-a-language-modeling-framework-for","paper_url":"https://arxiv.org/abs/2109.10852v2","paper_title":"Pix2seq: A Language Modeling Framework for Object Detection","code":"https://github.com/google-research/pix2seq","n_code_links":6,"syntology":{"n_ran":10,"n_unverified":2,"n_samples":12,"n_pointer_only_licence":10}},{"rank_in_archive_order":119,"model":"Mask R-CNN-FPN (AOGNet-40M)","metrics":{"AP50":"66.2","AP75":"49.1","box AP":"44.9"},"uses_additional_data":false,"paper_date":"2019-08-04","paper":"/paper/attentive-normalization","paper_url":"https://arxiv.org/abs/1908.01259v3","paper_title":"Attentive Normalization","code":"https://github.com/iVMCL/AOGNet-v2","n_code_links":2,"syntology":null},{"rank_in_archive_order":120,"model":"DETR-DC5 (ResNet-101)","metrics":{"AP50":"64.7","AP75":"47.7","APL":"62.3","APM":"49.5","APS":"23.7","box AP":"44.9"},"uses_additional_data":false,"paper_date":"2020-05-26","paper":"/paper/end-to-end-object-detection-with-transformers","paper_url":"https://arxiv.org/abs/2005.12872v3","paper_title":"End-to-End Object Detection with Transformers","code":"https://github.com/huggingface/transformers","n_code_links":37,"syntology":{"n_ran":59,"n_unverified":33,"n_samples":92,"n_pointer_only_licence":19}},{"rank_in_archive_order":121,"model":"Mask R-CNN (VoVNetV2-99, single-scale)","metrics":{"APL":"57.7","APS":"28.5","box AP":"44.9"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":122,"model":"R3-CNN (ResNet-50-FPN, DCN)","metrics":{"AP50":"64.3","AP75":"48.9","APL":"59.6","APM":"48.3","APS":"26.6","box AP":"44.8"},"uses_additional_data":false,"paper_date":"2021-04-03","paper":"/paper/recursively-refined-r-cnn-instance","paper_url":"https://arxiv.org/abs/2104.01329v2","paper_title":"Recursively Refined R-CNN: Instance Segmentation with Self-RoI Rebalancing","code":"https://github.com/IMPLabUniPr/mmdetection","n_code_links":1,"syntology":null},{"rank_in_archive_order":123,"model":"RPDet (ResNet-101-DCN, multi-scale train)","metrics":{"box AP":"44.8"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/reppoints-point-set-representation-for-object","paper_url":"https://arxiv.org/abs/1904.11490v2","paper_title":"RepPoints: Point Set Representation for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":124,"model":"RetinaNet (ViL-Base, multi-scale, 3x)","metrics":{"AP75":"47.6","APL":"58.1","APM":"48","APS":"29.9","box AP":"44.7"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/2103-15358","paper_url":"https://arxiv.org/abs/2103.15358v2","paper_title":"Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding","code":"https://github.com/microsoft/esvit","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":125,"model":"Cascade R-CNN (HRNetV2p-W48)","metrics":{"AP50":"62.7","AP75":"48.7","APL":"58.5","APM":"48.1","APS":"26.3","box AP":"44.6"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":126,"model":"CenterMask+VoVNetV2-57 (single-scale)","metrics":{"APM":"48.3","APS":"27.7","box AP":"44.6"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":127,"model":"Conditional DETR-R101","metrics":{"AP50":"65.6","AP75":"47.5","APL":"63.6","APM":"48.4","APS":"23.6","Params (M)":"63","box AP":"44.5"},"uses_additional_data":false,"paper_date":"2021-08-13","paper":"/paper/conditional-detr-for-fast-training","paper_url":"https://arxiv.org/abs/2108.06152v3","paper_title":"Conditional DETR for Fast Training Convergence","code":"https://github.com/huggingface/transformers","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":4,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":128,"model":"Sparse R-CNN (ResNet-50, learnable proposals, random crop aug, FPN)","metrics":{"AP50":"63.4","AP75":"48.2","APL":"59.5","APM":"47.2","APS":"26.9","box AP":"44.5"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/sparse-r-cnn-end-to-end-object-detection-with","paper_url":"https://arxiv.org/abs/2011.12450v2","paper_title":"Sparse R-CNN: End-to-End Object Detection with Learnable Proposals","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":null},{"rank_in_archive_order":129,"model":"GFL (ResNet-50)","metrics":{"AP50":"63.0","AP75":"48.3","box AP":"44.5"},"uses_additional_data":false,"paper_date":"2015-12-10","paper":"/paper/deep-residual-learning-for-image-recognition","paper_url":"http://arxiv.org/abs/1512.03385v1","paper_title":"Deep Residual Learning for Image Recognition","code":"https://github.com/tensorflow/models/tree/master/research/deeplab","n_code_links":484,"syntology":{"n_ran":230,"n_unverified":147,"n_samples":377,"n_pointer_only_licence":187}},{"rank_in_archive_order":130,"model":"RPDet (ResNeXt-101-DCN)","metrics":{"box AP":"44.5"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/reppoints-point-set-representation-for-object","paper_url":"https://arxiv.org/abs/1904.11490v2","paper_title":"RepPoints: Point Set Representation for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":131,"model":"CenterMask+X101-32x8d (single-scale)","metrics":{"APL":"57.1","APS":"26.7","box AP":"44.4"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":132,"model":"RetinaNet (ViL-Base)","metrics":{"AP50":"65.5","AP75":"47.1","APL":"58.3","APM":"47.9","APS":"28.9","box AP":"44.3"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/2103-15358","paper_url":"https://arxiv.org/abs/2103.15358v2","paper_title":"Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding","code":"https://github.com/microsoft/esvit","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":133,"model":"R3-CNN (ResNet-50-FPN, GC-Net)","metrics":{"AP50":"64.1","AP75":"48.4","APL":"58.9","APM":"47.1","APS":"27","box AP":"44.3"},"uses_additional_data":false,"paper_date":"2021-04-03","paper":"/paper/recursively-refined-r-cnn-instance","paper_url":"https://arxiv.org/abs/2104.01329v2","paper_title":"Recursively Refined R-CNN: Instance Segmentation with Self-RoI Rebalancing","code":"https://github.com/IMPLabUniPr/mmdetection","n_code_links":1,"syntology":null},{"rank_in_archive_order":134,"model":"Anchor DETR-DC5-R50","metrics":{"AP50":"64.7","AP75":"47.5","APL":"60.6","APM":"48.2","APS":"24.7","box AP":"44.2"},"uses_additional_data":false,"paper_date":"2021-09-15","paper":"/paper/anchor-detr-query-design-for-transformer","paper_url":"https://arxiv.org/abs/2109.07107v2","paper_title":"Anchor DETR: Query Design for Transformer-Based Object Detection","code":"https://github.com/megvii-research/AnchorDETR","n_code_links":2,"syntology":null},{"rank_in_archive_order":135,"model":"DAB-DETR-R101","metrics":{"AP50":"64.7","AP75":"47.2","APL":"62.9","APM":"48.2","APS":"24.1","Params (M)":"63","box AP":"44.1"},"uses_additional_data":false,"paper_date":"2022-01-28","paper":"/paper/dab-detr-dynamic-anchor-boxes-are-better-1","paper_url":"https://arxiv.org/abs/2201.12329v4","paper_title":"DAB-DETR: Dynamic Anchor Boxes are Better Queries for DETR","code":"https://github.com/IDEA-Research/detrex","n_code_links":8,"syntology":{"n_ran":6,"n_unverified":5,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":136,"model":"Faster RCNN-R101-FPN+","metrics":{"AP50":"63.9","AP75":"47.8","APL":"56","APM":"48.1","APS":"27.2","box AP":"44"},"uses_additional_data":false,"paper_date":"2020-05-26","paper":"/paper/end-to-end-object-detection-with-transformers","paper_url":"https://arxiv.org/abs/2005.12872v3","paper_title":"End-to-End Object Detection with Transformers","code":"https://github.com/huggingface/transformers","n_code_links":37,"syntology":{"n_ran":59,"n_unverified":33,"n_samples":92,"n_pointer_only_licence":19}},{"rank_in_archive_order":137,"model":"Cascade R-CNN (HRNetV2p-W32)","metrics":{"AP50":"61.7","AP75":"47.7","APL":"57.4","APM":"46.5","APS":"25.6","box AP":"43.7"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":138,"model":"Sparse R-CNN (ResNet-101, FPN)","metrics":{"AP50":"62.1","AP75":"47.2","APL":"59.7","APM":"46.3","APS":"26.1","box AP":"43.5"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/sparse-r-cnn-end-to-end-object-detection-with","paper_url":"https://arxiv.org/abs/2011.12450v2","paper_title":"Sparse R-CNN: End-to-End Object Detection with Learnable Proposals","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":null},{"rank_in_archive_order":139,"model":"ATSS (ResNet-50)","metrics":{"AP50":"61.9","AP75":"47.0","box AP":"43.5"},"uses_additional_data":false,"paper_date":"2015-12-10","paper":"/paper/deep-residual-learning-for-image-recognition","paper_url":"http://arxiv.org/abs/1512.03385v1","paper_title":"Deep Residual Learning for Image Recognition","code":"https://github.com/tensorflow/models/tree/master/research/deeplab","n_code_links":484,"syntology":{"n_ran":230,"n_unverified":147,"n_samples":377,"n_pointer_only_licence":187}},{"rank_in_archive_order":140,"model":"PVT-Large (RetinaNet 3x,MS)","metrics":{"AP50":"63.6","AP75":"46.1","APL":"59.5","APM":"46.0","APS":"26.1","box AP":"43.4"},"uses_additional_data":false,"paper_date":"2021-02-24","paper":"/paper/pyramid-vision-transformer-a-versatile","paper_url":"https://arxiv.org/abs/2102.12122v2","paper_title":"Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without Convolutions","code":"https://github.com/open-mmlab/mmdetection","n_code_links":11,"syntology":{"n_ran":22,"n_unverified":8,"n_samples":30,"n_pointer_only_licence":1}},{"rank_in_archive_order":141,"model":"ExtremeNet (Hourglass-104, multi-scale)","metrics":{"AP50":"59.6","AP75":"46.8","APL":"59.4","APM":"46.6","APS":"25.7","box AP":"43.3"},"uses_additional_data":false,"paper_date":"2019-01-23","paper":"/paper/bottom-up-object-detection-by-grouping","paper_url":"http://arxiv.org/abs/1901.08043v3","paper_title":"Bottom-up Object Detection by Grouping Extreme and Center Points","code":"https://github.com/xingyizhou/ExtremeNet","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":142,"model":"Pix2seq (R50-DC5 )","metrics":{"AP50":"61.0","AP75":"46.1","APL":"58.6","APM":"47","APS":"26.6","box AP":"43.2"},"uses_additional_data":false,"paper_date":"2021-09-22","paper":"/paper/pix2seq-a-language-modeling-framework-for","paper_url":"https://arxiv.org/abs/2109.10852v2","paper_title":"Pix2seq: A Language Modeling Framework for Object Detection","code":"https://github.com/google-research/pix2seq","n_code_links":6,"syntology":{"n_ran":10,"n_unverified":2,"n_samples":12,"n_pointer_only_licence":10}},{"rank_in_archive_order":143,"model":"HTC (cascade)","metrics":{"AP50":"59.4","AP75":"40.7","APL":"52.3","APM":"40.9","APS":"20.3","box AP":"43.2"},"uses_additional_data":false,"paper_date":"2019-01-22","paper":"/paper/hybrid-task-cascade-for-instance-segmentation","paper_url":"http://arxiv.org/abs/1901.07518v2","paper_title":"Hybrid Task Cascade for Instance Segmentation","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":11,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":144,"model":"Mask R-CNN-FPN (ResNeXt-101, GN+WS)","metrics":{"AP50":"64.15","AP75":"47.11","APL":"56.39","APM":"47.19","APS":"25.49","box AP":"43.12"},"uses_additional_data":false,"paper_date":"2019-03-25","paper":"/paper/weight-standardization","paper_url":"https://arxiv.org/abs/1903.10520v2","paper_title":"Micro-Batch Training with Batch-Channel Normalization and Weight Standardization","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":7,"syntology":null},{"rank_in_archive_order":145,"model":"HTC (HRNetV2p-W18)","metrics":{"APM":"46.0","APS":"26.6","box AP":"43.1"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":146,"model":"Mask R-CNN (ResNet-101, DCNv2)","metrics":{"box AP":"43.1"},"uses_additional_data":false,"paper_date":"2018-11-27","paper":"/paper/deformable-convnets-v2-more-deformable-better","paper_url":"http://arxiv.org/abs/1811.11168v2","paper_title":"Deformable ConvNets v2: More Deformable, Better Results","code":"https://github.com/open-mmlab/mmdetection","n_code_links":26,"syntology":{"n_ran":2,"n_unverified":11,"n_samples":13,"n_pointer_only_licence":2}},{"rank_in_archive_order":147,"model":"Conditional DETR-R50","metrics":{"AP50":"64","AP75":"45.7","APL":"61.5","APM":"46.7","APS":"22.7","Params (M)":"44","box AP":"43"},"uses_additional_data":false,"paper_date":"2021-08-13","paper":"/paper/conditional-detr-for-fast-training","paper_url":"https://arxiv.org/abs/2108.06152v3","paper_title":"Conditional DETR for Fast Training Convergence","code":"https://github.com/huggingface/transformers","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":4,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":148,"model":"HoughNet (HG-104)","metrics":{"AP50":"62.2","AP75":"46.9","APL":"55.8","APM":"47.6","APS":"25.5","box AP":"43.0"},"uses_additional_data":false,"paper_date":"2020-07-05","paper":"/paper/houghnet-integrating-near-and-long-range","paper_url":"https://arxiv.org/abs/2007.02355v3","paper_title":"HoughNet: Integrating near and long-range evidence for bottom-up object detection","code":"https://github.com/giddyyupp/coco-minitrain","n_code_links":2,"syntology":null},{"rank_in_archive_order":149,"model":"Faster R-CNN (FPN, X-volution)","metrics":{"AP50":"64","AP75":"46.4","APL":"55","APM":"46","APS":"26.9","box AP":"42.8"},"uses_additional_data":false,"paper_date":"2021-06-04","paper":"/paper/x-volution-on-the-unification-of-convolution","paper_url":"https://arxiv.org/abs/2106.02253v2","paper_title":"X-volution: On the unification of convolution and self-attention","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":150,"model":"Cascade R-CNN (ResNet-101-FPN+, cascade)","metrics":{"AP50":"61.6","AP75":"46.6","APL":"57.4","APM":"46.2","APS":"23.8","box AP":"42.7"},"uses_additional_data":false,"paper_date":"2017-12-03","paper":"/paper/cascade-r-cnn-delving-into-high-quality","paper_url":"http://arxiv.org/abs/1712.00726v1","paper_title":"Cascade R-CNN: Delving into High Quality Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":8,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":151,"model":"PVT-Large (RetinaNet 1x)","metrics":{"AP50":"63.7","AP75":"45.4","APL":"58.4","APM":"46.0","APS":"25.8","box AP":"42.6"},"uses_additional_data":false,"paper_date":"2021-02-24","paper":"/paper/pyramid-vision-transformer-a-versatile","paper_url":"https://arxiv.org/abs/2102.12122v2","paper_title":"Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without Convolutions","code":"https://github.com/open-mmlab/mmdetection","n_code_links":11,"syntology":{"n_ran":22,"n_unverified":8,"n_samples":30,"n_pointer_only_licence":1}},{"rank_in_archive_order":152,"model":"CornerNet-Saccade (Hourglass-54)","metrics":{"APL":"58.4","APM":"44.3","APS":"25.5","box AP":"42.6"},"uses_additional_data":false,"paper_date":"2019-04-18","paper":"/paper/190408900","paper_url":"https://arxiv.org/abs/1904.08900v2","paper_title":"CornerNet-Lite: Efficient Keypoint Based Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":26,"n_samples":27,"n_pointer_only_licence":0}},{"rank_in_archive_order":153,"model":"Pix2seq (R50)","metrics":{"box AP":"42.6"},"uses_additional_data":false,"paper_date":"2021-09-22","paper":"/paper/pix2seq-a-language-modeling-framework-for","paper_url":"https://arxiv.org/abs/2109.10852v2","paper_title":"Pix2seq: A Language Modeling Framework for Object Detection","code":"https://github.com/google-research/pix2seq","n_code_links":6,"syntology":{"n_ran":10,"n_unverified":2,"n_samples":12,"n_pointer_only_licence":10}},{"rank_in_archive_order":154,"model":"Mask R-CNN (ResNet-101-FPN, GroupNorm, long)","metrics":{"AP50":"62.8","AP75":"46.2","box AP":"42.3"},"uses_additional_data":false,"paper_date":"2018-03-22","paper":"/paper/group-normalization","paper_url":"http://arxiv.org/abs/1803.08494v3","paper_title":"Group Normalization","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":22,"syntology":{"n_ran":5,"n_unverified":10,"n_samples":15,"n_pointer_only_licence":4}},{"rank_in_archive_order":155,"model":"Sparse R-CNN (ResNet-50, FPN)","metrics":{"AP50":"61.2","AP75":"45.7","APL":"57.6","APM":"44.6","APS":"26.7","box AP":"42.3"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/sparse-r-cnn-end-to-end-object-detection-with","paper_url":"https://arxiv.org/abs/2011.12450v2","paper_title":"Sparse R-CNN: End-to-End Object Detection with Learnable Proposals","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":null},{"rank_in_archive_order":156,"model":"Mask R-CNN (HRNetV2p-W32)","metrics":{"APM":"45.4","APS":"25.0","box AP":"42.3"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":157,"model":"DETR-ResNet50 with iRPE-K (300 epochs)","metrics":{"box AP":"42.3"},"uses_additional_data":false,"paper_date":"2021-07-29","paper":"/paper/rethinking-and-improving-relative-position","paper_url":"https://arxiv.org/abs/2107.14222v1","paper_title":"Rethinking and Improving Relative Position Encoding for Vision Transformer","code":"https://github.com/microsoft/cream","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":158,"model":"TridentNet (ResNet-101)","metrics":{"AP50":"63.5","AP75":"45.5","APL":"56.9","APM":"47","APS":"24.9","box AP":"42"},"uses_additional_data":false,"paper_date":"2019-01-07","paper":"/paper/scale-aware-trident-networks-for-object","paper_url":"https://arxiv.org/abs/1901.01892v2","paper_title":"Scale-Aware Trident Networks for Object Detection","code":"https://github.com/facebookresearch/detectron2/tree/master/projects/TridentNet/","n_code_links":4,"syntology":null},{"rank_in_archive_order":159,"model":"R3-CNN (ResNet-50-FPN)","metrics":{"AP50":"61","AP75":"46.3","APL":"55.7","APM":"45.2","APS":"24.5","box AP":"42"},"uses_additional_data":false,"paper_date":"2021-04-03","paper":"/paper/recursively-refined-r-cnn-instance","paper_url":"https://arxiv.org/abs/2104.01329v2","paper_title":"Recursively Refined R-CNN: Instance Segmentation with Self-RoI Rebalancing","code":"https://github.com/IMPLabUniPr/mmdetection","n_code_links":1,"syntology":null},{"rank_in_archive_order":160,"model":"Faster R-CNN (HRNetV2p-W48)","metrics":{"AP50":"62.8","AP75":"45.9","APL":"54.6","APM":"44.7","box AP":"41.8"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":161,"model":"Faster R-CNN (LIP-ResNet-101)","metrics":{"AP50":"63.6","AP75":"45.6","APM":"45.8","APS":"25.2","box AP":"41.7"},"uses_additional_data":false,"paper_date":"2019-08-12","paper":"/paper/lip-local-importance-based-pooling","paper_url":"https://arxiv.org/abs/1908.04156v3","paper_title":"LIP: Local Importance-based Pooling","code":"https://github.com/sebgao/LIP","n_code_links":1,"syntology":null},{"rank_in_archive_order":162,"model":"Faster R-CNN (ResNet-101, DCNv2)","metrics":{"APL":"58.7","APM":"45.8","APS":"22.2","box AP":"41.7"},"uses_additional_data":false,"paper_date":"2018-11-27","paper":"/paper/deformable-convnets-v2-more-deformable-better","paper_url":"http://arxiv.org/abs/1811.11168v2","paper_title":"Deformable ConvNets v2: More Deformable, Better Results","code":"https://github.com/open-mmlab/mmdetection","n_code_links":26,"syntology":{"n_ran":2,"n_unverified":11,"n_samples":13,"n_pointer_only_licence":2}},{"rank_in_archive_order":163,"model":"FSAF (ResNeXt-101, anchor-based branches)","metrics":{"AP50":"62.4","box AP":"41.6"},"uses_additional_data":false,"paper_date":"2019-03-02","paper":"/paper/feature-selective-anchor-free-module-for","paper_url":"http://arxiv.org/abs/1903.00621v1","paper_title":"Feature Selective Anchor-Free Module for Single-Shot Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":8,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":164,"model":"CornerNet-Saccade (Hourglass-104)","metrics":{"APL":"57.1","APM":"43.5","APS":"23.8","box AP":"41.4"},"uses_additional_data":false,"paper_date":"2019-04-18","paper":"/paper/190408900","paper_url":"https://arxiv.org/abs/1904.08900v2","paper_title":"CornerNet-Lite: Efficient Keypoint Based Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":26,"n_samples":27,"n_pointer_only_licence":0}},{"rank_in_archive_order":165,"model":"Grid R-CNN (ResNet-101-FPN)","metrics":{"AP50":"60.3","AP75":"44.4","APL":"54.1","APM":"45.8","APS":"23.4","box AP":"41.3"},"uses_additional_data":false,"paper_date":"2018-11-29","paper":"/paper/grid-r-cnn","paper_url":"http://arxiv.org/abs/1811.12030v1","paper_title":"Grid R-CNN","code":"https://github.com/open-mmlab/mmdetection","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":166,"model":"Cascade R-CNN (HRNetV2p-W18)","metrics":{"AP50":"59.2","AP75":"44.9","APL":"54.1","APM":"44.2","APS":"23.7","box AP":"41.3"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":167,"model":"CenterNet511 (Hourglass-52)","metrics":{"AP50":"59.2","AP75":"43.9","APL":"55.8","APM":"43.8","APS":"23.6","box AP":"41.3"},"uses_additional_data":false,"paper_date":"2019-04-17","paper":"/paper/centernet-object-detection-with-keypoint","paper_url":"http://arxiv.org/abs/1904.08189v3","paper_title":"CenterNet: Keypoint Triplets for Object Detection","code":"https://github.com/Duankaiwen/CenterNet","n_code_links":20,"syntology":{"n_ran":2,"n_unverified":9,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":168,"model":"RetinaMask (ResNet-101-FPN)","metrics":{"AP50":"60.2","AP75":"44.1","box AP":"41.1"},"uses_additional_data":false,"paper_date":"2019-01-10","paper":"/paper/retinamask-learning-to-predict-masks-improves","paper_url":"http://arxiv.org/abs/1901.03353v1","paper_title":"RetinaMask: Learning to predict masks improves state-of-the-art single-shot detection for free","code":"https://github.com/chengyangfu/retinamask","n_code_links":53,"syntology":null},{"rank_in_archive_order":169,"model":"PoolFormer-S36 (Mask R-CNN)","metrics":{"AP50":"63.1","AP75":"44.8","box AP":"41.0"},"uses_additional_data":false,"paper_date":"2021-11-22","paper":"/paper/metaformer-is-actually-what-you-need-for","paper_url":"https://arxiv.org/abs/2111.11418v3","paper_title":"MetaFormer Is Actually What You Need for Vision","code":"https://github.com/huggingface/transformers","n_code_links":18,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":170,"model":"Faster R-CNN (HRNetV2p-W32)","metrics":{"AP50":"61.8","AP75":"44.8","APL":"53.3","APM":"43.7","APS":"24.4","box AP":"40.9"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":171,"model":"VirTex Mask R-CNN (ResNet-50-FPN)","metrics":{"box AP":"40.9"},"uses_additional_data":false,"paper_date":"2020-06-11","paper":"/paper/virtex-learning-visual-representations-from","paper_url":"https://arxiv.org/abs/2006.06666v3","paper_title":"VirTex: Learning Visual Representations from Textual Annotations","code":"https://github.com/kdexd/virtex","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":172,"model":"Mask R-CNN (ResNet-101 + 1 NL)","metrics":{"AP50":"63.1","AP75":"44.5","box AP":"40.8"},"uses_additional_data":false,"paper_date":"2017-11-21","paper":"/paper/non-local-neural-networks","paper_url":"http://arxiv.org/abs/1711.07971v3","paper_title":"Non-local Neural Networks","code":"https://github.com/facebookresearch/detectron","n_code_links":32,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":173,"model":"Mask R-CNN (ResNet-50-FPN, GroupNorm, long)","metrics":{"AP50":"61.6","AP75":"44.4","box AP":"40.8"},"uses_additional_data":false,"paper_date":"2018-03-22","paper":"/paper/group-normalization","paper_url":"http://arxiv.org/abs/1803.08494v3","paper_title":"Group Normalization","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":22,"syntology":{"n_ran":5,"n_unverified":10,"n_samples":15,"n_pointer_only_licence":4}},{"rank_in_archive_order":174,"model":"RPDet (ResNet-50, multi-scale train)","metrics":{"box AP":"40.8"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/reppoints-point-set-representation-for-object","paper_url":"https://arxiv.org/abs/1904.11490v2","paper_title":"RepPoints: Point Set Representation for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":175,"model":"DETR-ResNet50 with iRPE-K (150 epochs)","metrics":{"box AP":"40.8"},"uses_additional_data":false,"paper_date":"2021-07-29","paper":"/paper/rethinking-and-improving-relative-position","paper_url":"https://arxiv.org/abs/2107.14222v1","paper_title":"Rethinking and Improving Relative Position Encoding for Vision Transformer","code":"https://github.com/microsoft/cream","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":176,"model":"Faster R-CNN+aLRP Loss (ResNet-50, 500 scale)","metrics":{"AP50":"60.7","AP75":"43.3","box AP":"40.7"},"uses_additional_data":false,"paper_date":"2020-09-28","paper":"/paper/a-ranking-based-balanced-loss-function","paper_url":"https://arxiv.org/abs/2009.13592v4","paper_title":"A Ranking-based, Balanced Loss Function Unifying Classification and Localisation in Object Detection","code":"https://github.com/kemaloksuz/aLRPLoss","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":177,"model":"PPDet (ResNet-101-FPN)","metrics":{"AP50":"59.5","AP75":"44.2","APL":"52.3","APM":"44.7","APS":"25.4","box AP":"40.5"},"uses_additional_data":false,"paper_date":"2020-08-03","paper":"/paper/reducing-label-noise-in-anchor-free-object","paper_url":"https://arxiv.org/abs/2008.01167v2","paper_title":"Reducing Label Noise in Anchor-Free Object Detection","code":"https://github.com/nerminsamet/ppdet","n_code_links":1,"syntology":null},{"rank_in_archive_order":178,"model":"GCnet (ResNet-50-FPN, GRoIE)","metrics":{"AP50":"62.4","AP75":"44","APL":"52.5","APM":"44.4","APS":"24.2","box AP":"40.3"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/gcnet-non-local-networks-meet-squeeze","paper_url":"http://arxiv.org/abs/1904.11492v1","paper_title":"GCNet: Non-local Networks Meet Squeeze-Excitation Networks and Beyond","code":"https://github.com/open-mmlab/mmdetection","n_code_links":9,"syntology":null},{"rank_in_archive_order":179,"model":"Mask R-CNN (ResNet-50-FPN, GroupNorm)","metrics":{"AP50":"61","AP75":"44","box AP":"40.3"},"uses_additional_data":false,"paper_date":"2018-03-22","paper":"/paper/group-normalization","paper_url":"http://arxiv.org/abs/1803.08494v3","paper_title":"Group Normalization","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":22,"syntology":{"n_ran":5,"n_unverified":10,"n_samples":15,"n_pointer_only_licence":4}},{"rank_in_archive_order":180,"model":"Cascade R-CNN (ResNet-50-FPN+)","metrics":{"AP50":" 59.4","AP75":"43.7","APL":"54.1","APM":"43.7","APS":"22.9","box AP":"40.3"},"uses_additional_data":false,"paper_date":"2017-12-03","paper":"/paper/cascade-r-cnn-delving-into-high-quality","paper_url":"http://arxiv.org/abs/1712.00726v1","paper_title":"Cascade R-CNN: Delving into High Quality Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":8,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":181,"model":"ExtremeNet (Hourglass-104, single-scale)","metrics":{"AP50":"55.1","AP75":"43.7","APL":"56.1","APM":"44.0","APS":"21.6","box AP":"40.3"},"uses_additional_data":false,"paper_date":"2019-01-23","paper":"/paper/bottom-up-object-detection-by-grouping","paper_url":"http://arxiv.org/abs/1901.08043v3","paper_title":"Bottom-up Object Detection by Grouping Extreme and Center Points","code":"https://github.com/xingyizhou/ExtremeNet","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":182,"model":"RPDet (ResNet-101)","metrics":{"box AP":"40.3"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/reppoints-point-set-representation-for-object","paper_url":"https://arxiv.org/abs/1904.11490v2","paper_title":"RepPoints: Point Set Representation for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":183,"model":"RetinaNet+aLRP Loss (ResNet-50, 500 scale)","metrics":{"AP50":"60.3","AP75":"42.3","box AP":"40.2"},"uses_additional_data":false,"paper_date":"2020-09-28","paper":"/paper/a-ranking-based-balanced-loss-function","paper_url":"https://arxiv.org/abs/2009.13592v4","paper_title":"A Ranking-based, Balanced Loss Function Unifying Classification and Localisation in Object Detection","code":"https://github.com/kemaloksuz/aLRPLoss","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":184,"model":"Mask R-CNN (ResNet-101-FPN)","metrics":{"box AP":"40.0"},"uses_additional_data":false,"paper_date":"2017-03-20","paper":"/paper/mask-r-cnn","paper_url":"http://arxiv.org/abs/1703.06870v3","paper_title":"Mask R-CNN","code":"https://github.com/tensorflow/models/tree/master/official/vision","n_code_links":179,"syntology":{"n_ran":42,"n_unverified":98,"n_samples":140,"n_pointer_only_licence":23}},{"rank_in_archive_order":185,"model":"FPN+","metrics":{"AP50":"61.3","AP75":"43.3","APL":"52.6","APM":"43.3","APS":"22.9","box AP":"39.8"},"uses_additional_data":false,"paper_date":"2016-12-09","paper":"/paper/feature-pyramid-networks-for-object-detection","paper_url":"http://arxiv.org/abs/1612.03144v2","paper_title":"Feature Pyramid Networks for Object Detection","code":"https://github.com/PaddlePaddle/PaddleOCR","n_code_links":85,"syntology":{"n_ran":16,"n_unverified":35,"n_samples":51,"n_pointer_only_licence":11}},{"rank_in_archive_order":186,"model":"FoveaBox+aLRP Loss (ResNet-50, 500 scale)","metrics":{"AP50":"58.8","AP75":"41.5","box AP":"39.7"},"uses_additional_data":false,"paper_date":"2020-09-28","paper":"/paper/a-ranking-based-balanced-loss-function","paper_url":"https://arxiv.org/abs/2009.13592v4","paper_title":"A Ranking-based, Balanced Loss Function Unifying Classification and Localisation in Object Detection","code":"https://github.com/kemaloksuz/aLRPLoss","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":187,"model":"Grid R-CNN (ResNet-50-FPN)","metrics":{"AP50":"58.3","AP75":"42.4","APL":"51.5","APM":"43.8","APS":"22.6","box AP":"39.6"},"uses_additional_data":false,"paper_date":"2018-11-29","paper":"/paper/grid-r-cnn","paper_url":"http://arxiv.org/abs/1811.12030v1","paper_title":"Grid R-CNN","code":"https://github.com/open-mmlab/mmdetection","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":188,"model":"Mask R-CNN (ResNet-50, ACNet)","metrics":{"box AP":"39.5"},"uses_additional_data":false,"paper_date":"2019-04-07","paper":"/paper/adaptively-connected-neural-networks","paper_url":"http://arxiv.org/abs/1904.03579v1","paper_title":"Adaptively Connected Neural Networks","code":"https://github.com/wanggrun/Adaptively-Connected-Neural-Networks","n_code_links":1,"syntology":null},{"rank_in_archive_order":189,"model":"FSAF (ResNet-101, anchor-based branches)","metrics":{"AP50":"59.2","box AP":"39.3"},"uses_additional_data":false,"paper_date":"2019-03-02","paper":"/paper/feature-selective-anchor-free-module-for","paper_url":"http://arxiv.org/abs/1903.00621v1","paper_title":"Feature Selective Anchor-Free Module for Single-Shot Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":8,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":190,"model":"Mask R-CNN (HRNetV2p-W18)","metrics":{"APL":"51.0","APM":"41.7","box AP":"39.2"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":191,"model":"Mask R-CNN (ResNet-50 + 1 NL)","metrics":{"AP50":"61.1","AP75":"41.9","box AP":"39.0"},"uses_additional_data":false,"paper_date":"2017-11-21","paper":"/paper/non-local-neural-networks","paper_url":"http://arxiv.org/abs/1711.07971v3","paper_title":"Non-local Neural Networks","code":"https://github.com/facebookresearch/detectron","n_code_links":32,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":192,"model":"FoveaBox (ResNet-101-FPN, 800x800)","metrics":{"AP50":"58.4","AP75":"41.5","APL":"51.7","APM":"43.5","APS":"22.3","box AP":"38.9"},"uses_additional_data":false,"paper_date":"2019-04-08","paper":"/paper/foveabox-beyond-anchor-based-object-detector","paper_url":"https://arxiv.org/abs/1904.03797v2","paper_title":"FoveaBox: Beyond Anchor-based Object Detector","code":"https://github.com/open-mmlab/mmdetection","n_code_links":7,"syntology":null},{"rank_in_archive_order":193,"model":"FCOS (ResNet-50-FPN + improvements)","metrics":{"AP50":"57.4","AP75":"41.4","APL":"49.8","APM":"42.5","APS":"22.3","box AP":"38.6 "},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/fcos-fully-convolutional-one-stage-object","paper_url":"https://arxiv.org/abs/1904.01355v5","paper_title":"FCOS: Fully Convolutional One-Stage Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":87,"syntology":{"n_ran":13,"n_unverified":27,"n_samples":40,"n_pointer_only_licence":18}},{"rank_in_archive_order":194,"model":"RPDet (ResNet-50)","metrics":{"box AP":"38.6"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/reppoints-point-set-representation-for-object","paper_url":"https://arxiv.org/abs/1904.11490v2","paper_title":"RepPoints: Point Set Representation for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":195,"model":"Libra R-CNN (ResNet-50 FPN)","metrics":{"AP50":"59.3","AP75":"42.0","APL":"50.5","APM":"42.1","APS":"22.9","box AP":"38.5"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/libra-r-cnn-towards-balanced-learning-for","paper_url":"http://arxiv.org/abs/1904.02701v1","paper_title":"Libra R-CNN: Towards Balanced Learning for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":null},{"rank_in_archive_order":196,"model":"Mask R-CNN (ResNet-50-FPN, GRoIE)","metrics":{"AP50":"59.9","AP75":"41.7","APL":"49.7","APM":"42.1","APS":"22.9","box AP":"38.4"},"uses_additional_data":false,"paper_date":"2020-04-28","paper":"/paper/a-novel-region-of-interest-extraction-layer","paper_url":"https://arxiv.org/abs/2004.13665v2","paper_title":"A novel Region of Interest Extraction Layer for Instance Segmentation","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":null},{"rank_in_archive_order":197,"model":"CornerNet511 (Hourglass-104)","metrics":{"AP50":"53.8","AP75":"40.9","APL":"51.8","APM":"40.5","APS":"18.6","box AP":"38.4"},"uses_additional_data":false,"paper_date":"2018-08-03","paper":"/paper/cornernet-detecting-objects-as-paired","paper_url":"http://arxiv.org/abs/1808.01244v2","paper_title":"CornerNet: Detecting Objects as Paired Keypoints","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":198,"model":"FoveaBox+Retina (ResNet-50)","metrics":{"AP50":"57.8","AP75":"40.5","box AP":"38.1"},"uses_additional_data":false,"paper_date":"2019-04-08","paper":"/paper/foveabox-beyond-anchor-based-object-detector","paper_url":"https://arxiv.org/abs/1904.03797v2","paper_title":"FoveaBox: Beyond Anchor-based Object Detector","code":"https://github.com/open-mmlab/mmdetection","n_code_links":7,"syntology":null},{"rank_in_archive_order":199,"model":"Faster R-CNN (HRNetV2p-W18)","metrics":{"AP50":"58.9","AP75":"41.5","APL":"49.6","APM":"40.8","APS":"22.6","box AP":"38.0"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":200,"model":"FoveaBox (ResNet-101-FPN, 600x600)","metrics":{"AP50":"57.8","AP75":"40.2","APL":"52.7","APM":"42.2","APS":"19.5","box AP":"38"},"uses_additional_data":false,"paper_date":"2019-04-08","paper":"/paper/foveabox-beyond-anchor-based-object-detector","paper_url":"https://arxiv.org/abs/1904.03797v2","paper_title":"FoveaBox: Beyond Anchor-based Object Detector","code":"https://github.com/open-mmlab/mmdetection","n_code_links":7,"syntology":null},{"rank_in_archive_order":201,"model":"FSAF (ResNet-101)","metrics":{"AP50":"58.0","box AP":"37.9"},"uses_additional_data":false,"paper_date":"2019-03-02","paper":"/paper/feature-selective-anchor-free-module-for","paper_url":"http://arxiv.org/abs/1903.00621v1","paper_title":"Feature Selective Anchor-Free Module for Single-Shot Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":8,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":202,"model":"Mask R-CNN (ResNet-50-FPN)","metrics":{"box AP":"37.7"},"uses_additional_data":false,"paper_date":"2017-03-20","paper":"/paper/mask-r-cnn","paper_url":"http://arxiv.org/abs/1703.06870v3","paper_title":"Mask R-CNN","code":"https://github.com/tensorflow/models/tree/master/official/vision","n_code_links":179,"syntology":{"n_ran":42,"n_unverified":98,"n_samples":140,"n_pointer_only_licence":23}},{"rank_in_archive_order":203,"model":"Faster R-CNN (ResNet-50-FPN, GRoIE)","metrics":{"AP50":"59.2","AP75":"40.6","APL":"47.8","APM":"41.5","APS":"22.3","box AP":"37.5"},"uses_additional_data":false,"paper_date":"2020-04-28","paper":"/paper/a-novel-region-of-interest-extraction-layer","paper_url":"https://arxiv.org/abs/2004.13665v2","paper_title":"A novel Region of Interest Extraction Layer for Instance Segmentation","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":null},{"rank_in_archive_order":204,"model":"Mask R-CNN (ResNeXt-101-FPN)","metrics":{"AP50":"59.5","AP75":"38.9","box AP":"36.7"},"uses_additional_data":false,"paper_date":"2017-03-20","paper":"/paper/mask-r-cnn","paper_url":"http://arxiv.org/abs/1703.06870v3","paper_title":"Mask R-CNN","code":"https://github.com/tensorflow/models/tree/master/official/vision","n_code_links":179,"syntology":{"n_ran":42,"n_unverified":98,"n_samples":140,"n_pointer_only_licence":23}},{"rank_in_archive_order":205,"model":"FoveaBox (ResNet-50-FPN, 600x600)","metrics":{"AP50":"55.2","AP75":"37.9","APL":"50.5","APM":"39.4","APS":"18.6","box AP":"36.0"},"uses_additional_data":false,"paper_date":"2019-04-08","paper":"/paper/foveabox-beyond-anchor-based-object-detector","paper_url":"https://arxiv.org/abs/1904.03797v2","paper_title":"FoveaBox: Beyond Anchor-based Object Detector","code":"https://github.com/open-mmlab/mmdetection","n_code_links":7,"syntology":null},{"rank_in_archive_order":206,"model":"FSAF (ResNet-50)","metrics":{"AP50":"55.0","AP75":"37.9","APL":"48.2","APM":"39.6","APS":"19.8","box AP":"35.9"},"uses_additional_data":false,"paper_date":"2019-03-02","paper":"/paper/feature-selective-anchor-free-module-for","paper_url":"http://arxiv.org/abs/1903.00621v1","paper_title":"Feature Selective Anchor-Free Module for Single-Shot Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":8,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":207,"model":"GHM-C + GHM-R (RetinaNet-FPN-ResNet-50, M=30)","metrics":{"AP50":"55.5","AP75":"38.1","APL":"46.7","APM":"39.6","APS":"19.6","box AP":"35.8"},"uses_additional_data":false,"paper_date":"2018-11-13","paper":"/paper/gradient-harmonized-single-stage-detector","paper_url":"http://arxiv.org/abs/1811.05181v1","paper_title":"Gradient Harmonized Single-stage Detector","code":"https://github.com/open-mmlab/mmdetection","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":208,"model":"Online Fg Bal. Sampling+Hard Negative Mining (ResNet-50)","metrics":{"AP50":"55.3","box AP":"35.6"},"uses_additional_data":false,"paper_date":"2019-09-21","paper":"/paper/190909777","paper_url":"https://arxiv.org/abs/1909.09777v3","paper_title":"Generating Positive Bounding Boxes for Balanced Training of Object Detectors","code":"https://github.com/kemaloksuz/BoundingBoxGenerator","n_code_links":1,"syntology":null},{"rank_in_archive_order":209,"model":"M2Det (ResNet-1o1, 320x320)","metrics":{"AP50":"53.7","APL":"49.3","APM":"39.5","APS":"15.9","box AP":"34.1"},"uses_additional_data":false,"paper_date":"2018-11-12","paper":"/paper/m2det-a-single-shot-object-detector-based-on","paper_url":"http://arxiv.org/abs/1811.04533v3","paper_title":"M2Det: A Single-Shot Object Detector based on Multi-Level Feature Pyramid Network","code":"https://github.com/LeeDongYeun/keras-m2det","n_code_links":11,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":210,"model":"Faster R-CNN (Res2Net-50)","metrics":{"AP50":"53.6","APL":"51.1","APM":"38.3","APS":"14","box AP":"33.7"},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/res2net-a-new-multi-scale-backbone","paper_url":"https://arxiv.org/abs/1904.01169v3","paper_title":"Res2Net: A New Multi-scale Backbone Architecture","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":34,"syntology":{"n_ran":3,"n_unverified":6,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":211,"model":"M2Det (VGG-16, 320x320)","metrics":{"AP50":"52.2","APL":"49.1","APM":"38.2","APS":"15","box AP":"33.2"},"uses_additional_data":false,"paper_date":"2018-11-12","paper":"/paper/m2det-a-single-shot-object-detector-based-on","paper_url":"http://arxiv.org/abs/1811.04533v3","paper_title":"M2Det: A Single-Shot Object Detector based on Multi-Level Feature Pyramid Network","code":"https://github.com/LeeDongYeun/keras-m2det","n_code_links":11,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":212,"model":"SOLQ (Swin-L, single scale)","metrics":{"AP50":"74.9","AP75":"61.3","APL":"71.9"},"uses_additional_data":false,"paper_date":"2021-06-04","paper":"/paper/solq-segmenting-objects-by-learning-queries","paper_url":"https://arxiv.org/abs/2106.02351v3","paper_title":"SOLQ: Segmenting Objects by Learning Queries","code":"https://github.com/megvii-research/SOLQ","n_code_links":1,"syntology":null},{"rank_in_archive_order":213,"model":"YOLOR-D6 (1280, single-scale, 31 fps)","metrics":{"AP50":"73.5","AP75":"60.6","APL":"68.7","APM":"60.1","APS":"40.4"},"uses_additional_data":false,"paper_date":"2021-05-10","paper":"/paper/you-only-learn-one-representation-unified","paper_url":"https://arxiv.org/abs/2105.04206v1","paper_title":"You Only Learn One Representation: Unified Network for Multiple Tasks","code":"https://github.com/WongKinYiu/yolor","n_code_links":9,"syntology":null},{"rank_in_archive_order":214,"model":"EfficientDet-D7x (single-scale)","metrics":{"AP50":"73.4","AP75":"59.0","APL":"67.9","APM":"58.0","APS":"40.0"},"uses_additional_data":false,"paper_date":"2019-11-20","paper":"/paper/efficientdet-scalable-and-efficient-object","paper_url":"https://arxiv.org/abs/1911.09070v7","paper_title":"EfficientDet: Scalable and Efficient Object Detection","code":"https://github.com/tensorflow/models/tree/master/research/object_detection","n_code_links":64,"syntology":{"n_ran":11,"n_unverified":59,"n_samples":70,"n_pointer_only_licence":3}},{"rank_in_archive_order":215,"model":"YOLOR-P6 (1280, single-scale, 72 fps)","metrics":{"AP50":"70.6","AP75":"57.4","APL":"65.2","APM":"57.3","APS":"37.4"},"uses_additional_data":false,"paper_date":"2021-05-10","paper":"/paper/you-only-learn-one-representation-unified","paper_url":"https://arxiv.org/abs/2105.04206v1","paper_title":"You Only Learn One Representation: Unified Network for Multiple Tasks","code":"https://github.com/WongKinYiu/yolor","n_code_links":9,"syntology":null},{"rank_in_archive_order":216,"model":"FocalNet-T (SRF, Cascade Mask R-CNN)","metrics":{"AP50":"70.1","AP75":"55.8"},"uses_additional_data":false,"paper_date":"2022-03-22","paper":"/paper/focal-modulation-networks","paper_url":"https://arxiv.org/abs/2203.11926v3","paper_title":"Focal Modulation Networks","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":217,"model":"R3-CNN (ResNet-50-FPN, GRoIE)","metrics":{"AP50":"61.2","AP75":"45.6","APS":"24.4"},"uses_additional_data":false,"paper_date":"2021-04-03","paper":"/paper/recursively-refined-r-cnn-instance","paper_url":"https://arxiv.org/abs/2104.01329v2","paper_title":"Recursively Refined R-CNN: Instance Segmentation with Self-RoI Rebalancing","code":"https://github.com/IMPLabUniPr/mmdetection","n_code_links":1,"syntology":null},{"rank_in_archive_order":218,"model":"Mask R-CNN (HRNetV2p-W32, cascade)","metrics":{"APM":"47.9","APS":"26.1"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":219,"model":"Shift-T","metrics":{"APM":"42.3"},"uses_additional_data":false,"paper_date":"2022-01-26","paper":"/paper/when-shift-operation-meets-vision-transformer","paper_url":"https://arxiv.org/abs/2201.10801v1","paper_title":"When Shift Operation Meets Vision Transformer: An Extremely Simple Alternative to Attention Mechanism","code":"https://github.com/keras-team/keras-io/blob/master/examples/vision/shiftvit.py","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":220,"model":"DyHead (ResNeXt-64x4d-101-DCN, multi scale)","metrics":{"APL":"66.3"},"uses_additional_data":false,"paper_date":"2021-06-15","paper":"/paper/dynamic-head-unifying-object-detection-heads","paper_url":"https://arxiv.org/abs/2106.08322v1","paper_title":"Dynamic Head: Unifying Object Detection Heads with Attentions","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,264 of the 9,581 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9581,"papers_checked":6264,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":3316},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":147,"rows_with_any_sample_ran":132,"distinct_papers_with_graph_line":66,"distinct_papers_with_any_sample_ran":58,"samples_over_distinct_papers":{"n_ran":785,"n_unverified":893,"n_samples":1678,"n_pointer_only_licence":496,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":1901,"n_unverified":2350,"n_samples":4251,"n_pointer_only_licence":1429,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}