{"url":"/sota/object-detection-on-coco","task":{"name":"Object Detection","url":"/task/object-detection","note":null},"dataset":{"name":"COCO test-dev","url":"/dataset/coco"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":null,"description_from":null,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["box mAP","AP50","AP75","APS","APM","APL","Hardware Burden","Params (M)","Operations per network pass","GFLOPs"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"box mAP":"higher","AP50":null,"AP75":null,"APS":null,"APM":null,"APL":null,"Hardware Burden":null,"Params (M)":"lower","Operations per network pass":null,"GFLOPs":null}},"counts":{"rows":225,"rows_with_code":220,"rows_with_paper_page":225,"rows_dated":225,"rows_using_additional_data":13},"rows":[{"rank_in_archive_order":1,"model":"Co-DETR","metrics":{"Params (M)":"304","box mAP":"66.0"},"uses_additional_data":false,"paper_date":"2022-11-22","paper":"/paper/detrs-with-collaborative-hybrid-assignments","paper_url":"https://arxiv.org/abs/2211.12860v5","paper_title":"DETRs with Collaborative Hybrid Assignments Training","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"InternImage-H (M3I Pre-training)","metrics":{"Params (M)":"2180","box mAP":"65.5"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"M3I Pre-training (InternImage-H)","metrics":{"box mAP":"65.4"},"uses_additional_data":false,"paper_date":"2022-11-17","paper":"/paper/towards-all-in-one-pre-training-via","paper_url":"https://arxiv.org/abs/2211.09807v2","paper_title":"Towards All-in-one Pre-training via Maximizing Multi-modal Mutual Information","code":"https://github.com/OpenGVLab/M3I-Pretraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":4,"model":"MoCaE","metrics":{"box mAP":"65.1"},"uses_additional_data":false,"paper_date":"2023-09-26","paper":"/paper/mocae-mixture-of-calibrated-experts","paper_url":"https://arxiv.org/abs/2309.14976v4","paper_title":"MoCaE: Mixture of Calibrated Experts Significantly Improves Object Detection","code":"https://github.com/fiveai/MoCaE","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":5,"model":"Focal-Stable-DINO (Focal-Huge, no TTA)","metrics":{"AP50":"81.7","AP75":"71.5","APL":"78","APM":"67.6","APS":"48.6","Params (M)":"689","box mAP":"64.8"},"uses_additional_data":false,"paper_date":"2023-04-25","paper":"/paper/a-strong-and-reproducible-object-detector","paper_url":"https://arxiv.org/abs/2304.13027v1","paper_title":"A Strong and Reproducible Object Detector with Only Public Datasets","code":"https://github.com/microsoft/FocalNet","n_code_links":3,"syntology":null},{"rank_in_archive_order":6,"model":"Co-DETR (Swin-L)","metrics":{"Params (M)":"218","box mAP":"64.8"},"uses_additional_data":false,"paper_date":"2022-11-22","paper":"/paper/detrs-with-collaborative-hybrid-assignments","paper_url":"https://arxiv.org/abs/2211.12860v5","paper_title":"DETRs with Collaborative Hybrid Assignments Training","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"EVA","metrics":{"AP50":"81.9","AP75":"71.7","APL":"77.9","APM":"67.7","APS":"48.5","box mAP":"64.7"},"uses_additional_data":false,"paper_date":"2022-11-14","paper":"/paper/eva-exploring-the-limits-of-masked-visual","paper_url":"https://arxiv.org/abs/2211.07636v2","paper_title":"EVA: Exploring the Limits of Masked Visual Representation Learning at Scale","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"Group DETR v2","metrics":{"AP50":"81.8","AP75":"71.1","APL":"77.1","APM":"67.2","APS":"48.4","box mAP":"64.5"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/group-detr-v2-strong-object-detector-with-1","paper_url":"https://arxiv.org/abs/2211.03594v1","paper_title":"Group DETR v2: Strong Object Detector with Encoder-Decoder Pretraining","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":9,"model":"FocalNet-H (DINO)","metrics":{"box mAP":"64.4"},"uses_additional_data":false,"paper_date":"2022-03-22","paper":"/paper/focal-modulation-networks","paper_url":"https://arxiv.org/abs/2203.11926v3","paper_title":"Focal Modulation Networks","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"InternImage-XL","metrics":{"Params (M)":"602","box mAP":"64.3"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"FD-SwinV2-G","metrics":{"box mAP":"64.2"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/contrastive-learning-rivals-masked-image","paper_url":"https://arxiv.org/abs/2205.14141v3","paper_title":"Contrastive Learning Rivals Masked Image Modeling in Fine-tuning via Feature Distillation","code":"https://github.com/SwinTransformer/Feature-Distillation","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":12,"model":"Plain-DETR (Swin-L)","metrics":{"AP50":"82.1","AP75":"70.7","APL":"76.7","APM":"66.8","APS":"48.2","Params (M)":"228","box mAP":"63.9"},"uses_additional_data":false,"paper_date":"2023-01-01","paper":"/paper/detr-does-not-need-multi-scale-or-locality","paper_url":"http://openaccess.thecvf.com//content/ICCV2023/html/Lin_DETR_Does_Not_Need_Multi-Scale_or_Locality_Design_ICCV_2023_paper.html","paper_title":"DETR Does Not Need Multi-Scale or Locality Design","code":"https://github.com/impiga/plain-detr","n_code_links":1,"syntology":null},{"rank_in_archive_order":13,"model":"RevCol-H(DINO)","metrics":{"box mAP":"63.8"},"uses_additional_data":false,"paper_date":"2022-12-22","paper":"/paper/reversible-column-networks","paper_url":"https://arxiv.org/abs/2212.11696v3","paper_title":"Reversible Column Networks","code":"https://github.com/megvii-research/revcol","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":3,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":14,"model":"BEiT-3","metrics":{"box mAP":"63.7"},"uses_additional_data":false,"paper_date":"2022-08-22","paper":"/paper/image-as-a-foreign-language-beit-pretraining","paper_url":"https://arxiv.org/abs/2208.10442v2","paper_title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","code":"https://github.com/microsoft/unilm/tree/master/beit","n_code_links":2,"syntology":null},{"rank_in_archive_order":15,"model":"Relation-DETR (Focal-L)","metrics":{"AP50":"80.8","AP75":"69.1","APL":"77.0","APM":"66.9","APS":"47.2","Params (M)":"214","box mAP":"63.5"},"uses_additional_data":false,"paper_date":"2024-07-16","paper":"/paper/relation-detr-exploring-explicit-position","paper_url":"https://arxiv.org/abs/2407.11699v1","paper_title":"Relation DETR: Exploring Explicit Position Relation Prior for Object Detection","code":"https://github.com/xiuqhou/relation-detr","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":16,"model":"DETA (Swin-L)","metrics":{"AP50":"80.4","AP75":"70.2","APL":"76.9","APM":"66.9","APS":"46.1","box mAP":"63.5"},"uses_additional_data":false,"paper_date":"2022-12-12","paper":"/paper/nms-strikes-back","paper_url":"https://arxiv.org/abs/2212.06137v1","paper_title":"NMS Strikes Back","code":"https://github.com/jozhang97/deta","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"DINO (Swin-L,multi-scale, TTA)","metrics":{"box mAP":"63.3"},"uses_additional_data":false,"paper_date":"2022-03-07","paper":"/paper/dino-detr-with-improved-denoising-anchor-1","paper_url":"https://arxiv.org/abs/2203.03605v4","paper_title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","code":"https://github.com/IDEA-Research/Grounded-Segment-Anything","n_code_links":16,"syntology":{"n_ran":7,"n_unverified":8,"n_samples":15,"n_pointer_only_licence":5}},{"rank_in_archive_order":18,"model":"SwinV2-G (HTC++)","metrics":{"Params (M)":"3000","box mAP":"63.1"},"uses_additional_data":false,"paper_date":"2021-11-18","paper":"/paper/swin-transformer-v2-scaling-up-capacity-and","paper_url":"https://arxiv.org/abs/2111.09883v2","paper_title":"Swin Transformer V2: Scaling Up Capacity and Resolution","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":23,"syntology":{"n_ran":3,"n_unverified":27,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"Grounding DINO","metrics":{"box mAP":"63.0"},"uses_additional_data":false,"paper_date":"2023-03-09","paper":"/paper/grounding-dino-marrying-dino-with-grounded","paper_url":"https://arxiv.org/abs/2303.05499v5","paper_title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","code":"https://github.com/huggingface/transformers","n_code_links":10,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":20,"model":"Florence-CoSwin-H","metrics":{"box mAP":"62.4"},"uses_additional_data":false,"paper_date":"2021-11-22","paper":"/paper/florence-a-new-foundation-model-for-computer","paper_url":"https://arxiv.org/abs/2111.11432v1","paper_title":"Florence: A New Foundation Model for Computer Vision","code":"https://github.com/microsoft/unicl","n_code_links":2,"syntology":null},{"rank_in_archive_order":21,"model":"GLIPv2 (CoSwin-H, multi-scale)","metrics":{"box mAP":"62.4"},"uses_additional_data":false,"paper_date":"2022-06-12","paper":"/paper/glipv2-unifying-localization-and-vision","paper_url":"https://arxiv.org/abs/2206.05836v2","paper_title":"GLIPv2: Unifying Localization and Vision-Language Understanding","code":"https://github.com/microsoft/GLIP","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":22,"model":"GLEE-Pro","metrics":{"box mAP":"62.3"},"uses_additional_data":false,"paper_date":"2023-12-14","paper":"/paper/general-object-foundation-model-for-images","paper_url":"https://arxiv.org/abs/2312.09158v1","paper_title":"General Object Foundation Model for Images and Videos at Scale","code":"https://github.com/FoundationVision/GLEE","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":23,"model":"GLIP (Swin-L, multi-scale)","metrics":{"AP50":"79.5","AP75":"67.7","APL":"75.0","APM":"64.9","APS":"45.3","box mAP":"61.5"},"uses_additional_data":false,"paper_date":"2021-12-07","paper":"/paper/grounded-language-image-pre-training","paper_url":"https://arxiv.org/abs/2112.03857v2","paper_title":"Grounded Language-Image Pre-training","code":"https://github.com/microsoft/GLIP","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":24,"model":"Soft Teacher + Swin-L (HTC++, multi-scale)","metrics":{"box mAP":"61.3"},"uses_additional_data":false,"paper_date":"2021-06-16","paper":"/paper/end-to-end-semi-supervised-object-detection","paper_url":"https://arxiv.org/abs/2106.09018v3","paper_title":"End-to-End Semi-Supervised Object Detection with Soft Teacher","code":"https://github.com/microsoft/SoftTeacher","n_code_links":8,"syntology":null},{"rank_in_archive_order":25,"model":"ViT-Adapter-L (HTC++, BEiTv2 pretrain, multi-scale)","metrics":{"box mAP":"60.9"},"uses_additional_data":false,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":26,"model":"DyHead (Swin-L, multi scale, self-training)","metrics":{"AP50":"78.5","AP75":"66.6","APL":"74.2","APM":"64.0","box mAP":"60.6"},"uses_additional_data":false,"paper_date":"2021-06-15","paper":"/paper/dynamic-head-unifying-object-detection-heads","paper_url":"https://arxiv.org/abs/2106.08322v1","paper_title":"Dynamic Head: Unifying Object Detection Heads with Attentions","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":27,"model":"GLEE-Plus","metrics":{"box mAP":"60.6"},"uses_additional_data":false,"paper_date":"2023-12-14","paper":"/paper/general-object-foundation-model-for-images","paper_url":"https://arxiv.org/abs/2312.09158v1","paper_title":"General Object Foundation Model for Images and Videos at Scale","code":"https://github.com/FoundationVision/GLEE","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":28,"model":"ViT-Adapter-L (HTC++, BEiT pretrain, multi-scale)","metrics":{"box mAP":"60.4"},"uses_additional_data":false,"paper_date":"2022-05-17","paper":"/paper/vision-transformer-adapter-for-dense","paper_url":"https://arxiv.org/abs/2205.08534v4","paper_title":"Vision Transformer Adapter for Dense Predictions","code":"https://github.com/czczup/vit-adapter","n_code_links":2,"syntology":null},{"rank_in_archive_order":29,"model":"GRiT (ViT-H, single-scale testing)","metrics":{"box mAP":"60.4"},"uses_additional_data":false,"paper_date":"2022-12-01","paper":"/paper/grit-a-generative-region-to-text-transformer","paper_url":"https://arxiv.org/abs/2212.00280v1","paper_title":"GRiT: A Generative Region-to-text Transformer for Object Understanding","code":"https://github.com/JialianW/GRiT","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":3,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":30,"model":"CBNetV2 (Dual-Swin-L HTC, multi-scale)","metrics":{"box mAP":"60.1"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/cbnetv2-a-composite-backbone-network","paper_url":"https://arxiv.org/abs/2107.00420v7","paper_title":"CBNet: A Composite Backbone Network Architecture for Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":31,"model":"PIIP-H6B (DINO)","metrics":{"AP50":"79.0","AP75":"65.4","box mAP":"60.0"},"uses_additional_data":false,"paper_date":"2024-06-06","paper":"/paper/parameter-inverted-image-pyramid-networks","paper_url":"https://arxiv.org/abs/2406.04330v2","paper_title":"Parameter-Inverted Image Pyramid Networks","code":"https://github.com/opengvlab/piip","n_code_links":1,"syntology":null},{"rank_in_archive_order":32,"model":"CBNetV2 (Dual-Swin-L HTC, single-scale)","metrics":{"box mAP":"59.4"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/cbnetv2-a-composite-backbone-network","paper_url":"https://arxiv.org/abs/2107.00420v7","paper_title":"CBNet: A Composite Backbone Network Architecture for Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":33,"model":"Focal-L (DyHead, multi-scale)","metrics":{"box mAP":"58.9"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/focal-self-attention-for-local-global","paper_url":"https://arxiv.org/abs/2107.00641v1","paper_title":"Focal Self-attention for Local-Global Interactions in Vision Transformers","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification/Focal_Transformer","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":34,"model":"DyHead (Swin-L, multi scale)","metrics":{"AP50":"77.1","AP75":"64.5","APL":"72.8","APM":"62.0","box mAP":"58.7"},"uses_additional_data":false,"paper_date":"2021-06-15","paper":"/paper/dynamic-head-unifying-object-detection-heads","paper_url":"https://arxiv.org/abs/2106.08322v1","paper_title":"Dynamic Head: Unifying Object Detection Heads with Attentions","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":35,"model":"Swin-L (HTC++, multi scale)","metrics":{"box mAP":"58.7"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":36,"model":"Swin-L (HTC++, single scale)","metrics":{"box mAP":"57.7"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":37,"model":"Cascade Eff-B7 NAS-FPN (1280, self-training Copy Paste, single-scale)","metrics":{"box mAP":"57.3"},"uses_additional_data":false,"paper_date":"2020-12-13","paper":"/paper/simple-copy-paste-is-a-strong-data","paper_url":"https://arxiv.org/abs/2012.07177v2","paper_title":"Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation","code":"https://github.com/PaddlePaddle/PaddleOCR","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":38,"model":"PyCenterNet (Swin-L, multi-scale)","metrics":{"AP50":"73.7","AP75":"62.4","APL":"71.3","APM":"59.2","APS":"38.7","box mAP":"57.1"},"uses_additional_data":false,"paper_date":"2022-04-18","paper":"/paper/centernet-for-object-detection","paper_url":"https://arxiv.org/abs/2204.08394v1","paper_title":"CenterNet++ for Object Detection","code":"https://github.com/Duankaiwen/PyCenterNet","n_code_links":3,"syntology":null},{"rank_in_archive_order":39,"model":"dBOT ViT-L (CLIP)","metrics":{"box mAP":"56.8"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":40,"model":"YOLOv7-D6 (44 fps)","metrics":{"box mAP":"56.6"},"uses_additional_data":true,"paper_date":"2022-07-06","paper":"/paper/yolov7-trainable-bag-of-freebies-sets-new","paper_url":"https://arxiv.org/abs/2207.02696v1","paper_title":"YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors","code":"https://github.com/pjreddie/darknet","n_code_links":21,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":41,"model":"SOLQ (Swin-L, single scale)","metrics":{"AP50":"74.6","AP75":"60.5","APL":"70.6","APM":"60","APS":"37.6","box mAP":"56.5"},"uses_additional_data":false,"paper_date":"2021-06-04","paper":"/paper/solq-segmenting-objects-by-learning-queries","paper_url":"https://arxiv.org/abs/2106.02351v3","paper_title":"SOLQ: Segmenting Objects by Learning Queries","code":"https://github.com/megvii-research/SOLQ","n_code_links":1,"syntology":null},{"rank_in_archive_order":42,"model":"CenterNet2 (Res2Net-101-DCN-BiFPN, self-training, 1560 single-scale)","metrics":{"AP50":"74.0","AP75":"61.6","APL":"68.6","APM":"59.7","APS":"38.7","box mAP":"56.4"},"uses_additional_data":false,"paper_date":"2021-03-12","paper":"/paper/probabilistic-two-stage-detection","paper_url":"https://arxiv.org/abs/2103.07461v1","paper_title":"Probabilistic two-stage detection","code":"https://github.com/xingyizhou/CenterNet2","n_code_links":3,"syntology":null},{"rank_in_archive_order":43,"model":"ISTR (ResNet50-FPN-3x, single-scale)","metrics":{"APL":"59.9","APM":"48.7","APS":"27.8","box mAP":"56.4"},"uses_additional_data":false,"paper_date":"2021-05-03","paper":"/paper/istr-end-to-end-instance-segmentation-with","paper_url":"https://arxiv.org/abs/2105.00637v2","paper_title":"ISTR: End-to-End Instance Segmentation with Transformers","code":"https://github.com/hujiecpp/ISTR","n_code_links":1,"syntology":null},{"rank_in_archive_order":44,"model":"QueryInst (single-scale)","metrics":{"AP50":"75.9","AP75":"61.9","APL":"70.3","APM":"58.9","APS":"37.4","Hardware Burden":"17G","box mAP":"56.1"},"uses_additional_data":false,"paper_date":"2021-05-05","paper":"/paper/queryinst-parallelly-supervised-mask-query","paper_url":"https://arxiv.org/abs/2105.01928v3","paper_title":"Instances as Queries","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":45,"model":"dBOT ViT-L","metrics":{"box mAP":"56.1"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":46,"model":"YOLOv7-E6 (56 fps)","metrics":{"box mAP":"56"},"uses_additional_data":false,"paper_date":"2022-07-06","paper":"/paper/yolov7-trainable-bag-of-freebies-sets-new","paper_url":"https://arxiv.org/abs/2207.02696v1","paper_title":"YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors","code":"https://github.com/pjreddie/darknet","n_code_links":21,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":47,"model":"YOLOv4-P7 with TTA","metrics":{"AP50":"73.2","AP75":"61.2","box mAP":"55.8"},"uses_additional_data":false,"paper_date":"2020-11-16","paper":"/paper/scaled-yolov4-scaling-cross-stage-partial","paper_url":"https://arxiv.org/abs/2011.08036v2","paper_title":"Scaled-YOLOv4: Scaling Cross Stage Partial Network","code":"https://github.com/AlexeyAB/darknet","n_code_links":41,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":48,"model":"DetectoRS (ResNeXt-101-64x4d, multi-scale)","metrics":{"AP50":"74.2","AP75":"61.1","APL":"68.1","APM":"58.4","APS":"37.7","box mAP":"55.7"},"uses_additional_data":false,"paper_date":"2020-06-03","paper":"/paper/detectors-detecting-objects-with-recursive-1","paper_url":"https://arxiv.org/abs/2006.02334v2","paper_title":"DetectoRS: Detecting Objects with Recursive Feature Pyramid and Switchable Atrous Convolution","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":49,"model":"YOLOR-D6 (1280, single-scale, 30 fps)","metrics":{"AP50":"73.3","AP75":"60.6","box mAP":"55.4"},"uses_additional_data":false,"paper_date":"2021-05-10","paper":"/paper/you-only-learn-one-representation-unified","paper_url":"https://arxiv.org/abs/2105.04206v1","paper_title":"You Only Learn One Representation: Unified Network for Multiple Tasks","code":"https://github.com/WongKinYiu/yolor","n_code_links":9,"syntology":null},{"rank_in_archive_order":50,"model":"YOLOv4-P6 with TTA","metrics":{"AP50":"72.6","AP75":"60.2","box mAP":"54.9"},"uses_additional_data":false,"paper_date":"2020-11-16","paper":"/paper/scaled-yolov4-scaling-cross-stage-partial","paper_url":"https://arxiv.org/abs/2011.08036v2","paper_title":"Scaled-YOLOv4: Scaling Cross Stage Partial Network","code":"https://github.com/AlexeyAB/darknet","n_code_links":41,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":51,"model":"YOLOv7-W6 (84 fps)","metrics":{"box mAP":"54.9"},"uses_additional_data":false,"paper_date":"2022-07-06","paper":"/paper/yolov7-trainable-bag-of-freebies-sets-new","paper_url":"https://arxiv.org/abs/2207.02696v1","paper_title":"YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors","code":"https://github.com/pjreddie/darknet","n_code_links":21,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":52,"model":"Cascade Eff-B7 NAS-FPN (1280)","metrics":{"box mAP":"54.8"},"uses_additional_data":false,"paper_date":"2020-12-13","paper":"/paper/simple-copy-paste-is-a-strong-data","paper_url":"https://arxiv.org/abs/2012.07177v2","paper_title":"Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation","code":"https://github.com/PaddlePaddle/PaddleOCR","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":53,"model":"DetectoRS (ResNeXt-101-32x4d, multi-scale)","metrics":{"AP50":"73.5","AP75":"60.1","APL":"66.4","APM":"57.3","APS":"37.4","box mAP":"54.7"},"uses_additional_data":false,"paper_date":"2020-06-03","paper":"/paper/detectors-detecting-objects-with-recursive-1","paper_url":"https://arxiv.org/abs/2006.02334v2","paper_title":"DetectoRS: Detecting Objects with Recursive Feature Pyramid and Switchable Atrous Convolution","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":54,"model":"GLEE-Lite","metrics":{"box mAP":"54.7"},"uses_additional_data":false,"paper_date":"2023-12-14","paper":"/paper/general-object-foundation-model-for-images","paper_url":"https://arxiv.org/abs/2312.09158v1","paper_title":"General Object Foundation Model for Images and Videos at Scale","code":"https://github.com/FoundationVision/GLEE","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":55,"model":"YOLOv4-P6 CSP-P6 (single-scale, 32 fps)","metrics":{"AP50":"72.3","AP75":"59.5","APL":"65.5","APM":"58.2","APS":"36.6","box mAP":"54.3"},"uses_additional_data":false,"paper_date":"2020-11-16","paper":"/paper/scaled-yolov4-scaling-cross-stage-partial","paper_url":"https://arxiv.org/abs/2011.08036v2","paper_title":"Scaled-YOLOv4: Scaling Cross Stage Partial Network","code":"https://github.com/AlexeyAB/darknet","n_code_links":41,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":56,"model":"SpineNet-190 (1280, with Self-training on OpenImages, single-scale)","metrics":{"box mAP":"54.3"},"uses_additional_data":false,"paper_date":"2020-06-11","paper":"/paper/rethinking-pre-training-and-self-training","paper_url":"https://arxiv.org/abs/2006.06882v2","paper_title":"Rethinking Pre-training and Self-training","code":"https://github.com/tensorflow/tpu/tree/master/models/official/detection/projects/self_training","n_code_links":2,"syntology":null},{"rank_in_archive_order":57,"model":"UniverseNet-20.08d (Res2Net-101, DCN, multi-scale)","metrics":{"AP50":"71.6","AP75":"59.9","APL":"67.4","APM":"57.2","APS":"35.8","box mAP":"54.1"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/usb-universal-scale-object-detection","paper_url":"https://arxiv.org/abs/2103.14027v3","paper_title":"USB: Universal-Scale Object Detection Benchmark","code":"https://github.com/shinya7y/UniverseNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":58,"model":"DyHead (ResNeXt-64x4d-101-DCN, multi scale)","metrics":{"AP50":"72.1","AP75":"59.3","box mAP":"54"},"uses_additional_data":false,"paper_date":"2021-06-15","paper":"/paper/dynamic-head-unifying-object-detection-heads","paper_url":"https://arxiv.org/abs/2106.08322v1","paper_title":"Dynamic Head: Unifying Object Detection Heads with Attentions","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":59,"model":"dBOT ViT-B (CLIP)","metrics":{"box mAP":"53.6"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":60,"model":"PAA (ResNext-152-32x8d + DCN, multi-scale)","metrics":{"AP50":"71.6","AP75":"59.1","APL":"66.9","APM":"56.3","APS":"36.0","box mAP":"53.5"},"uses_additional_data":false,"paper_date":"2020-07-16","paper":"/paper/probabilistic-anchor-assignment-with-iou","paper_url":"https://arxiv.org/abs/2007.08103v2","paper_title":"Probabilistic Anchor Assignment with IoU Prediction for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":null},{"rank_in_archive_order":61,"model":"LSNet (Res2Net-101+ DCN, multi-scale)","metrics":{"AP50":"71.1","AP75":"59.2","APL":"65.8","APM":"56.4","APS":"35.2","box mAP":"53.5"},"uses_additional_data":false,"paper_date":"2021-04-11","paper":"/paper/location-sensitive-visual-recognition-with","paper_url":"https://arxiv.org/abs/2104.04899v1","paper_title":"Location-Sensitive Visual Recognition with Cross-IOU Loss","code":"https://github.com/Duankaiwen/LSNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":62,"model":"dBOT ViT-B","metrics":{"box mAP":"53.5"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":63,"model":"ResNeSt-200 (multi-scale)","metrics":{"AP50":"72.0","AP75":"58.0","APL":"66.8","APM":"56.2","APS":"35.1","box mAP":"53.3"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":64,"model":"Cascade Mask R-CNN (Triple-ResNeXt152, multi-scale)","metrics":{"AP50":"71.9","AP75":"58.5 ","APL":" 66.7","APM":" 55.8","APS":"35.5","box mAP":"53.3"},"uses_additional_data":false,"paper_date":"2019-09-09","paper":"/paper/cbnet-a-novel-composite-backbone-network","paper_url":"https://arxiv.org/abs/1909.03625v1","paper_title":"CBNet: A Novel Composite Backbone Network Architecture for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":1}},{"rank_in_archive_order":65,"model":"DetectoRS (ResNeXt-101-32x4d, single-scale)","metrics":{"AP50":"71.6","AP75":"58.5","APL":"66.9","APM":"56.5","APS":"33.9","box mAP":"53.3"},"uses_additional_data":false,"paper_date":"2020-06-03","paper":"/paper/detectors-detecting-objects-with-recursive-1","paper_url":"https://arxiv.org/abs/2006.02334v2","paper_title":"DetectoRS: Detecting Objects with Recursive Feature Pyramid and Switchable Atrous Convolution","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":66,"model":"GFLV2 (Res2Net-101, DCN, multiscale)","metrics":{"AP50":"70.9","AP75":"59.2","APL":"65.6","APM":"56.1","APS":"35.7","box mAP":"53.3"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/generalized-focal-loss-v2-learning-reliable","paper_url":"https://arxiv.org/abs/2011.12885v1","paper_title":"Generalized Focal Loss V2: Learning Reliable Localization Quality Estimation for Dense Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":5,"syntology":null},{"rank_in_archive_order":67,"model":"YOLOv7-X (114 fps)","metrics":{"box mAP":"53.1"},"uses_additional_data":true,"paper_date":"2022-07-06","paper":"/paper/yolov7-trainable-bag-of-freebies-sets-new","paper_url":"https://arxiv.org/abs/2207.02696v1","paper_title":"YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors","code":"https://github.com/pjreddie/darknet","n_code_links":21,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":68,"model":"RelationNet++ (ResNeXt-64x4d-101-DCN)","metrics":{"box mAP":"52.7"},"uses_additional_data":false,"paper_date":"2020-10-29","paper":"/paper/relationnet-bridging-visual-representations","paper_url":"https://arxiv.org/abs/2010.15831v1","paper_title":"RelationNet++: Bridging Visual Representations for Object Detection via Transformer Decoder","code":"https://github.com/shinya7y/UniverseNet","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":69,"model":"EfficientDet-D7 (1536)","metrics":{"AP50":"71.6","AP75":"56.9","box mAP":"52.6"},"uses_additional_data":true,"paper_date":"2019-11-20","paper":"/paper/efficientdet-scalable-and-efficient-object","paper_url":"https://arxiv.org/abs/1911.09070v7","paper_title":"EfficientDet: Scalable and Efficient Object Detection","code":"https://github.com/tensorflow/models/tree/master/research/object_detection","n_code_links":64,"syntology":{"n_ran":11,"n_unverified":59,"n_samples":70,"n_pointer_only_licence":3}},{"rank_in_archive_order":70,"model":"YOLOv4-P5 with TTA","metrics":{"AP50":"70.3","AP75":"58","box mAP":"52.5"},"uses_additional_data":false,"paper_date":"2020-11-16","paper":"/paper/scaled-yolov4-scaling-cross-stage-partial","paper_url":"https://arxiv.org/abs/2011.08036v2","paper_title":"Scaled-YOLOv4: Scaling Cross Stage Partial Network","code":"https://github.com/AlexeyAB/darknet","n_code_links":41,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":71,"model":"Deformable DETR (ResNeXt-101+DCN)","metrics":{"AP50":"71.9","AP75":"58.1","APL":"65.6","APM":"54.4","APS":"34.4","Hardware Burden":"17G","Operations per network pass":"17.3G","box mAP":"52.3"},"uses_additional_data":false,"paper_date":"2020-10-08","paper":"/paper/deformable-detr-deformable-transformers-for-1","paper_url":"https://arxiv.org/abs/2010.04159v4","paper_title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":20,"syntology":{"n_ran":29,"n_unverified":26,"n_samples":55,"n_pointer_only_licence":21}},{"rank_in_archive_order":72,"model":"GCNet (ResNeXt-101 + DCN + cascade + GC r4)","metrics":{"AP50":"70.9","AP75":"56.9","box mAP":"52.3"},"uses_additional_data":false,"paper_date":"2020-12-24","paper":"/paper/global-context-networks","paper_url":"https://arxiv.org/abs/2012.13375v1","paper_title":"Global Context Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":null},{"rank_in_archive_order":73,"model":"PP-YOLOE-x(CSPRepResNet-x, 640x640, single-scale )","metrics":{"AP50":"69.9","AP75":"56.5","APL":"66.4","APM":"56.3","APS":"33.3","box mAP":"52.2"},"uses_additional_data":false,"paper_date":"2022-03-30","paper":"/paper/pp-yoloe-an-evolved-version-of-yolo","paper_url":"https://arxiv.org/abs/2203.16250v3","paper_title":"PP-YOLOE: An evolved version of YOLO","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":8,"syntology":{"n_ran":5,"n_unverified":22,"n_samples":27,"n_pointer_only_licence":0}},{"rank_in_archive_order":74,"model":"RetinaNet (SpineNet-190, 1280x1280)","metrics":{"AP50":"71.8","AP75":"56.5","APL":"63.6","APM":"55","APS":"35.4","box mAP":"52.1"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/spinenet-learning-scale-permuted-backbone-for","paper_url":"https://arxiv.org/abs/1912.05027v3","paper_title":"SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/modeling/backbones","n_code_links":13,"syntology":null},{"rank_in_archive_order":75,"model":"RepPoints v2 (ResNeXt-101, DCN, multi-scale)","metrics":{"AP50":"70.1","AP75":"57.5","APL":"63.6","APM":"54.6","APS":"34.5","box mAP":"52.1"},"uses_additional_data":false,"paper_date":"2020-07-16","paper":"/paper/reppoints-v2-verification-meets-regression","paper_url":"https://arxiv.org/abs/2007.08508v1","paper_title":"RepPoints V2: Verification Meets Regression for Object Detection","code":"https://github.com/Scalsol/RepPointsV2","n_code_links":1,"syntology":null},{"rank_in_archive_order":76,"model":"AC-FPN Cascade R-CNN (X-152-32x8d-FPN-IN5k, multi scale, only CEM)","metrics":{"AP50":"70.4","AP75":"57","APL":"64.7","APM":"54.8","APS":"34.2","box mAP":"51.9"},"uses_additional_data":false,"paper_date":"2020-05-23","paper":"/paper/attention-guided-context-feature-pyramid","paper_url":"https://arxiv.org/abs/2005.11475v1","paper_title":"Attention-guided Context Feature Pyramid Network for Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":2,"syntology":null},{"rank_in_archive_order":77,"model":"OTA (ResNeXt-101+DCN, multiscale)","metrics":{"AP50":"68.6","AP75":"57.1","APL":"64.1","APM":"53.7","APS":"34.1","box mAP":"51.5"},"uses_additional_data":false,"paper_date":"2021-03-26","paper":"/paper/ota-optimal-transport-assignment-for-object","paper_url":"https://arxiv.org/abs/2103.14259v1","paper_title":"OTA: Optimal Transport Assignment for Object Detection","code":"https://github.com/Megvii-BaseDetection/OTA","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":78,"model":"YOLOX-x(Modified CSP v5, 640x640, single-scale)","metrics":{"box mAP":"51.5"},"uses_additional_data":true,"paper_date":"2021-07-18","paper":"/paper/yolox-exceeding-yolo-series-in-2021","paper_url":"https://arxiv.org/abs/2107.08430v2","paper_title":"YOLOX: Exceeding YOLO Series in 2021","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":1,"n_unverified":22,"n_samples":23,"n_pointer_only_licence":0}},{"rank_in_archive_order":79,"model":"PP-YOLOE-l(CSPRepResNet-l, 640x640, single-scale )","metrics":{"AP50":"68.9","AP75":"55.6","APL":"66.1","APM":"55.3","APS":"31.4","box mAP":"51.4"},"uses_additional_data":false,"paper_date":"2022-03-30","paper":"/paper/pp-yoloe-an-evolved-version-of-yolo","paper_url":"https://arxiv.org/abs/2203.16250v3","paper_title":"PP-YOLOE: An evolved version of YOLO","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":8,"syntology":{"n_ran":5,"n_unverified":22,"n_samples":27,"n_pointer_only_licence":0}},{"rank_in_archive_order":80,"model":"YOLOv7 (161 fps)","metrics":{"box mAP":"51.4"},"uses_additional_data":true,"paper_date":"2022-07-06","paper":"/paper/yolov7-trainable-bag-of-freebies-sets-new","paper_url":"https://arxiv.org/abs/2207.02696v1","paper_title":"YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors","code":"https://github.com/pjreddie/darknet","n_code_links":21,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":81,"model":"UniverseNet-20.08d (Res2Net-101, DCN, single-scale)","metrics":{"AP50":"70.0","AP75":"55.8","APL":"64.9","APM":"55.3","APS":"31.7","box mAP":"51.3"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/usb-universal-scale-object-detection","paper_url":"https://arxiv.org/abs/2103.14027v3","paper_title":"USB: Universal-Scale Object Detection Benchmark","code":"https://github.com/shinya7y/UniverseNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":82,"model":"TSD(SENet154-DCN,multi-scale)","metrics":{"AP50":"71.9","AP75":"56.0","APL":"64.2","APM":"54.8","APS":"33.8","box mAP":"51.2"},"uses_additional_data":false,"paper_date":"2020-03-17","paper":"/paper/revisiting-the-sibling-head-in-object","paper_url":"https://arxiv.org/abs/2003.07540v1","paper_title":"Revisiting the Sibling Head in Object Detector","code":"https://github.com/Sense-X/TSD","n_code_links":2,"syntology":null},{"rank_in_archive_order":83,"model":"YOLOX-X (Modified CSP v5)","metrics":{"AP50":"69.6","AP75":"55.7","APL":"66.1","APM":"56.1","APS":"31.2","Params (M)":"99.1","box mAP":"51.2"},"uses_additional_data":false,"paper_date":"2021-07-18","paper":"/paper/yolox-exceeding-yolo-series-in-2021","paper_url":"https://arxiv.org/abs/2107.08430v2","paper_title":"YOLOX: Exceeding YOLO Series in 2021","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":1,"n_unverified":22,"n_samples":23,"n_pointer_only_licence":0}},{"rank_in_archive_order":84,"model":"iBOT (ViT-B/16)","metrics":{"box mAP":"51.2"},"uses_additional_data":false,"paper_date":"2021-11-15","paper":"/paper/ibot-image-bert-pre-training-with-online","paper_url":"https://arxiv.org/abs/2111.07832v3","paper_title":"iBOT: Image BERT Pre-Training with Online Tokenizer","code":"https://github.com/bytedance/ibot","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":85,"model":"RetinaNet (SpineNet-143, 1280x1280)","metrics":{"AP50":"70.4","AP75":"54.9","APL":"62.1","APM":"53.9","APS":"33.6","box mAP":"50.7"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/spinenet-learning-scale-permuted-backbone-for","paper_url":"https://arxiv.org/abs/1912.05027v3","paper_title":"SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/modeling/backbones","n_code_links":13,"syntology":null},{"rank_in_archive_order":86,"model":"ATSS (ResNetXt-64x4d-101+DCN,multi-scale)","metrics":{"AP50":"68.9","AP75":"56.3","APL":"62.4","APM":"52.9","APS":"33.2","box mAP":"50.7"},"uses_additional_data":false,"paper_date":"2019-12-05","paper":"/paper/bridging-the-gap-between-anchor-based-and","paper_url":"https://arxiv.org/abs/1912.02424v4","paper_title":"Bridging the Gap Between Anchor-based and Anchor-free Detection via Adaptive Training Sample Selection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":13,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":87,"model":"NAS-FPN (AmoebaNet-D, learned aug)","metrics":{"APL":"64.5","APM":"55.5","APS":"34.2","box mAP":"50.7"},"uses_additional_data":false,"paper_date":"2019-06-26","paper":"/paper/learning-data-augmentation-strategies-for","paper_url":"https://arxiv.org/abs/1906.11172v1","paper_title":"Learning Data Augmentation Strategies for Object Detection","code":"https://github.com/tensorflow/tpu","n_code_links":6,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":88,"model":"Boosting R-CNN*","metrics":{"box mAP":"50.7"},"uses_additional_data":false,"paper_date":"2022-06-28","paper":"/paper/boosting-r-cnn-reweighting-r-cnn-samples-by","paper_url":"https://arxiv.org/abs/2206.13728v3","paper_title":"Boosting R-CNN: Reweighting R-CNN Samples by RPN's Error for Underwater Object Detection","code":"https://github.com/mousecpn/Boosting-R-CNN-Reweighting-R-CNN-Samples-by-RPN-s-Error-for-Underwater-Object-Detection","n_code_links":2,"syntology":null},{"rank_in_archive_order":89,"model":"GFLV2 (Res2Net-101, DCN)","metrics":{"AP50":"69","AP75":"55.3","APL":"63.5","APM":"54.3","APS":"31.3","box mAP":"50.6"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/generalized-focal-loss-v2-learning-reliable","paper_url":"https://arxiv.org/abs/2011.12885v1","paper_title":"Generalized Focal Loss V2: Learning Reliable Localization Quality Estimation for Dense Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":5,"syntology":null},{"rank_in_archive_order":90,"model":"aLRP Loss (ResNext-101-64x4d, DCN, multiscale test)","metrics":{"AP50":"70.3","AP75":"53.9","APL":"63.0","APM":"53.1","APS":"32.0","box mAP":"50.2"},"uses_additional_data":false,"paper_date":"2020-09-28","paper":"/paper/a-ranking-based-balanced-loss-function","paper_url":"https://arxiv.org/abs/2009.13592v4","paper_title":"A Ranking-based, Balanced Loss Function Unifying Classification and Localisation in Object Detection","code":"https://github.com/kemaloksuz/aLRPLoss","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":91,"model":"FreeAnchor + SEPC (DCN, ResNext-101-64x4d)","metrics":{"AP50":"69.8","AP75":"54.3","APL":"63.7","APM":"53.3","APS":"31.3","box mAP":"50.1"},"uses_additional_data":false,"paper_date":"2020-05-06","paper":"/paper/scale-equalizing-pyramid-convolution-for","paper_url":"https://arxiv.org/abs/2005.03101v1","paper_title":"Scale-Equalizing Pyramid Convolution for Object Detection","code":"https://github.com/shinya7y/UniverseNet","n_code_links":2,"syntology":null},{"rank_in_archive_order":92,"model":"D2Det (ResNet-101-DCN, multi-scale test)","metrics":{"AP50":"69.4","AP75":"54.9","APL":"62.1","APM":"52.7","APS":"32.7","box mAP":"50.1"},"uses_additional_data":false,"paper_date":"2020-06-01","paper":"/paper/d2det-towards-high-quality-object-detection","paper_url":"http://openaccess.thecvf.com/content_CVPR_2020/html/Cao_D2Det_Towards_High_Quality_Object_Detection_and_Instance_Segmentation_CVPR_2020_paper.html","paper_title":"D2Det: Towards High Quality Object Detection and Instance Segmentation","code":"https://github.com/JialeCao001/D2Det","n_code_links":1,"syntology":null},{"rank_in_archive_order":93,"model":"Dynamic R-CNN (ResNet-101-DCN, multi-scale)","metrics":{"AP50":"68.3","AP75":"55.6","APL":"61.2","APM":"53.0","APS":"32.8","box mAP":"50.1"},"uses_additional_data":false,"paper_date":"2020-04-13","paper":"/paper/dynamic-r-cnn-towards-high-quality-object","paper_url":"https://arxiv.org/abs/2004.06002v2","paper_title":"Dynamic R-CNN: Towards High Quality Object Detection via Dynamic Training","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":16,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":94,"model":"TSD(ResNet-101-Deformable, Image Pyramid)","metrics":{"AP50":"69.6","AP75":"54.4","APL":"61.0","APM":"52.5","APS":"32.7","box mAP":"49.4"},"uses_additional_data":false,"paper_date":"2020-03-17","paper":"/paper/revisiting-the-sibling-head-in-object","paper_url":"https://arxiv.org/abs/2003.07540v1","paper_title":"Revisiting the Sibling Head in Object Detector","code":"https://github.com/Sense-X/TSD","n_code_links":2,"syntology":null},{"rank_in_archive_order":95,"model":"RepPoints v2 (ResNeXt-101, DCN)","metrics":{"AP50":"68.9","AP75":"53.4","APL":"62.3","APM":"52.1","APS":"30.3","box mAP":"49.4"},"uses_additional_data":false,"paper_date":"2020-07-16","paper":"/paper/reppoints-v2-verification-meets-regression","paper_url":"https://arxiv.org/abs/2007.08508v1","paper_title":"RepPoints V2: Verification Meets Regression for Object Detection","code":"https://github.com/Scalsol/RepPointsV2","n_code_links":1,"syntology":null},{"rank_in_archive_order":96,"model":"A2MIM (ViT-B)","metrics":{"box mAP":"49.4"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/architecture-agnostic-masked-image-modeling","paper_url":"https://arxiv.org/abs/2205.13943v4","paper_title":"Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN","code":"https://github.com/open-mmlab/mmpretrain","n_code_links":3,"syntology":null},{"rank_in_archive_order":97,"model":"iBOT (ViT-S/16)","metrics":{"box mAP":"49.4"},"uses_additional_data":false,"paper_date":"2021-11-15","paper":"/paper/ibot-image-bert-pre-training-with-online","paper_url":"https://arxiv.org/abs/2111.07832v3","paper_title":"iBOT: Image BERT Pre-Training with Online Tokenizer","code":"https://github.com/bytedance/ibot","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":98,"model":"CPNDet (Hourglass-104, multi-scale)","metrics":{"AP50":"67.3","AP75":"53.7","APL":"62.4","APM":"51.9","APS":"31.0","box mAP":"49.2"},"uses_additional_data":false,"paper_date":"2020-07-27","paper":"/paper/corner-proposal-network-for-anchor-free-two","paper_url":"https://arxiv.org/abs/2007.13816v1","paper_title":"Corner Proposal Network for Anchor-free, Two-stage Object Detection","code":"https://github.com/Duankaiwen/CPNDet","n_code_links":1,"syntology":null},{"rank_in_archive_order":99,"model":"GFLV2 (ResNeXt-101, 32x4d, DCN)","metrics":{"AP50":"67.6","AP75":"53.5","APL":"61.4","APM":"52.4","APS":"29.7","Hardware Burden":"3G","box mAP":"49"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/generalized-focal-loss-v2-learning-reliable","paper_url":"https://arxiv.org/abs/2011.12885v1","paper_title":"Generalized Focal Loss V2: Learning Reliable Localization Quality Estimation for Dense Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":5,"syntology":null},{"rank_in_archive_order":100,"model":"aLRP Loss (ResNext-101-64x4d, DCN, single scale)","metrics":{"AP50":"69.3","AP75":"52.5","APL":"62.1","APM":"51.5","APS":"30.8","box mAP":"48.9"},"uses_additional_data":false,"paper_date":"2020-09-28","paper":"/paper/a-ranking-based-balanced-loss-function","paper_url":"https://arxiv.org/abs/2009.13592v4","paper_title":"A Ranking-based, Balanced Loss Function Unifying Classification and Localisation in Object Detection","code":"https://github.com/kemaloksuz/aLRPLoss","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":101,"model":"PP-YOLOE-m(CSPRepResNet-m, 640x640, single-scale )","metrics":{"AP50":"66.5","AP75":"53.0","APL":"63.8","APM":"52.9","APS":"28.6","box mAP":"48.9"},"uses_additional_data":false,"paper_date":"2022-03-30","paper":"/paper/pp-yoloe-an-evolved-version-of-yolo","paper_url":"https://arxiv.org/abs/2203.16250v3","paper_title":"PP-YOLOE: An evolved version of YOLO","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":8,"syntology":{"n_ran":5,"n_unverified":22,"n_samples":27,"n_pointer_only_licence":0}},{"rank_in_archive_order":102,"model":"UniverseNet-20.08 (Res2Net-50, DCN, single-scale)","metrics":{"AP50":"67.5","AP75":"53.0","APL":"61.1","APM":"52.3","APS":"30.1","box mAP":"48.8"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/usb-universal-scale-object-detection","paper_url":"https://arxiv.org/abs/2103.14027v3","paper_title":"USB: Universal-Scale Object Detection Benchmark","code":"https://github.com/shinya7y/UniverseNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":103,"model":"SOLQ (ResNet101, single scale)","metrics":{"box mAP":"48.7"},"uses_additional_data":false,"paper_date":"2021-06-04","paper":"/paper/solq-segmenting-objects-by-learning-queries","paper_url":"https://arxiv.org/abs/2106.02351v3","paper_title":"SOLQ: Segmenting Objects by Learning Queries","code":"https://github.com/megvii-research/SOLQ","n_code_links":1,"syntology":null},{"rank_in_archive_order":104,"model":"RetinaNet (SpineNet-96, 1024x1024)","metrics":{"AP50":"68.4","AP75":"52.5","APL":"62","APM":"52.3","APS":"32","box mAP":"48.6"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/spinenet-learning-scale-permuted-backbone-for","paper_url":"https://arxiv.org/abs/1912.05027v3","paper_title":"SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/modeling/backbones","n_code_links":13,"syntology":null},{"rank_in_archive_order":105,"model":"TridentNet (ResNet-101-Deformable, Image Pyramid)","metrics":{"AP50":"69.7","AP75":"53.5","APL":"60.3","APM":"51.3","APS":"31.8","box mAP":"48.4"},"uses_additional_data":false,"paper_date":"2019-01-07","paper":"/paper/scale-aware-trident-networks-for-object","paper_url":"https://arxiv.org/abs/1901.01892v2","paper_title":"Scale-Aware Trident Networks for Object Detection","code":"https://github.com/facebookresearch/detectron2/tree/master/projects/TridentNet/","n_code_links":4,"syntology":null},{"rank_in_archive_order":106,"model":"GCNet (ResNeXt-101 + DCN + cascade + GC r4)","metrics":{"AP50":"67.6","AP75":"52.7","Operations per network pass":"54.8G","box mAP":"48.4"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/gcnet-non-local-networks-meet-squeeze","paper_url":"http://arxiv.org/abs/1904.11492v1","paper_title":"GCNet: Non-local Networks Meet Squeeze-Excitation Networks and Beyond","code":"https://github.com/open-mmlab/mmdetection","n_code_links":9,"syntology":null},{"rank_in_archive_order":107,"model":"GFLV2 (ResNet-101-DCN)","metrics":{"AP50":"66.5","AP75":"52.8","APL":"60.7","APM":"51.9","APS":"28.8","Hardware Burden":"3G","box mAP":"48.3"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/generalized-focal-loss-v2-learning-reliable","paper_url":"https://arxiv.org/abs/2011.12885v1","paper_title":"Generalized Focal Loss V2: Learning Reliable Localization Quality Estimation for Dense Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":5,"syntology":null},{"rank_in_archive_order":108,"model":"Swin-S (RPE w/ GAB)","metrics":{"box mAP":"48.23"},"uses_additional_data":false,"paper_date":"2023-05-08","paper":"/paper/understanding-gaussian-attention-bias-of","paper_url":"https://arxiv.org/abs/2305.04722v1","paper_title":"Understanding Gaussian Attention Bias of Vision Transformers Using Effective Receptive Fields","code":"https://github.com/kmbmjn/GaussianAttentionBias","n_code_links":1,"syntology":null},{"rank_in_archive_order":109,"model":"GFL (X-101-32x4d-DCN, single-scale)","metrics":{"AP50":"67.4","AP75":"52.6","APL":"60.2","APM":"51.7","APS":"29.2","box mAP":"48.2"},"uses_additional_data":false,"paper_date":"2020-06-08","paper":"/paper/generalized-focal-loss-learning-qualified-and","paper_url":"https://arxiv.org/abs/2006.04388v1","paper_title":"Generalized Focal Loss: Learning Qualified and Distributed Bounding Boxes for Dense Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":23,"n_samples":24,"n_pointer_only_licence":0}},{"rank_in_archive_order":110,"model":"ISTR (ResNet101-FPN-3x, single-scale)","metrics":{"APL":"61.5","APM":"50.4","APS":"28.7","box mAP":"48.1"},"uses_additional_data":false,"paper_date":"2021-05-03","paper":"/paper/istr-end-to-end-instance-segmentation-with","paper_url":"https://arxiv.org/abs/2105.00637v2","paper_title":"ISTR: End-to-End Instance Segmentation with Transformers","code":"https://github.com/hujiecpp/ISTR","n_code_links":1,"syntology":null},{"rank_in_archive_order":111,"model":"YOLOX-Darknet53(Darknet53, 640x640, single-scale)","metrics":{"box mAP":"48.0"},"uses_additional_data":true,"paper_date":"2021-07-18","paper":"/paper/yolox-exceeding-yolo-series-in-2021","paper_url":"https://arxiv.org/abs/2107.08430v2","paper_title":"YOLOX: Exceeding YOLO Series in 2021","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":1,"n_unverified":22,"n_samples":23,"n_pointer_only_licence":0}},{"rank_in_archive_order":112,"model":"DAT-S (RetinaNet)","metrics":{"AP50":"69.6","AP75":"51.2","APL":"63.4","APM":"51.8","APS":"32.3","box mAP":"47.9"},"uses_additional_data":false,"paper_date":"2022-01-03","paper":"/paper/vision-transformer-with-deformable-attention","paper_url":"https://arxiv.org/abs/2201.00520v3","paper_title":"Vision Transformer with Deformable Attention","code":"https://github.com/leaplabthu/dat","n_code_links":2,"syntology":{"n_ran":8,"n_unverified":2,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":113,"model":"aLRP Loss (ResNext-101-64x4d, single scale)","metrics":{"AP50":"68.4","AP75":"51.1","APL":"59.1","APM":"50.8","APS":"30.2","box mAP":"47.8"},"uses_additional_data":false,"paper_date":"2020-09-28","paper":"/paper/a-ranking-based-balanced-loss-function","paper_url":"https://arxiv.org/abs/2009.13592v4","paper_title":"A Ranking-based, Balanced Loss Function Unifying Classification and Localisation in Object Detection","code":"https://github.com/kemaloksuz/aLRPLoss","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":114,"model":"MatrixNet Corners (ResNet-152, multi-scale)","metrics":{"AP50":"66.2","AP75":"52.3","APL":"60.7","APM":"50.4","APS":"29.7","box mAP":"47.8"},"uses_additional_data":false,"paper_date":"2019-08-13","paper":"/paper/matrix-nets-a-new-deep-architecture-for","paper_url":"https://arxiv.org/abs/1908.04646v2","paper_title":"Matrix Nets: A New Deep Architecture for Object Detection","code":"https://github.com/arashwan/matrixnet","n_code_links":2,"syntology":null},{"rank_in_archive_order":115,"model":"SOLQ (ResNet50, single scale)","metrics":{"box mAP":"47.8"},"uses_additional_data":false,"paper_date":"2021-06-04","paper":"/paper/solq-segmenting-objects-by-learning-queries","paper_url":"https://arxiv.org/abs/2106.02351v3","paper_title":"SOLQ: Segmenting Objects by Learning Queries","code":"https://github.com/megvii-research/SOLQ","n_code_links":1,"syntology":null},{"rank_in_archive_order":116,"model":"DyHead (ResNeXt-64x4d-101)","metrics":{"AP50":"65.7","AP75":"51.9","box mAP":"47.7"},"uses_additional_data":false,"paper_date":"2021-06-15","paper":"/paper/dynamic-head-unifying-object-detection-heads","paper_url":"https://arxiv.org/abs/2106.08322v1","paper_title":"Dynamic Head: Unifying Object Detection Heads with Attentions","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":117,"model":"SAPD (ResNeXt-101, single-scale)","metrics":{"AP50":"67.4","AP75":"51.1","APL":"61.5","APM":"50.3","APS":"28.1","box mAP":"47.4"},"uses_additional_data":false,"paper_date":"2019-11-27","paper":"/paper/soft-anchor-point-object-detection","paper_url":"https://arxiv.org/abs/1911.12448v2","paper_title":"Soft Anchor-Point Object Detection","code":"https://github.com/xuannianz/FSAF","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":118,"model":"PANet (ResNeXt-101, multi-scale)","metrics":{"AP50":"67.2","AP75":"51.8 ","APL":"60.0 ","APM":"51.7","APS":"30.1","box mAP":"47.4"},"uses_additional_data":false,"paper_date":"2018-03-05","paper":"/paper/path-aggregation-network-for-instance","paper_url":"http://arxiv.org/abs/1803.01534v4","paper_title":"Path Aggregation Network for Instance Segmentation","code":"https://github.com/ultralytics/yolov5","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":1}},{"rank_in_archive_order":119,"model":"HTC (HRNetV2p-W48)","metrics":{"AP50":"65.9","AP75":"51.2","APL":"59.8","APM":"49.7","APS":"28.0","Hardware Burden":"15G","Operations per network pass":"71.7G","box mAP":"47.3"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":120,"model":"HTC (ResNeXt-101-FPN)","metrics":{"AP50":"63.9","AP75":"44.7","APL":"54.6","APM":"43.9","APS":"22.8","box mAP":"47.1"},"uses_additional_data":false,"paper_date":"2019-01-22","paper":"/paper/hybrid-task-cascade-for-instance-segmentation","paper_url":"http://arxiv.org/abs/1901.07518v2","paper_title":"Hybrid Task Cascade for Instance Segmentation","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":11,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":121,"model":"CenterNet511 (Hourglass-104, multi-scale)","metrics":{"AP50":"64.5","AP75":"50.7","APL":"58.9","APM":"49.9","APS":"28.9","box mAP":"47.0"},"uses_additional_data":false,"paper_date":"2019-04-17","paper":"/paper/centernet-object-detection-with-keypoint","paper_url":"http://arxiv.org/abs/1904.08189v3","paper_title":"CenterNet: Keypoint Triplets for Object Detection","code":"https://github.com/Duankaiwen/CenterNet","n_code_links":20,"syntology":{"n_ran":2,"n_unverified":9,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":122,"model":"MAL (ResNeXt101, multi-scale)","metrics":{"box mAP":"47.0"},"uses_additional_data":false,"paper_date":"2019-12-04","paper":"/paper/multiple-anchor-learning-for-visual-object","paper_url":"https://arxiv.org/abs/1912.02252v1","paper_title":"Multiple Anchor Learning for Visual Object Detection","code":"https://github.com/KevinKecc/MAL","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":9,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":123,"model":"ISTR (ResNet50-FPN-3x)","metrics":{"box mAP":"46.8"},"uses_additional_data":false,"paper_date":"2021-05-03","paper":"/paper/istr-end-to-end-instance-segmentation-with","paper_url":"https://arxiv.org/abs/2105.00637v2","paper_title":"ISTR: End-to-End Instance Segmentation with Transformers","code":"https://github.com/hujiecpp/ISTR","n_code_links":1,"syntology":null},{"rank_in_archive_order":124,"model":"RetinaNet (SpineNet-49, 896x896)","metrics":{"AP50":"66.3","AP75":"50.6","APL":"61.7","APM":"50.1","APS":"29.1","box mAP":"46.7"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/spinenet-learning-scale-permuted-backbone-for","paper_url":"https://arxiv.org/abs/1912.05027v3","paper_title":"SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/modeling/backbones","n_code_links":13,"syntology":null},{"rank_in_archive_order":125,"model":"RPDet (ResNet-101-DCN, multi-scale)","metrics":{"AP50":"67.4","AP75":"50.9","APL":"57.1","APM":"49.7","APS":"30.3","box mAP":"46.5"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/reppoints-point-set-representation-for-object","paper_url":"https://arxiv.org/abs/1904.11490v2","paper_title":"RepPoints: Point Set Representation for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":126,"model":"HoughNet (MS)","metrics":{"AP50":"65.1","AP75":"50.7","APL":"58.1","APM":"48.5","APS":"29.1","box mAP":"46.4"},"uses_additional_data":false,"paper_date":"2020-07-05","paper":"/paper/houghnet-integrating-near-and-long-range","paper_url":"https://arxiv.org/abs/2007.02355v3","paper_title":"HoughNet: Integrating near and long-range evidence for bottom-up object detection","code":"https://github.com/giddyyupp/coco-minitrain","n_code_links":2,"syntology":null},{"rank_in_archive_order":127,"model":"PPDet (ResNeXt-101-FPN, multiscale)","metrics":{"AP50":"64.8","AP75":"51.6","APL":"56.4","APM":"49.9","APS":"31.4","box mAP":"46.3"},"uses_additional_data":false,"paper_date":"2020-08-03","paper":"/paper/reducing-label-noise-in-anchor-free-object","paper_url":"https://arxiv.org/abs/2008.01167v2","paper_title":"Reducing Label Noise in Anchor-Free Object Detection","code":"https://github.com/nerminsamet/ppdet","n_code_links":1,"syntology":null},{"rank_in_archive_order":128,"model":"GFLV2 (ResNet-101)","metrics":{"AP50":"64.3","AP75":"50.5","APL":"57","APM":"49.9","APS":"27.8","box mAP":"46.2"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/generalized-focal-loss-v2-learning-reliable","paper_url":"https://arxiv.org/abs/2011.12885v1","paper_title":"Generalized Focal Loss V2: Learning Reliable Localization Quality Estimation for Dense Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":5,"syntology":null},{"rank_in_archive_order":129,"model":"SNIPER (ResNet-101)","metrics":{"AP50":"67.0","AP75":"51.6","APL":"58.1","APM":"48.9","APS":"29.6","Hardware Burden":"29G","box mAP":"46.1"},"uses_additional_data":false,"paper_date":"2018-05-23","paper":"/paper/sniper-efficient-multi-scale-training","paper_url":"http://arxiv.org/abs/1805.09300v3","paper_title":"SNIPER: Efficient Multi-Scale Training","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":4,"syntology":null},{"rank_in_archive_order":130,"model":"Mask R-CNN (HRNetV2p-W48 + cascade)","metrics":{"AP50":"64.0","AP75":"50.3","APL":"58.3","APM":"48.6","APS":"27.1","Hardware Burden":"15G","Operations per network pass":"61.8G","box mAP":"46.1"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":131,"model":"ResNeXt-64x4d-101 NAS-FCOS @128-256 w/improvements","metrics":{"box mAP":"46.1"},"uses_additional_data":false,"paper_date":"2019-06-11","paper":"/paper/nas-fcos-fast-neural-architecture-search-for","paper_url":"https://arxiv.org/abs/1906.04423v4","paper_title":"NAS-FCOS: Fast Neural Architecture Search for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":132,"model":"DCNv2 (ResNet-101, multi-scale)","metrics":{"AP50":"67.9","AP75":"50.8","APL":"59.5","APM":"49.1","APS":"27.8","box mAP":"46.0"},"uses_additional_data":false,"paper_date":"2018-11-27","paper":"/paper/deformable-convnets-v2-more-deformable-better","paper_url":"http://arxiv.org/abs/1811.11168v2","paper_title":"Deformable ConvNets v2: More Deformable, Better Results","code":"https://github.com/open-mmlab/mmdetection","n_code_links":26,"syntology":{"n_ran":2,"n_unverified":11,"n_samples":13,"n_pointer_only_licence":2}},{"rank_in_archive_order":133,"model":"Gaussian-FCOS","metrics":{"box mAP":"46"},"uses_additional_data":false,"paper_date":"2020-06-28","paper":"/paper/localization-uncertainty-estimation-for","paper_url":"https://arxiv.org/abs/2006.15607v6","paper_title":"Localization Uncertainty Estimation for Anchor-Free Object Detection","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":134,"model":"Cascade R-CNN-FPN (ResNet-101, map-guided)","metrics":{"AP50":"64.2","AP75":"50","APL":"58.6","APM":"49","APS":"26.3","box mAP":"45.9"},"uses_additional_data":false,"paper_date":"2019-08-21","paper":"/paper/instaboost-boosting-instance-segmentation-via","paper_url":"https://arxiv.org/abs/1908.07801v1","paper_title":"InstaBoost: Boosting Instance Segmentation via Probability Map Guided Copy-Pasting","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":null},{"rank_in_archive_order":135,"model":"MAL (ResNeXt101, single-scale)","metrics":{"box mAP":"45.9"},"uses_additional_data":false,"paper_date":"2019-12-04","paper":"/paper/multiple-anchor-learning-for-visual-object","paper_url":"https://arxiv.org/abs/1912.02252v1","paper_title":"Multiple Anchor Learning for Visual Object Detection","code":"https://github.com/KevinKecc/MAL","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":9,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":136,"model":"CenterMask+VoVNetV2-99 (single-scale)","metrics":{"AP50":"64.5","APL":"57.6","APM":"48.3","APS":"27.8","box mAP":"45.8"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":137,"model":"D-RFCN + SNIP (DPN-98 with flip, multi-scale)","metrics":{"AP50":"67.3","AP75":"51.1","APL":"57.1","APM":"48.8","APS":"29.3","box mAP":"45.7"},"uses_additional_data":false,"paper_date":"2017-11-22","paper":"/paper/an-analysis-of-scale-invariance-in-object-1","paper_url":"http://arxiv.org/abs/1711.08189v2","paper_title":"An Analysis of Scale Invariance in Object Detection - SNIP","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":138,"model":"YOLOv4 (CD53)","metrics":{"AP50":"64.1","AP75":"49.5","APL":"56.7","APM":"49","APS":"27","box mAP":"45.5"},"uses_additional_data":true,"paper_date":"2020-11-16","paper":"/paper/scaled-yolov4-scaling-cross-stage-partial","paper_url":"https://arxiv.org/abs/2011.08036v2","paper_title":"Scaled-YOLOv4: Scaling Cross Stage Partial Network","code":"https://github.com/AlexeyAB/darknet","n_code_links":41,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":139,"model":"AC-FPN Cascade R-CNN(ResNet-101, single scale)","metrics":{"AP50":"64.4","AP75":"49","APL":"56.6","APM":"47.7","APS":"26.9","box mAP":"45"},"uses_additional_data":false,"paper_date":"2020-05-23","paper":"/paper/attention-guided-context-feature-pyramid","paper_url":"https://arxiv.org/abs/2005.11475v1","paper_title":"Attention-guided Context Feature Pyramid Network for Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":2,"syntology":null},{"rank_in_archive_order":140,"model":"FreeAnchor (ResNeXt-101)","metrics":{"AP50":"64.3","AP75":"48.4","APL":"56","APM":"47.9","APS":"27","box mAP":"44.8"},"uses_additional_data":false,"paper_date":"2019-09-05","paper":"/paper/freeanchor-learning-to-match-anchors-for","paper_url":"https://arxiv.org/abs/1909.02466v2","paper_title":"FreeAnchor: Learning to Match Anchors for Visual Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":4,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":141,"model":"FCOS (ResNeXt-64x4d-101-FPN 4 + improvements)","metrics":{"AP50":"64.1","AP75":"48.4","APL":"55.6","APM":"47.5","APS":"27.6","box mAP":"44.7"},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/fcos-fully-convolutional-one-stage-object","paper_url":"https://arxiv.org/abs/1904.01355v5","paper_title":"FCOS: Fully Convolutional One-Stage Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":87,"syntology":{"n_ran":13,"n_unverified":27,"n_samples":40,"n_pointer_only_licence":18}},{"rank_in_archive_order":142,"model":"CenterMask+VoVNet2-57 (single-scale)","metrics":{"AP50":"63.1","AP75":"48.6","APL":"55.9","APS":"27.1","box mAP":"44.7"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":143,"model":"FSAF (ResNeXt-101, multi-scale)","metrics":{"AP50":"65.2","AP75":"48.6","APL":"54.6","APM":"47.1","APS":"29.7","box mAP":"44.6"},"uses_additional_data":false,"paper_date":"2019-03-02","paper":"/paper/feature-selective-anchor-free-module-for","paper_url":"http://arxiv.org/abs/1903.00621v1","paper_title":"Feature Selective Anchor-Free Module for Single-Shot Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":8,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":144,"model":"aLRP Loss (ResNext-101, DCN, 500 scale)","metrics":{"AP50":"65.0","AP75":"47.5","APL":"58.3","APM":"48.1","APS":"24.6","box mAP":"44.6"},"uses_additional_data":false,"paper_date":"2020-09-28","paper":"/paper/a-ranking-based-balanced-loss-function","paper_url":"https://arxiv.org/abs/2009.13592v4","paper_title":"A Ranking-based, Balanced Loss Function Unifying Classification and Localisation in Object Detection","code":"https://github.com/kemaloksuz/aLRPLoss","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":145,"model":"CenterMask + X-101-32x8d (single-scale)","metrics":{"AP50":"63.4","AP75":"48.4","APM":"47.2","box mAP":"44.6"},"uses_additional_data":false,"paper_date":"2019-11-15","paper":"/paper/centermask-real-time-anchor-free-instance-1","paper_url":"https://arxiv.org/abs/1911.06667v6","paper_title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","code":"https://github.com/youngwanLEE/centermask2","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":146,"model":"RetinaNet (SpineNet-49, 640x640)","metrics":{"AP50":"63.8","AP75":"47.6","APL":"61.1","APM":"47.7","APS":"25.9","box mAP":"44.3"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/spinenet-learning-scale-permuted-backbone-for","paper_url":"https://arxiv.org/abs/1912.05027v3","paper_title":"SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/modeling/backbones","n_code_links":13,"syntology":null},{"rank_in_archive_order":147,"model":"YOLOF-DC5","metrics":{"AP50":"62.9","AP75":"47.5","APL":"60.4","APM":"48.5","APS":"24.0","box mAP":"44.3"},"uses_additional_data":false,"paper_date":"2021-03-17","paper":"/paper/you-only-look-one-level-feature","paper_url":"https://arxiv.org/abs/2103.09460v1","paper_title":"You Only Look One-level Feature","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":null},{"rank_in_archive_order":148,"model":"GFLV2 (ResNet-50)","metrics":{"AP50":"62.3","AP75":"48.5","APL":"54.1","APM":"47.7","APS":"26.8","box mAP":"44.3"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/generalized-focal-loss-v2-learning-reliable","paper_url":"https://arxiv.org/abs/2011.12885v1","paper_title":"Generalized Focal Loss V2: Learning Reliable Localization Quality Estimation for Dense Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":5,"syntology":null},{"rank_in_archive_order":149,"model":"InterNet (ResNet-101-FPN, multi-scale)","metrics":{"AP50":"67.5","AP75":"51.1","APL":"57.7","APM":"50.3","APS":"27.2","box mAP":"44.2"},"uses_additional_data":false,"paper_date":"2019-03-28","paper":"/paper/feature-intertwiner-for-object-detection-1","paper_url":"http://arxiv.org/abs/1903.11851v1","paper_title":"Feature Intertwiner for Object Detection","code":"https://github.com/hli2020/feature_intertwiner","n_code_links":2,"syntology":null},{"rank_in_archive_order":150,"model":"M2Det (VGG-16, multi-scale)","metrics":{"AP50":"64.6","AP75":"49.3","APL":"55.1","APM":"47.9","APS":"29.2","Hardware Burden":"34G","box mAP":"44.2"},"uses_additional_data":false,"paper_date":"2018-11-12","paper":"/paper/m2det-a-single-shot-object-detector-based-on","paper_url":"http://arxiv.org/abs/1811.04533v3","paper_title":"M2Det: A Single-Shot Object Detector based on Multi-Level Feature Pyramid Network","code":"https://github.com/LeeDongYeun/keras-m2det","n_code_links":11,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":151,"model":"Faster R-CNN (LIP-ResNet-101-MD w FPN)","metrics":{"AP50":"65.7","AP75":"48.1","APL":"56.3","APM":"46.7","APS":"25.4","box mAP":"43.9"},"uses_additional_data":false,"paper_date":"2019-08-12","paper":"/paper/lip-local-importance-based-pooling","paper_url":"https://arxiv.org/abs/1908.04156v3","paper_title":"LIP: Local Importance-based Pooling","code":"https://github.com/sebgao/LIP","n_code_links":1,"syntology":null},{"rank_in_archive_order":152,"model":"M2Det (ResNet-101, multi-scale)","metrics":{"AP50":"64.4","AP75":"48","APL":"54.3","APM":"49.6","APS":"29.6","Hardware Burden":"27G","box mAP":"43.9"},"uses_additional_data":false,"paper_date":"2018-11-12","paper":"/paper/m2det-a-single-shot-object-detector-based-on","paper_url":"http://arxiv.org/abs/1811.04533v3","paper_title":"M2Det: A Single-Shot Object Detector based on Multi-Level Feature Pyramid Network","code":"https://github.com/LeeDongYeun/keras-m2det","n_code_links":11,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":153,"model":"YOLOv3 @800 + ASFF* (Darknet-53)","metrics":{"AP50":" 64.1","AP75":" 49.2","APL":"53.4","APM":" 46.6","APS":"27.0","box mAP":"43.9"},"uses_additional_data":true,"paper_date":"2019-11-21","paper":"/paper/learning-spatial-fusion-for-single-shot","paper_url":"https://arxiv.org/abs/1911.09516v2","paper_title":"Learning Spatial Fusion for Single-Shot Object Detection","code":"https://github.com/ruinmessi/ASFF","n_code_links":1,"syntology":null},{"rank_in_archive_order":154,"model":"FoveaBox (ResNeXt-101)","metrics":{"AP50":"63.5","AP75":"47.7","APL":"55.6","APM":"46.9","APS":"26.8","box mAP":"43.9"},"uses_additional_data":false,"paper_date":"2019-04-08","paper":"/paper/foveabox-beyond-anchor-based-object-detector","paper_url":"https://arxiv.org/abs/1904.03797v2","paper_title":"FoveaBox: Beyond Anchor-based Object Detector","code":"https://github.com/open-mmlab/mmdetection","n_code_links":7,"syntology":null},{"rank_in_archive_order":155,"model":"ExtremeNet (Hourglass-104, multi-scale)","metrics":{"AP50":"60.5","AP75":"47.0","APL":"57.6","APM":"46.9","APS":"24.1","Hardware Burden":"180G","box mAP":"43.7"},"uses_additional_data":false,"paper_date":"2019-01-23","paper":"/paper/bottom-up-object-detection-by-grouping","paper_url":"http://arxiv.org/abs/1901.08043v3","paper_title":"Bottom-up Object Detection by Grouping Extreme and Center Points","code":"https://github.com/xingyizhou/ExtremeNet","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":156,"model":"YOLOv4-608","metrics":{"AP50":"65.7","AP75":"47.3","APL":"53.3","APM":"46.7","APS":"26.7","box mAP":"43.5"},"uses_additional_data":true,"paper_date":"2020-04-23","paper":"/paper/yolov4-optimal-speed-and-accuracy-of-object","paper_url":"https://arxiv.org/abs/2004.10934v1","paper_title":"YOLOv4: Optimal Speed and Accuracy of Object Detection","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/projects/yolo","n_code_links":223,"syntology":{"n_ran":24,"n_unverified":160,"n_samples":184,"n_pointer_only_licence":8}},{"rank_in_archive_order":157,"model":"SNIPER (ResNet-50)","metrics":{"AP50":"65.0","AP75":"48.6","APL":"56.0","APM":"46.3","APS":"26.1","Hardware Burden":"29G","box mAP":"43.5"},"uses_additional_data":false,"paper_date":"2018-05-23","paper":"/paper/sniper-efficient-multi-scale-training","paper_url":"http://arxiv.org/abs/1805.09300v3","paper_title":"SNIPER: Efficient Multi-Scale Training","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":4,"syntology":null},{"rank_in_archive_order":158,"model":"CenterNet (HRNetV2-W48)","metrics":{"AP75":"46.5","APL":"57.8","APS":"22.2","Hardware Burden":"16G","Operations per network pass":"21.7G","box mAP":"43.5"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":159,"model":"D-RFCN + SNIP (ResNet-101, multi-scale)","metrics":{"AP50":"65.5","AP75":"48.4","APL":"54.9","APM":"46.5","APS":"27.2","box mAP":"43.4"},"uses_additional_data":false,"paper_date":"2017-11-22","paper":"/paper/an-analysis-of-scale-invariance-in-object-1","paper_url":"http://arxiv.org/abs/1711.08189v2","paper_title":"An Analysis of Scale Invariance in Object Detection - SNIP","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":160,"model":"Grid R-CNN (ResNeXt-101-FPN)","metrics":{"AP50":"63.0","AP75":"46.6","APL":"55.2","APM":"46.5","APS":"25.1","box mAP":"43.2"},"uses_additional_data":false,"paper_date":"2018-11-29","paper":"/paper/grid-r-cnn","paper_url":"http://arxiv.org/abs/1811.12030v1","paper_title":"Grid R-CNN","code":"https://github.com/open-mmlab/mmdetection","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":161,"model":"FCOS (ResNeXt-101-64x4d-FPN)","metrics":{"AP50":"62.8","AP75":"46.6 ","APL":"53.3","APM":"46.2","APS":"26.5","box mAP":"43.2"},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/fcos-fully-convolutional-one-stage-object","paper_url":"https://arxiv.org/abs/1904.01355v5","paper_title":"FCOS: Fully Convolutional One-Stage Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":87,"syntology":{"n_ran":13,"n_unverified":27,"n_samples":40,"n_pointer_only_licence":18}},{"rank_in_archive_order":162,"model":"CornerNet-Saccade (Hourglass-104, multi-scale)","metrics":{"APL":"57.3","APM":"44.6","APS":"24.4","box mAP":"43.2"},"uses_additional_data":false,"paper_date":"2019-04-18","paper":"/paper/190408900","paper_url":"https://arxiv.org/abs/1904.08900v2","paper_title":"CornerNet-Lite: Efficient Keypoint Based Object Detection","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":26,"n_samples":27,"n_pointer_only_licence":0}},{"rank_in_archive_order":163,"model":"PP-YOLOE-s(CSPRepResNet-s, 640x640, single-scale )","metrics":{"AP50":"60.5","AP75":"46.6","APL":"56.9","APM":"46.4","APS":"23.2","box mAP":"43.1"},"uses_additional_data":false,"paper_date":"2022-03-30","paper":"/paper/pp-yoloe-an-evolved-version-of-yolo","paper_url":"https://arxiv.org/abs/2203.16250v3","paper_title":"PP-YOLOE: An evolved version of YOLO","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":8,"syntology":{"n_ran":5,"n_unverified":22,"n_samples":27,"n_pointer_only_licence":0}},{"rank_in_archive_order":164,"model":"Libra R-CNN (ResNeXt-101-FPN)","metrics":{"AP50":"64","AP75":"47","APL":"54.6","APM":"45.6","APS":"25.3","box mAP":"43.0"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/libra-r-cnn-towards-balanced-learning-for","paper_url":"http://arxiv.org/abs/1904.02701v1","paper_title":"Libra R-CNN: Towards Balanced Learning for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":null},{"rank_in_archive_order":165,"model":"DyHead (ResNet-50)","metrics":{"AP50":"60.7","AP75":"46.8","box mAP":"43"},"uses_additional_data":false,"paper_date":"2021-06-15","paper":"/paper/dynamic-head-unifying-object-detection-heads","paper_url":"https://arxiv.org/abs/2106.08322v1","paper_title":"Dynamic Head: Unifying Object Detection Heads with Attentions","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":166,"model":"RPDet (ResNet-101-DCN)","metrics":{"AP50":"65.0","AP75":"46.3","APL":"54.7","APM":"46.2","APS":"24.9","box mAP":"42.8"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/reppoints-point-set-representation-for-object","paper_url":"https://arxiv.org/abs/1904.11490v2","paper_title":"RepPoints: Point Set Representation for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":167,"model":"SpineNet-49 (640, RetinaNet, single-scale)","metrics":{"AP50":"62.3","AP75":"46.1","APL":"57.3","APM":"45.2","APS":"23.7","box mAP":"42.8"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/spinenet-learning-scale-permuted-backbone-for","paper_url":"https://arxiv.org/abs/1912.05027v3","paper_title":"SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/modeling/backbones","n_code_links":13,"syntology":null},{"rank_in_archive_order":168,"model":"Cascade R-CNN (ResNet-101-FPN+, cascade)","metrics":{"AP50":"62.1","AP75":"46.3","APL":"55.2","APM":"45.5","APS":"23.7","box mAP":"42.8"},"uses_additional_data":false,"paper_date":"2017-12-03","paper":"/paper/cascade-r-cnn-delving-into-high-quality","paper_url":"http://arxiv.org/abs/1712.00726v1","paper_title":"Cascade R-CNN: Delving into High Quality Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":8,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":169,"model":"Cascade R-CNN","metrics":{"AP50":"62.1","AP75":"46.3","APL":"55.2","APM":"45.5","APS":"23.7","Hardware Burden":"15G","box mAP":"42.8"},"uses_additional_data":false,"paper_date":"2019-06-24","paper":"/paper/cascade-r-cnn-high-quality-object-detection","paper_url":"https://arxiv.org/abs/1906.09756v1","paper_title":"Cascade R-CNN: High Quality Object Detection and Instance Segmentation","code":"https://github.com/open-mmlab/mmdetection","n_code_links":4,"syntology":null},{"rank_in_archive_order":170,"model":"TridentNet (ResNet-101)","metrics":{"AP50":"63.6","AP75":"46.5","APL":"56.6","APM":"46.6","APS":"23.9","box mAP":"42.7"},"uses_additional_data":false,"paper_date":"2019-01-07","paper":"/paper/scale-aware-trident-networks-for-object","paper_url":"https://arxiv.org/abs/1901.01892v2","paper_title":"Scale-Aware Trident Networks for Object Detection","code":"https://github.com/facebookresearch/detectron2/tree/master/projects/TridentNet/","n_code_links":4,"syntology":null},{"rank_in_archive_order":171,"model":"FCOS (ResNeXt-32x8d-101-FPN)","metrics":{"AP50":"62.2","AP75":"46.1","APL":"52.6","APM":"45.6","APS":"26.0","box mAP":"42.7"},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/fcos-fully-convolutional-one-stage-object","paper_url":"https://arxiv.org/abs/1904.01355v5","paper_title":"FCOS: Fully Convolutional One-Stage Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":87,"syntology":{"n_ran":13,"n_unverified":27,"n_samples":40,"n_pointer_only_licence":18}},{"rank_in_archive_order":172,"model":"RetinaMask (ResNeXt-101-FPN-GN)","metrics":{"AP50":"62.5","AP75":"46.0","APL":"53.8","APM":"45.6","APS":"24.8","Hardware Burden":"12G","box mAP":"42.6"},"uses_additional_data":false,"paper_date":"2019-01-10","paper":"/paper/retinamask-learning-to-predict-masks-improves","paper_url":"http://arxiv.org/abs/1901.03353v1","paper_title":"RetinaMask: Learning to predict masks improves state-of-the-art single-shot detection for free","code":"https://github.com/chengyangfu/retinamask","n_code_links":53,"syntology":null},{"rank_in_archive_order":173,"model":"TAL + TAP","metrics":{"AP50":"60.3","AP75":"46.4","box mAP":"42.5"},"uses_additional_data":false,"paper_date":"2021-08-17","paper":"/paper/tood-task-aligned-one-stage-object-detection","paper_url":"https://arxiv.org/abs/2108.07755v3","paper_title":"TOOD: Task-aligned One-stage Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":2}},{"rank_in_archive_order":174,"model":"Faster R-CNN (HRNetV2p-W48)","metrics":{"AP50":"63.6","AP75":"46.4","APL":"53.0","APM":"44.6","APS":"24.9","Hardware Burden":"16G","Operations per network pass":"20.8G","box mAP":"42.4"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":175,"model":"HSD (Rest101, 768x768, single-scale test)","metrics":{"AP50":"61.2","AP75":"46.9","APL":"55.9","APM":"47.3","APS":"22.8","box mAP":"42.3"},"uses_additional_data":false,"paper_date":"2019-10-01","paper":"/paper/hierarchical-shot-detector","paper_url":"http://openaccess.thecvf.com/content_ICCV_2019/html/Cao_Hierarchical_Shot_Detector_ICCV_2019_paper.html","paper_title":"Hierarchical Shot Detector","code":"https://github.com/JialeCao001/HSD","n_code_links":1,"syntology":null},{"rank_in_archive_order":176,"model":"CornerNet511 (Hourglass-104, multi-scale)","metrics":{"AP50":"57.8","AP75":"45.3","APL":"56.7","APM":"44.8","APS":"20.8","box mAP":"42.1"},"uses_additional_data":false,"paper_date":"2018-08-03","paper":"/paper/cornernet-detecting-objects-as-paired","paper_url":"http://arxiv.org/abs/1808.01244v2","paper_title":"CornerNet: Detecting Objects as Paired Keypoints","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":177,"model":"FoveaBox (ResNeXt-101)","metrics":{"box mAP":"42.1"},"uses_additional_data":false,"paper_date":"2019-04-08","paper":"/paper/foveabox-beyond-anchor-based-object-detector","paper_url":"https://arxiv.org/abs/1904.03797v2","paper_title":"FoveaBox: Beyond Anchor-based Object Detector","code":"https://github.com/open-mmlab/mmdetection","n_code_links":7,"syntology":null},{"rank_in_archive_order":178,"model":"FCOS (HRNet-W32-5l)","metrics":{"AP50":"60.4","AP75":"45.3","APL":"51.0","APM":"45.0","APS":"25.4","box mAP":"42.0"},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/fcos-fully-convolutional-one-stage-object","paper_url":"https://arxiv.org/abs/1904.01355v5","paper_title":"FCOS: Fully Convolutional One-Stage Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":87,"syntology":{"n_ran":13,"n_unverified":27,"n_samples":40,"n_pointer_only_licence":18}},{"rank_in_archive_order":179,"model":"FoveaBox (ResNeXt-101)","metrics":{"box mAP":"41.9"},"uses_additional_data":false,"paper_date":"2019-04-08","paper":"/paper/foveabox-beyond-anchor-based-object-detector","paper_url":"https://arxiv.org/abs/1904.03797v2","paper_title":"FoveaBox: Beyond Anchor-based Object Detector","code":"https://github.com/open-mmlab/mmdetection","n_code_links":7,"syntology":null},{"rank_in_archive_order":180,"model":"RefineDet512+ (ResNet-101)","metrics":{"AP50":"62.9","AP75":"45.7","APL":"54.1","APM":"45.1","APS":"25.6","box mAP":"41.8"},"uses_additional_data":false,"paper_date":"2017-11-18","paper":"/paper/single-shot-refinement-neural-network-for","paper_url":"http://arxiv.org/abs/1711.06897v3","paper_title":"Single-Shot Refinement Neural Network for Object Detection","code":"https://github.com/sfzhang15/RefineDet","n_code_links":16,"syntology":null},{"rank_in_archive_order":181,"model":"GHM-C + GHM-R (RetinaNet-FPN-ResNeXt-101)","metrics":{"AP50":"62.8","AP75":"44.2","APL":"55.3","APM":"45.1","APS":"22.3","box mAP":"41.6"},"uses_additional_data":false,"paper_date":"2018-11-13","paper":"/paper/gradient-harmonized-single-stage-detector","paper_url":"http://arxiv.org/abs/1811.05181v1","paper_title":"Gradient Harmonized Single-stage Detector","code":"https://github.com/open-mmlab/mmdetection","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":182,"model":"CenterNet-DLA (DLA-34, multi-scale)","metrics":{"APL":"56.0","APM":"43.9","APS":"21.5","Hardware Burden":"26G","box mAP":"41.6"},"uses_additional_data":false,"paper_date":"2019-04-16","paper":"/paper/objects-as-points","paper_url":"http://arxiv.org/abs/1904.07850v2","paper_title":"Objects as Points","code":"https://github.com/tensorflow/models/tree/master/research/object_detection","n_code_links":76,"syntology":{"n_ran":10,"n_unverified":120,"n_samples":130,"n_pointer_only_licence":0}},{"rank_in_archive_order":183,"model":"RetinaNet (SpineNet-49S, 640x640)","metrics":{"AP50":"60.5","AP75":"44.6","APL":"58","APM":"45","APS":"23.3","box mAP":"41.5"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/spinenet-learning-scale-permuted-backbone-for","paper_url":"https://arxiv.org/abs/1912.05027v3","paper_title":"SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/modeling/backbones","n_code_links":13,"syntology":null},{"rank_in_archive_order":184,"model":"RPDet (ResNet-101)","metrics":{"AP50":"62.9","AP75":"44.3","APL":"51.7","APM":"44.1","APS":"23.6","box mAP":"41"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/reppoints-point-set-representation-for-object","paper_url":"https://arxiv.org/abs/1904.11490v2","paper_title":"RepPoints: Point Set Representation for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":185,"model":"M2Det (VGG-16, single-scale)","metrics":{"AP50":"59.7","AP75":"45","APL":"53.8","APM":"46.5","APS":"22.1","Hardware Burden":"34G","box mAP":"41.0"},"uses_additional_data":false,"paper_date":"2018-11-12","paper":"/paper/m2det-a-single-shot-object-detector-based-on","paper_url":"http://arxiv.org/abs/1811.04533v3","paper_title":"M2Det: A Single-Shot Object Detector based on Multi-Level Feature Pyramid Network","code":"https://github.com/LeeDongYeun/keras-m2det","n_code_links":11,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":186,"model":"LeYOLO (Large@768)","metrics":{"GFLOPs":"8.4","Params (M)":"2.4","box mAP":"41.0"},"uses_additional_data":false,"paper_date":"2024-06-20","paper":"/paper/leyolo-new-scalable-and-efficient-cnn","paper_url":"https://arxiv.org/abs/2406.14239v1","paper_title":"LeYOLO, New Scalable and Efficient CNN Architecture for Object Detection","code":"https://github.com/LilianHollard/LeYOLO","n_code_links":1,"syntology":null},{"rank_in_archive_order":187,"model":"FSAF (ResNet-101, single-scale)","metrics":{"AP50":"61.5","AP75":"44","APL":"51.3","APM":"44.2","APS":"24","Hardware Burden":"38G","box mAP":"40.9"},"uses_additional_data":false,"paper_date":"2019-03-02","paper":"/paper/feature-selective-anchor-free-module-for","paper_url":"http://arxiv.org/abs/1903.00621v1","paper_title":"Feature Selective Anchor-Free Module for Single-Shot Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":8,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":188,"model":"RetinaNet (ResNeXt-101-FPN)","metrics":{"AP50":"61.1","AP75":"44.1","APL":"51.2","APM":"44.2","APS":"24.1","Hardware Burden":"4G","box mAP":"40.8"},"uses_additional_data":false,"paper_date":"2017-08-07","paper":"/paper/focal-loss-for-dense-object-detection","paper_url":"http://arxiv.org/abs/1708.02002v2","paper_title":"Focal Loss for Dense Object Detection","code":"https://github.com/tensorflow/models","n_code_links":234,"syntology":{"n_ran":11,"n_unverified":0,"n_samples":11,"n_pointer_only_licence":6}},{"rank_in_archive_order":189,"model":"Cascade R-CNN (ResNet-50-FPN+, cascade)","metrics":{"AP50":"59.9","AP75":"44","APL":"52.1","APM":"42.7","APS":"22.6","Hardware Burden":"12G","box mAP":"40.6"},"uses_additional_data":false,"paper_date":"2017-12-03","paper":"/paper/cascade-r-cnn-delving-into-high-quality","paper_url":"http://arxiv.org/abs/1712.00726v1","paper_title":"Cascade R-CNN: Delving into High Quality Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":8,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":190,"model":"Faster R-CNN (Cascade RPN)","metrics":{"AP50":"58.9","AP75":"44.5","APL":"52.6","APM":"42.8","APS":"22.0","Hardware Burden":"5G","box mAP":"40.6"},"uses_additional_data":true,"paper_date":"2019-09-15","paper":"/paper/cascade-rpn-delving-into-high-quality-region","paper_url":"https://arxiv.org/abs/1909.06720v2","paper_title":"Cascade RPN: Delving into High-Quality Region Proposal Network with Adaptive Convolution","code":"https://github.com/open-mmlab/mmdetection","n_code_links":2,"syntology":null},{"rank_in_archive_order":191,"model":"ResNet-50-DW-DPN (Deformable Kernels)","metrics":{"APL":"53.3","APM":"43.9","APS":"24.6","box mAP":"40.6"},"uses_additional_data":false,"paper_date":"2019-10-07","paper":"/paper/deformable-kernels-adapting-effective","paper_url":"https://arxiv.org/abs/1910.02940v2","paper_title":"Deformable Kernels: Adapting Effective Receptive Fields for Object Deformation","code":"https://github.com/hangg7/deformable-kernels","n_code_links":2,"syntology":null},{"rank_in_archive_order":192,"model":"IoU-Net","metrics":{"box mAP":"40.6"},"uses_additional_data":false,"paper_date":"2018-07-30","paper":"/paper/acquisition-of-localization-confidence-for","paper_url":"http://arxiv.org/abs/1807.11590v1","paper_title":"Acquisition of Localization Confidence for Accurate Object Detection","code":"https://github.com/vacancy/PreciseRoIPooling","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":16,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":193,"model":"FCOS (HRNetV2p-W48)","metrics":{"AP50":"59.3","APL":"51.0","APM":"42.6","APS":"23.4","Hardware Burden":"16G","Operations per network pass":"27.3G","box mAP":"40.5"},"uses_additional_data":true,"paper_date":"2019-08-20","paper":"/paper/190807919","paper_url":"https://arxiv.org/abs/1908.07919v2","paper_title":"Deep High-Resolution Representation Learning for Visual Recognition","code":"https://github.com/open-mmlab/mmdetection","n_code_links":42,"syntology":{"n_ran":3,"n_unverified":31,"n_samples":34,"n_pointer_only_licence":16}},{"rank_in_archive_order":194,"model":"ResNet-50-FPN Mask R-CNN + KL Loss + var voting + soft-NMS","metrics":{"box mAP":"40.4"},"uses_additional_data":false,"paper_date":"2018-09-23","paper":"/paper/softer-nms-rethinking-bounding-box-regression","paper_url":"http://arxiv.org/abs/1809.08545v3","paper_title":"Bounding Box Regression with Uncertainty for Accurate Object Detection","code":"https://github.com/yihui-he/KL-Loss","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":195,"model":"RDSNet (ResNet-101, RetinaNet, mask, MBRM)","metrics":{"AP50":"60.1","AP75":"43","APL":"51.5","APM":"43.5","APS":"22.1","box mAP":"40.3"},"uses_additional_data":false,"paper_date":"2019-12-11","paper":"/paper/rdsnet-a-new-deep-architecture-for-reciprocal","paper_url":"https://arxiv.org/abs/1912.05070v1","paper_title":"RDSNet: A New Deep Architecture for Reciprocal Object Detection and Instance Segmentation","code":"https://github.com/wangsr126/RDSNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":196,"model":"ExtremeNet (Hourglass-104, single-scale)","metrics":{"AP50":"55.5","AP75":"43.2","APL":"53.1","APM":"43.2","APS":"20.4","Hardware Burden":"180G","box mAP":"40.2"},"uses_additional_data":false,"paper_date":"2019-01-23","paper":"/paper/bottom-up-object-detection-by-grouping","paper_url":"http://arxiv.org/abs/1901.08043v3","paper_title":"Bottom-up Object Detection by Grouping Extreme and Center Points","code":"https://github.com/xingyizhou/ExtremeNet","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":197,"model":"Mask R-CNN (ResNet-101-FPN, CBN)","metrics":{"AP50":"60.5","AP75":"44.1","APL":"38.5","APM":"57.3","APS":"35.8","box mAP":"40.1"},"uses_additional_data":false,"paper_date":"2020-02-13","paper":"/paper/cross-iteration-batch-normalization","paper_url":"https://arxiv.org/abs/2002.05712v3","paper_title":"Cross-Iteration Batch Normalization","code":"https://github.com/Howal/Cross-iterationBatchNorm","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":198,"model":"Fast R-CNN (Cascade RPN)","metrics":{"AP50":"59.4","AP75":"43.8","APL":"51.6","APM":"42.4","APS":"22.1","Hardware Burden":"5G","box mAP":"40.1"},"uses_additional_data":true,"paper_date":"2019-09-15","paper":"/paper/cascade-rpn-delving-into-high-quality-region","paper_url":"https://arxiv.org/abs/1909.06720v2","paper_title":"Cascade RPN: Delving into High-Quality Region Proposal Network with Adaptive Convolution","code":"https://github.com/open-mmlab/mmdetection","n_code_links":2,"syntology":null},{"rank_in_archive_order":199,"model":"Mask R-CNN (ResNeXt-101-FPN)","metrics":{"AP50":"62.3","AP75":"43.4","APL":"51.2","APM":"43.2","APS":"22.1","Hardware Burden":"9G","box mAP":"39.8"},"uses_additional_data":false,"paper_date":"2017-03-20","paper":"/paper/mask-r-cnn","paper_url":"http://arxiv.org/abs/1703.06870v3","paper_title":"Mask R-CNN","code":"https://github.com/tensorflow/models/tree/master/official/vision","n_code_links":179,"syntology":{"n_ran":42,"n_unverified":98,"n_samples":140,"n_pointer_only_licence":23}},{"rank_in_archive_order":200,"model":"GA-Faster-RCNN","metrics":{"AP50":"59.2","AP75":"43.5","APL":"50.7","APM":"42.6","APS":"21.8","box mAP":"39.8"},"uses_additional_data":false,"paper_date":"2019-01-10","paper":"/paper/region-proposal-by-guided-anchoring","paper_url":"http://arxiv.org/abs/1901.03278v2","paper_title":"Region Proposal by Guided Anchoring","code":"https://github.com/open-mmlab/mmdetection","n_code_links":2,"syntology":null},{"rank_in_archive_order":201,"model":"ResNet-50 NAS-FCOS @256","metrics":{"box mAP":"39.8"},"uses_additional_data":false,"paper_date":"2019-06-11","paper":"/paper/nas-fcos-fast-neural-architecture-search-for","paper_url":"https://arxiv.org/abs/1906.04423v4","paper_title":"NAS-FCOS: Fast Neural Architecture Search for Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":202,"model":"A2MIM (ResNet-50 2x)","metrics":{"box mAP":"39.8"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/architecture-agnostic-masked-image-modeling","paper_url":"https://arxiv.org/abs/2205.13943v4","paper_title":"Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN","code":"https://github.com/open-mmlab/mmpretrain","n_code_links":3,"syntology":null},{"rank_in_archive_order":203,"model":"FPN (ResNet101 backbone)","metrics":{"box mAP":"39.5"},"uses_additional_data":false,"paper_date":"2017-08-28","paper":"/paper/chainercv-a-library-for-deep-learning-in","paper_url":"http://arxiv.org/abs/1708.08169v1","paper_title":"ChainerCV: a Library for Deep Learning in Computer Vision","code":"https://github.com/pfnet/chainercv","n_code_links":2,"syntology":null},{"rank_in_archive_order":204,"model":"RetinaMask (ResNet-50-FPN)","metrics":{"AP50":"58.6","AP75":"42.3","APL":"51.0","APM":"42.0","APS":"21.9","Hardware Burden":"9G","box mAP":"39.4"},"uses_additional_data":false,"paper_date":"2019-01-10","paper":"/paper/retinamask-learning-to-predict-masks-improves","paper_url":"http://arxiv.org/abs/1901.03353v1","paper_title":"RetinaMask: Learning to predict masks improves state-of-the-art single-shot detection for free","code":"https://github.com/chengyangfu/retinamask","n_code_links":53,"syntology":null},{"rank_in_archive_order":205,"model":"LeYOLO (Medium@640)","metrics":{"GFLOPs":"5.8","box mAP":"39.3"},"uses_additional_data":false,"paper_date":"2024-06-20","paper":"/paper/leyolo-new-scalable-and-efficient-cnn","paper_url":"https://arxiv.org/abs/2406.14239v1","paper_title":"LeYOLO, New Scalable and Efficient CNN Architecture for Object Detection","code":"https://github.com/LilianHollard/LeYOLO","n_code_links":1,"syntology":null},{"rank_in_archive_order":206,"model":"AA-ResNet-10 + RetinaNet","metrics":{"Operations per network pass":"24.5G","box mAP":"39.2"},"uses_additional_data":false,"paper_date":"2019-04-22","paper":"/paper/190409925","paper_url":"https://arxiv.org/abs/1904.09925v5","paper_title":"Attention Augmented Convolutional Networks","code":"https://github.com/leaderj1001/Attention-Augmented-Conv2d","n_code_links":14,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":1}},{"rank_in_archive_order":207,"model":"MAL (ResNet50, single-scale)","metrics":{"box mAP":"39.2"},"uses_additional_data":false,"paper_date":"2019-12-04","paper":"/paper/multiple-anchor-learning-for-visual-object","paper_url":"https://arxiv.org/abs/1912.02252v1","paper_title":"Multiple Anchor Learning for Visual Object Detection","code":"https://github.com/KevinKecc/MAL","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":9,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":208,"model":"RetinaNet (ResNet-101-FPN)","metrics":{"AP50":"59.1","AP75":"42.3","APL":"50.2","APM":"42.7","APS":"21.8","Hardware Burden":"4G","box mAP":"39.1"},"uses_additional_data":false,"paper_date":"2017-08-07","paper":"/paper/focal-loss-for-dense-object-detection","paper_url":"http://arxiv.org/abs/1708.02002v2","paper_title":"Focal Loss for Dense Object Detection","code":"https://github.com/tensorflow/models","n_code_links":234,"syntology":{"n_ran":11,"n_unverified":0,"n_samples":11,"n_pointer_only_licence":6}},{"rank_in_archive_order":209,"model":"Cascade R-CNN (ResNet-101-FPN+)","metrics":{"AP50":"61.1","AP75":"41.9","APL":"49.8","APM":"41.8","APS":"21.3","Hardware Burden":"3G","box mAP":"38.8"},"uses_additional_data":false,"paper_date":"2017-12-03","paper":"/paper/cascade-r-cnn-delving-into-high-quality","paper_url":"http://arxiv.org/abs/1712.00726v1","paper_title":"Cascade R-CNN: Delving into High Quality Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":8,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":210,"model":"M2Det (ResNet-101, single-scale)","metrics":{"AP50":"59.4","AP75":"41.7","APL":"53.4","APM":"43.9","APS":"20.5","Hardware Burden":"27G","box mAP":"38.8"},"uses_additional_data":false,"paper_date":"2018-11-12","paper":"/paper/m2det-a-single-shot-object-detector-based-on","paper_url":"http://arxiv.org/abs/1811.04533v3","paper_title":"M2Det: A Single-Shot Object Detector based on Multi-Level Feature Pyramid Network","code":"https://github.com/LeeDongYeun/keras-m2det","n_code_links":11,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":211,"model":"SaccadeNet (DLA-34-DCN)","metrics":{"AP50":"55.6","AP75":"41.4","APL":"50.6","APM":"42.1","APS":"19.2","Hardware Burden":"46G","box mAP":"38.5"},"uses_additional_data":false,"paper_date":"2020-03-26","paper":"/paper/saccadenet-a-fast-and-accurate-object","paper_url":"https://arxiv.org/abs/2003.12125v1","paper_title":"SaccadeNet: A Fast and Accurate Object Detector","code":"https://github.com/voidrank/SaccadeNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":212,"model":"Mask R-CNN (ResNet-101-FPN)","metrics":{"AP50":"60.3","AP75":"41.7","APL":"50.2","APM":"41.1","APS":"20.1","Hardware Burden":"9G","box mAP":"38.2"},"uses_additional_data":false,"paper_date":"2017-03-20","paper":"/paper/mask-r-cnn","paper_url":"http://arxiv.org/abs/1703.06870v3","paper_title":"Mask R-CNN","code":"https://github.com/tensorflow/models/tree/master/official/vision","n_code_links":179,"syntology":{"n_ran":42,"n_unverified":98,"n_samples":140,"n_pointer_only_licence":23}},{"rank_in_archive_order":213,"model":"LeYOLO (Small@640)","metrics":{"GFLOPs":"4.51","Params (M)":"1.9","box mAP":"38.2"},"uses_additional_data":false,"paper_date":"2024-06-20","paper":"/paper/leyolo-new-scalable-and-efficient-cnn","paper_url":"https://arxiv.org/abs/2406.14239v1","paper_title":"LeYOLO, New Scalable and Efficient CNN Architecture for Object Detection","code":"https://github.com/LilianHollard/LeYOLO","n_code_links":1,"syntology":null},{"rank_in_archive_order":214,"model":"WSMA-Seg","metrics":{"box mAP":"38.1"},"uses_additional_data":false,"paper_date":"2019-04-30","paper":"/paper/segmentation-is-all-you-need","paper_url":"https://arxiv.org/abs/1904.13300v3","paper_title":"Segmentation is All You Need","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":215,"model":"Faster R-CNN + FPN + CGD","metrics":{"box mAP":"37.9"},"uses_additional_data":false,"paper_date":"2019-07-23","paper":"/paper/compact-global-descriptor-for-neural-networks","paper_url":"https://arxiv.org/abs/1907.09665v10","paper_title":"Compact Global Descriptor for Neural Networks","code":"https://github.com/HolmesShuan/Compact-Global-Descriptor","n_code_links":1,"syntology":null},{"rank_in_archive_order":216,"model":"CornerNet511 (Hourglass-52, single-scale)","metrics":{"AP50":"53.7","AP75":"40.1","APL":"50.5","APM":"39.0","APS":"17.0","box mAP":"37.8"},"uses_additional_data":false,"paper_date":"2018-08-03","paper":"/paper/cornernet-detecting-objects-as-paired","paper_url":"http://arxiv.org/abs/1808.01244v2","paper_title":"CornerNet: Detecting Objects as Paired Keypoints","code":"https://github.com/open-mmlab/mmdetection","n_code_links":5,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":217,"model":"RefineDet512+ (VGG-16)","metrics":{"AP50":"58.7","AP75":"40.8","APL":"48.3","APM":"40.3","APS":"22.7","box mAP":"37.6"},"uses_additional_data":false,"paper_date":"2017-11-18","paper":"/paper/single-shot-refinement-neural-network-for","paper_url":"http://arxiv.org/abs/1711.06897v3","paper_title":"Single-Shot Refinement Neural Network for Object Detection","code":"https://github.com/sfzhang15/RefineDet","n_code_links":16,"syntology":null},{"rank_in_archive_order":218,"model":"DeformConv-R-FCN (Aligned-Inception-ResNet)","metrics":{"AP50":"58.0","APL":"52.5","APM":"40.1","APS":"19.4","box mAP":"37.5"},"uses_additional_data":false,"paper_date":"2017-03-17","paper":"/paper/deformable-convolutional-networks","paper_url":"http://arxiv.org/abs/1703.06211v3","paper_title":"Deformable Convolutional Networks","code":"https://github.com/open-mmlab/mmdetection","n_code_links":38,"syntology":{"n_ran":3,"n_unverified":6,"n_samples":9,"n_pointer_only_licence":3}},{"rank_in_archive_order":219,"model":"Faster R-CNN (ImageNet+300M)","metrics":{"AP50":"58","AP75":"40.1","APL":"51.2","APM":"41.1","APS":"17.5","box mAP":"37.4"},"uses_additional_data":false,"paper_date":"2017-07-10","paper":"/paper/revisiting-unreasonable-effectiveness-of-data","paper_url":"http://arxiv.org/abs/1707.02968v2","paper_title":"Revisiting Unreasonable Effectiveness of Data in Deep Learning Era","code":"https://github.com/Tencent/tencent-ml-images","n_code_links":2,"syntology":null},{"rank_in_archive_order":220,"model":"Mask R-CNN (Bottleneck-injected ResNet-50, FPN)","metrics":{"box mAP":"36.9"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/torchdistill-a-modular-configuration-driven","paper_url":"https://arxiv.org/abs/2011.12913v2","paper_title":"torchdistill: A Modular, Configuration-Driven Framework for Knowledge Distillation","code":"https://github.com/yoshitomo-matsubara/torchdistill","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":16,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":221,"model":"Faster R-CNN + TDM","metrics":{"box mAP":"36.8"},"uses_additional_data":false,"paper_date":"2016-12-20","paper":"/paper/beyond-skip-connections-top-down-modulation","paper_url":"http://arxiv.org/abs/1612.06851v2","paper_title":"Beyond Skip Connections: Top-Down Modulation for Object Detection","code":"https://github.com/MTCloudVision/mxnet-dssd","n_code_links":1,"syntology":null},{"rank_in_archive_order":222,"model":"Cascade R-CNN (ResNet-50-FPN+)","metrics":{"AP50":"59","AP75":"39.2","APL":"46.4","APM":"38.8","APS":"20.3","Hardware Burden":"3G","box mAP":"36.5"},"uses_additional_data":false,"paper_date":"2017-12-03","paper":"/paper/cascade-r-cnn-delving-into-high-quality","paper_url":"http://arxiv.org/abs/1712.00726v1","paper_title":"Cascade R-CNN: Delving into High Quality Object Detection","code":"https://github.com/open-mmlab/mmdetection","n_code_links":8,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":223,"model":"RefineDet512 (ResNet-101)","metrics":{"AP50":"57.5","AP75":"39.5","APL":"51.4","APM":"39.9","APS":"16.6","box mAP":"36.4"},"uses_additional_data":false,"paper_date":"2017-11-18","paper":"/paper/single-shot-refinement-neural-network-for","paper_url":"http://arxiv.org/abs/1711.06897v3","paper_title":"Single-Shot Refinement Neural Network for Object Detection","code":"https://github.com/sfzhang15/RefineDet","n_code_links":16,"syntology":null},{"rank_in_archive_order":224,"model":"Faster R-CNN + FPN","metrics":{"Hardware Burden":"2G","box mAP":"36.2"},"uses_additional_data":true,"paper_date":"2016-12-09","paper":"/paper/feature-pyramid-networks-for-object-detection","paper_url":"http://arxiv.org/abs/1612.03144v2","paper_title":"Feature Pyramid Networks for Object Detection","code":"https://github.com/PaddlePaddle/PaddleOCR","n_code_links":85,"syntology":{"n_ran":16,"n_unverified":35,"n_samples":51,"n_pointer_only_licence":11}},{"rank_in_archive_order":225,"model":"Faster R-CNN (Bottleneck-injected ResNet-50 and FPN)","metrics":{"box mAP":"35.9"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/torchdistill-a-modular-configuration-driven","paper_url":"https://arxiv.org/abs/2011.12913v2","paper_title":"torchdistill: A Modular, Configuration-Driven Framework for Knowledge Distillation","code":"https://github.com/yoshitomo-matsubara/torchdistill","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":16,"n_samples":26,"n_pointer_only_licence":0}}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":131,"rows_with_any_sample_ran":110,"distinct_papers_with_graph_line":72,"distinct_papers_with_any_sample_ran":57,"samples_over_distinct_papers":{"n_ran":405,"n_unverified":1049,"n_samples":1454,"n_pointer_only_licence":224,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":742,"n_unverified":1727,"n_samples":2469,"n_pointer_only_licence":437,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}