{"url":"/sota/object-detection-on-crowdhuman-full-body","task":{"name":"Object Detection","url":"/task/object-detection","note":null},"dataset":{"name":"CrowdHuman (full body)","url":"/dataset/crowdhuman"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":null,"description_from":null,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["AP","mMR","Recall"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"AP":"higher","mMR":null,"Recall":"higher"}},"counts":{"rows":19,"rows_with_code":12,"rows_with_paper_page":19,"rows_dated":19,"rows_using_additional_data":0},"rows":[{"rank_in_archive_order":1,"model":"InternImage-H","metrics":{"AP":"97.2"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"MMPedestron","metrics":{"AP":"97.1","mMR":"30.8"},"uses_additional_data":false,"paper_date":"2024-07-14","paper":"/paper/when-pedestrian-detection-meets-multi-modal","paper_url":"https://arxiv.org/abs/2407.10125v1","paper_title":"When Pedestrian Detection Meets Multi-Modal Learning: Generalist Model and Benchmark Dataset","code":"https://github.com/BubblyYi/MMPedestron","n_code_links":1,"syntology":null},{"rank_in_archive_order":3,"model":"Progressive DETR","metrics":{"AP":"94.1","mMR":"37.7"},"uses_additional_data":false,"paper_date":"2022-03-15","paper":"/paper/progressive-end-to-end-object-detection-in","paper_url":"https://arxiv.org/abs/2203.07669v3","paper_title":"Progressive End-to-End Object Detection in Crowded Scenes","code":"https://github.com/megvii-model/iter-e2edet","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"DDQ DETR (R50)","metrics":{"AP":"93.8","Recall":"98.7","mMR":"39.7"},"uses_additional_data":false,"paper_date":"2023-03-22","paper":"/paper/dense-distinct-query-for-end-to-end-object","paper_url":"https://arxiv.org/abs/2303.12776v2","paper_title":"Dense Distinct Query for End-to-End Object Detection","code":"https://github.com/jshilong/ddq","n_code_links":2,"syntology":null},{"rank_in_archive_order":5,"model":"DDQ R-CNN (R50)","metrics":{"AP":"93.5","Recall":"98.6","mMR":"40.4"},"uses_additional_data":false,"paper_date":"2023-03-22","paper":"/paper/dense-distinct-query-for-end-to-end-object","paper_url":"https://arxiv.org/abs/2303.12776v2","paper_title":"Dense Distinct Query for End-to-End Object Detection","code":"https://github.com/jshilong/ddq","n_code_links":2,"syntology":null},{"rank_in_archive_order":6,"model":"Hulk(Finetune, ViT-L)","metrics":{"AP":"93","mMR":"36.5"},"uses_additional_data":false,"paper_date":"2023-12-04","paper":"/paper/hulk-a-universal-knowledge-translator-for","paper_url":"https://arxiv.org/abs/2312.01697v4","paper_title":"Hulk: A Universal Knowledge Translator for Human-Centric Tasks","code":"https://github.com/opengvlab/humanbench","n_code_links":2,"syntology":{"n_ran":12,"n_unverified":12,"n_samples":24,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"DDQ FCN (R50 One-Stage)","metrics":{"AP":"92.7","Recall":"98.2","mMR":"41.0"},"uses_additional_data":false,"paper_date":"2023-03-22","paper":"/paper/dense-distinct-query-for-end-to-end-object","paper_url":"https://arxiv.org/abs/2303.12776v2","paper_title":"Dense Distinct Query for End-to-End Object Detection","code":"https://github.com/jshilong/ddq","n_code_links":2,"syntology":null},{"rank_in_archive_order":8,"model":"UniHCP (finetune)","metrics":{"AP":"92.5","mMR":"41.6"},"uses_additional_data":false,"paper_date":"2023-03-06","paper":"/paper/unihcp-a-unified-model-for-human-centric","paper_url":"https://arxiv.org/abs/2303.02936v4","paper_title":"UniHCP: A Unified Model for Human-Centric Perceptions","code":"https://github.com/opengvlab/unihcp","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":6,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"Hulk(Finetune, ViT-B)","metrics":{"AP":"92.4","mMR":"40.7"},"uses_additional_data":false,"paper_date":"2023-12-04","paper":"/paper/hulk-a-universal-knowledge-translator-for","paper_url":"https://arxiv.org/abs/2312.01697v4","paper_title":"Hulk: A Universal Knowledge Translator for Human-Centric Tasks","code":"https://github.com/opengvlab/humanbench","n_code_links":2,"syntology":{"n_ran":12,"n_unverified":12,"n_samples":24,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"V2F-Net","metrics":{"AP":"91.03","Recall":"84.2","mMR":"42.28"},"uses_additional_data":false,"paper_date":"2021-04-07","paper":"/paper/v2f-net-explicit-decomposition-of-occluded","paper_url":"https://arxiv.org/abs/2104.03106v1","paper_title":"V2F-Net: Explicit Decomposition of Occluded Pedestrian Detection","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":11,"model":"CrowdDet","metrics":{"AP":"90.7","mMR":"41.4"},"uses_additional_data":false,"paper_date":"2020-03-20","paper":"/paper/detection-in-crowded-scenes-one-proposal","paper_url":"https://arxiv.org/abs/2003.09163v2","paper_title":"Detection in Crowded Scenes: One Proposal, Multiple Predictions","code":"https://github.com/tusimple/simpledet","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":12,"model":"Beta R-CNN","metrics":{"AP":"89.6","mMR":"40.3"},"uses_additional_data":false,"paper_date":"2022-10-23","paper":"/paper/beta-r-cnn-looking-into-pedestrian-detection-1","paper_url":"https://arxiv.org/abs/2210.12758v1","paper_title":"Beta R-CNN: Looking into Pedestrian Detection from Another Perspective","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":13,"model":"NOH-NMS","metrics":{"AP":"89.0","mMR":"43.9"},"uses_additional_data":false,"paper_date":"2020-07-27","paper":"/paper/noh-nms-improving-pedestrian-detection-by","paper_url":"https://arxiv.org/abs/2007.13376v1","paper_title":"NOH-NMS: Improving Pedestrian Detection by Nearby Objects Hallucination","code":"https://github.com/TencentYoutuResearch/PedestrianDetection-NohNMS","n_code_links":1,"syntology":null},{"rank_in_archive_order":14,"model":"IterDet (Faster RCNN, ResNet50, 2 iterations)","metrics":{"AP":"88.08","mMR":"49.44"},"uses_additional_data":false,"paper_date":"2020-05-12","paper":"/paper/iterdet-iterative-scheme-for-objectdetection","paper_url":"https://arxiv.org/abs/2005.05708v2","paper_title":"IterDet: Iterative Scheme for Object Detection in Crowded Environments","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":15,"model":"PS-RCNN (Faster RCNN, ResNet50, COCO Instance Masks","metrics":{"AP":"87.94"},"uses_additional_data":false,"paper_date":"2020-03-16","paper":"/paper/ps-rcnn-detecting-secondary-human-instances","paper_url":"https://arxiv.org/abs/2003.07080v1","paper_title":"PS-RCNN: Detecting Secondary Human Instances in a Crowd via Primary Object Suppression","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":16,"model":"PS-RCNN (Faster RCNN, ResNet50)","metrics":{"AP":"86.05"},"uses_additional_data":false,"paper_date":"2020-03-16","paper":"/paper/ps-rcnn-detecting-secondary-human-instances","paper_url":"https://arxiv.org/abs/2003.07080v1","paper_title":"PS-RCNN: Detecting Secondary Human Instances in a Crowd via Primary Object Suppression","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":17,"model":"Faster RCNN (ResNet50)","metrics":{"AP":"84.95","mMR":"50.49"},"uses_additional_data":false,"paper_date":"2018-04-30","paper":"/paper/crowdhuman-a-benchmark-for-detecting-human-in","paper_url":"http://arxiv.org/abs/1805.00123v1","paper_title":"CrowdHuman: A Benchmark for Detecting Human in a Crowd","code":"https://github.com/aibeedetect/bfjdet","n_code_links":1,"syntology":null},{"rank_in_archive_order":18,"model":"Adaptive NMS (Faster RCNN, ResNet50)","metrics":{"AP":"84.71","mMR":"49.73"},"uses_additional_data":false,"paper_date":"2019-04-07","paper":"/paper/adaptive-nms-refining-pedestrian-detection-in","paper_url":"http://arxiv.org/abs/1904.03629v1","paper_title":"Adaptive NMS: Refining Pedestrian Detection in a Crowd","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":19,"model":"IterDet (Faster RCNN, ResNet50, 1 iteration)","metrics":{"AP":"84.43","mMR":"49.12"},"uses_additional_data":false,"paper_date":"2020-05-12","paper":"/paper/iterdet-iterative-scheme-for-objectdetection","paper_url":"https://arxiv.org/abs/2005.05708v2","paper_title":"IterDet: Iterative Scheme for Object Detection in Crowded Environments","code":null,"n_code_links":0,"syntology":null}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":6,"rows_with_any_sample_ran":5,"distinct_papers_with_graph_line":5,"distinct_papers_with_any_sample_ran":4,"samples_over_distinct_papers":{"n_ran":22,"n_unverified":30,"n_samples":52,"n_pointer_only_licence":0,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":34,"n_unverified":42,"n_samples":76,"n_pointer_only_licence":0,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}