{"url":"/sota/multi-person-pose-estimation-on-crowdpose","task":{"name":"Multi-Person Pose Estimation","url":"/task/multi-person-pose-estimation","note":null},"dataset":{"name":"CrowdPose","url":"/dataset/crowdpose"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":"Multi-person pose estimation is the task of estimating the pose of multiple people in one frame.\r\n\r\n<span style=\"color:grey; opacity: 0.6\">( Image credit: [Human Pose Estimation with TensorFlow\r\n](https://github.com/eldar/pose-tensorflow) )</span>","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["mAP @0.5:0.95","AP Easy","AP Medium","AP Hard","FPS"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"mAP @0.5:0.95":"higher","AP Easy":"higher","AP Medium":"higher","AP Hard":"higher","FPS":null}},"counts":{"rows":28,"rows_with_code":26,"rows_with_paper_page":28,"rows_dated":28,"rows_using_additional_data":4},"rows":[{"rank_in_archive_order":1,"model":"RTMO-l","metrics":{"AP Easy":"88.8","AP Hard":"77.2","AP Medium":"84.7","FPS":"52.4","mAP @0.5:0.95":"83.8"},"uses_additional_data":true,"paper_date":"2023-12-12","paper":"/paper/rtmo-towards-high-performance-one-stage-real","paper_url":"https://arxiv.org/abs/2312.07526v2","paper_title":"RTMO: Towards High-Performance One-Stage Real-Time Multi-Person Pose Estimation","code":"https://github.com/open-mmlab/mmpose","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"BUCTD-W48 (w/cond. input from PETR, and generative sampling)","metrics":{"AP Easy":"83.9","AP Hard":"72.3","AP Medium":"79.0","mAP @0.5:0.95":"78.5"},"uses_additional_data":false,"paper_date":"2023-06-13","paper":"/paper/rethinking-pose-estimation-in-crowds","paper_url":"https://arxiv.org/abs/2306.07879v2","paper_title":"Rethinking pose estimation in crowds: overcoming the detection information-bottleneck and ambiguity","code":"https://github.com/amathislab/BUCTD","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"I²R-Net (1st stage: HRFormer-B)","metrics":{"AP Easy":"83.8","AP Hard":"69.3","AP Medium":"78.1","mAP @0.5:0.95":"77.4"},"uses_additional_data":false,"paper_date":"2022-06-22","paper":"/paper/i-2r-net-intra-and-inter-human-relation","paper_url":"https://arxiv.org/abs/2206.10892v2","paper_title":"I^2R-Net: Intra- and Inter-Human Relation Network for Multi-Person Pose Estimation","code":"https://github.com/leijue222/Intra-and-Inter-Human-Relation-Network-for-MPEE","n_code_links":1,"syntology":null},{"rank_in_archive_order":4,"model":"ED-Pose (Swin-L)","metrics":{"AP Easy":"83.0","AP Hard":"68.3","AP Medium":"77.3","mAP @0.5:0.95":"76.6"},"uses_additional_data":true,"paper_date":"2023-02-03","paper":"/paper/explicit-box-detection-unifies-end-to-end","paper_url":"https://arxiv.org/abs/2302.01593v1","paper_title":"Explicit Box Detection Unifies End-to-End Multi-Person Pose Estimation","code":"https://github.com/idea-research/ed-pose","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":5,"model":"DETRPose-X","metrics":{"AP Easy":"81.3","AP Hard":"68.1","AP Medium":"75.7","mAP @0.5:0.95":"75.1"},"uses_additional_data":false,"paper_date":"2025-06-16","paper":"/paper/detrpose-real-time-end-to-end-transformer","paper_url":"https://arxiv.org/abs/2506.13027v1","paper_title":"DETRPose: Real-time end-to-end transformer model for multi-person pose estimation","code":"https://github.com/SebastianJanampa/DETRPose","n_code_links":1,"syntology":null},{"rank_in_archive_order":6,"model":"DETRPose-L","metrics":{"AP Easy":"79.5","AP Hard":"66.1","AP Medium":"74.0","mAP @0.5:0.95":"73.3"},"uses_additional_data":false,"paper_date":"2025-06-16","paper":"/paper/detrpose-real-time-end-to-end-transformer","paper_url":"https://arxiv.org/abs/2506.13027v1","paper_title":"DETRPose: Real-time end-to-end transformer model for multi-person pose estimation","code":"https://github.com/SebastianJanampa/DETRPose","n_code_links":1,"syntology":null},{"rank_in_archive_order":7,"model":"HRFormer-B","metrics":{"AP Easy":"80.0","AP Hard":"62.4","AP Medium":"73.5","mAP @0.5:0.95":"72.4"},"uses_additional_data":false,"paper_date":"2021-10-18","paper":"/paper/hrformer-high-resolution-transformer-for","paper_url":"https://arxiv.org/abs/2110.09408v3","paper_title":"HRFormer: High-Resolution Transformer for Dense Prediction","code":"https://github.com/HRNet/HRFormer","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":4,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"BAPose (W32)","metrics":{"AP Easy":"79.9","AP Hard":"61.3","AP Medium":"73.4","mAP @0.5:0.95":"72.2"},"uses_additional_data":false,"paper_date":"2021-12-20","paper":"/paper/bapose-bottom-up-pose-estimation-with","paper_url":"https://arxiv.org/abs/2112.10716v1","paper_title":"BAPose: Bottom-Up Pose Estimation with Disentangled Waterfall Representations","code":"https://github.com/bmartacho/BAPose","n_code_links":1,"syntology":null},{"rank_in_archive_order":9,"model":"DETRPose-M","metrics":{"AP Easy":"78.6","AP Hard":"64.5","AP Medium":"72.6","mAP @0.5:0.95":"72.0"},"uses_additional_data":false,"paper_date":"2025-06-16","paper":"/paper/detrpose-real-time-end-to-end-transformer","paper_url":"https://arxiv.org/abs/2506.13027v1","paper_title":"DETRPose: Real-time end-to-end transformer model for multi-person pose estimation","code":"https://github.com/SebastianJanampa/DETRPose","n_code_links":1,"syntology":null},{"rank_in_archive_order":10,"model":"TransPose-H","metrics":{"AP Easy":"79.5","AP Hard":"62.2","AP Medium":"72.9","mAP @0.5:0.95":"71.8"},"uses_additional_data":false,"paper_date":"2020-12-28","paper":"/paper/transpose-towards-explainable-human-pose","paper_url":"https://arxiv.org/abs/2012.14214v5","paper_title":"TransPose: Keypoint Localization via Transformer","code":"https://github.com/yangsenius/TransPose","n_code_links":1,"syntology":null},{"rank_in_archive_order":11,"model":"SCIO (HRNet-48)","metrics":{"AP Medium":"72.2","mAP @0.5:0.95":"71.5"},"uses_additional_data":false,"paper_date":"2022-07-06","paper":"/paper/self-constrained-inference-optimization-on","paper_url":"https://arxiv.org/abs/2207.02425v1","paper_title":"Self-Constrained Inference Optimization on Structural Groups for Human Pose Estimation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":12,"model":"HigherHRNet (ScaleNet_P4)","metrics":{"mAP @0.5:0.95":"71.3"},"uses_additional_data":true,"paper_date":"2020-11-30","paper":"/paper/scalenas-one-shot-learning-of-scale-aware","paper_url":"https://arxiv.org/abs/2011.14584v1","paper_title":"ScaleNAS: One-Shot Learning of Scale-Aware Representations for Visual Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":13,"model":"MIPNet (HRNet-W48)","metrics":{"AP Easy":"78.1","AP Hard":"59.4","AP Medium":"71.1","mAP @0.5:0.95":"70.0"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/multi-hypothesis-pose-networks-rethinking-top","paper_url":"https://arxiv.org/abs/2101.11223v3","paper_title":"Multi-Instance Pose Networks: Rethinking Top-Down Pose Estimation","code":"https://github.com/rawalkhirodkar/MIPNet","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":14,"model":"CenterGroup","metrics":{"AP Easy":"76.6","AP Hard":"61.5","AP Medium":"70.0","mAP @0.5:0.95":"69.4"},"uses_additional_data":false,"paper_date":"2021-10-11","paper":"/paper/the-center-of-attention-center-keypoint-1","paper_url":"https://arxiv.org/abs/2110.05132v1","paper_title":"The Center of Attention: Center-Keypoint Grouping via Attention for Multi-Person Pose Estimation","code":"https://github.com/dvl-tum/center-group","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"HigherHRNet(HR-Net-48)","metrics":{"AP Easy":"75.8","AP Hard":"58.9","AP Medium":"68.1","FPS":"-","mAP @0.5:0.95":"67.6"},"uses_additional_data":true,"paper_date":"2019-08-27","paper":"/paper/bottom-up-higher-resolution-networks-for","paper_url":"https://arxiv.org/abs/1908.10357v3","paper_title":"HigherHRNet: Scale-Aware Representation Learning for Bottom-Up Human Pose Estimation","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":19,"syntology":{"n_ran":5,"n_unverified":22,"n_samples":27,"n_pointer_only_licence":0}},{"rank_in_archive_order":16,"model":"DETRPose-S","metrics":{"AP Easy":"74.7","AP Hard":"59.3","AP Medium":"68.1","mAP @0.5:0.95":"67.4"},"uses_additional_data":false,"paper_date":"2025-06-16","paper":"/paper/detrpose-real-time-end-to-end-transformer","paper_url":"https://arxiv.org/abs/2506.13027v1","paper_title":"DETRPose: Real-time end-to-end transformer model for multi-person pose estimation","code":"https://github.com/SebastianJanampa/DETRPose","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"Joint-candidate SPPE +","metrics":{"AP Easy":"75.5","AP Hard":"57.4","AP Medium":"66.3","FPS":"10.1","mAP @0.5:0.95":"66.0"},"uses_additional_data":false,"paper_date":"2018-12-02","paper":"/paper/crowdpose-efficient-crowded-scenes-pose","paper_url":"http://arxiv.org/abs/1812.00324v2","paper_title":"CrowdPose: Efficient Crowded Scenes Pose Estimation and A New Benchmark","code":"https://github.com/open-mmlab/mmpose","n_code_links":4,"syntology":null},{"rank_in_archive_order":18,"model":"OccNet","metrics":{"AP Easy":"75.2","AP Hard":"53.1","AP Medium":"66.6","mAP @0.5:0.95":"65.5"},"uses_additional_data":false,"paper_date":"2019-07-16","paper":"/paper/human-pose-estimation-for-real-world-crowded","paper_url":"https://arxiv.org/abs/1907.06922v1","paper_title":"Human Pose Estimation for Real-World Crowded Scenarios","code":"https://github.com/thomasgolda/Human-Pose-Estimation-for-Real-World-Crowded-Scenarios","n_code_links":1,"syntology":null},{"rank_in_archive_order":19,"model":"Hourglass-104","metrics":{"AP Easy":"73.8","AP Hard":"54.8","AP Medium":"66.2","FPS":"14.7 (21.4)","mAP @0.5:0.95":"65.2"},"uses_additional_data":false,"paper_date":"2021-07-07","paper":"/paper/greedy-offset-guided-keypoint-grouping-for","paper_url":"https://arxiv.org/abs/2107.03098v2","paper_title":"Greedy Offset-Guided Keypoint Grouping for Human Pose Estimation","code":"https://github.com/hellojialee/OffsetGuided","n_code_links":1,"syntology":null},{"rank_in_archive_order":20,"model":"SPM","metrics":{"AP Easy":"70.3","AP Hard":"55.7","AP Medium":"64.5","mAP @0.5:0.95":"63.7"},"uses_additional_data":false,"paper_date":"2019-08-24","paper":"/paper/single-stage-multi-person-pose-machines","paper_url":"https://arxiv.org/abs/1908.09220v1","paper_title":"Single-Stage Multi-Person Pose Machines","code":"https://github.com/murdockhou/Single-Stage-Multi-person-Pose-Machines","n_code_links":1,"syntology":null},{"rank_in_archive_order":21,"model":"AlphaPose","metrics":{"AP Easy":"71.2","AP Hard":"51.1","AP Medium":"61.4","mAP @0.5:0.95":"61.0"},"uses_additional_data":false,"paper_date":"2016-12-01","paper":"/paper/rmpe-regional-multi-person-pose-estimation","paper_url":"http://arxiv.org/abs/1612.00137v5","paper_title":"RMPE: Regional Multi-person Pose Estimation","code":"https://github.com/MVIG-SJTU/AlphaPose","n_code_links":14,"syntology":null},{"rank_in_archive_order":22,"model":"Simple baseline","metrics":{"AP Easy":"71.4","AP Hard":"51.2","AP Medium":"61.2","mAP @0.5:0.95":"60.8"},"uses_additional_data":false,"paper_date":"2018-04-17","paper":"/paper/simple-baselines-for-human-pose-estimation","paper_url":"http://arxiv.org/abs/1804.06208v2","paper_title":"Simple Baselines for Human Pose Estimation and Tracking","code":"https://github.com/PaddlePaddle/PaddleDetection","n_code_links":27,"syntology":null},{"rank_in_archive_order":23,"model":"ROMP+CAR","metrics":{"mAP @0.5:0.95":"58.6"},"uses_additional_data":false,"paper_date":"2020-08-27","paper":"/paper/centerhmr-a-bottom-up-single-shot-method-for","paper_url":"https://arxiv.org/abs/2008.12272v4","paper_title":"Monocular, One-stage, Regression of Multiple 3D People","code":"https://github.com/Arthur151/ROMP","n_code_links":2,"syntology":null},{"rank_in_archive_order":24,"model":"LitePose-S","metrics":{"mAP @0.5:0.95":"58.3"},"uses_additional_data":false,"paper_date":"2022-05-03","paper":"/paper/lite-pose-efficient-architecture-design-for","paper_url":"https://arxiv.org/abs/2205.01271v4","paper_title":"Lite Pose: Efficient Architecture Design for 2D Human Pose Estimation","code":"https://github.com/mit-han-lab/litepose","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":25,"model":"Mask R-CNN","metrics":{"AP Easy":"69.4","AP Hard":"45.8","AP Medium":"57.9","mAP @0.5:0.95":"57.2"},"uses_additional_data":false,"paper_date":"2017-03-20","paper":"/paper/mask-r-cnn","paper_url":"http://arxiv.org/abs/1703.06870v3","paper_title":"Mask R-CNN","code":"https://github.com/tensorflow/models/tree/master/official/vision","n_code_links":179,"syntology":{"n_ran":42,"n_unverified":98,"n_samples":140,"n_pointer_only_licence":23}},{"rank_in_archive_order":26,"model":"DETRPose-N","metrics":{"AP Easy":"65.0","AP Hard":"46,6","AP Medium":"56,6","mAP @0.5:0.95":"56.0"},"uses_additional_data":false,"paper_date":"2025-06-16","paper":"/paper/detrpose-real-time-end-to-end-transformer","paper_url":"https://arxiv.org/abs/2506.13027v1","paper_title":"DETRPose: Real-time end-to-end transformer model for multi-person pose estimation","code":"https://github.com/SebastianJanampa/DETRPose","n_code_links":1,"syntology":null},{"rank_in_archive_order":27,"model":"ROMP","metrics":{"mAP @0.5:0.95":"55.6"},"uses_additional_data":false,"paper_date":"2020-08-27","paper":"/paper/centerhmr-a-bottom-up-single-shot-method-for","paper_url":"https://arxiv.org/abs/2008.12272v4","paper_title":"Monocular, One-stage, Regression of Multiple 3D People","code":"https://github.com/Arthur151/ROMP","n_code_links":2,"syntology":null},{"rank_in_archive_order":28,"model":"OpenPose","metrics":{"AP Easy":"62.7","AP Hard":"32.3","AP Medium":"58.7"},"uses_additional_data":false,"paper_date":"2018-12-18","paper":"/paper/openpose-realtime-multi-person-2d-pose","paper_url":"https://arxiv.org/abs/1812.08008v2","paper_title":"OpenPose: Realtime Multi-Person 2D Pose Estimation using Part Affinity Fields","code":"https://github.com/CMU-Perceptual-Computing-Lab/openpose","n_code_links":51,"syntology":{"n_ran":3,"n_unverified":13,"n_samples":16,"n_pointer_only_licence":2}}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":9,"rows_with_any_sample_ran":8,"distinct_papers_with_graph_line":9,"distinct_papers_with_any_sample_ran":8,"samples_over_distinct_papers":{"n_ran":67,"n_unverified":142,"n_samples":209,"n_pointer_only_licence":26,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":67,"n_unverified":142,"n_samples":209,"n_pointer_only_licence":26,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}