{"url":"/sota/3d-human-pose-estimation-on-human36m","task":{"name":"3D Human Pose Estimation","url":"/task/3d-human-pose-estimation","note":null},"dataset":{"name":"Human3.6M","url":"/dataset/human3-6m"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":"**3D Human Pose Estimation** is a computer vision task that involves estimating the 3D positions and orientations of body joints and bones from 2D images or videos. The goal is to reconstruct the 3D pose of a person in real-time, which can be used in a variety of applications, such as virtual reality, human-computer interaction, and motion analysis.","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Average MPJPE (mm)","Using 2D ground-truth joints","Multi-View or Monocular","PA-MPJPE","Acceleration Error","Angular Error","MPVE (mm)"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Average MPJPE (mm)":null,"Using 2D ground-truth joints":null,"Multi-View or Monocular":null,"PA-MPJPE":null,"Acceleration Error":"lower","Angular Error":"lower","MPVE (mm)":null}},"counts":{"rows":88,"rows_with_code":65,"rows_with_paper_page":88,"rows_dated":88,"rows_using_additional_data":0},"rows":[{"rank_in_archive_order":1,"model":"LMT R152 384x384","metrics":{"Angular Error":"11.33","Average MPJPE (mm)":"17.59","MPVE (mm)":"23.7","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-08-24","paper":"/paper/learnable-human-mesh-triangulation-for-3d","paper_url":"https://arxiv.org/abs/2208.11251v1","paper_title":"Learnable human mesh triangulation for 3D human pose and shape estimation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":2,"model":"Geometry-Biased Transformer (HRNet)","metrics":{"Average MPJPE (mm)":"26.0","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2023-12-28","paper":"/paper/geometry-biased-transformer-for-robust-multi","paper_url":"https://arxiv.org/abs/2312.17106v1","paper_title":"Geometry-Biased Transformer for Robust Multi-View 3D Human Pose Reconstruction","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":3,"model":"Epipolar Transformer+R50 256×256+RPSM","metrics":{"Average MPJPE (mm)":"26.9","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2020-05-10","paper":"/paper/epipolar-transformers","paper_url":"https://arxiv.org/abs/2005.04551v1","paper_title":"Epipolar Transformers","code":"https://github.com/yihui-he/epipolar-transformers","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"MTF-Transformer (M=0.4, T=7)","metrics":{"Average MPJPE (mm)":"28.5","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-10-11","paper":"/paper/adaptively-multi-view-and-temporal-fusing","paper_url":"https://arxiv.org/abs/2110.05092v2","paper_title":"Adaptive Multi-view and Temporal Fusing Transformer for 3D Human Pose Estimation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":5,"model":"Generalizable Human Pose Triangulation","metrics":{"Average MPJPE (mm)":"29.1","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-10-01","paper":"/paper/stochastic-modeling-for-learnable-human-pose","paper_url":"https://arxiv.org/abs/2110.00280v3","paper_title":"Generalizable Human Pose Triangulation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":6,"model":"MTF-Transformer (M=0.4, T=1)","metrics":{"Average MPJPE (mm)":"29.4","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-10-11","paper":"/paper/adaptively-multi-view-and-temporal-fusing","paper_url":"https://arxiv.org/abs/2110.05092v2","paper_title":"Adaptive Multi-view and Temporal Fusing Transformer for 3D Human Pose Estimation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":7,"model":"SmartEdgeSensor","metrics":{"Average MPJPE (mm)":"29.8","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-06-28","paper":"/paper/real-time-multi-view-3d-human-pose-estimation","paper_url":"https://arxiv.org/abs/2106.14729v1","paper_title":"Real-Time Multi-View 3D Human Pose Estimation using Semantic Feedback to Smart Edge Sensors","code":"https://github.com/AIS-Bonn/SmartEdgeSensor3DHumanPose","n_code_links":1,"syntology":null},{"rank_in_archive_order":8,"model":"LWCDR","metrics":{"Average MPJPE (mm)":"30.2","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2020-04-05","paper":"/paper/lightweight-multi-view-3d-pose-estimation","paper_url":"https://arxiv.org/abs/2004.02186v2","paper_title":"Lightweight Multi-View 3D Pose Estimation through Camera-Disentangled Representation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":9,"model":"LMT R50 224x224","metrics":{"Angular Error":"14.61","Average MPJPE (mm)":"30.56","MPVE (mm)":"42.28","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-08-24","paper":"/paper/learnable-human-mesh-triangulation-for-3d","paper_url":"https://arxiv.org/abs/2208.11251v1","paper_title":"Learnable human mesh triangulation for 3D human pose and shape estimation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":10,"model":"FLEX","metrics":{"Average MPJPE (mm)":"30.9","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-05-05","paper":"/paper/flex-parameter-free-multi-view-3d-human","paper_url":"https://arxiv.org/abs/2105.01937v4","paper_title":"FLEX: Extrinsic Parameters-free Multi-view 3D Human Motion Reconstruction","code":"https://github.com/BrianG13/FLEX","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":11,"model":"Fusion-RPSM (t=10)","metrics":{"Average MPJPE (mm)":"31.17","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-09-03","paper":"/paper/cross-view-fusion-for-3d-human-pose","paper_url":"https://arxiv.org/abs/1909.01203v1","paper_title":"Cross View Fusion for 3D Human Pose Estimation","code":"https://github.com/microsoft/multiview-human-pose-estimation-pytorch","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":12,"model":"KTPFormer (T=243)","metrics":{"Average MPJPE (mm)":"33.0","Multi-View or Monocular":"Monocular","PA-MPJPE":"26.2","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2024-03-31","paper":"/paper/ktpformer-kinematics-and-trajectory-prior","paper_url":"https://arxiv.org/abs/2404.00658v2","paper_title":"KTPFormer: Kinematics and Trajectory Prior Knowledge-Enhanced Transformer for 3D Human Pose Estimation","code":"https://github.com/JihuaPeng/KTPFormer","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":10}},{"rank_in_archive_order":13,"model":"DiffPhy (W=480)","metrics":{"Average MPJPE (mm)":"33.4","Multi-View or Monocular":"Monocular","PA-MPJPE":"21.9","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-05-24","paper":"/paper/differentiable-dynamics-for-articulated-3d","paper_url":"https://arxiv.org/abs/2205.12256v1","paper_title":"Differentiable Dynamics for Articulated 3d Human Motion Reconstruction","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":14,"model":"PoseRN","metrics":{"Average MPJPE (mm)":"38.4","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-07-07","paper":"/paper/posern-a-2d-pose-refinement-network-for-bias","paper_url":"https://arxiv.org/abs/2107.03000v1","paper_title":"PoseRN: A 2D pose refinement network for bias-free multi-view 3D human pose estimation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":15,"model":"SoloPose","metrics":{"Average MPJPE (mm)":" 38.9","Multi-View or Monocular":"Monocular","PA-MPJPE":"29.9","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2023-12-15","paper":"/paper/solopose-one-shot-kinematic-3d-human-pose","paper_url":"https://arxiv.org/abs/2312.10195v1","paper_title":"SoloPose: One-Shot Kinematic 3D Human Pose Estimation with Video Data Augmentation","code":"https://github.com/Santa-Clara-Media-Lab/SoloPose","n_code_links":1,"syntology":null},{"rank_in_archive_order":16,"model":"Pose Consensus (multi-view, GT calib.)","metrics":{"Average MPJPE (mm)":"39","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-11-21","paper":"/paper/consensus-based-optimization-for-3d-human","paper_url":"https://arxiv.org/abs/1911.09245v3","paper_title":"Consensus-based Optimization for 3D Human Pose Estimation in Camera Coordinates","code":"https://github.com/dluvizon/3d-pose-consensus","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"MixSTE (HRNet, T=243)","metrics":{"Average MPJPE (mm)":"39.8","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-03-02","paper":"/paper/mixste-seq2seq-mixed-spatio-temporal-encoder","paper_url":"https://arxiv.org/abs/2203.00859v4","paper_title":"MixSTE: Seq2seq Mixed Spatio-Temporal Encoder for 3D Human Pose Estimation in Video","code":"https://github.com/JinluZhang1126/MixSTE","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":18,"model":"Spatio-Temporal Network (T=128)","metrics":{"Average MPJPE (mm)":"40.1","Multi-View or Monocular":"Monocular","PA-MPJPE":"30.7","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2020-04-07","paper":"/paper/3d-human-pose-estimation-using-spatio-1","paper_url":"https://arxiv.org/abs/2004.11822v1","paper_title":"3D Human Pose Estimation using Spatio-Temporal Networks with Explicit Occlusion Training","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":19,"model":"IVT (f=5)","metrics":{"Average MPJPE (mm)":"40.2","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-08-06","paper":"/paper/ivt-an-end-to-end-instance-guided-video","paper_url":"https://arxiv.org/abs/2208.03431v1","paper_title":"IVT: An End-to-End Instance-guided Video Transformer for 3D Pose Estimation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":20,"model":"GnTCN","metrics":{"Average MPJPE (mm)":"40.9","Multi-View or Monocular":"Monocular","PA-MPJPE":"30.4","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2020-12-22","paper":"/paper/graph-and-temporal-convolutional-networks-for","paper_url":"https://arxiv.org/abs/2012.11806v3","paper_title":"Graph and Temporal Convolutional Networks for 3D Multi-person Pose Estimation in Monocular Videos","code":"https://github.com/3dpose/GnTCN","n_code_links":1,"syntology":null},{"rank_in_archive_order":21,"model":"MixSTE (CPN, T=243)","metrics":{"Average MPJPE (mm)":"40.9","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-03-02","paper":"/paper/mixste-seq2seq-mixed-spatio-temporal-encoder","paper_url":"https://arxiv.org/abs/2203.00859v4","paper_title":"MixSTE: Seq2seq Mixed Spatio-Temporal Encoder for 3D Human Pose Estimation in Video","code":"https://github.com/JinluZhang1126/MixSTE","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":22,"model":"U-CondDGConv","metrics":{"Average MPJPE (mm)":"41.1","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-07-16","paper":"/paper/conditional-directed-graph-convolution-for-3d","paper_url":"https://arxiv.org/abs/2107.07797v2","paper_title":"Conditional Directed Graph Convolution for 3D Human Pose Estimation","code":"https://github.com/tamasino52/U-CondDGCN","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":23,"model":"P-STMO (N=243)","metrics":{"Average MPJPE (mm)":"42.1","Multi-View or Monocular":"Monocular","PA-MPJPE":"34.4","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-03-15","paper":"/paper/p-stmo-pre-trained-spatial-temporal-many-to","paper_url":"https://arxiv.org/abs/2203.07628v2","paper_title":"P-STMO: Pre-Trained Spatial Temporal Many-to-One Model for 3D Human Pose Estimation","code":"https://github.com/patrick-swk/p-stmo","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":1}},{"rank_in_archive_order":24,"model":"MixSTE (CPN, T=81)","metrics":{"Average MPJPE (mm)":"42.4","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-03-02","paper":"/paper/mixste-seq2seq-mixed-spatio-temporal-encoder","paper_url":"https://arxiv.org/abs/2203.00859v4","paper_title":"MixSTE: Seq2seq Mixed Spatio-Temporal Encoder for 3D Human Pose Estimation in Video","code":"https://github.com/JinluZhang1126/MixSTE","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":25,"model":"UGCN (HR-Net)","metrics":{"Average MPJPE (mm)":"42.6","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2020-04-29","paper":"/paper/motion-guided-3d-pose-estimation-from-videos","paper_url":"https://arxiv.org/abs/2004.13985v1","paper_title":"Motion Guided 3D Pose Estimation from Videos","code":"https://github.com/tamasino52/UGCN","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":6,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":26,"model":"Occlusion-Aware Networks","metrics":{"Average MPJPE (mm)":"42.9","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-10-01","paper":"/paper/occlusion-aware-networks-for-3d-human-pose","paper_url":"http://openaccess.thecvf.com/content_ICCV_2019/html/Cheng_Occlusion-Aware_Networks_for_3D_Human_Pose_Estimation_in_Video_ICCV_2019_paper.html","paper_title":"Occlusion-Aware Networks for 3D Human Pose Estimation in Video","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":27,"model":"MHFormer","metrics":{"Average MPJPE (mm)":"43","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-11-24","paper":"/paper/mhformer-multi-hypothesis-transformer-for-3d","paper_url":"https://arxiv.org/abs/2111.12707v4","paper_title":"MHFormer: Multi-Hypothesis Transformer for 3D Human Pose Estimation","code":"https://github.com/Vegetebird/MHFormer","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":6,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":28,"model":"ConvFormer (T=243, CPN)","metrics":{"Average MPJPE (mm)":"43.2","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2023-04-04","paper":"/paper/convformer-parameter-reduction-in-transformer","paper_url":"https://arxiv.org/abs/2304.02147v1","paper_title":"ConvFormer: Parameter Reduction in Transformer Models for 3D Human Pose Estimation by Leveraging Dynamic Multi-Headed Convolutional Attention","code":"https://github.com/ajda1992/convformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":29,"model":"ContextPose","metrics":{"Average MPJPE (mm)":"43.4","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/context-modeling-in-3d-human-pose-estimation","paper_url":"https://arxiv.org/abs/2103.15507v2","paper_title":"Context Modeling in 3D Human Pose Estimation: A Unified Perspective","code":"https://github.com/ShirleyMaxx/ContextPose-PyTorch-release","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":30,"model":"CrossFormer (T=81)","metrics":{"Average MPJPE (mm)":"43.7","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-03-24","paper":"/paper/crossformer-cross-spatio-temporal-transformer","paper_url":"https://arxiv.org/abs/2203.13387v1","paper_title":"CrossFormer: Cross Spatio-Temporal Transformer for 3D Human Pose Estimation","code":"https://github.com/mfawzy/CrossFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":31,"model":"StridedTransformer (T=351)","metrics":{"Average MPJPE (mm)":"43.7","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-03-26","paper":"/paper/lifting-transformer-for-3d-human-pose","paper_url":"https://arxiv.org/abs/2103.14304v8","paper_title":"Exploiting Temporal Contexts with Strided Transformer for 3D Human Pose Estimation","code":"https://github.com/Vegetebird/StridedTransformer-Pose3D","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":6,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":32,"model":"StridedTransformer (T=243)","metrics":{"Average MPJPE (mm)":"44","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-03-26","paper":"/paper/lifting-transformer-for-3d-human-pose","paper_url":"https://arxiv.org/abs/2103.14304v8","paper_title":"Exploiting Temporal Contexts with Strided Transformer for 3D Human Pose Estimation","code":"https://github.com/Vegetebird/StridedTransformer-Pose3D","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":6,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":33,"model":"Anatomy3D","metrics":{"Average MPJPE (mm)":"44.1","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2020-02-24","paper":"/paper/anatomy-aware-3d-human-pose-estimation-in","paper_url":"https://arxiv.org/abs/2002.10322v5","paper_title":"Anatomy-aware 3D Human Pose Estimation with Bone-based Pose Decomposition","code":"https://github.com/sunnychencool/Anatomy3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":34,"model":"P-STMO-S (N=81)","metrics":{"Average MPJPE (mm)":"44.1","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-03-15","paper":"/paper/p-stmo-pre-trained-spatial-temporal-many-to","paper_url":"https://arxiv.org/abs/2203.07628v2","paper_title":"P-STMO: Pre-Trained Spatial Temporal Many-to-One Model for 3D Human Pose Estimation","code":"https://github.com/patrick-swk/p-stmo","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":1}},{"rank_in_archive_order":35,"model":"PoseFormer (f=81)","metrics":{"Average MPJPE (mm)":"44.3","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-03-18","paper":"/paper/3d-human-pose-estimation-with-spatial-and","paper_url":"https://arxiv.org/abs/2103.10455v3","paper_title":"3D Human Pose Estimation with Spatial and Temporal Transformers","code":"https://github.com/zczcwh/PoseFormer","n_code_links":3,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":36,"model":"RIE (T=243 CPN)","metrics":{"Average MPJPE (mm)":"44.3","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-07-29","paper":"/paper/improving-robustness-and-accuracy-via","paper_url":"https://arxiv.org/abs/2107.13994v1","paper_title":"Improving Robustness and Accuracy via Relative Information Encoding in 3D Human Pose Estimation","code":"https://github.com/paTRICK-swk/Pose3D-RIE","n_code_links":1,"syntology":null},{"rank_in_archive_order":37,"model":"Probabilistic Monocular (T=200)","metrics":{"Average MPJPE (mm)":"44.3","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-07-29","paper":"/paper/probabilistic-monocular-3d-human-pose","paper_url":"https://arxiv.org/abs/2107.13788v2","paper_title":"Probabilistic Monocular 3D Human Pose Estimation with Normalizing Flows","code":"https://github.com/twehrbein/Probabilistic-Monocular-3D-Human-Pose-Estimation-with-Normalizing-Flows","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":9,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":38,"model":"Shape-aware SMPL","metrics":{"Average MPJPE (mm)":"44.4","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-08-26","paper":"/paper/shape-aware-human-pose-and-shape","paper_url":"https://arxiv.org/abs/1908.09464v1","paper_title":"Shape-Aware Human Pose and Shape Reconstruction Using Multi-View Images","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":39,"model":"TesseTrack (Monocular)","metrics":{"Average MPJPE (mm)":"44.6","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-06-16","paper":"/paper/tessetrack-end-to-end-learnable-multi-person","paper_url":"http://www.cs.cmu.edu/~ILIM/projects/IM/TesseTrack/","paper_title":"TesseTrack: End-to-End Learnable Multi-Person Articulated 3D Pose Tracking","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":40,"model":"SRNet (T=243)","metrics":{"Average MPJPE (mm)":"44.8","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2020-07-18","paper":"/paper/srnet-improving-generalization-in-3d-human","paper_url":"https://arxiv.org/abs/2007.09389v1","paper_title":"SRNet: Improving Generalization in 3D Human Pose Estimation with a Split-and-Recombine Approach","code":"https://github.com/ailingzengzzz/Split-and-Recombine-Net","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":8,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":41,"model":"Attention (T=243 CPN)","metrics":{"Average MPJPE (mm)":"44.8","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-03-04","paper":"/paper/enhanced-3d-human-pose-estimation-from-videos","paper_url":"https://arxiv.org/abs/2103.03170v1","paper_title":"Enhanced 3D Human Pose Estimation from Videos by using Attention-Based Neural Network with Dilated Convolutions","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":42,"model":"Virtual Bones (T=243 CPN)","metrics":{"Average MPJPE (mm)":"44.8","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-06-28","paper":"/paper/motion-projection-consistency-based-3d-human","paper_url":"https://arxiv.org/abs/2106.14706v2","paper_title":"Motion Projection Consistency Based 3D Human Pose Estimation with Virtual Bones from Monocular Videos","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":43,"model":"Pose Consensus (multi-view, est. calib.)","metrics":{"Average MPJPE (mm)":"45","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-11-21","paper":"/paper/consensus-based-optimization-for-3d-human","paper_url":"https://arxiv.org/abs/1911.09245v3","paper_title":"Consensus-based Optimization for 3D Human Pose Estimation in Camera Coordinates","code":"https://github.com/dluvizon/3d-pose-consensus","n_code_links":1,"syntology":null},{"rank_in_archive_order":44,"model":"HEMlets Pose","metrics":{"Average MPJPE (mm)":"45.1","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-10-26","paper":"/paper/hemlets-pose-learning-part-centric-heatmap-1","paper_url":"https://arxiv.org/abs/1910.12032v1","paper_title":"HEMlets Pose: Learning Part-Centric Heatmap Triplets for Accurate 3D Human Pose Estimation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":45,"model":"Attention3DHumanPose (T=243 CPN)","metrics":{"Average MPJPE (mm)":"45.1","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2020-06-01","paper":"/paper/attention-mechanism-exploits-temporal","paper_url":"http://openaccess.thecvf.com/content_CVPR_2020/html/Liu_Attention_Mechanism_Exploits_Temporal_Contexts_Real-Time_3D_Human_Pose_Reconstruction_CVPR_2020_paper.html","paper_title":"Attention Mechanism Exploits Temporal Contexts: Real-Time 3D Human Pose Reconstruction","code":"https://github.com/lrxjason/Attention3DHumanPose","n_code_links":1,"syntology":null},{"rank_in_archive_order":46,"model":"StridedTransformer (T=81)","metrics":{"Average MPJPE (mm)":"45.4","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-03-26","paper":"/paper/lifting-transformer-for-3d-human-pose","paper_url":"https://arxiv.org/abs/2103.14304v8","paper_title":"Exploiting Temporal Contexts with Strided Transformer for 3D Human Pose Estimation","code":"https://github.com/Vegetebird/StridedTransformer-Pose3D","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":6,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":47,"model":"DC-GCT(T=1)","metrics":{"Average MPJPE (mm)":"46.1","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2023-08-10","paper":"/paper/double-chain-constraints-for-3d-human-pose","paper_url":"https://arxiv.org/abs/2308.05298v1","paper_title":"Double-chain Constraints for 3D Human Pose Estimation in Images and Videos","code":"https://github.com/KHB1698/DC-GCT","n_code_links":1,"syntology":null},{"rank_in_archive_order":48,"model":"Trajectory Space Factorization (50 frames)","metrics":{"Average MPJPE (mm)":"46.6","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-08-22","paper":"/paper/trajectory-space-factorization-for-deep-video","paper_url":"https://arxiv.org/abs/1908.08289v1","paper_title":"Trajectory Space Factorization for Deep Video-Based 3D Human Pose Estimation","code":"https://github.com/jiahaoLjh/trajectory-pose-3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":49,"model":"VideoPose3D (T=243)","metrics":{"Average MPJPE (mm)":"46.8","Multi-View or Monocular":"Monocular","PA-MPJPE":"36.5","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2018-11-28","paper":"/paper/3d-human-pose-estimation-in-video-with","paper_url":"http://arxiv.org/abs/1811.11742v2","paper_title":"3D human pose estimation in video with temporal convolutions and semi-supervised training","code":"https://github.com/open-mmlab/mmpose","n_code_links":10,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":50,"model":"StridedTransformer (T=27)","metrics":{"Average MPJPE (mm)":"46.9","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-03-26","paper":"/paper/lifting-transformer-for-3d-human-pose","paper_url":"https://arxiv.org/abs/2103.14304v8","paper_title":"Exploiting Temporal Contexts with Strided Transformer for 3D Human Pose Estimation","code":"https://github.com/Vegetebird/StridedTransformer-Pose3D","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":6,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":51,"model":"Virtual Bones (T=9 CPN)","metrics":{"Average MPJPE (mm)":"47.4","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-06-28","paper":"/paper/motion-projection-consistency-based-3d-human","paper_url":"https://arxiv.org/abs/2106.14706v2","paper_title":"Motion Projection Consistency Based 3D Human Pose Estimation with Virtual Bones from Monocular Videos","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":52,"model":"Skeletal GNN","metrics":{"Average MPJPE (mm)":"47.9","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-08-16","paper":"/paper/learning-skeletal-graph-neural-networks-for","paper_url":"https://arxiv.org/abs/2108.07181v2","paper_title":"Learning Skeletal Graph Neural Networks for Hard 3D Pose Estimation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":53,"model":"GraphMLP","metrics":{"Average MPJPE (mm)":"48","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-06-13","paper":"/paper/graphmlp-a-graph-mlp-like-architecture-for-3d","paper_url":"https://arxiv.org/abs/2206.06420v5","paper_title":"GraphMLP: A Graph MLP-Like Architecture for 3D Human Pose Estimation","code":"https://github.com/vegetebird/graphmlp","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":54,"model":"STRGCN (T=7)","metrics":{"Average MPJPE (mm)":"48.8","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-10-01","paper":"/paper/exploiting-spatial-temporal-relationships-for","paper_url":"http://openaccess.thecvf.com/content_ICCV_2019/html/Cai_Exploiting_Spatial-Temporal_Relationships_for_3D_Pose_Estimation_via_Graph_Convolutional_ICCV_2019_paper.html","paper_title":"Exploiting Spatial-Temporal Relationships for 3D Pose Estimation via Graph Convolutional Networks","code":"https://github.com/vanoracai/Exploiting-Spatial-temporal-Relationships-for-3D-Pose-Estimation-via-Graph-Convolutional-Networks","n_code_links":1,"syntology":null},{"rank_in_archive_order":55,"model":"STRGCN (T=3)","metrics":{"Average MPJPE (mm)":"49.1","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-10-01","paper":"/paper/exploiting-spatial-temporal-relationships-for","paper_url":"http://openaccess.thecvf.com/content_ICCV_2019/html/Cai_Exploiting_Spatial-Temporal_Relationships_for_3D_Pose_Estimation_via_Graph_Convolutional_ICCV_2019_paper.html","paper_title":"Exploiting Spatial-Temporal Relationships for 3D Pose Estimation via Graph Convolutional Networks","code":"https://github.com/vanoracai/Exploiting-Spatial-temporal-Relationships-for-3D-Pose-Estimation-via-Graph-Convolutional-Networks","n_code_links":1,"syntology":null},{"rank_in_archive_order":56,"model":"DiffPyramid (CPN)","metrics":{"Average MPJPE (mm)":"49.2","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2025-06-03","paper":"/paper/learning-pyramid-structured-long-range-1","paper_url":"https://arxiv.org/abs/2506.02853v1","paper_title":"Learning Pyramid-structured Long-range Dependencies for 3D Human Pose Estimation","code":"https://github.com/MingjieWe/PGFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":57,"model":"Dual network","metrics":{"Average MPJPE (mm)":"49.31","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-05-02","paper":"/paper/dual-networks-based-3d-multi-person-pose","paper_url":"https://arxiv.org/abs/2205.00748v3","paper_title":"Dual networks based 3D Multi-Person Pose Estimation from Monocular Video","code":"https://github.com/3dpose/3D-Multi-Person-Pose","n_code_links":1,"syntology":null},{"rank_in_archive_order":58,"model":"Modulated-GCN","metrics":{"Average MPJPE (mm)":"49.4","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-01-01","paper":"/paper/modulated-graph-convolutional-network-for-3d","paper_url":"http://openaccess.thecvf.com//content/ICCV2021/html/Zou_Modulated_Graph_Convolutional_Network_for_3D_Human_Pose_Estimation_ICCV_2021_paper.html","paper_title":"Modulated Graph Convolutional Network for 3D Human Pose Estimation","code":"https://github.com/zhimingzo/modulated-gcn","n_code_links":1,"syntology":null},{"rank_in_archive_order":59,"model":"MTF-Transformer (M=0.4, T=7, N=1)","metrics":{"Average MPJPE (mm)":"49.4","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-10-11","paper":"/paper/adaptively-multi-view-and-temporal-fusing","paper_url":"https://arxiv.org/abs/2110.05092v2","paper_title":"Adaptive Multi-view and Temporal Fusing Transformer for 3D Human Pose Estimation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":60,"model":"PGFormer (CPN)","metrics":{"Average MPJPE (mm)":"49.5","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2025-06-03","paper":"/paper/learning-pyramid-structured-long-range-1","paper_url":"https://arxiv.org/abs/2506.02853v1","paper_title":"Learning Pyramid-structured Long-range Dependencies for 3D Human Pose Estimation","code":"https://github.com/MingjieWe/PGFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":61,"model":"MDN (Multi-View)","metrics":{"Average MPJPE (mm)":"49.6","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-04-11","paper":"/paper/generating-multiple-hypotheses-for-3d-human","paper_url":"http://arxiv.org/abs/1904.05547v1","paper_title":"Generating Multiple Hypotheses for 3D Human Pose Estimation with Mixture Density Network","code":"https://github.com/chaneyddtt/Generating-Multiple-Hypotheses-for-3D-Human-Pose-Estimation-with-Mixture-Density-Network","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":62,"model":"Ray3D (T=9 CPN)","metrics":{"Average MPJPE (mm)":"49.7","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-03-22","paper":"/paper/ray3d-ray-based-3d-human-pose-estimation-for","paper_url":"https://arxiv.org/abs/2203.11471v3","paper_title":"Ray3D: ray-based 3D human pose estimation for monocular absolute 3D localization","code":"https://github.com/YxZhxn/Ray3D","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":63,"model":"SRNet (T=1)","metrics":{"Average MPJPE (mm)":"49.9","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2020-07-18","paper":"/paper/srnet-improving-generalization-in-3d-human","paper_url":"https://arxiv.org/abs/2007.09389v1","paper_title":"SRNet: Improving Generalization in 3D Human Pose Estimation with a Split-and-Recombine Approach","code":"https://github.com/ailingzengzzz/Split-and-Recombine-Net","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":8,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":64,"model":"HR-Net+VPose+PoseAug","metrics":{"Average MPJPE (mm)":"50.2","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-05-06","paper":"/paper/poseaug-a-differentiable-pose-augmentation","paper_url":"https://arxiv.org/abs/2105.02465v1","paper_title":"PoseAug: A Differentiable Pose Augmentation Framework for 3D Human Pose Estimation","code":"https://github.com/jfzhang95/PoseAug","n_code_links":1,"syntology":null},{"rank_in_archive_order":65,"model":"Jointformer (CPN)","metrics":{"Average MPJPE (mm)":"50.5","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-08-07","paper":"/paper/jointformer-single-frame-lifting-transformer","paper_url":"https://arxiv.org/abs/2208.03704v1","paper_title":"Jointformer: Single-Frame Lifting Transformer with Error Prediction and Refinement for 3D Human Pose Estimation","code":"https://github.com/seblutz/JointFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":66,"model":"Multi-view Temporal self-supervised","metrics":{"Average MPJPE (mm)":"50.6","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-10-14","paper":"/paper/learning-temporal-3d-human-pose-estimation","paper_url":"https://arxiv.org/abs/2110.07578v1","paper_title":"Learning Temporal 3D Human Pose Estimation with Pseudo-Labels","code":"https://github.com/vru2020/Pose_3D","n_code_links":2,"syntology":null},{"rank_in_archive_order":67,"model":"STRGCN (T=1)","metrics":{"Average MPJPE (mm)":"50.6","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-10-01","paper":"/paper/exploiting-spatial-temporal-relationships-for","paper_url":"http://openaccess.thecvf.com/content_ICCV_2019/html/Cai_Exploiting_Spatial-Temporal_Relationships_for_3D_Pose_Estimation_via_Graph_Convolutional_ICCV_2019_paper.html","paper_title":"Exploiting Spatial-Temporal Relationships for 3D Pose Estimation via Graph Convolutional Networks","code":"https://github.com/vanoracai/Exploiting-Spatial-temporal-Relationships-for-3D-Pose-Estimation-via-Graph-Convolutional-Networks","n_code_links":1,"syntology":null},{"rank_in_archive_order":68,"model":"MTF-Transformer (M=0.4, T=1, N=1)","metrics":{"Average MPJPE (mm)":"50.7","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-10-11","paper":"/paper/adaptively-multi-view-and-temporal-fusing","paper_url":"https://arxiv.org/abs/2110.05092v2","paper_title":"Adaptive Multi-view and Temporal Fusing Transformer for 3D Human Pose Estimation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":69,"model":"HR-Net+ST-GCN+PoseAug","metrics":{"Average MPJPE (mm)":"50.8","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-05-06","paper":"/paper/poseaug-a-differentiable-pose-augmentation","paper_url":"https://arxiv.org/abs/2105.02465v1","paper_title":"PoseAug: A Differentiable Pose Augmentation Framework for 3D Human Pose Estimation","code":"https://github.com/jfzhang95/PoseAug","n_code_links":1,"syntology":null},{"rank_in_archive_order":70,"model":"TAG-Net","metrics":{"Average MPJPE (mm)":"50.9","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2020-06-14","paper":"/paper/cascaded-deep-monocular-3d-human-pose-1","paper_url":"https://arxiv.org/abs/2006.07778v3","paper_title":"Cascaded deep monocular 3D human pose estimation with evolutionary training data","code":"https://github.com/Nicholasli1995/EvoSkeleton","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":71,"model":"LoCO","metrics":{"Average MPJPE (mm)":"51.1","Multi-View or Monocular":"Monocular","PA-MPJPE":"43.4","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2020-04-01","paper":"/paper/compressed-volumetric-heatmaps-for-multi","paper_url":"https://arxiv.org/abs/2004.00329v1","paper_title":"Compressed Volumetric Heatmaps for Multi-Person 3D Pose Estimation","code":"https://github.com/fabbrimatteo/LoCO","n_code_links":1,"syntology":null},{"rank_in_archive_order":72,"model":"VideoPose3D (T=1)","metrics":{"Average MPJPE (mm)":"51.8","Multi-View or Monocular":"Monocular","PA-MPJPE":"40","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2018-11-28","paper":"/paper/3d-human-pose-estimation-in-video-with","paper_url":"http://arxiv.org/abs/1811.11742v2","paper_title":"3D human pose estimation in video with temporal convolutions and semi-supervised training","code":"https://github.com/open-mmlab/mmpose","n_code_links":10,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":73,"model":"Graph Stacked Hourglass Network (CPN)","metrics":{"Average MPJPE (mm)":"51.9","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-03-30","paper":"/paper/graph-stacked-hourglass-networks-for-3d-human","paper_url":"https://arxiv.org/abs/2103.16385v1","paper_title":"Graph Stacked Hourglass Networks for 3D Human Pose Estimation","code":"https://github.com/tamasino52/GraphSH","n_code_links":1,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":15}},{"rank_in_archive_order":74,"model":"Pose Consensus (monocular)","metrics":{"Average MPJPE (mm)":"52","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-11-21","paper":"/paper/consensus-based-optimization-for-3d-human","paper_url":"https://arxiv.org/abs/1911.09245v3","paper_title":"Consensus-based Optimization for 3D Human Pose Estimation in Camera Coordinates","code":"https://github.com/dluvizon/3d-pose-consensus","n_code_links":1,"syntology":null},{"rank_in_archive_order":75,"model":"MöbiusGCN","metrics":{"Average MPJPE (mm)":"52.1","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2022-03-20","paper":"/paper/3d-human-pose-estimation-using-mobius-graph","paper_url":"https://arxiv.org/abs/2203.10554v1","paper_title":"3D Human Pose Estimation Using Möbius Graph Convolutional Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":76,"model":"PoseLifter","metrics":{"Average MPJPE (mm)":"52.5","Multi-View or Monocular":"Monocular","PA-MPJPE":"39.1","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-10-26","paper":"/paper/absposelifter-absolute-3d-human-pose-lifting","paper_url":"https://arxiv.org/abs/1910.12029v2","paper_title":"PoseLifter: Absolute 3D human pose lifting network from a single noisy 2D human pose","code":"https://github.com/juyongchang/PoseLifter","n_code_links":1,"syntology":null},{"rank_in_archive_order":77,"model":"MDN","metrics":{"Average MPJPE (mm)":"52.7","Multi-View or Monocular":"Monocular","PA-MPJPE":"42.6","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-04-11","paper":"/paper/generating-multiple-hypotheses-for-3d-human","paper_url":"http://arxiv.org/abs/1904.05547v1","paper_title":"Generating Multiple Hypotheses for 3D Human Pose Estimation with Mixture Density Network","code":"https://github.com/chaneyddtt/Generating-Multiple-Hypotheses-for-3D-Human-Pose-Estimation-with-Mixture-Density-Network","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":78,"model":"ONS LCN","metrics":{"Average MPJPE (mm)":"52.7","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-10-01","paper":"/paper/optimizing-network-structure-for-3d-human","paper_url":"http://openaccess.thecvf.com/content_ICCV_2019/html/Ci_Optimizing_Network_Structure_for_3D_Human_Pose_Estimation_ICCV_2019_paper.html","paper_title":"Optimizing Network Structure for 3D Human Pose Estimation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":79,"model":"SemGCN","metrics":{"Average MPJPE (mm)":"57.6","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-04-06","paper":"/paper/semantic-graph-convolutional-networks-for-3d","paper_url":"https://arxiv.org/abs/1904.03345v3","paper_title":"Semantic Graph Convolutional Networks for 3D Human Pose Regression","code":"https://github.com/garyzhao/SemGCN","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":80,"model":"Stereoscopic View Synthesis Subnetwork","metrics":{"Average MPJPE (mm)":"58","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-04-11","paper":"/paper/generalizing-monocular-3d-human-pose","paper_url":"http://arxiv.org/abs/1904.05512v1","paper_title":"Generalizing Monocular 3D Human Pose Estimation in the Wild","code":"https://github.com/llcshappy/Monocular-3D-Human-Pose","n_code_links":1,"syntology":null},{"rank_in_archive_order":81,"model":"Sequence-to-sequence network","metrics":{"Average MPJPE (mm)":"58.5","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2017-11-23","paper":"/paper/exploiting-temporal-information-for-3d-pose","paper_url":"http://arxiv.org/abs/1711.08585v4","paper_title":"Exploiting temporal information for 3D pose estimation","code":"https://github.com/rayat137/Pose_3D","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":82,"model":"TAPE (T=16)","metrics":{"Acceleration Error":"6.5","Average MPJPE (mm)":"60","Multi-View or Monocular":"Monocular","PA-MPJPE":"39.5","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2023-04-29","paper":"/paper/tape-temporal-attention-based-probabilistic","paper_url":"https://arxiv.org/abs/2305.00181v1","paper_title":"TAPE: Temporal Attention-based Probabilistic human pose and shape Estimation","code":"https://github.com/nikosvasilik/tape","n_code_links":1,"syntology":null},{"rank_in_archive_order":83,"model":"Probabilistic Monocular (T=1)","metrics":{"Average MPJPE (mm)":"61.8","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-07-29","paper":"/paper/probabilistic-monocular-3d-human-pose","paper_url":"https://arxiv.org/abs/2107.13788v2","paper_title":"Probabilistic Monocular 3D Human Pose Estimation with Normalizing Flows","code":"https://github.com/twehrbein/Probabilistic-Monocular-3D-Human-Pose-Estimation-with-Normalizing-Flows","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":9,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":84,"model":"2D-3D Lifting self-supervised","metrics":{"Average MPJPE (mm)":"62.0","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2021-08-17","paper":"/paper/self-supervised-3d-human-pose-estimation-with","paper_url":"https://arxiv.org/abs/2108.07777v1","paper_title":"Self-Supervised 3D Human Pose Estimation with Multiple-View Geometry","code":"https://github.com/vru2020/Pose_3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":85,"model":"SIM (SH detections FT) (MA)","metrics":{"Average MPJPE (mm)":"62.9","Multi-View or Monocular":"Monocular","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2017-05-08","paper":"/paper/a-simple-yet-effective-baseline-for-3d-human","paper_url":"http://arxiv.org/abs/1705.03098v2","paper_title":"A simple yet effective baseline for 3d human pose estimation","code":"https://github.com/open-mmlab/mmpose","n_code_links":14,"syntology":{"n_ran":5,"n_unverified":2,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":86,"model":"VoxelKeypointFusion (transfer)","metrics":{"Average MPJPE (mm)":"64.3","Multi-View or Monocular":"Multi-View","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2024-10-24","paper":"/paper/voxelkeypointfusion-generalizable-multi-view","paper_url":"https://arxiv.org/abs/2410.18723v3","paper_title":"VoxelKeypointFusion: Generalizable Multi-View Multi-Person Pose Estimation","code":"https://gitlab.com/Percipiote/VoxelKeypointFusion","n_code_links":1,"syntology":null},{"rank_in_archive_order":87,"model":"VIBE","metrics":{"Average MPJPE (mm)":"65.6","Multi-View or Monocular":"Monocular","PA-MPJPE":"41.4","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2019-12-11","paper":"/paper/vibe-video-inference-for-human-body-pose-and","paper_url":"https://arxiv.org/abs/1912.05656v3","paper_title":"VIBE: Video Inference for Human Body Pose and Shape Estimation","code":"https://github.com/mkocabas/VIBE","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":88,"model":"CanonPose","metrics":{"Average MPJPE (mm)":"74.3","Multi-View or Monocular":"MultiView","Using 2D ground-truth joints":"No"},"uses_additional_data":false,"paper_date":"2020-11-30","paper":"/paper/canonpose-self-supervised-monocular-3d-human","paper_url":"https://arxiv.org/abs/2011.14679v1","paper_title":"CanonPose: Self-Supervised Monocular 3D Human Pose Estimation in the Wild","code":"https://github.com/bastianwandt/CanonPose","n_code_links":1,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,885 of the 9,623 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9623,"papers_checked":6885,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":2737},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":34,"rows_with_any_sample_ran":27,"distinct_papers_with_graph_line":24,"distinct_papers_with_any_sample_ran":19,"samples_over_distinct_papers":{"n_ran":71,"n_unverified":82,"n_samples":153,"n_pointer_only_licence":45,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":102,"n_unverified":131,"n_samples":233,"n_pointer_only_licence":56,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}