{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/revisiting-skeleton-based-action-recognition","title":"Revisiting Skeleton-based Action Recognition","arxiv_id":"2104.13586","date":"2021-04-28","proceeding":"CVPR 2022 1","authors":["Haodong Duan","Yue Zhao","Kai Chen","Dahua Lin","Bo Dai"],"abstract":"Human skeleton, as a compact representation of human action, has received increasing attention in recent years. Many skeleton-based action recognition methods adopt graph convolutional networks (GCN) to extract features on top of human skeletons. Despite the positive results shown in previous works, GCN-based methods are subject to limitations in robustness, interoperability, and scalability. In this work, we propose PoseC3D, a new approach to skeleton-based action recognition, which relies on a 3D heatmap stack instead of a graph sequence as the base representation of human skeletons. Compared to GCN-based methods, PoseC3D is more effective in learning spatiotemporal features, more robust against pose estimation noises, and generalizes better in cross-dataset settings. Also, PoseC3D can handle multiple-person scenarios without additional computation cost, and its features can be easily integrated with other modalities at early fusion stages, which provides a great design space to further boost the performance. On four challenging datasets, PoseC3D consistently obtains superior performance, when used alone on skeletons and in combination with the RGB modality.","url_abs":"https://arxiv.org/abs/2104.13586v2","url_pdf":"https://arxiv.org/pdf/2104.13586v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"revisiting-skeleton-based-action-recognition","repo_url":"https://github.com/kennymckormick/pyskl","is_official":0,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"revisiting-skeleton-based-action-recognition","repo_url":"https://github.com/open-mmlab/mmaction2","is_official":0,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":null},{"paper_slug":"revisiting-skeleton-based-action-recognition","repo_url":"https://github.com/sandman002/One-Style-is-All-You-Need-to-Generate-a-Video","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok"}},{"paper_slug":"revisiting-skeleton-based-action-recognition","repo_url":"https://github.com/txyugood/PaddlePoseC3D","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"paddle","reach":{"status":"ok"}}],"tasks":[{"task_slug":"3d-human-action-recognition","task_name":"3D Action Recognition"},{"task_slug":"action-recognition-in-videos","task_name":"Action Recognition"},{"task_slug":"group-activity-recognition","task_name":"Group Activity Recognition"},{"task_slug":"pose-estimation","task_name":"Pose Estimation"},{"task_slug":"skeleton-based-action-recognition","task_name":"Skeleton Based Action Recognition"}],"methods":[{"method_slug":"graph-convolutional-networks","method_name":"Graph Convolutional Networks"},{"method_slug":"heatmap","method_name":"Heatmap"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/3d-action-recognition-on-assembly101","task":"3D Action Recognition","dataset":"Assembly101","model":"RGBPoseConv3D","rank_in_archive_order":3,"of":7,"metrics":{"Actions Top-1":"33.61","Object Top-1":"42.90","Verbs Top-1":"61.99"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-on-h2o-2-hands-and-objects","task":"Action Recognition","dataset":"H2O  (2 Hands and Objects)","model":"RGBPoseConv3D","rank_in_archive_order":7,"of":11,"metrics":{"Actions Top-1":"83.47","Hand Pose":"2D","Object Label":"No","Object Pose":"No","RGB":"Yes"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-in-videos-on-ntu-rgbd","task":"Action Recognition","dataset":"NTU RGB+D","model":"PoseC3D (RGB + Pose)","rank_in_archive_order":2,"of":28,"metrics":{"Accuracy (CS)":"97.0","Accuracy (CV)":"99.6"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-in-videos-on-ntu-rgbd-120","task":"Action Recognition","dataset":"NTU RGB+D 120","model":"PoseC3D (RGB + Pose)","rank_in_archive_order":2,"of":21,"metrics":{"Accuracy (Cross-Setup)":"96.4","Accuracy (Cross-Subject)":"95.3"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-in-videos-on-volleyball","task":"Action Recognition","dataset":"Volleyball","model":"PoseC3D (Pose Only)","rank_in_archive_order":1,"of":4,"metrics":{"Accuracy":"91.3"},"uses_additional_data":false},{"leaderboard":"/sota/group-activity-recognition-on-volleyball","task":"Group Activity Recognition","dataset":"Volleyball","model":"PoseC3D (Pose-Only)","rank_in_archive_order":8,"of":12,"metrics":{"Accuracy":"91.3"},"uses_additional_data":false},{"leaderboard":"/sota/skeleton-based-action-recognition-on-kinetics","task":"Skeleton Based Action Recognition","dataset":"Kinetics-Skeleton dataset","model":"PoseC3D (SlowOnly-346)","rank_in_archive_order":4,"of":42,"metrics":{"Accuracy":"49.1"},"uses_additional_data":true},{"leaderboard":"/sota/skeleton-based-action-recognition-on-kinetics","task":"Skeleton Based Action Recognition","dataset":"Kinetics-Skeleton dataset","model":"PoseC3D","rank_in_archive_order":5,"of":42,"metrics":{"Accuracy":"47.7"},"uses_additional_data":true},{"leaderboard":"/sota/skeleton-based-action-recognition-on-ntu-rgbd","task":"Skeleton Based Action Recognition","dataset":"NTU RGB+D","model":"PoseC3D [3D Heatmap]","rank_in_archive_order":2,"of":135,"metrics":{"Accuracy (CS)":"94.1","Accuracy (CV)":"97.1","Ensembled Modalities":"2"},"uses_additional_data":true},{"leaderboard":"/sota/skeleton-based-action-recognition-on-ntu-rgbd-1","task":"Skeleton Based Action Recognition","dataset":"NTU RGB+D 120","model":"PoseC3D (w. HRNet 2D Skeleton)","rank_in_archive_order":37,"of":83,"metrics":{"Accuracy (Cross-Setup)":"90.3","Accuracy (Cross-Subject)":"86.9"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2104.13586","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}