{"url":"/task/skeleton-based-action-recognition","name":"Skeleton Based Action Recognition","slug":"skeleton-based-action-recognition","description_markdown":"**Skeleton-based Action Recognition** is a computer vision task that involves recognizing human actions from a sequence of 3D skeletal joint data captured from sensors such as Microsoft Kinect, Intel RealSense, and wearable devices. The goal of skeleton-based action recognition is to develop algorithms that can understand and classify human actions from skeleton data, which can be used in various applications such as human-computer interaction, sports analysis, and surveillance.\r\n\r\n<span style=\"color:grey; opacity: 0.6\">( Image credit: [View Adaptive Neural Networks for High\r\nPerformance Skeleton-based Human Action\r\nRecognition](https://arxiv.org/pdf/1804.07453v3.pdf) )</span>","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"},{"name":"Time Series","url":"/area/time-series"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":419,"papers_with_code":219,"benchmarks":34,"benchmark_tables_in_archive":34,"benchmark_tables_shown":34,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":30,"subtasks":0,"parent_tasks":2},"benchmarks":[{"leaderboard":"/sota/skeleton-based-action-recognition-on-ntu-rgbd","slug":"skeleton-based-action-recognition-on-ntu-rgbd","dataset":"NTU RGB+D","dataset_url":"/dataset/ntu-rgb-d","rows_in_archive":135,"metrics":["Accuracy (CS)","Accuracy (CV)","Ensembled Modalities","GFLOPs per pred"],"first_row_in_archive_order":{"model":"Hulk(Finetune, ViT-L)","paper_title":"Hulk: A Universal Knowledge Translator for Human-Centric Tasks","paper_url":"/paper/hulk-a-universal-knowledge-translator-for","paper_date":"2023-12-04","arxiv_id":"2312.01697","code_links":[{"title":"opengvlab/humanbench","url":"https://github.com/opengvlab/humanbench"},{"title":"opengvlab/hulk","url":"https://github.com/opengvlab/hulk"}],"syntology":{"n":24,"n_ran":12,"n_unverified":12,"n_pointer_only":0}}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-ntu-rgbd-1","slug":"skeleton-based-action-recognition-on-ntu-rgbd-1","dataset":"NTU RGB+D 120","dataset_url":"/dataset/ntu-rgb-d-120","rows_in_archive":83,"metrics":["Accuracy (Cross-Subject)","Accuracy (Cross-Setup)","Ensembled Modalities","GFLOPS per prediction"],"first_row_in_archive_order":{"model":"ProtoGCN","paper_title":"Revealing Key Details to See Differences: A Novel Prototypical Perspective for Skeleton-based Action Recognition","paper_url":"/paper/revealing-key-details-to-see-differences-a","paper_date":"2024-11-28","arxiv_id":"2411.18941","code_links":[{"title":"firework8/ProtoGCN","url":"https://github.com/firework8/ProtoGCN"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-kinetics","slug":"skeleton-based-action-recognition-on-kinetics","dataset":"Kinetics-Skeleton dataset","dataset_url":"/dataset/kinetics","rows_in_archive":42,"metrics":["Accuracy","GFLOPS per prediction"],"first_row_in_archive_order":{"model":"Structured Keypoint Pooling (PPNv2 skeletons+objects)","paper_title":"Unified Keypoint-based Action Recognition Framework via Structured Keypoint Pooling","paper_url":"/paper/unified-keypoint-based-action-recognition","paper_date":"2023-03-27","arxiv_id":"2303.15270","code_links":[],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-n-ucla","slug":"skeleton-based-action-recognition-on-n-ucla","dataset":"N-UCLA","dataset_url":"/dataset/n-ucla","rows_in_archive":25,"metrics":["Accuracy","Data Modality (Joint, Bone, Motion)"],"first_row_in_archive_order":{"model":"DSCNet (RGB + Pose)","paper_title":"A Dense-Sparse Complementary Network for Human Action Recognition based on RGB and Skeleton Modalities","paper_url":"/paper/a-dense-sparse-complementary-network-for","paper_date":"2023-12-28","arxiv_id":null,"code_links":[{"title":"Maxchengqin/DSCNet","url":"https://github.com/Maxchengqin/DSCNet"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-j-hmdb","slug":"skeleton-based-action-recognition-on-j-hmdb","dataset":"J-HMDB","dataset_url":"/dataset/jhmdb","rows_in_archive":13,"metrics":["Accuracy (RGB+pose)","Accuracy (pose)"],"first_row_in_archive_order":{"model":"Potion","paper_title":"PoTion: Pose MoTion Representation for Action Recognition","paper_url":"/paper/potion-pose-motion-representation-for-action","paper_date":"2018-06-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-sbu","slug":"skeleton-based-action-recognition-on-sbu","dataset":"SBU / SBU-Refine","dataset_url":"/dataset/sbu","rows_in_archive":9,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Joint Line Distance","paper_title":"On Geometric Features for Skeleton-Based Action Recognition using Multilayer LSTM Networks","paper_url":"/paper/on-geometric-features-for-skeleton-based","paper_date":"2017-03-01","arxiv_id":null,"code_links":[{"title":"Sy-Zhang/Geometric-Feature-Release","url":"https://github.com/Sy-Zhang/Geometric-Feature-Release"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-sysu-3d","slug":"skeleton-based-action-recognition-on-sysu-3d","dataset":"SYSU 3D","dataset_url":null,"rows_in_archive":9,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"SGN","paper_title":"Semantics-Guided Neural Networks for Efficient Skeleton-Based Human Action Recognition","paper_url":"/paper/semantics-guided-neural-networks-for","paper_date":"2019-04-02","arxiv_id":"1904.01189","code_links":[{"title":"microsoft/SGN","url":"https://github.com/microsoft/SGN"},{"title":"urw7rs/torch_skeleton","url":"https://github.com/urw7rs/torch_skeleton"}],"syntology":{"n":13,"n_ran":3,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-uav","slug":"skeleton-based-action-recognition-on-uav","dataset":"UAV-Human","dataset_url":"/dataset/uav-human","rows_in_archive":9,"metrics":["CSv1(%)","CSv2(%)"],"first_row_in_archive_order":{"model":"HDBN","paper_title":"HDBN: A Novel Hybrid Dual-branch Network for Robust Skeleton-based Action Recognition","paper_url":"/paper/hdbn-a-novel-hybrid-dual-branch-network-for","paper_date":"2024-04-24","arxiv_id":"2404.15719","code_links":[{"title":"liujf69/icmew2024-track10","url":"https://github.com/liujf69/icmew2024-track10"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-cad-120","slug":"skeleton-based-action-recognition-on-cad-120","dataset":"CAD-120","dataset_url":"/dataset/cad-120","rows_in_archive":8,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"NGM (5-shot)","paper_title":"Neural Graph Matching Networks for Fewshot 3D Action Recognition","paper_url":"/paper/neural-graph-matching-networks-for-fewshot-3d","paper_date":"2018-09-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-florence","slug":"skeleton-based-action-recognition-on-florence","dataset":"Florence 3D","dataset_url":"/dataset/florence3d","rows_in_archive":7,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Deep STGC_K","paper_title":"Spatio-Temporal Graph Convolution for Skeleton Based Action Recognition","paper_url":"/paper/spatio-temporal-graph-convolution-for","paper_date":"2018-02-27","arxiv_id":"1802.09834","code_links":[],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-shrec","slug":"skeleton-based-action-recognition-on-shrec","dataset":"SHREC 2017 track on 3D Hand Gesture Recognition","dataset_url":"/dataset/shrec","rows_in_archive":7,"metrics":["28 gestures accuracy","14 gestures accuracy","Speed  (FPS)","No. Parameters"],"first_row_in_archive_order":{"model":"RE-TCN","paper_title":"Action Recognition in Real-World Ambient Assisted Living Environment","paper_url":"/paper/action-recognition-in-real-world-ambient","paper_date":"2025-03-29","arxiv_id":"2503.23214","code_links":[{"title":"Gbouna/RE-TCN","url":"https://github.com/Gbouna/RE-TCN"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-ut","slug":"skeleton-based-action-recognition-on-ut","dataset":"UT-Kinect","dataset_url":"/dataset/ut-kinect","rows_in_archive":7,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Temporal Subspace Clustering","paper_title":"Subspace Clustering for Action Recognition with Covariance Representations and Temporal Pruning","paper_url":"/paper/subspace-clustering-for-action-recognition","paper_date":"2020-06-21","arxiv_id":"2006.11812","code_links":[{"title":"IIT-PAVIS/subspace-clustering-action-recognition","url":"https://github.com/IIT-PAVIS/subspace-clustering-action-recognition"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-varying","slug":"skeleton-based-action-recognition-on-varying","dataset":"Varying-view RGB-D Action-Skeleton","dataset_url":null,"rows_in_archive":7,"metrics":["Accuracy (CS)","Accuracy (CV I)","Accuracy (CV II)","Accuracy (AV I)","Accuracy (AV II)"],"first_row_in_archive_order":{"model":"VS-CNN","paper_title":"A Large-scale Varying-view RGB-D Action Dataset for Arbitrary-view Human Action Recognition","paper_url":"/paper/a-large-scale-varying-view-rgb-d-action","paper_date":"2019-04-24","arxiv_id":"1904.10681","code_links":[],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-jhmdb-2d","slug":"skeleton-based-action-recognition-on-jhmdb-2d","dataset":"JHMDB (2D poses only)","dataset_url":"/dataset/jhmdb","rows_in_archive":6,"metrics":["Average accuracy of 3 splits","Accuracy","No. parameters"],"first_row_in_archive_order":{"model":"HT-ConvNet","paper_title":"Hierarchical Temporal Convolution Network:Towards Privacy-Centric Activity Recognition","paper_url":"/paper/hierarchical-temporal-convolution-network","paper_date":"2024-12-21","arxiv_id":null,"code_links":[{"title":"Gbouna/HT-ConvNet","url":"https://github.com/Gbouna/HT-ConvNet"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-first","slug":"skeleton-based-action-recognition-on-first","dataset":"First-Person Hand Action Benchmark","dataset_url":"/dataset/first-person-hand-action-benchmark","rows_in_archive":4,"metrics":["1:3 Accuracy","1:1 Accuracy","3:1 Accuracy","Cross-person Accuracy"],"first_row_in_archive_order":{"model":"TCN-Summ","paper_title":"Domain and View-point Agnostic Hand Action Recognition","paper_url":"/paper/domain-and-view-point-agnostic-hand-action","paper_date":"2021-03-03","arxiv_id":"2103.02303","code_links":[{"title":"AlbertoSabater/Domain-and-View-point-Agnostic-Hand-Action-Recognition","url":"https://github.com/AlbertoSabater/Domain-and-View-point-Agnostic-Hand-Action-Recognition"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-gaming","slug":"skeleton-based-action-recognition-on-gaming","dataset":"Gaming 3D (G3D)","dataset_url":"/dataset/g3d","rows_in_archive":4,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"CNN","paper_title":"Action Recognition Based on Joint Trajectory Maps with Convolutional Neural Networks","paper_url":"/paper/action-recognition-based-on-joint-trajectory","paper_date":"2016-12-30","arxiv_id":"1612.09401","code_links":[],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-h2o-2","slug":"skeleton-based-action-recognition-on-h2o-2","dataset":"H2O  (2 Hands and Objects)","dataset_url":"/dataset/h2o-dataset","rows_in_archive":4,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"CHASE(STSA-Net)","paper_title":"CHASE: Learning Convex Hull Adaptive Shift for Skeleton-based Multi-Entity Action Recognition","paper_url":"/paper/chase-learning-convex-hull-adaptive-shift-for","paper_date":"2024-10-09","arxiv_id":"2410.07153","code_links":[{"title":"Necolizer/CHASE","url":"https://github.com/Necolizer/CHASE"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-msr","slug":"skeleton-based-action-recognition-on-msr","dataset":"MSR Action3D","dataset_url":"/dataset/msr-action3d","rows_in_archive":4,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Distribution of Action Movements + SVM","paper_title":"Distribution of Action Movements (DAM): A Descriptor for Human Action Recognition","paper_url":"/paper/distribution-of-action-movements-dam-a-1","paper_date":"2023-10-26","arxiv_id":"2310.17421","code_links":[],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-pku-mmd","slug":"skeleton-based-action-recognition-on-pku-mmd","dataset":"PKU-MMD","dataset_url":"/dataset/pku-mmd","rows_in_archive":4,"metrics":["mAP@0.50 (CV)","mAP@0.50 (CS)","Accuracy (Cross-Subject)"],"first_row_in_archive_order":{"model":"RF-Action","paper_title":"Making the Invisible Visible: Action Recognition Through Walls and Occlusions","paper_url":"/paper/making-the-invisible-visible-action","paper_date":"2019-09-20","arxiv_id":"1909.09300","code_links":[],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-jhmdb","slug":"skeleton-based-action-recognition-on-jhmdb","dataset":"JHMDB Pose Tracking","dataset_url":"/dataset/jhmdb","rows_in_archive":3,"metrics":["PCK@0.1","PCK@0.2","PCK@0.3","PCK@0.4","PCK@0.5"],"first_row_in_archive_order":{"model":"mgPFF+ft 1st","paper_title":"Multigrid Predictive Filter Flow for Unsupervised Learning on Videos","paper_url":"/paper/multigrid-predictive-filter-flow-for","paper_date":"2019-04-02","arxiv_id":"1904.01693","code_links":[{"title":"aimerykong/predictive-filter-flow","url":"https://github.com/aimerykong/predictive-filter-flow"},{"title":"bestaar/predictiveFilterFlow","url":"https://github.com/bestaar/predictiveFilterFlow"}],"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":5}}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-ntu60-x","slug":"skeleton-based-action-recognition-on-ntu60-x","dataset":"NTU60-X","dataset_url":"/dataset/ntu-x","rows_in_archive":3,"metrics":["Accuracy (Body + Fingers joints)","Accuracy (Body joints)","Accuracy (Body + Fingers + Face joints)"],"first_row_in_archive_order":{"model":"4s-ShiftGCN","paper_title":"NTU-X: An Enhanced Large-scale Dataset for Improving Pose-based Recognition of Subtle Human Actions","paper_url":"/paper/ntu60-x-towards-skeleton-based-recognition-of","paper_date":"2021-01-27","arxiv_id":"2101.11529","code_links":[{"title":"skelemoa/ntu-x","url":"https://github.com/skelemoa/ntu-x"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-upenn","slug":"skeleton-based-action-recognition-on-upenn","dataset":"UPenn Action","dataset_url":"/dataset/penn-action","rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"UNIK","paper_title":"UNIK: A Unified Framework for Real-world Skeleton-based Action Recognition","paper_url":"/paper/unik-a-unified-framework-for-real-world","paper_date":"2021-07-19","arxiv_id":"2107.08580","code_links":[{"title":"YangDi666/UNIK","url":"https://github.com/YangDi666/UNIK"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-uwa3d","slug":"skeleton-based-action-recognition-on-uwa3d","dataset":"UWA3D","dataset_url":null,"rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"VA-fusion (aug.)","paper_title":"View Adaptive Neural Networks for High Performance Skeleton-based Human Action Recognition","paper_url":"/paper/view-adaptive-neural-networks-for-high","paper_date":"2018-04-20","arxiv_id":"1804.07453","code_links":[{"title":"microsoft/View-Adaptive-Neural-Networks-for-Skeleton-based-Human-Action-Recognition","url":"https://github.com/microsoft/View-Adaptive-Neural-Networks-for-Skeleton-based-Human-Action-Recognition"},{"title":"iamjeff7/j-va-aagcn","url":"https://github.com/iamjeff7/j-va-aagcn"}],"syntology":{"n":12,"n_ran":6,"n_unverified":6,"n_pointer_only":9}}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-drive","slug":"skeleton-based-action-recognition-on-drive","dataset":"Drive&Act","dataset_url":"/dataset/drive-act","rows_in_archive":2,"metrics":["mean per-class accuracy"],"first_row_in_archive_order":{"model":"dyalyt","paper_title":"Do You Act Like You Talk? Exploring Pose-based Driver Action Classification with Speech Recognition Networks","paper_url":"/paper/do-you-act-like-you-talk-exploring-pose-based","paper_date":"2024-07-15","arxiv_id":null,"code_links":[{"title":"pablopardod/dyalyt","url":"https://github.com/pablopardod/dyalyt"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-hmdb51","slug":"skeleton-based-action-recognition-on-hmdb51","dataset":"HMDB51","dataset_url":"/dataset/hmdb51","rows_in_archive":2,"metrics":["Accuracy","Average accuracy of 3 splits"],"first_row_in_archive_order":{"model":"Structured Keypoint Pooling","paper_title":"Unified Keypoint-based Action Recognition Framework via Structured Keypoint Pooling","paper_url":"/paper/unified-keypoint-based-action-recognition","paper_date":"2023-03-27","arxiv_id":"2303.15270","code_links":[],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-j-hmbd","slug":"skeleton-based-action-recognition-on-j-hmbd","dataset":"J-HMBD Early Action","dataset_url":"/dataset/jhmdb","rows_in_archive":2,"metrics":["10%"],"first_row_in_archive_order":{"model":"DR^2N","paper_title":"Relational Autoencoder for Feature Extraction","paper_url":"/paper/relational-autoencoder-for-feature-extraction","paper_date":"2018-02-09","arxiv_id":"1802.03145","code_links":[{"title":"ser-art/RAE-vs-AE","url":"https://github.com/ser-art/RAE-vs-AE"},{"title":"rk68657/AutoEncoders","url":"https://github.com/rk68657/AutoEncoders"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-msrc-12","slug":"skeleton-based-action-recognition-on-msrc-12","dataset":"MSRC-12","dataset_url":"/dataset/msrc-12","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Temporal Subspace Clustering","paper_title":"Subspace Clustering for Action Recognition with Covariance Representations and Temporal Pruning","paper_url":"/paper/subspace-clustering-for-action-recognition","paper_date":"2020-06-21","arxiv_id":"2006.11812","code_links":[{"title":"IIT-PAVIS/subspace-clustering-action-recognition","url":"https://github.com/IIT-PAVIS/subspace-clustering-action-recognition"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-tcg","slug":"skeleton-based-action-recognition-on-tcg","dataset":"TCG-dataset","dataset_url":"/dataset/tcg","rows_in_archive":2,"metrics":["Acc","F1-Score","Jaccard Index"],"first_row_in_archive_order":{"model":"Bidirectional LSTM","paper_title":"Traffic Control Gesture Recognition for Autonomous Vehicles","paper_url":"/paper/traffic-control-gesture-recognition-for","paper_date":"2020-07-31","arxiv_id":"2007.16072","code_links":[{"title":"againerju/tcg_recognition","url":"https://github.com/againerju/tcg_recognition"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on","slug":"skeleton-based-action-recognition-on","dataset":"Skeletics-152","dataset_url":"/dataset/skeletics-152-1","rows_in_archive":1,"metrics":["Accuracy (Cross-Subject)"],"first_row_in_archive_order":{"model":"4s-ShiftGCN","paper_title":"Quo Vadis, Skeleton Action Recognition ?","paper_url":"/paper/quo-vadis-skeleton-action-recognition","paper_date":"2020-07-04","arxiv_id":"2007.02072","code_links":[{"title":"skelemoa/quovadis","url":"https://github.com/skelemoa/quovadis"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-hdm05","slug":"skeleton-based-action-recognition-on-hdm05","dataset":"HDM05","dataset_url":"/dataset/hdm05","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Temporal Subspace Clustering","paper_title":"Subspace Clustering for Action Recognition with Covariance Representations and Temporal Pruning","paper_url":"/paper/subspace-clustering-for-action-recognition","paper_date":"2020-06-21","arxiv_id":"2006.11812","code_links":[{"title":"IIT-PAVIS/subspace-clustering-action-recognition","url":"https://github.com/IIT-PAVIS/subspace-clustering-action-recognition"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-kinetics-2","slug":"skeleton-based-action-recognition-on-kinetics-2","dataset":"Kinetics-400","dataset_url":"/dataset/kinetics","rows_in_archive":1,"metrics":["Actions Top-1 (S1)"],"first_row_in_archive_order":{"model":"STGAT","paper_title":"Spatial Temporal Graph Attention Network for Skeleton-Based Action Recognition","paper_url":"/paper/spatial-temporal-graph-attention-network-for","paper_date":"2022-08-18","arxiv_id":"2208.08599","code_links":[{"title":"hulianyuyy/STGAT","url":"https://github.com/hulianyuyy/STGAT"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-msr-1","slug":"skeleton-based-action-recognition-on-msr-1","dataset":"MSR ActionPairs","dataset_url":"/dataset/msr-actionpairs","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Temporal Subspace Clustering","paper_title":"Subspace Clustering for Action Recognition with Covariance Representations and Temporal Pruning","paper_url":"/paper/subspace-clustering-for-action-recognition","paper_date":"2020-06-21","arxiv_id":"2006.11812","code_links":[{"title":"IIT-PAVIS/subspace-clustering-action-recognition","url":"https://github.com/IIT-PAVIS/subspace-clustering-action-recognition"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-skeleton","slug":"skeleton-based-action-recognition-on-skeleton","dataset":"Skeleton-Mimetics","dataset_url":"/dataset/skeleton-mimetics","rows_in_archive":1,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"MS-G3D","paper_title":"Quo Vadis, Skeleton Action Recognition ?","paper_url":"/paper/quo-vadis-skeleton-action-recognition","paper_date":"2020-07-04","arxiv_id":"2007.02072","code_links":[{"title":"skelemoa/quovadis","url":"https://github.com/skelemoa/quovadis"}],"syntology":null}},{"leaderboard":"/sota/skeleton-based-action-recognition-on-ucf101","slug":"skeleton-based-action-recognition-on-ucf101","dataset":"UCF101","dataset_url":"/dataset/ucf101","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Structured Keypoint Pooling","paper_title":"Unified Keypoint-based Action Recognition Framework via Structured Keypoint Pooling","paper_url":"/paper/unified-keypoint-based-action-recognition","paper_date":"2023-03-27","arxiv_id":"2303.15270","code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/ucf101","name":"UCF101","full_name":"UCF101 Human Actions dataset","num_papers_in_archive":1863},{"url":"/dataset/kinetics","name":"Kinetics","full_name":"Kinetics Human Action Video Dataset","num_papers_in_archive":1341},{"url":"/dataset/hmdb51","name":"HMDB51","full_name":"","num_papers_in_archive":839},{"url":"/dataset/kinetics-400-1","name":"Kinetics 400","full_name":"","num_papers_in_archive":712},{"url":"/dataset/ntu-rgb-d","name":"NTU RGB+D","full_name":"","num_papers_in_archive":476},{"url":"/dataset/jhmdb","name":"JHMDB","full_name":"Joint-annotated Human Motion Data Base","num_papers_in_archive":249},{"url":"/dataset/ntu-rgb-d-120","name":"NTU RGB+D 120","full_name":"","num_papers_in_archive":137},{"url":"/dataset/penn-action","name":"Penn Action","full_name":"","num_papers_in_archive":110},{"url":"/dataset/pku-mmd","name":"PKU-MMD","full_name":"PKU-MMD","num_papers_in_archive":72},{"url":"/dataset/ut-kinect","name":"UT-Kinect","full_name":"UTKinect-Action3D Dataset","num_papers_in_archive":70},{"url":"/dataset/cad-120","name":"CAD-120","full_name":"","num_papers_in_archive":65},{"url":"/dataset/uav-human","name":"UAV-Human","full_name":"","num_papers_in_archive":47},{"url":"/dataset/shrec","name":"SHREC","full_name":"SHape REtrieval Contest","num_papers_in_archive":32},{"url":"/dataset/msrc-12","name":"MSRC-12","full_name":"MSRC-12 Kinect Gesture Dataset","num_papers_in_archive":31},{"url":"/dataset/n-ucla","name":"N-UCLA","full_name":"Northwestern-UCLA Multiview Action 3D Dataset","num_papers_in_archive":30},{"url":"/dataset/g3d","name":"G3D","full_name":"Gaming 3D Dataset","num_papers_in_archive":28},{"url":"/dataset/sbu","name":"SBU / SBU-Refine","full_name":"SBU-Kinect-Interaction dataset v2.0","num_papers_in_archive":28},{"url":"/dataset/drive-act","name":"Drive&Act","full_name":"","num_papers_in_archive":26},{"url":"/dataset/florence3d","name":"Florence3D","full_name":"","num_papers_in_archive":18},{"url":"/dataset/first-person-hand-action-benchmark","name":"First-Person Hand Action Benchmark","full_name":"","num_papers_in_archive":15},{"url":"/dataset/h2o-dataset","name":"H2O  (2 Hands and Objects)","full_name":"","num_papers_in_archive":14},{"url":"/dataset/msr-actionpairs","name":"MSR ActionPairs","full_name":"","num_papers_in_archive":7},{"url":"/dataset/msr-action3d","name":"MSR Action3D","full_name":"","num_papers_in_archive":5},{"url":"/dataset/tcg","name":"TCG","full_name":"Traffic Control Gesture","num_papers_in_archive":4},{"url":"/dataset/hdm05","name":"HDM05","full_name":"HDM05","num_papers_in_archive":3},{"url":"/dataset/ntu-x","name":"NTU-X","full_name":"","num_papers_in_archive":2},{"url":"/dataset/skeletics-152-1","name":"Skeletics 152","full_name":"","num_papers_in_archive":2},{"url":"/dataset/skeleton-mimetics","name":"Skeleton-Mimetics","full_name":"","num_papers_in_archive":2},{"url":"/dataset/anubis","name":"ANUBIS","full_name":"Skeleton-Based Action Recognition Dataset","num_papers_in_archive":1},{"url":"/dataset/metaphorics","name":"Metaphorics","full_name":"","num_papers_in_archive":1}],"subtasks":[],"parent_tasks":[{"url":"/task/3d-human-action-recognition","name":"3D Action Recognition"},{"url":"/task/action-detection","name":"Action Detection"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":219,"tagged_in_all":419,"items":[{"url":"/paper/pointnet-deep-learning-on-point-sets-for-3d","title":"PointNet: Deep Learning on Point Sets for 3D Classification and Segmentation","date":"2016-12-02","arxiv_id":"1612.00593","repositories_listed":110,"syntology":{"n":164,"n_ran":89,"n_unverified":75,"n_pointer_only":90}},{"url":"/paper/graph-attention-networks","title":"Graph Attention Networks","date":"2017-10-30","arxiv_id":"1710.10903","repositories_listed":93,"syntology":{"n":106,"n_ran":50,"n_unverified":56,"n_pointer_only":43}},{"url":"/paper/semi-supervised-classification-with-graph","title":"Semi-Supervised Classification with Graph Convolutional Networks","date":"2016-09-09","arxiv_id":"1609.02907","repositories_listed":55,"syntology":{"n":58,"n_ran":31,"n_unverified":27,"n_pointer_only":22}},{"url":"/paper/quo-vadis-action-recognition-a-new-model-and","title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","date":"2017-05-22","arxiv_id":"1705.07750","repositories_listed":34,"syntology":{"n":28,"n_ran":16,"n_unverified":12,"n_pointer_only":7}},{"url":"/paper/spatial-temporal-graph-convolutional-networks-1","title":"Spatial Temporal Graph Convolutional Networks for Skeleton-Based Action Recognition","date":"2018-01-23","arxiv_id":"1801.07455","repositories_listed":24,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/flownet-20-evolution-of-optical-flow","title":"FlowNet 2.0: Evolution of Optical Flow Estimation with Deep Networks","date":"2016-12-06","arxiv_id":"1612.01925","repositories_listed":12,"syntology":{"n":21,"n_ran":2,"n_unverified":19,"n_pointer_only":3}},{"url":"/paper/independently-recurrent-neural-network-indrnn","title":"Independently Recurrent Neural Network (IndRNN): Building A Longer and Deeper RNN","date":"2018-03-13","arxiv_id":"1803.04831","repositories_listed":11,"syntology":{"n":5,"n_ran":1,"n_unverified":4,"n_pointer_only":1}},{"url":"/paper/simplifying-graph-convolutional-networks","title":"Simplifying Graph Convolutional Networks","date":"2019-02-19","arxiv_id":"1902.07153","repositories_listed":7,"syntology":{"n":8,"n_ran":3,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/ucf101-a-dataset-of-101-human-actions-classes","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","date":"2012-12-03","arxiv_id":"1212.0402","repositories_listed":7,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/co-occurrence-feature-learning-from-skeleton","title":"Co-occurrence Feature Learning from Skeleton Data for Action Recognition and Detection with Hierarchical Aggregation","date":"2018-04-17","arxiv_id":"1804.06055","repositories_listed":6,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":3}},{"url":"/paper/temporal-convolutional-networks-for-action","title":"Temporal Convolutional Networks for Action Segmentation and Detection","date":"2016-11-16","arxiv_id":"1611.05267","repositories_listed":5,"syntology":{"n":21,"n_ran":2,"n_unverified":19,"n_pointer_only":0}},{"url":"/paper/convolutional-neural-networks-on-graphs-with","title":"Convolutional Neural Networks on Graphs with Fast Localized Spectral Filtering","date":"2016-06-30","arxiv_id":"1606.09375","repositories_listed":5,"syntology":{"n":6,"n_ran":2,"n_unverified":4,"n_pointer_only":2}},{"url":"/paper/constructing-stronger-and-faster-baselines","title":"Constructing Stronger and Faster Baselines for Skeleton-based Action Recognition","date":"2021-06-29","arxiv_id":"2106.15125","repositories_listed":4,"syntology":null},{"url":"/paper/revisiting-skeleton-based-action-recognition","title":"Revisiting Skeleton-based Action Recognition","date":"2021-04-28","arxiv_id":"2104.13586","repositories_listed":4,"syntology":null},{"url":"/paper/non-local-graph-convolutional-networks-for","title":"Two-Stream Adaptive Graph Convolutional Networks for Skeleton-Based Action Recognition","date":"2018-05-20","arxiv_id":"1805.07694","repositories_listed":4,"syntology":null},{"url":"/paper/dg-stgcn-dynamic-spatial-temporal-modeling","title":"DG-STGCN: Dynamic Spatial-Temporal Modeling for Skeleton-based Action Recognition","date":"2022-10-12","arxiv_id":"2210.05895","repositories_listed":3,"syntology":null},{"url":"/paper/language-supervised-training-for-skeleton","title":"Generative Action Description Prompts for Skeleton-based Action Recognition","date":"2022-08-10","arxiv_id":"2208.05318","repositories_listed":3,"syntology":{"n":10,"n_ran":7,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/skeleton-based-sign-language-recognition","title":"Skeleton Aware Multi-modal Sign Language Recognition","date":"2021-03-16","arxiv_id":"2103.08833","repositories_listed":3,"syntology":null},{"url":"/paper/richly-activated-graph-convolutional-network","title":"Richly Activated Graph Convolutional Network for Robust Skeleton-based Action Recognition","date":"2020-08-09","arxiv_id":"2008.03791","repositories_listed":3,"syntology":null},{"url":"/paper/disentangling-and-unifying-graph-convolutions","title":"Disentangling and Unifying Graph Convolutions for Skeleton-Based Action Recognition","date":"2020-03-31","arxiv_id":"2003.14111","repositories_listed":3,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/make-skeleton-based-action-recognition-model-1","title":"Make Skeleton-based Action Recognition Model Smaller, Faster and Better","date":"2019-07-23","arxiv_id":"1907.09658","repositories_listed":3,"syntology":null},{"url":"/paper/richlt-activated-graph-convolutional-network","title":"Richly Activated Graph Convolutional Network for Action Recognition with Incomplete Skeletons","date":"2019-05-16","arxiv_id":"1905.06774","repositories_listed":3,"syntology":null},{"url":"/paper/action-ood-an-end-to-end-skeleton-based-model","title":"Skeleton-OOD: An End-to-End Skeleton-Based Model for Robust Out-of-Distribution Human Action Detection","date":"2024-05-31","arxiv_id":"2405.20633","repositories_listed":2,"syntology":null},{"url":"/paper/hulk-a-universal-knowledge-translator-for","title":"Hulk: A Universal Knowledge Translator for Human-Centric Tasks","date":"2023-12-04","arxiv_id":"2312.01697","repositories_listed":2,"syntology":{"n":24,"n_ran":12,"n_unverified":12,"n_pointer_only":0}},{"url":"/paper/reads-v-real-time-automated-detection-of","title":"VSViG: Real-time Video-based Seizure Detection via Skeleton-based Spatiotemporal ViG","date":"2023-11-24","arxiv_id":"2311.14775","repositories_listed":2,"syntology":null},{"url":"/paper/infogcn-learning-representation-by-predicting","title":"InfoGCN++: Learning Representation by Predicting the Future for Online Human Skeleton-based Action Recognition","date":"2023-10-16","arxiv_id":"2310.10547","repositories_listed":2,"syntology":null},{"url":"/paper/topology-aware-mlp-for-skeleton-based-action","title":"SiT-MLP: A Simple MLP with Point-wise Topology Feature Learning for Skeleton-based Action Recognition","date":"2023-08-30","arxiv_id":"2308.16018","repositories_listed":2,"syntology":null},{"url":"/paper/joint-adversarial-and-collaborative-learning","title":"Cross-Model Cross-Stream Learning for Self-Supervised Human Action Recognition","date":"2023-07-15","arxiv_id":"2307.07791","repositories_listed":2,"syntology":null},{"url":"/paper/proformer-learning-data-efficient","title":"Delving Deep into One-Shot Skeleton-based Action Recognition with Diverse Occlusions","date":"2022-02-23","arxiv_id":"2202.11423","repositories_listed":2,"syntology":null},{"url":"/paper/sign-language-recognition-via-skeleton-aware","title":"Sign Language Recognition via Skeleton-Aware Multi-Model Ensemble","date":"2021-10-12","arxiv_id":"2110.06161","repositories_listed":2,"syntology":null}],"syntology_records":15,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}