{"url":"/task/3d-human-action-recognition","name":"3D Action Recognition","slug":"3d-human-action-recognition","description_markdown":"Image: [Rahmani et al](https://www.cv-foundation.org/openaccess/content_cvpr_2016/papers/Rahmani_3D_Action_Recognition_CVPR_2016_paper.pdf)","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":91,"papers_with_code":38,"benchmarks":3,"benchmark_tables_in_archive":3,"benchmark_tables_shown":3,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":15,"subtasks":6,"parent_tasks":2},"benchmarks":[{"leaderboard":"/sota/3d-action-recognition-on-assembly101","slug":"3d-action-recognition-on-assembly101","dataset":"Assembly101","dataset_url":"/dataset/assembly101","rows_in_archive":7,"metrics":["Actions Top-1","Verbs Top-1","Object Top-1"],"first_row_in_archive_order":{"model":"HandFormer-B/21","paper_title":"On the Utility of 3D Hand Poses for Action Recognition","paper_url":"/paper/on-the-utility-of-3d-hand-poses-for-action","paper_date":"2024-03-14","arxiv_id":"2403.09805","code_links":[{"title":"s-shamil/HandFormer","url":"https://github.com/s-shamil/HandFormer"}],"syntology":{"n":13,"n_ran":8,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/3d-action-recognition-on-ntu-rgb-d-1","slug":"3d-action-recognition-on-ntu-rgb-d-1","dataset":"NTU RGB+D","dataset_url":"/dataset/ntu-rgb-d","rows_in_archive":5,"metrics":["Cross Subject Accuracy","Cross View Accuracy"],"first_row_in_archive_order":{"model":"Kinet","paper_title":"No Pain, Big Gain: Classify Dynamic Point Cloud Sequences with Static Models by Fitting Feature-level Space-time Surfaces","paper_url":"/paper/no-pain-big-gain-classify-dynamic-point-cloud","paper_date":"2022-03-21","arxiv_id":"2203.11113","code_links":[{"title":"jx-zhong-for-academic-purpose/kinet","url":"https://github.com/jx-zhong-for-academic-purpose/kinet"}],"syntology":null}},{"leaderboard":"/sota/3d-action-recognition-on-100-sleep-nights-of","slug":"3d-action-recognition-on-100-sleep-nights-of","dataset":"100 sleep nights of 8 caregivers","dataset_url":null,"rows_in_archive":1,"metrics":["10%"],"first_row_in_archive_order":{"model":"htf","paper_title":"A System for Real-Time Interactive Analysis of Deep Learning Training","paper_url":"/paper/a-system-for-real-time-interactive-analysis","paper_date":"2020-01-05","arxiv_id":"2001.01215","code_links":[{"title":"microsoft/tensorwatch","url":"https://github.com/microsoft/tensorwatch"}],"syntology":{"n":17,"n_ran":0,"n_unverified":17,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/ntu-rgb-d","name":"NTU RGB+D","full_name":"","num_papers_in_archive":476},{"url":"/dataset/babel-1","name":"BABEL","full_name":"","num_papers_in_archive":72},{"url":"/dataset/assembly101","name":"Assembly101","full_name":"","num_papers_in_archive":57},{"url":"/dataset/uav-human","name":"UAV-Human","full_name":"","num_papers_in_archive":47},{"url":"/dataset/florence3d","name":"Florence3D","full_name":"","num_papers_in_archive":18},{"url":"/dataset/flag3d","name":"FLAG3D","full_name":"","num_papers_in_archive":4},{"url":"/dataset/fr-fs","name":"FR-FS","full_name":"Fall Recognition in Figure Skating","num_papers_in_archive":4},{"url":"/dataset/fitness-aqa","name":"Fitness-AQA","full_name":"Fitness Action Quality Assessment [ECCV 2022]","num_papers_in_archive":3},{"url":"/dataset/navigation-turing-test","name":"Navigation Turing Test","full_name":"","num_papers_in_archive":3},{"url":"/dataset/3dyoga90","name":"3DYoga90","full_name":"3DYoga90: A Hierarchical Video Dataset for Yoga Pose Understanding","num_papers_in_archive":2},{"url":"/dataset/cap","name":"CAP","full_name":"Consented Activities of People","num_papers_in_archive":2},{"url":"/dataset/multiviewc","name":"MultiviewC","full_name":"","num_papers_in_archive":2},{"url":"/dataset/darai","name":"DARai","full_name":"Daily Activity Recordings for AI and ML applications","num_papers_in_archive":1},{"url":"/dataset/infiniterep","name":"InfiniteRep","full_name":"InfiniteRep","num_papers_in_archive":0},{"url":"/dataset/unipd-bpe","name":"UNIPD-BPE","full_name":"University of Padova Body Pose Estimation","num_papers_in_archive":0}],"subtasks":[{"url":"/task/generalized-zero-shot-skeletal-action","name":"Generalized Zero Shot skeletal action recognition"},{"url":"/task/image-manipulation-detection","name":"Image Manipulation Detection"},{"url":"/task/model-editing","name":"Model Editing"},{"url":"/task/motion-retargeting","name":"motion retargeting"},{"url":"/task/skeleton-based-action-recognition","name":"Skeleton Based Action Recognition"},{"url":"/task/zero-shot-skeletal-action-recognition","name":"Zero Shot Skeletal Action Recognition"}],"parent_tasks":[{"url":"/task/action-recognition","name":"Temporal Action Localization"},{"url":"/task/action-recognition-in-videos","name":"Action Recognition"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":38,"tagged_in_all":91,"items":[{"url":"/paper/grad-cam-improved-visual-explanations-for","title":"Grad-CAM++: Improved Visual Explanations for Deep Convolutional Networks","date":"2017-10-30","arxiv_id":"1710.11063","repositories_listed":24,"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":3}},{"url":"/paper/temporal-shift-module-for-efficient-video","title":"TSM: Temporal Shift Module for Efficient Video Understanding","date":"2018-11-20","arxiv_id":"1811.08383","repositories_listed":13,"syntology":{"n":16,"n_ran":6,"n_unverified":10,"n_pointer_only":4}},{"url":"/paper/unsupervised-learning-of-object-keypoints-for","title":"Unsupervised Learning of Object Keypoints for Perception and Control","date":"2019-06-19","arxiv_id":"1906.11883","repositories_listed":6,"syntology":{"n":11,"n_ran":4,"n_unverified":7,"n_pointer_only":4}},{"url":"/paper/revisiting-skeleton-based-action-recognition","title":"Revisiting Skeleton-based Action Recognition","date":"2021-04-28","arxiv_id":"2104.13586","repositories_listed":4,"syntology":null},{"url":"/paper/non-local-graph-convolutional-networks-for","title":"Two-Stream Adaptive Graph Convolutional Networks for Skeleton-Based Action Recognition","date":"2018-05-20","arxiv_id":"1805.07694","repositories_listed":4,"syntology":null},{"url":"/paper/disentangling-and-unifying-graph-convolutions","title":"Disentangling and Unifying Graph Convolutions for Skeleton-Based Action Recognition","date":"2020-03-31","arxiv_id":"2003.14111","repositories_listed":3,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/reconstructing-undersampled-photoacoustic","title":"Reconstructing undersampled photoacoustic microscopy images using deep learning","date":"2020-05-30","arxiv_id":"2006.00251","repositories_listed":2,"syntology":null},{"url":"/paper/ntu-rgbd-a-large-scale-dataset-for-3d-human","title":"NTU RGB+D: A Large Scale Dataset for 3D Human Activity Analysis","date":"2016-04-11","arxiv_id":"1604.02808","repositories_listed":2,"syntology":null},{"url":"/paper/chase-learning-convex-hull-adaptive-shift-for","title":"CHASE: Learning Convex Hull Adaptive Shift for Skeleton-based Multi-Entity Action Recognition","date":"2024-10-09","arxiv_id":"2410.07153","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/spatial-hierarchy-and-temporal-attention","title":"Spatial Hierarchy and Temporal Attention Guided Cross Masking for Self-supervised Skeleton-based Action Recognition","date":"2024-09-26","arxiv_id":"2409.17951","repositories_listed":1,"syntology":null},{"url":"/paper/stars-self-supervised-tuning-for-3d-action","title":"STARS: Self-supervised Tuning for 3D Action Recognition in Skeleton Sequences","date":"2024-07-15","arxiv_id":"2407.10935","repositories_listed":1,"syntology":null},{"url":"/paper/on-the-utility-of-3d-hand-poses-for-action","title":"On the Utility of 3D Hand Poses for Action Recognition","date":"2024-03-14","arxiv_id":"2403.09805","repositories_listed":1,"syntology":{"n":13,"n_ran":8,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/masked-motion-predictors-are-strong-3d-action","title":"Masked Motion Predictors are Strong 3D Action Representation Learners","date":"2023-08-14","arxiv_id":"2308.07092","repositories_listed":1,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":4}},{"url":"/paper/interactive-spatiotemporal-token-attention","title":"Interactive Spatiotemporal Token Attention Network for Skeleton-based General Interactive Action Recognition","date":"2023-07-14","arxiv_id":"2307.07469","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/cmd-self-supervised-3d-action-representation","title":"CMD: Self-supervised 3D Action Representation Learning with Cross-modal Mutual Distillation","date":"2022-08-26","arxiv_id":"2208.12448","repositories_listed":1,"syntology":null},{"url":"/paper/collaborating-domain-shared-and-target","title":"Collaborating Domain-shared and Target-specific Feature Clustering for Cross-domain 3D Action Recognition","date":"2022-07-20","arxiv_id":"2207.09767","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/multi-scale-spatial-temporal-graph","title":"Multi-Scale Spatial Temporal Graph Convolutional Network for Skeleton-Based Action Recognition","date":"2022-06-27","arxiv_id":"2206.13028","repositories_listed":1,"syntology":{"n":26,"n_ran":19,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/pstnet-point-spatio-temporal-convolution-on-1","title":"PSTNet: Point Spatio-Temporal Convolution on Point Cloud Sequences","date":"2022-05-27","arxiv_id":"2205.13713","repositories_listed":1,"syntology":null},{"url":"/paper/assembly101-a-large-scale-multi-view-video","title":"Assembly101: A Large-Scale Multi-View Video Dataset for Understanding Procedural Activities","date":"2022-03-28","arxiv_id":"2203.14712","repositories_listed":1,"syntology":null},{"url":"/paper/no-pain-big-gain-classify-dynamic-point-cloud","title":"No Pain, Big Gain: Classify Dynamic Point Cloud Sequences with Static Models by Fitting Feature-level Space-time Surfaces","date":"2022-03-21","arxiv_id":"2203.11113","repositories_listed":1,"syntology":null},{"url":"/paper/domain-knowledge-informed-self-supervised","title":"Domain Knowledge-Informed Self-Supervised Representations for Workout Form Assessment","date":"2022-02-28","arxiv_id":"2202.14019","repositories_listed":1,"syntology":null},{"url":"/paper/deep-hierarchical-representation-of-point","title":"Deep Hierarchical Representation of Point Cloud Videos via Spatio-Temporal Decomposition","date":"2021-12-14","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/3dvnet-multi-view-depth-prediction-and","title":"3DVNet: Multi-View Depth Prediction and Volumetric Refinement","date":"2021-12-01","arxiv_id":"2112.00202","repositories_listed":1,"syntology":null},{"url":"/paper/sequentialpointnet-a-strong-parallelized","title":"Real-time 3D human action recognition based on Hyperpoint sequence","date":"2021-11-16","arxiv_id":"2111.08492","repositories_listed":1,"syntology":null},{"url":"/paper/point-4d-transformer-networks-for-spatio","title":"Point 4D Transformer Networks for Spatio-Temporal Modeling in Point Cloud Videos","date":"2021-06-19","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/babel-bodies-action-and-behavior-with-english","title":"BABEL: Bodies, Action and Behavior with English Labels","date":"2021-06-17","arxiv_id":"2106.09696","repositories_listed":1,"syntology":null},{"url":"/paper/weight-excitation-built-in-attention","title":"Weight Excitation: Built-in Attention Mechanisms in Convolutional Neural Networks","date":"2020-08-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/roweisposes-including-eigenposes-supervised","title":"Roweisposes, Including Eigenposes, Supervised Eigenposes, and Fisherposes, for 3D Action Recognition","date":"2020-06-28","arxiv_id":"2006.15736","repositories_listed":1,"syntology":null},{"url":"/paper/3dv-3d-dynamic-voxel-for-action-recognition","title":"3DV: 3D Dynamic Voxel for Action Recognition in Depth Video","date":"2020-05-12","arxiv_id":"2005.05501","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/a-system-for-real-time-interactive-analysis","title":"A System for Real-Time Interactive Analysis of Deep Learning Training","date":"2020-01-05","arxiv_id":"2001.01215","repositories_listed":1,"syntology":{"n":17,"n_ran":0,"n_unverified":17,"n_pointer_only":0}}],"syntology_records":12,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}