{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/interpretable-3d-human-action-analysis-with","title":"Interpretable 3D Human Action Analysis with Temporal Convolutional Networks","arxiv_id":"1704.04516","date":"2017-04-14","proceeding":null,"authors":["Tae Soo Kim","Austin Reiter"],"abstract":"The discriminative power of modern deep learning models for 3D human action\nrecognition is growing ever so potent. In conjunction with the recent\nresurgence of 3D human action representation with 3D skeletons, the quality and\nthe pace of recent progress have been significant. However, the inner workings\nof state-of-the-art learning based methods in 3D human action recognition still\nremain mostly black-box. In this work, we propose to use a new class of models\nknown as Temporal Convolutional Neural Networks (TCN) for 3D human action\nrecognition. Compared to popular LSTM-based Recurrent Neural Network models,\ngiven interpretable input such as 3D skeletons, TCN provides us a way to\nexplicitly learn readily interpretable spatio-temporal representations for 3D\nhuman action recognition. We provide our strategy in re-designing the TCN with\ninterpretability in mind and how such characteristics of the model is leveraged\nto construct a powerful 3D activity recognition method. Through this work, we\nwish to take a step towards a spatio-temporal model that is easier to\nunderstand, explain and interpret. The resulting model, Res-TCN, achieves\nstate-of-the-art results on the largest 3D human action recognition dataset,\nNTU-RGBD.","url_abs":"http://arxiv.org/abs/1704.04516v1","url_pdf":"http://arxiv.org/pdf/1704.04516v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"interpretable-3d-human-action-analysis-with","repo_url":"https://github.com/TaeSoo-Kim/TCNActionRecognition","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"none","reach":{"status":"unanswered"}}],"tasks":[{"task_slug":"3d-human-action-recognition","task_name":"3D Action Recognition"},{"task_slug":"action-analysis","task_name":"Action Analysis"},{"task_slug":"action-recognition-in-videos","task_name":"Action Recognition"},{"task_slug":"activity-recognition","task_name":"Activity Recognition"},{"task_slug":"multimodal-activity-recognition","task_name":"Multimodal Activity Recognition"},{"task_slug":"skeleton-based-action-recognition","task_name":"Skeleton Based Action Recognition"},{"task_slug":"action-recognition","task_name":"Temporal Action Localization"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/multimodal-activity-recognition-on-ev-action","task":"Multimodal Activity Recognition","dataset":"EV-Action","model":"TCN (Skeleton Kinect)","rank_in_archive_order":1,"of":9,"metrics":{"Accuracy":"80.1"},"uses_additional_data":false},{"leaderboard":"/sota/multimodal-activity-recognition-on-ev-action","task":"Multimodal Activity Recognition","dataset":"EV-Action","model":"TCN (Skeleton Vicon)","rank_in_archive_order":6,"of":9,"metrics":{"Accuracy":"64.1"},"uses_additional_data":false},{"leaderboard":"/sota/skeleton-based-action-recognition-on-ntu-rgbd","task":"Skeleton Based Action Recognition","dataset":"NTU RGB+D","model":"TCN","rank_in_archive_order":123,"of":135,"metrics":{"Accuracy (CS)":"74.3","Accuracy (CV)":"83.1"},"uses_additional_data":false},{"leaderboard":"/sota/skeleton-based-action-recognition-on-varying","task":"Skeleton Based Action Recognition","dataset":"Varying-view RGB-D Action-Skeleton","model":"Res-TCN","rank_in_archive_order":3,"of":7,"metrics":{"Accuracy (AV I)":"48%","Accuracy (AV II)":"68%","Accuracy (CS)":"63%","Accuracy (CV I)":"14%","Accuracy (CV II)":"48%"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1704.04516","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}