{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/vpn-learning-video-pose-embedding-for","title":"VPN: Learning Video-Pose Embedding for Activities of Daily Living","arxiv_id":"2007.03056","date":"2020-07-06","proceeding":"ECCV 2020 8","authors":["Srijan Das","Saurav Sharma","Rui Dai","Francois Bremond","Monique Thonnat"],"abstract":"In this paper, we focus on the spatio-temporal aspect of recognizing Activities of Daily Living (ADL). ADL have two specific properties (i) subtle spatio-temporal patterns and (ii) similar visual patterns varying with time. Therefore, ADL may look very similar and often necessitate to look at their fine-grained details to distinguish them. Because the recent spatio-temporal 3D ConvNets are too rigid to capture the subtle visual patterns across an action, we propose a novel Video-Pose Network: VPN. The 2 key components of this VPN are a spatial embedding and an attention network. The spatial embedding projects the 3D poses and RGB cues in a common semantic space. This enables the action recognition framework to learn better spatio-temporal features exploiting both modalities. In order to discriminate similar actions, the attention network provides two functionalities - (i) an end-to-end learnable pose backbone exploiting the topology of human body, and (ii) a coupler to provide joint spatio-temporal attention weights across a video. Experiments show that VPN outperforms the state-of-the-art results for action classification on a large scale human activity dataset: NTU-RGB+D 120, its subset NTU-RGB+D 60, a real-world challenging human activity dataset: Toyota Smarthome and a small scale human-object interaction dataset Northwestern UCLA.","url_abs":"https://arxiv.org/abs/2007.03056v1","url_pdf":"https://arxiv.org/pdf/2007.03056v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"vpn-learning-video-pose-embedding-for","repo_url":"https://github.com/srijandas07/VPN","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"tf","reach":{"status":"ok"}}],"tasks":[{"task_slug":"action-classification","task_name":"Action Classification"},{"task_slug":"action-recognition-in-videos","task_name":"Action Recognition"},{"task_slug":"human-object-interaction-detection","task_name":"Human-Object Interaction Detection"},{"task_slug":"skeleton-based-action-recognition","task_name":"Skeleton Based Action Recognition"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/action-classification-on-toyota-smarthome","task":"Action Classification","dataset":"Toyota Smarthome dataset","model":"VPN (RGB + Pose)","rank_in_archive_order":7,"of":13,"metrics":{"CS":"60.8","CV1":"43.8","CV2":"53.5"},"uses_additional_data":true},{"leaderboard":"/sota/action-recognition-in-videos-on-ntu-rgbd","task":"Action Recognition","dataset":"NTU RGB+D","model":"VPN (RGB + Pose)","rank_in_archive_order":8,"of":28,"metrics":{"Accuracy (CS)":"95.5","Accuracy (CV)":"98.0"},"uses_additional_data":true},{"leaderboard":"/sota/action-recognition-in-videos-on-ntu-rgbd-120","task":"Action Recognition","dataset":"NTU RGB+D 120","model":"VPN (RGB + Pose)","rank_in_archive_order":16,"of":21,"metrics":{"Accuracy (Cross-Setup)":"86.3","Accuracy (Cross-Subject)":"87.8"},"uses_additional_data":true},{"leaderboard":"/sota/skeleton-based-action-recognition-on-n-ucla","task":"Skeleton Based Action Recognition","dataset":"N-UCLA","model":"VPN (RGB + Pose)","rank_in_archive_order":19,"of":25,"metrics":{"Accuracy":"93.5"},"uses_additional_data":true},{"leaderboard":"/sota/skeleton-based-action-recognition-on-ntu-rgbd-1","task":"Skeleton Based Action Recognition","dataset":"NTU RGB+D 120","model":"VPN","rank_in_archive_order":40,"of":83,"metrics":{"Accuracy (Cross-Setup)":"87.8","Accuracy (Cross-Subject)":"86.3"},"uses_additional_data":true}],"syntology":{"syntology_url":"https://syntology.ai/paper/2007.03056","atlas_url":"https://app.syntology.ai/?focus=2007.03056","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}