{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/sa-dvae-improving-zero-shot-skeleton-based","title":"SA-DVAE: Improving Zero-Shot Skeleton-Based Action Recognition by Disentangled Variational Autoencoders","arxiv_id":"2407.13460","date":"2024-07-18","proceeding":null,"authors":["Sheng-Wei Li","Zi-Xiang Wei","Wei-Jie Chen","Yi-Hsin Yu","Chih-Yuan Yang","Jane Yung-jen Hsu"],"abstract":"Existing zero-shot skeleton-based action recognition methods utilize projection networks to learn a shared latent space of skeleton features and semantic embeddings. The inherent imbalance in action recognition datasets, characterized by variable skeleton sequences yet constant class labels, presents significant challenges for alignment. To address the imbalance, we propose SA-DVAE -- Semantic Alignment via Disentangled Variational Autoencoders, a method that first adopts feature disentanglement to separate skeleton features into two independent parts -- one is semantic-related and another is irrelevant -- to better align skeleton and semantic features. We implement this idea via a pair of modality-specific variational autoencoders coupled with a total correction penalty. We conduct experiments on three benchmark datasets: NTU RGB+D, NTU RGB+D 120 and PKU-MMD, and our experimental results show that SA-DAVE produces improved performance over existing methods. The code is available at https://github.com/pha123661/SA-DVAE.","url_abs":"https://arxiv.org/abs/2407.13460v1","url_pdf":"https://arxiv.org/pdf/2407.13460v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"sa-dvae-improving-zero-shot-skeleton-based","repo_url":"https://github.com/pha123661/SA-DVAE","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"action-recognition-in-videos","task_name":"Action Recognition"},{"task_slug":"disentanglement","task_name":"Disentanglement"},{"task_slug":"generalized-zero-shot-skeletal-action","task_name":"Generalized Zero Shot skeletal action recognition"},{"task_slug":"skeleton-based-action-recognition","task_name":"Skeleton Based Action Recognition"},{"task_slug":"zero-shot-skeletal-action-recognition","task_name":"Zero Shot Skeletal Action Recognition"},{"task_slug":"zero-shot-skeleton-based-action-recognition","task_name":"Zero-shot skeleton-based action recognition"}],"methods":[{"method_slug":"align","method_name":"ALIGN"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/generalized-zero-shot-skeletal-action","task":"Generalized Zero Shot skeletal action recognition","dataset":"NTU RGB+D","model":"SA-DVAE","rank_in_archive_order":2,"of":4,"metrics":{"Harmonic Mean (12 unseen classes)":"42.56","Harmonic Mean (5 unseen classes)":"66.27","Random Split Harmonic Mean":"75.27"},"uses_additional_data":false},{"leaderboard":"/sota/generalized-zero-shot-skeletal-action","task":"Generalized Zero Shot skeletal action recognition","dataset":"NTU RGB+D","model":"SA-DVAE + augmented text","rank_in_archive_order":4,"of":4,"metrics":{"Random Split Harmonic Mean":"75.51"},"uses_additional_data":false},{"leaderboard":"/sota/generalized-zero-shot-skeletal-action-1","task":"Generalized Zero Shot skeletal action recognition","dataset":"NTU RGB+D 120","model":"SA-DVAE","rank_in_archive_order":1,"of":4,"metrics":{"Harmonic Mean (10 unseen classes)":"60.42","Harmonic Mean (24 unseen classes)":"44.50","Random Split Harmonic Mean":"47.54"},"uses_additional_data":false},{"leaderboard":"/sota/generalized-zero-shot-skeletal-action-1","task":"Generalized Zero Shot skeletal action recognition","dataset":"NTU RGB+D 120","model":"SA-DVAE + augmented text","rank_in_archive_order":4,"of":4,"metrics":{"Random Split Harmonic Mean":"50.72"},"uses_additional_data":false},{"leaderboard":"/sota/generalized-zero-shot-skeletal-action-2","task":"Generalized Zero Shot skeletal action recognition","dataset":"PKU-MMD","model":"SA-DVAE","rank_in_archive_order":1,"of":1,"metrics":{"Random Split Harmonic Mean":"54.72"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-skeletal-action-recognition-on-ntu","task":"Zero Shot Skeletal Action Recognition","dataset":"NTU RGB+D","model":"SA-DVAE","rank_in_archive_order":4,"of":9,"metrics":{"Accuracy (12 unseen classes)":"41.38","Accuracy (5 unseen classes)":"82.37","Random Split Accuracy":"84.20"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-skeletal-action-recognition-on-ntu","task":"Zero Shot Skeletal Action Recognition","dataset":"NTU RGB+D","model":"SA-DVAE + augmented text","rank_in_archive_order":9,"of":9,"metrics":{"Random Split Accuracy":"87.61"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-skeletal-action-recognition-on-ntu-1","task":"Zero Shot Skeletal Action Recognition","dataset":"NTU RGB+D 120","model":"SA-DVAE","rank_in_archive_order":4,"of":9,"metrics":{"Accuracy (10 unseen classes)":"68.77","Accuracy (24 unseen classes)":"46.12","Random Split Accuracy":"50.67"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-skeletal-action-recognition-on-ntu-1","task":"Zero Shot Skeletal Action Recognition","dataset":"NTU RGB+D 120","model":"SA-DVAE + augmented text","rank_in_archive_order":9,"of":9,"metrics":{"Random Split Accuracy":"57.16"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-skeletal-action-recognition-on-pku","task":"Zero Shot Skeletal Action Recognition","dataset":"PKU-MMD","model":"SA-DVAE","rank_in_archive_order":4,"of":7,"metrics":{"Random Split Accuracy":"66.54"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2407.13460","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}