Papers › SA-DVAE: Improving Zero-Shot Skeleton-Based Action Recognition by Disentangled...

SA-DVAE: Improving Zero-Shot Skeleton-Based Action Recognition by Disentangled Variational Autoencoders

18 Jul 2024arXiv:2407.13460archive 2025-07-28

Sheng-Wei Li, Zi-Xiang Wei, Wei-Jie Chen, Yi-Hsin Yu, Chih-Yuan Yang, Jane Yung-jen Hsu

Existing zero-shot skeleton-based action recognition methods utilize projection networks to learn a shared latent space of skeleton features and semantic embeddings. The inherent imbalance in action recognition datasets, characterized by variable skeleton sequences yet constant class labels, presents significant challenges for alignment. To address the imbalance, we propose SA-DVAE -- Semantic Alignment via Disentangled Variational Autoencoders, a method that first adopts feature disentanglement to separate skeleton features into two independent parts -- one is semantic-related and another is irrelevant -- to better align skeleton and semantic features. We implement this idea via a pair of modality-specific variational autoencoders coupled with a total correction penalty. We conduct experiments on three benchmark datasets: NTU RGB+D, NTU RGB+D 120 and PKU-MMD, and our experimental results show that SA-DAVE produces improved performance over existing methods. The code is available at https://github.com/pha123661/SA-DVAE.

PaperPDFCode

In Syntology Open this paper in Syntology's Atlas, the map of the papers in Syntology's graph and their citations.

Code

pha123661/SA-DVAE officialmentioned in papermentioned on GitHubpytorch report

Repository list and official/mentioned flags are the archive's, frozen 2025-07-28. Reachability, where shown, is from one Syntology probe window (2026-09-16 to 2026-09-18); repositories not probed show nothing. GitHub stars are not tracked.

Code Syntology ran Syntology

Not run by Syntology. Nothing on this page verifies that the listed code works.

Tasks

Action RecognitionDisentanglementGeneralized Zero Shot skeletal action recognitionSkeleton Based Action RecognitionZero Shot Skeletal Action RecognitionZero-shot skeleton-based action recognition

Results from the paper archive 2025-07-28

TaskDatasetModelMetricValueRank at snapshotLeaderboardReport
Generalized Zero Shot skeletal action recognition NTU RGB+D SA-DVAE Harmonic Mean (12 unseen classes) 42.56 #2 of 4 Archive leaderboard report
Generalized Zero Shot skeletal action recognition NTU RGB+D SA-DVAE Harmonic Mean (5 unseen classes) 66.27 #2 of 4 Archive leaderboard report
Generalized Zero Shot skeletal action recognition NTU RGB+D SA-DVAE Random Split Harmonic Mean 75.27 #2 of 4 Archive leaderboard report
Generalized Zero Shot skeletal action recognition NTU RGB+D SA-DVAE + augmented text Random Split Harmonic Mean 75.51 #4 of 4 Archive leaderboard report
Generalized Zero Shot skeletal action recognition NTU RGB+D 120 SA-DVAE Harmonic Mean (10 unseen classes) 60.42 #1 of 4 Archive leaderboard report
Generalized Zero Shot skeletal action recognition NTU RGB+D 120 SA-DVAE Harmonic Mean (24 unseen classes) 44.50 #1 of 4 Archive leaderboard report
Generalized Zero Shot skeletal action recognition NTU RGB+D 120 SA-DVAE Random Split Harmonic Mean 47.54 #1 of 4 Archive leaderboard report
Generalized Zero Shot skeletal action recognition NTU RGB+D 120 SA-DVAE + augmented text Random Split Harmonic Mean 50.72 #4 of 4 Archive leaderboard report
Generalized Zero Shot skeletal action recognition PKU-MMD SA-DVAE Random Split Harmonic Mean 54.72 #1 of 1 Archive leaderboard report
Zero Shot Skeletal Action Recognition NTU RGB+D SA-DVAE Accuracy (12 unseen classes) 41.38 #4 of 9 Archive leaderboard report
Zero Shot Skeletal Action Recognition NTU RGB+D SA-DVAE Accuracy (5 unseen classes) 82.37 #4 of 9 Archive leaderboard report
Zero Shot Skeletal Action Recognition NTU RGB+D SA-DVAE Random Split Accuracy 84.20 #4 of 9 Archive leaderboard report
Zero Shot Skeletal Action Recognition NTU RGB+D SA-DVAE + augmented text Random Split Accuracy 87.61 #9 of 9 Archive leaderboard report
Zero Shot Skeletal Action Recognition NTU RGB+D 120 SA-DVAE Accuracy (10 unseen classes) 68.77 #4 of 9 Archive leaderboard report
Zero Shot Skeletal Action Recognition NTU RGB+D 120 SA-DVAE Accuracy (24 unseen classes) 46.12 #4 of 9 Archive leaderboard report
Zero Shot Skeletal Action Recognition NTU RGB+D 120 SA-DVAE Random Split Accuracy 50.67 #4 of 9 Archive leaderboard report
Zero Shot Skeletal Action Recognition NTU RGB+D 120 SA-DVAE + augmented text Random Split Accuracy 57.16 #9 of 9 Archive leaderboard report
Zero Shot Skeletal Action Recognition PKU-MMD SA-DVAE Random Split Accuracy 66.54 #4 of 7 Archive leaderboard report

Ranks are positions in the archive's leaderboards as they stood at the 2025-07-28 snapshot. Results published since then are not among these rows, so a rank here is not a current standing.

Methods

ALIGN

Report a problem or propose a change · a person checks every report against the paper or source before anything changes; decisions are listed on /corrections