{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/xkd-cross-modal-knowledge-distillation-with","title":"XKD: Cross-modal Knowledge Distillation with Domain Alignment for Video Representation Learning","arxiv_id":"2211.13929","date":"2022-11-25","proceeding":null,"authors":["Pritam Sarkar","Ali Etemad"],"abstract":"We present XKD, a novel self-supervised framework to learn meaningful representations from unlabelled videos. XKD is trained with two pseudo objectives. First, masked data reconstruction is performed to learn modality-specific representations from audio and visual streams. Next, self-supervised cross-modal knowledge distillation is performed between the two modalities through a teacher-student setup to learn complementary information. We introduce a novel domain alignment strategy to tackle domain discrepancy between audio and visual modalities enabling effective cross-modal knowledge distillation. Additionally, to develop a general-purpose network capable of handling both audio and visual streams, modality-agnostic variants of XKD are introduced, which use the same pretrained backbone for different audio and visual tasks. Our proposed cross-modal knowledge distillation improves video action classification by $8\\%$ to $14\\%$ on UCF101, HMDB51, and Kinetics400. Additionally, XKD improves multimodal action classification by $5.5\\%$ on Kinetics-Sound. XKD shows state-of-the-art performance in sound classification on ESC50, achieving top-1 accuracy of $96.5\\%$.","url_abs":"https://arxiv.org/abs/2211.13929v5","url_pdf":"https://arxiv.org/pdf/2211.13929v5.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"xkd-cross-modal-knowledge-distillation-with","repo_url":"https://github.com/pritamqu/XKD","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"NOASSERTION"}}],"tasks":[{"task_slug":"action-classification","task_name":"Action Classification"},{"task_slug":"classification-1","task_name":"Classification"},{"task_slug":"knowledge-distillation","task_name":"Knowledge Distillation"},{"task_slug":"representation-learning","task_name":"Representation Learning"},{"task_slug":"self-supervised-action-recognition","task_name":"Self-Supervised Action Recognition"},{"task_slug":"self-supervised-action-recognition-linear","task_name":"Self-Supervised Action Recognition Linear"},{"task_slug":"sound-classification","task_name":"Sound Classification"},{"task_slug":"transfer-learning","task_name":"Transfer Learning"}],"methods":[{"method_slug":"knowledge-distillation","method_name":"Knowledge Distillation"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/self-supervised-action-recognition-on-hmdb51","task":"Self-Supervised Action Recognition","dataset":"HMDB51","model":"XKD (ViT-B/112/16)","rank_in_archive_order":8,"of":48,"metrics":{"Top-1 Accuracy":"69"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-hmdb51","task":"Self-Supervised Action Recognition","dataset":"HMDB51","model":"XKD-Modality-Agnostic (ViT-B/112/16)","rank_in_archive_order":14,"of":48,"metrics":{"Top-1 Accuracy":"65.9"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-1","task":"Self-Supervised Action Recognition","dataset":"Kinetics-400","model":"XKD (ViT-B/112/16)","rank_in_archive_order":1,"of":4,"metrics":{"Top-1 accuracy %":"77.6","Top-5 Accuracy %":"92.9"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101","task":"Self-Supervised Action Recognition","dataset":"UCF101","model":"XKD (ViT-B/112/16)","rank_in_archive_order":9,"of":53,"metrics":{"3-fold Accuracy":"94.1","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101","task":"Self-Supervised Action Recognition","dataset":"UCF101","model":"XKD-Modality-Agnostic (ViT-B/112/16)","rank_in_archive_order":14,"of":53,"metrics":{"3-fold Accuracy":"93.4"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2211.13929","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}