Papers › Self-Supervised Audio-Visual Representation Learning with Relaxed Cross-Modal Synchronicity

Self-Supervised Audio-Visual Representation Learning with Relaxed Cross-Modal Synchronicity

9 Nov 2021arXiv:2111.05329archive 2025-07-28

Pritam Sarkar, Ali Etemad

We present CrissCross, a self-supervised framework for learning audio-visual representations. A novel notion is introduced in our framework whereby in addition to learning the intra-modal and standard 'synchronous' cross-modal relations, CrissCross also learns 'asynchronous' cross-modal relationships. We perform in-depth studies showing that by relaxing the temporal synchronicity between the audio and visual modalities, the network learns strong generalized representations useful for a variety of downstream tasks. To pretrain our proposed solution, we use 3 different datasets with varying sizes, Kinetics-Sound, Kinetics400, and AudioSet. The learned representations are evaluated on a number of downstream tasks namely action recognition, sound classification, and action retrieval. Our experiments show that CrissCross either outperforms or achieves performances on par with the current state-of-the-art self-supervised methods on action recognition and action retrieval with UCF101 and HMDB51, as well as sound classification with ESC50 and DCASE. Moreover, CrissCross outperforms fully-supervised pretraining while pretrained on Kinetics-Sound. The codes and pretrained models are available on the project website.

PaperPDFCode

In Syntology Open this paper in Syntology's Atlas, the map of the papers in Syntology's graph and their citations.

Code

pritamqu/CrissCross officialmentioned on GitHubpytorchNOASSERTION report

Repository list and official/mentioned flags are the archive's, frozen 2025-07-28. Reachability, where shown, is from one Syntology probe window (2026-09-16 to 2026-09-18); repositories not probed show nothing. GitHub stars are not tracked.

Code Syntology ran Syntology

Not run by Syntology. Nothing on this page verifies that the listed code works.

Tasks

Audio ClassificationRetrievalSelf-Supervised Action RecognitionSelf-Supervised Audio ClassificationSelf-Supervised LearningSelf-Supervised Sound ClassificationSelf-supervised Video RetrievalSound Classification

Results from the paper archive 2025-07-28

TaskDatasetModelMetricValueRank at snapshotLeaderboardReport
Audio Classification DCASE CrissCross (AudioSet) PRE-TRAINING DATASET AudioSet #1 of 5 Archive leaderboard report
Audio Classification DCASE CrissCross (AudioSet) Top-1 Accuracy 97 #1 of 5 Archive leaderboard report
Audio Classification DCASE CrissCross (Kinetics-400) PRE-TRAINING DATASET Kinetics-400 #2 of 5 Archive leaderboard report
Audio Classification DCASE CrissCross (Kinetics-400) Top-1 Accuracy 96 #2 of 5 Archive leaderboard report
Audio Classification DCASE CrissCross (Kinetics-Sound) PRE-TRAINING DATASET Kinetics-Sound #5 of 5 Archive leaderboard report
Audio Classification DCASE CrissCross (Kinetics-Sound) Top-1 Accuracy 93 #5 of 5 Archive leaderboard report
Self-Supervised Action Recognition HMDB51 CrissCross (AudioSet) Frozen false #11 of 48 Archive leaderboard report
Self-Supervised Action Recognition HMDB51 CrissCross (AudioSet) Pre-Training Dataset AudioSet #11 of 48 Archive leaderboard report
Self-Supervised Action Recognition HMDB51 CrissCross (AudioSet) Top-1 Accuracy 66.8 #11 of 48 Archive leaderboard report
Self-Supervised Action Recognition HMDB51 CrissCross (Kinetics400) Frozen false #18 of 48 Archive leaderboard report
Self-Supervised Action Recognition HMDB51 CrissCross (Kinetics400) Pre-Training Dataset Kinetics400 #18 of 48 Archive leaderboard report
Self-Supervised Action Recognition HMDB51 CrissCross (Kinetics400) Top-1 Accuracy 64.7 #18 of 48 Archive leaderboard report
Self-Supervised Action Recognition HMDB51 CrissCross (Kinetics-Sound) Frozen false #26 of 48 Archive leaderboard report
Self-Supervised Action Recognition HMDB51 CrissCross (Kinetics-Sound) Pre-Training Dataset Kinetics-Sound #26 of 48 Archive leaderboard report
Self-Supervised Action Recognition HMDB51 CrissCross (Kinetics-Sound) Top-1 Accuracy 60.5 #26 of 48 Archive leaderboard report
Self-Supervised Action Recognition UCF101 CrissCross (AudioSet) 3-fold Accuracy 92.4 #16 of 53 Archive leaderboard report
Self-Supervised Action Recognition UCF101 CrissCross (AudioSet) Frozen false #16 of 53 Archive leaderboard report
Self-Supervised Action Recognition UCF101 CrissCross (AudioSet) Pre-Training Dataset AudioSet #16 of 53 Archive leaderboard report
Self-Supervised Action Recognition UCF101 CrissCross (Kinetics400) 3-fold Accuracy 91.5 #19 of 53 Archive leaderboard report
Self-Supervised Action Recognition UCF101 CrissCross (Kinetics400) Frozen false #19 of 53 Archive leaderboard report
Self-Supervised Action Recognition UCF101 CrissCross (Kinetics400) Pre-Training Dataset Kinetics400 #19 of 53 Archive leaderboard report
Self-Supervised Action Recognition UCF101 CrissCross (Kinetics-Sound) 3-fold Accuracy 88.3 #25 of 53 Archive leaderboard report
Self-Supervised Action Recognition UCF101 CrissCross (Kinetics-Sound) Frozen false #25 of 53 Archive leaderboard report
Self-Supervised Action Recognition UCF101 CrissCross (Kinetics-Sound) Pre-Training Dataset Kinetics-Sound #25 of 53 Archive leaderboard report

Ranks are positions in the archive's leaderboards as they stood at the 2025-07-28 snapshot. Results published since then are not among these rows, so a rank here is not a current standing.

Report a problem or propose a change · a person checks every report against the paper or source before anything changes; decisions are listed on /corrections