{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/masked-latent-prediction-and-classification","title":"Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning","arxiv_id":"2502.12031","date":"2025-02-17","proceeding":"ICASSP 2025 3","authors":["Aurian Quelennec","Pierre Chouteau","Geoffroy Peeters","Slim Essid"],"abstract":"Recently, self-supervised learning methods based on masked latent prediction have proven to encode input data into powerful representations. However, during training, the learned latent space can be further transformed to extract higher-level information that could be more suited for downstream classification tasks. Therefore, we propose a new method: MAsked latenT Prediction And Classification (MATPAC), which is trained with two pretext tasks solved jointly. As in previous work, the first pretext task is a masked latent prediction task, ensuring a robust input representation in the latent space. The second one is unsupervised classification, which utilises the latent representations of the first pretext task to match probability distributions between a teacher and a student. We validate the MATPAC method by comparing it to other state-of-the-art proposals and conducting ablations studies. MATPAC reaches state-of-the-art self-supervised learning results on reference audio classification datasets such as OpenMIC, GTZAN, ESC-50 and US8K and outperforms comparable supervised methods results for musical auto-tagging on Magna-tag-a-tune.","url_abs":"https://arxiv.org/abs/2502.12031v1","url_pdf":"https://arxiv.org/pdf/2502.12031v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"masked-latent-prediction-and-classification","repo_url":"https://github.com/aurianworld/matpac","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"audio-classification","task_name":"Audio Classification"},{"task_slug":"audio-tagging","task_name":"Audio Tagging"},{"task_slug":"classification-1","task_name":"Classification"},{"task_slug":"environmental-sound-classification","task_name":"Environmental Sound Classification"},{"task_slug":"instrument-recognition","task_name":"Instrument Recognition"},{"task_slug":"music-auto-tagging","task_name":"Music Auto-Tagging"},{"task_slug":"music-genre-classification","task_name":"Music Genre Classification"},{"task_slug":"music-tagging","task_name":"Music Tagging"},{"task_slug":"prediction","task_name":"Prediction"},{"task_slug":"representation-learning","task_name":"Representation Learning"},{"task_slug":"self-supervised-audio-classification","task_name":"Self-Supervised Audio Classification"},{"task_slug":"self-supervised-learning","task_name":"Self-Supervised Learning"},{"task_slug":"tag","task_name":"TAG"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/audio-classification-on-esc-50","task":"Audio Classification","dataset":"ESC-50","model":"MATPAC (SSL model, linear eval)","rank_in_archive_order":18,"of":29,"metrics":{"Accuracy (5-fold)":"93.5","PRE-TRAINING DATASET":"AudioSet","Top-1 Accuracy":"93.5"},"uses_additional_data":false},{"leaderboard":"/sota/audio-classification-on-fsd50k","task":"Audio Classification","dataset":"FSD50K","model":"MATPAC (SSL Model)","rank_in_archive_order":7,"of":10,"metrics":{"mAP":"55.2"},"uses_additional_data":false},{"leaderboard":"/sota/environmental-sound-classification-on","task":"Environmental Sound Classification","dataset":"UrbanSound8K","model":"MATPAC (SSL, linear eval)","rank_in_archive_order":2,"of":3,"metrics":{"Accuracy":"89.4"},"uses_additional_data":false},{"leaderboard":"/sota/instrument-recognition-on-nsynth","task":"Instrument Recognition","dataset":"NSynth","model":"MATPAC (SSL, linear eval)","rank_in_archive_order":4,"of":7,"metrics":{"Accuracy":"74.6"},"uses_additional_data":false},{"leaderboard":"/sota/instrument-recognition-on-openmic-2018","task":"Instrument Recognition","dataset":"OpenMIC-2018","model":"MATPAC (SSL Model, linear eval)","rank_in_archive_order":2,"of":5,"metrics":{"mean average precision":"0.854"},"uses_additional_data":false},{"leaderboard":"/sota/music-auto-tagging-on-magnatagatune","task":"Music Auto-Tagging","dataset":"MagnaTagATune","model":"MATPAC (SSL, linear eval)","rank_in_archive_order":2,"of":3,"metrics":{"PR-AUC":"41.1","ROC AUC":"91.6"},"uses_additional_data":false}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}