{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/mt-slvr-multi-task-self-supervised-learning","title":"MT-SLVR: Multi-Task Self-Supervised Learning for Transformation In(Variant) Representations","arxiv_id":"2305.17191","date":"2023-05-29","proceeding":null,"authors":["Calum Heggan","Tim Hospedales","Sam Budgett","Mehrdad Yaghoobi"],"abstract":"Contrastive self-supervised learning has gained attention for its ability to create high-quality representations from large unlabelled data sets. A key reason that these powerful features enable data-efficient learning of downstream tasks is that they provide augmentation invariance, which is often a useful inductive bias. However, the amount and type of invariances preferred is not known apriori, and varies across different downstream tasks. We therefore propose a multi-task self-supervised framework (MT-SLVR) that learns both variant and invariant features in a parameter-efficient manner. Our multi-task representation provides a strong and flexible feature that benefits diverse downstream tasks. We evaluate our approach on few-shot classification tasks drawn from a variety of audio domains and demonstrate improved classification performance on all of them","url_abs":"https://arxiv.org/abs/2305.17191v2","url_pdf":"https://arxiv.org/pdf/2305.17191v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"mt-slvr-multi-task-self-supervised-learning","repo_url":"https://github.com/cheggan/mt-slvr","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"few-shot-audio-classification","task_name":"Few-Shot Audio Classification"},{"task_slug":"inductive-bias","task_name":"Inductive Bias"},{"task_slug":"self-supervised-learning","task_name":"Self-Supervised Learning"},{"task_slug":"unsupervised-few-shot-audio-classification","task_name":"Unsupervised Few-Shot Audio Classification"}],"methods":[{"method_slug":"1x1-convolution","method_name":"1x1 Convolution"},{"method_slug":"average-pooling","method_name":"Average Pooling"},{"method_slug":"batch-normalization","method_name":"Batch Normalization"},{"method_slug":"bottleneck-residual-block","method_name":"Bottleneck Residual Block"},{"method_slug":"colorjitter","method_name":"ColorJitter"},{"method_slug":"convolution","method_name":"Convolution"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"feedforward-network","method_name":"Feedforward Network"},{"method_slug":"global-average-pooling","method_name":"Global Average Pooling"},{"method_slug":"kaiming-initialization","method_name":"Kaiming Initialization"},{"method_slug":"max-pooling","method_name":"Max Pooling"},{"method_slug":"nt-xent","method_name":"NT-Xent"},{"method_slug":"random-gaussian-blur","method_name":"Random Gaussian Blur"},{"method_slug":"random-resized-crop","method_name":"Random Resized Crop"},{"method_slug":"relu","method_name":"ReLU"},{"method_slug":"residual-block","method_name":"Residual Block"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"simclr","method_name":"SimCLR"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/few-shot-audio-classification-on-birdclef","task":"Few-Shot Audio Classification","dataset":"BirdClef 2020  (Pruned)","model":"SimCLR (FSD50K, RN18)","rank_in_archive_order":8,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"30.93±0.38"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-birdclef","task":"Few-Shot Audio Classification","dataset":"BirdClef 2020  (Pruned)","model":"MT-SLVR (SimCLR + MLAP) w/ Parallel Adapters (FSD50K, RN18)","rank_in_archive_order":9,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"29.49±0.38"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-birdclef","task":"Few-Shot Audio Classification","dataset":"BirdClef 2020  (Pruned)","model":"Multi-Label Augmentation Prediction (FSD50K, RN18)","rank_in_archive_order":10,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"21.04±0.35 "},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-crema-d","task":"Few-Shot Audio Classification","dataset":"CREMA-D","model":"MT-SLVR (SimCLR + MLAP) w/ Parallel Adapters (FSD50K, RN18)","rank_in_archive_order":1,"of":3,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"29.61±0.38"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-crema-d","task":"Few-Shot Audio Classification","dataset":"CREMA-D","model":"SimCLR (FSD50K, RN18)","rank_in_archive_order":2,"of":3,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"29.10±0.36"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-crema-d","task":"Few-Shot Audio Classification","dataset":"CREMA-D","model":"Multi-Label Augmentation Prediction (FSD50K, RN18)","rank_in_archive_order":3,"of":3,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"21.68±0.33"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-common-voice","task":"Few-Shot Audio Classification","dataset":"Common Voice","model":"MT-SLVR (SimCLR + MLAP) w/ Parallel Adapters (FSD50K, RN18)","rank_in_archive_order":1,"of":3,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"35.22±0.40"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-common-voice","task":"Few-Shot Audio Classification","dataset":"Common Voice","model":"SimCLR (FSD50K, RN18)","rank_in_archive_order":2,"of":3,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"33.33±0.38"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-common-voice","task":"Few-Shot Audio Classification","dataset":"Common Voice","model":"Multi-Label Augmentation Prediction (FSD50K, RN18)","rank_in_archive_order":3,"of":3,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"23.00±0.42"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-esc-50","task":"Few-Shot Audio Classification","dataset":"ESC-50","model":"MT-SLVR (SimCLR + MLAP) w/ Parallel Adapters (FSD50K, RN18)","rank_in_archive_order":4,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"69.53±0.39"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-esc-50","task":"Few-Shot Audio Classification","dataset":"ESC-50","model":"SimCLR (FSD50K, RN18)","rank_in_archive_order":8,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"63.40±0.39"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-esc-50","task":"Few-Shot Audio Classification","dataset":"ESC-50","model":"Multi-Label Augmentation Prediction (FSD50K, RN18)","rank_in_archive_order":10,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"37.76±0.34"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on","task":"Few-Shot Audio Classification","dataset":"FSDKaggle2018","model":"MT-SLVR (SimCLR + MLAP) w/ Parallel Adapters (FSD50K, RN18)","rank_in_archive_order":6,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"39.11±0.41"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on","task":"Few-Shot Audio Classification","dataset":"FSDKaggle2018","model":"SimCLR (FSD50K, RN18)","rank_in_archive_order":8,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"37.64±0.40"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on","task":"Few-Shot Audio Classification","dataset":"FSDKaggle2018","model":"Multi-Label Augmentation Prediction (FSD50K, RN18)","rank_in_archive_order":10,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"21.72±0.34"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-nsynth","task":"Few-Shot Audio Classification","dataset":"NSynth","model":"MT-SLVR (SimCLR + MLAP) w/ Parallel Adapters (FSD50K, RN18)","rank_in_archive_order":6,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"71.81±0.39"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-nsynth","task":"Few-Shot Audio Classification","dataset":"NSynth","model":"SimCLR (FSD50K, RN18)","rank_in_archive_order":8,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"66.44±0.40"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-nsynth","task":"Few-Shot Audio Classification","dataset":"NSynth","model":"Multi-Label Augmentation Prediction (FSD50K, RN18)","rank_in_archive_order":10,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"62.52±0.36"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-speech-1","task":"Few-Shot Audio Classification","dataset":"Speech Accent Archive","model":"MT-SLVR (SimCLR + MLAP) w/ Parallel Adapters (FSD50K, RN18)","rank_in_archive_order":1,"of":3,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"28.92±0.37"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-speech-1","task":"Few-Shot Audio Classification","dataset":"Speech Accent Archive","model":"SimCLR (FSD50K, RN18)","rank_in_archive_order":2,"of":3,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"26.16±0.34"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-speech-1","task":"Few-Shot Audio Classification","dataset":"Speech Accent Archive","model":"Multi-Label Augmentation Prediction (FSD50K, RN18)","rank_in_archive_order":3,"of":3,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"23.08±0.34"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-speech","task":"Few-Shot Audio Classification","dataset":"Speech Command v2","model":"SimCLR (FSD50K, RN18)","rank_in_archive_order":1,"of":3,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"25.68±0.35"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-speech","task":"Few-Shot Audio Classification","dataset":"Speech Command v2","model":"MT-SLVR (SimCLR + MLAP) w/ Parallel Adapters (FSD50K, RN18)","rank_in_archive_order":2,"of":3,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"23.65±0.34"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-speech","task":"Few-Shot Audio Classification","dataset":"Speech Command v2","model":"Multi-Label Augmentation Prediction (FSD50K, RN18)","rank_in_archive_order":3,"of":3,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"20.08±0.37"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-voxceleb1","task":"Few-Shot Audio Classification","dataset":"VoxCeleb1","model":"MT-SLVR (SimCLR + MLAP) w/ Parallel Adapters (FSD50K, RN18)","rank_in_archive_order":6,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"33.58±0.39"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-voxceleb1","task":"Few-Shot Audio Classification","dataset":"VoxCeleb1","model":"SimCLR (FSD50K, RN18)","rank_in_archive_order":7,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"31.18±0.37"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-voxceleb1","task":"Few-Shot Audio Classification","dataset":"VoxCeleb1","model":"Multi-Label Augmentation Prediction (FSD50K, RN18)","rank_in_archive_order":10,"of":10,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"21.68±0.40"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-watkins","task":"Few-Shot Audio Classification","dataset":"Watkins Marine Mammal Sounds","model":"MT-SLVR (SimCLR + MLAP) w/ Parallel Adapters (FSD50K, RN18)","rank_in_archive_order":1,"of":5,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"59.49±0.42"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-watkins","task":"Few-Shot Audio Classification","dataset":"Watkins Marine Mammal Sounds","model":"SimCLR (FSD50K, RN18)","rank_in_archive_order":3,"of":5,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"52.91±0.41"},"uses_additional_data":true},{"leaderboard":"/sota/few-shot-audio-classification-on-watkins","task":"Few-Shot Audio Classification","dataset":"Watkins Marine Mammal Sounds","model":"Multi-Label Augmentation Prediction (FSD50K, RN18)","rank_in_archive_order":5,"of":5,"metrics":{"Top-1 Accuracy(5-Way-1-Shot)":"28.88±0.39"},"uses_additional_data":true}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}