{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/cooperative-learning-of-audio-and-video","title":"Cooperative Learning of Audio and Video Models from Self-Supervised Synchronization","arxiv_id":"1807.00230","date":"2018-06-30","proceeding":"NeurIPS 2018 12","authors":["Bruno Korbar","Du Tran","Lorenzo Torresani"],"abstract":"There is a natural correlation between the visual and auditive elements of a\nvideo. In this work we leverage this connection to learn general and effective\nmodels for both audio and video analysis from self-supervised temporal\nsynchronization. We demonstrate that a calibrated curriculum learning scheme, a\ncareful choice of negative examples, and the use of a contrastive loss are\ncritical ingredients to obtain powerful multi-sensory representations from\nmodels optimized to discern temporal synchronization of audio-video pairs.\nWithout further finetuning, the resulting audio features achieve performance\nsuperior or comparable to the state-of-the-art on established audio\nclassification benchmarks (DCASE2014 and ESC-50). At the same time, our visual\nsubnet provides a very effective initialization to improve the accuracy of\nvideo-based action recognition models: compared to learning from scratch, our\nself-supervised pretraining yields a remarkable gain of +19.9% in action\nrecognition accuracy on UCF101 and a boost of +17.7% on HMDB51.","url_abs":"http://arxiv.org/abs/1807.00230v2","url_pdf":"http://arxiv.org/pdf/1807.00230v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"action-recognition-in-videos","task_name":"Action Recognition"},{"task_slug":"audio-classification","task_name":"Audio Classification"},{"task_slug":"self-supervised-action-recognition","task_name":"Self-Supervised Action Recognition"},{"task_slug":"self-supervised-audio-classification","task_name":"Self-Supervised Audio Classification"},{"task_slug":"action-recognition","task_name":"Temporal Action Localization"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/audio-classification-on-esc-50","task":"Audio Classification","dataset":"ESC-50","model":"AVTS","rank_in_archive_order":28,"of":29,"metrics":{"Top-1 Accuracy":"82.3"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-hmdb51-1","task":"Self-Supervised Action Recognition","dataset":"HMDB51 (finetuned)","model":"AVTS","rank_in_archive_order":10,"of":14,"metrics":{"Top-1 Accuracy":"61.6"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101-1","task":"Self-Supervised Action Recognition","dataset":"UCF101 (finetuned)","model":"AVTS","rank_in_archive_order":10,"of":14,"metrics":{"3-fold Accuracy":"89.0"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1807.00230","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}