{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/attention-bottlenecks-for-multimodal-fusion","title":"Attention Bottlenecks for Multimodal Fusion","arxiv_id":"2107.00135","date":"2021-06-30","proceeding":"NeurIPS 2021 12","authors":["Arsha Nagrani","Shan Yang","Anurag Arnab","Aren Jansen","Cordelia Schmid","Chen Sun"],"abstract":"Humans perceive the world by concurrently processing and fusing high-dimensional inputs from multiple modalities such as vision and audio. Machine perception models, in stark contrast, are typically modality-specific and optimised for unimodal benchmarks, and hence late-stage fusion of final representations or predictions from each modality (`late-fusion') is still a dominant paradigm for multimodal video classification. Instead, we introduce a novel transformer based architecture that uses `fusion bottlenecks' for modality fusion at multiple layers. Compared to traditional pairwise self-attention, our model forces information between different modalities to pass through a small number of bottleneck latents, requiring the model to collate and condense the most relevant information in each modality and only share what is necessary. We find that such a strategy improves fusion performance, at the same time reducing computational cost. We conduct thorough ablation studies, and achieve state-of-the-art results on multiple audio-visual classification benchmarks including Audioset, Epic-Kitchens and VGGSound. All code and models will be released.","url_abs":"https://arxiv.org/abs/2107.00135v3","url_pdf":"https://arxiv.org/pdf/2107.00135v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"attention-bottlenecks-for-multimodal-fusion","repo_url":"https://github.com/google-research/scenic/tree/main/scenic/projects/mbt","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"jax","reach":null}],"tasks":[{"task_slug":"action-classification","task_name":"Action Classification"},{"task_slug":"action-recognition-in-videos","task_name":"Action Recognition"},{"task_slug":"audio-classification","task_name":"Audio Classification"},{"task_slug":"video-classification","task_name":"Video Classification"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/action-classification-on-kinetics-400","task":"Action Classification","dataset":"Kinetics-400","model":"MBT (AV)","rank_in_archive_order":92,"of":207,"metrics":{"Acc@1":"80.8","Acc@5":"94.6"},"uses_additional_data":false},{"leaderboard":"/sota/action-classification-on-kinetics-sounds","task":"Action Classification","dataset":"Kinetics-Sounds","model":"MBT (AV)","rank_in_archive_order":4,"of":4,"metrics":{"Top 1 Accuracy":"85","Top 5 Accuracy":"96.8"},"uses_additional_data":false},{"leaderboard":"/sota/action-classification-on-moments-in-time","task":"Action Classification","dataset":"MiT","model":"MBT (AV)","rank_in_archive_order":13,"of":29,"metrics":{"Top 1 Accuracy":"37.3","Top 5 Accuracy":"61.2"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-on-epic-kitchens-100","task":"Action Recognition","dataset":"EPIC-KITCHENS-100","model":"MBT","rank_in_archive_order":24,"of":32,"metrics":{"Action@1":"43.4","Noun@1":"58","Verb@1":"64.8"},"uses_additional_data":false},{"leaderboard":"/sota/audio-classification-on-audioset","task":"Audio Classification","dataset":"AudioSet","model":"MBT (AS-500K training + Video)","rank_in_archive_order":12,"of":51,"metrics":{"Test mAP":"0.496"},"uses_additional_data":true},{"leaderboard":"/sota/audio-classification-on-vggsound","task":"Audio Classification","dataset":"VGGSound","model":"MBT (A)","rank_in_archive_order":20,"of":23,"metrics":{"Top 1 Accuracy":"52.3","Top 5 Accuracy":"78.1"},"uses_additional_data":false},{"leaderboard":"/sota/audio-classification-on-vggsound","task":"Audio Classification","dataset":"VGGSound","model":"MBT (V)","rank_in_archive_order":21,"of":23,"metrics":{"Top 1 Accuracy":"51.2","Top 5 Accuracy":"72.6"},"uses_additional_data":false},{"leaderboard":"/sota/audio-classification-on-vggsound","task":"Audio Classification","dataset":"VGGSound","model":"MBT (AV)","rank_in_archive_order":23,"of":23,"metrics":{"Top 5 Accuracy":"85.6"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":"https://app.syntology.ai/?focus=2107.00135","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}