{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/automated-audio-captioning-by-fine-tuning","title":"AUTOMATED AUDIO CAPTIONING BY FINE-TUNING BART WITH AUDIOSET TAGS","arxiv_id":null,"date":"2021-11-15","proceeding":"DCASE workshop 2021 11","authors":["F ́elix Gontier","Romain Serizel","Christophe Cerisara"],"abstract":"utomated audio captioning is the multimodal task of describing\r\nenvironmental audio recordings with fluent natural language. Most\r\ncurrent methods utilize pre-trained analysis models to extract rele-\r\nvant semantic content from the audio input. However, prior infor-\r\nmation on language modeling is rarely introduced, and correspond-\r\ning architectures are limited in capacity due to data scarcity. In\r\nthis paper, we present a method leveraging the linguistic informa-\r\ntion contained in BART, a large-scale conditional language model\r\nwith general purpose pre-training. The caption generation is condi-\r\ntioned on sequences of textual AudioSet tags. This input is enriched\r\nwith temporally aligned audio embeddings that allows the model to\r\nimprove the sound event recognition. The full BART architecture\r\nis fine-tuned with few additional parameters. Experimental results\r\ndemonstrate that, beyond the scaling properties of the architecture,\r\nlanguage-only pre-training improves the text quality in the multi-\r\nmodal setting of audio captioning. The best model achieves state-\r\nof-the-art performance on AudioCaps with 46.5 SPIDEr.","url_abs":"https://dcase.community/documents/workshop2021/proceedings/DCASE2021Workshop_Gontier_57.pdf","url_pdf":"https://dcase.community/documents/workshop2021/proceedings/DCASE2021Workshop_Gontier_57.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"automated-audio-captioning-by-fine-tuning","repo_url":"https://github.com/felixgontier/dcase2021aac","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"audio-captioning","task_name":"Audio captioning"},{"task_slug":null,"task_name":"AudioCaps"},{"task_slug":"caption-generation","task_name":"Caption Generation"},{"task_slug":"language-modeling","task_name":"Language Modeling"},{"task_slug":"language-modelling","task_name":"Language Modelling"},{"task_slug":"retrieval-augmented-few-shot-in-context-audio","task_name":"Retrieval-augmented Few-shot In-context Audio Captioning"}],"methods":[{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"bart","method_name":"BART"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/audio-captioning-on-audiocaps","task":"Audio captioning","dataset":"AudioCaps","model":"BART + YAMNet + PANNs","rank_in_archive_order":14,"of":18,"metrics":{"CIDEr":"0.753","SPICE":"0.176","SPIDEr":"0.465"},"uses_additional_data":false},{"leaderboard":"/sota/retrieval-augmented-few-shot-in-context-audio","task":"Retrieval-augmented Few-shot In-context Audio Captioning","dataset":"AudioCaps","model":"Automated audio captioning by fine-tuning bart with audioset tags","rank_in_archive_order":5,"of":5,"metrics":{"CIDEr":"0.147"},"uses_additional_data":false}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}