{"url":"/dataset/audiocaps","name":"AudioCaps","full_name":null,"description_markdown":"**AudioCaps** is a dataset of sounds with event descriptions that was introduced for the task of audio captioning, with sounds sourced from the [AudioSet](https://paperswithcode.com/dataset/audioset) dataset. Annotators were provided the audio tracks together with category hints (and with additional video hints if needed).\r\n\r\nSource: [Audio Retrieval with Natural Language Queries](/paper/audio-retrieval-with-natural-language-queries)\r\n\r\nImage source: [https://audiocaps.github.io/](https://audiocaps.github.io/)","description_withheld":null,"homepage":"https://audiocaps.github.io/","introduced_date":"2019-06-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/audiocaps-generating-captions-for-audios-in","title":"AudioCaps: Generating Captions for Audios in The Wild","first_author":"Chris Dongjoo Kim","url":null},"license":{"name":"Unknown","url":null},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"},{"name":"Audio","url":"/datasets/modality/audio"}],"tasks":[{"name":"Audio Generation","url":"/task/audio-generation","datasets_with_task":"/datasets/task/audio-generation"},{"name":"Audio captioning","url":"/task/audio-captioning","datasets_with_task":"/datasets/task/audio-captioning"},{"name":"Text to Audio Retrieval","url":"/task/text-to-audio-retrieval","datasets_with_task":"/datasets/task/text-to-audio-retrieval"},{"name":"Audio to Text Retrieval","url":"/task/audio-to-text-retrieval","datasets_with_task":"/datasets/task/audio-to-text-retrieval"},{"name":"Target Sound Extraction","url":"/task/target-sound-extraction","datasets_with_task":"/datasets/task/target-sound-extraction"},{"name":"Zero-shot Text to Audio Retrieval","url":"/task/zero-shot-text-to-audio-retrieval","datasets_with_task":"/datasets/task/zero-shot-text-to-audio-retrieval"},{"name":"Zero-shot Audio Captioning","url":"/task/zero-shot-audio-captioning","datasets_with_task":"/datasets/task/zero-shot-audio-captioning"},{"name":"Text to Audio/Video Retrieval","url":"/task/text-to-audio-video-retrieval","datasets_with_task":"/datasets/task/text-to-audio-video-retrieval"},{"name":"Audio/Video to Text Retrieval","url":"/task/audio-video-to-text-retrieval","datasets_with_task":"/datasets/task/audio-video-to-text-retrieval"},{"name":"Retrieval-augmented Few-shot In-context Audio Captioning","url":"/task/retrieval-augmented-few-shot-in-context-audio","datasets_with_task":"/datasets/task/retrieval-augmented-few-shot-in-context-audio"},{"name":"Zero-Shot Audio Retrieval","url":"/task/zero-shot-audio-retrieval","datasets_with_task":"/datasets/task/zero-shot-audio-retrieval"}],"languages":[],"variants":["AudioCaps"],"data_loaders":[{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/jp1924/AudioCaps","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/d0rj/audiocaps","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/labbeti/aac-datasets","url":"https://aac-datasets.readthedocs.io/en/stable/","frameworks":["pytorch"]}],"num_papers_in_archive":279,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/audio-generation-on-audiocaps","task":"Audio Generation","dataset_variant":"AudioCaps","rows":23,"metrics":["FD_openl3","FAD","FD","KL_passt","IS","CLAP_LAION","CLAP_MS"],"first_row_in_archive_order":{"model":"ETTA-FT-AC-100k","paper":"/paper/etta-elucidating-the-design-space-of-text-to","metrics":{"CLAP_LAION":"0.60","CLAP_MS":"0.43","FAD":"2.03","FD":"10.10","FD_openl3":"61.79","IS":"14.29","KL_passt":"1.13"},"code_links":[{"title":"NVIDIA/elucidated-text-to-audio","url":"https://github.com/NVIDIA/elucidated-text-to-audio"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/audio-captioning-on-audiocaps","task":"Audio captioning","dataset_variant":"AudioCaps","rows":18,"metrics":["SPIDEr","CIDEr","SPICE","BLEU-4","METEOR","ROUGE-L","FENSE","SPIDEr-FL","#params (M)","ROUGE","Sentence-BERT"],"first_row_in_archive_order":{"model":"MQ-Cap","paper":"/paper/audio-captioning-via-generative-pair-to-pair","metrics":{"BLEU-4":"0.301","CIDEr":"0.845","METEOR":"0.266","SPICE":"0.194","SPIDEr":"0.519"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/text-to-audio-retrieval-on-audiocaps","task":"Text to Audio Retrieval","dataset_variant":"AudioCaps","rows":11,"metrics":["R@1","R@5","R@10"],"first_row_in_archive_order":{"model":"InternVideo2-6B","paper":"/paper/internvideo2-scaling-video-foundation-models","metrics":{"R@1":"55.2"},"code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/retrieval-augmented-few-shot-in-context-audio","task":"Retrieval-augmented Few-shot In-context Audio Captioning","dataset_variant":"AudioCaps","rows":5,"metrics":["CIDEr"],"first_row_in_archive_order":{"model":"Audio Flamingo (4-shot)","paper":"/paper/audio-flamingo-a-novel-audio-language-model","metrics":{"CIDEr":"0.518"},"code_links":[{"title":"NVIDIA/audio-flamingo","url":"https://github.com/NVIDIA/audio-flamingo"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/zero-shot-audio-captioning-on-audiocaps","task":"Zero-shot Audio Captioning","dataset_variant":"AudioCaps","rows":4,"metrics":["METEOR","BLEU-4","CIDEr","ROUGE-L","SPICE","SPIDEr"],"first_row_in_archive_order":{"model":"Audio Flamingo","paper":"/paper/audio-flamingo-a-novel-audio-language-model","metrics":{"BLEU-4":"14.3","CIDEr":"50.2","METEOR":"20.5","ROUGE-L":"40.8","SPICE":"15.1","SPIDEr":"32.6"},"code_links":[{"title":"NVIDIA/audio-flamingo","url":"https://github.com/NVIDIA/audio-flamingo"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/target-sound-extraction-on-audiocaps","task":"Target Sound Extraction","dataset_variant":"AudioCaps","rows":1,"metrics":["SDRi","SI-SDRi"],"first_row_in_archive_order":{"model":"CLAPSep","paper":"/paper/clapsep-leveraging-contrastive-pre-trained","metrics":{"SDRi":"10.08","SI-SDRi":"9.40"},"code_links":[{"title":"aisaka0v0/clapsep","url":"https://github.com/aisaka0v0/clapsep"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/lavcap-llm-based-audio-visual-captioning","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","date":"2025-01-16","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/tangoflux-super-fast-and-faithful-text-to","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","date":"2024-12-30","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/etta-elucidating-the-design-space-of-text-to","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","date":"2024-12-26","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/audio-captioning-via-generative-pair-to-pair","title":"Enhancing Retrieval-Augmented Audio Captioning with Generation-Assisted Multimodal Querying and Progressive Learning","date":"2024-10-14","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/slam-aac-enhancing-audio-captioning-with","title":"SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs","date":"2024-10-12","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/enclap-analyzing-the-enclap-framework-for","title":"EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance","date":"2024-09-02","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/stable-audio-open","title":"Stable Audio Open","date":"2024-07-19","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":1,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/taming-data-and-transformers-for-audio-1","title":"Taming Data and Transformers for Audio Generation","date":"2024-06-27","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/enhancing-automated-audio-captioning-via","title":"Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding","date":"2024-06-19","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":5,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/2406-15487","title":"Improving Text-To-Audio Models with Synthetic Captions","date":"2024-06-18","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":3,"samples_unverified":1,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/long-form-music-generation-with-latent","title":"Long-form music generation with latent diffusion","date":"2024-04-16","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/internvideo2-scaling-video-foundation-models","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","date":"2024-03-22","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/clapsep-leveraging-contrastive-pre-trained","title":"CLAPSep: Leveraging Contrastive Pre-trained Model for Multi-Modal Query-Conditioned Target Sound Extraction","date":"2024-02-27","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":4,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/fast-timing-conditioned-latent-audio","title":"Fast Timing-Conditioned Latent Audio Diffusion","date":"2024-02-07","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":2,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/audio-flamingo-a-novel-audio-language-model","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","date":"2024-02-02","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/enclap-combining-neural-audio-codec-and-audio","title":"EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning","date":"2024-01-31","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/auffusion-leveraging-the-power-of-diffusion","title":"Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation","date":"2024-01-02","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/audiobox-unified-audio-generation-with","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","date":"2023-12-25","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/zero-shot-audio-captioning-with-audio","title":"Zero-shot audio captioning with audio-language model guidance and audio context keywords","date":"2023-11-14","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":17,"samples_ran":13,"samples_unverified":4,"pointer_only_for_licence":17,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/accelerating-diffusion-based-text-to-audio","title":"ConsistencyTTA: Accelerating Diffusion-Based Text-to-Audio Generation with Consistency Distillation","date":"2023-09-19","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":4,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/recap-retrieval-augmented-audio-captioning","title":"RECAP: Retrieval-Augmented Audio Captioning","date":"2023-09-18","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":5,"samples_unverified":3,"pointer_only_for_licence":8,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/retrieval-augmented-text-to-audio-generation","title":"Retrieval-Augmented Text-to-Audio Generation","date":"2023-09-14","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/zero-shot-audio-captioning-via-audibility","title":"Zero-Shot Audio Captioning via Audibility Guidance","date":"2023-09-07","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/rethinking-transfer-and-auxiliary-learning","title":"Rethinking Transfer and Auxiliary Learning for Improving Audio Captioning Transformer","date":"2023-08-20","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/audioldm-2-learning-holistic-audio-generation","title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining","date":"2023-08-10","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":27,"samples_ran":12,"samples_unverified":15,"pointer_only_for_licence":13,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/vast-a-vision-audio-subtitle-text-omni-1","title":"VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset","date":"2023-05-29","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":42,"samples_ran":15,"samples_unverified":27,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/make-an-audio-2-temporal-enhanced-text-to","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","date":"2023-05-29","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":8,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/any-to-any-generation-via-composable","title":"Any-to-Any Generation via Composable Diffusion","date":"2023-05-19","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":2,"samples_unverified":11,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/one-peace-exploring-one-general","title":"ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities","date":"2023-05-18","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":2,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/text-to-audio-generation-using-instruction","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","date":"2023-04-24","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/valor-vision-audio-language-omni-perception","title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","date":"2023-04-17","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/prefix-tuning-for-automated-audio-captioning","title":"Prefix tuning for automated audio captioning","date":"2023-03-30","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/make-an-audio-text-to-audio-generation-with","title":"Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models","date":"2023-01-30","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/audioldm-text-to-audio-generation-with-latent","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","date":"2023-01-29","rows_on_this_dataset":1,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":21,"samples_ran":8,"samples_unverified":13,"pointer_only_for_licence":10,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/improving-audio-language-learning-with-mixgen","title":"Exploring Train and Test-Time Augmentations for Audio-Language Learning","date":"2022-10-31","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/audiogen-textually-guided-audio-generation","title":"AudioGen: Textually Guided Audio Generation","date":"2022-09-30","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/diffsound-discrete-diffusion-model-for-text","title":"Diffsound: Discrete Diffusion Model for Text-to-sound Generation","date":"2022-07-20","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/cross-modal-retrieval-with-querybank","title":"Cross Modal Retrieval with Querybank Normalisation","date":"2021-12-23","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":2,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/audio-retrieval-with-natural-language-queries-1","title":"Audio Retrieval with Natural Language Queries: A Benchmark Study","date":"2021-12-17","rows_on_this_dataset":3,"code_links":1,"syntology":null},{"paper":"/paper/automated-audio-captioning-by-fine-tuning","title":"AUTOMATED AUDIO CAPTIONING BY FINE-TUNING BART WITH AUDIOSET TAGS","date":"2021-11-15","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/audio-captioning-transformer","title":"Audio Captioning Transformer","date":"2021-07-21","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/audio-retrieval-with-natural-language-queries","title":"Audio Retrieval with Natural Language Queries","date":"2021-05-05","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":0,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/audiocaps-generating-captions-for-audios-in","title":"AudioCaps: Generating Captions for Audios in The Wild","date":"2019-06-01","rows_on_this_dataset":1,"code_links":0,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":19,"samples_harvested":187,"samples_ran":93,"samples_unverified":94,"pointer_only_for_licence":57,"papers_with_no_sample_that_ran":1,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}