{"url":"/dataset/musiccaps","name":"MusicCaps","full_name":null,"description_markdown":"**MusicCaps** is a dataset composed of 5.5k music-text pairs, with rich text descriptions provided by human experts. For each 10-second music clip, MusicCaps provides: \r\n\r\n1) A free-text caption consisting of four sentences on average, describing the music and \r\n\r\n2) A list of music aspects, describing genre, mood, tempo, singer voices, instrumentation, dissonances, rhythm, etc.\r\n\r\nSource:[MusicLM: Generating Music From Text](https://arxiv.org/pdf/2301.11325v1.pdf)","description_withheld":null,"homepage":"https://google-research.github.io/seanet/musiclm/examples/","introduced_date":"2023-01-26","introduced_date_note":null,"introduced_by":{"paper":"/paper/musiclm-generating-music-from-text","title":"MusicLM: Generating Music From Text","first_author":"Andrea Agostinelli","url":null},"license":{"name":"CC BY-SA 4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"},{"name":"Music","url":"/datasets/modality/music"}],"tasks":[{"name":"Text-to-Music Generation","url":"/task/text-to-music-generation","datasets_with_task":"/datasets/task/text-to-music-generation"},{"name":"Music Generation","url":"/task/music-generation","datasets_with_task":"/datasets/task/music-generation"},{"name":"Music Captioning","url":"/task/music-captioning","datasets_with_task":"/datasets/task/music-captioning"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"Vietnamese","url":"/datasets/language/vietnamese"}],"variants":["MusicCaps"],"data_loaders":[{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/d0rj/MusicCaps-ru","frameworks":["tf","pytorch","jax"]}],"num_papers_in_archive":84,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/text-to-music-generation-on-musiccaps","task":"Text-to-Music Generation","dataset_variant":"MusicCaps","rows":21,"metrics":["FAD","FD_openl3","FD","KL_passt","IS","CLAP_LAION","CLAP_MS"],"first_row_in_archive_order":{"model":"MeLFusion (image-conditioned)","paper":"/paper/melfusion-synthesizing-music-from-image-and","metrics":{"FAD":"1.12","FD":"22.65","KL_passt":"0.89"},"code_links":[{"title":"schowdhury671/melfusion","url":"https://github.com/schowdhury671/melfusion"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/etta-elucidating-the-design-space-of-text-to","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","date":"2024-12-26","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/flux-that-plays-music","title":"FLUX that Plays Music","date":"2024-09-01","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":9,"samples_ran":6,"samples_unverified":3,"pointer_only_for_licence":9,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/stable-audio-open","title":"Stable Audio Open","date":"2024-07-19","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":1,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/2406-15487","title":"Improving Text-To-Audio Models with Synthetic Captions","date":"2024-06-18","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":3,"samples_unverified":1,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/melfusion-synthesizing-music-from-image-and","title":"MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion Models","date":"2024-06-07","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":12,"samples_unverified":0,"pointer_only_for_licence":12,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/quality-aware-masked-diffusion-transformer","title":"Quality-aware Masked Diffusion Transformer for Enhanced Music Generation","date":"2024-05-24","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":4,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/fast-timing-conditioned-latent-audio","title":"Fast Timing-Conditioned Latent Audio Diffusion","date":"2024-02-07","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":2,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/audioldm-2-learning-holistic-audio-generation","title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining","date":"2023-08-10","rows_on_this_dataset":3,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":27,"samples_ran":12,"samples_unverified":15,"pointer_only_for_licence":13,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/jen-1-text-guided-universal-music-generation","title":"JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models","date":"2023-08-09","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/simple-and-controllable-music-generation","title":"Simple and Controllable Music Generation","date":"2023-06-08","rows_on_this_dataset":3,"code_links":8,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":18,"samples_ran":11,"samples_unverified":7,"pointer_only_for_licence":7,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/efficient-neural-music-generation","title":"Efficient Neural Music Generation","date":"2023-05-25","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/noise2music-text-conditioned-music-generation","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","date":"2023-02-08","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/musiclm-generating-music-from-text","title":"MusicLM: Generating Music From Text","date":"2023-01-26","rows_on_this_dataset":3,"code_links":5,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":16,"samples_ran":6,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/uniaudio-an-audio-foundation-model-toward-1","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","date":null,"rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":4,"samples_unverified":0,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":10,"samples_harvested":103,"samples_ran":61,"samples_unverified":42,"pointer_only_for_licence":49,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}