{"url":"/dataset/song-describer-dataset","name":"Song Describer Dataset","full_name":null,"description_markdown":"The Song Describer Dataset (SDD) contains ~1.1k captions for 706 permissively licensed music recordings. It is designed for use in evaluation of models that address music-and-language (M&L) tasks such as music captioning, text-to-music generation and music-language retrieval.","description_withheld":null,"homepage":"https://github.com/mulab-mir/song-describer-dataset","introduced_date":"2023-11-16","introduced_date_note":null,"introduced_by":{"paper":"/paper/the-song-describer-dataset-a-corpus-of-audio","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","first_author":"Ilaria Manco","url":null},"license":{"name":"CC BY-SA 4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"},{"name":"Audio","url":"/datasets/modality/audio"},{"name":"Music","url":"/datasets/modality/music"}],"tasks":[{"name":"Cross-Modal Retrieval","url":"/task/cross-modal-retrieval","datasets_with_task":"/datasets/task/cross-modal-retrieval"},{"name":"Text-to-Music Generation","url":"/task/text-to-music-generation","datasets_with_task":"/datasets/task/text-to-music-generation"},{"name":"Music Generation","url":"/task/music-generation","datasets_with_task":"/datasets/task/music-generation"},{"name":"Music Captioning","url":"/task/music-captioning","datasets_with_task":"/datasets/task/music-captioning"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["Song Describer Dataset"],"data_loaders":[],"num_papers_in_archive":5,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/music-generation-on-song-describer-dataset","task":"Music Generation","dataset_variant":"Song Describer Dataset","rows":1,"metrics":["FAD VGG"],"first_row_in_archive_order":{"model":"OpenMusic","paper":"/paper/quality-aware-masked-diffusion-transformer","metrics":{"FAD VGG":"1.01"},"code_links":[{"title":"ivcylc/openmusic","url":"https://github.com/ivcylc/openmusic"},{"title":"ivcylc/qa-mdt","url":"https://github.com/ivcylc/qa-mdt"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/quality-aware-masked-diffusion-transformer","title":"Quality-aware Masked Diffusion Transformer for Enhanced Music Generation","date":"2024-05-24","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":4,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":1,"samples_harvested":7,"samples_ran":4,"samples_unverified":3,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}