{"url":"/dataset/slakh2100","name":"Slakh2100","full_name":"Synthesized Lakh Dataset","description_markdown":"The Synthesized Lakh (Slakh) Dataset is a dataset for audio source separation that is synthesized from the Lakh MIDI Dataset v0.1 using professional-grade sample-based virtual instruments. This first release of Slakh, called **Slakh2100**, contains 2100 automatically mixed tracks and accompanying MIDI files synthesized using a professional-grade sampling engine. The tracks in Slakh2100 are split into training (1500 tracks), validation (375 tracks), and test (225 tracks) subsets, totaling 145 hours of mixtures.\n\nSource: [http://www.slakh.com/](http://www.slakh.com/)\nImage Source: [http://www.slakh.com/](http://www.slakh.com/)\nAudio Source: [http://www.slakh.com/](http://www.slakh.com/)","description_withheld":null,"homepage":"http://www.slakh.com/","introduced_date":"2019-01-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/cutting-music-source-separation-some-slakh-a","title":"Cutting Music Source Separation Some Slakh: A Dataset to Study the Impact of Training Data Quality and Quantity","first_author":"Ethan Manilow","url":null},"license":null,"modalities":[{"name":"Audio","url":"/datasets/modality/audio"},{"name":"Midi","url":"/datasets/modality/midi"}],"tasks":[{"name":"Semantic Segmentation","url":"/task/semantic-segmentation","datasets_with_task":"/datasets/task/semantic-segmentation"},{"name":"Music Transcription","url":"/task/music-transcription","datasets_with_task":"/datasets/task/music-transcription"},{"name":"Data Augmentation","url":"/task/data-augmentation","datasets_with_task":"/datasets/task/data-augmentation"},{"name":"Music Source Separation","url":"/task/music-source-separation","datasets_with_task":"/datasets/task/music-source-separation"},{"name":"Multi-instrument Music Transcription","url":"/task/multi-instrument-music-transcription","datasets_with_task":"/datasets/task/multi-instrument-music-transcription"}],"languages":[],"variants":["Slakh2100"],"data_loaders":[],"num_papers_in_archive":38,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/music-transcription-on-slakh2100","task":"Music Transcription","dataset_variant":"Slakh2100","rows":6,"metrics":["note-level F-measure-no-offset (Fno)","Onset F1"],"first_row_in_archive_order":{"model":"YourMT3+ (YPTF.MoE+M)","paper":"/paper/yourmt3-multi-instrument-music-transcription","metrics":{"Onset F1":"84.56","note-level F-measure-no-offset (Fno)":"0.8456"},"code_links":[{"title":"mimbres/yourmt3","url":"https://github.com/mimbres/yourmt3"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/multi-instrument-music-transcription-on","task":"Multi-instrument Music Transcription","dataset_variant":"Slakh2100","rows":5,"metrics":["Multi F1"],"first_row_in_archive_order":{"model":"YourMT3+ (YPTF.MoE+M)","paper":"/paper/yourmt3-multi-instrument-music-transcription","metrics":{"Multi F1":"74.84"},"code_links":[{"title":"mimbres/yourmt3","url":"https://github.com/mimbres/yourmt3"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/music-source-separation-on-slakh2100","task":"Music Source Separation","dataset_variant":"Slakh2100","rows":2,"metrics":["SDR (bass)","SDR (drums)","SI-SDRi (Bass)","Si-SDRi (Drums)","Si-SDRi (Guitar)","Si-SDRi (Piano)"],"first_row_in_archive_order":{"model":"LQ-VAE + Scalable Transformer","paper":"/paper/unsupervised-source-separation-via-bayesian","metrics":{"SDR (bass)":"7.42","SDR (drums)":"5.83"},"code_links":[{"title":"michelemancusi/LQVAE-separation","url":"https://github.com/michelemancusi/LQVAE-separation"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/yourmt3-multi-instrument-music-transcription","title":"YourMT3+: Multi-instrument Music Transcription with Enhanced Transformer Architectures and Cross-dataset Stem Augmentation","date":"2024-07-05","rows_on_this_dataset":6,"code_links":1,"syntology":null},{"paper":"/paper/the-chamber-ensemble-generator-limitless-high","title":"The Chamber Ensemble Generator: Limitless High-Quality MIR Data via Generative Modeling","date":"2022-09-28","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":9,"samples_ran":0,"samples_unverified":9,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/jointist-joint-learning-for-multi-instrument","title":"Jointist: Joint Learning for Multi-instrument Transcription and Its Applications","date":"2022-06-22","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/a-lightweight-instrument-agnostic-model-for","title":"A Lightweight Instrument-Agnostic Model for Polyphonic Note Transcription and Multipitch Estimation","date":"2022-03-18","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":0,"samples_unverified":7,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mt3-multi-task-multitrack-music-transcription-1","title":"MT3: Multi-Task Multitrack Music Transcription","date":"2021-11-04","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":0,"samples_unverified":6,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/unsupervised-source-separation-via-bayesian","title":"Unsupervised Source Separation via Bayesian Inference in the Latent Domain","date":"2021-10-11","rows_on_this_dataset":1,"code_links":1,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":3,"samples_harvested":22,"samples_ran":0,"samples_unverified":22,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":3,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}