{"url":"/task/music-generation","name":"Music Generation","slug":"music-generation","description_markdown":"Musique guitar","categories":[{"name":"Audio","url":"/area/audio"},{"name":"Music","url":"/area/music"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":386,"papers_with_code":190,"benchmarks":1,"benchmark_tables_in_archive":1,"benchmark_tables_shown":1,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":33,"subtasks":3,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/music-generation-on-song-describer-dataset","slug":"music-generation-on-song-describer-dataset","dataset":"Song Describer Dataset","dataset_url":"/dataset/song-describer-dataset","rows_in_archive":1,"metrics":["FAD VGG"],"first_row_in_archive_order":{"model":"OpenMusic","paper_title":"Quality-aware Masked Diffusion Transformer for Enhanced Music Generation","paper_url":"/paper/quality-aware-masked-diffusion-transformer","paper_date":"2024-05-24","arxiv_id":"2405.15863","code_links":[{"title":"ivcylc/openmusic","url":"https://github.com/ivcylc/openmusic"},{"title":"ivcylc/qa-mdt","url":"https://github.com/ivcylc/qa-mdt"}],"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/nsynth","name":"NSynth","full_name":"NSynth","num_papers_in_archive":138},{"url":"/dataset/maestro","name":"MAESTRO","full_name":"MAESTRO","num_papers_in_archive":118},{"url":"/dataset/musiccaps","name":"MusicCaps","full_name":"","num_papers_in_archive":84},{"url":"/dataset/pop909","name":"POP909","full_name":"POP909","num_papers_in_archive":43},{"url":"/dataset/urmp","name":"URMP","full_name":"University of Rochester Multi-Modal Musical Performance","num_papers_in_archive":38},{"url":"/dataset/lakh-midi-dataset","name":"Lakh MIDI Dataset","full_name":"","num_papers_in_archive":36},{"url":"/dataset/jsb-chorales","name":"JSB Chorales","full_name":"","num_papers_in_archive":33},{"url":"/dataset/music21","name":"Music21","full_name":"Music21","num_papers_in_archive":33},{"url":"/dataset/musedata","name":"MuseData","full_name":"MuseData","num_papers_in_archive":28},{"url":"/dataset/emopia","name":"EMOPIA","full_name":"A Multi-Modal Pop Piano Dataset For Emotion Recognition and Emotion-based Music Generation","num_papers_in_archive":23},{"url":"/dataset/groove-midi-dataset","name":"Groove","full_name":"Groove MIDI Dataset","num_papers_in_archive":16},{"url":"/dataset/vgmidi","name":"VGMIDI","full_name":"","num_papers_in_archive":15},{"url":"/dataset/asap-aligned-scores-and-performances","name":"ASAP","full_name":"Aligned Scores and Performances","num_papers_in_archive":13},{"url":"/dataset/lakh-pianoroll-dataset","name":"Lakh Pianoroll Dataset","full_name":"","num_papers_in_archive":10},{"url":"/dataset/nes-mdb","name":"NES-MDB","full_name":"Nintendo Entertainment System Music Database","num_papers_in_archive":7},{"url":"/dataset/midicaps","name":"MidiCaps","full_name":"MidiCaps","num_papers_in_archive":6},{"url":"/dataset/musicbench","name":"MusicBench","full_name":"","num_papers_in_archive":6},{"url":"/dataset/adl-piano-midi","name":"ADL Piano MIDI","full_name":"","num_papers_in_archive":5},{"url":"/dataset/song-describer-dataset","name":"Song Describer Dataset","full_name":"","num_papers_in_archive":5},{"url":"/dataset/bach-doodle","name":"Bach Doodle","full_name":"Bach Doodle","num_papers_in_archive":4},{"url":"/dataset/commu","name":"ComMU","full_name":"","num_papers_in_archive":4},{"url":"/dataset/dmelodies","name":"dMelodies","full_name":null,"num_papers_in_archive":4},{"url":"/dataset/fakemusiccaps","name":"FakeMusicCaps","full_name":"","num_papers_in_archive":4},{"url":"/dataset/js-fake-chorales","name":"JS Fake Chorales","full_name":"JS Fake Chorales","num_papers_in_archive":3},{"url":"/dataset/aime","name":"AIME","full_name":"AI Music Evaluation Dataset","num_papers_in_archive":2},{"url":"/dataset/abc-cc","name":"abc_cc","full_name":"ABC CC","num_papers_in_archive":1},{"url":"/dataset/guitar-techs","name":"Guitar-TECHS","full_name":"Guitar Tones/Techniques, Excerpts & Chords Dataset","num_papers_in_archive":1},{"url":"/dataset/jamendomaxcapshttps-arxiv-org-abs-2502-07461","name":"JamendoMaxCaps","full_name":"","num_papers_in_archive":1},{"url":"/dataset/jazzvar-dataset","name":"JAZZVAR Dataset","full_name":"JAZZVAR: A Dataset of Variations found within Solo Piano Performances of Jazz Standards for Music Overpainting","num_papers_in_archive":1},{"url":"/dataset/nes-vmdb","name":"NES-VMDB","full_name":"","num_papers_in_archive":1},{"url":"/dataset/niko-chord-progression-dataset","name":"Niko Chord Progression Dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/xmidi","name":"XMIDI","full_name":"","num_papers_in_archive":1},{"url":"/dataset/ym2413-mdb","name":"YM2413-MDB","full_name":"","num_papers_in_archive":1}],"subtasks":[{"url":"/task/multimodal-music-generation","name":"Multimodal Music Generation"},{"url":"/task/music-performance-rendering","name":"Music Performance Rendering"},{"url":"/task/music-texture-transfer","name":"Music Texture Transfer"}],"parent_tasks":[{"url":"/task/1-image-2-2-stitchi","name":"1 Image, 2*2 Stitchi"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":190,"tagged_in_all":386,"items":[{"url":"/paper/music-transformer","title":"Music Transformer","date":"2018-09-12","arxiv_id":"1809.04281","repositories_listed":12,"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":1}},{"url":"/paper/simple-and-controllable-music-generation","title":"Simple and Controllable Music Generation","date":"2023-06-08","arxiv_id":"2306.05284","repositories_listed":8,"syntology":{"n":18,"n_ran":11,"n_unverified":7,"n_pointer_only":7}},{"url":"/paper/musegan-multi-track-sequential-generative","title":"MuseGAN: Multi-track Sequential Generative Adversarial Networks for Symbolic Music Generation and Accompaniment","date":"2017-09-19","arxiv_id":"1709.06298","repositories_listed":8,"syntology":null},{"url":"/paper/it-s-raw-audio-generation-with-state-space","title":"It's Raw! Audio Generation with State-Space Models","date":"2022-02-20","arxiv_id":"2202.09729","repositories_listed":6,"syntology":{"n":6,"n_ran":6,"n_unverified":0,"n_pointer_only":4}},{"url":"/paper/musiclm-generating-music-from-text","title":"MusicLM: Generating Music From Text","date":"2023-01-26","arxiv_id":"2301.11325","repositories_listed":5,"syntology":{"n":16,"n_ran":6,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/bigvgan-a-universal-neural-vocoder-with-large","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","date":"2022-06-09","arxiv_id":"2206.04658","repositories_listed":5,"syntology":{"n":17,"n_ran":8,"n_unverified":9,"n_pointer_only":1}},{"url":"/paper/compound-word-transformer-learning-to-compose","title":"Compound Word Transformer: Learning to Compose Full-Song Music over Dynamic Directed Hypergraphs","date":"2021-01-07","arxiv_id":"2101.02402","repositories_listed":5,"syntology":{"n":9,"n_ran":3,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/melnet-a-generative-model-for-audio-in-the","title":"MelNet: A Generative Model for Audio in the Frequency Domain","date":"2019-06-04","arxiv_id":"1906.01083","repositories_listed":5,"syntology":{"n":4,"n_ran":4,"n_unverified":0,"n_pointer_only":4}},{"url":"/paper/this-time-with-feeling-learning-expressive","title":"This Time with Feeling: Learning Expressive Musical Performance","date":"2018-08-10","arxiv_id":"1808.03715","repositories_listed":5,"syntology":null},{"url":"/paper/mustango-toward-controllable-text-to-music","title":"Mustango: Toward Controllable Text-to-Music Generation","date":"2023-11-14","arxiv_id":"2311.08355","repositories_listed":4,"syntology":{"n":9,"n_ran":7,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/counterpoint-by-convolution","title":"Counterpoint by Convolution","date":"2019-03-18","arxiv_id":"1903.07227","repositories_listed":4,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/enabling-factorized-piano-music-modeling-and","title":"Enabling Factorized Piano Music Modeling and Generation with the MAESTRO Dataset","date":"2018-10-29","arxiv_id":"1810.12247","repositories_listed":4,"syntology":null},{"url":"/paper/midinet-a-convolutional-generative","title":"MidiNet: A Convolutional Generative Adversarial Network for Symbolic-domain Music Generation","date":"2017-03-31","arxiv_id":"1703.10847","repositories_listed":4,"syntology":null},{"url":"/paper/mousai-text-to-music-generation-with-long","title":"Moûsai: Text-to-Music Generation with Long-Context Latent Diffusion","date":"2023-01-27","arxiv_id":"2301.11757","repositories_listed":3,"syntology":null},{"url":"/paper/mmm-exploring-conditional-multi-track-music","title":"MMM : Exploring Conditional Multi-Track Music Generation with the Transformer","date":"2020-08-13","arxiv_id":"2008.06048","repositories_listed":3,"syntology":{"n":9,"n_ran":0,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/convolutional-generative-adversarial-networks","title":"Convolutional Generative Adversarial Networks with Binary Neurons for Polyphonic Music Generation","date":"2018-04-25","arxiv_id":"1804.09399","repositories_listed":3,"syntology":{"n":35,"n_ran":0,"n_unverified":35,"n_pointer_only":0}},{"url":"/paper/a-critical-review-of-recurrent-neural","title":"A Critical Review of Recurrent Neural Networks for Sequence Learning","date":"2015-05-29","arxiv_id":"1506.00019","repositories_listed":3,"syntology":null},{"url":"/paper/vision-to-music-generation-a-survey","title":"Vision-to-Music Generation: A Survey","date":"2025-03-27","arxiv_id":"2503.21254","repositories_listed":2,"syntology":null},{"url":"/paper/rethinking-emotion-bias-in-music-via-frechet","title":"Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance","date":"2024-09-23","arxiv_id":"2409.15545","repositories_listed":2,"syntology":null},{"url":"/paper/fakemusiccaps-a-dataset-for-detection-and","title":"FakeMusicCaps: a Dataset for Detection and Attribution of Synthetic Music Generated via Text-to-Music Models","date":"2024-09-16","arxiv_id":"2409.10684","repositories_listed":2,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/flux-that-plays-music","title":"FLUX that Plays Music","date":"2024-09-01","arxiv_id":"2409.00587","repositories_listed":2,"syntology":{"n":9,"n_ran":6,"n_unverified":3,"n_pointer_only":9}},{"url":"/paper/musicongen-rhythm-and-chord-control-for","title":"MusiConGen: Rhythm and Chord Control for Transformer-Based Text-to-Music Generation","date":"2024-07-21","arxiv_id":"2407.15060","repositories_listed":2,"syntology":null},{"url":"/paper/quality-aware-masked-diffusion-transformer","title":"Quality-aware Masked Diffusion Transformer for Enhanced Music Generation","date":"2024-05-24","arxiv_id":"2405.15863","repositories_listed":2,"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/whole-song-hierarchical-generation-of","title":"Whole-Song Hierarchical Generation of Symbolic Music Using Cascaded Diffusion Models","date":"2024-05-16","arxiv_id":"2405.09901","repositories_listed":2,"syntology":{"n":12,"n_ran":10,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/cocola-coherence-oriented-contrastive","title":"COCOLA: Coherence-Oriented Contrastive Learning of Musical Audio Representations","date":"2024-04-25","arxiv_id":"2404.16969","repositories_listed":2,"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":5}},{"url":"/paper/jen-1-text-guided-universal-music-generation","title":"JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models","date":"2023-08-09","arxiv_id":"2308.04729","repositories_listed":2,"syntology":null},{"url":"/paper/musecoco-generating-symbolic-music-from-text","title":"MuseCoco: Generating Symbolic Music from Text","date":"2023-05-31","arxiv_id":"2306.00110","repositories_listed":2,"syntology":null},{"url":"/paper/byte-pair-encoding-for-symbolic-music","title":"Byte Pair Encoding for Symbolic Music","date":"2023-01-27","arxiv_id":"2301.11975","repositories_listed":2,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/exploring-the-efficacy-of-pre-trained","title":"Exploring the Efficacy of Pre-trained Checkpoints in Text-to-Music Generation Task","date":"2022-11-21","arxiv_id":"2211.11216","repositories_listed":2,"syntology":null},{"url":"/paper/commu-dataset-for-combinatorial-music","title":"ComMU: Dataset for Combinatorial Music Generation","date":"2022-11-17","arxiv_id":"2211.09385","repositories_listed":2,"syntology":null}],"syntology_records":17,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}