{"url":"/task/text-to-music-generation","name":"Text-to-Music Generation","slug":"text-to-music-generation","description_markdown":null,"categories":[{"name":"Audio","url":"/area/audio"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":37,"papers_with_code":25,"benchmarks":2,"benchmark_tables_in_archive":2,"benchmark_tables_shown":2,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":6,"subtasks":0,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/text-to-music-generation-on-musiccaps","slug":"text-to-music-generation-on-musiccaps","dataset":"MusicCaps","dataset_url":"/dataset/musiccaps","rows_in_archive":21,"metrics":["FAD","FD_openl3","FD","KL_passt","IS","CLAP_LAION","CLAP_MS"],"first_row_in_archive_order":{"model":"MeLFusion (image-conditioned)","paper_title":"MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion Models","paper_url":"/paper/melfusion-synthesizing-music-from-image-and","paper_date":"2024-06-07","arxiv_id":"2406.04673","code_links":[{"title":"schowdhury671/melfusion","url":"https://github.com/schowdhury671/melfusion"}],"syntology":{"n":12,"n_ran":12,"n_unverified":0,"n_pointer_only":12}}},{"leaderboard":"/sota/text-to-music-generation-on-musicbench","slug":"text-to-music-generation-on-musicbench","dataset":"MusicBench","dataset_url":"/dataset/musicbench","rows_in_archive":1,"metrics":["FAD"],"first_row_in_archive_order":{"model":"Mustango (non-pretrained)","paper_title":"Mustango: Toward Controllable Text-to-Music Generation","paper_url":"/paper/mustango-toward-controllable-text-to-music","paper_date":"2023-11-14","arxiv_id":"2311.08355","code_links":[{"title":"amaai-lab/mustango","url":"https://github.com/amaai-lab/mustango"},{"title":"atharva20038/music4all","url":"https://github.com/atharva20038/music4all"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/2/musicgen_melody"},{"title":"MindSpore-scientific/code-10","url":"https://github.com/MindSpore-scientific/code-10/tree/main/text-to-music"}],"syntology":{"n":9,"n_ran":7,"n_unverified":2,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/musiccaps","name":"MusicCaps","full_name":"","num_papers_in_archive":84},{"url":"/dataset/musicbench","name":"MusicBench","full_name":"","num_papers_in_archive":6},{"url":"/dataset/song-describer-dataset","name":"Song Describer Dataset","full_name":"","num_papers_in_archive":5},{"url":"/dataset/aime","name":"AIME","full_name":"AI Music Evaluation Dataset","num_papers_in_archive":2},{"url":"/dataset/jamendomaxcapshttps-arxiv-org-abs-2502-07461","name":"JamendoMaxCaps","full_name":"","num_papers_in_archive":1},{"url":"/dataset/piast","name":"PIAST","full_name":"PIAST: A Multimodal Piano Dataset with Audio, Symbolic and Text","num_papers_in_archive":1}],"subtasks":[],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":25,"of":25,"tagged_in_all":37,"items":[{"url":"/paper/simple-and-controllable-music-generation","title":"Simple and Controllable Music Generation","date":"2023-06-08","arxiv_id":"2306.05284","repositories_listed":8,"syntology":{"n":18,"n_ran":11,"n_unverified":7,"n_pointer_only":7}},{"url":"/paper/musiclm-generating-music-from-text","title":"MusicLM: Generating Music From Text","date":"2023-01-26","arxiv_id":"2301.11325","repositories_listed":5,"syntology":{"n":16,"n_ran":6,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/mustango-toward-controllable-text-to-music","title":"Mustango: Toward Controllable Text-to-Music Generation","date":"2023-11-14","arxiv_id":"2311.08355","repositories_listed":4,"syntology":{"n":9,"n_ran":7,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/music-understanding-llama-advancing-text-to","title":"Music Understanding LLaMA: Advancing Text-to-Music Generation with Question Answering and Captioning","date":"2023-08-22","arxiv_id":"2308.11276","repositories_listed":3,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":4}},{"url":"/paper/mousai-text-to-music-generation-with-long","title":"Moûsai: Text-to-Music Generation with Long-Context Latent Diffusion","date":"2023-01-27","arxiv_id":"2301.11757","repositories_listed":3,"syntology":null},{"url":"/paper/flux-that-plays-music","title":"FLUX that Plays Music","date":"2024-09-01","arxiv_id":"2409.00587","repositories_listed":2,"syntology":{"n":9,"n_ran":6,"n_unverified":3,"n_pointer_only":9}},{"url":"/paper/musicongen-rhythm-and-chord-control-for","title":"MusiConGen: Rhythm and Chord Control for Transformer-Based Text-to-Music Generation","date":"2024-07-21","arxiv_id":"2407.15060","repositories_listed":2,"syntology":null},{"url":"/paper/quality-aware-masked-diffusion-transformer","title":"Quality-aware Masked Diffusion Transformer for Enhanced Music Generation","date":"2024-05-24","arxiv_id":"2405.15863","repositories_listed":2,"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/fast-timing-conditioned-latent-audio","title":"Fast Timing-Conditioned Latent Audio Diffusion","date":"2024-02-07","arxiv_id":"2402.04825","repositories_listed":2,"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/audioldm-2-learning-holistic-audio-generation","title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining","date":"2023-08-10","arxiv_id":"2308.05734","repositories_listed":2,"syntology":{"n":27,"n_ran":12,"n_unverified":15,"n_pointer_only":13}},{"url":"/paper/jen-1-text-guided-universal-music-generation","title":"JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models","date":"2023-08-09","arxiv_id":"2308.04729","repositories_listed":2,"syntology":null},{"url":"/paper/exploring-the-efficacy-of-pre-trained","title":"Exploring the Efficacy of Pre-trained Checkpoints in Text-to-Music Generation Task","date":"2022-11-21","arxiv_id":"2211.11216","repositories_listed":2,"syntology":null},{"url":"/paper/tokensynth-a-token-based-neural-synthesizer","title":"TokenSynth: A Token-based Neural Synthesizer for Instrument Cloning and Text-to-Instrument","date":"2025-02-13","arxiv_id":"2502.08939","repositories_listed":1,"syntology":null},{"url":"/paper/etta-elucidating-the-design-space-of-text-to","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","date":"2024-12-26","arxiv_id":"2412.19351","repositories_listed":1,"syntology":null},{"url":"/paper/long-form-text-to-music-generation-with","title":"Long-Form Text-to-Music Generation with Adaptive Prompts: A Case Study in Tabletop Role-Playing Games Soundtracks","date":"2024-11-06","arxiv_id":"2411.03948","repositories_listed":1,"syntology":null},{"url":"/paper/melody-is-all-you-need-for-music-generation","title":"Melody-Guided Music Generation","date":"2024-09-30","arxiv_id":"2409.20196","repositories_listed":1,"syntology":null},{"url":"/paper/stable-audio-open","title":"Stable Audio Open","date":"2024-07-19","arxiv_id":"2407.14358","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/2406-15487","title":"Improving Text-To-Audio Models with Synthetic Captions","date":"2024-06-18","arxiv_id":"2406.15487","repositories_listed":1,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":4}},{"url":"/paper/melfusion-synthesizing-music-from-image-and","title":"MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion Models","date":"2024-06-07","arxiv_id":"2406.04673","repositories_listed":1,"syntology":{"n":12,"n_ran":12,"n_unverified":0,"n_pointer_only":12}},{"url":"/paper/musicmagus-zero-shot-text-to-music-editing","title":"MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models","date":"2024-02-09","arxiv_id":"2402.06178","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/pam-prompting-audio-language-models-for-audio","title":"PAM: Prompting Audio-Language Models for Audio Quality Assessment","date":"2024-02-01","arxiv_id":"2402.00282","repositories_listed":1,"syntology":{"n":10,"n_ran":8,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/the-song-describer-dataset-a-corpus-of-audio","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","date":"2023-11-16","arxiv_id":"2311.10057","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/music-controlnet-a-model-similar-to-sd","title":"Music ControlNet: A model similar to SD ControlNetD that can accurately control music generation","date":"2023-11-07","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/investigating-personalization-methods-in-text","title":"Investigating Personalization Methods in Text to Music Generation","date":"2023-09-20","arxiv_id":"2309.11140","repositories_listed":1,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":3}},{"url":"/paper/musicldm-enhancing-novelty-in-text-to-music","title":"MusicLDM: Enhancing Novelty in Text-to-Music Generation Using Beat-Synchronous Mixup Strategies","date":"2023-08-03","arxiv_id":"2308.01546","repositories_listed":1,"syntology":{"n":14,"n_ran":9,"n_unverified":5,"n_pointer_only":14}}],"syntology_records":16,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}