{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/jen-1-text-guided-universal-music-generation","title":"JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models","arxiv_id":"2308.04729","date":"2023-08-09","proceeding":null,"authors":["Peike Li","BoYu Chen","Yao Yao","Yikai Wang","Allen Wang","Alex Wang"],"abstract":"Music generation has attracted growing interest with the advancement of deep generative models. However, generating music conditioned on textual descriptions, known as text-to-music, remains challenging due to the complexity of musical structures and high sampling rate requirements. Despite the task's significance, prevailing generative models exhibit limitations in music quality, computational efficiency, and generalization. This paper introduces JEN-1, a universal high-fidelity model for text-to-music generation. JEN-1 is a diffusion model incorporating both autoregressive and non-autoregressive training. Through in-context learning, JEN-1 performs various generation tasks including text-guided music generation, music inpainting, and continuation. Evaluations demonstrate JEN-1's superior performance over state-of-the-art methods in text-music alignment and music quality while maintaining computational efficiency. Our demos are available at https://jenmusic.ai/audio-demos","url_abs":"https://arxiv.org/abs/2308.04729v2","url_pdf":"https://arxiv.org/pdf/2308.04729v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"jen-1-text-guided-universal-music-generation","repo_url":"https://github.com/0417keito/JEN-1-COMPOSER-pytorch","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok"}},{"paper_slug":"jen-1-text-guided-universal-music-generation","repo_url":"https://github.com/0417keito/JEN-1-pytorch","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok"}}],"tasks":[{"task_slug":"computational-efficiency","task_name":"Computational Efficiency"},{"task_slug":"in-context-learning","task_name":"In-Context Learning"},{"task_slug":"music-generation","task_name":"Music Generation"},{"task_slug":"text-to-music-generation","task_name":"Text-to-Music Generation"}],"methods":[{"method_slug":"diffusion","method_name":"Diffusion"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/text-to-music-generation-on-musiccaps","task":"Text-to-Music Generation","dataset":"MusicCaps","model":"JEN-1","rank_in_archive_order":5,"of":21,"metrics":{"FAD":"2.00","KL_passt":"1.29"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2308.04729","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}