{"url":"/sota/audio-generation-on-audiocaps","task":{"name":"Audio Generation","url":"/task/audio-generation","note":null},"dataset":{"name":"AudioCaps","url":"/dataset/audiocaps"},"category":"Audio","categories":["Audio","Music","Speech"],"category_note":null,"description":"Audio generation (synthesis) is the task of generating raw audio such as speech.\r\n\r\n<span style=\"color:grey; opacity: 0.6\">( Image credit: [MelNet](https://arxiv.org/pdf/1906.01083v1.pdf) )</span>","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["FD_openl3","FAD","FD","KL_passt","IS","CLAP_LAION","CLAP_MS"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"FD_openl3":null,"FAD":null,"FD":null,"KL_passt":null,"IS":null,"CLAP_LAION":null,"CLAP_MS":null}},"counts":{"rows":23,"rows_with_code":21,"rows_with_paper_page":23,"rows_dated":23,"rows_using_additional_data":0},"rows":[{"rank_in_archive_order":1,"model":"ETTA-FT-AC-100k","metrics":{"CLAP_LAION":"0.60","CLAP_MS":"0.43","FAD":"2.03","FD":"10.10","FD_openl3":"61.79","IS":"14.29","KL_passt":"1.13"},"uses_additional_data":false,"paper_date":"2024-12-26","paper":"/paper/etta-elucidating-the-design-space-of-text-to","paper_url":"https://arxiv.org/abs/2412.19351v1","paper_title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","code":"https://github.com/NVIDIA/elucidated-text-to-audio","n_code_links":1,"syntology":null},{"rank_in_archive_order":2,"model":"TangoFlux","metrics":{"CLAP_LAION":"0.488","FD_openl3":"75.1","IS":"12.2","KL_passt":"1.15"},"uses_additional_data":false,"paper_date":"2024-12-30","paper":"/paper/tangoflux-super-fast-and-faithful-text-to","paper_url":"https://arxiv.org/abs/2412.21037v2","paper_title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","code":"https://github.com/declare-lab/TangoFlux","n_code_links":1,"syntology":null},{"rank_in_archive_order":3,"model":"Stable Audio Open","metrics":{"CLAP_LAION":"0.35","CLAP_MS":"0.34","FD_openl3":"78.24","KL_passt":"2.14"},"uses_additional_data":false,"paper_date":"2024-07-19","paper":"/paper/stable-audio-open","paper_url":"https://arxiv.org/abs/2407.14358v2","paper_title":"Stable Audio Open","code":"https://github.com/stability-ai/stable-audio-tools","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"TangoFlux-base","metrics":{"CLAP_LAION":"0.438","FD_openl3":"79.7","IS":"10.7","KL_passt":"1.23"},"uses_additional_data":false,"paper_date":"2024-12-30","paper":"/paper/tangoflux-super-fast-and-faithful-text-to","paper_url":"https://arxiv.org/abs/2412.21037v2","paper_title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","code":"https://github.com/declare-lab/TangoFlux","n_code_links":1,"syntology":null},{"rank_in_archive_order":5,"model":"ETTA","metrics":{"CLAP_LAION":"0.54","CLAP_MS":"0.43","FAD":"2.51","FD":"13.12","FD_openl3":"80.13","IS":"14.36","KL_passt":"1.22"},"uses_additional_data":false,"paper_date":"2024-12-26","paper":"/paper/etta-elucidating-the-design-space-of-text-to","paper_url":"https://arxiv.org/abs/2412.19351v1","paper_title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","code":"https://github.com/NVIDIA/elucidated-text-to-audio","n_code_links":1,"syntology":null},{"rank_in_archive_order":6,"model":"Stable Audio","metrics":{"CLAP_LAION":"0.41","FD_openl3":"103.66","KL_passt":"2.89"},"uses_additional_data":false,"paper_date":"2024-02-07","paper":"/paper/fast-timing-conditioned-latent-audio","paper_url":"https://arxiv.org/abs/2402.04825v3","paper_title":"Fast Timing-Conditioned Latent Audio Diffusion","code":"https://github.com/stability-ai/stable-audio-tools","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"Stable Audio 2.0","metrics":{"FD_openl3":"110.62","KL_passt":"2.70"},"uses_additional_data":false,"paper_date":"2024-04-16","paper":"/paper/long-form-music-generation-with-latent","paper_url":"https://arxiv.org/abs/2404.10301v2","paper_title":"Long-form music generation with latent diffusion","code":"https://github.com/stability-ai/stable-audio-tools","n_code_links":1,"syntology":null},{"rank_in_archive_order":8,"model":"AudioLDM2-large","metrics":{"CLAP_LAION":"0.53","CLAP_MS":"0.37","FAD":"2.02","FD":"26.18","FD_openl3":"158.04","IS":"8.55","KL_passt":"1.68"},"uses_additional_data":false,"paper_date":"2023-08-10","paper":"/paper/audioldm-2-learning-holistic-audio-generation","paper_url":"https://arxiv.org/abs/2308.05734v3","paper_title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining","code":"https://github.com/haoheliu/AudioLDM2","n_code_links":2,"syntology":{"n_ran":12,"n_unverified":15,"n_samples":27,"n_pointer_only_licence":13}},{"rank_in_archive_order":9,"model":"AudioGen","metrics":{"FAD":"3.13","FD_openl3":"185.53","KL_passt":"1.42"},"uses_additional_data":false,"paper_date":"2022-09-30","paper":"/paper/audiogen-textually-guided-audio-generation","paper_url":"https://arxiv.org/abs/2209.15352v2","paper_title":"AudioGen: Textually Guided Audio Generation","code":"https://github.com/facebookresearch/audiocraft","n_code_links":1,"syntology":null},{"rank_in_archive_order":10,"model":"Audiobox Sound","metrics":{"CLAP_LAION":"0.71","FAD":"0.77","FD":"8.30","IS":"12.70"},"uses_additional_data":false,"paper_date":"2023-12-25","paper":"/paper/audiobox-unified-audio-generation-with","paper_url":"https://arxiv.org/abs/2312.15821v1","paper_title":"Audiobox: Unified Audio Generation with Natural Language Prompts","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":11,"model":"GenAu-Large","metrics":{"CLAP_MS":"0.668","FAD":"1.21","FD":"16.51"},"uses_additional_data":false,"paper_date":"2024-06-27","paper":"/paper/taming-data-and-transformers-for-audio-1","paper_url":"https://arxiv.org/abs/2406.19388v4","paper_title":"Taming Data and Transformers for Audio Generation","code":"https://github.com/snap-research/GenAU","n_code_links":1,"syntology":null},{"rank_in_archive_order":12,"model":"Re-AudioLDM-L","metrics":{"FAD":"1.37"},"uses_additional_data":false,"paper_date":"2023-09-14","paper":"/paper/retrieval-augmented-text-to-audio-generation","paper_url":"https://arxiv.org/abs/2309.08051v2","paper_title":"Retrieval-Augmented Text-to-Audio Generation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":13,"model":"AudioLDM 2-AC-Large","metrics":{"CLAP_LAION":"0.243","FAD":"1.42"},"uses_additional_data":false,"paper_date":"2023-08-10","paper":"/paper/audioldm-2-learning-holistic-audio-generation","paper_url":"https://arxiv.org/abs/2308.05734v3","paper_title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining","code":"https://github.com/haoheliu/AudioLDM2","n_code_links":2,"syntology":{"n_ran":12,"n_unverified":15,"n_samples":27,"n_pointer_only_licence":13}},{"rank_in_archive_order":14,"model":"TANGO","metrics":{"FAD":"1.59","FD":"24.52"},"uses_additional_data":false,"paper_date":"2023-04-24","paper":"/paper/text-to-audio-generation-using-instruction","paper_url":"https://arxiv.org/abs/2304.13731v2","paper_title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","code":"https://github.com/declare-lab/tango","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"Auffusion","metrics":{"FAD":"1.63","FD":"21.99"},"uses_additional_data":false,"paper_date":"2024-01-02","paper":"/paper/auffusion-leveraging-the-power-of-diffusion","paper_url":"https://arxiv.org/abs/2401.01044v1","paper_title":"Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation","code":"https://github.com/happylittlecat2333/Auffusion","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":16,"model":"Auffusion-Full","metrics":{"FAD":"1.76","FD":"23.08"},"uses_additional_data":false,"paper_date":"2024-01-02","paper":"/paper/auffusion-leveraging-the-power-of-diffusion","paper_url":"https://arxiv.org/abs/2401.01044v1","paper_title":"Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation","code":"https://github.com/happylittlecat2333/Auffusion","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":17,"model":"Make-An-Audio 2","metrics":{"FAD":"1.80","FD":"11.75"},"uses_additional_data":false,"paper_date":"2023-05-29","paper":"/paper/make-an-audio-2-temporal-enhanced-text-to","paper_url":"https://arxiv.org/abs/2305.18474v1","paper_title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","code":"https://github.com/bytedance/make-an-audio-2","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":4,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":18,"model":"CoDi","metrics":{"FAD":"1.80","FD":"22.90"},"uses_additional_data":false,"paper_date":"2023-05-19","paper":"/paper/any-to-any-generation-via-composable","paper_url":"https://arxiv.org/abs/2305.11846v1","paper_title":"Any-to-Any Generation via Composable Diffusion","code":"https://github.com/microsoft/i-Code/tree/main/i-Code-V3","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":11,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"AudioLDM-L-Full","metrics":{"FAD":"1.96","FD":"23.31"},"uses_additional_data":false,"paper_date":"2023-01-29","paper":"/paper/audioldm-text-to-audio-generation-with-latent","paper_url":"https://arxiv.org/abs/2301.12503v3","paper_title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","code":"https://github.com/huggingface/diffusers","n_code_links":4,"syntology":{"n_ran":8,"n_unverified":13,"n_samples":21,"n_pointer_only_licence":10}},{"rank_in_archive_order":20,"model":"Consistency TTA (Single-step generation)","metrics":{"FAD":"2.18","FD":"20.44"},"uses_additional_data":false,"paper_date":"2023-09-19","paper":"/paper/accelerating-diffusion-based-text-to-audio","paper_url":"https://arxiv.org/abs/2309.10740v3","paper_title":"ConsistencyTTA: Accelerating Diffusion-Based Text-to-Audio Generation with Consistency Distillation","code":"https://github.com/Bai-YT/ConsistencyTTA","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"Tango-AF&AC-FT-AC","metrics":{"CLAP_LAION":"0.527","FAD":"2.54","FD":"17.19","IS":"11.04"},"uses_additional_data":false,"paper_date":"2024-06-18","paper":"/paper/2406-15487","paper_url":"https://arxiv.org/abs/2406.15487v2","paper_title":"Improving Text-To-Audio Models with Synthetic Captions","code":"https://github.com/declare-lab/tango","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":22,"model":"Make-An-Audio","metrics":{"FAD":"2.66","FD":"18.32"},"uses_additional_data":false,"paper_date":"2023-01-30","paper":"/paper/make-an-audio-text-to-audio-generation-with","paper_url":"https://arxiv.org/abs/2301.12661v1","paper_title":"Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models","code":"https://github.com/text-to-audio/make-an-audio","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":23,"model":"Diffsound","metrics":{"FAD":"7.75","FD":"47.68"},"uses_additional_data":false,"paper_date":"2022-07-20","paper":"/paper/diffsound-discrete-diffusion-model-for-text","paper_url":"https://arxiv.org/abs/2207.09983v2","paper_title":"Diffsound: Discrete Diffusion Model for Text-to-sound Generation","code":"https://github.com/yangdongchao/text-to-sound-synthesis","n_code_links":1,"syntology":null}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":12,"rows_with_any_sample_ran":12,"distinct_papers_with_graph_line":10,"distinct_papers_with_any_sample_ran":10,"samples_over_distinct_papers":{"n_ran":44,"n_unverified":47,"n_samples":91,"n_pointer_only_licence":29,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":58,"n_unverified":62,"n_samples":120,"n_pointer_only_licence":44,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}