{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/archisound-audio-generation-with-diffusion","title":"ArchiSound: Audio Generation with Diffusion","arxiv_id":"2301.13267","date":"2023-01-30","proceeding":null,"authors":["Flavio Schneider"],"abstract":"The recent surge in popularity of diffusion models for image generation has brought new attention to the potential of these models in other areas of media generation. One area that has yet to be fully explored is the application of diffusion models to audio generation. Audio generation requires an understanding of multiple aspects, such as the temporal dimension, long term structure, multiple layers of overlapping sounds, and the nuances that only trained listeners can detect. In this work, we investigate the potential of diffusion models for audio generation. We propose a set of models to tackle multiple aspects, including a new method for text-conditional latent audio diffusion with stacked 1D U-Nets, that can generate multiple minutes of music from a textual description. For each model, we make an effort to maintain reasonable inference speed, targeting real-time on a single consumer GPU. In addition to trained models, we provide a collection of open source libraries with the hope of simplifying future work in the field. Samples can be found at https://bit.ly/audio-diffusion. Codes are at https://github.com/archinetai/audio-diffusion-pytorch.","url_abs":"https://arxiv.org/abs/2301.13267v1","url_pdf":"https://arxiv.org/pdf/2301.13267v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"archisound-audio-generation-with-diffusion","repo_url":"https://github.com/archinetai/audio-diffusion-pytorch","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}}],"tasks":[{"task_slug":"audio-generation","task_name":"Audio Generation"},{"task_slug":null,"task_name":"GPU"},{"task_slug":"image-generation","task_name":"Image Generation"}],"methods":[{"method_slug":"diffusion","method_name":"Diffusion"}],"datasets_introduced":[],"methods_introduced":[],"results":[],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2301.13267","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2301.13267"}},"developers":"https://syntology.ai/developers","read_at":"2026-09-24T18:15:14+00:00","read_at_is":"when the build read Syntology's graph, not when any sample ran","claim":"Per-sample execution status on synthesized fixtures; not a correctness claim about the paper. Samples come from repositories linked to the paper, official or community; repo_kind says which.","repos":[{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/archinetai/audio-diffusion-pytorch","reach":{"status":"ok","spdx":"MIT"}}],"summary":{"ran":1,"unverified":5},"by_repo_kind":{"official":{"samples":6,"ran":1,"repositories":1}},"repo_kind_vocabulary":{"official":"The archive marks this repository official for the paper","named_in_paper":"The archive records that the paper mentions this repository; it is not marked official","listed":"In the archive's code links for this paper, not marked official and not recorded as mentioned in the paper","found_in_text":"Syntology found this repository in the paper's own text; whether it is the authors' implementation is not asserted","community":"Not in the archive's code links for this paper; a community repository Syntology harvested"},"n_pointer_only_for_licence":0,"samples":[{"code_sha256_prefix":"1714b81de8dbea7f","entry":"pad_dims","repo":"archinetai/audio-diffusion-pytorch","repo_kind":"official","path":"audio_diffusion_pytorch/diffusion.py","file_url":"https://github.com/archinetai/audio-diffusion-pytorch/blob/HEAD/audio_diffusion_pytorch/diffusion.py","link_basis":"harvester_set","language":"python","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"1714b81de8dbea7f"}},{"code_sha256_prefix":"73879fb60563ab28","entry":"clip","repo":"archinetai/audio-diffusion-pytorch","repo_kind":"official","path":"audio_diffusion_pytorch/diffusion.py","file_url":"https://github.com/archinetai/audio-diffusion-pytorch/blob/HEAD/audio_diffusion_pytorch/diffusion.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"73879fb60563ab28"}},{"code_sha256_prefix":"b7f514d1295ce8bf","entry":"exists","repo":"archinetai/audio-diffusion-pytorch","repo_kind":"official","path":"audio_diffusion_pytorch/utils.py","file_url":"https://github.com/archinetai/audio-diffusion-pytorch/blob/HEAD/audio_diffusion_pytorch/utils.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"b7f514d1295ce8bf"}},{"code_sha256_prefix":"5f96c88e1341917f","entry":"extend_dim","repo":"archinetai/audio-diffusion-pytorch","repo_kind":"official","path":"audio_diffusion_pytorch/diffusion.py","file_url":"https://github.com/archinetai/audio-diffusion-pytorch/blob/HEAD/audio_diffusion_pytorch/diffusion.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"5f96c88e1341917f"}},{"code_sha256_prefix":"6f23ac079c8f083f","entry":"iff","repo":"archinetai/audio-diffusion-pytorch","repo_kind":"official","path":"audio_diffusion_pytorch/utils.py","file_url":"https://github.com/archinetai/audio-diffusion-pytorch/blob/HEAD/audio_diffusion_pytorch/utils.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"6f23ac079c8f083f"}},{"code_sha256_prefix":"246e7d93f8c8366d","entry":"is_sequence","repo":"archinetai/audio-diffusion-pytorch","repo_kind":"official","path":"audio_diffusion_pytorch/utils.py","file_url":"https://github.com/archinetai/audio-diffusion-pytorch/blob/HEAD/audio_diffusion_pytorch/utils.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"246e7d93f8c8366d"}}]},"arxiv_metadata":null,"syntology_extracted_results":null}