{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/audio-generation/papers/3","list_of":"/task/audio-generation","task":"Audio Generation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":3,"rows_per_page":100,"rows":[201,270],"of":270,"counts":{"archive_papers_tagged":270,"with_a_code_link":124,"where_syntology_ran_a_sample":57,"not_listed_spam_title":0,"listed":270,"listed_where_code_ran":57,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":49,"every_run_a_failure_of_syntologys_instrument":8,"listed_with_a_run_with_no_instrument_failure":49,"listed_every_run_a_failure_of_syntologys_instrument":8,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/audio-generation","prev":"/task/audio-generation/papers/2","next":null,"papers":[{"url":null,"slug":"autoregressive-diffusion-transformer-for-text","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","date":"2024-06-08","arxiv_id":"2406.05551","repositories_listed":0,"syntology":null},{"url":null,"slug":"creative-text-to-audio-generation-via","title":"Creative Text-to-Audio Generation via Synthesizer Programming","date":"2024-06-01","arxiv_id":"2406.00294","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-deep-learning-audio-generation","title":"A Survey of Deep Learning Audio Generation Methods","date":"2024-05-31","arxiv_id":"2406.00146","repositories_listed":0,"syntology":null},{"url":null,"slug":"c3llm-conditional-multimodal-content","title":"C3LLM: Conditional Multimodal Content Generation Using Large Language Models","date":"2024-05-25","arxiv_id":"2405.16136","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-rarity-of-musical-audio-signals-within","title":"The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation","date":"2024-05-23","arxiv_id":"2405.15103","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-echoes-a-simple-unified-transformer","title":"Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation","date":"2024-05-23","arxiv_id":"2405.14598","repositories_listed":0,"syntology":null},{"url":"/paper/prompt-guided-precise-audio-editing-with","slug":"prompt-guided-precise-audio-editing-with","title":"Prompt-guided Precise Audio Editing with Diffusion Models","date":"2024-05-11","arxiv_id":"2406.04350","repositories_listed":0,"syntology":{"n":18,"n_ran":16,"n_constructed":0,"n_ran_checked":12,"n_instrument":4,"n_unverified":2,"n_honours":1,"n_violates":2,"n_no_contract":9,"n_pointer_only":18,"phrase":"16 ran (of which 0 constructed an object rather than computing a result; 12 with no instrument failure: 1 honoured, 2 violated, 9 with no contract checked; 4 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/prompt-guided-precise-audio-editing-with#ran","syntology_url":"https://syntology.ai/paper/2406.04350","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2406.04350"}},"official":null}},{"url":null,"slug":"leveraging-ai-to-generate-audio-for-user","title":"Leveraging AI to Generate Audio for User-generated Content in Video Games","date":"2024-04-25","arxiv_id":"2404.17018","repositories_listed":0,"syntology":null},{"url":null,"slug":"music-style-transfer-with-diffusion-model","title":"Music Style Transfer With Diffusion Model","date":"2024-04-23","arxiv_id":"2404.14771","repositories_listed":0,"syntology":null},{"url":null,"slug":"ld-pruner-efficient-pruning-of-latent","title":"LD-Pruner: Efficient Pruning of Latent Diffusion Models using Task-Agnostic Insights","date":"2024-04-18","arxiv_id":"2404.11936","repositories_listed":0,"syntology":null},{"url":null,"slug":"synthesizing-soundscapes-leveraging-text-to","title":"Synthetic training set generation using text-to-audio models for environmental sound classification","date":"2024-03-26","arxiv_id":"2403.17864","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-to-audio-generation-synchronized-with","title":"Text-to-Audio Generation Synchronized with Videos","date":"2024-03-08","arxiv_id":"2403.07938","repositories_listed":0,"syntology":null},{"url":null,"slug":"un-paired-signal-to-signal-translation-with","title":"(Un)paired signal-to-signal translation with 1D conditional GANs","date":"2024-03-05","arxiv_id":"2403.04800","repositories_listed":0,"syntology":null},{"url":null,"slug":"bespoke-non-stationary-solvers-for-fast","title":"Bespoke Non-Stationary Solvers for Fast Sampling of Diffusion and Flow Models","date":"2024-03-02","arxiv_id":"2403.01329","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-and-hearing-open-domain-visual-audio","title":"Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners","date":"2024-02-27","arxiv_id":"2402.17723","repositories_listed":0,"syntology":null},{"url":null,"slug":"classification-diffusion-models","title":"Classification Diffusion Models: Revitalizing Density Ratio Estimation","date":"2024-02-15","arxiv_id":"2402.10095","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-neural-network-based-generative","title":"Analyzing Neural Network-Based Generative Diffusion Models through Convex Optimization","date":"2024-02-03","arxiv_id":"2402.01965","repositories_listed":0,"syntology":null},{"url":null,"slug":"bass-accompaniment-generation-via-latent","title":"Bass Accompaniment Generation via Latent Diffusion","date":"2024-02-02","arxiv_id":"2402.01412","repositories_listed":0,"syntology":null},{"url":null,"slug":"ella-v-stable-neural-codec-language-modeling","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","date":"2024-01-14","arxiv_id":"2401.07333","repositories_listed":0,"syntology":null},{"url":null,"slug":"masked-audio-generation-using-a-single-non","title":"Masked Audio Generation using a Single Non-Autoregressive Transformer","date":"2024-01-09","arxiv_id":"2401.04577","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-parallel-audio-generation-using","title":"Efficient Parallel Audio Generation using Group Masked Language Modeling","date":"2024-01-02","arxiv_id":"2401.01099","repositories_listed":0,"syntology":null},{"url":null,"slug":"cyclic-learning-for-binaural-audio-generation","title":"Cyclic Learning for Binaural Audio Generation and Localization","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/audiobox-unified-audio-generation-with","slug":"audiobox-unified-audio-generation-with","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","date":"2023-12-25","arxiv_id":"2312.15821","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-exr-controllable-review-generation","title":"Diffusion-EXR: Controllable Review Generation for Explainable Recommendation via Diffusion Models","date":"2023-12-24","arxiv_id":"2312.15490","repositories_listed":0,"syntology":null},{"url":null,"slug":"cmmd-contrastive-multi-modal-diffusion-for","title":"CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling","date":"2023-12-08","arxiv_id":"2312.05412","repositories_listed":0,"syntology":null},{"url":null,"slug":"sefgan-harvesting-the-power-of-normalizing","title":"SEFGAN: Harvesting the Power of Normalizing Flows and GANs for Efficient High-Quality Speech Enhancement","date":"2023-12-04","arxiv_id":"2312.01744","repositories_listed":0,"syntology":null},{"url":null,"slug":"tinyclap-distilling-constrastive-language","title":"tinyCLAP: Distilling Constrastive Language-Audio Pretrained Models","date":"2023-11-24","arxiv_id":"2311.14517","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-generative-model-for-visual","title":"Cross-modal Generative Model for Visual-Guided Binaural Stereo Generation","date":"2023-11-13","arxiv_id":"2311.07630","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-context-prompt-editing-for-conditional","title":"In-Context Prompt Editing For Conditional Audio Generation","date":"2023-11-01","arxiv_id":"2311.00895","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-open-prompt-challenge-in-conditional","title":"On The Open Prompt Challenge In Conditional Audio Generation","date":"2023-11-01","arxiv_id":"2311.00897","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-editing-with-non-rigid-text-prompts","title":"Audio Editing with Non-Rigid Text Prompts","date":"2023-10-19","arxiv_id":"2310.12858","repositories_listed":0,"syntology":null},{"url":null,"slug":"foleygen-visually-guided-audio-generation","title":"FoleyGen: Visually-Guided Audio Generation","date":"2023-09-19","arxiv_id":"2309.10537","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhance-audio-generation-controllability","title":"Enhance audio generation controllability through representation similarity regularization","date":"2023-09-15","arxiv_id":"2309.08773","repositories_listed":0,"syntology":null},{"url":"/paper/retrieval-augmented-text-to-audio-generation","slug":"retrieval-augmented-text-to-audio-generation","title":"Retrieval-Augmented Text-to-Audio Generation","date":"2023-09-14","arxiv_id":"2309.08051","repositories_listed":0,"syntology":null},{"url":null,"slug":"advances-in-machine-learning-based-sampling","title":"Advances in machine-learning-based sampling motivated by lattice quantum chromodynamics","date":"2023-09-03","arxiv_id":"2309.01156","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-generation-with-multiple-conditional","title":"Audio Generation with Multiple Conditional Diffusion Model","date":"2023-08-23","arxiv_id":"2308.11940","repositories_listed":0,"syntology":null},{"url":null,"slug":"iteratta-an-interface-for-exploring-both-text","title":"IteraTTA: An interface for exploring both text prompts and audio priors in generating music with text-to-audio models","date":"2023-07-24","arxiv_id":"2307.13005","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-demand-driven-perspective-on-generative","title":"A Demand-Driven Perspective on Generative Audio AI","date":"2023-07-10","arxiv_id":"2307.04292","repositories_listed":0,"syntology":null},{"url":null,"slug":"lm-vc-zero-shot-voice-conversion-via-speech","title":"LM-VC: Zero-shot Voice Conversion via Speech Generation based on Language Models","date":"2023-06-18","arxiv_id":"2306.10521","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffava-personalized-text-to-audio-generation","title":"DiffAVA: Personalized Text-to-Audio Generation with Visual Alignment","date":"2023-05-22","arxiv_id":"2305.12903","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-pre-trained-audioldm-for-sound","title":"Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study","date":"2023-03-07","arxiv_id":"2303.03857","repositories_listed":0,"syntology":null},{"url":null,"slug":"singsong-generating-musical-accompaniments","title":"SingSong: Generating musical accompaniments from singing","date":"2023-01-30","arxiv_id":"2301.12662","repositories_listed":0,"syntology":null},{"url":null,"slug":"superb-slt-2022-challenge-on-generalization","title":"SUPERB @ SLT 2022: Challenge on Generalization and Efficiency of Self-Supervised Speech Representation Learning","date":"2022-10-16","arxiv_id":"2210.08634","repositories_listed":0,"syntology":null},{"url":null,"slug":"system-fingerprints-detection-for-deepfake","title":"Audio Deepfake Attribution: An Initial Dataset and Investigation","date":"2022-08-21","arxiv_id":"2208.10489","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-audio-synthesis-with-complex","title":"Adversarial Audio Synthesis with Complex-valued Polynomial Networks","date":"2022-06-14","arxiv_id":"2206.06811","repositories_listed":0,"syntology":null},{"url":null,"slug":"flexlip-a-controllable-text-to-lip-system","title":"FlexLip: A Controllable Text-to-Lip System","date":"2022-06-07","arxiv_id":"2206.03206","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-target-representation-in-continuous-output","title":"On Target Representation in Continuous-output Neural Machine Translation","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"streamable-neural-audio-synthesis-with-non","title":"Streamable Neural Audio Synthesis With Non-Causal Convolutions","date":"2022-04-14","arxiv_id":"2204.07064","repositories_listed":0,"syntology":null},{"url":null,"slug":"add-2022-the-first-audio-deep-synthesis","title":"ADD 2022: the First Audio Deep Synthesis Detection Challenge","date":"2022-02-17","arxiv_id":"2202.08433","repositories_listed":0,"syntology":null},{"url":null,"slug":"soundify-matching-sound-effects-to-video","title":"Soundify: Matching Sound Effects to Video","date":"2021-12-17","arxiv_id":"2112.09726","repositories_listed":0,"syntology":null},{"url":null,"slug":"geometry-aware-multi-task-learning-for","title":"Geometry-Aware Multi-Task Learning for Binaural Audio Generation from Video","date":"2021-11-21","arxiv_id":"2111.10882","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-investigation-of-pre-upsampling-generative","title":"An investigation of pre-upsampling generative modelling and Generative Adversarial Networks in audio super resolution","date":"2021-09-30","arxiv_id":"2109.14994","repositories_listed":0,"syntology":null},{"url":null,"slug":"depth-infused-binaural-audio-generation-using","title":"Depth Infused Binaural Audio Generation using Hierarchical Cross-Modal Attention","date":"2021-08-10","arxiv_id":"2108.04906","repositories_listed":0,"syntology":null},{"url":null,"slug":"crash-raw-audio-score-based-generative","title":"CRASH: Raw Audio Score-based Generative Modeling for Controllable High-resolution Drum Sound Synthesis","date":"2021-06-14","arxiv_id":"2106.07431","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-audio-visual-consistency-with","title":"Exploiting Audio-Visual Consistency with Partial Supervision for Spatial Audio Generation","date":"2021-05-03","arxiv_id":"2105.00708","repositories_listed":0,"syntology":null},{"url":null,"slug":"visually-informed-binaural-audio-generation","title":"Visually Informed Binaural Audio Generation without Binaural Audios","date":"2021-04-13","arxiv_id":"2104.06162","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comprehensive-survey-on-deep-music","title":"A Comprehensive Survey on Deep Music Generation: Multi-level Representations, Algorithms, Evaluations, and Future Directions","date":"2020-11-13","arxiv_id":"2011.06801","repositories_listed":0,"syntology":null},{"url":null,"slug":"nu-gan-high-resolution-neural-upsampling-with","title":"NU-GAN: High resolution neural upsampling with GAN","date":"2020-10-22","arxiv_id":"2010.11362","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-dequantization-for-high-fidelity-audio","title":"Audio Dequantization for High Fidelity Audio Generation in Flow-based Neural Vocoder","date":"2020-08-16","arxiv_id":"2008.06867","repositories_listed":0,"syntology":null},{"url":null,"slug":"incremental-text-to-speech-for-neural","title":"Incremental Text to Speech for Neural Sequence-to-Sequence Models using Reinforcement Learning","date":"2020-08-07","arxiv_id":"2008.03096","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-granular-sound-synthesis","title":"Neural Granular Sound Synthesis","date":"2020-08-04","arxiv_id":"2008.01393","repositories_listed":0,"syntology":null},{"url":null,"slug":"sep-stereo-visually-guided-stereophonic-audio","title":"Sep-Stereo: Visually Guided Stereophonic Audio Generation by Associating Source Separation","date":"2020-07-20","arxiv_id":"2007.09902","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-fidelity-audio-generation-and","title":"High-Fidelity Audio Generation and Representation Learning with Guided Adversarial Autoencoder","date":"2020-06-01","arxiv_id":"2006.00877","repositories_listed":0,"syntology":null},{"url":null,"slug":"guided-generative-adversarial-neural-network","title":"Guided Generative Adversarial Neural Network for Representation Learning and High Fidelity Audio Generation using Fewer Labelled Audio Data","date":"2020-03-05","arxiv_id":"2003.02836","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-variational-inference-for","title":"Cross-modal variational inference for bijective signal-symbol translation","date":"2020-02-10","arxiv_id":"2002.03862","repositories_listed":0,"syntology":null},{"url":null,"slug":"fastwave-accelerating-autoregressive","title":"FastWave: Accelerating Autoregressive Convolutional Neural Networks on FPGA","date":"2020-02-09","arxiv_id":"2002.04971","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-neural-speech-waveform","title":"Transferring neural speech waveform synthesizers to musical instrument sounds generation","date":"2019-10-27","arxiv_id":"1910.12381","repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-upsampling-audio-synthesis-via","title":"Progressive Upsampling Audio Synthesis via Effective Adversarial Training","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"voice-command-generation-using-progressive","title":"Voice command generation using Progressive Wavegans","date":"2019-03-13","arxiv_id":"1903.07395","repositories_listed":0,"syntology":null},{"url":null,"slug":"cmcgan-a-uniform-framework-for-cross-modal","title":"CMCGAN: A Uniform Framework for Cross-Modal Visual-Audio Mutual Generation","date":"2017-11-22","arxiv_id":"1711.08102","repositories_listed":0,"syntology":null}],"record_sha256":"9cb9623ad7e658258a3d0174551539fa599423177c0785406b479d0e47a02d88","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}