{"url":"/method/wavegan","slug":"wavegan","name":"WaveGAN","full_name":"WaveGAN","full_name_withheld":false,"description_markdown":"**WaveGAN** is a generative adversarial network for unsupervised synthesis of raw-waveform audio (as opposed to image-like spectrograms). \r\n\r\nThe WaveGAN architecture is based off [DCGAN](https://paperswithcode.com/method/dcgan). The DCGAN generator uses the [transposed convolution](https://paperswithcode.com/method/transposed-convolution) operation to iteratively upsample low-resolution feature maps into a high-resolution image. WaveGAN modifies this transposed [convolution](https://paperswithcode.com/method/convolution) operation to widen its receptive field, using a longer one-dimensional filters of length 25 instead of two-dimensional filters of size 5x5, and upsampling by a factor of 4 instead of 2 at each layer. The discriminator is modified in a similar way, using length-25 filters in one dimension and increasing stride\r\nfrom 2 to 4. These changes result in WaveGAN having the same number of parameters, numerical\r\noperations, and output dimensionality as DCGAN. An additional layer is added afterwards to allow for more audio samples. Further changes include:\r\n\r\n1. Flattening 2D convolutions into 1D (e.g. 5x5 2D conv becomes length-25 1D).\r\n2. Increasing the stride factor for all convolutions (e.g. stride 2x2 becomes stride 4).\r\n3. Removing [batch normalization](https://paperswithcode.com/method/batch-normalization) from the generator and discriminator.\r\n4. Training using the [WGAN](https://paperswithcode.com/method/wgan)-GP strategy.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Adversarial Audio Synthesis","paper":"/paper/adversarial-audio-synthesis","first_author":"Chris Donahue","n_authors":3,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/adversarial-audio-synthesis"},"source":{"url":"http://arxiv.org/abs/1802.04208v3","title":"Adversarial Audio Synthesis","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Audio","area_id":"audio","collection":"Generative Audio Models","url":"/methods/category/generative-audio-models","pwc_aliases":[]}],"n_papers_tagged":30,"archive_num_papers":30,"papers_newest_first":[{"paper":null,"title":"NAIST Simultaneous Speech Translation System for IWSLT 2024","date":"2024-06-30","arxiv_id":"2407.00826","n_code_links":0,"syntology":null},{"paper":null,"title":"(Un)paired signal-to-signal translation with 1D conditional GANs","date":"2024-03-05","arxiv_id":"2403.04800","n_code_links":0,"syntology":null},{"paper":null,"title":"The Effects of Signal-to-Noise Ratio on Generative Adversarial Networks Applied to Marine Bioacoustic Data","date":"2023-12-22","arxiv_id":"2312.14806","n_code_links":0,"syntology":null},{"paper":null,"title":"Framewise WaveGAN: High Speed Adversarial Vocoder in Time Domain with Very Low Computational Complexity","date":"2022-12-08","arxiv_id":"2212.04532","n_code_links":0,"syntology":null},{"paper":"/paper/hifi-wavegan-generative-adversarial-network","title":"HiFi-WaveGAN: Generative Adversarial Network with Auxiliary Spectrogram-Phase Loss for High-Fidelity Singing Voice Generation","date":"2022-10-23","arxiv_id":"2210.12740","n_code_links":1,"syntology":null},{"paper":"/paper/wavegan-frequency-aware-gan-for-high-fidelity","title":"WaveGAN: Frequency-aware GAN for High-Fidelity Few-shot Image Generation","date":"2022-07-15","arxiv_id":"2207.07288","n_code_links":1,"syntology":{"ran":7,"of":13,"unverified":6,"pointer_only":13}},{"paper":null,"title":"WOLONet: Wave Outlooker for Efficient and High Fidelity Speech Synthesis","date":"2022-06-20","arxiv_id":"2206.09920","n_code_links":0,"syntology":null},{"paper":null,"title":"NatiQ: An End-to-end Text-to-Speech System for Arabic","date":"2022-06-15","arxiv_id":"2206.07373","n_code_links":0,"syntology":null},{"paper":null,"title":"Unified Source-Filter GAN with Harmonic-plus-Noise Source Excitation Generation","date":"2022-05-12","arxiv_id":"2205.06053","n_code_links":0,"syntology":null},{"paper":null,"title":"MSR-NV: Neural Vocoder Using Multiple Sampling Rates","date":"2021-09-28","arxiv_id":"2109.13714","n_code_links":0,"syntology":null},{"paper":null,"title":"Digital Einstein Experience: Fast Text-to-Speech for Conversational AI","date":"2021-07-21","arxiv_id":"2107.10658","n_code_links":0,"syntology":null},{"paper":"/paper/starganv2-vc-a-diverse-unsupervised-non","title":"StarGANv2-VC: A Diverse, Unsupervised, Non-parallel Framework for Natural-Sounding Voice Conversion","date":"2021-07-21","arxiv_id":"2107.10394","n_code_links":2,"syntology":{"ran":3,"of":5,"unverified":2,"pointer_only":0}},{"paper":null,"title":"Interpreting intermediate convolutional layers of generative CNNs trained on waveforms","date":"2021-04-19","arxiv_id":"2104.09489","n_code_links":0,"syntology":null},{"paper":"/paper/unified-source-filter-gan-unified-source","title":"Unified Source-Filter GAN: Unified Source-filter Network Based On Factorization of Quasi-Periodic Parallel WaveGAN","date":"2021-04-10","arxiv_id":"2104.04668","n_code_links":1,"syntology":null},{"paper":null,"title":"Adversarial Attacks and Defenses for Speech Recognition Systems","date":"2021-03-31","arxiv_id":"2103.17122","n_code_links":0,"syntology":null},{"paper":null,"title":"Improve GAN-based Neural Vocoder using Pointwise Relativistic LeastSquare GAN","date":"2021-03-26","arxiv_id":"2103.14245","n_code_links":0,"syntology":null},{"paper":"/paper/lvcnet-efficient-condition-dependent-modeling","title":"LVCNet: Efficient Condition-Dependent Modeling Network for Waveform Generation","date":"2021-02-22","arxiv_id":"2102.10815","n_code_links":5,"syntology":null},{"paper":null,"title":"Study of Pre-processing Defenses against Adversarial Attacks on State-of-the-art Speaker Recognition Systems","date":"2021-01-22","arxiv_id":"2101.08909","n_code_links":0,"syntology":null},{"paper":"/paper/synthesising-realistic-calcium-imaging-data","title":"Synthesising Realistic Calcium Imaging Data of Neuronal Populations Using GAN","date":"2021-01-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/stylemelgan-an-efficient-high-fidelity","title":"StyleMelGAN: An Efficient High-Fidelity Adversarial Vocoder with Temporal Adaptive Normalization","date":"2020-11-03","arxiv_id":"2011.01557","n_code_links":2,"syntology":{"ran":0,"of":2,"unverified":2,"pointer_only":0}},{"paper":null,"title":"Parallel waveform synthesis based on generative adversarial networks with voicing-aware conditional discriminators","date":"2020-10-27","arxiv_id":"2010.14151","n_code_links":0,"syntology":null},{"paper":null,"title":"Latent Vector Recovery of Audio GANs","date":"2020-10-16","arxiv_id":"2010.08534","n_code_links":0,"syntology":null},{"paper":"/paper/baseline-system-of-voice-conversion-challenge","title":"Baseline System of Voice Conversion Challenge 2020 with Cyclic Variational Autoencoder and Parallel WaveGAN","date":"2020-10-09","arxiv_id":"2010.04429","n_code_links":1,"syntology":null},{"paper":"/paper/calciumgan-a-generative-adversarial-network","title":"Synthesising Realistic Calcium Traces of Neuronal Populations Using GAN","date":"2020-09-06","arxiv_id":"2009.02707","n_code_links":1,"syntology":null},{"paper":"/paper/hifisinger-towards-high-fidelity-neural","title":"HiFiSinger: Towards High-Fidelity Neural Singing Voice Synthesis","date":"2020-09-03","arxiv_id":"2009.01776","n_code_links":1,"syntology":{"ran":0,"of":10,"unverified":10,"pointer_only":0}},{"paper":"/paper/vocgan-a-high-fidelity-real-time-vocoder-with","title":"VocGAN: A High-Fidelity Real-time Vocoder with a Hierarchically-nested Adversarial Network","date":"2020-07-30","arxiv_id":"2007.15256","n_code_links":2,"syntology":null},{"paper":"/paper/quasi-periodic-parallel-wavegan-a-non","title":"Quasi-Periodic Parallel WaveGAN: A Non-autoregressive Raw Waveform Generative Model with Pitch-dependent Dilated Convolution Neural Network","date":"2020-07-25","arxiv_id":"2007.12955","n_code_links":1,"syntology":null},{"paper":null,"title":"Towards Robust Neural Vocoding for Speech Generation: A Survey","date":"2019-12-05","arxiv_id":"1912.02461","n_code_links":0,"syntology":null},{"paper":"/paper/parallel-wavegan-a-fast-waveform-generation","title":"Parallel WaveGAN: A fast waveform generation model based on generative adversarial networks with multi-resolution spectrogram","date":"2019-10-25","arxiv_id":"1910.11480","n_code_links":12,"syntology":{"ran":0,"of":20,"unverified":20,"pointer_only":1}},{"paper":"/paper/adversarial-audio-synthesis","title":"Adversarial Audio Synthesis","date":"2018-02-12","arxiv_id":"1802.04208","n_code_links":22,"syntology":{"ran":2,"of":4,"unverified":2,"pointer_only":4}}],"papers_shown":30,"tasks":[{"task":"/task/text-to-speech","name":"Text to Speech","papers":9},{"task":"/task/text-to-speech-1","name":"text-to-speech","papers":9},{"task":null,"name":"Generative Adversarial Network","papers":7},{"task":"/task/speech-synthesis","name":"Speech Synthesis","papers":4},{"task":"/task/high","name":"Vocal Bursts Intensity Prediction","papers":4},{"task":"/task/image-generation","name":"Image Generation","papers":3},{"task":"/task/voice-conversion","name":"Voice Conversion","papers":3},{"task":"/task/audio-generation","name":"Audio Generation","papers":2},{"task":null,"name":"CPU","papers":2},{"task":"/task/decoder","name":"Decoder","papers":2},{"task":null,"name":"GPU","papers":2},{"task":"/task/singing-voice-synthesis","name":"Singing Voice Synthesis","papers":2},{"task":"/task/translation","name":"Translation","papers":2},{"task":"/task/adversarial-robustness","name":"Adversarial Robustness","papers":1},{"task":"/task/audio-synthesis","name":"Audio Synthesis","papers":1},{"task":"/task/automatic-speech-recognition-2","name":"Automatic Speech Recognition","papers":1},{"task":"/task/automatic-speech-recognition","name":"Automatic Speech Recognition (ASR)","papers":1},{"task":"/task/image-to-image-translation","name":"Image-to-Image Translation","papers":1},{"task":"/task/speaker-recognition","name":"Speaker Recognition","papers":1},{"task":"/task/spectral-reconstruction","name":"Spectral Reconstruction","papers":1}],"tasks_shown":20,"n_tasks":29,"usage_by_year":[{"year":"2018","papers":1},{"year":"2019","papers":2},{"year":"2020","papers":8},{"year":"2021","papers":10},{"year":"2022","papers":6},{"year":"2023","papers":1},{"year":"2024","papers":2}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/wavegan"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}