{"url":"/method/phase-shuffle","slug":"phase-shuffle","name":"Phase Shuffle","full_name":"Phase Shuffle","full_name_withheld":false,"description_markdown":"**Phase Shuffle** is a technique for removing pitched noise artifacts that come from using transposed convolutions in audio generation models. Phase shuffle is an operation with hyperparameter $n$. It randomly perturbs the phase of each layer’s activations by −$n$ to $n$ samples before input to the next layer.\r\n\r\nIn the original application in [WaveGAN](https://paperswithcode.com/method/wavegan), the authors only apply phase shuffle to the discriminator, as the latent vector already provides the generator a mechanism to manipulate the phase\r\nof a resultant waveform. Intuitively speaking, phase shuffle makes the discriminator’s job more challenging by requiring invariance to the phase of the input waveform.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Adversarial Audio Synthesis","paper":"/paper/adversarial-audio-synthesis","first_author":"Chris Donahue","n_authors":3,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/adversarial-audio-synthesis"},"source":{"url":"http://arxiv.org/abs/1802.04208v3","title":"Adversarial Audio Synthesis","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Audio","area_id":"audio","collection":"Audio Artifact Removal","url":"/methods/category/audio-artifact-removal","pwc_aliases":[]}],"n_papers_tagged":30,"archive_num_papers":30,"papers_newest_first":[{"paper":null,"title":"NAIST Simultaneous Speech Translation System for IWSLT 2024","date":"2024-06-30","arxiv_id":"2407.00826","n_code_links":0,"syntology":null},{"paper":null,"title":"(Un)paired signal-to-signal translation with 1D conditional GANs","date":"2024-03-05","arxiv_id":"2403.04800","n_code_links":0,"syntology":null},{"paper":null,"title":"The Effects of Signal-to-Noise Ratio on Generative Adversarial Networks Applied to Marine Bioacoustic Data","date":"2023-12-22","arxiv_id":"2312.14806","n_code_links":0,"syntology":null},{"paper":null,"title":"Framewise WaveGAN: High Speed Adversarial Vocoder in Time Domain with Very Low Computational Complexity","date":"2022-12-08","arxiv_id":"2212.04532","n_code_links":0,"syntology":null},{"paper":"/paper/hifi-wavegan-generative-adversarial-network","title":"HiFi-WaveGAN: Generative Adversarial Network with Auxiliary Spectrogram-Phase Loss for High-Fidelity Singing Voice Generation","date":"2022-10-23","arxiv_id":"2210.12740","n_code_links":1,"syntology":null},{"paper":"/paper/wavegan-frequency-aware-gan-for-high-fidelity","title":"WaveGAN: Frequency-aware GAN for High-Fidelity Few-shot Image Generation","date":"2022-07-15","arxiv_id":"2207.07288","n_code_links":1,"syntology":{"ran":7,"of":13,"unverified":6,"pointer_only":13}},{"paper":null,"title":"WOLONet: Wave Outlooker for Efficient and High Fidelity Speech Synthesis","date":"2022-06-20","arxiv_id":"2206.09920","n_code_links":0,"syntology":null},{"paper":null,"title":"NatiQ: An End-to-end Text-to-Speech System for Arabic","date":"2022-06-15","arxiv_id":"2206.07373","n_code_links":0,"syntology":null},{"paper":null,"title":"Unified Source-Filter GAN with Harmonic-plus-Noise Source Excitation Generation","date":"2022-05-12","arxiv_id":"2205.06053","n_code_links":0,"syntology":null},{"paper":null,"title":"MSR-NV: Neural Vocoder Using Multiple Sampling Rates","date":"2021-09-28","arxiv_id":"2109.13714","n_code_links":0,"syntology":null},{"paper":null,"title":"Digital Einstein Experience: Fast Text-to-Speech for Conversational AI","date":"2021-07-21","arxiv_id":"2107.10658","n_code_links":0,"syntology":null},{"paper":"/paper/starganv2-vc-a-diverse-unsupervised-non","title":"StarGANv2-VC: A Diverse, Unsupervised, Non-parallel Framework for Natural-Sounding Voice Conversion","date":"2021-07-21","arxiv_id":"2107.10394","n_code_links":2,"syntology":{"ran":3,"of":5,"unverified":2,"pointer_only":0}},{"paper":null,"title":"Interpreting intermediate convolutional layers of generative CNNs trained on waveforms","date":"2021-04-19","arxiv_id":"2104.09489","n_code_links":0,"syntology":null},{"paper":"/paper/unified-source-filter-gan-unified-source","title":"Unified Source-Filter GAN: Unified Source-filter Network Based On Factorization of Quasi-Periodic Parallel WaveGAN","date":"2021-04-10","arxiv_id":"2104.04668","n_code_links":1,"syntology":null},{"paper":null,"title":"Adversarial Attacks and Defenses for Speech Recognition Systems","date":"2021-03-31","arxiv_id":"2103.17122","n_code_links":0,"syntology":null},{"paper":null,"title":"Improve GAN-based Neural Vocoder using Pointwise Relativistic LeastSquare GAN","date":"2021-03-26","arxiv_id":"2103.14245","n_code_links":0,"syntology":null},{"paper":"/paper/lvcnet-efficient-condition-dependent-modeling","title":"LVCNet: Efficient Condition-Dependent Modeling Network for Waveform Generation","date":"2021-02-22","arxiv_id":"2102.10815","n_code_links":5,"syntology":null},{"paper":null,"title":"Study of Pre-processing Defenses against Adversarial Attacks on State-of-the-art Speaker Recognition Systems","date":"2021-01-22","arxiv_id":"2101.08909","n_code_links":0,"syntology":null},{"paper":"/paper/synthesising-realistic-calcium-imaging-data","title":"Synthesising Realistic Calcium Imaging Data of Neuronal Populations Using GAN","date":"2021-01-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/stylemelgan-an-efficient-high-fidelity","title":"StyleMelGAN: An Efficient High-Fidelity Adversarial Vocoder with Temporal Adaptive Normalization","date":"2020-11-03","arxiv_id":"2011.01557","n_code_links":2,"syntology":{"ran":0,"of":2,"unverified":2,"pointer_only":0}},{"paper":null,"title":"Parallel waveform synthesis based on generative adversarial networks with voicing-aware conditional discriminators","date":"2020-10-27","arxiv_id":"2010.14151","n_code_links":0,"syntology":null},{"paper":null,"title":"Latent Vector Recovery of Audio GANs","date":"2020-10-16","arxiv_id":"2010.08534","n_code_links":0,"syntology":null},{"paper":"/paper/baseline-system-of-voice-conversion-challenge","title":"Baseline System of Voice Conversion Challenge 2020 with Cyclic Variational Autoencoder and Parallel WaveGAN","date":"2020-10-09","arxiv_id":"2010.04429","n_code_links":1,"syntology":null},{"paper":"/paper/calciumgan-a-generative-adversarial-network","title":"Synthesising Realistic Calcium Traces of Neuronal Populations Using GAN","date":"2020-09-06","arxiv_id":"2009.02707","n_code_links":1,"syntology":null},{"paper":"/paper/hifisinger-towards-high-fidelity-neural","title":"HiFiSinger: Towards High-Fidelity Neural Singing Voice Synthesis","date":"2020-09-03","arxiv_id":"2009.01776","n_code_links":1,"syntology":{"ran":0,"of":10,"unverified":10,"pointer_only":0}},{"paper":"/paper/vocgan-a-high-fidelity-real-time-vocoder-with","title":"VocGAN: A High-Fidelity Real-time Vocoder with a Hierarchically-nested Adversarial Network","date":"2020-07-30","arxiv_id":"2007.15256","n_code_links":2,"syntology":null},{"paper":"/paper/quasi-periodic-parallel-wavegan-a-non","title":"Quasi-Periodic Parallel WaveGAN: A Non-autoregressive Raw Waveform Generative Model with Pitch-dependent Dilated Convolution Neural Network","date":"2020-07-25","arxiv_id":"2007.12955","n_code_links":1,"syntology":null},{"paper":null,"title":"Towards Robust Neural Vocoding for Speech Generation: A Survey","date":"2019-12-05","arxiv_id":"1912.02461","n_code_links":0,"syntology":null},{"paper":"/paper/parallel-wavegan-a-fast-waveform-generation","title":"Parallel WaveGAN: A fast waveform generation model based on generative adversarial networks with multi-resolution spectrogram","date":"2019-10-25","arxiv_id":"1910.11480","n_code_links":12,"syntology":{"ran":0,"of":20,"unverified":20,"pointer_only":1}},{"paper":"/paper/adversarial-audio-synthesis","title":"Adversarial Audio Synthesis","date":"2018-02-12","arxiv_id":"1802.04208","n_code_links":22,"syntology":{"ran":2,"of":4,"unverified":2,"pointer_only":4}}],"papers_shown":30,"tasks":[{"task":"/task/text-to-speech","name":"Text to Speech","papers":9},{"task":"/task/text-to-speech-1","name":"text-to-speech","papers":9},{"task":null,"name":"Generative Adversarial Network","papers":7},{"task":"/task/speech-synthesis","name":"Speech Synthesis","papers":4},{"task":"/task/high","name":"Vocal Bursts Intensity Prediction","papers":4},{"task":"/task/image-generation","name":"Image Generation","papers":3},{"task":"/task/voice-conversion","name":"Voice Conversion","papers":3},{"task":"/task/audio-generation","name":"Audio Generation","papers":2},{"task":null,"name":"CPU","papers":2},{"task":"/task/decoder","name":"Decoder","papers":2},{"task":null,"name":"GPU","papers":2},{"task":"/task/singing-voice-synthesis","name":"Singing Voice Synthesis","papers":2},{"task":"/task/translation","name":"Translation","papers":2},{"task":"/task/adversarial-robustness","name":"Adversarial Robustness","papers":1},{"task":"/task/audio-synthesis","name":"Audio Synthesis","papers":1},{"task":"/task/automatic-speech-recognition-2","name":"Automatic Speech Recognition","papers":1},{"task":"/task/automatic-speech-recognition","name":"Automatic Speech Recognition (ASR)","papers":1},{"task":"/task/image-to-image-translation","name":"Image-to-Image Translation","papers":1},{"task":"/task/speaker-recognition","name":"Speaker Recognition","papers":1},{"task":"/task/spectral-reconstruction","name":"Spectral Reconstruction","papers":1}],"tasks_shown":20,"n_tasks":29,"usage_by_year":[{"year":"2018","papers":1},{"year":"2019","papers":2},{"year":"2020","papers":8},{"year":"2021","papers":10},{"year":"2022","papers":6},{"year":"2023","papers":1},{"year":"2024","papers":2}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/phase-shuffle"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}