{"url":"/method/hifi-gan","slug":"hifi-gan","name":"HiFi-GAN","full_name":"HiFi-GAN","full_name_withheld":false,"description_markdown":"**HiFi-GAN** is a generative adversarial network for speech synthesis. HiFi-GAN consists of one generator and two discriminators: multi-scale and multi-period discriminators. The generator and discriminators are trained adversarially, along with two additional losses for improving training stability and model performance.\r\n\r\nThe generator is a fully convolutional neural network. It uses a mel-spectrogram as input and upsamples it through transposed convolutions until the length of the output sequence matches the temporal resolution of raw waveforms. Every [transposed convolution](https://paperswithcode.com/method/transposed-convolution) is followed by a multi-receptive field fusion (MRF) module.\r\n\r\nFor the discriminator, a multi-period discriminator (MPD) is used consisting of several sub-discriminators each handling a portion of periodic signals of input audio. Additionally, to capture consecutive patterns and long-term dependencies, the multi-scale discriminator (MSD) proposed in [MelGAN](https://paperswithcode.com/method/melgan) is used, which consecutively evaluates audio samples at different levels.","description_state":"present","introduced_year":null,"introduced_by":{"title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis","paper":"/paper/hifi-gan-generative-adversarial-networks-for","first_author":"Jungil Kong","n_authors":3,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/hifi-gan-generative-adversarial-networks-for"},"source":{"url":"https://arxiv.org/abs/2010.05646v2","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Generative Adversarial Networks","url":"/methods/category/generative-adversarial-networks","pwc_aliases":[]},{"area":"Audio","area_id":"audio","collection":"Generative Audio Models","url":"/methods/category/generative-audio-models","pwc_aliases":[]}],"n_papers_tagged":33,"archive_num_papers":33,"papers_newest_first":[{"paper":"/paper/ringformer-a-neural-vocoder-with-ring","title":"RingFormer: A Neural Vocoder with Ring Attention and Convolution-Augmented Transformer","date":"2025-01-02","arxiv_id":"2501.01182","n_code_links":1,"syntology":null},{"paper":null,"title":"A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction","date":"2024-12-11","arxiv_id":"2412.08312","n_code_links":0,"syntology":null},{"paper":"/paper/tselm-target-speaker-extraction-using","title":"TSELM: Target Speaker Extraction using Discrete Tokens and Language Models","date":"2024-09-12","arxiv_id":"2409.07841","n_code_links":1,"syntology":null},{"paper":null,"title":"DSP-informed bandwidth extension using locally-conditioned excitation and linear time-varying filter subnetworks","date":"2024-07-22","arxiv_id":"2407.15624","n_code_links":0,"syntology":null},{"paper":"/paper/streamspeech-simultaneous-speech-to-speech","title":"StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning","date":"2024-06-05","arxiv_id":"2406.03049","n_code_links":1,"syntology":{"ran":4,"of":4,"unverified":0,"pointer_only":0}},{"paper":"/paper/covomix-advancing-zero-shot-speech-generation","title":"CoVoMix: Advancing Zero-Shot Speech Generation for Human-like Multi-talker Conversations","date":"2024-04-10","arxiv_id":"2404.06690","n_code_links":1,"syntology":null},{"paper":null,"title":"SpecDiff-GAN: A Spectrally-Shaped Noise Diffusion GAN for Speech and Music Synthesis","date":"2024-01-30","arxiv_id":"2402.01753","n_code_links":0,"syntology":null},{"paper":null,"title":"UNIT-DSR: Dysarthric Speech Reconstruction System Using Speech Unit Normalization","date":"2024-01-26","arxiv_id":"2401.14664","n_code_links":0,"syntology":null},{"paper":null,"title":"Scaling NVIDIA's Multi-speaker Multi-lingual TTS Systems with Zero-Shot TTS to Indic Languages","date":"2024-01-24","arxiv_id":"2401.13851","n_code_links":0,"syntology":null},{"paper":null,"title":"SELM: Speech Enhancement Using Discrete Tokens and Language Models","date":"2023-12-15","arxiv_id":"2312.09747","n_code_links":0,"syntology":null},{"paper":"/paper/apnet2-high-quality-and-high-efficiency","title":"APNet2: High-quality and High-efficiency Neural Vocoder with Direct Prediction of Amplitude and Phase Spectra","date":"2023-11-20","arxiv_id":"2311.11545","n_code_links":1,"syntology":null},{"paper":null,"title":"Collaborative Watermarking for Adversarial Speech Synthesis","date":"2023-09-26","arxiv_id":"2309.15224","n_code_links":0,"syntology":null},{"paper":"/paper/hiftnet-a-fast-high-quality-neural-vocoder","title":"HiFTNet: A Fast High-Quality Neural Vocoder with Harmonic-plus-Noise Filter and Inverse Short Time Fourier Transform","date":"2023-09-18","arxiv_id":"2309.09493","n_code_links":1,"syntology":null},{"paper":null,"title":"Rep2wav: Noise Robust text-to-speech Using self-supervised representations","date":"2023-08-28","arxiv_id":"2308.14553","n_code_links":0,"syntology":null},{"paper":"/paper/musicldm-enhancing-novelty-in-text-to-music","title":"MusicLDM: Enhancing Novelty in Text-to-Music Generation Using Beat-Synchronous Mixup Strategies","date":"2023-08-03","arxiv_id":"2308.01546","n_code_links":1,"syntology":{"ran":9,"of":14,"unverified":5,"pointer_only":14}},{"paper":null,"title":"Speaker-independent neural formant synthesis","date":"2023-06-02","arxiv_id":"2306.01957","n_code_links":0,"syntology":null},{"paper":"/paper/source-filter-based-generative-adversarial","title":"Source-Filter-Based Generative Adversarial Neural Vocoder for High Fidelity Speech Synthesis","date":"2023-04-26","arxiv_id":"2304.13270","n_code_links":1,"syntology":null},{"paper":null,"title":"Wave-U-Net Discriminator: Fast and Lightweight Discriminator for Generative Adversarial Network-Based Speech Synthesis","date":"2023-03-24","arxiv_id":"2303.13909","n_code_links":0,"syntology":null},{"paper":null,"title":"Self-Supervised Representations for Singing Voice Conversion","date":"2023-03-21","arxiv_id":"2303.12197","n_code_links":0,"syntology":null},{"paper":null,"title":"Fast and small footprint Hybrid HMM-HiFiGAN based system for speech synthesis in Indian languages","date":"2023-02-13","arxiv_id":"2302.06227","n_code_links":0,"syntology":null},{"paper":"/paper/mntts2-an-open-source-multi-speaker-mongolian","title":"MnTTS2: An Open-Source Multi-Speaker Mongolian Text-to-Speech Synthesis Dataset","date":"2022-12-11","arxiv_id":"2301.00657","n_code_links":1,"syntology":null},{"paper":"/paper/hiding-speaker-s-sex-in-speech-using-zero","title":"Hiding speaker's sex in speech using zero-evidence speaker representation in an analysis/synthesis pipeline","date":"2022-11-29","arxiv_id":"2211.16065","n_code_links":1,"syntology":null},{"paper":"/paper/towards-building-text-to-speech-systems-for","title":"Towards Building Text-To-Speech Systems for the Next Billion Users","date":"2022-11-17","arxiv_id":"2211.09536","n_code_links":2,"syntology":{"ran":0,"of":1,"unverified":1,"pointer_only":0}},{"paper":null,"title":"Source-Filter HiFi-GAN: Fast and Pitch Controllable High-Fidelity Neural Vocoder","date":"2022-10-27","arxiv_id":"2210.15533","n_code_links":0,"syntology":null},{"paper":"/paper/mntts-an-open-source-mongolian-text-to-speech","title":"MnTTS: An Open-Source Mongolian Text-to-Speech Synthesis Dataset and Accompanied Baseline","date":"2022-09-22","arxiv_id":"2209.10848","n_code_links":1,"syntology":null},{"paper":null,"title":"Mandarin Singing Voice Synthesis with Denoising Diffusion Probabilistic Wasserstein GAN","date":"2022-09-21","arxiv_id":"2209.10446","n_code_links":0,"syntology":null},{"paper":"/paper/jets-jointly-training-fastspeech2-and-hifi","title":"JETS: Jointly Training FastSpeech2 and HiFi-GAN for End to End Text to Speech","date":"2022-03-31","arxiv_id":"2203.16852","n_code_links":2,"syntology":{"ran":0,"of":2,"unverified":2,"pointer_only":0}},{"paper":null,"title":"Disentangleing Content and Fine-grained Prosody Information via Hybrid ASR Bottleneck Features for Voice Conversion","date":"2022-03-24","arxiv_id":"2203.12813","n_code_links":0,"syntology":null},{"paper":"/paper/ecapa-tdnn-for-multi-speaker-text-to-speech","title":"ECAPA-TDNN for Multi-speaker Text-to-speech Synthesis","date":"2022-03-20","arxiv_id":"2203.10473","n_code_links":1,"syntology":null},{"paper":"/paper/istftnet-fast-and-lightweight-mel-spectrogram","title":"iSTFTNet: Fast and Lightweight Mel-Spectrogram Vocoder Incorporating Inverse Short-Time Fourier Transform","date":"2022-03-04","arxiv_id":"2203.02395","n_code_links":2,"syntology":{"ran":8,"of":11,"unverified":3,"pointer_only":0}}],"papers_shown":30,"tasks":[{"task":"/task/speech-synthesis","name":"Speech Synthesis","papers":16},{"task":"/task/text-to-speech","name":"Text to Speech","papers":13},{"task":"/task/text-to-speech-1","name":"text-to-speech","papers":13},{"task":"/task/text-to-speech-synthesis","name":"Text-To-Speech Synthesis","papers":7},{"task":"/task/voice-conversion","name":"Voice Conversion","papers":6},{"task":null,"name":"Generative Adversarial Network","papers":5},{"task":"/task/audio-generation","name":"Audio Generation","papers":3},{"task":"/task/decoder","name":"Decoder","papers":3},{"task":"/task/automatic-speech-recognition","name":"Automatic Speech Recognition (ASR)","papers":2},{"task":null,"name":"CPU","papers":2},{"task":"/task/self-supervised-learning","name":"Self-Supervised Learning","papers":2},{"task":"/task/speaker-verification","name":"Speaker Verification","papers":2},{"task":"/task/speech-enhancement","name":"Speech Enhancement","papers":2},{"task":"/task/speech-recognition","name":"Speech Recognition","papers":2},{"task":"/task/voice-cloning","name":"Voice Cloning","papers":2},{"task":"/task/speech-recognition-1","name":"speech-recognition","papers":2},{"task":"/task/automatic-speech-recognition-2","name":"Automatic Speech Recognition","papers":1},{"task":"/task/bandwidth-extension","name":"Bandwidth Extension","papers":1},{"task":"/task/beat-tracking","name":"Beat Tracking","papers":1},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":1}],"tasks_shown":20,"n_tasks":61,"usage_by_year":[{"year":"2020","papers":1},{"year":"2021","papers":2},{"year":"2022","papers":10},{"year":"2023","papers":11},{"year":"2024","papers":8},{"year":"2025","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/hifi-gan"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}