{"url":"/method/wavenet","slug":"wavenet","name":"WaveNet","full_name":"WaveNet","full_name_withheld":false,"description_markdown":"**WaveNet** is an audio generative model based on the [PixelCNN](https://paperswithcode.com/method/pixelcnn) architecture. In order to deal with long-range temporal dependencies needed for raw audio generation, architectures are developed based on dilated causal convolutions, which exhibit very large receptive fields.\r\n\r\nThe joint probability of a waveform $\\vec{x} = \\{ x_1, \\dots, x_T \\}$ is factorised as a product of conditional probabilities as follows:\r\n\r\n$$p\\left(\\vec{x}\\right) = \\prod_{t=1}^{T} p\\left(x_t \\mid x_1, \\dots ,x_{t-1}\\right)$$\r\n\r\nEach audio sample $x_t$ is therefore conditioned on the samples at all previous timesteps.","description_state":"present","introduced_year":null,"introduced_by":{"title":"WaveNet: A Generative Model for Raw Audio","paper":"/paper/wavenet-a-generative-model-for-raw-audio","first_author":"Aaron van den Oord","n_authors":9,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/wavenet-a-generative-model-for-raw-audio"},"source":{"url":"http://arxiv.org/abs/1609.03499v2","title":"WaveNet: A Generative Model for Raw Audio","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Audio","area_id":"audio","collection":"Generative Audio Models","url":"/methods/category/generative-audio-models","pwc_aliases":[]}],"n_papers_tagged":171,"archive_num_papers":171,"papers_newest_first":[{"paper":null,"title":"Aliasing Reduction in Neural Amp Modeling by Smoothing Activations","date":"2025-05-07","arxiv_id":"2505.04082","n_code_links":0,"syntology":null},{"paper":"/paper/wavenet-volterra-neural-networks-for-active","title":"WaveNet-Volterra Neural Networks for Active Noise Control: A Fully Causal Approach","date":"2025-04-06","arxiv_id":"2504.04450","n_code_links":1,"syntology":null},{"paper":"/paper/an-ensemble-framework-for-probabilistic-short","title":"An Ensemble Framework for Probabilistic Short-Term Load Forecasting Based on BiTCN and Deep Attention Networks","date":"2025-02-25","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"title":"Explore the Use of Time Series Foundation Model for Car-Following Behavior Analysis","date":"2025-01-13","arxiv_id":"2501.07034","n_code_links":0,"syntology":null},{"paper":null,"title":"Autoregressive Speech Synthesis with Next-Distribution Prediction","date":"2024-12-22","arxiv_id":"2412.16846","n_code_links":0,"syntology":null},{"paper":null,"title":"SeagrassFinder: Deep Learning for Eelgrass Detection and Coverage Estimation in the Wild","date":"2024-12-20","arxiv_id":"2412.16147","n_code_links":0,"syntology":null},{"paper":null,"title":"Synthetic Time Series Data Generation for Healthcare Applications: A PCG Case Study","date":"2024-12-17","arxiv_id":"2412.16207","n_code_links":0,"syntology":null},{"paper":null,"title":"Deep Learning-Based Approach for Identification and Compensation of Nonlinear Distortions in Parametric Array Loudspeakers","date":"2024-12-02","arxiv_id":"2412.01092","n_code_links":0,"syntology":null},{"paper":null,"title":"Islanding Detection for Active Distribution Networks Using WaveNet+UNet Classifier","date":"2024-10-17","arxiv_id":"2410.13926","n_code_links":0,"syntology":null},{"paper":"/paper/rf-challenge-the-data-driven-radio-frequency","title":"RF Challenge: The Data-Driven Radio Frequency Signal Separation Challenge","date":"2024-09-13","arxiv_id":"2409.08839","n_code_links":1,"syntology":null},{"paper":null,"title":"InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself","date":"2024-09-10","arxiv_id":"2409.06330","n_code_links":0,"syntology":null},{"paper":null,"title":"Leveraging WaveNet for Dynamic Listening Head Modeling from Speech","date":"2024-09-08","arxiv_id":"2409.05089","n_code_links":0,"syntology":null},{"paper":null,"title":"Training Universal Vocoders with Feature Smoothing-Based Augmentation Methods for High-Quality TTS Systems","date":"2024-09-04","arxiv_id":"2409.02517","n_code_links":0,"syntology":null},{"paper":"/paper/synthesizing-audio-from-silent-video-using","title":"Synthesizing Audio from Silent Video using Sequence to Sequence Modeling","date":"2024-04-25","arxiv_id":"2404.17608","n_code_links":1,"syntology":null},{"paper":"/paper/foundational-gpt-model-for-meg","title":"Foundational GPT Model for MEG","date":"2024-04-14","arxiv_id":"2404.09256","n_code_links":1,"syntology":null},{"paper":null,"title":"A Novel Approach to WaveNet Architecture for RF Signal Separation with Learnable Dilation and Data Augmentation","date":"2024-02-08","arxiv_id":"2402.09461","n_code_links":0,"syntology":null},{"paper":null,"title":"Forecasting VIX using Bayesian Deep Learning","date":"2024-01-30","arxiv_id":"2401.17042","n_code_links":0,"syntology":null},{"paper":null,"title":"An overview of text-to-speech systems and media applications","date":"2023-10-22","arxiv_id":"2310.14301","n_code_links":0,"syntology":null},{"paper":null,"title":"Energy-Based Models For Speech Synthesis","date":"2023-10-19","arxiv_id":"2310.12765","n_code_links":0,"syntology":null},{"paper":"/paper/wavenet-wave-aware-image-enhancement","title":"WaveNet: Wave-Aware Image Enhancement","date":"2023-10-10","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/an-initial-exploration-learning-to-generate","title":"An Initial Exploration: Learning to Generate Realistic Audio for Silent Video","date":"2023-08-23","arxiv_id":"2308.12408","n_code_links":1,"syntology":null},{"paper":"/paper/learning-minimal-representations-of","title":"Learning minimal representations of stochastic processes with variational autoencoders","date":"2023-07-21","arxiv_id":"2307.11608","n_code_links":1,"syntology":null},{"paper":null,"title":"Speaker-independent neural formant synthesis","date":"2023-06-02","arxiv_id":"2306.01957","n_code_links":0,"syntology":null},{"paper":"/paper/multilingual-text-to-speech-synthesis-for","title":"Multilingual Text-to-Speech Synthesis for Turkic Languages Using Transliteration","date":"2023-05-25","arxiv_id":"2305.15749","n_code_links":1,"syntology":null},{"paper":"/paper/traffic-forecasting-on-new-roads-unseen-in","title":"Traffic Forecasting on New Roads Using Spatial Contrastive Pre-Training (SCPT)","date":"2023-05-09","arxiv_id":"2305.05237","n_code_links":1,"syntology":null},{"paper":null,"title":"ArmanTTS single-speaker Persian dataset","date":"2023-04-07","arxiv_id":"2304.03585","n_code_links":0,"syntology":null},{"paper":"/paper/because-every-sensor-is-unique-so-is-every","title":"Because Every Sensor Is Unique, so Is Every Pair: Handling Dynamicity in Traffic Forecasting","date":"2023-02-20","arxiv_id":"2302.09956","n_code_links":1,"syntology":null},{"paper":null,"title":"Extreme Audio Time Stretching Using Neural Synthesis","date":"2022-11-30","arxiv_id":"2211.16992","n_code_links":0,"syntology":null},{"paper":"/paper/wavenets-wavelet-channel-attention-networks","title":"WaveNets: Wavelet Channel Attention Networks","date":"2022-11-04","arxiv_id":"2211.02695","n_code_links":1,"syntology":null},{"paper":"/paper/clarinet-a-music-retrieval-system","title":"Clarinet: A Music Retrieval System","date":"2022-10-23","arxiv_id":"2210.12648","n_code_links":1,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/speech-synthesis","name":"Speech Synthesis","papers":54},{"task":"/task/text-to-speech","name":"Text to Speech","papers":51},{"task":"/task/text-to-speech-1","name":"text-to-speech","papers":51},{"task":"/task/decoder","name":"Decoder","papers":18},{"task":"/task/text-to-speech-synthesis","name":"Text-To-Speech Synthesis","papers":16},{"task":"/task/voice-conversion","name":"Voice Conversion","papers":12},{"task":"/task/audio-synthesis","name":"Audio Synthesis","papers":10},{"task":"/task/audio-generation","name":"Audio Generation","papers":8},{"task":null,"name":"GPU","papers":8},{"task":"/task/time-series-1","name":"Time Series","papers":7},{"task":"/task/deep-learning","name":"Deep Learning","papers":6},{"task":"/task/speech-enhancement","name":"Speech Enhancement","papers":6},{"task":null,"name":"Generative Adversarial Network","papers":5},{"task":"/task/speech-recognition","name":"Speech Recognition","papers":5},{"task":"/task/time-series","name":"Time Series Analysis","papers":5},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":5},{"task":"/task/translation","name":"Translation","papers":5},{"task":null,"name":"CPU","papers":4},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":4},{"task":"/task/graph-neural-network","name":"Graph Neural Network","papers":4}],"tasks_shown":20,"n_tasks":121,"usage_by_year":[{"year":"2016","papers":2},{"year":"2017","papers":10},{"year":"2018","papers":26},{"year":"2019","papers":38},{"year":"2020","papers":32},{"year":"2021","papers":24},{"year":"2022","papers":12},{"year":"2023","papers":10},{"year":"2024","papers":13},{"year":"2025","papers":4}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/wavenet"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}