{"url":"/method/convtasnet","slug":"convtasnet","name":"ConvTasNet","full_name":"Convolutional time-domain audio separation network","full_name_withheld":false,"description_markdown":"Combines learned time-frequency representation with a masker architecture based on 1D [dilated convolution](https://paperswithcode.com/method/dilated-convolution).","description_state":"present","introduced_year":null,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":"https://arxiv.org/abs/1809.07454v3","title":"Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/asteroid-team/asteroid/blob/master/asteroid/models/conv_tasnet.py","code_snippet_url_on_a_code_host":true,"categories":[{"area":"Sequential","area_id":"sequential","collection":"Temporal Convolutions","url":"/methods/category/temporal-convolutions","pwc_aliases":[]}],"n_papers_tagged":11,"archive_num_papers":null,"papers_newest_first":[{"paper":null,"title":"Online Audio-Visual Autoregressive Speaker Extraction","date":"2025-06-02","arxiv_id":"2506.01270","n_code_links":0,"syntology":null},{"paper":null,"title":"Source Separation of Small Classical Ensembles: Challenges and Opportunities","date":"2025-05-23","arxiv_id":"2505.17823","n_code_links":0,"syntology":null},{"paper":null,"title":"Effects of Dataset Sampling Rate for Noise Cancellation through Deep Learning","date":"2024-05-30","arxiv_id":"2405.20884","n_code_links":0,"syntology":null},{"paper":"/paper/online-speaker-diarization-of-meetings-guided","title":"Online speaker diarization of meetings guided by speech separation","date":"2024-01-30","arxiv_id":"2402.00067","n_code_links":1,"syntology":null},{"paper":null,"title":"An Empirical Analysis on the Vulnerabilities of End-to-End Speech Segregation Models","date":"2022-06-20","arxiv_id":"2206.09556","n_code_links":0,"syntology":null},{"paper":"/paper/an-enhanced-conv-tasnet-model-for-speech","title":"An enhanced Conv-TasNet model for speech separation using a speaker distance-based loss function","date":"2022-05-26","arxiv_id":"2205.13657","n_code_links":1,"syntology":null},{"paper":"/paper/on-using-transformers-for-speech-separation","title":"Exploring Self-Attention Mechanisms for Speech Separation","date":"2022-02-06","arxiv_id":"2202.02884","n_code_links":1,"syntology":null},{"paper":null,"title":"Towards Listening to 10 People Simultaneously: An Efficient Permutation Invariant Training of Audio Source Separation Using Sinkhorn's Algorithm","date":"2020-10-22","arxiv_id":"2010.11871","n_code_links":0,"syntology":null},{"paper":"/paper/filterbank-design-for-end-to-end-speech","title":"Filterbank design for end-to-end speech separation","date":"2019-10-23","arxiv_id":"1910.10400","n_code_links":2,"syntology":{"ran":1,"of":8,"unverified":7,"pointer_only":0}},{"paper":null,"title":"Universal Sound Separation","date":"2019-05-08","arxiv_id":"1905.03330","n_code_links":0,"syntology":null},{"paper":"/paper/tasnet-surpassing-ideal-time-frequency","title":"Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation","date":"2018-09-20","arxiv_id":"1809.07454","n_code_links":17,"syntology":{"ran":7,"of":36,"unverified":29,"pointer_only":16}}],"papers_shown":11,"tasks":[{"task":"/task/speech-separation","name":"Speech Separation","papers":8},{"task":"/task/speech-enhancement","name":"Speech Enhancement","papers":3},{"task":"/task/action-detection","name":"Action Detection","papers":1},{"task":"/task/activity-detection","name":"Activity Detection","papers":1},{"task":"/task/audio-source-separation","name":"Audio Source Separation","papers":1},{"task":"/task/denoising","name":"Denoising","papers":1},{"task":"/task/multi-task-audio-source-seperation","name":"Multi-task Audio Source Seperation","papers":1},{"task":"/task/music-source-separation","name":"Music Source Separation","papers":1},{"task":"/task/speaker-diarization","name":"Speaker Diarization","papers":1},{"task":"/task/speaker-recognition","name":"Speaker Recognition","papers":1},{"task":"/task/speaker-separation","name":"Speaker Separation","papers":1},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":1},{"task":"/task/speaker-diarization","name":"speaker-diarization","papers":1}],"tasks_shown":13,"n_tasks":13,"usage_by_year":[{"year":"2018","papers":1},{"year":"2019","papers":2},{"year":"2020","papers":1},{"year":"2022","papers":3},{"year":"2024","papers":2},{"year":"2025","papers":2}],"row_source":"embedded","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/convtasnet"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}