{"url":"/task/speech-separation","name":"Speech Separation","slug":"speech-separation","description_markdown":"The task of extracting all overlapping speech sources in a given mixed speech signal refers to the **Speech Separation**. Speech Separation is a special scenario of source separation problem, where the focus is only on the overlapping speech signal sources and other interferences such as music or noise signals are not the main concern of the study. A recent representative Github project can be referred to [ClearerVoice-Studio](https://github.com/modelscope/ClearerVoice-Studio).\r\n\r\n\r\n<span class=\"description-source\">Source: [A Unified Framework for Speech Separation ](https://arxiv.org/abs/1912.07814)</span>\r\n\r\nImage credit: [Speech Separation of A Target Speaker Based on Deep Neural Networks](http://staff.ustc.edu.cn/~jundu/Publications/publications/ICSP2014_Du.pdf)","categories":[{"name":"Speech","url":"/area/speech"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":359,"papers_with_code":120,"benchmarks":19,"benchmark_tables_in_archive":19,"benchmark_tables_shown":19,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":16,"subtasks":1,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/speech-separation-on-wsj0-2mix","slug":"speech-separation-on-wsj0-2mix","dataset":"WSJ0-2mix","dataset_url":"/dataset/wsj0-2mix-1","rows_in_archive":40,"metrics":["SI-SDRi","SDRi","Number of parameters (M)","MACs (G)"],"first_row_in_archive_order":{"model":"TF-Locoformer (L) + DM","paper_title":"TF-Locoformer: Transformer with Local Modeling by Convolution for Speech Separation and Enhancement","paper_url":"/paper/tf-locoformer-transformer-with-local-modeling","paper_date":"2024-08-06","arxiv_id":"2408.03440","code_links":[{"title":"merlresearch/tf-locoformer","url":"https://github.com/merlresearch/tf-locoformer"}],"syntology":null}},{"leaderboard":"/sota/speech-separation-on-whamr","slug":"speech-separation-on-whamr","dataset":"WHAMR!","dataset_url":"/dataset/whamr","rows_in_archive":18,"metrics":["SI-SDRi","MACs (G)","Number of parameters (M)","SDRi"],"first_row_in_archive_order":{"model":"TF-Locoformer (M)","paper_title":"TF-Locoformer: Transformer with Local Modeling by Convolution for Speech Separation and Enhancement","paper_url":"/paper/tf-locoformer-transformer-with-local-modeling","paper_date":"2024-08-06","arxiv_id":"2408.03440","code_links":[{"title":"merlresearch/tf-locoformer","url":"https://github.com/merlresearch/tf-locoformer"}],"syntology":null}},{"leaderboard":"/sota/speech-separation-on-libri2mix","slug":"speech-separation-on-libri2mix","dataset":"Libri2Mix","dataset_url":"/dataset/librimix","rows_in_archive":10,"metrics":["SI-SDRi","SDRi","Number of parameters (M)","SDR"],"first_row_in_archive_order":{"model":"MossFormer2 (w speed perturb)","paper_title":"MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation","paper_url":"/paper/mossformer2-combining-transformer-and-rnn-1","paper_date":"2023-12-19","arxiv_id":"2312.11825","code_links":[{"title":"modelscope/ClearerVoice-Studio","url":"https://github.com/modelscope/ClearerVoice-Studio"},{"title":"alibabasglab/MossFormer2","url":"https://github.com/alibabasglab/MossFormer2"}],"syntology":{"n":4,"n_ran":4,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/speech-separation-on-wsj0-3mix","slug":"speech-separation-on-wsj0-3mix","dataset":"WSJ0-3mix","dataset_url":null,"rows_in_archive":9,"metrics":["SI-SDRi"],"first_row_in_archive_order":{"model":"SepTDA","paper_title":"Boosting Unknown-number Speaker Separation with Transformer Decoder-based Attractor","paper_url":"/paper/boosting-unknown-number-speaker-separation","paper_date":"2024-01-23","arxiv_id":"2401.12473","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-separation-on-lrs2","slug":"speech-separation-on-lrs2","dataset":"LRS2","dataset_url":"/dataset/lrs2","rows_in_archive":8,"metrics":["SI-SNRi","SDRi","PESQ","STOI"],"first_row_in_archive_order":{"model":"IIANet","paper_title":"IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation","paper_url":"/paper/scanet-a-self-and-cross-attention-network-for","paper_date":"2023-08-16","arxiv_id":"2308.08143","code_links":[{"title":"JusperLee/IIANet","url":"https://github.com/JusperLee/IIANet"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/speech-separation-on-wham","slug":"speech-separation-on-wham","dataset":"WHAM!","dataset_url":"/dataset/wham","rows_in_archive":6,"metrics":["SI-SDRi"],"first_row_in_archive_order":{"model":"SepReformer-L + DM","paper_title":"Separate and Reconstruct: Asymmetric Encoder-Decoder for Speech Separation","paper_url":"/paper/separate-and-reconstruct-asymmetric-encoder","paper_date":"2024-06-10","arxiv_id":"2406.05983","code_links":[{"title":"dmlguq456/SepReformer","url":"https://github.com/dmlguq456/SepReformer"}],"syntology":null}},{"leaderboard":"/sota/speech-separation-on-wsj0-5mix","slug":"speech-separation-on-wsj0-5mix","dataset":"WSJ0-5mix","dataset_url":null,"rows_in_archive":6,"metrics":["SI-SDRi"],"first_row_in_archive_order":{"model":"SepTDA","paper_title":"Boosting Unknown-number Speaker Separation with Transformer Decoder-based Attractor","paper_url":"/paper/boosting-unknown-number-speaker-separation","paper_date":"2024-01-23","arxiv_id":"2401.12473","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-separation-on-lrs3","slug":"speech-separation-on-lrs3","dataset":"LRS3","dataset_url":null,"rows_in_archive":5,"metrics":["SI-SNRi","SDRi"],"first_row_in_archive_order":{"model":"IIANet","paper_title":"IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation","paper_url":"/paper/scanet-a-self-and-cross-attention-network-for","paper_date":"2023-08-16","arxiv_id":"2308.08143","code_links":[{"title":"JusperLee/IIANet","url":"https://github.com/JusperLee/IIANet"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/speech-separation-on-voxceleb2","slug":"speech-separation-on-voxceleb2","dataset":"VoxCeleb2","dataset_url":"/dataset/voxceleb2","rows_in_archive":5,"metrics":["SI-SNRi","SDRi"],"first_row_in_archive_order":{"model":"IIANet","paper_title":"IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation","paper_url":"/paper/scanet-a-self-and-cross-attention-network-for","paper_date":"2023-08-16","arxiv_id":"2308.08143","code_links":[{"title":"JusperLee/IIANet","url":"https://github.com/JusperLee/IIANet"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/speech-separation-on-wsj0-4mix","slug":"speech-separation-on-wsj0-4mix","dataset":"WSJ0-4mix","dataset_url":null,"rows_in_archive":5,"metrics":["SI-SDRi"],"first_row_in_archive_order":{"model":"SepTDA","paper_title":"Boosting Unknown-number Speaker Separation with Transformer Decoder-based Attractor","paper_url":"/paper/boosting-unknown-number-speaker-separation","paper_date":"2024-01-23","arxiv_id":"2401.12473","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-separation-on-libri5mix","slug":"speech-separation-on-libri5mix","dataset":"Libri5Mix","dataset_url":null,"rows_in_archive":4,"metrics":["SI-SDRi"],"first_row_in_archive_order":{"model":"Separate And Diffuse","paper_title":"Separate And Diffuse: Using a Pretrained Diffusion Model for Improving Source Separation","paper_url":"/paper/separate-and-diffuse-using-a-pretrained","paper_date":"2023-01-25","arxiv_id":"2301.10752","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-separation-on-libri10mix","slug":"speech-separation-on-libri10mix","dataset":"Libri10Mix","dataset_url":null,"rows_in_archive":3,"metrics":["SI-SDRi"],"first_row_in_archive_order":{"model":"Separate And Diffuse","paper_title":"Separate And Diffuse: Using a Pretrained Diffusion Model for Improving Source Separation","paper_url":"/paper/separate-and-diffuse-using-a-pretrained","paper_date":"2023-01-25","arxiv_id":"2301.10752","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-separation-on-grid-corpus-mixed-speech","slug":"speech-separation-on-grid-corpus-mixed-speech","dataset":"GRID corpus (mixed-speech)","dataset_url":"/dataset/grid","rows_in_archive":2,"metrics":["SDR"],"first_row_in_archive_order":{"model":null,"paper_title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","paper_url":"/paper/midi-multi-instance-diffusion-for-single","paper_date":"2024-12-04","arxiv_id":"2412.03558","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-separation-on-libri20mix","slug":"speech-separation-on-libri20mix","dataset":"Libri20Mix","dataset_url":null,"rows_in_archive":2,"metrics":["SI-SDRi"],"first_row_in_archive_order":{"model":"Separate And Diffuse","paper_title":"Separate And Diffuse: Using a Pretrained Diffusion Model for Improving Source Separation","paper_url":"/paper/separate-and-diffuse-using-a-pretrained","paper_date":"2023-01-25","arxiv_id":"2301.10752","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-separation-on-libricss","slug":"speech-separation-on-libricss","dataset":"LibriCSS","dataset_url":"/dataset/libricss","rows_in_archive":2,"metrics":["0S","0L","10%","20%","30%","40%"],"first_row_in_archive_order":{"model":"Conformer (large)","paper_title":"Continuous Speech Separation with Conformer","paper_url":"/paper/continuous-speech-separation-with-conformer","paper_date":"2020-08-13","arxiv_id":"2008.05773","code_links":[{"title":"Sanyuan-Chen/CSS_with_Conformer","url":"https://github.com/Sanyuan-Chen/CSS_with_Conformer"}],"syntology":null}},{"leaderboard":"/sota/speech-separation-on-ikala","slug":"speech-separation-on-ikala","dataset":"iKala","dataset_url":"/dataset/ikala","rows_in_archive":1,"metrics":["NSDR"],"first_row_in_archive_order":{"model":"U-Net","paper_title":"Singing Voice Separation with Deep U-Net Convolutional Networks","paper_url":"/paper/singing-voice-separation-with-deep-u-net","paper_date":"2017-10-27","arxiv_id":null,"code_links":[{"title":"tsurumeso/vocal-remover","url":"https://github.com/tsurumeso/vocal-remover"}],"syntology":null}},{"leaderboard":"/sota/speech-separation-on-libri15mix","slug":"speech-separation-on-libri15mix","dataset":"Libri15Mix","dataset_url":null,"rows_in_archive":1,"metrics":["SI-SDRi"],"first_row_in_archive_order":{"model":"Hungarian PIT","paper_title":"Many-Speakers Single Channel Speech Separation with Optimal Permutation Training","paper_url":"/paper/many-speakers-single-channel-speech","paper_date":"2021-04-18","arxiv_id":"2104.08955","code_links":[{"title":"shakeddovrat/librimix","url":"https://github.com/shakeddovrat/librimix"}],"syntology":null}},{"leaderboard":"/sota/speech-separation-on-tcd-timit-corpus-mixed","slug":"speech-separation-on-tcd-timit-corpus-mixed","dataset":"TCD-TIMIT corpus (mixed-speech)","dataset_url":"/dataset/timit","rows_in_archive":1,"metrics":["SDR"],"first_row_in_archive_order":{"model":"Audio-Visual concat-ref","paper_title":"Face Landmark-based Speaker-Independent Audio-Visual Speech Enhancement in Multi-Talker Environments","paper_url":"/paper/face-landmark-based-speaker-independent-audio","paper_date":"2018-11-06","arxiv_id":"1811.02480","code_links":[{"title":"dr-pato/audio_visual_speech_enhancement","url":"https://github.com/dr-pato/audio_visual_speech_enhancement"}],"syntology":null}},{"leaderboard":"/sota/speech-separation-on-wsj0-2mix-16k","slug":"speech-separation-on-wsj0-2mix-16k","dataset":"WSJ0-2mix-16k","dataset_url":"/dataset/wsj0-2mix-1","rows_in_archive":1,"metrics":["SI-SDRi"],"first_row_in_archive_order":{"model":"MossFormer2","paper_title":"MossFormer: Pushing the Performance Limit of Monaural Speech Separation using Gated Single-Head Transformer with Convolution-Augmented Joint Self-Attentions","paper_url":"/paper/mossformer-pushing-the-performance-limit-of","paper_date":"2023-02-23","arxiv_id":"2302.11824","code_links":[{"title":"modelscope/ClearerVoice-Studio","url":"https://github.com/modelscope/ClearerVoice-Studio"},{"title":"alibabasglab/mossformer","url":"https://github.com/alibabasglab/mossformer"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}}}],"datasets":[{"url":"/dataset/voxceleb2","name":"VoxCeleb2","full_name":"VoxCeleb2","num_papers_in_archive":564},{"url":"/dataset/wsj0-2mix-1","name":"WSJ0-2mix","full_name":"","num_papers_in_archive":159},{"url":"/dataset/librimix","name":"LibriMix","full_name":"","num_papers_in_archive":122},{"url":"/dataset/lrs2","name":"LRS2","full_name":"Lip Reading Sentences 2","num_papers_in_archive":115},{"url":"/dataset/wham","name":"WHAM!","full_name":"WSJ0 Hipster Ambient Mixtures","num_papers_in_archive":114},{"url":"/dataset/libricss","name":"LibriCSS","full_name":"","num_papers_in_archive":73},{"url":"/dataset/whamr","name":"WHAMR!","full_name":"WHAM! with synthetic reverberated sources","num_papers_in_archive":57},{"url":"/dataset/timit","name":"TIMIT","full_name":"TIMIT Acoustic-Phonetic Continuous Speech Corpus","num_papers_in_archive":31},{"url":"/dataset/mir-1k","name":"MIR-1K","full_name":"","num_papers_in_archive":21},{"url":"/dataset/ikala","name":"iKala","full_name":"","num_papers_in_archive":20},{"url":"/dataset/dipco","name":"DiPCo","full_name":"DiPCo -- Dinner Party Corpus","num_papers_in_archive":16},{"url":"/dataset/grid","name":"GRID Dataset","full_name":"","num_papers_in_archive":10},{"url":"/dataset/real-m","name":"REAL-M","full_name":"","num_papers_in_archive":4},{"url":"/dataset/mc-grid-test","name":"MC_GRID","full_name":"Multi_Channel_Grid","num_papers_in_archive":1},{"url":"/dataset/mdrt","name":"mDRT","full_name":"Multilingual Diagnostic Rhyme Test","num_papers_in_archive":1},{"url":"/dataset/whamr-ext","name":"WHAMR_ext","full_name":"WHAMR_ext","num_papers_in_archive":1}],"subtasks":[{"url":"/task/speech-extraction","name":"Speech Extraction"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":120,"tagged_in_all":359,"items":[{"url":"/paper/tasnet-surpassing-ideal-time-frequency","title":"Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation","date":"2018-09-20","arxiv_id":"1809.07454","repositories_listed":17,"syntology":{"n":36,"n_ran":7,"n_unverified":29,"n_pointer_only":16}},{"url":"/paper/dual-path-rnn-efficient-long-sequence","title":"Dual-path RNN: efficient long sequence modeling for time-domain single-channel speech separation","date":"2019-10-14","arxiv_id":"1910.06379","repositories_listed":8,"syntology":{"n":22,"n_ran":4,"n_unverified":18,"n_pointer_only":0}},{"url":"/paper/deep-clustering-discriminative-embeddings-for","title":"Deep clustering: Discriminative embeddings for segmentation and separation","date":"2015-08-18","arxiv_id":"1508.04306","repositories_listed":8,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":3}},{"url":"/paper/wavecrn-an-efficient-convolutional-recurrent","title":"WaveCRN: An Efficient Convolutional Recurrent Neural Network for End-to-end Speech Enhancement","date":"2020-04-06","arxiv_id":"2004.04098","repositories_listed":5,"syntology":null},{"url":"/paper/speech-slytherin-examining-the-performance","title":"Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis","date":"2024-07-13","arxiv_id":"2407.09732","repositories_listed":4,"syntology":null},{"url":"/paper/attention-is-all-you-need-in-speech","title":"Attention is All You Need in Speech Separation","date":"2020-10-25","arxiv_id":"2010.13154","repositories_listed":4,"syntology":null},{"url":"/paper/sudo-rm-rf-efficient-networks-for-universal","title":"Sudo rm -rf: Efficient Networks for Universal Audio Source Separation","date":"2020-07-14","arxiv_id":"2007.06833","repositories_listed":4,"syntology":{"n":10,"n_ran":1,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/voice-separation-with-an-unknown-number-of","title":"Voice Separation with an Unknown Number of Multiple Speakers","date":"2020-02-29","arxiv_id":"2003.01531","repositories_listed":4,"syntology":{"n":13,"n_ran":10,"n_unverified":3,"n_pointer_only":9}},{"url":"/paper/looking-to-listen-at-the-cocktail-party-a","title":"Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation","date":"2018-04-10","arxiv_id":"1804.03619","repositories_listed":4,"syntology":{"n":23,"n_ran":0,"n_unverified":23,"n_pointer_only":0}},{"url":"/paper/compute-and-memory-efficient-universal-sound","title":"Compute and memory efficient universal sound source separation","date":"2021-03-03","arxiv_id":"2103.02644","repositories_listed":3,"syntology":null},{"url":"/paper/tasnet-time-domain-audio-separation-network","title":"TasNet: time-domain audio separation network for real-time, single-channel speech separation","date":"2017-11-01","arxiv_id":"1711.00541","repositories_listed":3,"syntology":null},{"url":"/paper/multi-talker-speech-separation-with-utterance","title":"Multi-talker Speech Separation with Utterance-level Permutation Invariant Training of Deep Recurrent Neural Networks","date":"2017-03-18","arxiv_id":"1703.06284","repositories_listed":3,"syntology":{"n":3,"n_ran":1,"n_unverified":2,"n_pointer_only":3}},{"url":"/paper/sonicsim-a-customizable-simulation-platform","title":"SonicSim: A customizable simulation platform for speech processing in moving sound source scenarios","date":"2024-10-02","arxiv_id":"2410.01481","repositories_listed":2,"syntology":{"n":11,"n_ran":8,"n_unverified":3,"n_pointer_only":11}},{"url":"/paper/mossformer-pushing-the-performance-limit-of","title":"MossFormer: Pushing the Performance Limit of Monaural Speech Separation using Gated Single-Head Transformer with Convolution-Augmented Joint Self-Attentions","date":"2023-02-23","arxiv_id":"2302.11824","repositories_listed":2,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/an-audio-visual-speech-separation-model","title":"An Audio-Visual Speech Separation Model Inspired by Cortico-Thalamo-Cortical Circuits","date":"2022-12-21","arxiv_id":"2212.10744","repositories_listed":2,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/deformable-temporal-convolutional-networks","title":"Deformable Temporal Convolutional Networks for Monaural Noisy Reverberant Speech Separation","date":"2022-10-27","arxiv_id":"2210.15305","repositories_listed":2,"syntology":null},{"url":"/paper/cmgan-conformer-based-metric-gan-for-monaural","title":"CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement","date":"2022-09-22","arxiv_id":"2209.11112","repositories_listed":2,"syntology":null},{"url":"/paper/mesh2ir-neural-acoustic-impulse-response","title":"MESH2IR: Neural Acoustic Impulse Response Generator for Complex 3D Scenes","date":"2022-05-18","arxiv_id":"2205.09248","repositories_listed":2,"syntology":{"n":6,"n_ran":6,"n_unverified":0,"n_pointer_only":6}},{"url":"/paper/a-cappella-audio-visual-singing-voice","title":"A cappella: Audio-visual Singing Voice Separation","date":"2021-04-20","arxiv_id":"2104.09946","repositories_listed":2,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/sandglasset-a-light-multi-granularity-self","title":"Sandglasset: A Light Multi-Granularity Self-attentive Network For Time-Domain Speech Separation","date":"2021-03-01","arxiv_id":"2103.00819","repositories_listed":2,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/directional-sparse-filtering-using-weighted","title":"Directional Sparse Filtering using Weighted Lehmer Mean for Blind Separation of Unbalanced Speech Mixtures","date":"2021-01-30","arxiv_id":"2102.00196","repositories_listed":2,"syntology":null},{"url":"/paper/effective-low-cost-time-domain-audio","title":"Effective Low-Cost Time-Domain Audio Separation Using Globally Attentive Locally Recurrent Networks","date":"2021-01-13","arxiv_id":"2101.05014","repositories_listed":2,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/multi-decoder-dprnn-high-accuracy-source","title":"Multi-Decoder DPRNN: High Accuracy Source Counting and Separation","date":"2020-11-24","arxiv_id":"2011.12022","repositories_listed":2,"syntology":null},{"url":"/paper/multi-microphone-complex-spectral-mapping-for","title":"Multi-microphone Complex Spectral Mapping for Utterance-wise and Continuous Speech Separation","date":"2020-10-04","arxiv_id":"2010.01703","repositories_listed":2,"syntology":{"n":9,"n_ran":1,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/end-to-end-microphone-permutation-and-number","title":"End-to-end Microphone Permutation and Number Invariant Multi-channel Speech Separation","date":"2019-10-30","arxiv_id":"1910.14104","repositories_listed":2,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/filterbank-design-for-end-to-end-speech","title":"Filterbank design for end-to-end speech separation","date":"2019-10-23","arxiv_id":"1910.10400","repositories_listed":2,"syntology":{"n":8,"n_ran":1,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/two-step-sound-source-separation-training-on","title":"Two-Step Sound Source Separation: Training on Learned Latent Targets","date":"2019-10-22","arxiv_id":"1910.09804","repositories_listed":2,"syntology":null},{"url":"/paper/single-channel-multi-speaker-separation-using","title":"Single-Channel Multi-Speaker Separation using Deep Clustering","date":"2016-07-07","arxiv_id":"1607.02173","repositories_listed":2,"syntology":null},{"url":"/paper/joint-optimization-of-masks-and-deep","title":"Joint Optimization of Masks and Deep Recurrent Neural Networks for Monaural Source Separation","date":"2015-02-13","arxiv_id":"1502.04149","repositories_listed":2,"syntology":null},{"url":"/paper/solospeech-enhancing-intelligibility-and","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","date":"2025-05-25","arxiv_id":"2505.19314","repositories_listed":1,"syntology":null}],"syntology_records":17,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}