{"url":"/method/eend","slug":"eend","name":"EEND","full_name":"End-to-End Neural Diarization","full_name_withheld":false,"description_markdown":"**End-to-End Neural Diarization** is a neural network for speaker diarization in which a neural network directly outputs speaker diarization results given a multi-speaker recording. To realize such an end-to-end model, the speaker diarization problem is formulated as a multi-label classification problem and a permutation-free objective function is introduced to directly minimize diarization errors. The EEND method can explicitly handle speaker overlaps during training and inference. Just by feeding multi-speaker recordings with corresponding speaker segment labels, the model can be adapted to real conversations.","description_state":"present","introduced_year":null,"introduced_by":{"title":"End-to-End Neural Diarization: Reformulating Speaker Diarization as Simple Multi-label Classification","paper":"/paper/end-to-end-neural-diarization-reformulating","first_author":"Yusuke Fujita","n_authors":5,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/end-to-end-neural-diarization-reformulating"},"source":{"url":"https://arxiv.org/abs/2003.02966v1","title":"End-to-End Neural Diarization: Reformulating Speaker Diarization as Simple Multi-label Classification","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Audio","area_id":"audio","collection":"Speaker Diarization","url":"/methods/category/speaker-diarization","pwc_aliases":[]}],"n_papers_tagged":26,"archive_num_papers":26,"papers_newest_first":[{"paper":"/paper/ls-eend-long-form-streaming-end-to-end-neural","title":"LS-EEND: Long-Form Streaming End-to-End Neural Diarization with Online Attractor Extraction","date":"2024-10-09","arxiv_id":"2410.06670","n_code_links":1,"syntology":null},{"paper":null,"title":"From Modular to End-to-End Speaker Diarization","date":"2024-06-27","arxiv_id":"2407.08752","n_code_links":0,"syntology":null},{"paper":null,"title":"Speakers Unembedded: Embedding-free Approach to Long-form Neural Diarization","date":"2024-06-26","arxiv_id":"2406.18679","n_code_links":0,"syntology":null},{"paper":null,"title":"Song Data Cleansing for End-to-End Neural Singer Diarization Using Neural Analysis and Synthesis Framework","date":"2024-06-24","arxiv_id":"2406.16315","n_code_links":0,"syntology":null},{"paper":"/paper/powerset-multi-class-cross-entropy-loss-for","title":"Powerset multi-class cross entropy loss for neural speaker diarization","date":"2023-10-19","arxiv_id":"2310.13025","n_code_links":1,"syntology":null},{"paper":null,"title":"Frame-wise and overlap-robust speaker embeddings for meeting diarization","date":"2023-06-01","arxiv_id":"2306.00625","n_code_links":0,"syntology":null},{"paper":null,"title":"An Experimental Review of Speaker Diarization methods with application to Two-Speaker Conversational Telephone Speech recordings","date":"2023-05-29","arxiv_id":"2305.18074","n_code_links":0,"syntology":null},{"paper":"/paper/neural-diarization-with-non-autoregressive","title":"Neural Diarization with Non-autoregressive Intermediate Attractors","date":"2023-03-13","arxiv_id":"2303.06806","n_code_links":1,"syntology":null},{"paper":"/paper/told-a-novel-two-stage-overlap-aware","title":"TOLD: A Novel Two-Stage Overlap-Aware Framework for Speaker Diarization","date":"2023-03-08","arxiv_id":"2303.05397","n_code_links":1,"syntology":null},{"paper":"/paper/ber-balanced-error-rate-for-speaker","title":"BER: Balanced Error Rate For Speaker Diarization","date":"2022-11-08","arxiv_id":"2211.04304","n_code_links":2,"syntology":null},{"paper":"/paper/utterance-by-utterance-overlap-aware-neural","title":"Utterance-by-utterance overlap-aware neural diarization with Graph-PIT","date":"2022-07-28","arxiv_id":"2207.13888","n_code_links":1,"syntology":null},{"paper":null,"title":"Online Neural Diarization of Unlimited Numbers of Speakers Using Global and Local Attractors","date":"2022-06-06","arxiv_id":"2206.02432","n_code_links":0,"syntology":null},{"paper":"/paper/improving-the-naturalness-of-simulated","title":"Improving the Naturalness of Simulated Conversations for End-to-End Neural Diarization","date":"2022-04-24","arxiv_id":"2204.11232","n_code_links":1,"syntology":null},{"paper":"/paper/leveraging-speech-separation-for","title":"Low-Latency Speech Separation Guided Diarization for Telephone Conversations","date":"2022-04-05","arxiv_id":"2204.02306","n_code_links":1,"syntology":null},{"paper":"/paper/from-simulated-mixtures-to-simulated","title":"From Simulated Mixtures to Simulated Conversations as Training Data for End-to-End Neural Diarization","date":"2022-04-02","arxiv_id":"2204.00890","n_code_links":2,"syntology":null},{"paper":null,"title":"Tight integration of neural- and clustering-based diarization through deep unfolding of infinite Gaussian mixture model","date":"2022-02-14","arxiv_id":"2202.06524","n_code_links":0,"syntology":null},{"paper":null,"title":"ASR-Aware End-to-end Neural Diarization","date":"2022-02-02","arxiv_id":"2202.01286","n_code_links":0,"syntology":null},{"paper":null,"title":"Auxiliary Loss of Transformer with Residual Connection for End-to-End Speaker Diarization","date":"2021-10-14","arxiv_id":"2110.07116","n_code_links":0,"syntology":null},{"paper":null,"title":"Multi-Channel End-to-End Neural Diarization with Distributed Microphones","date":"2021-10-10","arxiv_id":"2110.04694","n_code_links":0,"syntology":null},{"paper":"/paper/encoder-decoder-based-attractor-calculation","title":"Encoder-Decoder Based Attractors for End-to-End Neural Diarization","date":"2021-06-20","arxiv_id":"2106.10654","n_code_links":1,"syntology":null},{"paper":null,"title":"End-to-end Neural Diarization: From Transformer to Conformer","date":"2021-06-14","arxiv_id":"2106.07167","n_code_links":0,"syntology":null},{"paper":null,"title":"Semi-Supervised Training with Pseudo-Labeling for End-to-End Neural Diarization","date":"2021-06-09","arxiv_id":"2106.04764","n_code_links":0,"syntology":null},{"paper":null,"title":"End-to-End Speaker Diarization Conditioned on Speech Activity and Overlap Detection","date":"2021-06-08","arxiv_id":"2106.04078","n_code_links":0,"syntology":null},{"paper":"/paper/advances-in-integration-of-end-to-end-neural","title":"Advances in integration of end-to-end neural and clustering-based diarization for real conversational speech","date":"2021-05-19","arxiv_id":"2105.09040","n_code_links":1,"syntology":null},{"paper":null,"title":"Integrating end-to-end neural and clustering-based diarization: Getting the best of both worlds","date":"2020-10-26","arxiv_id":"2010.13366","n_code_links":0,"syntology":null},{"paper":"/paper/end-to-end-neural-diarization-reformulating","title":"End-to-End Neural Diarization: Reformulating Speaker Diarization as Simple Multi-label Classification","date":"2020-02-24","arxiv_id":"2003.02966","n_code_links":1,"syntology":null}],"papers_shown":26,"tasks":[{"task":"/task/speaker-diarization","name":"Speaker Diarization","papers":19},{"task":"/task/speaker-diarization","name":"speaker-diarization","papers":19},{"task":"/task/clustering","name":"Clustering","papers":9},{"task":"/task/decoder","name":"Decoder","papers":4},{"task":"/task/multi-label-classification-2","name":"MUlTI-LABEL-ClASSIFICATION","papers":3},{"task":"/task/multi-label-classification","name":"Multi-Label Classification","papers":3},{"task":"/task/speech-recognition","name":"Speech Recognition","papers":3},{"task":"/task/speech-recognition-1","name":"speech-recognition","papers":3},{"task":"/task/form","name":"Form","papers":2},{"task":"/task/speech-separation","name":"Speech Separation","papers":2},{"task":"/task/action-detection","name":"Action Detection","papers":1},{"task":"/task/activity-detection","name":"Activity Detection","papers":1},{"task":"/task/automatic-speech-recognition-2","name":"Automatic Speech Recognition","papers":1},{"task":"/task/automatic-speech-recognition","name":"Automatic Speech Recognition (ASR)","papers":1},{"task":"/task/change-detection","name":"Change Detection","papers":1},{"task":"/task/constrained-clustering","name":"Constrained Clustering","papers":1},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":1},{"task":"/task/classification","name":"General Classification","papers":1},{"task":"/task/multi-task-learning","name":"Multi-Task Learning","papers":1},{"task":"/task/multi-class-classification","name":"Multi-class Classification","papers":1}],"tasks_shown":20,"n_tasks":24,"usage_by_year":[{"year":"2020","papers":2},{"year":"2021","papers":7},{"year":"2022","papers":8},{"year":"2023","papers":5},{"year":"2024","papers":4}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/eend"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}