{"url":"/task/speech-recognition","name":"Speech Recognition","slug":"speech-recognition","description_markdown":"**Speech Recognition** is the task of converting spoken language into text. It involves recognizing the words spoken in an audio recording and transcribing them into a written format. The goal is to accurately transcribe the speech in real-time or from recorded audio, taking into account factors such as accents, speaking speed, and background noise.\r\n\r\n<span style=\"color:grey; opacity: 0.6\">( Image credit: [SpecAugment](https://arxiv.org/pdf/1904.08779v2.pdf) )</span>","categories":[{"name":"Audio","url":"/area/audio"},{"name":"Speech","url":"/area/speech"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":6433,"papers_with_code":1373,"benchmarks":65,"benchmark_tables_in_archive":235,"benchmark_tables_shown":235,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":96,"subtasks":11,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/speech-recognition-on-librispeech-test-clean","slug":"speech-recognition-on-librispeech-test-clean","dataset":"LibriSpeech test-clean","dataset_url":"/dataset/librispeech","rows_in_archive":64,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"United Med ASR","paper_title":"High-precision medical speech recognition through synthetic data and semantic correction: UNITED-MEDASR","paper_url":"/paper/high-precision-medical-speech-recognition","paper_date":"2024-11-24","arxiv_id":"2412.00055","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-librispeech-test-other","slug":"speech-recognition-on-librispeech-test-other","dataset":"LibriSpeech test-other","dataset_url":"/dataset/librispeech","rows_in_archive":53,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"SAMBA ASR","paper_title":"Samba-ASR: State-Of-The-Art Speech Recognition Leveraging Structured State-Space Models","paper_url":"/paper/samba-asr-state-of-the-art-speech-recognition","paper_date":"2025-01-06","arxiv_id":"2501.02832","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-switchboard-hub500","slug":"speech-recognition-on-switchboard-hub500","dataset":"Switchboard + Hub500","dataset_url":null,"rows_in_archive":30,"metrics":["Percentage error"],"first_row_in_archive_order":{"model":"IBM (LSTM+Conformer encoder-decoder)","paper_title":"On the limit of English conversational speech recognition","paper_url":"/paper/on-the-limit-of-english-conversational-speech","paper_date":"2021-05-03","arxiv_id":"2105.00982","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-timit","slug":"speech-recognition-on-timit","dataset":"TIMIT","dataset_url":"/dataset/timit","rows_in_archive":22,"metrics":["Percentage error"],"first_row_in_archive_order":{"model":"wav2vec 2.0","paper_title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","paper_url":"/paper/wav2vec-2-0-a-framework-for-self-supervised","paper_date":"2020-06-20","arxiv_id":"2006.11477","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"pytorch/fairseq","url":"https://github.com/pytorch/fairseq"},{"title":"pytorch/fairseq","url":"https://github.com/pytorch/fairseq/tree/master/examples/wav2vec"},{"title":"wenet-e2e/wenet","url":"https://github.com/wenet-e2e/wenet"},{"title":"sh-lee-prml/hierspeechpp","url":"https://github.com/sh-lee-prml/hierspeechpp"},{"title":"facebookresearch/brainmagick","url":"https://github.com/facebookresearch/brainmagick"},{"title":"mailong25/vietnamese-speech-recognition","url":"https://github.com/mailong25/vietnamese-speech-recognition"},{"title":"mailong25/self-supervised-speech-recognition","url":"https://github.com/mailong25/self-supervised-speech-recognition"},{"title":"huseinzol05/malaya-speech","url":"https://github.com/huseinzol05/malaya-speech"},{"title":"neonbjb/ocotillo","url":"https://github.com/neonbjb/ocotillo"},{"title":"shivangi-aneja/FaceTalk","url":"https://github.com/shivangi-aneja/FaceTalk"},{"title":"eastonYi/wav2vec","url":"https://github.com/eastonYi/wav2vec"},{"title":"vasudevgupta7/gsoc-wav2vec2","url":"https://github.com/vasudevgupta7/gsoc-wav2vec2"},{"title":"JoungheeKim/Non-Attentive-Tacotron","url":"https://github.com/JoungheeKim/Non-Attentive-Tacotron"},{"title":"HarunoriKawano/Wav2vec2.0","url":"https://github.com/HarunoriKawano/Wav2vec2.0"},{"title":"gatech-eic/s3-router","url":"https://github.com/gatech-eic/s3-router"},{"title":"BirgerMoell/tmh","url":"https://github.com/BirgerMoell/tmh"},{"title":"liutianlin0121/seislm","url":"https://github.com/liutianlin0121/seislm"},{"title":"AIdeaLab/wav2vec2_docker","url":"https://github.com/AIdeaLab/wav2vec2_docker"},{"title":"nlp-en-es/wav2vec2-spanish","url":"https://github.com/nlp-en-es/wav2vec2-spanish"},{"title":"phanxuanphucnd/wav2asr","url":"https://github.com/phanxuanphucnd/wav2asr"},{"title":"Arizona-Voice/Arizona-spotting","url":"https://github.com/Arizona-Voice/Arizona-spotting"},{"title":"phanxuanphucnd/Arizona-spotting","url":"https://github.com/phanxuanphucnd/Arizona-spotting"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/wav2vec2_conformer"},{"title":"phanxuanphucnd/Arizona-asr","url":"https://github.com/phanxuanphucnd/Arizona-asr"}],"syntology":{"n":9,"n_ran":2,"n_unverified":7,"n_pointer_only":2}}},{"leaderboard":"/sota/speech-recognition-on-aishell-1","slug":"speech-recognition-on-aishell-1","dataset":"AISHELL-1","dataset_url":"/dataset/aishell-1","rows_in_archive":18,"metrics":["Word Error Rate (WER)","Params(M)"],"first_row_in_archive_order":{"model":"FireRedASR-AED","paper_title":"FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration","paper_url":"/paper/fireredasr-open-source-industrial-grade","paper_date":"2025-01-24","arxiv_id":"2501.14350","code_links":[{"title":"fireredteam/fireredasr","url":"https://github.com/fireredteam/fireredasr"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-wsj-eval92","slug":"speech-recognition-on-wsj-eval92","dataset":"WSJ eval92","dataset_url":null,"rows_in_archive":17,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Speechstew 100M","paper_title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network","paper_url":"/paper/speechstew-simply-mix-all-available-speech","paper_date":"2021-04-05","arxiv_id":"2104.02133","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-common-voice-german","slug":"speech-recognition-on-common-voice-german","dataset":"Common Voice German","dataset_url":"/dataset/common-voice","rows_in_archive":14,"metrics":["Test WER","Test CER"],"first_row_in_archive_order":{"model":"wav2vec 2.0 XLS-R 1B + TEVR (5-gram)","paper_title":"TEVR: Improving Speech Recognition by Token Entropy Variance Reduction","paper_url":"/paper/tevr-improving-speech-recognition-by-token","paper_date":"2022-06-25","arxiv_id":"2206.12693","code_links":[{"title":"DeutscheKI/tevr-asr-tool","url":"https://github.com/DeutscheKI/tevr-asr-tool"},{"title":"fxtentacle/wav2vec2-xls-r-1b-tevr","url":"https://huggingface.co/fxtentacle/wav2vec2-xls-r-1b-tevr"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-swb_hub_500-wer","slug":"speech-recognition-on-swb_hub_500-wer","dataset":"swb_hub_500 WER fullSWBCH","dataset_url":null,"rows_in_archive":12,"metrics":["Percentage error"],"first_row_in_archive_order":{"model":"IBM (LSTM+Conformer encoder-decoder)","paper_title":"On the limit of English conversational speech recognition","paper_url":"/paper/on-the-limit-of-english-conversational-speech","paper_date":"2021-05-03","arxiv_id":"2105.00982","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-tuda","slug":"speech-recognition-on-tuda","dataset":"TUDA","dataset_url":"/dataset/tuda","rows_in_archive":9,"metrics":["Test WER"],"first_row_in_archive_order":{"model":"Conformer-Transducer (no LM)","paper_title":"Automatic Speech Recognition in German: A Detailed Error Analysis","paper_url":"/paper/automatic-speech-recognition-in-german-a","paper_date":"2022-08-03","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-common-voice-french","slug":"speech-recognition-on-common-voice-french","dataset":"Common Voice French","dataset_url":"/dataset/common-voice","rows_in_archive":8,"metrics":["Test WER"],"first_row_in_archive_order":{"model":"ConformerCTC-L (5-gram)","paper_title":"Scribosermo: Fast Speech-to-Text models for German and other Languages","paper_url":"/paper/scribosermo-fast-speech-to-text-models-for","paper_date":"2021-10-15","arxiv_id":"2110.07982","code_links":[{"title":"Jaco-Assistant/deepspeech-polyglot","url":"https://gitlab.com/Jaco-Assistant/deepspeech-polyglot"},{"title":"jaco-assistant/scribosermo","url":"https://gitlab.com/jaco-assistant/scribosermo"},{"title":"jaco-assistant/corcua","url":"https://gitlab.com/jaco-assistant/corcua"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-common-voice-spanish","slug":"speech-recognition-on-common-voice-spanish","dataset":"Common Voice Spanish","dataset_url":"/dataset/common-voice","rows_in_archive":8,"metrics":["Test WER","Test CER","Test CER (+LM)","Test WER (+LM)"],"first_row_in_archive_order":{"model":"ConformerCTC-L (4-gram)","paper_title":"NeMo: a toolkit for building AI applications using Neural Modules","paper_url":"/paper/nemo-a-toolkit-for-building-ai-applications","paper_date":"2019-09-14","arxiv_id":"1909.09577","code_links":[{"title":"NVIDIA/NeMo","url":"https://github.com/NVIDIA/NeMo"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-mediaspeech","slug":"speech-recognition-on-mediaspeech","dataset":"MediaSpeech","dataset_url":"/dataset/mediaspeech","rows_in_archive":8,"metrics":["WER for Arabic","WER for French","WER for Spanish","WER for Turkish"],"first_row_in_archive_order":{"model":"Quartznet","paper_title":"MediaSpeech: Multilanguage ASR Benchmark and Dataset","paper_url":"/paper/mediaspeech-multilanguage-asr-benchmark-and","paper_date":"2021-03-30","arxiv_id":"2103.16193","code_links":[{"title":"NTRLab/MediaSpeech","url":"https://github.com/NTRLab/MediaSpeech"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-slue","slug":"speech-recognition-on-slue","dataset":"SLUE","dataset_url":"/dataset/slue","rows_in_archive":8,"metrics":["VoxPopuli (Dev)","VoxPopuli (Test)","VoxCeleb (Dev)","VoxCeleb (Test)"],"first_row_in_archive_order":{"model":"W2V2-L-LL60K (+ TED-LIUM 3 LM)","paper_title":"SLUE: New Benchmark Tasks for Spoken Language Understanding Evaluation on Natural Speech","paper_url":"/paper/slue-new-benchmark-tasks-for-spoken-language","paper_date":"2021-11-19","arxiv_id":"2111.10367","code_links":[{"title":"asappresearch/slue-toolkit","url":"https://github.com/asappresearch/slue-toolkit"}],"syntology":{"n":12,"n_ran":0,"n_unverified":12,"n_pointer_only":0}}},{"leaderboard":"/sota/speech-recognition-on-vietmed","slug":"speech-recognition-on-vietmed","dataset":"VietMed","dataset_url":"/dataset/vietmed","rows_in_archive":8,"metrics":["Dev WER","Test WER"],"first_row_in_archive_order":{"model":"XLSR-53-Viet","paper_title":"VietMed: A Dataset and Benchmark for Automatic Speech Recognition of Vietnamese in the Medical Domain","paper_url":"/paper/vietmed-a-dataset-and-benchmark-for-automatic","paper_date":"2024-04-08","arxiv_id":"2404.05659","code_links":[{"title":"leduckhai/multimed","url":"https://github.com/leduckhai/multimed"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-wenetspeech","slug":"speech-recognition-on-wenetspeech","dataset":"WenetSpeech","dataset_url":"/dataset/wenetspeech","rows_in_archive":8,"metrics":["Character Error Rate (CER)"],"first_row_in_archive_order":{"model":"Paraformer-large","paper_title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","paper_url":"/paper/funasr-a-fundamental-end-to-end-speech","paper_date":"2023-05-18","arxiv_id":"2305.11013","code_links":[{"title":"alibaba-damo-academy/FunASR","url":"https://github.com/alibaba-damo-academy/FunASR"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-easycom","slug":"speech-recognition-on-easycom","dataset":"EasyCom","dataset_url":"/dataset/easycom","rows_in_archive":5,"metrics":["WER (%)"],"first_row_in_archive_order":{"model":"ReVISE (bf)","paper_title":"ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement","paper_url":"/paper/revise-self-supervised-speech-resynthesis","paper_date":"2022-12-21","arxiv_id":"2212.11377","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-gigaspeech-dev","slug":"speech-recognition-on-gigaspeech-dev","dataset":"GigaSpeech DEV","dataset_url":"/dataset/gigaspeech","rows_in_archive":5,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"SAMBA ASR","paper_title":"Samba-ASR: State-Of-The-Art Speech Recognition Leveraging Structured State-Space Models","paper_url":"/paper/samba-asr-state-of-the-art-speech-recognition","paper_date":"2025-01-06","arxiv_id":"2501.02832","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-gigaspeech-test","slug":"speech-recognition-on-gigaspeech-test","dataset":"GigaSpeech TEST","dataset_url":"/dataset/gigaspeech","rows_in_archive":5,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Zipformer+pruned transducer w/ CR-CTC\n(no external language model)","paper_title":"CR-CTC: Consistency regularization on CTC for improved speech recognition","paper_url":"/paper/cr-ctc-consistency-regularization-on-ctc-for","paper_date":"2024-10-07","arxiv_id":"2410.05101","code_links":[{"title":"k2-fsa/icefall","url":"https://github.com/k2-fsa/icefall"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-hub500-switchboard","slug":"speech-recognition-on-hub500-switchboard","dataset":"Hub5'00 SwitchBoard","dataset_url":"/dataset/2000-hub5-english","rows_in_archive":5,"metrics":["SwitchBoard","CallHome","Eval2000","Hub5'00"],"first_row_in_archive_order":{"model":"LAS + SpecAugment (with LM, Switchboard mild policy)","paper_title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition","paper_url":"/paper/specaugment-a-simple-data-augmentation-method","paper_date":"2019-04-18","arxiv_id":"1904.08779","code_links":[{"title":"mozilla/DeepSpeech","url":"https://github.com/mozilla/DeepSpeech"},{"title":"PaddlePaddle/PaddleSpeech","url":"https://github.com/PaddlePaddle/PaddleSpeech"},{"title":"makcedward/nlpaug","url":"https://github.com/makcedward/nlpaug"},{"title":"iver56/audiomentations","url":"https://github.com/iver56/audiomentations"},{"title":"shelling203/SpecAugment","url":"https://github.com/shelling203/SpecAugment"},{"title":"DemisEom/SpecAugment","url":"https://github.com/DemisEom/SpecAugment"},{"title":"google-research/leaf-audio","url":"https://github.com/google-research/leaf-audio"},{"title":"ZhengkunTian/OpenTransformer","url":"https://github.com/ZhengkunTian/OpenTransformer"},{"title":"lRomul/argus-freesound","url":"https://github.com/lRomul/argus-freesound"},{"title":"shuaijiang/Whisper-Finetune","url":"https://github.com/shuaijiang/Whisper-Finetune"},{"title":"ebouteillon/freesound-audio-tagging-2019","url":"https://github.com/ebouteillon/freesound-audio-tagging-2019"},{"title":"SarthakYadav/audax","url":"https://github.com/SarthakYadav/audax"},{"title":"freds0/data_augmentation_for_asr","url":"https://github.com/freds0/data_augmentation_for_asr"},{"title":"biyoml/End-to-End-Mandarin-ASR","url":"https://github.com/biyoml/End-to-End-Mandarin-ASR"},{"title":"jackjhliu/End-to-End-Mandarin-ASR","url":"https://github.com/jackjhliu/End-to-End-Mandarin-ASR"},{"title":"KimJeongSun/SpecAugment_numpy_scipy","url":"https://github.com/KimJeongSun/SpecAugment_numpy_scipy"},{"title":"AmirmohammadRostami/KeywordsSpotting-EfficientNet-A0","url":"https://github.com/AmirmohammadRostami/KeywordsSpotting-EfficientNet-A0"},{"title":"sh951011/Korean-Speech-Recognition","url":"https://github.com/sh951011/Korean-Speech-Recognition/blob/master/package/feature.py"},{"title":"hgstudent/las","url":"https://github.com/hgstudent/las"},{"title":"audio-westlakeu/rct","url":"https://github.com/audio-westlakeu/rct"},{"title":"Audio-WestlakeU/RCT-Random-Consistency-Training","url":"https://github.com/Audio-WestlakeU/RCT-Random-Consistency-Training"},{"title":"HLasse/wav2vec_finetune","url":"https://github.com/HLasse/wav2vec_finetune"},{"title":"park-cheol/ASR-Conformer","url":"https://github.com/park-cheol/ASR-Conformer"},{"title":"cosmoquester/speech-recognition","url":"https://github.com/cosmoquester/speech-recognition"},{"title":"MichaelisTrofficus/spec_augment","url":"https://github.com/MichaelisTrofficus/spec_augment"},{"title":"viig99/mixmatch-freesound","url":"https://github.com/viig99/mixmatch-freesound"},{"title":"HeleneFabia/keyword-spotter","url":"https://github.com/HeleneFabia/keyword-spotter"},{"title":"andychinka/dcase-challenge","url":"https://github.com/andychinka/dcase-challenge"},{"title":"ahmedalbahnasawy/spec_torch_kaldi-compatibility","url":"https://github.com/ahmedalbahnasawy/spec_torch_kaldi-compatibility"},{"title":"kimjeongsun/specaugment","url":"https://github.com/kimjeongsun/specaugment"}],"syntology":{"n":18,"n_ran":1,"n_unverified":17,"n_pointer_only":0}}},{"leaderboard":"/sota/speech-recognition-on-libri-light-test-clean","slug":"speech-recognition-on-libri-light-test-clean","dataset":"Libri-Light test-clean","dataset_url":"/dataset/libri-light","rows_in_archive":5,"metrics":["Word Error Rate (WER)","ABX-across","ABX-within"],"first_row_in_archive_order":{"model":"wav2vec 2.0 Large-10h-LV-60k","paper_title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","paper_url":"/paper/wav2vec-2-0-a-framework-for-self-supervised","paper_date":"2020-06-20","arxiv_id":"2006.11477","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"pytorch/fairseq","url":"https://github.com/pytorch/fairseq"},{"title":"pytorch/fairseq","url":"https://github.com/pytorch/fairseq/tree/master/examples/wav2vec"},{"title":"wenet-e2e/wenet","url":"https://github.com/wenet-e2e/wenet"},{"title":"sh-lee-prml/hierspeechpp","url":"https://github.com/sh-lee-prml/hierspeechpp"},{"title":"facebookresearch/brainmagick","url":"https://github.com/facebookresearch/brainmagick"},{"title":"mailong25/vietnamese-speech-recognition","url":"https://github.com/mailong25/vietnamese-speech-recognition"},{"title":"mailong25/self-supervised-speech-recognition","url":"https://github.com/mailong25/self-supervised-speech-recognition"},{"title":"huseinzol05/malaya-speech","url":"https://github.com/huseinzol05/malaya-speech"},{"title":"neonbjb/ocotillo","url":"https://github.com/neonbjb/ocotillo"},{"title":"shivangi-aneja/FaceTalk","url":"https://github.com/shivangi-aneja/FaceTalk"},{"title":"eastonYi/wav2vec","url":"https://github.com/eastonYi/wav2vec"},{"title":"vasudevgupta7/gsoc-wav2vec2","url":"https://github.com/vasudevgupta7/gsoc-wav2vec2"},{"title":"JoungheeKim/Non-Attentive-Tacotron","url":"https://github.com/JoungheeKim/Non-Attentive-Tacotron"},{"title":"HarunoriKawano/Wav2vec2.0","url":"https://github.com/HarunoriKawano/Wav2vec2.0"},{"title":"gatech-eic/s3-router","url":"https://github.com/gatech-eic/s3-router"},{"title":"BirgerMoell/tmh","url":"https://github.com/BirgerMoell/tmh"},{"title":"liutianlin0121/seislm","url":"https://github.com/liutianlin0121/seislm"},{"title":"AIdeaLab/wav2vec2_docker","url":"https://github.com/AIdeaLab/wav2vec2_docker"},{"title":"nlp-en-es/wav2vec2-spanish","url":"https://github.com/nlp-en-es/wav2vec2-spanish"},{"title":"phanxuanphucnd/wav2asr","url":"https://github.com/phanxuanphucnd/wav2asr"},{"title":"Arizona-Voice/Arizona-spotting","url":"https://github.com/Arizona-Voice/Arizona-spotting"},{"title":"phanxuanphucnd/Arizona-spotting","url":"https://github.com/phanxuanphucnd/Arizona-spotting"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/wav2vec2_conformer"},{"title":"phanxuanphucnd/Arizona-asr","url":"https://github.com/phanxuanphucnd/Arizona-asr"}],"syntology":{"n":9,"n_ran":2,"n_unverified":7,"n_pointer_only":2}}},{"leaderboard":"/sota/speech-recognition-on-libri-light-test-other","slug":"speech-recognition-on-libri-light-test-other","dataset":"Libri-Light test-other","dataset_url":"/dataset/libri-light","rows_in_archive":5,"metrics":["Word Error Rate (WER)","ABX-across","ABX-within"],"first_row_in_archive_order":{"model":"wav2vec 2.0 Large-10h-LV-60k","paper_title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","paper_url":"/paper/wav2vec-2-0-a-framework-for-self-supervised","paper_date":"2020-06-20","arxiv_id":"2006.11477","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"pytorch/fairseq","url":"https://github.com/pytorch/fairseq"},{"title":"pytorch/fairseq","url":"https://github.com/pytorch/fairseq/tree/master/examples/wav2vec"},{"title":"wenet-e2e/wenet","url":"https://github.com/wenet-e2e/wenet"},{"title":"sh-lee-prml/hierspeechpp","url":"https://github.com/sh-lee-prml/hierspeechpp"},{"title":"facebookresearch/brainmagick","url":"https://github.com/facebookresearch/brainmagick"},{"title":"mailong25/vietnamese-speech-recognition","url":"https://github.com/mailong25/vietnamese-speech-recognition"},{"title":"mailong25/self-supervised-speech-recognition","url":"https://github.com/mailong25/self-supervised-speech-recognition"},{"title":"huseinzol05/malaya-speech","url":"https://github.com/huseinzol05/malaya-speech"},{"title":"neonbjb/ocotillo","url":"https://github.com/neonbjb/ocotillo"},{"title":"shivangi-aneja/FaceTalk","url":"https://github.com/shivangi-aneja/FaceTalk"},{"title":"eastonYi/wav2vec","url":"https://github.com/eastonYi/wav2vec"},{"title":"vasudevgupta7/gsoc-wav2vec2","url":"https://github.com/vasudevgupta7/gsoc-wav2vec2"},{"title":"JoungheeKim/Non-Attentive-Tacotron","url":"https://github.com/JoungheeKim/Non-Attentive-Tacotron"},{"title":"HarunoriKawano/Wav2vec2.0","url":"https://github.com/HarunoriKawano/Wav2vec2.0"},{"title":"gatech-eic/s3-router","url":"https://github.com/gatech-eic/s3-router"},{"title":"BirgerMoell/tmh","url":"https://github.com/BirgerMoell/tmh"},{"title":"liutianlin0121/seislm","url":"https://github.com/liutianlin0121/seislm"},{"title":"AIdeaLab/wav2vec2_docker","url":"https://github.com/AIdeaLab/wav2vec2_docker"},{"title":"nlp-en-es/wav2vec2-spanish","url":"https://github.com/nlp-en-es/wav2vec2-spanish"},{"title":"phanxuanphucnd/wav2asr","url":"https://github.com/phanxuanphucnd/wav2asr"},{"title":"Arizona-Voice/Arizona-spotting","url":"https://github.com/Arizona-Voice/Arizona-spotting"},{"title":"phanxuanphucnd/Arizona-spotting","url":"https://github.com/phanxuanphucnd/Arizona-spotting"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/wav2vec2_conformer"},{"title":"phanxuanphucnd/Arizona-asr","url":"https://github.com/phanxuanphucnd/Arizona-asr"}],"syntology":{"n":9,"n_ran":2,"n_unverified":7,"n_pointer_only":2}}},{"leaderboard":"/sota/speech-recognition-on-chime-6-dev-gss12","slug":"speech-recognition-on-chime-6-dev-gss12","dataset":"CHiME-6 dev_gss12","dataset_url":null,"rows_in_archive":4,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"ConformerXXL-PS + G-Augment","paper_title":"G-Augment: Searching for the Meta-Structure of Data Augmentation Policies for ASR","paper_url":"/paper/g-augment-searching-for-the-meta-structure-of","paper_date":"2022-10-19","arxiv_id":"2210.10879","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-lrs3-ted","slug":"speech-recognition-on-lrs3-ted","dataset":"LRS3-TED","dataset_url":"/dataset/lrs3-ted","rows_in_archive":4,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Whisper","paper_title":"Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation","paper_url":"/paper/whisper-flamingo-integrating-visual-features","paper_date":"2024-06-14","arxiv_id":"2406.10082","code_links":[{"title":"roudimit/whisper-flamingo","url":"https://github.com/roudimit/whisper-flamingo"}],"syntology":{"n":18,"n_ran":5,"n_unverified":13,"n_pointer_only":18}}},{"leaderboard":"/sota/speech-recognition-on-tedlium","slug":"speech-recognition-on-tedlium","dataset":"Tedlium","dataset_url":"/dataset/ted-lium-3","rows_in_archive":4,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"United-MedASR (764M)","paper_title":"High-precision medical speech recognition through synthetic data and semantic correction: UNITED-MEDASR","paper_url":"/paper/high-precision-medical-speech-recognition","paper_date":"2024-11-24","arxiv_id":"2412.00055","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-wsj-dev93","slug":"speech-recognition-on-wsj-dev93","dataset":"WSJ dev93","dataset_url":null,"rows_in_archive":4,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"CTC-CRF ST-NAS","paper_title":"Efficient Neural Architecture Search for End-to-end Speech Recognition via Straight-Through Gradients","paper_url":"/paper/efficient-neural-architecture-search-for-end","paper_date":"2020-11-11","arxiv_id":"2011.05649","code_links":[{"title":"thu-spmi/ST-NAS","url":"https://github.com/thu-spmi/ST-NAS"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-chime-6-eval","slug":"speech-recognition-on-chime-6-eval","dataset":"CHiME-6 eval","dataset_url":null,"rows_in_archive":3,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"ConformerXXL-PS + G-Augment","paper_title":"G-Augment: Searching for the Meta-Structure of Data Augmentation Policies for ASR","paper_url":"/paper/g-augment-searching-for-the-meta-structure-of","paper_date":"2022-10-19","arxiv_id":"2210.10879","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-common-voice-vi","slug":"speech-recognition-on-common-voice-vi","dataset":"Common Voice vi","dataset_url":"/dataset/common-voice","rows_in_archive":3,"metrics":["Test WER"],"first_row_in_archive_order":{"model":"khanhld/chunkformer-large-vie","paper_title":"ChunkFormer: Masked Chunking Conformer For Long-Form Speech Transcription","paper_url":"/paper/chunkformer-masked-chunking-conformer-for-1","paper_date":"2025-02-20","arxiv_id":"2502.14673","code_links":[{"title":"khanld/chunkformer","url":"https://github.com/khanld/chunkformer"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-europarl-asr-en-guest","slug":"speech-recognition-on-europarl-asr-en-guest","dataset":"Europarl-ASR EN Guest-test","dataset_url":"/dataset/europarl-asr","rows_in_archive":3,"metrics":["WER"],"first_row_in_archive_order":{"model":"United-MedASR (764M)","paper_title":"High-precision medical speech recognition through synthetic data and semantic correction: UNITED-MEDASR","paper_url":"/paper/high-precision-medical-speech-recognition","paper_date":"2024-11-24","arxiv_id":"2412.00055","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-fongbe-speech","slug":"speech-recognition-on-fongbe-speech","dataset":"Fongbe  audio","dataset_url":"/dataset/fongbe-speech-recognition","rows_in_archive":3,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Triphone (39 features) + LDA and MLLT + SGMM","paper_title":"First Automatic Fongbe Continuous Speech Recognition System: Development of Acoustic Models and Language Models","paper_url":"/paper/first-automatic-fongbe-continuous-speech","paper_date":"2017-01-21","arxiv_id":null,"code_links":[{"title":"laleye/ALFFA_PUBLIC","url":"https://github.com/laleye/ALFFA_PUBLIC"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-speech-commands-2","slug":"speech-recognition-on-speech-commands-2","dataset":"Speech Commands","dataset_url":"/dataset/speech-commands","rows_in_archive":3,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"Centaurus","paper_title":"Let SSMs be ConvNets: State-space Modeling with Optimal Tensor Contractions","paper_url":"/paper/let-ssms-be-convnets-state-space-modeling","paper_date":"2025-01-22","arxiv_id":"2501.13230","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-spgispeech","slug":"speech-recognition-on-spgispeech","dataset":"SPGISpeech","dataset_url":"/dataset/spgispeech","rows_in_archive":3,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Icefall - zipformer transducer","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-vivos","slug":"speech-recognition-on-vivos","dataset":"VIVOS","dataset_url":"/dataset/vivos","rows_in_archive":3,"metrics":["Test WER"],"first_row_in_archive_order":{"model":"khanhld/chunkformer-large-vie","paper_title":"ChunkFormer: Masked Chunking Conformer For Long-Form Speech Transcription","paper_url":"/paper/chunkformer-masked-chunking-conformer-for-1","paper_date":"2025-02-20","arxiv_id":"2502.14673","code_links":[{"title":"khanld/chunkformer","url":"https://github.com/khanld/chunkformer"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-wsj-eval93","slug":"speech-recognition-on-wsj-eval93","dataset":"WSJ eval93","dataset_url":null,"rows_in_archive":3,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Deep Speech 2","paper_title":"Deep Speech 2: End-to-End Speech Recognition in English and Mandarin","paper_url":"/paper/deep-speech-2-end-to-end-speech-recognition","paper_date":"2015-12-08","arxiv_id":"1512.02595","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models/tree/master/research/deep_speech"},{"title":"PaddlePaddle/PaddleSpeech","url":"https://github.com/PaddlePaddle/PaddleSpeech"},{"title":"PaddlePaddle/models","url":"https://github.com/PaddlePaddle/models"},{"title":"baidu-research/warp-ctc","url":"https://github.com/baidu-research/warp-ctc"},{"title":"SeanNaren/deepspeech.pytorch","url":"https://github.com/SeanNaren/deepspeech.pytorch"},{"title":"TensorSpeech/TensorFlowASR","url":"https://github.com/TensorSpeech/TensorFlowASR"},{"title":"DeepMark/deepmark","url":"https://github.com/DeepMark/deepmark"},{"title":"SeanNaren/deepspeech.torch","url":"https://github.com/SeanNaren/deepspeech.torch"},{"title":"robmsmt/KerasDeepSpeech","url":"https://github.com/robmsmt/KerasDeepSpeech"},{"title":"mindspore-ai/models","url":"https://github.com/mindspore-ai/models/tree/master/research/audio/deepspeech2"},{"title":"mindspore-ai/models","url":"https://github.com/mindspore-ai/models/tree/master/official/cv/warpctc"},{"title":"msalhab96/SpeeQ","url":"https://github.com/msalhab96/SpeeQ"},{"title":"myrtleSoftware/deepspeech","url":"https://github.com/myrtleSoftware/deepspeech"},{"title":"sooftware/End-to-End-Speech-Recognition-Models","url":"https://github.com/sooftware/End-to-End-Speech-Recognition-Models"},{"title":"sooftware/OpenSpeech","url":"https://github.com/sooftware/OpenSpeech"},{"title":"victor369basu/End2EndAutomaticSpeechRecognition","url":"https://github.com/victor369basu/End2EndAutomaticSpeechRecognition"},{"title":"raotnameh/End-to-end-E2E-Named-Entity-Recognition-from-English-Speech","url":"https://github.com/raotnameh/End-to-end-E2E-Named-Entity-Recognition-from-English-Speech"},{"title":"fd873630/deep_speech_2_korean","url":"https://github.com/fd873630/deep_speech_2_korean"},{"title":"mangelroman/audio2score","url":"https://github.com/mangelroman/audio2score"},{"title":"cosmoquester/speech-recognition","url":"https://github.com/cosmoquester/speech-recognition"},{"title":"switiz/deepspeech2.pytorch","url":"https://github.com/switiz/deepspeech2.pytorch"},{"title":"bjtommychen/Keras_DeepSpeech2_SpeechRecognition","url":"https://github.com/bjtommychen/Keras_DeepSpeech2_SpeechRecognition"},{"title":"GavinGuan95/Punctuator.Pytorch","url":"https://github.com/GavinGuan95/Punctuator.Pytorch"},{"title":"MangoMoe/VerbalVim","url":"https://github.com/MangoMoe/VerbalVim"},{"title":"umd-fire-coml/2020-Speech-Recognition","url":"https://github.com/umd-fire-coml/2020-Speech-Recognition"},{"title":"hkakitani/deepspeech.pytorch","url":"https://github.com/hkakitani/deepspeech.pytorch"},{"title":"sburud/master","url":"https://gitlab.com/sburud/master"},{"title":"raraz15/DeepTurkish","url":"https://github.com/raraz15/DeepTurkish"},{"title":"UnofficialJuliaMirror/DeepMark-deepmark","url":"https://github.com/UnofficialJuliaMirror/DeepMark-deepmark"},{"title":"freshtan/deepspeech2","url":"https://github.com/freshtan/deepspeech2"},{"title":"wangys102/MindSpore","url":"https://github.com/wangys102/MindSpore/tree/main/DeepSpeech2"},{"title":"2023-MindSpore-1/ms-code-63","url":"https://github.com/2023-MindSpore-1/ms-code-63"},{"title":"2023-MindSpore-1/ms-code-57","url":"https://github.com/2023-MindSpore-1/ms-code-57"},{"title":"UnofficialJuliaMirrorSnapshots/DeepMark-deepmark","url":"https://github.com/UnofficialJuliaMirrorSnapshots/DeepMark-deepmark"},{"title":"MindSpore-paper-code-2/code400","url":"https://github.com/MindSpore-paper-code-2/code400/tree/main/DeepSpeech2"}],"syntology":{"n":39,"n_ran":2,"n_unverified":37,"n_pointer_only":0}}},{"leaderboard":"/sota/speech-recognition-on-aishell-2","slug":"speech-recognition-on-aishell-2","dataset":"AISHELL-2","dataset_url":"/dataset/aishell-2","rows_in_archive":2,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Paraformer-large","paper_title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","paper_url":"/paper/funasr-a-fundamental-end-to-end-speech","paper_date":"2023-05-18","arxiv_id":"2305.11013","code_links":[{"title":"alibaba-damo-academy/FunASR","url":"https://github.com/alibaba-damo-academy/FunASR"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-ami-imh","slug":"speech-recognition-on-ami-imh","dataset":"AMI IMH","dataset_url":null,"rows_in_archive":2,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"ConformerXXL-P + Downstream NST","paper_title":"BigSSL: Exploring the Frontier of Large-Scale Semi-Supervised Learning for Automatic Speech Recognition","paper_url":"/paper/bigssl-exploring-the-frontier-of-large-scale","paper_date":"2021-09-27","arxiv_id":"2109.13226","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-ami-sdm1","slug":"speech-recognition-on-ami-sdm1","dataset":"AMI SDM1","dataset_url":null,"rows_in_archive":2,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"ConformerXXL-P","paper_title":"BigSSL: Exploring the Frontier of Large-Scale Semi-Supervised Learning for Automatic Speech Recognition","paper_url":"/paper/bigssl-exploring-the-frontier-of-large-scale","paper_date":"2021-09-27","arxiv_id":"2109.13226","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-common-voice-2","slug":"speech-recognition-on-common-voice-2","dataset":"Common Voice","dataset_url":"/dataset/common-voice","rows_in_archive":2,"metrics":["Test WER"],"first_row_in_archive_order":{"model":"ConformerXXL-P + Downstream NST","paper_title":"BigSSL: Exploring the Frontier of Large-Scale Semi-Supervised Learning for Automatic Speech Recognition","paper_url":"/paper/bigssl-exploring-the-frontier-of-large-scale","paper_date":"2021-09-27","arxiv_id":"2109.13226","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-common-voice-english","slug":"speech-recognition-on-common-voice-english","dataset":"Common Voice English","dataset_url":"/dataset/common-voice","rows_in_archive":2,"metrics":["Word Error Rate (WER)","Test WER"],"first_row_in_archive_order":{"model":"parakeet-rnnt-1.1b","paper_title":"Fast Conformer with Linearly Scalable Attention for Efficient Speech Recognition","paper_url":"/paper/fast-conformer-with-linearly-scalable","paper_date":"2023-05-08","arxiv_id":"2305.05084","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-common-voice-italian","slug":"speech-recognition-on-common-voice-italian","dataset":"Common Voice Italian","dataset_url":"/dataset/common-voice","rows_in_archive":2,"metrics":["Test WER"],"first_row_in_archive_order":{"model":"Whisper (Large v2)","paper_title":"Robust Speech Recognition via Large-Scale Weak Supervision","paper_url":"/paper/robust-speech-recognition-via-large-scale-1","paper_date":"2022-12-06","arxiv_id":"2212.04356","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"openai/whisper","url":"https://github.com/openai/whisper"},{"title":"ggerganov/whisper.cpp","url":"https://github.com/ggerganov/whisper.cpp"},{"title":"m-bain/whisperx","url":"https://github.com/m-bain/whisperx"},{"title":"sanchit-gandhi/whisper-jax","url":"https://github.com/sanchit-gandhi/whisper-jax"},{"title":"whisperspeech/whisperspeech","url":"https://github.com/whisperspeech/whisperspeech"},{"title":"collabora/whisperspeech","url":"https://github.com/collabora/whisperspeech"},{"title":"collabora/whisperlive","url":"https://github.com/collabora/whisperlive"},{"title":"kadirnar/whisper-plus","url":"https://github.com/kadirnar/whisper-plus"},{"title":"k2-fsa/icefall","url":"https://github.com/k2-fsa/icefall"},{"title":"briansidp/whisperbiasing","url":"https://github.com/briansidp/whisperbiasing"},{"title":"audioshake/alt-eval","url":"https://github.com/audioshake/alt-eval"},{"title":"robflynnyh/long-context-asr","url":"https://github.com/robflynnyh/long-context-asr"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/whisper"},{"title":"open-creator/icefall","url":"https://github.com/open-creator/icefall"}],"syntology":{"n":59,"n_ran":5,"n_unverified":54,"n_pointer_only":18}}},{"leaderboard":"/sota/speech-recognition-on-europarl-asr-en-mep","slug":"speech-recognition-on-europarl-asr-en-mep","dataset":"Europarl-ASR EN MEP-test","dataset_url":"/dataset/europarl-asr","rows_in_archive":2,"metrics":["WER"],"first_row_in_archive_order":{"model":"mllp_2021_offline_filt","paper_title":"Europarl-ASR: A Large Corpus of Parliamentary Debates for Streaming ASR Benchmarking and Speech Data Filtering/Verbatimization","paper_url":"/paper/europarl-asr-a-large-corpus-of-parliamentary","paper_date":"2021-08-30","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-libricss","slug":"speech-recognition-on-libricss","dataset":"LibriCSS","dataset_url":"/dataset/libricss","rows_in_archive":2,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"TS-SEP","paper_title":"TS-SEP: Joint Diarization and Separation Conditioned on Estimated Speaker Embeddings","paper_url":"/paper/ts-sep-joint-diarization-and-separation","paper_date":"2023-03-07","arxiv_id":"2303.03849","code_links":[{"title":"merlresearch/tssep","url":"https://github.com/merlresearch/tssep"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-ted-lium","slug":"speech-recognition-on-ted-lium","dataset":"TED-LIUM","dataset_url":"/dataset/ted-lium-3","rows_in_archive":2,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Whisper-LLaMa-7b","paper_title":"HyPoradise: An Open Baseline for Generative Speech Recognition with Large Language Models","paper_url":"/paper/hyporadise-an-open-baseline-for-generative-1","paper_date":"2023-09-27","arxiv_id":"2309.15701","code_links":[{"title":"hypotheses-paradise/hypo2trans","url":"https://github.com/hypotheses-paradise/hypo2trans"}],"syntology":{"n":7,"n_ran":3,"n_unverified":4,"n_pointer_only":0}}},{"leaderboard":"/sota/speech-recognition-on-aishell-2-test-android-1","slug":"speech-recognition-on-aishell-2-test-android-1","dataset":"AISHELL-2 Test Android","dataset_url":"/dataset/aishell-2","rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Qwen-Audio","paper_title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","paper_url":"/paper/qwen-audio-advancing-universal-audio","paper_date":"2023-11-14","arxiv_id":"2311.07919","code_links":[{"title":"alibaba-damo-academy/FunASR","url":"https://github.com/alibaba-damo-academy/FunASR"},{"title":"qwenlm/qwen-audio","url":"https://github.com/qwenlm/qwen-audio"}],"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":7}}},{"leaderboard":"/sota/speech-recognition-on-aishell-2-test-ios","slug":"speech-recognition-on-aishell-2-test-ios","dataset":"AISHELL-2 Test IOS","dataset_url":"/dataset/aishell-2","rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Qwen-Audio","paper_title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","paper_url":"/paper/qwen-audio-advancing-universal-audio","paper_date":"2023-11-14","arxiv_id":"2311.07919","code_links":[{"title":"alibaba-damo-academy/FunASR","url":"https://github.com/alibaba-damo-academy/FunASR"},{"title":"qwenlm/qwen-audio","url":"https://github.com/qwenlm/qwen-audio"}],"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":7}}},{"leaderboard":"/sota/speech-recognition-on-aishell-2-test-mic-1","slug":"speech-recognition-on-aishell-2-test-mic-1","dataset":"AISHELL-2 Test Mic","dataset_url":"/dataset/aishell-2","rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Qwen-Audio","paper_title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","paper_url":"/paper/qwen-audio-advancing-universal-audio","paper_date":"2023-11-14","arxiv_id":"2311.07919","code_links":[{"title":"alibaba-damo-academy/FunASR","url":"https://github.com/alibaba-damo-academy/FunASR"},{"title":"qwenlm/qwen-audio","url":"https://github.com/qwenlm/qwen-audio"}],"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":7}}},{"leaderboard":"/sota/speech-recognition-on-callhome-en","slug":"speech-recognition-on-callhome-en","dataset":"CALLHOME En","dataset_url":null,"rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"WavLM Large & EEND-vector clustering","paper_title":"WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing","paper_url":"/paper/wavlm-large-scale-self-supervised-pre","paper_date":"2021-10-26","arxiv_id":"2110.13900","code_links":[{"title":"microsoft/unilm","url":"https://github.com/microsoft/unilm"},{"title":"kyutai-labs/moshi","url":"https://github.com/kyutai-labs/moshi"},{"title":"nyrahealth/crisperwhisper","url":"https://github.com/nyrahealth/crisperwhisper"},{"title":"olawod/freevc","url":"https://github.com/olawod/freevc"},{"title":"microsoft/unispeech","url":"https://github.com/microsoft/unispeech"},{"title":"cywang97/unispeech","url":"https://github.com/cywang97/unispeech"},{"title":"sanyuan-chen/unispeech","url":"https://github.com/sanyuan-chen/unispeech"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/wavlm"},{"title":"MS-P3/code7","url":"https://github.com/MS-P3/code7/tree/main/wavlm"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-callhome-spanish-speech","slug":"speech-recognition-on-callhome-spanish-speech","dataset":"CALLHOME Spanish Speech","dataset_url":"/dataset/callhome-american-english-speech","rows_in_archive":1,"metrics":["WER"],"first_row_in_archive_order":{"model":"TDT 0-2","paper_title":"Efficient Sequence Transduction by Jointly Predicting Tokens and Durations","paper_url":"/paper/efficient-sequence-transduction-by-jointly","paper_date":"2023-04-13","arxiv_id":"2304.06795","code_links":[{"title":"NVIDIA/NeMo","url":"https://github.com/NVIDIA/NeMo"},{"title":"chimechallenge/C8DASR-Baseline-NeMo","url":"https://github.com/chimechallenge/C8DASR-Baseline-NeMo"},{"title":"kehanlu/Nemo","url":"https://github.com/kehanlu/Nemo"},{"title":"wd929/NeMo","url":"https://github.com/wd929/NeMo"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/speech-recognition-on-cas-vsr-s101","slug":"speech-recognition-on-cas-vsr-s101","dataset":"CAS-VSR-S101","dataset_url":"/dataset/cas-vsr-s101","rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"ES³ Base*","paper_title":"ES3: Evolving Self-Supervised Learning of Robust Audio-Visual Speech Representations","paper_url":"/paper/es3-evolving-self-supervised-learning-of","paper_date":"2024-01-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-common-voice-frisian","slug":"speech-recognition-on-common-voice-frisian","dataset":"Common Voice Frisian","dataset_url":"/dataset/common-voice","rows_in_archive":1,"metrics":["Test WER"],"first_row_in_archive_order":{"model":"wav2vec2-large-xls-r-1b-frisian","paper_title":"Improving the previous state-of-the-art Frisian ASR by fine-tuning XLS-R","paper_url":"/paper/improving-the-previous-state-of-the-art","paper_date":"2023-03-31","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-common-voice-japanese","slug":"speech-recognition-on-common-voice-japanese","dataset":"Common Voice Japanese","dataset_url":"/dataset/common-voice","rows_in_archive":1,"metrics":["Test WER","Test CER"],"first_row_in_archive_order":{"model":"Whisper (Large v2)","paper_title":"Robust Speech Recognition via Large-Scale Weak Supervision","paper_url":"/paper/robust-speech-recognition-via-large-scale-1","paper_date":"2022-12-06","arxiv_id":"2212.04356","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"openai/whisper","url":"https://github.com/openai/whisper"},{"title":"ggerganov/whisper.cpp","url":"https://github.com/ggerganov/whisper.cpp"},{"title":"m-bain/whisperx","url":"https://github.com/m-bain/whisperx"},{"title":"sanchit-gandhi/whisper-jax","url":"https://github.com/sanchit-gandhi/whisper-jax"},{"title":"whisperspeech/whisperspeech","url":"https://github.com/whisperspeech/whisperspeech"},{"title":"collabora/whisperspeech","url":"https://github.com/collabora/whisperspeech"},{"title":"collabora/whisperlive","url":"https://github.com/collabora/whisperlive"},{"title":"kadirnar/whisper-plus","url":"https://github.com/kadirnar/whisper-plus"},{"title":"k2-fsa/icefall","url":"https://github.com/k2-fsa/icefall"},{"title":"briansidp/whisperbiasing","url":"https://github.com/briansidp/whisperbiasing"},{"title":"audioshake/alt-eval","url":"https://github.com/audioshake/alt-eval"},{"title":"robflynnyh/long-context-asr","url":"https://github.com/robflynnyh/long-context-asr"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/whisper"},{"title":"open-creator/icefall","url":"https://github.com/open-creator/icefall"}],"syntology":{"n":59,"n_ran":5,"n_unverified":54,"n_pointer_only":18}}},{"leaderboard":"/sota/speech-recognition-on-common-voice-portuguese","slug":"speech-recognition-on-common-voice-portuguese","dataset":"Common Voice Portuguese","dataset_url":"/dataset/common-voice","rows_in_archive":1,"metrics":["Test WER"],"first_row_in_archive_order":{"model":"XLSR53 Wav2Vec2 Portuguese by Orlem Santos","paper_title":"XLSR53 Wav2Vec2 Portuguese by Orlem Santos","paper_url":"/paper/xlsr53-wav2vec2-portuguese-by-orlem-santos","paper_date":"2022-02-01","arxiv_id":null,"code_links":[{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/5/wav2vec2_with_lm"},{"title":"Orlllem/wav2vec2-fairseq-pt-br","url":"https://github.com/Orlllem/wav2vec2-fairseq-pt-br"},{"title":"MindCode-4/code-10","url":"https://github.com/MindCode-4/code-10/tree/main/AECRNet"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-common-voice-russian","slug":"speech-recognition-on-common-voice-russian","dataset":"Common Voice Russian","dataset_url":"/dataset/common-voice","rows_in_archive":1,"metrics":["Test WER","Test CER","Test CER (+LM)","Test WER (+LM)"],"first_row_in_archive_order":{"model":"Whisper (Large v2)","paper_title":"Robust Speech Recognition via Large-Scale Weak Supervision","paper_url":"/paper/robust-speech-recognition-via-large-scale-1","paper_date":"2022-12-06","arxiv_id":"2212.04356","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"openai/whisper","url":"https://github.com/openai/whisper"},{"title":"ggerganov/whisper.cpp","url":"https://github.com/ggerganov/whisper.cpp"},{"title":"m-bain/whisperx","url":"https://github.com/m-bain/whisperx"},{"title":"sanchit-gandhi/whisper-jax","url":"https://github.com/sanchit-gandhi/whisper-jax"},{"title":"whisperspeech/whisperspeech","url":"https://github.com/whisperspeech/whisperspeech"},{"title":"collabora/whisperspeech","url":"https://github.com/collabora/whisperspeech"},{"title":"collabora/whisperlive","url":"https://github.com/collabora/whisperlive"},{"title":"kadirnar/whisper-plus","url":"https://github.com/kadirnar/whisper-plus"},{"title":"k2-fsa/icefall","url":"https://github.com/k2-fsa/icefall"},{"title":"briansidp/whisperbiasing","url":"https://github.com/briansidp/whisperbiasing"},{"title":"audioshake/alt-eval","url":"https://github.com/audioshake/alt-eval"},{"title":"robflynnyh/long-context-asr","url":"https://github.com/robflynnyh/long-context-asr"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/whisper"},{"title":"open-creator/icefall","url":"https://github.com/open-creator/icefall"}],"syntology":{"n":59,"n_ran":5,"n_unverified":54,"n_pointer_only":18}}},{"leaderboard":"/sota/speech-recognition-on-facebook-multilingual","slug":"speech-recognition-on-facebook-multilingual","dataset":"facebook/multilingual_librispeech german","dataset_url":"/dataset/multilingual-librispeech","rows_in_archive":1,"metrics":["WER"],"first_row_in_archive_order":{"model":"TDT 0-4","paper_title":"Efficient Sequence Transduction by Jointly Predicting Tokens and Durations","paper_url":"/paper/efficient-sequence-transduction-by-jointly","paper_date":"2023-04-13","arxiv_id":"2304.06795","code_links":[{"title":"NVIDIA/NeMo","url":"https://github.com/NVIDIA/NeMo"},{"title":"chimechallenge/C8DASR-Baseline-NeMo","url":"https://github.com/chimechallenge/C8DASR-Baseline-NeMo"},{"title":"kehanlu/Nemo","url":"https://github.com/kehanlu/Nemo"},{"title":"wd929/NeMo","url":"https://github.com/wd929/NeMo"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/speech-recognition-on-gigaspeech","slug":"speech-recognition-on-gigaspeech","dataset":"GigaSpeech","dataset_url":"/dataset/gigaspeech","rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Conformer/Transformer-AED","paper_title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","paper_url":"/paper/gigaspeech-an-evolving-multi-domain-asr","paper_date":"2021-06-13","arxiv_id":"2106.06909","code_links":[{"title":"SpeechColab/GigaSpeech","url":"https://github.com/SpeechColab/GigaSpeech"},{"title":"speechtranslation/gigas2s","url":"https://github.com/speechtranslation/gigas2s"},{"title":"maikezuefle/contr-pretraining","url":"https://github.com/maikezuefle/contr-pretraining"}],"syntology":{"n":10,"n_ran":2,"n_unverified":8,"n_pointer_only":0}}},{"leaderboard":"/sota/speech-recognition-on-google-speech-commands","slug":"speech-recognition-on-google-speech-commands","dataset":"Google Speech Commands - Musan","dataset_url":"/dataset/google-speech-commands-musan","rows_in_archive":1,"metrics":["Error rate - SNR 0dB"],"first_row_in_archive_order":{"model":"ImportantAug","paper_title":"ImportantAug: a data augmentation agent for speech","paper_url":"/paper/importantaug-a-data-augmentation-agent-for","paper_date":"2021-12-14","arxiv_id":"2112.07156","code_links":[{"title":"tvanh512/importantAug","url":"https://github.com/tvanh512/importantAug"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-hub5-00-fisher-swbd","slug":"speech-recognition-on-hub5-00-fisher-swbd","dataset":"Hub5'00 FISHER-SWBD","dataset_url":null,"rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"CTC-CRF","paper_title":"CAT: A CTC-CRF based ASR Toolkit Bridging the Hybrid and the End-to-end Approaches towards Data Efficiency and Low Latency","paper_url":"/paper/cat-a-ctc-crf-based-asr-toolkit-bridging-the","paper_date":"2020-05-27","arxiv_id":"2005.13326","code_links":[{"title":"thu-spmi/cat","url":"https://github.com/thu-spmi/cat"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-hub500-callhome","slug":"speech-recognition-on-hub500-callhome","dataset":"Hub5'00 CallHome","dataset_url":"/dataset/callhome-american-english-speech","rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Espresso","paper_title":"Espresso: A Fast End-to-end Neural Speech Recognition Toolkit","paper_url":"/paper/espresso-a-fast-end-to-end-neural-speech","paper_date":"2019-09-18","arxiv_id":"1909.08723","code_links":[{"title":"freewym/espresso","url":"https://github.com/freewym/espresso"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}}},{"leaderboard":"/sota/speech-recognition-on-librispeech-100h-test","slug":"speech-recognition-on-librispeech-100h-test","dataset":"LibriSpeech 100h test-clean","dataset_url":null,"rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Branchformer + GFSA","paper_title":"Graph Convolutions Enrich the Self-Attention in Transformers!","paper_url":"/paper/graph-convolutions-enrich-the-self-attention","paper_date":"2023-12-07","arxiv_id":"2312.04234","code_links":[{"title":"jeongwhanchoi/gfsa","url":"https://github.com/jeongwhanchoi/gfsa"}],"syntology":{"n":29,"n_ran":19,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/speech-recognition-on-librispeech-100h-test-1","slug":"speech-recognition-on-librispeech-100h-test-1","dataset":"LibriSpeech 100h test-other","dataset_url":null,"rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"Branchformer + GFSA","paper_title":"Graph Convolutions Enrich the Self-Attention in Transformers!","paper_url":"/paper/graph-convolutions-enrich-the-self-attention","paper_date":"2023-12-07","arxiv_id":"2312.04234","code_links":[{"title":"jeongwhanchoi/gfsa","url":"https://github.com/jeongwhanchoi/gfsa"}],"syntology":{"n":29,"n_ran":19,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/speech-recognition-on-librispeech-train-clean","slug":"speech-recognition-on-librispeech-train-clean","dataset":"LibriSpeech train-clean-100 test-clean","dataset_url":null,"rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"wav2vec_wav2letter","paper_title":"Self-training and Pre-training are Complementary for Speech Recognition","paper_url":"/paper/self-training-and-pre-training-are","paper_date":"2020-10-22","arxiv_id":"2010.11430","code_links":[{"title":"facebookresearch/fairseq","url":"https://github.com/facebookresearch/fairseq"},{"title":"pytorch/fairseq","url":"https://github.com/pytorch/fairseq"},{"title":"pytorch/fairseq","url":"https://github.com/pytorch/fairseq/blob/f3b6f5817fbee59057ae2506f01502ea3c301b4b/examples/wav2vec/README.md"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-librispeech-train-clean-1","slug":"speech-recognition-on-librispeech-train-clean-1","dataset":"LibriSpeech train-clean-100 test-other","dataset_url":null,"rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"wav2vec_wav2letter","paper_title":"Self-training and Pre-training are Complementary for Speech Recognition","paper_url":"/paper/self-training-and-pre-training-are","paper_date":"2020-10-22","arxiv_id":"2010.11430","code_links":[{"title":"facebookresearch/fairseq","url":"https://github.com/facebookresearch/fairseq"},{"title":"pytorch/fairseq","url":"https://github.com/pytorch/fairseq"},{"title":"pytorch/fairseq","url":"https://github.com/pytorch/fairseq/blob/f3b6f5817fbee59057ae2506f01502ea3c301b4b/examples/wav2vec/README.md"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-lrs2","slug":"speech-recognition-on-lrs2","dataset":"LRS2","dataset_url":"/dataset/lrs2","rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"RAVEn Large","paper_title":"Jointly Learning Visual and Auditory Speech Representations from Raw Data","paper_url":"/paper/jointly-learning-visual-and-auditory-speech","paper_date":"2022-12-12","arxiv_id":"2212.06246","code_links":[{"title":"ahaliassos/raven","url":"https://github.com/ahaliassos/raven"}],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-switchboard-300hr","slug":"speech-recognition-on-switchboard-300hr","dataset":"Switchboard (300hr)","dataset_url":null,"rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"End-to-end LF-MMI","paper_title":"End-to-end speech recognition using lattice-free MMI","paper_url":"/paper/end-to-end-speech-recognition-using-lattice","paper_date":"2018-09-06","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-switchboard-callhome","slug":"speech-recognition-on-switchboard-callhome","dataset":"Switchboard CallHome","dataset_url":"/dataset/callhome-american-english-speech","rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"SpeechStew (100M)","paper_title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network","paper_url":"/paper/speechstew-simply-mix-all-available-speech","paper_date":"2021-04-05","arxiv_id":"2104.02133","code_links":[],"syntology":null}},{"leaderboard":"/sota/speech-recognition-on-switchboard-swbd","slug":"speech-recognition-on-switchboard-swbd","dataset":"Switchboard SWBD","dataset_url":null,"rows_in_archive":1,"metrics":["Word Error Rate (WER)"],"first_row_in_archive_order":{"model":"SpeechStew (100M)","paper_title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network","paper_url":"/paper/speechstew-simply-mix-all-available-speech","paper_date":"2021-04-05","arxiv_id":"2104.02133","code_links":[],"syntology":null}},{"leaderboard":null,"slug":"speech-recognition-on-aishell-2-android","dataset":"AISHELL-2 Android","dataset_url":null,"rows_in_archive":0,"metrics":["Test CER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-aishell-2-mic","dataset":"AISHELL-2 Mic","dataset_url":null,"rows_in_archive":0,"metrics":["Test CER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-atcosim","dataset":"ATCOSIM","dataset_url":null,"rows_in_archive":0,"metrics":["Word Error Rate"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-bembaspeech-bem","dataset":"BembaSpeech bem","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-collectivat-tv3-parla","dataset":"collectivat/tv3_parla ca","dataset_url":null,"rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice","dataset":"Common Voice Interlingua","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-1","dataset":"Common Voice Kinyarwanda","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-1-0-french","dataset":"Common Voice 1.0 French","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Wer"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0","dataset":"Common Voice 7.0 Swedish","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-1","dataset":"Common Voice 7.0 Bashkir","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-13","dataset":"Common Voice 7.0 Italian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test CER (+LM)","Test WER","Test WER (+LM)"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-2","dataset":"Common Voice 7.0 Assamese","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-23","dataset":"Common Voice 7.0 Turkish","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-25","dataset":"Common Voice 7.0 Punjabi","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-27","dataset":"Common Voice 7.0 Japanese","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER (with LM)","Test WER (with LM)"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-29","dataset":"Common Voice 7.0 Portuguese","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER on Common Voice 7"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-32","dataset":"Common Voice 7.0 Luganda","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-4","dataset":"Common Voice 7.0 Vietnamese","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER (with LM)","Test WER","Test WER (with LM)","Test WER (with Language model)"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-5","dataset":"Common Voice 7.0 Finnish","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-abkhaz","dataset":"Common Voice 7.0 Abkhaz","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-arabic","dataset":"Common Voice 7.0 Arabic","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-basque","dataset":"Common Voice 7.0 Basque","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-french","dataset":"Common Voice 7.0 French","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-german","dataset":"Common Voice 7.0 German","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-hindi","dataset":"Common Voice 7.0 Hindi","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-odia","dataset":"Common Voice 7.0 Odia","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-thai","dataset":"Common Voice 7.0 Thai","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test SER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-7-0-votic","dataset":"Common Voice 7.0 Votic","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0","dataset":"Common Voice 8.0 Swedish","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-1","dataset":"Common Voice 8.0 Kurmanji Kurdish","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-10","dataset":"Common Voice 8.0 Bulgarian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-11","dataset":"Common Voice 8.0 Marathi","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-12","dataset":"Common Voice 8.0 Latvian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-13","dataset":"Common Voice 8.0 Georgian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["CER LM","WER LM"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-15","dataset":"Common Voice 8.0 Indonesian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-16","dataset":"Common Voice 8.0 Spanish","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-19","dataset":"Common Voice 8.0 Estonian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-2","dataset":"Common Voice 8.0 Punjabi","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-20","dataset":"Common Voice 8.0 Portuguese","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-21","dataset":"Common Voice 8.0 Ukrainian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["CER LM","WER LM"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-22","dataset":"Common Voice 8.0 Maltese","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-23","dataset":"Common Voice 8.0 Romanian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER (with LM)","Test CER (without LM)","Test WER (with LM)","Test WER (without LM)"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-24","dataset":"Common Voice 8.0 Slovenian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test CER (+LM)","Test WER","Test WER (+LM)"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-26","dataset":"Common Voice 8.0 Mongolian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER using LM","Test WER using LM"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-29","dataset":"Common Voice 8.0 Assamese","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-3","dataset":"Common Voice 8.0 Central Kurdish","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-30","dataset":"Common Voice 8.0 Sorbian, Upper","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-31","dataset":"Common Voice 8.0 Interlingua","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER using LM","Test WER using LM"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-32","dataset":"Common Voice 8.0 Romansh Sursilvan","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-33","dataset":"Common Voice 8.0 Romansh Vallader","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-35","dataset":"Common Voice 8.0 Vietnamese","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER (with LM)","Test WER","Test WER (with LM)"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-37","dataset":"Common Voice 8.0 Russian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test CER (+LM)","Test WER","Test WER (+LM)"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-38","dataset":"Common Voice 8.0 Santali (Ol Chiki)","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-39","dataset":"Common Voice 8.0 Serbian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-4","dataset":"Common Voice 8.0 Catalan","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-40","dataset":"Common Voice 8.0 Guarani","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-41","dataset":"Common Voice 8.0 Galician","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-6","dataset":"Common Voice 8.0 Armenian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["CER LM","WER LM"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-7","dataset":"Common Voice 8.0 Swahili","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-8","dataset":"Common Voice 8.0 Hungarian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-9","dataset":"Common Voice 8.0 Japanese","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-abkhaz","dataset":"Common Voice 8.0 Abkhaz","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-arabic","dataset":"Common Voice 8.0 Arabic","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-basaa","dataset":"Common Voice 8.0 Basaa","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-breton","dataset":"Common Voice 8.0 Breton","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-czech","dataset":"Common Voice 8.0 Czech","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-dutch","dataset":"Common Voice 8.0 Dutch","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-erzya","dataset":"Common Voice 8.0 Erzya","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-french","dataset":"Common Voice 8.0 French","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test CER (with LM)","Test WER","Test WER (with LM)"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-german","dataset":"Common Voice 8.0 German","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-greek","dataset":"Common Voice 8.0 Greek","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER using LM","Test WER using LM"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-hausa","dataset":"Common Voice 8.0 Hausa","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-hindi","dataset":"Common Voice 8.0 Hindi","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-kabyle","dataset":"Common Voice 8.0 Kabyle","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-kazakh","dataset":"Common Voice 8.0 Kazakh","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-odia","dataset":"Common Voice 8.0 Odia","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-polish","dataset":"Common Voice 8.0 Polish","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-sakha","dataset":"Common Voice 8.0 Sakha","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-slovak","dataset":"Common Voice 8.0 Slovak","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-tatar","dataset":"Common Voice 8.0 Tatar","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-urdu","dataset":"Common Voice 8.0 Urdu","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-uyghur","dataset":"Common Voice 8.0 Uyghur","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-uzbek","dataset":"Common Voice 8.0 Uzbek","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER (no LM)","Test CER (with LM)","Test WER (no LM)","Test WER (with LM)"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-8-0-votic","dataset":"Common Voice 8.0 Votic","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-arabic","dataset":"Common Voice Arabic","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-assamese","dataset":"Common Voice Assamese","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-basque","dataset":"Common Voice Basque","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-breton","dataset":"Common Voice Breton","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-catalan","dataset":"Common Voice Catalan","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-chinese","dataset":"Common Voice Chinese (Hong Kong)","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-chinese-2","dataset":"Common Voice Chinese (China)","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-chuvash","dataset":"Common Voice Chuvash","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-czech","dataset":"Common Voice Czech","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER","Test CER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-dhivehi","dataset":"Common Voice Dhivehi","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-dutch","dataset":"Common Voice Dutch","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER","Test CER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-esperanto","dataset":"Common Voice Esperanto","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-estonian","dataset":"Common Voice Estonian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER","Test CER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-finnish","dataset":"Common Voice Finnish","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-galician","dataset":"Common Voice Galician","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-georgian","dataset":"Common Voice Georgian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-greek","dataset":"Common Voice Greek","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-hakha-chin","dataset":"Common Voice Hakha Chin","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-hindi","dataset":"Common Voice Hindi","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER","Test CER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-hungarian","dataset":"Common Voice Hungarian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-indonesian","dataset":"Common Voice Indonesian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-irish","dataset":"Common Voice Irish","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-kyrgyz","dataset":"Common Voice Kyrgyz","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-latvian","dataset":"Common Voice Latvian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-lithuanian","dataset":"Common Voice Lithuanian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-luganda","dataset":"Common Voice Luganda","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER","Test CER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-maltese","dataset":"Common Voice Maltese","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-mongolian","dataset":"Common Voice Mongolian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-odia","dataset":"Common Voice Odia","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER","Test CER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-persian","dataset":"Common Voice Persian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-polish","dataset":"Common Voice Polish","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-punjabi","dataset":"Common Voice Punjabi","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-romanian","dataset":"Common Voice Romanian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-romansh","dataset":"Common Voice Romansh Vallader","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-romansh-1","dataset":"Common Voice Romansh Sursilvan","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-sakha","dataset":"Common Voice Sakha","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-slovenian","dataset":"Common Voice Slovenian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-sorbian","dataset":"Common Voice Sorbian, Upper","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-swedish","dataset":"Common Voice Swedish","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER","Test CER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-tamil","dataset":"Common Voice Tamil","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-tatar","dataset":"Common Voice Tatar","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-thai","dataset":"Common Voice Thai","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-turkish","dataset":"Common Voice Turkish","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-ukrainian","dataset":"Common Voice Ukrainian","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-vietnamese","dataset":"Common Voice Vietnamese","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-common-voice-welsh","dataset":"Common Voice Welsh","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-coraa","dataset":"CORAA","dataset_url":null,"rows_in_archive":0,"metrics":["Test CORAA WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-darpa-timit","dataset":"DARPA TIMIT","dataset_url":"/dataset/timit","rows_in_archive":0,"metrics":["Test CER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-fleurs","dataset":"FLEURS","dataset_url":"/dataset/fleurs","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-fon","dataset":"fon","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-german-asr-data-mix","dataset":"German ASR Data-Mix","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-interspeech-2021-asr-mr","dataset":"InterSpeech 2021 ASR mr","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-kazakh-speech-corpus-v1","dataset":"Kazakh Speech Corpus v1.1","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-librispeech-other","dataset":"Librispeech (other)","dataset_url":"/dataset/librispeech","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-madel121-arabic-egy","dataset":"MAdel121/arabic-egy-cleaned (validation split)","dataset_url":null,"rows_in_archive":0,"metrics":["CER","WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-mozilla-common-voice-10","dataset":"Mozilla Common Voice 10.0","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Dev WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-mozilla-common-voice-16","dataset":"Mozilla Common Voice 16.1","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER (De)","Test WER (ES)","Test WER (En)","Test WER (Fr)"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-mozilla-common-voice-7","dataset":"Mozilla Common Voice 7.0","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-mozilla-common-voice-8","dataset":"Mozilla Common Voice 8.0","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-mozilla-common-voice-9","dataset":"Mozilla Common Voice 9.0","dataset_url":"/dataset/common-voice","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-multilingual-1","dataset":"Multilingual LibriSpeech","dataset_url":"/dataset/multilingual-librispeech","rows_in_archive":0,"metrics":["Dev WER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-open-slr","dataset":"Open SLR","dataset_url":null,"rows_in_archive":0,"metrics":["Test CER","Test CER (without LM)","Test CER with lm","Test WER","Test WER (without LM)","Test WER with lm"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-openslr","dataset":"OpenSLR","dataset_url":"/dataset/openslr","rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-openslr-gu","dataset":"OpenSLR gu","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-openslr-high-quality","dataset":"OpenSLR High quality TTS data for Javanese","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-openslr-high-quality-1","dataset":"OpenSLR High quality TTS data for Sundanese","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-openslr-km","dataset":"OpenSLR km","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-openslr-kn","dataset":"OpenSLR kn","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-openslr-mr","dataset":"OpenSLR mr","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-openslr-ne","dataset":"OpenSLR ne","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-openslr-te","dataset":"OpenSLR te","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-podlodka-io","dataset":"Podlodka.io","dataset_url":null,"rows_in_archive":0,"metrics":["WER (with punctuation and capital letters)","WER (without punctuation)"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-projecte-aina-parlament","dataset":"projecte-aina/parlament_parla ca","dataset_url":null,"rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-robust-speech-event","dataset":"Robust Speech Event - Catalan Dev Data","dataset_url":null,"rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-robust-speech-event-dev","dataset":"Robust Speech Event - Dev Data","dataset_url":null,"rows_in_archive":0,"metrics":["Test CER","Test WER","Validation CER","Validation WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-sberdevices-golos","dataset":"Sberdevices Golos (farfield)","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-sberdevices-golos-crowd","dataset":"Sberdevices Golos (crowd)","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-speech-recognition","dataset":"speech-recognition-community-v2/dev_data ca","dataset_url":null,"rows_in_archive":0,"metrics":["Test CER","Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-spgi-speech","dataset":"SPGI Speech","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-tedlium-v3","dataset":"tedlium-v3","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-test-split-of-combined","dataset":"Test split of combined dataset using all datasets mentioned above","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-uwb-atcc-dataset-air","dataset":"UWB-ATCC dataset (Air Traffic Control Communications)","dataset_url":null,"rows_in_archive":0,"metrics":["TEST WER","TEST WER (+LM)"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-vlsp-task-1","dataset":"VLSP - Task 1","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-vox-populi","dataset":"Vox Populi","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-wall-street-journal-92","dataset":"Wall Street Journal 92","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"speech-recognition-on-wall-street-journal-93","dataset":"Wall Street Journal 93","dataset_url":null,"rows_in_archive":0,"metrics":["Test WER"],"first_row_in_archive_order":null}],"datasets":[{"url":"/dataset/mnist","name":"MNIST","full_name":"","num_papers_in_archive":7651},{"url":"/dataset/librispeech","name":"LibriSpeech","full_name":"","num_papers_in_archive":2361},{"url":"/dataset/common-voice","name":"Common Voice","full_name":"Common Voice","num_papers_in_archive":449},{"url":"/dataset/speech-commands","name":"Speech Commands","full_name":"Speech Commands","num_papers_in_archive":392},{"url":"/dataset/must-c","name":"MuST-C","full_name":"","num_papers_in_archive":216},{"url":"/dataset/aishell-1","name":"AISHELL-1","full_name":"","num_papers_in_archive":197},{"url":"/dataset/libri-light","name":"Libri-Light","full_name":"","num_papers_in_archive":194},{"url":"/dataset/fleurs","name":"FLEURS","full_name":"Few-shot Learning Evaluation of Universal Representations of Speech","num_papers_in_archive":141},{"url":"/dataset/europarl","name":"Europarl","full_name":"European Parliament Proceedings Parallel Corpus","num_papers_in_archive":128},{"url":"/dataset/lrs2","name":"LRS2","full_name":"Lip Reading Sentences 2","num_papers_in_archive":115},{"url":"/dataset/voxpopuli","name":"VoxPopuli","full_name":"","num_papers_in_archive":113},{"url":"/dataset/gigaspeech","name":"GigaSpeech","full_name":"","num_papers_in_archive":87},{"url":"/dataset/multilingual-librispeech","name":"Multilingual LibriSpeech","full_name":"MLS","num_papers_in_archive":77},{"url":"/dataset/aishell-2","name":"AISHELL-2","full_name":"","num_papers_in_archive":75},{"url":"/dataset/libricss","name":"LibriCSS","full_name":"","num_papers_in_archive":73},{"url":"/dataset/covost2","name":"CoVoST2","full_name":"Common Voice Speech-To-Text 2","num_papers_in_archive":66},{"url":"/dataset/ted-lium-3","name":"TED-LIUM","full_name":"","num_papers_in_archive":64},{"url":"/dataset/lrs3-ted","name":"LRS3-TED","full_name":"","num_papers_in_archive":63},{"url":"/dataset/wenetspeech","name":"WenetSpeech","full_name":"","num_papers_in_archive":58},{"url":"/dataset/europarl-st","name":"Europarl-ST","full_name":"","num_papers_in_archive":57},{"url":"/dataset/reverb-challenge","name":"ReVerb Challenge","full_name":"REverberant Voice Enhancement and Recognition Benchmark","num_papers_in_archive":55},{"url":"/dataset/voices","name":"VOICES","full_name":"Voices Obscured In Complex Environmental Settings","num_papers_in_archive":48},{"url":"/dataset/alimeeting","name":"AliMeeting","full_name":"Multi-Channel Multi-Party Meeting Transcription Challenge","num_papers_in_archive":46},{"url":"/dataset/chime-5","name":"CHiME-5","full_name":"CHiME Speech Separation and Recognition Challenge","num_papers_in_archive":42},{"url":"/dataset/covost","name":"CoVoST","full_name":"","num_papers_in_archive":34},{"url":"/dataset/thchs-30","name":"THCHS-30","full_name":"","num_papers_in_archive":34},{"url":"/dataset/2000-hub5-english","name":"2000 HUB5 English","full_name":"2000 HUB5 English","num_papers_in_archive":33},{"url":"/dataset/nwpu-crowd","name":"NWPU-Crowd","full_name":"","num_papers_in_archive":32},{"url":"/dataset/timit","name":"TIMIT","full_name":"TIMIT Acoustic-Phonetic Continuous Speech Corpus","num_papers_in_archive":31},{"url":"/dataset/spoken-squad","name":"Spoken-SQuAD","full_name":null,"num_papers_in_archive":24},{"url":"/dataset/vocalsound","name":"VocalSound","full_name":"","num_papers_in_archive":24},{"url":"/dataset/easycom","name":"EasyCom","full_name":"","num_papers_in_archive":22},{"url":"/dataset/slue","name":"SLUE","full_name":"Spoken Language Understanding Evaluation","num_papers_in_archive":22},{"url":"/dataset/taskmaster-1","name":"Taskmaster-1","full_name":"Taskmaster-1","num_papers_in_archive":19},{"url":"/dataset/spgispeech","name":"SPGISpeech","full_name":"","num_papers_in_archive":16},{"url":"/dataset/mass","name":"MaSS","full_name":"","num_papers_in_archive":15},{"url":"/dataset/sms-wsj","name":"SMS-WSJ","full_name":"Spatialized Multi-Speaker Wall Street Journal","num_papers_in_archive":14},{"url":"/dataset/magicdata-ramc","name":"MagicData-RAMC","full_name":"","num_papers_in_archive":12},{"url":"/dataset/callhome-american-english-speech","name":"CALLHOME American English Speech","full_name":"","num_papers_in_archive":11},{"url":"/dataset/tuda","name":"TUDA","full_name":"","num_papers_in_archive":11},{"url":"/dataset/speakingfaces","name":"SpeakingFaces","full_name":"","num_papers_in_archive":10},{"url":"/dataset/speech-coco","name":"SPEECH-COCO","full_name":"","num_papers_in_archive":9},{"url":"/dataset/adima","name":"ADIMA","full_name":"","num_papers_in_archive":8},{"url":"/dataset/europarl-asr","name":"Europarl-ASR","full_name":"","num_papers_in_archive":8},{"url":"/dataset/jsut-corpus","name":"JSUT Corpus","full_name":"","num_papers_in_archive":8},{"url":"/dataset/atari-grand-challenge","name":"Atari Grand Challenge","full_name":"","num_papers_in_archive":7},{"url":"/dataset/vivos","name":"VIVOS","full_name":"VIVOS Corpus","num_papers_in_archive":7},{"url":"/dataset/emodb-dataset","name":"EmoDB Dataset","full_name":"Berlin Database of Emotional Speech","num_papers_in_archive":6},{"url":"/dataset/open-images-v7","name":"Open Images V7","full_name":"","num_papers_in_archive":6},{"url":"/dataset/accentdb","name":"AccentDB","full_name":"AccentDB","num_papers_in_archive":5},{"url":"/dataset/adl-piano-midi","name":"ADL Piano MIDI","full_name":"","num_papers_in_archive":5},{"url":"/dataset/artie-bias-corpus","name":"Artie Bias Corpus","full_name":"","num_papers_in_archive":5},{"url":"/dataset/clovacall","name":"ClovaCall","full_name":null,"num_papers_in_archive":5},{"url":"/dataset/csrc","name":"CSRC","full_name":"Children Speech Recognition Challenge","num_papers_in_archive":5},{"url":"/dataset/libri-adapt","name":"Libri-Adapt","full_name":"","num_papers_in_archive":5},{"url":"/dataset/mediaspeech","name":"MediaSpeech","full_name":"","num_papers_in_archive":5},{"url":"/dataset/olr-2021","name":"OLR 2021","full_name":"","num_papers_in_archive":5},{"url":"/dataset/timers-and-such","name":"Timers and Such","full_name":"","num_papers_in_archive":5},{"url":"/dataset/word2word","name":"word2word","full_name":"word2word","num_papers_in_archive":5},{"url":"/dataset/rtasc","name":"RTASC","full_name":"ROBIN Technical Acquisition Speech Corpus","num_papers_in_archive":4},{"url":"/dataset/vietmed","name":"VietMed","full_name":"VietMed: A Dataset and Benchmark for Automatic Speech Recognition of Vietnamese in the Medical Domain","num_papers_in_archive":4},{"url":"/dataset/arzen","name":"ArzEn","full_name":"Corpus of Egyptian Arabic-English Code-switching","num_papers_in_archive":3},{"url":"/dataset/google-speech-commands-musan","name":"Google Speech Commands - Musan","full_name":"","num_papers_in_archive":3},{"url":"/dataset/librivoxdeen","name":"LibriVoxDeEn","full_name":"","num_papers_in_archive":3},{"url":"/dataset/nusacrowd","name":"NusaCrowd","full_name":"","num_papers_in_archive":3},{"url":"/dataset/odsqa","name":"ODSQA","full_name":"Open-Domain Spoken Question Answering","num_papers_in_archive":3},{"url":"/dataset/resd","name":"RESD","full_name":"Russian Emotional Speech Dialogs with annotated text","num_papers_in_archive":3},{"url":"/dataset/tal-corpus","name":"TaL Corpus","full_name":"The Tongue and Lips Corpus","num_papers_in_archive":3},{"url":"/dataset/zambezi-voice","name":"Zambezi Voice","full_name":"Zambezi Voice","num_papers_in_archive":3},{"url":"/dataset/av-digits-database","name":"AV Digits Database","full_name":"AV Digits Database","num_papers_in_archive":2},{"url":"/dataset/bd-4sk-asr","name":"BD-4SK-ASR","full_name":"Basic Dataset for Sorani Kurdish Automatic Speech Recognition","num_papers_in_archive":2},{"url":"/dataset/esb","name":"ESB","full_name":"End-to-End Speech Benchmark","num_papers_in_archive":2},{"url":"/dataset/golos","name":"GOLOS","full_name":"","num_papers_in_archive":2},{"url":"/dataset/jam-alt","name":"Jam-ALT","full_name":"JamALT: A Formatting-Aware Lyrics Transcription Benchmark","num_papers_in_archive":2},{"url":"/dataset/masri-headset","name":"MASRI-HEADSET","full_name":"","num_papers_in_archive":2},{"url":"/dataset/neurovoz","name":"NeuroVoz","full_name":"NeuroVoz: a Castillian Spanish corpus of parkinsonian speech","num_papers_in_archive":2},{"url":"/dataset/openslr","name":"OpenSLR","full_name":"Open Speech and Language Resources","num_papers_in_archive":2},{"url":"/dataset/tilde-model-corpus","name":"Tilde MODEL Corpus","full_name":"Tilde Multilingual Open Data for European Languages","num_papers_in_archive":2},{"url":"/dataset/arabic-speech-commands-dataset","name":"Arabic Speech Commands Dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/berst","name":"BERSt","full_name":"Basic Emotion Random phrase Shouts","num_papers_in_archive":1},{"url":"/dataset/cas-vsr-s101","name":"CAS-VSR-S101","full_name":"","num_papers_in_archive":1},{"url":"/dataset/crowdspeech","name":"CrowdSpeech","full_name":"","num_papers_in_archive":1},{"url":"/dataset/cuco-database","name":"CUCO Database","full_name":"A voice and speech corpus of patients who underwent upper airway surgery in pre-and post-operative states","num_papers_in_archive":1},{"url":"/dataset/deep-voice-deepfake-voice-recognition","name":"DEEP-VOICE: DeepFake Voice Recognition","full_name":"Jordan Bird","num_papers_in_archive":1},{"url":"/dataset/emospeech","name":"EmoSpeech","full_name":"","num_papers_in_archive":1},{"url":"/dataset/fongbe-speech-recognition","name":"Fongbe  audio","full_name":"Fongbe dataset","num_papers_in_archive":1},{"url":"/dataset/ft-speech","name":"FT Speech","full_name":"","num_papers_in_archive":1},{"url":"/dataset/i3-video","name":"i3-video","full_name":"is-it-instructional-video","num_papers_in_archive":1},{"url":"/dataset/kite","name":"Kite","full_name":"","num_papers_in_archive":1},{"url":"/dataset/medibeng","name":"MediBeng","full_name":"Synthetic Code-Switched Bengali-English Speech Conversations for Healthcare Applications","num_papers_in_archive":1},{"url":"/dataset/msner","name":"MSNER","full_name":"Multilingual Spoken Named Entity Recognition","num_papers_in_archive":1},{"url":"/dataset/persian-preschool-cognition-speech","name":"Persian Preschool Cognition Speech","full_name":"","num_papers_in_archive":1},{"url":"/dataset/radiotalk","name":"RadioTalk","full_name":"","num_papers_in_archive":1},{"url":"/dataset/united-syn-med","name":"United-Syn-Med","full_name":"","num_papers_in_archive":1},{"url":"/dataset/vaksancayah","name":"Vāksañcayaḥ","full_name":"Sanskrit Speech Corpus by IIT Bombay","num_papers_in_archive":1},{"url":"/dataset/aidatatang-200zh","name":"aidatatang_200zh","full_name":"aidatatang_200zh","num_papers_in_archive":0}],"subtasks":[{"url":"/task/accented-speech-recognition","name":"Accented Speech Recognition"},{"url":"/task/automatic-lyrics-transcription","name":"Automatic Lyrics Transcription"},{"url":"/task/automatic-speech-recognition","name":"Automatic Speech Recognition (ASR)"},{"url":"/task/distant-speech-recognition","name":"Distant Speech Recognition"},{"url":"/task/english-conversational-speech-recognition","name":"English Conversational Speech Recognition"},{"url":"/task/noisy-speech-recognition","name":"Noisy Speech Recognition"},{"url":"/task/robust-speech-recognition","name":"Robust Speech Recognition"},{"url":"/task/sequence-to-sequence-speech-recognition","name":"Sequence-To-Sequence Speech Recognition"},{"url":"/task/speech-language-identification","name":"Speech Language Identification"},{"url":"/task/target-speaker-extraction","name":"Target Speaker Extraction"},{"url":"/task/visual-speech-recognition","name":"Visual Speech Recognition"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":1373,"tagged_in_all":6433,"items":[{"url":"/paper/communication-efficient-learning-of-deep","title":"Communication-Efficient Learning of Deep Networks from Decentralized Data","date":"2016-02-17","arxiv_id":"1602.05629","repositories_listed":41,"syntology":{"n":77,"n_ran":40,"n_unverified":37,"n_pointer_only":50}},{"url":"/paper/listen-attend-and-spell","title":"Listen, Attend and Spell","date":"2015-08-05","arxiv_id":"1508.01211","repositories_listed":40,"syntology":{"n":51,"n_ran":12,"n_unverified":39,"n_pointer_only":9}},{"url":"/paper/speech-commands-a-dataset-for-limited","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","date":"2018-04-09","arxiv_id":"1804.03209","repositories_listed":35,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/deep-speech-2-end-to-end-speech-recognition","title":"Deep Speech 2: End-to-End Speech Recognition in English and Mandarin","date":"2015-12-08","arxiv_id":"1512.02595","repositories_listed":35,"syntology":{"n":39,"n_ran":2,"n_unverified":37,"n_pointer_only":0}},{"url":"/paper/specaugment-a-simple-data-augmentation-method","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition","date":"2019-04-18","arxiv_id":"1904.08779","repositories_listed":30,"syntology":{"n":18,"n_ran":1,"n_unverified":17,"n_pointer_only":0}},{"url":"/paper/wav2vec-2-0-a-framework-for-self-supervised","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","date":"2020-06-20","arxiv_id":"2006.11477","repositories_listed":25,"syntology":{"n":9,"n_ran":2,"n_unverified":7,"n_pointer_only":2}},{"url":"/paper/conformer-convolution-augmented-transformer","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","date":"2020-05-16","arxiv_id":"2005.08100","repositories_listed":25,"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":2}},{"url":"/paper/deep-speech-scaling-up-end-to-end-speech","title":"Deep Speech: Scaling up end-to-end speech recognition","date":"2014-12-17","arxiv_id":"1412.5567","repositories_listed":24,"syntology":{"n":9,"n_ran":9,"n_unverified":0,"n_pointer_only":8}},{"url":"/paper/recurrent-neural-network-regularization","title":"Recurrent Neural Network Regularization","date":"2014-09-08","arxiv_id":"1409.2329","repositories_listed":21,"syntology":{"n":6,"n_ran":2,"n_unverified":4,"n_pointer_only":6}},{"url":"/paper/split-computing-and-early-exiting-for-deep","title":"Split Computing and Early Exiting for Deep Learning Applications: Survey and Research Challenges","date":"2021-03-08","arxiv_id":"2103.04505","repositories_listed":19,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/lstm-a-search-space-odyssey","title":"LSTM: A Search Space Odyssey","date":"2015-03-13","arxiv_id":"1503.04069","repositories_listed":17,"syntology":null},{"url":"/paper/snips-voice-platform-an-embedded-spoken","title":"Snips Voice Platform: an embedded Spoken Language Understanding system for private-by-design voice interfaces","date":"2018-05-25","arxiv_id":"1805.10190","repositories_listed":16,"syntology":{"n":15,"n_ran":1,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/robust-speech-recognition-via-large-scale-1","title":"Robust Speech Recognition via Large-Scale Weak Supervision","date":"2022-12-06","arxiv_id":"2212.04356","repositories_listed":15,"syntology":{"n":59,"n_ran":5,"n_unverified":54,"n_pointer_only":18}},{"url":"/paper/improved-training-of-end-to-end-attention","title":"Improved training of end-to-end attention models for speech recognition","date":"2018-05-08","arxiv_id":"1805.03294","repositories_listed":14,"syntology":{"n":12,"n_ran":0,"n_unverified":12,"n_pointer_only":0}},{"url":"/paper/a-baseline-for-detecting-misclassified-and","title":"A Baseline for Detecting Misclassified and Out-of-Distribution Examples in Neural Networks","date":"2016-10-07","arxiv_id":"1610.02136","repositories_listed":14,"syntology":{"n":21,"n_ran":7,"n_unverified":14,"n_pointer_only":6}},{"url":"/paper/attention-based-models-for-speech-recognition","title":"Attention-Based Models for Speech Recognition","date":"2015-06-24","arxiv_id":"1506.07503","repositories_listed":14,"syntology":null},{"url":"/paper/data2vec-a-general-framework-for-self-1","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","date":"2022-02-07","arxiv_id":"2202.03555","repositories_listed":12,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/hubert-self-supervised-speech-representation","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","date":"2021-06-14","arxiv_id":"2106.07447","repositories_listed":11,"syntology":{"n":9,"n_ran":0,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/the-pytorch-kaldi-speech-recognition-toolkit","title":"The PyTorch-Kaldi Speech Recognition Toolkit","date":"2018-11-19","arxiv_id":"1811.07453","repositories_listed":11,"syntology":{"n":6,"n_ran":5,"n_unverified":1,"n_pointer_only":6}},{"url":"/paper/keyword-transformer-a-self-attention-model","title":"Keyword Transformer: A Self-Attention Model for Keyword Spotting","date":"2021-04-01","arxiv_id":"2104.00769","repositories_listed":10,"syntology":{"n":16,"n_ran":1,"n_unverified":15,"n_pointer_only":0}},{"url":"/paper/jasper-an-end-to-end-convolutional-neural","title":"Jasper: An End-to-End Convolutional Neural Acoustic Model","date":"2019-04-05","arxiv_id":"1904.03288","repositories_listed":10,"syntology":null},{"url":"/paper/wavlm-large-scale-self-supervised-pre","title":"WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing","date":"2021-10-26","arxiv_id":"2110.13900","repositories_listed":9,"syntology":null},{"url":"/paper/wav2letter-an-end-to-end-convnet-based-speech","title":"Wav2Letter: an End-to-End ConvNet-based Speech Recognition System","date":"2016-09-11","arxiv_id":"1609.03193","repositories_listed":9,"syntology":null},{"url":"/paper/scheduled-sampling-for-sequence-prediction","title":"Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks","date":"2015-06-09","arxiv_id":"1506.03099","repositories_listed":9,"syntology":{"n":8,"n_ran":0,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/efficiently-modeling-long-sequences-with-1","title":"Efficiently Modeling Long Sequences with Structured State Spaces","date":"2021-10-31","arxiv_id":"2111.00396","repositories_listed":8,"syntology":{"n":55,"n_ran":28,"n_unverified":27,"n_pointer_only":3}},{"url":"/paper/unsupervised-cross-lingual-representation-3","title":"Unsupervised Cross-lingual Representation Learning for Speech Recognition","date":"2020-06-24","arxiv_id":"2006.13979","repositories_listed":8,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/wav2letter-the-fastest-open-source-speech","title":"wav2letter++: The Fastest Open-source Speech Recognition System","date":"2018-12-18","arxiv_id":"1812.07625","repositories_listed":8,"syntology":null},{"url":"/paper/joint-ctc-attention-based-end-to-end-speech","title":"Joint CTC-Attention based End-to-End Speech Recognition using Multi-task Learning","date":"2016-09-21","arxiv_id":"1609.06773","repositories_listed":8,"syntology":{"n":10,"n_ran":0,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/reproducing-whisper-style-training-using-an","title":"Reproducing Whisper-Style Training Using an Open-Source Toolkit and Publicly Available Data","date":"2023-09-25","arxiv_id":"2309.13876","repositories_listed":7,"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/tera-self-supervised-learning-of-transformer","title":"TERA: Self-Supervised Learning of Transformer Encoder Representation for Speech","date":"2020-07-12","arxiv_id":"2007.06028","repositories_listed":7,"syntology":{"n":14,"n_ran":5,"n_unverified":9,"n_pointer_only":0}}],"syntology_records":24,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}