{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/mediaspeech-multilanguage-asr-benchmark-and","title":"MediaSpeech: Multilanguage ASR Benchmark and Dataset","arxiv_id":"2103.16193","date":"2021-03-30","proceeding":null,"authors":["Rostislav Kolobov","Olga Okhapkina","Olga Omelchishina","Andrey Platunov","Roman Bedyakin","Vyacheslav Moshkin","Dmitry Menshikov","Nikolay Mikhaylovskiy"],"abstract":"The performance of automated speech recognition (ASR) systems is well known to differ for varied application domains. At the same time, vendors and research groups typically report ASR quality results either for limited use simplistic domains (audiobooks, TED talks), or proprietary datasets. To fill this gap, we provide an open-source 10-hour ASR system evaluation dataset NTR MediaSpeech for 4 languages: Spanish, French, Turkish and Arabic. The dataset was collected from the official youtube channels of media in the respective languages, and manually transcribed. We estimate that the WER of the dataset is under 5%. We have benchmarked many ASR systems available both commercially and freely, and provide the benchmark results. We also open-source baseline QuartzNet models for each language.","url_abs":"https://arxiv.org/abs/2103.16193v1","url_pdf":"https://arxiv.org/pdf/2103.16193v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"mediaspeech-multilanguage-asr-benchmark-and","repo_url":"https://github.com/NTRLab/MediaSpeech","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"ok"}}],"tasks":[{"task_slug":"speech-recognition","task_name":"Speech Recognition"},{"task_slug":"speech-recognition-1","task_name":"speech-recognition"}],"methods":[],"datasets_introduced":[{"slug":"mediaspeech","name":"MediaSpeech","full_name":""}],"methods_introduced":[],"results":[{"leaderboard":"/sota/speech-recognition-on-mediaspeech","task":"Speech Recognition","dataset":"MediaSpeech","model":"Quartznet","rank_in_archive_order":1,"of":8,"metrics":{"WER for Arabic":"0.1300","WER for French":"0.1915","WER for Spanish":"0.1826","WER for Turkish":"0.1422"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-mediaspeech","task":"Speech Recognition","dataset":"MediaSpeech","model":"Wit","rank_in_archive_order":2,"of":8,"metrics":{"WER for Arabic":"0.2333","WER for French":"0.1759","WER for Spanish":"0.0879","WER for Turkish":"0.0768"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-mediaspeech","task":"Speech Recognition","dataset":"MediaSpeech","model":"Azure","rank_in_archive_order":3,"of":8,"metrics":{"WER for Arabic":"0.3016","WER for French":"0.1683","WER for Spanish":"0.1296","WER for Turkish":"0.2296"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-mediaspeech","task":"Speech Recognition","dataset":"MediaSpeech","model":"VOSK","rank_in_archive_order":4,"of":8,"metrics":{"WER for Arabic":"0.3085","WER for French":"0.2111","WER for Spanish":"0.1970","WER for Turkish":"0.3050"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-mediaspeech","task":"Speech Recognition","dataset":"MediaSpeech","model":"Google","rank_in_archive_order":5,"of":8,"metrics":{"WER for Arabic":"0.4464","WER for French":"0.2385","WER for Spanish":"0.2176","WER for Turkish":"0.2707"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-mediaspeech","task":"Speech Recognition","dataset":"MediaSpeech","model":"wav2vec","rank_in_archive_order":6,"of":8,"metrics":{"WER for Arabic":"0.9596","WER for French":"0.3113","WER for Spanish":"0.2469","WER for Turkish":"0.5812"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-mediaspeech","task":"Speech Recognition","dataset":"MediaSpeech","model":"Deepspeech","rank_in_archive_order":7,"of":8,"metrics":{"WER for French":"0.4741","WER for Spanish":"0.4236"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-mediaspeech","task":"Speech Recognition","dataset":"MediaSpeech","model":"Silero","rank_in_archive_order":8,"of":8,"metrics":{"WER for Spanish":"0.3070"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":"https://app.syntology.ai/?focus=2103.16193","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}