{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/automatic-speech-recognition-in-german-a","title":"Automatic Speech Recognition in German: A Detailed Error Analysis","arxiv_id":null,"date":"2022-08-03","proceeding":"IEEE International Conference on Omni-layer Intelligent Systems (COINS) 2022 8","authors":["Johannes Wirth","René Peinl"],"abstract":"The amount of freely available systems for automatic speech recognition (ASR) based on neural networks is growing steadily, with equally increasingly reliable predictions. However, the evaluation of trained models is typically exclusively based on statistical metrics such as WER or CER, which do not provide any insight into the nature or impact of the errors produced when predicting transcripts from speech input. This work presents a selection of ASR model architectures that are pretrained on the German language and evaluates them on a benchmark of diverse test datasets. It identifies cross-architectural prediction errors, classifies those into categories and traces the sources of errors per category back into training data as well as other sources. Finally, it discusses solutions in order to create qualitatively better training datasets and more robust ASR systems.","url_abs":"https://ieeexplore.ieee.org/abstract/document/9854978/","url_pdf":"https://arxiv.org/ftp/arxiv/papers/2204/2204.05617.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"automatic-speech-recognition-2","task_name":"Automatic Speech Recognition"},{"task_slug":"automatic-speech-recognition","task_name":"Automatic Speech Recognition (ASR)"},{"task_slug":"speech-recognition","task_name":"Speech Recognition"},{"task_slug":"speech-recognition-1","task_name":"speech-recognition"}],"methods":[{"method_slug":"test","method_name":"Test"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/automatic-speech-recognition-on-hui","task":"Automatic Speech Recognition (ASR)","dataset":"HUI speech corpus","model":"Conformer Transducer","rank_in_archive_order":1,"of":1,"metrics":{"WER (%)":"1.89%"},"uses_additional_data":true},{"leaderboard":"/sota/automatic-speech-recognition-on-m-ailabs","task":"Automatic Speech Recognition (ASR)","dataset":"M-AILabs speech dataset","model":"Conformer Transducer","rank_in_archive_order":1,"of":1,"metrics":{"WER (%)":"4.28%"},"uses_additional_data":true},{"leaderboard":"/sota/automatic-speech-recognition-on-the-spoken","task":"Automatic Speech Recognition (ASR)","dataset":"The Spoken Wikipedia Corpora","model":"Conformer Transducer","rank_in_archive_order":1,"of":1,"metrics":{"WER (%)":"8.04%"},"uses_additional_data":true},{"leaderboard":"/sota/automatic-speech-recognition-on-voxpopuli","task":"Automatic Speech Recognition (ASR)","dataset":"VoxPopuli","model":"Conformer Transducer (German)","rank_in_archive_order":1,"of":1,"metrics":{"WER (%)":"8.98%"},"uses_additional_data":true},{"leaderboard":"/sota/automatic-speech-recognition-on-voxforge","task":"Automatic Speech Recognition (ASR)","dataset":"Voxforge German","model":"Conformer Transducer","rank_in_archive_order":1,"of":1,"metrics":{"WER (%)":"3.36%"},"uses_additional_data":true},{"leaderboard":"/sota/speech-recognition-on-common-voice-german","task":"Speech Recognition","dataset":"Common Voice German","model":"Conformer Transducer (no LM)","rank_in_archive_order":6,"of":14,"metrics":{"Test WER":"6.28%"},"uses_additional_data":true},{"leaderboard":"/sota/speech-recognition-on-tuda","task":"Speech Recognition","dataset":"TUDA","model":"Conformer-Transducer (no LM)","rank_in_archive_order":1,"of":9,"metrics":{"Test WER":"5.82%"},"uses_additional_data":true}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}