{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/scribosermo-fast-speech-to-text-models-for","title":"Scribosermo: Fast Speech-to-Text models for German and other Languages","arxiv_id":"2110.07982","date":"2021-10-15","proceeding":null,"authors":["Daniel Bermuth","Alexander Poeppel","Wolfgang Reif"],"abstract":"Recent Speech-to-Text models often require a large amount of hardware resources and are mostly trained in English. This paper presents Speech-to-Text models for German, as well as for Spanish and French with special features: (a) They are small and run in real-time on microcontrollers like a RaspberryPi. (b) Using a pretrained English model, they can be trained on consumer-grade hardware with a relatively small dataset. (c) The models are competitive with other solutions and outperform them in German. In this respect, the models combine advantages of other approaches, which only include a subset of the presented features. Furthermore, the paper provides a new library for handling datasets, which is focused on easy extension with additional datasets and shows an optimized way for transfer-learning new languages using a pretrained model from another language with a similar alphabet.","url_abs":"https://arxiv.org/abs/2110.07982v1","url_pdf":"https://arxiv.org/pdf/2110.07982v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"scribosermo-fast-speech-to-text-models-for","repo_url":"https://gitlab.com/jaco-assistant/scribosermo","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"tf","reach":null},{"paper_slug":"scribosermo-fast-speech-to-text-models-for","repo_url":"https://gitlab.com/jaco-assistant/corcua","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"none","reach":null},{"paper_slug":"scribosermo-fast-speech-to-text-models-for","repo_url":"https://gitlab.com/Jaco-Assistant/deepspeech-polyglot","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":null}],"tasks":[{"task_slug":"speech-recognition","task_name":"Speech Recognition"},{"task_slug":"speech-to-text","task_name":"Speech-to-Text"},{"task_slug":"transfer-learning","task_name":"Transfer Learning"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/speech-recognition-on-common-voice-french","task":"Speech Recognition","dataset":"Common Voice French","model":"ConformerCTC-L (5-gram)","rank_in_archive_order":1,"of":8,"metrics":{"Test WER":"8.13%"},"uses_additional_data":true},{"leaderboard":"/sota/speech-recognition-on-common-voice-french","task":"Speech Recognition","dataset":"Common Voice French","model":"ConformerCTC-L (no-LM)","rank_in_archive_order":5,"of":8,"metrics":{"Test WER":"10.19 %"},"uses_additional_data":true},{"leaderboard":"/sota/speech-recognition-on-common-voice-french","task":"Speech Recognition","dataset":"Common Voice French","model":"QuartzNet15x5FR (D7)","rank_in_archive_order":6,"of":8,"metrics":{"Test WER":"11.0%"},"uses_additional_data":true},{"leaderboard":"/sota/speech-recognition-on-common-voice-french","task":"Speech Recognition","dataset":"Common Voice French","model":"QuartzNet15x5FR (CV-only)","rank_in_archive_order":7,"of":8,"metrics":{"Test WER":"12.1%"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-common-voice-german","task":"Speech Recognition","dataset":"Common Voice German","model":"ConformerCTC-L (5-gram)","rank_in_archive_order":3,"of":14,"metrics":{"Test CER":"1.37%","Test WER":"4.05%"},"uses_additional_data":true},{"leaderboard":"/sota/speech-recognition-on-common-voice-german","task":"Speech Recognition","dataset":"Common Voice German","model":"QuartzNet15x5DE (D37, 5-gram)","rank_in_archive_order":8,"of":14,"metrics":{"Test CER":"2.7%","Test WER":"6.6%"},"uses_additional_data":true},{"leaderboard":"/sota/speech-recognition-on-common-voice-german","task":"Speech Recognition","dataset":"Common Voice German","model":"ConformerCTC-L (no LM)","rank_in_archive_order":10,"of":14,"metrics":{"Test CER":"2.05%","Test WER":"7.33%"},"uses_additional_data":true},{"leaderboard":"/sota/speech-recognition-on-common-voice-german","task":"Speech Recognition","dataset":"Common Voice German","model":"QuartzNet15x5DE (CV-only, 5-gram)","rank_in_archive_order":11,"of":14,"metrics":{"Test CER":"3.2%","Test WER":"7.7%"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-common-voice-italian","task":"Speech Recognition","dataset":"Common Voice Italian","model":"QuartzNet15x5IT (D5)","rank_in_archive_order":2,"of":2,"metrics":{"Test WER":"11.5%"},"uses_additional_data":true},{"leaderboard":"/sota/speech-recognition-on-common-voice-spanish","task":"Speech Recognition","dataset":"Common Voice Spanish","model":"ConformerCTC-L (5-gram)","rank_in_archive_order":3,"of":8,"metrics":{"Test WER":"5.68%"},"uses_additional_data":true},{"leaderboard":"/sota/speech-recognition-on-common-voice-spanish","task":"Speech Recognition","dataset":"Common Voice Spanish","model":"ConformerCTC-L (no-LM)","rank_in_archive_order":5,"of":8,"metrics":{"Test WER":"7.46 %"},"uses_additional_data":true},{"leaderboard":"/sota/speech-recognition-on-common-voice-spanish","task":"Speech Recognition","dataset":"Common Voice Spanish","model":"QuartzNet15x5ES (D8)","rank_in_archive_order":6,"of":8,"metrics":{"Test WER":"10.0%"},"uses_additional_data":true},{"leaderboard":"/sota/speech-recognition-on-common-voice-spanish","task":"Speech Recognition","dataset":"Common Voice Spanish","model":"QuartzNet15x5ES (CV-only)","rank_in_archive_order":8,"of":8,"metrics":{"Test WER":"10.5%"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-tuda","task":"Speech Recognition","dataset":"TUDA","model":"QuartzNet15x5DE (D37)","rank_in_archive_order":3,"of":9,"metrics":{"Test WER":"10.2%"},"uses_additional_data":true}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}