{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/vietnamese-end-to-end-speech-recognition","title":"Vietnamese end-to-end speech recognition using wav2vec 2.0","arxiv_id":null,"date":"2021-09-02","proceeding":"https://github.com/vietai/ASR 2021 9","authors":["Thai Binh Nguyen"],"abstract":"Our models are pre-trained on 13k hours of Vietnamese youtube audio (un-label data) and fine-tuned on 250 hours labeled of VLSP ASR dataset on 16kHz sampled speech audio. We use wav2vec2 architecture for the pre-trained model. For fine-tuning phase, wav2vec2 is fine-tuned using Connectionist Temporal Classification (CTC), which is an algorithm that is used to train neural networks for sequence-to-sequence problems and mainly in Automatic Speech Recognition and handwriting recognition. On the Vivos dataset, we achieved a WER score of 6.15","url_abs":"https://github.com/vietai/ASR","url_pdf":"https://github.com/vietai/ASR","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"vietnamese-end-to-end-speech-recognition","repo_url":"https://github.com/vietai/ASR","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"automatic-speech-recognition-2","task_name":"Automatic Speech Recognition"},{"task_slug":"automatic-speech-recognition","task_name":"Automatic Speech Recognition (ASR)"},{"task_slug":"handwriting-recognition","task_name":"Handwriting Recognition"},{"task_slug":"speech-recognition","task_name":"Speech Recognition"},{"task_slug":"speech-recognition-1","task_name":"speech-recognition"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/speech-recognition-on-common-voice-vi","task":"Speech Recognition","dataset":"Common Voice vi","model":"Vietnamese end-to-end speech recognition using wav2vec 2.0 by VietAI","rank_in_archive_order":3,"of":3,"metrics":{"Test WER":"11.52"},"uses_additional_data":true},{"leaderboard":"/sota/speech-recognition-on-vivos","task":"Speech Recognition","dataset":"VIVOS","model":"Vietnamese end-to-end speech recognition using wav2vec 2.0 by VietAI","rank_in_archive_order":2,"of":3,"metrics":{"Test WER":"6.15"},"uses_additional_data":true}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}