{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/audio-visual-speech-recognition-with-a-hybrid","title":"Audio-Visual Speech Recognition With A Hybrid CTC/Attention Architecture","arxiv_id":"1810.00108","date":"2018-09-28","proceeding":null,"authors":["Stavros Petridis","Themos Stafylakis","Pingchuan Ma","Georgios Tzimiropoulos","Maja Pantic"],"abstract":"Recent works in speech recognition rely either on connectionist temporal\nclassification (CTC) or sequence-to-sequence models for character-level\nrecognition. CTC assumes conditional independence of individual characters,\nwhereas attention-based models can provide nonsequential alignments. Therefore,\nwe could use a CTC loss in combination with an attention-based model in order\nto force monotonic alignments and at the same time get rid of the conditional\nindependence assumption. In this paper, we use the recently proposed hybrid\nCTC/attention architecture for audio-visual recognition of speech in-the-wild.\nTo the best of our knowledge, this is the first time that such a hybrid\narchitecture architecture is used for audio-visual recognition of speech. We\nuse the LRS2 database and show that the proposed audio-visual model leads to an\n1.3% absolute decrease in word error rate over the audio-only model and\nachieves the new state-of-the-art performance on LRS2 database (7% word error\nrate). We also observe that the audio-visual model significantly outperforms\nthe audio-based model (up to 32.9% absolute improvement in word error rate) for\nseveral different types of noise as the signal-to-noise ratio decreases.","url_abs":"http://arxiv.org/abs/1810.00108v1","url_pdf":"http://arxiv.org/pdf/1810.00108v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"audio-visual-speech-recognition","task_name":"Audio-Visual Speech Recognition"},{"task_slug":"automatic-speech-recognition","task_name":"Automatic Speech Recognition (ASR)"},{"task_slug":"lipreading","task_name":"Lipreading"},{"task_slug":"speech-recognition","task_name":"Speech Recognition"},{"task_slug":"visual-speech-recognition","task_name":"Visual Speech Recognition"},{"task_slug":"speech-recognition-1","task_name":"speech-recognition"}],"methods":[{"method_slug":"ctc-loss","method_name":"CTC Loss"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/audio-visual-speech-recognition-on-lrs2","task":"Audio-Visual Speech Recognition","dataset":"LRS2","model":"CTC/Attention","rank_in_archive_order":6,"of":8,"metrics":{"Test WER":"7.0"},"uses_additional_data":false},{"leaderboard":"/sota/automatic-speech-recognition-on-lrs2","task":"Automatic Speech Recognition (ASR)","dataset":"LRS2","model":"CTC/attention","rank_in_archive_order":7,"of":9,"metrics":{"Test WER":"8.2"},"uses_additional_data":false},{"leaderboard":"/sota/lipreading-on-lrs2","task":"Lipreading","dataset":"LRS2","model":"Hybrid CTC / Attention","rank_in_archive_order":21,"of":25,"metrics":{"Word Error Rate (WER)":"50"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":"https://app.syntology.ai/?focus=1810.00108","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}