{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/deep-audio-visual-speech-recognition","title":"Deep Audio-Visual Speech Recognition","arxiv_id":"1809.02108","date":"2018-09-06","proceeding":null,"authors":["Triantafyllos Afouras","Joon Son Chung","Andrew Senior","Oriol Vinyals","Andrew Zisserman"],"abstract":"The goal of this work is to recognise phrases and sentences being spoken by a\ntalking face, with or without the audio. Unlike previous works that have\nfocussed on recognising a limited number of words or phrases, we tackle lip\nreading as an open-world problem - unconstrained natural language sentences,\nand in the wild videos. Our key contributions are: (1) we compare two models\nfor lip reading, one using a CTC loss, and the other using a\nsequence-to-sequence loss. Both models are built on top of the transformer\nself-attention architecture; (2) we investigate to what extent lip reading is\ncomplementary to audio speech recognition, especially when the audio signal is\nnoisy; (3) we introduce and publicly release a new dataset for audio-visual\nspeech recognition, LRS2-BBC, consisting of thousands of natural sentences from\nBritish television. The models that we train surpass the performance of all\nprevious work on a lip reading benchmark dataset by a significant margin.","url_abs":"http://arxiv.org/abs/1809.02108v2","url_pdf":"http://arxiv.org/pdf/1809.02108v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"deep-audio-visual-speech-recognition","repo_url":"https://github.com/amitai1992/AutomatedLipReading","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"ok"}},{"paper_slug":"deep-audio-visual-speech-recognition","repo_url":"https://github.com/exgc/avmust-ted","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"deep-audio-visual-speech-recognition","repo_url":"https://github.com/lordmartian/deep_avsr","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"deep-audio-visual-speech-recognition","repo_url":"https://github.com/smeetrs/deep_avsr","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}}],"tasks":[{"task_slug":"audio-visual-speech-recognition","task_name":"Audio-Visual Speech Recognition"},{"task_slug":"automatic-speech-recognition","task_name":"Automatic Speech Recognition (ASR)"},{"task_slug":"lip-reading","task_name":"Lip Reading"},{"task_slug":"lipreading","task_name":"Lipreading"},{"task_slug":"speech-recognition","task_name":"Speech Recognition"},{"task_slug":"visual-speech-recognition","task_name":"Visual Speech Recognition"},{"task_slug":"speech-recognition-1","task_name":"speech-recognition"}],"methods":[{"method_slug":"ctc-loss","method_name":"CTC Loss"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/audio-visual-speech-recognition-on-lrs2","task":"Audio-Visual Speech Recognition","dataset":"LRS2","model":"TM-CTC","rank_in_archive_order":7,"of":8,"metrics":{"Test WER":"8.2"},"uses_additional_data":false},{"leaderboard":"/sota/audio-visual-speech-recognition-on-lrs2","task":"Audio-Visual Speech Recognition","dataset":"LRS2","model":"TM-Seq2seq","rank_in_archive_order":8,"of":8,"metrics":{"Test WER":"8.5"},"uses_additional_data":false},{"leaderboard":"/sota/audio-visual-speech-recognition-on-lrs3-ted","task":"Audio-Visual Speech Recognition","dataset":"LRS3-TED","model":"TM-seq2seq","rank_in_archive_order":12,"of":12,"metrics":{"Word Error Rate (WER)":"7.2"},"uses_additional_data":true},{"leaderboard":"/sota/automatic-speech-recognition-on-lrs2","task":"Automatic Speech Recognition (ASR)","dataset":"LRS2","model":"TM-seq2seq","rank_in_archive_order":8,"of":9,"metrics":{"Test WER":"9.7"},"uses_additional_data":false},{"leaderboard":"/sota/automatic-speech-recognition-on-lrs2","task":"Automatic Speech Recognition (ASR)","dataset":"LRS2","model":"TM-CTC","rank_in_archive_order":9,"of":9,"metrics":{"Test WER":"10.1"},"uses_additional_data":false},{"leaderboard":"/sota/lipreading-on-lrs2","task":"Lipreading","dataset":"LRS2","model":"TM-seq2seq + extLM","rank_in_archive_order":19,"of":25,"metrics":{"Word Error Rate (WER)":"48.3"},"uses_additional_data":true},{"leaderboard":"/sota/lipreading-on-lrs2","task":"Lipreading","dataset":"LRS2","model":"TM-CTC + extLM","rank_in_archive_order":24,"of":25,"metrics":{"Word Error Rate (WER)":"54.7"},"uses_additional_data":true},{"leaderboard":"/sota/lipreading-on-lrs3-ted","task":"Lipreading","dataset":"LRS3-TED","model":"TM-seq2seq","rank_in_archive_order":21,"of":23,"metrics":{"Word Error Rate (WER)":"58.9"},"uses_additional_data":true}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1809.02108","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}