{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/speechstew-simply-mix-all-available-speech","title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network","arxiv_id":"2104.02133","date":"2021-04-05","proceeding":null,"authors":["William Chan","Daniel Park","Chris Lee","Yu Zhang","Quoc Le","Mohammad Norouzi"],"abstract":"We present SpeechStew, a speech recognition model that is trained on a combination of various publicly available speech recognition datasets: AMI, Broadcast News, Common Voice, LibriSpeech, Switchboard/Fisher, Tedlium, and Wall Street Journal. SpeechStew simply mixes all of these datasets together, without any special re-weighting or re-balancing of the datasets. SpeechStew achieves SoTA or near SoTA results across a variety of tasks, without the use of an external language model. Our results include 9.0\\% WER on AMI-IHM, 4.7\\% WER on Switchboard, 8.3\\% WER on CallHome, and 1.3\\% on WSJ, which significantly outperforms prior work with strong external language models. We also demonstrate that SpeechStew learns powerful transfer learning representations. We fine-tune SpeechStew on a noisy low resource speech dataset, CHiME-6. We achieve 38.9\\% WER without a language model, which compares to 38.6\\% WER to a strong HMM baseline with a language model.","url_abs":"https://arxiv.org/abs/2104.02133v3","url_pdf":"https://arxiv.org/pdf/2104.02133v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"all","task_name":"All"},{"task_slug":"language-modeling","task_name":"Language Modeling"},{"task_slug":"language-modelling","task_name":"Language Modelling"},{"task_slug":"speech-recognition","task_name":"Speech Recognition"},{"task_slug":"transfer-learning","task_name":"Transfer Learning"},{"task_slug":"speech-recognition-1","task_name":"speech-recognition"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/speech-recognition-on-ami-imh","task":"Speech Recognition","dataset":"AMI IMH","model":"SpeechStew (100M)","rank_in_archive_order":2,"of":2,"metrics":{"Word Error Rate (WER)":"9"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-ami-sdm1","task":"Speech Recognition","dataset":"AMI SDM1","model":"SpeechStew (100M)","rank_in_archive_order":2,"of":2,"metrics":{"Word Error Rate (WER)":"21.7"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-chime-6-dev-gss12","task":"Speech Recognition","dataset":"CHiME-6 dev_gss12","model":"SpeechStew (1B)","rank_in_archive_order":3,"of":4,"metrics":{"Word Error Rate (WER)":"31.9"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-chime-6-eval","task":"Speech Recognition","dataset":"CHiME-6 eval","model":"SpeechStew (1B)","rank_in_archive_order":3,"of":3,"metrics":{"Word Error Rate (WER)":"38.9"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-common-voice-2","task":"Speech Recognition","dataset":"Common Voice","model":"SpeechStew (1B)","rank_in_archive_order":2,"of":2,"metrics":{"Test WER":"10.8%"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-librispeech-test-clean","task":"Speech Recognition","dataset":"LibriSpeech test-clean","model":"SpeechStew (1B)","rank_in_archive_order":9,"of":64,"metrics":{"Word Error Rate (WER)":"1.7"},"uses_additional_data":true},{"leaderboard":"/sota/speech-recognition-on-librispeech-test-clean","task":"Speech Recognition","dataset":"LibriSpeech test-clean","model":"SpeechStew (100M)","rank_in_archive_order":23,"of":64,"metrics":{"Word Error Rate (WER)":"2.0"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-librispeech-test-other","task":"Speech Recognition","dataset":"LibriSpeech test-other","model":"SpeechStew (1B)","rank_in_archive_order":9,"of":53,"metrics":{"Word Error Rate (WER)":"3.3"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-librispeech-test-other","task":"Speech Recognition","dataset":"LibriSpeech test-other","model":"SpeechStew (100M)","rank_in_archive_order":16,"of":53,"metrics":{"Word Error Rate (WER)":"4.0"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-switchboard-callhome","task":"Speech Recognition","dataset":"Switchboard CallHome","model":"SpeechStew (100M)","rank_in_archive_order":1,"of":1,"metrics":{"Word Error Rate (WER)":"8.3"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-switchboard-swbd","task":"Speech Recognition","dataset":"Switchboard SWBD","model":"SpeechStew (100M)","rank_in_archive_order":1,"of":1,"metrics":{"Word Error Rate (WER)":"4.7"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-tedlium","task":"Speech Recognition","dataset":"Tedlium","model":"SpeechStew (100M)","rank_in_archive_order":4,"of":4,"metrics":{"Word Error Rate (WER)":"5.3"},"uses_additional_data":false},{"leaderboard":"/sota/speech-recognition-on-wsj-eval92","task":"Speech Recognition","dataset":"WSJ eval92","model":"Speechstew 100M","rank_in_archive_order":1,"of":17,"metrics":{"Word Error Rate (WER)":"1.3"},"uses_additional_data":true}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2104.02133","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}