{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/neurst-neural-speech-translation-toolkit","title":"NeurST: Neural Speech Translation Toolkit","arxiv_id":"2012.10018","date":"2020-12-18","proceeding":"ACL 2021 5","authors":["Chengqi Zhao","Mingxuan Wang","Qianqian Dong","Rong Ye","Lei LI"],"abstract":"NeurST is an open-source toolkit for neural speech translation. The toolkit mainly focuses on end-to-end speech translation, which is easy to use, modify, and extend to advanced speech translation research and products. NeurST aims at facilitating the speech translation research for NLP researchers and building reliable benchmarks for this field. It provides step-by-step recipes for feature extraction, data preprocessing, distributed training, and evaluation. In this paper, we will introduce the framework design of NeurST and show experimental results for different benchmark datasets, which can be regarded as reliable baselines for future research. The toolkit is publicly available at https://github.com/bytedance/neurst/ and we will continuously update the performance of NeurST with other counterparts and studies at https://st-benchmark.github.io/.","url_abs":"https://arxiv.org/abs/2012.10018v3","url_pdf":"https://arxiv.org/pdf/2012.10018v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"neurst-neural-speech-translation-toolkit","repo_url":"https://github.com/bytedance/neurst","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"tf","reach":{"status":"unanswered"}}],"tasks":[{"task_slug":"speech-to-text-translation","task_name":"Speech-to-Text Translation"},{"task_slug":"translation","task_name":"Translation"}],"methods":[{"method_slug":"absolute-position-encodings","method_name":"Absolute Position Encodings"},{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"label-smoothing","method_name":"Label Smoothing"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"position-wise-feed-forward-layer","method_name":"Position-Wise Feed-Forward Layer"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"transformer","method_name":"Transformer"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/speech-to-text-translation-on-must-c-en-de","task":"Speech-to-Text Translation","dataset":"MuST-C EN->DE","model":"Transformer + ASR Pretrain","rank_in_archive_order":7,"of":8,"metrics":{"Case-sensitive sacreBLEU":"22.8"},"uses_additional_data":false},{"leaderboard":"/sota/speech-to-text-translation-on-must-c-en-es","task":"Speech-to-Text Translation","dataset":"MuST-C EN->ES","model":"Transformer + ASR Pretrain + SpecAug","rank_in_archive_order":4,"of":5,"metrics":{"Case-sensitive sacreBLEU":"27.4"},"uses_additional_data":false},{"leaderboard":"/sota/speech-to-text-translation-on-must-c-en-es","task":"Speech-to-Text Translation","dataset":"MuST-C EN->ES","model":"Transformer + ASR Pretrain","rank_in_archive_order":5,"of":5,"metrics":{"Case-sensitive sacreBLEU":"26.8"},"uses_additional_data":false},{"leaderboard":"/sota/speech-to-text-translation-on-must-c-en-fr","task":"Speech-to-Text Translation","dataset":"MuST-C EN->FR","model":"Transformer + ASR Pretrain + SpecAug","rank_in_archive_order":2,"of":3,"metrics":{"Case-sensitive sacreBLEU":"33.3"},"uses_additional_data":false},{"leaderboard":"/sota/speech-to-text-translation-on-must-c-en-fr","task":"Speech-to-Text Translation","dataset":"MuST-C EN->FR","model":"Transformer + ASR Pretrain","rank_in_archive_order":3,"of":3,"metrics":{"Case-sensitive sacreBLEU":"32.3"},"uses_additional_data":false},{"leaderboard":"/sota/speech-to-text-translation-on-libri-trans","task":"Speech-to-Text Translation","dataset":"libri-trans","model":"Transformer + ASR Pretrain + SpecAug","rank_in_archive_order":1,"of":2,"metrics":{"Case-insensitive sacreBLEU":"17.2","Case-insensitive tokenized BLEU":"18.7","Case-sensitive sacreBLEU":"16.3","Case-sensitive tokenized BLEU":"17.8"},"uses_additional_data":false},{"leaderboard":"/sota/speech-to-text-translation-on-libri-trans","task":"Speech-to-Text Translation","dataset":"libri-trans","model":"Transformer + ASR Pretrain","rank_in_archive_order":2,"of":2,"metrics":{"Case-insensitive sacreBLEU":"16.5","Case-insensitive tokenized BLEU":"17.9","Case-sensitive sacreBLEU":"15.5","Case-sensitive tokenized BLEU":"16.9"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2012.10018","atlas_url":"https://app.syntology.ai/?focus=2012.10018","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}