{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/trans-blstm-transformer-with-bidirectional","title":"TRANS-BLSTM: Transformer with Bidirectional LSTM for Language Understanding","arxiv_id":"2003.07000","date":"2020-03-16","proceeding":null,"authors":["Zhiheng Huang","Peng Xu","Davis Liang","Ajay Mishra","Bing Xiang"],"abstract":"Bidirectional Encoder Representations from Transformers (BERT) has recently achieved state-of-the-art performance on a broad range of NLP tasks including sentence classification, machine translation, and question answering. The BERT model architecture is derived primarily from the transformer. Prior to the transformer era, bidirectional Long Short-Term Memory (BLSTM) has been the dominant modeling architecture for neural machine translation and question answering. In this paper, we investigate how these two modeling techniques can be combined to create a more powerful model architecture. We propose a new architecture denoted as Transformer with BLSTM (TRANS-BLSTM) which has a BLSTM layer integrated to each transformer block, leading to a joint modeling framework for transformer and BLSTM. We show that TRANS-BLSTM models consistently lead to improvements in accuracy compared to BERT baselines in GLUE and SQuAD 1.1 experiments. Our TRANS-BLSTM model obtains an F1 score of 94.01% on the SQuAD 1.1 development dataset, which is comparable to the state-of-the-art result.","url_abs":"https://arxiv.org/abs/2003.07000v1","url_pdf":"https://arxiv.org/pdf/2003.07000v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"machine-translation","task_name":"Machine Translation"},{"task_slug":"natural-language-inference","task_name":"Natural Language Inference"},{"task_slug":"paraphrase-identification","task_name":"Paraphrase Identification"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"sentence","task_name":"Sentence"},{"task_slug":"sentence-classification","task_name":"Sentence Classification"},{"task_slug":"text-classification","task_name":"Text Classification"},{"task_slug":"translation","task_name":"Translation"}],"methods":[{"method_slug":"absolute-position-encodings","method_name":"Absolute Position Encodings"},{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"bert","method_name":"BERT"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"label-smoothing","method_name":"Label Smoothing"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"linear-warmup-with-linear-decay","method_name":"Linear Warmup With Linear Decay"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"position-wise-feed-forward-layer","method_name":"Position-Wise Feed-Forward Layer"},{"method_slug":"relu","method_name":"ReLU"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"transformer","method_name":"Transformer"},{"method_slug":"weight-decay","method_name":"Weight Decay"},{"method_slug":"wordpiece","method_name":"WordPiece"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/natural-language-inference-on-qnli","task":"Natural Language Inference","dataset":"QNLI","model":"TRANS-BLSTM","rank_in_archive_order":18,"of":43,"metrics":{"Accuracy":"94.08%"},"uses_additional_data":false},{"leaderboard":"/sota/paraphrase-identification-on-quora-question","task":"Paraphrase Identification","dataset":"Quora Question Pairs","model":"TRANS-BLSTM","rank_in_archive_order":24,"of":31,"metrics":{"Accuracy":"88.28"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-glue-cola","task":"Text Classification","dataset":"GLUE COLA","model":"TRANS-BLSTM","rank_in_archive_order":1,"of":1,"metrics":{},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-glue-mrpc","task":"Text Classification","dataset":"GLUE MRPC","model":"TRANS-BLSTM","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"90.45"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-glue-rte","task":"Text Classification","dataset":"GLUE RTE","model":"TRANS-BLSTM","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"79.78"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-glue-sst2","task":"Text Classification","dataset":"GLUE SST2","model":"TRANS-BLSTM","rank_in_archive_order":1,"of":2,"metrics":{"Accuracy":"94.38"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-glue-stsb","task":"Text Classification","dataset":"GLUE STSB","model":"TRANS-BLSTM","rank_in_archive_order":1,"of":1,"metrics":{},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2003.07000","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}