{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/convolutional-sequence-to-sequence-learning","title":"Convolutional Sequence to Sequence Learning","arxiv_id":"1705.03122","date":"2017-05-08","proceeding":"ICML 2017 8","authors":["Jonas Gehring","Michael Auli","David Grangier","Denis Yarats","Yann N. Dauphin"],"abstract":"The prevalent approach to sequence to sequence learning maps an input\nsequence to a variable length output sequence via recurrent neural networks. We\nintroduce an architecture based entirely on convolutional neural networks.\nCompared to recurrent models, computations over all elements can be fully\nparallelized during training and optimization is easier since the number of\nnon-linearities is fixed and independent of the input length. Our use of gated\nlinear units eases gradient propagation and we equip each decoder layer with a\nseparate attention module. We outperform the accuracy of the deep LSTM setup of\nWu et al. (2016) on both WMT'14 English-German and WMT'14 English-French\ntranslation at an order of magnitude faster speed, both on GPU and CPU.","url_abs":"http://arxiv.org/abs/1705.03122v3","url_pdf":"http://arxiv.org/pdf/1705.03122v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/facebookresearch/fairseq","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/CKPOON0619/Kaggle2Sigma","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/DavidHarar/Siamese-Networks-for-name-nickname-similarity","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/Deeksha96/Im2Latex","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/EdinburghNLP/XSum","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/Helsinki-NLP/OpenNMT-py","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/IBM/pytorch-seq2seq","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/Izecson/saml-nmt","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"mxnet","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/Izecson/sockeye-1.16.6","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/Kakoedlinnoeslovo/fairseq","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/MiuGod0126/ConvS2S_Paddle","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"paddle","reach":{"status":"ok","spdx":"Apache-2.0"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/Nick-Zhao-Engr/Machine-Translation","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/OpenNMT/OpenNMT-py","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/YizhuLiu/sumlen","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/ZurichNLP/sockeye","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"mxnet","reach":{"status":"ok","spdx":"Apache-2.0"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/albarji/neurowriter","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/alisterta/Persian-text-to-speech","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"ok"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/awslabs/sockeye","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"mxnet","reach":{"status":"ok","spdx":"Apache-2.0"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/bcmi220/esc4nmt","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/butsugiri/shape","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/cove-adml/adml-anon","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/facebookresearch/ParlAI","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/lucylow/En_francais_si_vous_plait-","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/memray/OpenNMT-kpg-release","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/midobal/OpenNMT-py","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/nrc-cnrc/sockeye-multisource","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"mxnet","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/oneTimePad/conv-nmt","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/phanideepgampa/IM2LATEX","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/richinkabra/CoVe-BCN","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/shashiongithub/XSum","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/siyuofzhou/CNNSeqToSeq","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"torch","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/stefannatu/NLP-Translation-Models","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/thinkwee/DPP_CNN_Summarization","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/umeiko/mindspore-seq2seq","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"mindspore","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/xingniu/sockeye","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"mxnet","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/yinghao1019/NLP_and_DL_practice","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"unanswered"}},{"paper_slug":"convolutional-sequence-to-sequence-learning","repo_url":"https://github.com/yinghao1019/NLP_and_DL_practice/blob/master/Conv_seq2seq.ipynb","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"bangla-spelling-error-correction","task_name":"Bangla Spelling Error Correction"},{"task_slug":null,"task_name":"CPU"},{"task_slug":"decoder","task_name":"Decoder"},{"task_slug":null,"task_name":"GPU"},{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"machine-translation","task_name":"Machine Translation"},{"task_slug":"translation","task_name":"Translation"}],"methods":[{"method_slug":"lstm","method_name":"LSTM"},{"method_slug":"sigmoid-activation","method_name":"Sigmoid Activation"},{"method_slug":"tanh-activation","method_name":"Tanh Activation"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/bangla-spelling-error-correction-on-dpcspell","task":"Bangla Spelling Error Correction","dataset":"DPCSpell-Bangla-SEC-Corpus","model":"ConvSeq2Seq","rank_in_archive_order":3,"of":4,"metrics":{"Exact Match Accuracy":"78.85%"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-mnist","task":"Image Classification","dataset":"MNIST","model":"CNN Model by Som","rank_in_archive_order":51,"of":81,"metrics":{"Accuracy":"98.59","Percentage error":"1.41"},"uses_additional_data":false},{"leaderboard":"/sota/machine-translation-on-iwslt2015-english","task":"Machine Translation","dataset":"IWSLT2015 English-German","model":"ConvS2S","rank_in_archive_order":6,"of":8,"metrics":{"BLEU score":"26.73"},"uses_additional_data":false},{"leaderboard":"/sota/machine-translation-on-iwslt2015-german","task":"Machine Translation","dataset":"IWSLT2015 German-English","model":"ConvS2S","rank_in_archive_order":6,"of":15,"metrics":{"BLEU score":"32.31"},"uses_additional_data":false},{"leaderboard":"/sota/machine-translation-on-wmt2014-english-french","task":"Machine Translation","dataset":"WMT2014 English-French","model":"ConvS2S (ensemble)","rank_in_archive_order":25,"of":57,"metrics":{"BLEU score":"41.3"},"uses_additional_data":false},{"leaderboard":"/sota/machine-translation-on-wmt2014-english-french","task":"Machine Translation","dataset":"WMT2014 English-French","model":"ConvS2S","rank_in_archive_order":33,"of":57,"metrics":{"BLEU score":"40.46","Hardware Burden":"143G"},"uses_additional_data":false},{"leaderboard":"/sota/machine-translation-on-wmt2014-english-german","task":"Machine Translation","dataset":"WMT2014 English-German","model":"ConvS2S (ensemble)","rank_in_archive_order":58,"of":91,"metrics":{"BLEU score":"26.4","Hardware Burden":"54G"},"uses_additional_data":false},{"leaderboard":"/sota/machine-translation-on-wmt2014-english-german","task":"Machine Translation","dataset":"WMT2014 English-German","model":"ConvS2S","rank_in_archive_order":70,"of":91,"metrics":{"BLEU score":"25.16","Hardware Burden":"72G"},"uses_additional_data":false},{"leaderboard":"/sota/machine-translation-on-wmt2016-english-1","task":"Machine Translation","dataset":"WMT2016 English-Romanian","model":"ConvS2S BPE40k","rank_in_archive_order":7,"of":21,"metrics":{"BLEU score":"29.9"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1705.03122","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}