{"url":"/method/sandwich-transformer","slug":"sandwich-transformer","name":"Sandwich Transformer","full_name":"Sandwich Transformer","full_name_withheld":false,"description_markdown":"A **Sandwich Transformer** is a variant of a [Transformer](https://paperswithcode.com/method/transformer) that reorders sublayers in the architecture to achieve better performance. The reordering is based on the authors' analysis that models with more self-attention toward the bottom and more\r\nfeedforward sublayers toward the top tend to perform better in general.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Improving Transformer Models by Reordering their Sublayers","paper":"/paper/improving-transformer-models-by-reordering","first_author":"Ofir Press","n_authors":3,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/improving-transformer-models-by-reordering"},"source":{"url":"https://arxiv.org/abs/1911.03864v2","title":"Improving Transformer Models by Reordering their Sublayers","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/ofirpress/sandwich_transformer/blob/9d8e48fd1f9c10586a8a988e07bae4f8a327706f/models.py#L179","code_snippet_url_on_a_code_host":true,"categories":[{"area":"Natural Language Processing","area_id":"natural-language-processing","collection":"Language Models","url":"/methods/category/language-models","pwc_aliases":[]},{"area":"Natural Language Processing","area_id":"natural-language-processing","collection":"Autoregressive Transformers","url":"/methods/category/autoregressive-transformers","pwc_aliases":[]},{"area":"Natural Language Processing","area_id":"natural-language-processing","collection":"Transformers","url":"/methods/category/transformers","pwc_aliases":[]}],"n_papers_tagged":2,"archive_num_papers":2,"papers_newest_first":[{"paper":"/paper/generative-pre-training-from-molecules","title":"Generative Pre-Training from Molecules","date":"2021-09-16","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/improving-transformer-models-by-reordering","title":"Improving Transformer Models by Reordering their Sublayers","date":"2019-11-10","arxiv_id":"1911.03864","n_code_links":2,"syntology":null}],"papers_shown":2,"tasks":[{"task":"/task/language-modelling","name":"Language Modelling","papers":2},{"task":"/task/feature-engineering","name":"Feature Engineering","papers":1},{"task":"/task/general-knowledge","name":"General Knowledge","papers":1},{"task":"/task/language-modeling","name":"Language Modeling","papers":1},{"task":"/task/machine-translation","name":"Machine Translation","papers":1},{"task":"/task/molecular-property-prediction","name":"Molecular Property Prediction","papers":1},{"task":"/task/property-prediction","name":"Property Prediction","papers":1},{"task":"/task/translation","name":"Translation","papers":1}],"tasks_shown":8,"n_tasks":8,"usage_by_year":[{"year":"2019","papers":1},{"year":"2021","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/sandwich-transformer"},"syntology_read_at":"2026-09-25T09:33:49+00:00"}