{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/infty-former-infinite-memory-transformer","title":"$\\infty$-former: Infinite Memory Transformer","arxiv_id":"2109.00301","date":"2021-09-01","proceeding":null,"authors":["Pedro Henrique Martins","Zita Marinho","André F. T. Martins"],"abstract":"Transformers are unable to model long-term memories effectively, since the amount of computation they need to perform grows with the context length. While variations of efficient transformers have been proposed, they all have a finite memory capacity and are forced to drop old information. In this paper, we propose the $\\infty$-former, which extends the vanilla transformer with an unbounded long-term memory. By making use of a continuous-space attention mechanism to attend over the long-term memory, the $\\infty$-former's attention complexity becomes independent of the context length, trading off memory length with precision. In order to control where precision is more important, $\\infty$-former maintains \"sticky memories\" being able to model arbitrarily long contexts while keeping the computation budget fixed. Experiments on a synthetic sorting task, language modeling, and document grounded dialogue generation demonstrate the $\\infty$-former's ability to retain information from long sequences.","url_abs":"https://arxiv.org/abs/2109.00301v3","url_pdf":"https://arxiv.org/pdf/2109.00301v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"infty-former-infinite-memory-transformer","repo_url":"https://github.com/deep-spin/infinite-former","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"jax","reach":{"status":"ok"}}],"tasks":[{"task_slug":"dialogue-generation","task_name":"Dialogue Generation"},{"task_slug":"language-modeling","task_name":"Language Modeling"},{"task_slug":"language-modelling","task_name":"Language Modelling"}],"methods":[{"method_slug":"absolute-position-encodings","method_name":"Absolute Position Encodings"},{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"label-smoothing","method_name":"Label Smoothing"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"position-wise-feed-forward-layer","method_name":"Position-Wise Feed-Forward Layer"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"transformer","method_name":"Transformer"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/dialogue-generation-on-cmu-dog","task":"Dialogue Generation","dataset":"CMU-DoG","model":"∞-former (Sticky memories)","rank_in_archive_order":1,"of":1,"metrics":{"F1":"9.01","Meteor":"7.55","ROUGE-1":"15.37","Rouge-L":"12.56"},"uses_additional_data":false},{"leaderboard":"/sota/dialogue-generation-on-pg-19","task":"Dialogue Generation","dataset":"PG-19","model":"∞-former (Sticky memories + initialized GPT-2 Small)","rank_in_archive_order":1,"of":1,"metrics":{"Perplexity":"32.48"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-wikitext-103","task":"Language Modelling","dataset":"WikiText-103","model":"[?]-former (SM)","rank_in_archive_order":14,"of":89,"metrics":{"Test perplexity":"16.61"},"uses_additional_data":false},{"leaderboard":"/sota/language-modelling-on-wikitext-103","task":"Language Modelling","dataset":"WikiText-103","model":"-former (SM)","rank_in_archive_order":15,"of":89,"metrics":{"Test perplexity":"16.61"},"uses_additional_data":false},{"leaderboard":"/sota/language-modelling-on-wikitext-103","task":"Language Modelling","dataset":"WikiText-103","model":"∞-former (Sticky memories + initialized GPT-2 Small)","rank_in_archive_order":16,"of":89,"metrics":{"Test perplexity":"16.61"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-wikitext-103","task":"Language Modelling","dataset":"WikiText-103","model":"∞-former (initialized GPT-2 Small)","rank_in_archive_order":17,"of":89,"metrics":{"Test perplexity":"16.64"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-wikitext-103","task":"Language Modelling","dataset":"WikiText-103","model":"[?]-former (Sticky memories)","rank_in_archive_order":56,"of":89,"metrics":{"Test perplexity":"24.22"},"uses_additional_data":false},{"leaderboard":"/sota/language-modelling-on-wikitext-103","task":"Language Modelling","dataset":"WikiText-103","model":"\\infty-former (Sticky memories)","rank_in_archive_order":57,"of":89,"metrics":{"Test perplexity":"24.22"},"uses_additional_data":false},{"leaderboard":"/sota/language-modelling-on-wikitext-103","task":"Language Modelling","dataset":"WikiText-103","model":"∞-former (Sticky memories)","rank_in_archive_order":58,"of":89,"metrics":{"Test perplexity":"24.22"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2109.00301","atlas_url":"https://app.syntology.ai/?focus=2109.00301","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}