{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/muppet-massive-multi-task-representations","title":"Muppet: Massive Multi-task Representations with Pre-Finetuning","arxiv_id":"2101.11038","date":"2021-01-26","proceeding":"EMNLP 2021 11","authors":["Armen Aghajanyan","Anchit Gupta","Akshat Shrivastava","Xilun Chen","Luke Zettlemoyer","Sonal Gupta"],"abstract":"We propose pre-finetuning, an additional large-scale learning stage between language model pre-training and fine-tuning. Pre-finetuning is massively multi-task learning (around 50 datasets, over 4.8 million total labeled examples), and is designed to encourage learning of representations that generalize better to many different tasks. We show that pre-finetuning consistently improves performance for pretrained discriminators (e.g.~RoBERTa) and generation models (e.g.~BART) on a wide range of tasks (sentence prediction, commonsense reasoning, MRC, etc.), while also significantly improving sample efficiency during fine-tuning. We also show that large-scale multi-tasking is crucial; pre-finetuning can hurt performance when few tasks are used up until a critical point (usually above 15) after which performance improves linearly in the number of tasks.","url_abs":"https://arxiv.org/abs/2101.11038v1","url_pdf":"https://arxiv.org/pdf/2101.11038v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"muppet-massive-multi-task-representations","repo_url":"https://huggingface.co/facebook/muppet-roberta-base","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"none","reach":null},{"paper_slug":"muppet-massive-multi-task-representations","repo_url":"https://huggingface.co/facebook/muppet-roberta-large","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"none","reach":null}],"tasks":[{"task_slug":"abstractive-text-summarization","task_name":"Abstractive Text Summarization"},{"task_slug":"common-sense-reasoning","task_name":"Common Sense Reasoning"},{"task_slug":"language-modeling","task_name":"Language Modeling"},{"task_slug":"language-modelling","task_name":"Language Modelling"},{"task_slug":"multi-task-learning","task_name":"Multi-Task Learning"},{"task_slug":"natural-language-inference","task_name":"Natural Language Inference"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"sentence","task_name":"Sentence"},{"task_slug":"sentence-completion","task_name":"Sentence Completion"},{"task_slug":"sentiment-analysis","task_name":"Sentiment Analysis"},{"task_slug":"text-summarization","task_name":"Text Summarization"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/abstractive-text-summarization-on-cnn-daily","task":"Abstractive Text Summarization","dataset":"CNN / Daily Mail","model":"MUPPET BART Large","rank_in_archive_order":12,"of":53,"metrics":{"ROUGE-1":"44.45","ROUGE-2":"21.25","ROUGE-L":"41.4"},"uses_additional_data":false},{"leaderboard":"/sota/common-sense-reasoning-on-commonsenseqa","task":"Common Sense Reasoning","dataset":"CommonsenseQA","model":"MUPPET Roberta Large","rank_in_archive_order":7,"of":38,"metrics":{"Accuracy":"79.2"},"uses_additional_data":true},{"leaderboard":"/sota/natural-language-inference-on-rte","task":"Natural Language Inference","dataset":"RTE","model":"MUPPET Roberta Large","rank_in_archive_order":6,"of":90,"metrics":{"Accuracy":"92.8%"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-boolq","task":"Question Answering","dataset":"BoolQ","model":"MUPPET Roberta Large","rank_in_archive_order":13,"of":65,"metrics":{"Accuracy":"87.5"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-boolq","task":"Question Answering","dataset":"BoolQ","model":"MUPPET Roberta Base","rank_in_archive_order":20,"of":65,"metrics":{"Accuracy":"83.8"},"uses_additional_data":false},{"leaderboard":"/sota/sentence-completion-on-hellaswag","task":"Sentence Completion","dataset":"HellaSwag","model":"MUPPET Roberta Large","rank_in_archive_order":19,"of":89,"metrics":{"Accuracy":"86.4"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-sst-2-binary","task":"Sentiment Analysis","dataset":"SST-2 Binary classification","model":"MUPPET Roberta Large","rank_in_archive_order":4,"of":87,"metrics":{"Accuracy":"97.4"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-sst-2-binary","task":"Sentiment Analysis","dataset":"SST-2 Binary classification","model":"MUPPET Roberta base","rank_in_archive_order":12,"of":87,"metrics":{"Accuracy":"96.7"},"uses_additional_data":false},{"leaderboard":"/sota/text-summarization-on-gigaword","task":"Text Summarization","dataset":"GigaWord","model":"MUPPET BART Large","rank_in_archive_order":5,"of":41,"metrics":{"ROUGE-1":"40.4","ROUGE-2":"20.54","ROUGE-L":"36.21"},"uses_additional_data":true},{"leaderboard":"/sota/text-summarization-on-reddit-tifu","task":"Text Summarization","dataset":"Reddit TIFU","model":"MUPPET BART Large","rank_in_archive_order":3,"of":5,"metrics":{"ROUGE-1":"30.3","ROUGE-2":"11.25","ROUGE-L":"24.92"},"uses_additional_data":true}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2101.11038","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}