{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/language-models-are-unsupervised-multitask","title":"Language Models are Unsupervised Multitask Learners","arxiv_id":null,"date":"2019-02-14","proceeding":"Preprint 2019 2","authors":["Alec Radford","Jeffrey Wu","Rewon Child","David Luan","Dario Amodei","Ilya Sutskever"],"abstract":"Natural language processing tasks, such as question answering, machine translation, reading comprehension, and summarization, are typically\r\napproached with supervised learning on taskspecific datasets. We demonstrate that language\r\nmodels begin to learn these tasks without any explicit supervision when trained on a new dataset\r\nof millions of webpages called WebText. When\r\nconditioned on a document plus questions, the answers generated by the language model reach 55\r\nF1 on the CoQA dataset - matching or exceeding\r\nthe performance of 3 out of 4 baseline systems\r\nwithout using the 127,000+ training examples.\r\nThe capacity of the language model is essential\r\nto the success of zero-shot task transfer and increasing it improves performance in a log-linear\r\nfashion across tasks. Our largest model, GPT-2,\r\nis a 1.5B parameter Transformer that achieves\r\nstate of the art results on 7 out of 8 tested language modeling datasets in a zero-shot setting\r\nbut still underfits WebText. Samples from the\r\nmodel reflect these improvements and contain coherent paragraphs of text. These findings suggest\r\na promising path towards building language processing systems which learn to perform tasks from\r\ntheir naturally occurring demonstrations.","url_abs":"https://d4mucfpksywv.cloudfront.net/better-language-models/language-models.pdf","url_pdf":"https://d4mucfpksywv.cloudfront.net/better-language-models/language-models.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/openai/gpt-2","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"tf","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/2023-MindSpore-1/ms-code-154","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/MS-P3/code5/tree/main/gpt2","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/PaddlePaddle/PaddleNLP/tree/develop/examples/language_model/gpt","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"paddle","reach":null},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/VachanVY/gpt.jax","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"jax","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/aananda-giri/gpt2-nepali","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/abhaskumarsinha/Corpus2GPT","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/abhaskumarsinha/MinimalGPT","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"tf","reach":null},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/affjljoo3581/GPT2","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/akanyaani/gpt-2-tensorflow2.0","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"tf","reach":null},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/akanyaani/minGPTF","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"tf","reach":null},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/huggingface/swift-coreml-transformers","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/huggingface/transformers","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/imcaspar/gpt2-ml","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"tf","reach":null},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/jankrepl/mildlyoverfitted","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"jax","reach":null},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/lvyufeng/bert4ms","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":{"status":"ok","spdx":"Apache-2.0"}},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/milmor/GPT","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"tf","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/mindspore-ai/models/blob/master/research/nlp/gpt2","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/minimaxir/gpt-2-simple","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"tf","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/ramanakshay/nanogpt","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"language-models-are-unsupervised-multitask","repo_url":"https://github.com/varun-suresh/experiments-with-gpt2","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"common-sense-reasoning","task_name":"Common Sense Reasoning"},{"task_slug":"coreference-resolution","task_name":"Coreference Resolution"},{"task_slug":"data-to-text-generation","task_name":"Data-to-Text Generation"},{"task_slug":"dialogue-state-tracking","task_name":"Dialogue State Tracking"},{"task_slug":"document-summarization","task_name":"Document Summarization"},{"task_slug":"language-modeling","task_name":"Language Modeling"},{"task_slug":"language-modelling","task_name":"Language Modelling"},{"task_slug":"machine-translation","task_name":"Machine Translation"},{"task_slug":"multi-task-learning","task_name":"Multi-Task Learning"},{"task_slug":"multi-task-language-understanding","task_name":"Multi-task Language Understanding"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"reading-comprehension","task_name":"Reading Comprehension"},{"task_slug":"response-generation","task_name":"Response Generation"},{"task_slug":"sentiment-analysis","task_name":"Sentiment Analysis"},{"task_slug":"text-generation","task_name":"Text Generation"},{"task_slug":"translation","task_name":"Translation"}],"methods":[{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"cosine-annealing","method_name":"Cosine Annealing"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"discriminative-fine-tuning","method_name":"Discriminative Fine-Tuning"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"gpt-2","method_name":"GPT-2"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"linear-warmup-with-cosine-annealing","method_name":"Linear Warmup With Cosine Annealing"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"weight-decay","method_name":"Weight Decay"}],"datasets_introduced":[{"slug":"webtext","name":"WebText","full_name":""}],"methods_introduced":[{"slug":"gpt-2","name":"GPT-2","full_name":"GPT-2"}],"results":[{"leaderboard":"/sota/coreference-resolution-on-winograd-schema","task":"Coreference Resolution","dataset":"Winograd Schema Challenge","model":"GPT-2-XL 1.5B","rank_in_archive_order":33,"of":82,"metrics":{"Accuracy":"70.7"},"uses_additional_data":false},{"leaderboard":"/sota/dialogue-state-tracking-on-simmc2-0","task":"Dialogue State Tracking","dataset":"SIMMC2.0","model":"GPT-2","rank_in_archive_order":4,"of":5,"metrics":{"Act F1":"94.5","Slot F1":"81.7"},"uses_additional_data":false},{"leaderboard":"/sota/document-summarization-on-cnn-daily-mail","task":"Document Summarization","dataset":"CNN / Daily Mail","model":"GPT-2","rank_in_archive_order":26,"of":26,"metrics":{"ROUGE-1":"29.34","ROUGE-2":"8.27","ROUGE-L":"26.58"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-lambada","task":"Language Modelling","dataset":"LAMBADA","model":"GPT-2 1.5B (Zero Shot)","rank_in_archive_order":29,"of":37,"metrics":{"Accuracy":"63.24","Perplexity":"8.63"},"uses_additional_data":false},{"leaderboard":"/sota/language-modelling-on-one-billion-word","task":"Language Modelling","dataset":"One Billion Word","model":"GPT-2","rank_in_archive_order":23,"of":27,"metrics":{"Number of params":"1.54B","PPL":"42.16"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-penn-treebank-word","task":"Language Modelling","dataset":"Penn Treebank (Word Level)","model":"GPT-2","rank_in_archive_order":3,"of":43,"metrics":{"Params":"1542M","Test perplexity":"35.76"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-text8","task":"Language Modelling","dataset":"Text8","model":"GPT-2","rank_in_archive_order":1,"of":24,"metrics":{"Bit per Character (BPC)":"0.98","Number of params":"1542M"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-wikitext-103","task":"Language Modelling","dataset":"WikiText-103","model":"GPT-2 Full","rank_in_archive_order":25,"of":89,"metrics":{"Number of params":"1542M","Test perplexity":"17.48"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-wikitext-103","task":"Language Modelling","dataset":"WikiText-103","model":"GPT-2 Large","rank_in_archive_order":46,"of":89,"metrics":{"Number of params":"774M","Test perplexity":"22.05"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-wikitext-103","task":"Language Modelling","dataset":"WikiText-103","model":"GPT-2 Medium","rank_in_archive_order":63,"of":89,"metrics":{"Number of params":"355M","Test perplexity":"26.37"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-wikitext-103","task":"Language Modelling","dataset":"WikiText-103","model":"GPT-2 Small","rank_in_archive_order":79,"of":89,"metrics":{"Number of params":"124M","Test perplexity":"37.50"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-wikitext-2","task":"Language Modelling","dataset":"WikiText-2","model":"GPT-2","rank_in_archive_order":6,"of":38,"metrics":{"Number of params":"1542M","Test perplexity":"18.34"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-wikitext-2","task":"Language Modelling","dataset":"WikiText-2","model":"GPT-2 (large)","rank_in_archive_order":7,"of":38,"metrics":{"Number of params":"762M","Test perplexity":"19.93"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-wikitext-2","task":"Language Modelling","dataset":"WikiText-2","model":"GPT-2 (medium)","rank_in_archive_order":8,"of":38,"metrics":{"Number of params":"345M","Test perplexity":"22.76"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-wikitext-2","task":"Language Modelling","dataset":"WikiText-2","model":"GPT-2 (small)","rank_in_archive_order":9,"of":38,"metrics":{"Number of params":"117M","Test perplexity":"29.41"},"uses_additional_data":true},{"leaderboard":"/sota/language-modelling-on-enwiki8","task":"Language Modelling","dataset":"enwik8","model":"GPT-2 (48 layers, h=1600)","rank_in_archive_order":1,"of":42,"metrics":{"Bit per Character (BPC)":"0.93","Number of params":"1542M"},"uses_additional_data":true},{"leaderboard":"/sota/question-answering-on-fever","task":"Question Answering","dataset":"FEVER","model":"Zero-shot","rank_in_archive_order":7,"of":8,"metrics":{"EM":"50"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-webquestions","task":"Question Answering","dataset":"WebQuestions","model":"Zero-shot","rank_in_archive_order":12,"of":37,"metrics":{"EM":"43"},"uses_additional_data":false},{"leaderboard":"/sota/response-generation-on-simmc2-0","task":"Response Generation","dataset":"SIMMC2.0","model":"GPT-2","rank_in_archive_order":5,"of":5,"metrics":{"BLEU":"19.2"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-imdb","task":"Sentiment Analysis","dataset":"IMDb","model":"GPT-2 Finetuned","rank_in_archive_order":31,"of":49,"metrics":{"Accuracy":"92.36"},"uses_additional_data":false},{"leaderboard":"/sota/text-generation-on-openwebtext","task":"Text Generation","dataset":"OpenWebText","model":"GPT2-124M","rank_in_archive_order":3,"of":3,"metrics":{"eval_loss":"3.12"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}