{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/improving-language-understanding-by","title":"Improving Language Understanding by Generative Pre-Training","arxiv_id":null,"date":"2018-06-11","proceeding":"Preprint 2018 6","authors":["Alec Radford","Karthik Narasimhan","Tim Salimans","Ilya Sutskever"],"abstract":"Natural language understanding comprises a wide range of diverse tasks such\r\nas textual entailment, question answering, semantic similarity assessment, and\r\ndocument classification. Although large unlabeled text corpora are abundant,\r\nlabeled data for learning these specific tasks is scarce, making it challenging for\r\ndiscriminatively trained models to perform adequately. We demonstrate that large\r\ngains on these tasks can be realized by generative pre-training of a language model\r\non a diverse corpus of unlabeled text, followed by discriminative fine-tuning on each\r\nspecific task. In contrast to previous approaches, we make use of task-aware input\r\ntransformations during fine-tuning to achieve effective transfer while requiring\r\nminimal changes to the model architecture. We demonstrate the effectiveness of\r\nour approach on a wide range of benchmarks for natural language understanding.\r\nOur general task-agnostic model outperforms discriminatively trained models that\r\nuse architectures specifically crafted for each task, significantly improving upon the\r\nstate of the art in 9 out of the 12 tasks studied. For instance, we achieve absolute\r\nimprovements of 8.9% on commonsense reasoning (Stories Cloze Test), 5.7% on\r\nquestion answering (RACE), and 1.5% on textual entailment (MultiNLI).","url_abs":"https://s3-us-west-2.amazonaws.com/openai-assets/research-covers/language-unsupervised/language_understanding_paper.pdf","url_pdf":"https://s3-us-west-2.amazonaws.com/openai-assets/research-covers/language-unsupervised/language_understanding_paper.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"improving-language-understanding-by","repo_url":"https://github.com/2023-MindSpore-1/ms-code-152","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null},{"paper_slug":"improving-language-understanding-by","repo_url":"https://github.com/Mind23-2/MindCode-139","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null},{"paper_slug":"improving-language-understanding-by","repo_url":"https://github.com/MindSpore-scientific/code-7/tree/main/gpt_j","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"none","reach":null},{"paper_slug":"improving-language-understanding-by","repo_url":"https://github.com/PaddlePaddle/FleetX/tree/develop/examples/static/gpt","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"paddle","reach":null},{"paper_slug":"improving-language-understanding-by","repo_url":"https://github.com/abhaskumarsinha/Corpus2GPT","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null},{"paper_slug":"improving-language-understanding-by","repo_url":"https://github.com/abhaskumarsinha/Keras-implementation-of-Transformer-Architecture","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"tf","reach":null},{"paper_slug":"improving-language-understanding-by","repo_url":"https://github.com/abhaskumarsinha/MinimalGPT","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"tf","reach":null},{"paper_slug":"improving-language-understanding-by","repo_url":"https://github.com/huggingface/transformers","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null},{"paper_slug":"improving-language-understanding-by","repo_url":"https://github.com/lattice-ai/GPT","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"tf","reach":null},{"paper_slug":"improving-language-understanding-by","repo_url":"https://github.com/lvyufeng/bert4ms","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":{"status":"ok","spdx":"Apache-2.0"}},{"paper_slug":"improving-language-understanding-by","repo_url":"https://github.com/milmor/GPT","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"tf","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"improving-language-understanding-by","repo_url":"https://github.com/openai/finetune-transformer-lm","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"tf","reach":null},{"paper_slug":"improving-language-understanding-by","repo_url":"https://github.com/xiuyu0000/new_papers_codes/tree/main/gpt","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null}],"tasks":[{"task_slug":"cloze-test","task_name":"Cloze Test"},{"task_slug":"document-classification","task_name":"Document Classification"},{"task_slug":"language-modeling","task_name":"Language Modeling"},{"task_slug":"language-modelling","task_name":"Language Modelling"},{"task_slug":"natural-language-inference","task_name":"Natural Language Inference"},{"task_slug":"natural-language-understanding","task_name":"Natural Language Understanding"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"semantic-similarity","task_name":"Semantic Similarity"},{"task_slug":"semantic-textual-similarity","task_name":"Semantic Textual Similarity"}],"methods":[{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"cosine-annealing","method_name":"Cosine Annealing"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"discriminative-fine-tuning","method_name":"Discriminative Fine-Tuning"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"gpt","method_name":"GPT"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"linear-warmup-with-cosine-annealing","method_name":"Linear Warmup With Cosine Annealing"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"weight-decay","method_name":"Weight Decay"}],"datasets_introduced":[],"methods_introduced":[{"slug":"gpt","name":"GPT","full_name":"GPT"}],"results":[{"leaderboard":"/sota/natural-language-inference-on-multinli","task":"Natural Language Inference","dataset":"MultiNLI","model":"Finetuned Transformer LM","rank_in_archive_order":41,"of":67,"metrics":{"Matched":"82.1","Mismatched":"81.4"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-snli","task":"Natural Language Inference","dataset":"SNLI","model":"Fine-Tuned LM-Pretrained Transformer","rank_in_archive_order":15,"of":98,"metrics":{"% Test Accuracy":"89.9","% Train Accuracy":"96.6","Parameters":"85m"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-scitail","task":"Natural Language Inference","dataset":"SciTail","model":"Finetuned Transformer LM","rank_in_archive_order":4,"of":13,"metrics":{"Accuracy":"88.3"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-race","task":"Question Answering","dataset":"RACE","model":"Finetuned Transformer LM","rank_in_archive_order":4,"of":7,"metrics":{"RACE":"59.0","RACE-h":"57.4","RACE-m":"62.9"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-storycloze","task":"Question Answering","dataset":"StoryCloze","model":"Finetuned Transformer LM","rank_in_archive_order":8,"of":23,"metrics":{"Accuracy":"86.5"},"uses_additional_data":false}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}