{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/ernie-20-a-continual-pre-training-framework","title":"ERNIE 2.0: A Continual Pre-training Framework for Language Understanding","arxiv_id":"1907.12412","date":"2019-07-29","proceeding":null,"authors":["Yu Sun","Shuohuan Wang","Yukun Li","Shikun Feng","Hao Tian","Hua Wu","Haifeng Wang"],"abstract":"Recently, pre-trained models have achieved state-of-the-art results in various language understanding tasks, which indicates that pre-training on large-scale corpora may play a crucial role in natural language processing. Current pre-training procedures usually focus on training the model with several simple tasks to grasp the co-occurrence of words or sentences. However, besides co-occurring, there exists other valuable lexical, syntactic and semantic information in training corpora, such as named entity, semantic closeness and discourse relations. In order to extract to the fullest extent, the lexical, syntactic and semantic information from training corpora, we propose a continual pre-training framework named ERNIE 2.0 which builds and learns incrementally pre-training tasks through constant multi-task learning. Experimental results demonstrate that ERNIE 2.0 outperforms BERT and XLNet on 16 tasks including English tasks on GLUE benchmarks and several common tasks in Chinese. The source codes and pre-trained models have been released at https://github.com/PaddlePaddle/ERNIE.","url_abs":"https://arxiv.org/abs/1907.12412v2","url_pdf":"https://arxiv.org/pdf/1907.12412v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"ernie-20-a-continual-pre-training-framework","repo_url":"https://github.com/PaddlePaddle/ERNIE","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"paddle","reach":null},{"paper_slug":"ernie-20-a-continual-pre-training-framework","repo_url":"https://github.com/DataScienceNigeria/ERNIE-2.0-from-Baidu-Inc.","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"ok"}},{"paper_slug":"ernie-20-a-continual-pre-training-framework","repo_url":"https://github.com/PaddlePaddle/PaddleNLP/tree/develop/model_zoo/ernie-1.0","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"paddle","reach":null}],"tasks":[{"task_slug":"chinese-named-entity-recognition","task_name":"Chinese Named Entity Recognition"},{"task_slug":"chinese-reading-comprehension","task_name":"Chinese Reading Comprehension"},{"task_slug":"chinese-sentence-pair-classification","task_name":"Chinese Sentence Pair Classification"},{"task_slug":"chinese-sentiment-analysis","task_name":"Chinese Sentiment Analysis"},{"task_slug":"linguistic-acceptability","task_name":"Linguistic Acceptability"},{"task_slug":"multi-task-learning","task_name":"Multi-Task Learning"},{"task_slug":"named-entity-recognition-ner","task_name":"Named Entity Recognition (NER)"},{"task_slug":"natural-language-inference","task_name":"Natural Language Inference"},{"task_slug":"open-domain-question-answering","task_name":"Open-Domain Question Answering"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"semantic-textual-similarity","task_name":"Semantic Textual Similarity"},{"task_slug":"sentiment-analysis","task_name":"Sentiment Analysis"}],"methods":[{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"bert","method_name":"BERT"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"ernie","method_name":"ERNIE"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"linear-warmup-with-linear-decay","method_name":"Linear Warmup With Linear Decay"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"sentencepiece","method_name":"SentencePiece"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"weight-decay","method_name":"Weight Decay"},{"method_slug":"wordpiece","method_name":"WordPiece"},{"method_slug":"xlnet","method_name":"XLNet"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/chinese-named-entity-recognition-on-msra","task":"Chinese Named Entity Recognition","dataset":"MSRA","model":"ERNIE 2.0 Large","rank_in_archive_order":10,"of":21,"metrics":{"F1":"95"},"uses_additional_data":false},{"leaderboard":"/sota/chinese-named-entity-recognition-on-msra","task":"Chinese Named Entity Recognition","dataset":"MSRA","model":"ERNIE 2.0 Base","rank_in_archive_order":15,"of":21,"metrics":{"F1":"93.8"},"uses_additional_data":false},{"leaderboard":"/sota/chinese-named-entity-recognition-on-msra-dev","task":"Chinese Named Entity Recognition","dataset":"MSRA Dev","model":"ERNIE 2.0 Large","rank_in_archive_order":1,"of":3,"metrics":{"F1":"96.3"},"uses_additional_data":false},{"leaderboard":"/sota/chinese-named-entity-recognition-on-msra-dev","task":"Chinese Named Entity Recognition","dataset":"MSRA Dev","model":"ERNIE 2.0 Base","rank_in_archive_order":2,"of":3,"metrics":{"F1":"95.2"},"uses_additional_data":false},{"leaderboard":"/sota/linguistic-acceptability-on-cola","task":"Linguistic Acceptability","dataset":"CoLA","model":"ERNIE 2.0 Large","rank_in_archive_order":27,"of":43,"metrics":{"Accuracy":"63.5%"},"uses_additional_data":false},{"leaderboard":"/sota/linguistic-acceptability-on-cola","task":"Linguistic Acceptability","dataset":"CoLA","model":"ERNIE 2.0 Base","rank_in_archive_order":34,"of":43,"metrics":{"Accuracy":"55.2%"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-multinli","task":"Natural Language Inference","dataset":"MultiNLI","model":"ERNIE 2.0 Large","rank_in_archive_order":15,"of":67,"metrics":{"Matched":"88.7","Mismatched":"88.8"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-multinli","task":"Natural Language Inference","dataset":"MultiNLI","model":"ERNIE 2.0 Base","rank_in_archive_order":28,"of":67,"metrics":{"Matched":"86.1","Mismatched":"85.5"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-qnli","task":"Natural Language Inference","dataset":"QNLI","model":"ERNIE 2.0 Large","rank_in_archive_order":14,"of":43,"metrics":{"Accuracy":"94.6%"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-qnli","task":"Natural Language Inference","dataset":"QNLI","model":"ERNIE 2.0 Base","rank_in_archive_order":24,"of":43,"metrics":{"Accuracy":"92.9%"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-rte","task":"Natural Language Inference","dataset":"RTE","model":"ERNIE 2.0 Large","rank_in_archive_order":35,"of":90,"metrics":{"Accuracy":"80.2%"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-rte","task":"Natural Language Inference","dataset":"RTE","model":"ERNIE 2.0 Base","rank_in_archive_order":45,"of":90,"metrics":{"Accuracy":"74.8%"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-wnli","task":"Natural Language Inference","dataset":"WNLI","model":"ERNIE 2.0 Large","rank_in_archive_order":19,"of":23,"metrics":{"Accuracy":"67.8"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-xnli-chinese-1","task":"Natural Language Inference","dataset":"XNLI Chinese","model":"ERNIE 2.0 Large","rank_in_archive_order":1,"of":3,"metrics":{"Accuracy":"81"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-xnli-chinese-1","task":"Natural Language Inference","dataset":"XNLI Chinese","model":"ERNIE 2.0 Base","rank_in_archive_order":2,"of":3,"metrics":{"Accuracy":"79.7"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-xnli-chinese","task":"Natural Language Inference","dataset":"XNLI Chinese Dev","model":"ERNIE 2.0 Large","rank_in_archive_order":1,"of":3,"metrics":{"Accuracy":"82.6"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-xnli-chinese","task":"Natural Language Inference","dataset":"XNLI Chinese Dev","model":"ERNIE 2.0 Base","rank_in_archive_order":2,"of":3,"metrics":{"Accuracy":"81.2"},"uses_additional_data":false},{"leaderboard":"/sota/open-domain-question-answering-on-dureader","task":"Open-Domain Question Answering","dataset":"DuReader","model":"ERNIE 2.0 Large","rank_in_archive_order":1,"of":2,"metrics":{"EM":"64.2"},"uses_additional_data":false},{"leaderboard":"/sota/open-domain-question-answering-on-dureader","task":"Open-Domain Question Answering","dataset":"DuReader","model":"ERNIE 2.0 Base","rank_in_archive_order":2,"of":2,"metrics":{"EM":"61.3"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-quora-question-pairs","task":"Question Answering","dataset":"Quora Question Pairs","model":"ERNIE 2.0 Large","rank_in_archive_order":7,"of":19,"metrics":{"Accuracy":"90.1%"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-quora-question-pairs","task":"Question Answering","dataset":"Quora Question Pairs","model":"ERNIE 2.0 Base","rank_in_archive_order":10,"of":19,"metrics":{"Accuracy":"89.8%"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-mrpc","task":"Semantic Textual Similarity","dataset":"MRPC","model":"ERNIE 2.0 Large","rank_in_archive_order":28,"of":45,"metrics":{"Accuracy":"87.4%"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-mrpc","task":"Semantic Textual Similarity","dataset":"MRPC","model":"ERNIE 2.0 Base","rank_in_archive_order":34,"of":45,"metrics":{"Accuracy":"86.1%"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts-benchmark","task":"Semantic Textual Similarity","dataset":"STS Benchmark","model":"ERNIE 2.0 Large","rank_in_archive_order":12,"of":66,"metrics":{"Pearson Correlation":"0.912"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts-benchmark","task":"Semantic Textual Similarity","dataset":"STS Benchmark","model":"ERNIE 2.0 Base","rank_in_archive_order":23,"of":66,"metrics":{"Pearson Correlation":"0.876"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-sst-2-binary","task":"Sentiment Analysis","dataset":"SST-2 Binary classification","model":"ERNIE 2.0 Base","rank_in_archive_order":25,"of":87,"metrics":{"Accuracy":"95"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1907.12412","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1907.12412"}},"developers":"https://syntology.ai/developers","read_at":"2026-09-24T18:15:14+00:00","read_at_is":"when the build read Syntology's graph, not when any sample ran","claim":"Per-sample execution status on synthesized fixtures; not a correctness claim about the paper. Samples come from repositories linked to the paper, official or community; repo_kind says which.","repos":[{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/PaddlePaddle/PaddleNLP/tree/develop/model_zoo/ernie-1.0","reach":null},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/PaddlePaddle/ERNIE","reach":null},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/DataScienceNigeria/ERNIE-2.0-from-Baidu-Inc.","reach":{"status":"ok"}}],"summary":{"unverified":1},"by_repo_kind":{},"repo_kind_vocabulary":{"official":"The archive marks this repository official for the paper","named_in_paper":"The archive records that the paper mentions this repository; it is not marked official","listed":"In the archive's code links for this paper, not marked official and not recorded as mentioned in the paper","found_in_text":"Syntology found this repository in the paper's own text; whether it is the authors' implementation is not asserted","community":"Not in the archive's code links for this paper; a community repository Syntology harvested"},"n_pointer_only_for_licence":1,"samples":[{"code_sha256_prefix":"f277229b3bab1f59","entry":"calc_lm_head_logits","repo":null,"repo_kind":null,"path":null,"file_url":null,"link_basis":"identical_code_first_harvested_elsewhere","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"mcp_get_code":{"code_sha256":"f277229b3bab1f59"}}]},"arxiv_metadata":null,"syntology_extracted_results":null}