{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/domain-specific-language-model-pretraining","title":"Domain-Specific Language Model Pretraining for Biomedical Natural Language Processing","arxiv_id":"2007.15779","date":"2020-07-31","proceeding":null,"authors":["Yu Gu","Robert Tinn","Hao Cheng","Michael Lucas","Naoto Usuyama","Xiaodong Liu","Tristan Naumann","Jianfeng Gao","Hoifung Poon"],"abstract":"Pretraining large neural language models, such as BERT, has led to impressive gains on many natural language processing (NLP) tasks. However, most pretraining efforts focus on general domain corpora, such as newswire and Web. A prevailing assumption is that even domain-specific pretraining can benefit by starting from general-domain language models. In this paper, we challenge this assumption by showing that for domains with abundant unlabeled text, such as biomedicine, pretraining language models from scratch results in substantial gains over continual pretraining of general-domain language models. To facilitate this investigation, we compile a comprehensive biomedical NLP benchmark from publicly-available datasets. Our experiments show that domain-specific pretraining serves as a solid foundation for a wide range of biomedical NLP tasks, leading to new state-of-the-art results across the board. Further, in conducting a thorough evaluation of modeling choices, both for pretraining and task-specific fine-tuning, we discover that some common practices are unnecessary with BERT models, such as using complex tagging schemes in named entity recognition (NER). To help accelerate research in biomedical NLP, we have released our state-of-the-art pretrained and task-specific models for the community, and created a leaderboard featuring our BLURB benchmark (short for Biomedical Language Understanding & Reasoning Benchmark) at https://aka.ms/BLURB.","url_abs":"https://arxiv.org/abs/2007.15779v6","url_pdf":"https://arxiv.org/pdf/2007.15779v6.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"domain-specific-language-model-pretraining","repo_url":"https://github.com/bionlu-coling2024/biomed-ner-intent_detection","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok"}},{"paper_slug":"domain-specific-language-model-pretraining","repo_url":"https://github.com/rohanshad/cmr_transformer","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"continual-pretraining","task_name":"Continual Pretraining"},{"task_slug":"document-classification","task_name":"Document Classification"},{"task_slug":"drug-drug-interaction-extraction","task_name":"Drug–drug Interaction Extraction"},{"task_slug":"language-modeling","task_name":"Language Modeling"},{"task_slug":"language-modelling","task_name":"Language Modelling"},{"task_slug":"cg","task_name":"NER"},{"task_slug":"named-entity-recognition-1","task_name":"Named Entity Recognition"},{"task_slug":"named-entity-recognition-ner","task_name":"Named Entity Recognition (NER)"},{"task_slug":"pico","task_name":"PICO"},{"task_slug":"participant-intervention-comparison-outcome","task_name":"Participant Intervention Comparison Outcome Extraction"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"relation-extraction","task_name":"Relation Extraction"},{"task_slug":"sentence-similarity","task_name":"Sentence Similarity"},{"task_slug":"text-classification","task_name":"Text Classification"},{"task_slug":"named-entity-recognition","task_name":"named-entity-recognition"}],"methods":[{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"bert","method_name":"BERT"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"linear-warmup-with-linear-decay","method_name":"Linear Warmup With Linear Decay"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"weight-decay","method_name":"Weight Decay"},{"method_slug":"wordpiece","method_name":"WordPiece"}],"datasets_introduced":[{"slug":"blurb","name":"BLURB","full_name":"Biomedical Language Understanding and Reasoning Benchmark"}],"methods_introduced":[],"results":[{"leaderboard":"/sota/document-classification-on-hoc","task":"Document Classification","dataset":"HOC","model":"PubMedBERT uncased","rank_in_archive_order":5,"of":5,"metrics":{"Micro F1":"82.32"},"uses_additional_data":false},{"leaderboard":"/sota/drug-drug-interaction-extraction-on-ddi","task":"Drug–drug Interaction Extraction","dataset":"DDI extraction 2013 corpus","model":"PubMedBERT","rank_in_archive_order":3,"of":10,"metrics":{"F1":"0.8236","Micro F1":"82.36"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-bc2gm","task":"Named Entity Recognition (NER)","dataset":"BC2GM","model":"PubMedBERT uncased","rank_in_archive_order":10,"of":13,"metrics":{"F1":"84.52"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-ner-on-jnlpba","task":"Named Entity Recognition (NER)","dataset":"JNLPBA","model":"PubMedBERT uncased","rank_in_archive_order":9,"of":17,"metrics":{"F1":"79.1"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-ner-on-ncbi-disease","task":"Named Entity Recognition (NER)","dataset":"NCBI-disease","model":"PubMedBERT uncased","rank_in_archive_order":16,"of":26,"metrics":{"F1":"87.82"},"uses_additional_data":false},{"leaderboard":"/sota/pico-on-ebm-pico","task":"PICO","dataset":"EBM PICO","model":"PubMedBERT uncased","rank_in_archive_order":3,"of":3,"metrics":{"Macro F1 word level":"73.38"},"uses_additional_data":false},{"leaderboard":"/sota/participant-intervention-comparison-outcome","task":"Participant Intervention Comparison Outcome Extraction","dataset":"EBM-NLP","model":"PubMedBERT uncased","rank_in_archive_order":2,"of":5,"metrics":{"F1":"73.38"},"uses_additional_data":true},{"leaderboard":"/sota/question-answering-on-blurb","task":"Question Answering","dataset":"BLURB","model":"PubMedBERT (uncased; abstracts)","rank_in_archive_order":4,"of":4,"metrics":{"Accuracy":"71.7"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-bioasq","task":"Question Answering","dataset":"BioASQ","model":"PubMedBERT uncased","rank_in_archive_order":5,"of":7,"metrics":{"Accuracy":"87.56"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-pubmedqa","task":"Question Answering","dataset":"PubMedQA","model":"PubMedBERT uncased","rank_in_archive_order":28,"of":30,"metrics":{"Accuracy":"55.84"},"uses_additional_data":false},{"leaderboard":"/sota/relation-extraction-on-chemprot","task":"Relation Extraction","dataset":"ChemProt","model":"PubMedBERT uncased","rank_in_archive_order":12,"of":13,"metrics":{"Micro F1":"77.24"},"uses_additional_data":false},{"leaderboard":"/sota/relation-extraction-on-ddi","task":"Relation Extraction","dataset":"DDI","model":"PubMedBERT uncased","rank_in_archive_order":3,"of":3,"metrics":{"Micro F1":"82.36"},"uses_additional_data":false},{"leaderboard":"/sota/relation-extraction-on-gad","task":"Relation Extraction","dataset":"GAD","model":"PubMedBERT uncased","rank_in_archive_order":3,"of":3,"metrics":{"Micro F1":"82.34"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-blurb","task":"Text Classification","dataset":"BLURB","model":"PubMedBERT (uncased; abstracts)","rank_in_archive_order":3,"of":3,"metrics":{"F1":"82.32"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2007.15779","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}