{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/biomedical-named-entity-recognition-at-scale","title":"Biomedical Named Entity Recognition at Scale","arxiv_id":"2011.06315","date":"2020-11-12","proceeding":null,"authors":["Veysel Kocaman","David Talby"],"abstract":"Named entity recognition (NER) is a widely applicable natural language processing task and building block of question answering, topic modeling, information retrieval, etc. In the medical domain, NER plays a crucial role by extracting meaningful chunks from clinical notes and reports, which are then fed to downstream tasks like assertion status detection, entity resolution, relation extraction, and de-identification. Reimplementing a Bi-LSTM-CNN-Char deep learning architecture on top of Apache Spark, we present a single trainable NER model that obtains new state-of-the-art results on seven public biomedical benchmarks without using heavy contextual embeddings like BERT. This includes improving BC4CHEMD to 93.72% (4.1% gain), Species800 to 80.91% (4.6% gain), and JNLPBA to 81.29% (5.2% gain). In addition, this model is freely available within a production-grade code base as part of the open-source Spark NLP library; can scale up for training and inference in any Spark cluster; has GPU support and libraries for popular programming languages such as Python, R, Scala and Java; and can be extended to support other human languages with no code changes.","url_abs":"https://arxiv.org/abs/2011.06315v1","url_pdf":"https://arxiv.org/pdf/2011.06315v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"biomedical-named-entity-recognition-at-scale","repo_url":"https://github.com/JohnSnowLabs/spark-nlp-workshop/blob/master/tutorials/Certification_Trainings/Healthcare/1.4.Biomedical_NER_SparkNLP_paper_reproduce.ipynb","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"none","reach":{"status":"unanswered"}}],"tasks":[{"task_slug":"de-identification","task_name":"De-identification"},{"task_slug":"entity-resolution","task_name":"Entity Resolution"},{"task_slug":null,"task_name":"GPU"},{"task_slug":"information-retrieval","task_name":"Information Retrieval"},{"task_slug":"medical-named-entity-recognition","task_name":"Medical Named Entity Recognition"},{"task_slug":"cg","task_name":"NER"},{"task_slug":"named-entity-recognition-1","task_name":"Named Entity Recognition"},{"task_slug":"named-entity-recognition-ner","task_name":"Named Entity Recognition (NER)"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"relation-extraction","task_name":"Relation Extraction"},{"task_slug":"retrieval","task_name":"Retrieval"},{"task_slug":"named-entity-recognition","task_name":"named-entity-recognition"}],"methods":[{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"bert","method_name":"BERT"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"linear-warmup-with-linear-decay","method_name":"Linear Warmup With Linear Decay"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"weight-decay","method_name":"Weight Decay"},{"method_slug":"wordpiece","method_name":"WordPiece"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/named-entity-recognition-on-anatem","task":"Named Entity Recognition (NER)","dataset":"AnatEM","model":"BLSTM-CNN-Char (SparkNLP)","rank_in_archive_order":3,"of":5,"metrics":{"F1":"89.13"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-bc2gm","task":"Named Entity Recognition (NER)","dataset":"BC2GM","model":"Spark NLP","rank_in_archive_order":1,"of":13,"metrics":{"F1":"88.75"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-bc4chemd","task":"Named Entity Recognition (NER)","dataset":"BC4CHEMD","model":"BLSTM-CNN-Char (SparkNLP)","rank_in_archive_order":2,"of":7,"metrics":{"F1":"93.72"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-ner-on-bc5cdr","task":"Named Entity Recognition (NER)","dataset":"BC5CDR","model":"BLSTM-CNN-Char (SparkNLP)","rank_in_archive_order":8,"of":16,"metrics":{"F1":"89.73"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-ner-on-bc5cdr","task":"Named Entity Recognition (NER)","dataset":"BC5CDR","model":"Spark NLP","rank_in_archive_order":9,"of":16,"metrics":{"F1":"89.73"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-bc5cdr-chemical","task":"Named Entity Recognition (NER)","dataset":"BC5CDR-chemical","model":"Spark NLP","rank_in_archive_order":1,"of":13,"metrics":{"F1":"94.88"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-bionlp13-cg","task":"Named Entity Recognition (NER)","dataset":"BioNLP13-CG","model":"BLSTM-CNN-Char (SparkNLP)","rank_in_archive_order":1,"of":3,"metrics":{"F1":"85.58"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-ner-on-jnlpba","task":"Named Entity Recognition (NER)","dataset":"JNLPBA","model":"BLSTM-CNN-Char (SparkNLP)","rank_in_archive_order":2,"of":17,"metrics":{"F1":"81.29"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-ner-on-jnlpba","task":"Named Entity Recognition (NER)","dataset":"JNLPBA","model":"Spark NLP","rank_in_archive_order":3,"of":17,"metrics":{"F1":"81.29"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-linnaeus","task":"Named Entity Recognition (NER)","dataset":"LINNAEUS","model":"BLSTM-CNN-Char (SparkNLP)","rank_in_archive_order":1,"of":6,"metrics":{"F1":"86.26"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-linnaeus","task":"Named Entity Recognition (NER)","dataset":"LINNAEUS","model":"Spark NLP","rank_in_archive_order":2,"of":6,"metrics":{"F1":"86.26"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-ner-on-ncbi-disease","task":"Named Entity Recognition (NER)","dataset":"NCBI-disease","model":"BLSTM-CNN-Char (SparkNLP)","rank_in_archive_order":4,"of":26,"metrics":{"F1":"89.13"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-ner-on-ncbi-disease","task":"Named Entity Recognition (NER)","dataset":"NCBI-disease","model":"Spark NLP","rank_in_archive_order":5,"of":26,"metrics":{"F1":"89.13"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-species-800","task":"Named Entity Recognition (NER)","dataset":"Species-800","model":"Spark NLP","rank_in_archive_order":4,"of":4,"metrics":{"F1":"80.91"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-species800","task":"Named Entity Recognition (NER)","dataset":"Species800","model":"BLSTM-CNN-Char (SparkNLP)","rank_in_archive_order":1,"of":2,"metrics":{"F1":"80.91"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2011.06315","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}