{"url":"/task/cg","name":"NER","slug":"cg","description_markdown":"The named entity recognition (NER) involves identification of key information in the text and classification into a set of predefined categories. This includes standard entities in the text like Part of Speech (PoS) and entities like places, names etc...","categories":[{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":1729,"papers_with_code":665,"benchmarks":4,"benchmark_tables_in_archive":5,"benchmark_tables_shown":5,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":27,"subtasks":0,"parent_tasks":2},"benchmarks":[{"leaderboard":"/sota/ner-on-conll-2003-1","slug":"ner-on-conll-2003-1","dataset":"CoNLL 2003","dataset_url":"/dataset/conll-2003","rows_in_archive":1,"metrics":["AUC","Accuracy","F1","Precision","Recall"],"first_row_in_archive_order":{"model":"Def2Vec","paper_title":"Def2Vec: Extensible Word Embeddings from Dictionary Definitions","paper_url":"/paper/def2vec-extensible-word-embeddings-from","paper_date":"2023-12-16","arxiv_id":null,"code_links":[{"title":"IreneMorazzoni/def_2_vec_irene","url":"https://github.com/IreneMorazzoni/def_2_vec_irene"},{"title":"vincenzo-scotti/def_2_vec","url":"https://github.com/vincenzo-scotti/def_2_vec"}],"syntology":null}},{"leaderboard":"/sota/ner-on-inlegalner","slug":"ner-on-inlegalner","dataset":"InLegalNER","dataset_url":"/dataset/inlegalner","rows_in_archive":1,"metrics":["F1 score"],"first_row_in_archive_order":{"model":"opennyaiorg/en_legal_ner_trf","paper_title":"Named Entity Recognition in Indian court judgments","paper_url":"/paper/named-entity-recognition-in-indian-court","paper_date":"2022-11-07","arxiv_id":"2211.03442","code_links":[{"title":"legal-nlp-ekstep/legal_ner","url":"https://github.com/legal-nlp-ekstep/legal_ner"}],"syntology":null}},{"leaderboard":"/sota/ner-on-supermat","slug":"ner-on-supermat","dataset":"SuperMat","dataset_url":"/dataset/supermat","rows_in_archive":1,"metrics":["F1","Precision","Recall"],"first_row_in_archive_order":{"model":"superconductors-Scibert","paper_title":"Automatic extraction of materials and properties from superconductors scientific literature","paper_url":"/paper/automatic-extraction-of-materials-and","paper_date":"2022-10-26","arxiv_id":"2210.15600","code_links":[{"title":"lfoppiano/grobid-superconductors","url":"https://github.com/lfoppiano/grobid-superconductors"},{"title":"lfoppiano/supercon","url":"https://github.com/lfoppiano/supercon"}],"syntology":null}},{"leaderboard":"/sota/ner-on-the-embo-sourcedata-nlp-dataset","slug":"ner-on-the-embo-sourcedata-nlp-dataset","dataset":"The EMBO SourceData-NLP dataset","dataset_url":"/dataset/the-embo-sourcedata-nlp-dataset","rows_in_archive":1,"metrics":["F1 Micro"],"first_row_in_archive_order":{"model":"BioLinkBERT-large","paper_title":"Integrating curation into scientific publishing to train AI models","paper_url":"/paper/the-sourcedata-nlp-dataset-integrating","paper_date":"2023-10-31","arxiv_id":"2310.20440","code_links":[{"title":"source-data/soda-data","url":"https://github.com/source-data/soda-data"}],"syntology":null}},{"leaderboard":null,"slug":"ner-on-dane","dataset":"DaNE","dataset_url":"/dataset/dane","rows_in_archive":0,"metrics":["NER F Score","NER Precision","NER Recall"],"first_row_in_archive_order":null}],"datasets":[{"url":"/dataset/mnist","name":"MNIST","full_name":"","num_papers_in_archive":7651},{"url":"/dataset/conll-2003","name":"CoNLL 2003","full_name":"","num_papers_in_archive":755},{"url":"/dataset/msra-cn-ner","name":"MSRA CN NER","full_name":"MSRA CN NER Dataset","num_papers_in_archive":23},{"url":"/dataset/ade-corpus","name":"Adverse Drug Events (ADE) Corpus","full_name":"","num_papers_in_archive":14},{"url":"/dataset/bc4chemd","name":"BC4CHEMD","full_name":"BioCreative IV Chemical compound and drug name recognition","num_papers_in_archive":6},{"url":"/dataset/dane","name":"DaNE","full_name":"Danish Dependency Treebank","num_papers_in_archive":6},{"url":"/dataset/harveyner","name":"HarveyNER","full_name":"","num_papers_in_archive":5},{"url":"/dataset/finer-139","name":"FiNER-139","full_name":"","num_papers_in_archive":4},{"url":"/dataset/nuner","name":"NuNER","full_name":"","num_papers_in_archive":4},{"url":"/dataset/supermat","name":"SuperMat","full_name":"","num_papers_in_archive":4},{"url":"/dataset/tlunified-ner","name":"TLUnified-NER","full_name":"","num_papers_in_archive":3},{"url":"/dataset/biographical","name":"Biographical","full_name":"Biographical: A Semi-Supervised Relation Extraction Dataset","num_papers_in_archive":2},{"url":"/dataset/fijo","name":"FIJO","full_name":"French Insurance Job Offer dataset","num_papers_in_archive":2},{"url":"/dataset/inlegalner","name":"InLegalNER","full_name":"InLegalNER","num_papers_in_archive":2},{"url":"/dataset/lepiszcze","name":"LEPISZCZE","full_name":"","num_papers_in_archive":2},{"url":"/dataset/aiseckg","name":"AISECKG","full_name":"AISecKG: Knowledge Graph Dataset for Cybersecurity Education","num_papers_in_archive":1},{"url":"/dataset/first-harem","name":"First HAREM","full_name":"Primeiro HAREM","num_papers_in_archive":1},{"url":"/dataset/iecsil-fire-2018-shared-task","name":"IECSIL FIRE-2018 Shared Task","full_name":"","num_papers_in_archive":1},{"url":"/dataset/mini-harem","name":"Mini HAREM","full_name":"","num_papers_in_archive":1},{"url":"/dataset/rate-ner","name":"RaTE-NER","full_name":"","num_papers_in_archive":1},{"url":"/dataset/tasteset","name":"TASTEset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/the-embo-sourcedata-nlp-dataset","name":"The EMBO SourceData-NLP dataset","full_name":"The SourceData-NLP dataset: integrating curation into scientific publishing for training large language models","num_papers_in_archive":1},{"url":"/dataset/noise-sf","name":"Noise-SF","full_name":"","num_papers_in_archive":0},{"url":"/dataset/popcorn","name":"POPCORN","full_name":"POPCORN: Fictional and Synthetic Intelligence Reports for Named Entity Recognition and Relation Extraction Tasks","num_papers_in_archive":0},{"url":"/dataset/second-harem","name":"Second HAREM","full_name":"Segundo HAREM","num_papers_in_archive":0},{"url":"/dataset/sigarra-news-corpus","name":"SIGARRA News Corpus","full_name":"","num_papers_in_archive":0},{"url":"/dataset/sourcedata-nlp","name":"SourceData-NLP","full_name":"The SourceData-NLP dataset: integrating curation into scientific publishing for training large language models","num_papers_in_archive":0}],"subtasks":[],"parent_tasks":[{"url":"/task/event-extraction","name":"Event Extraction"},{"url":"/task/named-entity-recognition-ner","name":"Named Entity Recognition (NER)"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":665,"tagged_in_all":1729,"items":[{"url":"/paper/nezha-neural-contextualized-representation","title":"NEZHA: Neural Contextualized Representation for Chinese Language Understanding","date":"2019-08-31","arxiv_id":"1909.00204","repositories_listed":10,"syntology":null},{"url":"/paper/crossner-evaluating-cross-domain-named-entity","title":"CrossNER: Evaluating Cross-Domain Named Entity Recognition","date":"2020-12-08","arxiv_id":"2012.04373","repositories_listed":5,"syntology":null},{"url":"/paper/arabert-transformer-based-model-for-arabic","title":"AraBERT: Transformer-based Model for Arabic Language Understanding","date":"2020-02-28","arxiv_id":"2003.00104","repositories_listed":4,"syntology":null},{"url":"/paper/fast-and-accurate-entity-recognition-with","title":"Fast and Accurate Entity Recognition with Iterated Dilated Convolutions","date":"2017-02-07","arxiv_id":"1702.02098","repositories_listed":4,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}},{"url":"/paper/rita-automatic-framework-for-designing-of","title":"RITA: Automatic Framework for Designing of Resilient IoT Applications","date":"2024-11-27","arxiv_id":"2411.18324","repositories_listed":3,"syntology":null},{"url":"/paper/ratescore-a-metric-for-radiology-report","title":"RaTEScore: A Metric for Radiology Report Generation","date":"2024-06-24","arxiv_id":"2406.16845","repositories_listed":3,"syntology":null},{"url":"/paper/diffusionner-boundary-diffusion-for-named","title":"DiffusionNER: Boundary Diffusion for Named Entity Recognition","date":"2023-05-22","arxiv_id":"2305.13298","repositories_listed":3,"syntology":null},{"url":"/paper/finer-financial-named-entity-recognition","title":"FiNER-ORD: Financial Named Entity Recognition Open Research Dataset","date":"2023-02-22","arxiv_id":"2302.11157","repositories_listed":3,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/let-s-stop-incorrect-comparisons-in-end-to","title":"Let's Stop Incorrect Comparisons in End-to-end Relation Extraction!","date":"2020-09-22","arxiv_id":"2009.10684","repositories_listed":3,"syntology":null},{"url":"/paper/beheshti-ner-persian-named-entity-recognition","title":"Beheshti-NER: Persian Named Entity Recognition Using BERT","date":"2020-03-19","arxiv_id":"2003.08875","repositories_listed":3,"syntology":null},{"url":"/paper/parallel-sequence-tagging-for-concept","title":"Parallel sequence tagging for concept recognition","date":"2020-03-16","arxiv_id":"2003.07424","repositories_listed":3,"syntology":null},{"url":"/paper/cluener2020-fine-grained-name-entity","title":"CLUENER2020: Fine-grained Named Entity Recognition Dataset and Benchmark for Chinese","date":"2020-01-13","arxiv_id":"2001.04351","repositories_listed":3,"syntology":null},{"url":"/paper/remedying-bilstm-cnn-deficiency-in-modeling","title":"Why Attention? Analyze BiLSTM Deficiency and Its Remedies in the Case of NER","date":"2019-08-29","arxiv_id":"1908.11046","repositories_listed":3,"syntology":null},{"url":"/paper/chinese-ner-using-lattice-lstm","title":"Chinese NER Using Lattice LSTM","date":"2018-05-05","arxiv_id":"1805.02023","repositories_listed":3,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/empower-sequence-labeling-with-task-aware","title":"Empower Sequence Labeling with Task-Aware Neural Language Model","date":"2017-09-13","arxiv_id":"1709.04109","repositories_listed":3,"syntology":null},{"url":"/paper/multimodal-llms-for-ocr-ocr-post-correction","title":"Multimodal LLMs for OCR, OCR Post-Correction, and Named Entity Recognition in Historical Documents","date":"2025-04-01","arxiv_id":"2504.00414","repositories_listed":2,"syntology":null},{"url":"/paper/insightbuddy-ai-medication-extraction-and","title":"INSIGHTBUDDY-AI: Medication Extraction and Entity Linking using Large Language Models and Ensemble Learning","date":"2024-09-28","arxiv_id":"2409.19467","repositories_listed":2,"syntology":null},{"url":"/paper/whisperner-unified-open-named-entity-and","title":"WhisperNER: Unified Open Named Entity and Speech Recognition","date":"2024-09-12","arxiv_id":"2409.08107","repositories_listed":2,"syntology":null},{"url":"/paper/do-english-named-entity-recognizers-work-well","title":"Do \"English\" Named Entity Recognizers Work Well on Global Englishes?","date":"2024-04-20","arxiv_id":"2404.13465","repositories_listed":2,"syntology":null},{"url":"/paper/embedded-named-entity-recognition-using","title":"Embedded Named Entity Recognition using Probing Classifiers","date":"2024-03-18","arxiv_id":"2403.11747","repositories_listed":2,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":5}},{"url":"/paper/evaluating-named-entity-recognition","title":"Evaluating Named Entity Recognition: A comparative analysis of mono- and multilingual transformer models on a novel Brazilian corporate earnings call transcripts dataset","date":"2024-03-18","arxiv_id":"2403.12212","repositories_listed":2,"syntology":null},{"url":"/paper/rethinking-negative-instances-for-generative","title":"Rethinking Negative Instances for Generative Named Entity Recognition","date":"2024-02-26","arxiv_id":"2402.16602","repositories_listed":2,"syntology":null},{"url":"/paper/def2vec-extensible-word-embeddings-from","title":"Def2Vec: Extensible Word Embeddings from Dictionary Definitions","date":"2023-12-16","arxiv_id":null,"repositories_listed":2,"syntology":null},{"url":"/paper/universal-ner-a-gold-standard-multilingual-1","title":"Universal NER: A Gold-Standard Multilingual Named Entity Recognition Benchmark","date":"2023-11-15","arxiv_id":"2311.09122","repositories_listed":2,"syntology":null},{"url":"/paper/gliner-generalist-model-for-named-entity","title":"GLiNER: Generalist Model for Named Entity Recognition using Bidirectional Transformer","date":"2023-11-14","arxiv_id":"2311.08526","repositories_listed":2,"syntology":null},{"url":"/paper/reading-order-matters-information-extraction","title":"Reading Order Matters: Information Extraction from Visually-rich Documents by Token Path Prediction","date":"2023-10-17","arxiv_id":"2310.11016","repositories_listed":2,"syntology":null},{"url":"/paper/puoberta-training-and-evaluation-of-a-curated","title":"PuoBERTa: Training and evaluation of a curated language model for Setswana","date":"2023-10-13","arxiv_id":"2310.09141","repositories_listed":2,"syntology":null},{"url":"/paper/label-supervised-llama-finetuning","title":"Label Supervised LLaMA Finetuning","date":"2023-10-02","arxiv_id":"2310.01208","repositories_listed":2,"syntology":null},{"url":"/paper/universalner-targeted-distillation-from-large","title":"UniversalNER: Targeted Distillation from Large Language Models for Open Named Entity Recognition","date":"2023-08-07","arxiv_id":"2308.03279","repositories_listed":2,"syntology":{"n":12,"n_ran":5,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/streamlining-social-media-information","title":"Streamlining Social Media Information Retrieval for COVID-19 Research with Deep Learning","date":"2023-06-28","arxiv_id":"2306.16001","repositories_listed":2,"syntology":null}],"syntology_records":5,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}