{"url":"/dataset/masakhaner","name":"MasakhaNER","full_name":null,"description_markdown":"MasakhaNER is a collection of Named Entity Recognition (NER) datasets for 10 different African languages. The languages forming this dataset are: Amharic, Hausa, Igbo, Kinyarwanda, Luganda, Luo, Nigerian-Pidgin, Swahili, Wolof, and Yorùbá.","description_withheld":null,"homepage":"https://github.com/masakhane-io/masakhane-ner","introduced_date":"2021-03-22","introduced_date_note":null,"introduced_by":{"paper":"/paper/masakhaner-named-entity-recognition-for","title":"MasakhaNER: Named Entity Recognition for African Languages","first_author":"David Ifeoluwa Adelani","url":null},"license":null,"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Named Entity Recognition (NER)","url":"/task/named-entity-recognition-ner","datasets_with_task":"/datasets/task/named-entity-recognition-ner"},{"name":"Cross-Lingual NER","url":"/task/cross-lingual-ner","datasets_with_task":"/datasets/task/cross-lingual-ner"},{"name":"Named Entity Recognition","url":"/task/named-entity-recognition-1","datasets_with_task":"/datasets/task/named-entity-recognition-1"}],"languages":[{"name":"Amharic","url":"/datasets/language/amharic"},{"name":"Nigerian Pidgin","url":"/datasets/language/nigerian-pidgin"},{"name":"Wolof","url":"/datasets/language/wolof"},{"name":"Yoruba","url":"/datasets/language/yoruba"},{"name":"Swahili","url":"/datasets/language/swahili"},{"name":"Hausa","url":"/datasets/language/hausa"},{"name":"Igbo","url":"/datasets/language/igbo"},{"name":"Kinyarwanda","url":"/datasets/language/kinyarwanda"},{"name":"Luo (Kenya and Tanzania)","url":"/datasets/language/luo-kenya-and-tanzania"},{"name":"Luo (Cameroon)","url":"/datasets/language/luo-cameroon"}],"variants":["MasakhaNER","MasakhaNER2.0"],"data_loaders":[{"repo":"https://github.com/masakhane-io/masakhane-ner","url":"https://github.com/masakhane-io/masakhane-ner","frameworks":["pytorch"]}],"num_papers_in_archive":56,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/cross-lingual-ner-on-masakhaner2-0","task":"Cross-Lingual NER","dataset_variant":"MasakhaNER2.0","rows":2,"metrics":["Bambara","Ewe","Fon","Hausa","Igbo","Kinyarwanda","Luganda","Luo","Mossi","Chichewa","chiShona","Kiswahili","Setswana","Akan/Twi","Wolof","isiXhosa","Yoruba","isiZulu"],"first_row_in_archive_order":{"model":"EasyProject","paper":"/paper/frustratingly-easy-label-projection-for-cross","metrics":{"Akan/Twi":"65.3","Bambara":" 45.8","Chichewa":"75.3","Ewe":" 78.5","Fon":" 61.4","Hausa":"72.2","Igbo":" 65.6","Kinyarwanda":" 71.0","Kiswahili":"83.6","Luganda":" 76.7","Luo":" 50.2","Mossi":"53.1","Setswana":"74.0","Wolof":" 58.9","Yoruba":" 36.8","chiShona":" 55.9","isiXhosa":"71.1","isiZulu":"73.0"},"code_links":[{"title":"edchengg/easyproject","url":"https://github.com/edchengg/easyproject"},{"title":"edchengg/transfusion","url":"https://github.com/edchengg/transfusion"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/t-projection-high-quality-annotation","title":"T-Projection: High Quality Annotation Projection for Sequence Labeling Tasks","date":"2022-12-20","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/frustratingly-easy-label-projection-for-cross","title":"Frustratingly Easy Label Projection for Cross-lingual Transfer","date":"2022-11-28","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":9,"samples_ran":0,"samples_unverified":9,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":1,"samples_harvested":9,"samples_ran":0,"samples_unverified":9,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":1,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}