{"url":"/dataset/universal-dependencies","name":"Universal Dependencies","full_name":null,"description_markdown":"The **Universal Dependencies** (UD) project seeks to develop cross-linguistically consistent treebank annotation of morphology and syntax for multiple languages. The first version of the dataset was released in 2015 and consisted of 10 treebanks over 10 languages. Version 2.7 released in 2020 consists of 183 treebanks over 104 languages. The annotation consists of UPOS (universal part-of-speech tags), XPOS (language-specific part-of-speech tags), Feats (universal morphological features), Lemmas, dependency heads and universal dependency labels.\r\n\r\nSource: [Evaluating Contextualized Embeddings on 54 Languagesin POS Tagging, Lemmatization and Dependency Parsing](https://arxiv.org/abs/1908.07448)\r\nImage Source: [https://universaldependencies.org/introduction.html](https://universaldependencies.org/introduction.html)","description_withheld":null,"homepage":"https://universaldependencies.org/","introduced_date":"2016-01-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/universal-dependencies-v1-a-multilingual","title":"Universal Dependencies v1: A Multilingual Treebank Collection","first_author":"Joakim Nivre","url":null},"license":{"name":"Various (see link)","url":"https://lindat.mff.cuni.cz/repository/xmlui/page/licence-UD-2.1"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"},{"name":"Audio","url":"/datasets/modality/audio"}],"tasks":[{"name":"Dependency Parsing","url":"/task/dependency-parsing","datasets_with_task":"/datasets/task/dependency-parsing"},{"name":"Part-Of-Speech Tagging","url":"/task/part-of-speech-tagging","datasets_with_task":"/datasets/task/part-of-speech-tagging"},{"name":"Language Identification","url":"/task/language-identification","datasets_with_task":"/datasets/task/language-identification"},{"name":"POS","url":"/task/pos","datasets_with_task":"/datasets/task/pos"},{"name":"Cross-lingual zero-shot dependency parsing","url":"/task/cross-lingual-zero-shot-dependency-parsing","datasets_with_task":"/datasets/task/cross-lingual-zero-shot-dependency-parsing"},{"name":"Cross-Lingual POS Tagging","url":"/task/cross-lingual-pos-tagging","datasets_with_task":"/datasets/task/cross-lingual-pos-tagging"},{"name":"TAG","url":"/task/tag","datasets_with_task":"/datasets/task/tag"},{"name":"SENTS","url":"/task/sents","datasets_with_task":"/datasets/task/sents"},{"name":"MORPH","url":"/task/morph","datasets_with_task":"/datasets/task/morph"},{"name":"UNLABELED_DEPENDENCIES","url":"/task/unlabeled-dependencies","datasets_with_task":"/datasets/task/unlabeled-dependencies"},{"name":"LABELED_DEPENDENCIES","url":"/task/labeled-dependencies","datasets_with_task":"/datasets/task/labeled-dependencies"},{"name":"LEMMA","url":"/task/lemma","datasets_with_task":"/datasets/task/lemma"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"French","url":"/datasets/language/french"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"German","url":"/datasets/language/german"},{"name":"Italian","url":"/datasets/language/italian"},{"name":"Chinese","url":"/datasets/language/chinese"},{"name":"Japanese","url":"/datasets/language/japanese"},{"name":"Russian","url":"/datasets/language/russian"},{"name":"Portuguese","url":"/datasets/language/portuguese"},{"name":"Afrikaans","url":"/datasets/language/afrikaans"},{"name":"Akkadian","url":"/datasets/language/akkadian"},{"name":"Akuntsu","url":"/datasets/language/akuntsu"},{"name":"Albanian","url":"/datasets/language/albanian"},{"name":"Amharic","url":"/datasets/language/amharic"},{"name":"Ancient Greek","url":"/datasets/language/ancient-greek"},{"name":"Apurinã","url":"/datasets/language/apurin"},{"name":"Arabic","url":"/datasets/language/arabic"},{"name":"Armenian","url":"/datasets/language/armenian"},{"name":"Assyrian Neo-Aramaic","url":"/datasets/language/assyrian-neo-aramaic"},{"name":"Bambara","url":"/datasets/language/bambara"},{"name":"Basque","url":"/datasets/language/basque"},{"name":"Belarusian","url":"/datasets/language/belarusian"},{"name":"Bhojpuri","url":"/datasets/language/bhojpuri"},{"name":"Breton","url":"/datasets/language/breton"},{"name":"Bulgarian","url":"/datasets/language/bulgarian"},{"name":"Catalan","url":"/datasets/language/catalan"},{"name":"Chukot","url":"/datasets/language/chukot"},{"name":"Church Slavic","url":"/datasets/language/church-slavic"},{"name":"Coptic","url":"/datasets/language/coptic"},{"name":"Croatian","url":"/datasets/language/croatian"},{"name":"Czech","url":"/datasets/language/czech"},{"name":"Danish","url":"/datasets/language/danish"},{"name":"Dutch","url":"/datasets/language/dutch"},{"name":"Erzya","url":"/datasets/language/erzya"},{"name":"Estonian","url":"/datasets/language/estonian"},{"name":"Faroese","url":"/datasets/language/faroese"},{"name":"Finnish","url":"/datasets/language/finnish"},{"name":"Galician","url":"/datasets/language/galician"},{"name":"Gothic","url":"/datasets/language/gothic"},{"name":"Hebrew","url":"/datasets/language/hebrew"},{"name":"Hindi","url":"/datasets/language/hindi"},{"name":"Hungarian","url":"/datasets/language/hungarian"},{"name":"Icelandic","url":"/datasets/language/icelandic"},{"name":"Indonesian","url":"/datasets/language/indonesian"},{"name":"Irish","url":"/datasets/language/irish"},{"name":"Karelian","url":"/datasets/language/karelian"},{"name":"Kazakh","url":"/datasets/language/kazakh"},{"name":"Khunsari","url":"/datasets/language/khunsari"},{"name":"Komi-Permyak","url":"/datasets/language/komi-permyak"},{"name":"Komi-Zyrian","url":"/datasets/language/komi-zyrian"},{"name":"Korean","url":"/datasets/language/korean"},{"name":"Latin","url":"/datasets/language/latin"},{"name":"Latvian","url":"/datasets/language/latvian"},{"name":"Literary Chinese","url":"/datasets/language/literary-chinese"},{"name":"Lithuanian","url":"/datasets/language/lithuanian"},{"name":"Livvi","url":"/datasets/language/livvi"},{"name":"Maltese","url":"/datasets/language/maltese"},{"name":"Manx","url":"/datasets/language/manx"},{"name":"Marathi","url":"/datasets/language/marathi"},{"name":"Mbyá Guaraní","url":"/datasets/language/mby-guaran"},{"name":"Modern Greek","url":"/datasets/language/modern-greek"},{"name":"Moksha","url":"/datasets/language/moksha"},{"name":"Mundurukú","url":"/datasets/language/munduruk"},{"name":"Nayini","url":"/datasets/language/nayini"},{"name":"Nigerian Pidgin","url":"/datasets/language/nigerian-pidgin"},{"name":"Northern Kurdish","url":"/datasets/language/northern-kurdish"},{"name":"Northern Sami","url":"/datasets/language/northern-sami"},{"name":"Norwegian","url":"/datasets/language/norwegian"},{"name":"Old French","url":"/datasets/language/old-french"},{"name":"Old Russian","url":"/datasets/language/old-russian"},{"name":"Old Turkish","url":"/datasets/language/old-turkish"},{"name":"Persian","url":"/datasets/language/persian"},{"name":"Polish","url":"/datasets/language/polish"},{"name":"Romanian","url":"/datasets/language/romanian"},{"name":"Russia Buriat","url":"/datasets/language/russia-buriat"},{"name":"Sanskrit","url":"/datasets/language/sanskrit"},{"name":"Scottish Gaelic","url":"/datasets/language/scottish-gaelic"},{"name":"Serbian","url":"/datasets/language/serbian"},{"name":"Skolt Sami","url":"/datasets/language/skolt-sami"},{"name":"Slovak","url":"/datasets/language/slovak"},{"name":"Slovenian","url":"/datasets/language/slovenian"},{"name":"Soi","url":"/datasets/language/soi"},{"name":"South Levantine Arabic","url":"/datasets/language/south-levantine-arabic"},{"name":"Swedish","url":"/datasets/language/swedish"},{"name":"Swedish Sign Language","url":"/datasets/language/swedish-sign-language"},{"name":"Swiss German","url":"/datasets/language/swiss-german"},{"name":"Tagalog","url":"/datasets/language/tagalog"},{"name":"Tamil","url":"/datasets/language/tamil"},{"name":"Telugu","url":"/datasets/language/telugu"},{"name":"Thai","url":"/datasets/language/thai"},{"name":"Tupinambá","url":"/datasets/language/tupinamb"},{"name":"Turkish","url":"/datasets/language/turkish"},{"name":"Uighur","url":"/datasets/language/uighur"},{"name":"Ukrainian","url":"/datasets/language/ukrainian"},{"name":"Upper Sorbian","url":"/datasets/language/upper-sorbian"},{"name":"Urdu","url":"/datasets/language/urdu"},{"name":"Vietnamese","url":"/datasets/language/vietnamese"},{"name":"Warlpiri","url":"/datasets/language/warlpiri"},{"name":"Welsh","url":"/datasets/language/welsh"},{"name":"Wolof","url":"/datasets/language/wolof"},{"name":"Yoruba","url":"/datasets/language/yoruba"},{"name":"Yue Chinese","url":"/datasets/language/yue-chinese"}],"variants":["UD","Universal Dependencies","Universal Dependency Treebank","Universal Dependencies v2.8","universal_dependencies sk_snk","Maltese Universal Dependencies Treebank (MUDT)","UD Danish DDT"],"data_loaders":[{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/universal_dependencies","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/albertvillanova/universal_dependencies","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/BramVanroy/ud_dutch_lassysmall","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/BramVanroy/ud_dutch_alpino","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/universal-dependencies/universal_dependencies","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/allenai/allennlp-models","url":"https://docs.allennlp.org/models/main/models/structured_prediction/dataset_readers/universal_dependencies/","frameworks":["pytorch"]}],"num_papers_in_archive":520,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/dependency-parsing-on-universal-dependencies","task":"Dependency Parsing","dataset_variant":"Universal Dependencies","rows":6,"metrics":["LAS","UAS","BLEX"],"first_row_in_archive_order":{"model":"UDPipe 2.0 + mBERT + FLAIR","paper":"/paper/evaluating-contextualized-embeddings-on-54","metrics":{"LAS":"84.60","UAS":"87.64"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/part-of-speech-tagging-on-ud","task":"Part-Of-Speech Tagging","dataset_variant":"UD","rows":5,"metrics":["Avg accuracy"],"first_row_in_archive_order":{"model":"BiLSTM-LAN","paper":"/paper/hierarchically-refined-label-attention","metrics":{"Avg accuracy":"96.88"},"code_links":[{"title":"Nealcly/LAN","url":"https://github.com/Nealcly/LAN"},{"title":"Nealcly/BiLSTM-LAN","url":"https://github.com/Nealcly/BiLSTM-LAN"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/cross-lingual-zero-shot-dependency-parsing-on","task":"Cross-lingual zero-shot dependency parsing","dataset_variant":"Universal Dependency Treebank","rows":3,"metrics":["LAS","UAS"],"first_row_in_archive_order":{"model":"Cross-Lingual ELMo","paper":"/paper/cross-lingual-alignment-of-contextual-word","metrics":{"LAS":"77.3","UAS":"84.2"},"code_links":[{"title":"TalSchuster/CrossLingualContextualEmb","url":"https://github.com/TalSchuster/CrossLingualContextualEmb"},{"title":"TalSchuster/CrossLingualELMo","url":"https://github.com/TalSchuster/CrossLingualELMo"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/dependency-parsing-on-universal-dependency","task":"Dependency Parsing","dataset_variant":"Universal Dependency Treebank","rows":1,"metrics":["Macro F1"],"first_row_in_archive_order":{"model":"Stanza","paper":"/paper/stanza-a-python-natural-language-processing","metrics":{"Macro F1":"81.13"},"code_links":[{"title":"stanfordnlp/stanza","url":"https://github.com/stanfordnlp/stanza"},{"title":"textflint/textflint","url":"https://github.com/textflint/textflint"},{"title":"astrazeneca/kazu","url":"https://github.com/astrazeneca/kazu"},{"title":"sktwtrg/stanza_ja_test","url":"https://github.com/sktwtrg/stanza_ja_test"},{"title":"rasoolims/stanza","url":"https://github.com/rasoolims/stanza"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/language-identification-on-universal","task":"Language Identification","dataset_variant":"Universal Dependencies","rows":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Apple bi-LSTM","paper":"/paper/a-reproduction-of-apple-s-bi-directional-lstm","metrics":{"Accuracy":"86.93"},"code_links":[{"title":"AU-DIS/LSTM_langid","url":"https://github.com/AU-DIS/LSTM_langid"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/a-reproduction-of-apple-s-bi-directional-lstm","title":"A reproduction of Apple's bi-directional LSTM models for language identification in short strings","date":"2021-02-11","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/stanza-a-python-natural-language-processing","title":"Stanza: A Python Natural Language Processing Toolkit for Many Human Languages","date":"2020-03-16","rows_on_this_dataset":1,"code_links":5,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":30,"samples_ran":16,"samples_unverified":14,"pointer_only_for_licence":28,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/hierarchically-refined-label-attention","title":"Hierarchically-Refined Label Attention Network for Sequence Labeling","date":"2019-08-23","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/evaluating-contextualized-embeddings-on-54","title":"Evaluating Contextualized Embeddings on 54 Languages in POS Tagging, Lemmatization and Dependency Parsing","date":"2019-08-20","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/sequence-tagging-with-contextual-and-non","title":"Sequence Tagging with Contextual and Non-Contextual Subword Representations: A Multilingual Evaluation","date":"2019-06-04","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/75-languages-1-model-parsing-universal","title":"75 Languages, 1 Model: Parsing Universal Dependencies Universally","date":"2019-04-03","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":0,"samples_unverified":12,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/cross-lingual-alignment-of-contextual-word","title":"Cross-Lingual Alignment of Contextual Word Embeddings, with Applications to Zero-shot Dependency Parsing","date":"2019-02-25","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":2,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/universal-dependency-parsing-from-scratch","title":"Universal Dependency Parsing from Scratch","date":"2019-01-29","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/udpipe-20-prototype-at-conll-2018-ud-shared","title":"UDPipe 2.0 Prototype at CoNLL 2018 UD Shared Task","date":"2018-10-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/turku-neural-parser-pipeline-an-end-to-end","title":"Turku Neural Parser Pipeline: An End-to-End System for the CoNLL 2018 Shared Task","date":"2018-10-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/towards-better-ud-parsing-deep-contextualized","title":"Towards Better UD Parsing: Deep Contextualized Word Embeddings, Ensemble, and Treebank Concatenation","date":"2018-07-09","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/robust-multilingual-part-of-speech-tagging","title":"Robust Multilingual Part-of-Speech Tagging via Adversarial Training","date":"2017-11-14","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/a-novel-neural-network-model-for-joint-pos","title":"A Novel Neural Network Model for Joint POS Tagging and Graph-based Dependency Parsing","date":"2017-05-16","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/multilingual-part-of-speech-tagging-with","title":"Multilingual Part-of-Speech Tagging with Bidirectional Long Short-Term Memory Models and Auxiliary Loss","date":"2016-04-19","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":1,"samples_unverified":3,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/a-representation-learning-framework-for-multi","title":"A Representation Learning Framework for Multi-Source Transfer Parsing","date":"2016-03-05","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/many-languages-one-parser","title":"Many Languages, One Parser","date":"2016-02-04","rows_on_this_dataset":1,"code_links":1,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":4,"samples_harvested":49,"samples_ran":19,"samples_unverified":30,"pointer_only_for_licence":29,"papers_with_no_sample_that_ran":1,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}