{"url":"/dataset/multext-east","name":"MULTEXT-East","full_name":null,"description_markdown":"The **MULTEXT-East** resources are a multilingual dataset for language engineering research and development. It consists of the (1) MULTEXT-East morphosyntactic specifications, defining categories (parts-of-speech), their morphosyntactic features (attributes and values), and the compact MSD tagset representations; (2) morphosyntactic lexica, (3) the annotated parallel \"1984\" corpus; and (4) some comparable text and speech corpora. The specifications are available for the following macrolanguages, languages and language varieties: Albanian, Bulgarian, Chechen, Czech, Damaskini, English, Estonian, Hungarian, Macedonian, Persian, Polish, Resian, Romanian, Russian, Serbo-Croatian, Slovak, Slovene, Torlak, and Ukrainian, while the other resources are available for a subset of these languages.","description_withheld":null,"homepage":"http://nl.ijs.si/ME/","introduced_date":"2020-03-31","introduced_date_note":null,"introduced_by":{"paper":"/paper/multext-east","title":"MULTEXT-East","first_author":"Tomaž Erjavec","url":null},"license":{"name":"Unknown","url":null},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"Russian","url":"/datasets/language/russian"},{"name":"Albanian","url":"/datasets/language/albanian"},{"name":"Bulgarian","url":"/datasets/language/bulgarian"},{"name":"Czech","url":"/datasets/language/czech"},{"name":"Estonian","url":"/datasets/language/estonian"},{"name":"Hungarian","url":"/datasets/language/hungarian"},{"name":"Persian","url":"/datasets/language/persian"},{"name":"Polish","url":"/datasets/language/polish"},{"name":"Romanian","url":"/datasets/language/romanian"},{"name":"Slovak","url":"/datasets/language/slovak"},{"name":"Slovenian","url":"/datasets/language/slovenian"},{"name":"Ukrainian","url":"/datasets/language/ukrainian"},{"name":"Chechen","url":"/datasets/language/chechen"},{"name":"Serbo-Croatian","url":"/datasets/language/serbo-croatian"},{"name":"Macedonian","url":"/datasets/language/macedonian"}],"variants":["MULTEXT-East"],"data_loaders":[],"num_papers_in_archive":25,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}