{"url":"/dataset/multieurlex","name":"MultiEURLEX","full_name":null,"description_markdown":"**MultiEURLEX** is a multilingual dataset for topic classification of legal documents. The dataset comprises 65k European Union (EU) laws, officially translated in 23 languages, annotated with multiple labels from the EUROVOC taxonomy. The dataset covers 23 official EU languages from 7 language families.","description_withheld":null,"homepage":"https://github.com/nlpaueb/multi-eurlex","introduced_date":"2021-09-02","introduced_date_note":null,"introduced_by":{"paper":"/paper/multieurlex-a-multi-lingual-and-multi-label","title":"MultiEURLEX -- A multi-lingual and multi-label legal document classification dataset for zero-shot cross-lingual transfer","first_author":"Ilias Chalkidis","url":null},"license":null,"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Document Classification","url":"/task/document-classification","datasets_with_task":"/datasets/task/document-classification"},{"name":"Multilingual text classification","url":"/task/multilingual-text-classification","datasets_with_task":"/datasets/task/multilingual-text-classification"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"French","url":"/datasets/language/french"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"German","url":"/datasets/language/german"},{"name":"Italian","url":"/datasets/language/italian"},{"name":"Portuguese","url":"/datasets/language/portuguese"},{"name":"Bulgarian","url":"/datasets/language/bulgarian"},{"name":"Croatian","url":"/datasets/language/croatian"},{"name":"Czech","url":"/datasets/language/czech"},{"name":"Danish","url":"/datasets/language/danish"},{"name":"Dutch","url":"/datasets/language/dutch"},{"name":"Estonian","url":"/datasets/language/estonian"},{"name":"Finnish","url":"/datasets/language/finnish"},{"name":"Hungarian","url":"/datasets/language/hungarian"},{"name":"Latvian","url":"/datasets/language/latvian"},{"name":"Lithuanian","url":"/datasets/language/lithuanian"},{"name":"Maltese","url":"/datasets/language/maltese"},{"name":"Polish","url":"/datasets/language/polish"},{"name":"Romanian","url":"/datasets/language/romanian"},{"name":"Slovak","url":"/datasets/language/slovak"},{"name":"Slovenian","url":"/datasets/language/slovenian"},{"name":"Swedish","url":"/datasets/language/swedish"},{"name":"Greek","url":"/datasets/language/greek"}],"variants":["MultiEURLEX"],"data_loaders":[],"num_papers_in_archive":11,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}