{"url":"/dataset/eur-lex-sum","name":"EUR-Lex-Sum","full_name":null,"description_markdown":"**EUR-Lex-Sum** is a dataset for cross-lingual summarization. It is based on manually curated document summaries of legal acts from the European Union law platform. Documents and their respective summaries exist as crosslingual paragraph-aligned data in several of the 24 official European languages, enabling access to various cross-lingual and lower-resourced summarization setups. The dataset contains up to 1,500 document/summary pairs per language, including a subset of 375 cross-lingually aligned legal acts with texts available in all 24 languages.\r\n\r\nSource: [EUR-Lex-Sum: A Multi- and Cross-lingual Dataset for Long-form Summarization in the Legal Domain](https://arxiv.org/pdf/2210.13448v1.pdf)\r\n\r\nImage Source: [https://arxiv.org/pdf/2210.13448v1.pdf](https://arxiv.org/pdf/2210.13448v1.pdf)","description_withheld":null,"homepage":"https://github.com/achouhan93/eur-lex-sum","introduced_date":"2022-10-24","introduced_date_note":null,"introduced_by":{"paper":"/paper/eur-lex-sum-a-multi-and-cross-lingual-dataset","title":"EUR-Lex-Sum: A Multi- and Cross-lingual Dataset for Long-form Summarization in the Legal Domain","first_author":"Dennis Aumiller","url":null},"license":null,"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Text Summarization","url":"/task/text-summarization","datasets_with_task":"/datasets/task/text-summarization"},{"name":"Document Summarization","url":"/task/document-summarization","datasets_with_task":"/datasets/task/document-summarization"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"French","url":"/datasets/language/french"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"German","url":"/datasets/language/german"},{"name":"Italian","url":"/datasets/language/italian"},{"name":"Portuguese","url":"/datasets/language/portuguese"},{"name":"Bulgarian","url":"/datasets/language/bulgarian"},{"name":"Croatian","url":"/datasets/language/croatian"},{"name":"Czech","url":"/datasets/language/czech"},{"name":"Danish","url":"/datasets/language/danish"},{"name":"Dutch","url":"/datasets/language/dutch"},{"name":"Estonian","url":"/datasets/language/estonian"},{"name":"Finnish","url":"/datasets/language/finnish"},{"name":"Hungarian","url":"/datasets/language/hungarian"},{"name":"Irish","url":"/datasets/language/irish"},{"name":"Latvian","url":"/datasets/language/latvian"},{"name":"Lithuanian","url":"/datasets/language/lithuanian"},{"name":"Maltese","url":"/datasets/language/maltese"},{"name":"Polish","url":"/datasets/language/polish"},{"name":"Romanian","url":"/datasets/language/romanian"},{"name":"Slovak","url":"/datasets/language/slovak"},{"name":"Slovenian","url":"/datasets/language/slovenian"},{"name":"Swedish","url":"/datasets/language/swedish"},{"name":"Greek","url":"/datasets/language/greek"}],"variants":["EUR-Lex-Sum"],"data_loaders":[],"num_papers_in_archive":8,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}