{"url":"/dataset/europa","name":"EUROPA","full_name":null,"description_markdown":"### Dataset Description\r\n\r\nEUROPA is a dataset designed for training and evaluating multilingual keyphrase generation models in the legal domain. It consists of legal judgments from the Court of Justice of the European Union (EU) and includes instances in all 24 official EU languages.\r\n\r\n**Key Features**:\r\n**Multilingual:** Covers 24 official EU languages.\r\n**Domain-Specific:** Focuses on legal documents.\r\n**Source:** Derived from Court of Justice of the European Union judgments.\r\n\r\n- **Curated by:** N3 team\r\n- **Languages:** French, German, English, Italian, Dutch, Greek, Danish, Portuguese, Spanish, Swedish, Finnish, Lithuanian, Estonian, Czech, Hungarian, Latvian, Slovenian, Polish, Maltese, Slovak, Romanian, Bulgarian, Croatian, Irish\r\n- **License:** MIT License\r\n\r\n### Dataset Sources\r\n\r\n- **Paper:** https://arxiv.org/abs/2403.00252\r\n\r\n## Dataset Structure\r\n\r\n- **celex_id:** CELEX identifier inherited from CJEU. Different translated versions of the same judgment share the same celex_id. If you wish to set a unique identifier for each instance, you can concatenate `lang` and `celex_id` values;\r\n- **lang:** ISO 639-1 language code;\r\n- **input:** judgment transcription or translation;\r\n- **keyphrases:** reference keyphrases drafted by the CJEU.\r\n\r\nAs explained in our paper, the dataset is split chronologically for assessing temporal generalization of models:\r\n- **training set**: 1957 to 2010 (131 076 instances);\r\n- **validation set**: 2011 to 2015 (63 373 instances);\r\n- **test set**: 2016 to 2023 (90 508 instances).\r\n\r\n## Citation\r\n\r\n```\r\n@article{salaun2024europa,\r\n  title={EUROPA: A Legal Multilingual Keyphrase Generation Dataset},\r\n  author={Sala{\\\"u}n, Olivier and Piedboeuf, Fr{\\'e}d{\\'e}ric and Le Berre, Guillaume and Hermelo, David Alfonso and Langlais, Philippe},\r\n  journal={arXiv preprint arXiv:2403.00252},\r\n  year={2024}\r\n}\r\n```","description_withheld":null,"homepage":"https://huggingface.co/datasets/NCube/europa","introduced_date":"2024-03-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/europa-a-legal-multilingual-keyphrase","title":"EUROPA: A Legal Multilingual Keyphrase Generation Dataset","first_author":"Olivier Salaün","url":null},"license":null,"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Keyphrase Extraction","url":"/task/keyphrase-extraction","datasets_with_task":"/datasets/task/keyphrase-extraction"},{"name":"Keyphrase Generation","url":"/task/keyphrase-generation","datasets_with_task":"/datasets/task/keyphrase-generation"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"French","url":"/datasets/language/french"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"German","url":"/datasets/language/german"},{"name":"Italian","url":"/datasets/language/italian"},{"name":"Portuguese","url":"/datasets/language/portuguese"},{"name":"Bulgarian","url":"/datasets/language/bulgarian"},{"name":"Croatian","url":"/datasets/language/croatian"},{"name":"Czech","url":"/datasets/language/czech"},{"name":"Danish","url":"/datasets/language/danish"},{"name":"Dutch","url":"/datasets/language/dutch"},{"name":"Estonian","url":"/datasets/language/estonian"},{"name":"Finnish","url":"/datasets/language/finnish"},{"name":"Hungarian","url":"/datasets/language/hungarian"},{"name":"Irish","url":"/datasets/language/irish"},{"name":"Latvian","url":"/datasets/language/latvian"},{"name":"Lithuanian","url":"/datasets/language/lithuanian"},{"name":"Maltese","url":"/datasets/language/maltese"},{"name":"Polish","url":"/datasets/language/polish"},{"name":"Romanian","url":"/datasets/language/romanian"},{"name":"Slovak","url":"/datasets/language/slovak"},{"name":"Slovenian","url":"/datasets/language/slovenian"},{"name":"Swedish","url":"/datasets/language/swedish"},{"name":"Greek","url":"/datasets/language/greek"}],"variants":["EUROPA"],"data_loaders":[],"num_papers_in_archive":1,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}