{"url":"/dataset/xl-sum","name":"XL-Sum","full_name":null,"description_markdown":"**XL-Sum** is a comprehensive and diverse dataset for abstractive summarization comprising 1 million professionally annotated article-summary pairs from BBC, extracted using a set of carefully designed heuristics. The dataset covers 44 languages ranging from low to high-resource, for many of which no public dataset is currently available. XL-Sum is highly abstractive, concise, and of high quality, as indicated by human and intrinsic evaluation.","description_withheld":null,"homepage":"https://github.com/csebuetnlp/xl-sum","introduced_date":"2021-06-25","introduced_date_note":null,"introduced_by":{"paper":"/paper/xl-sum-large-scale-multilingual-abstractive","title":"XL-Sum: Large-Scale Multilingual Abstractive Summarization for 44 Languages","first_author":"Tahmid Hasan","url":null},"license":{"name":"Custom (non-commercial)","url":"https://github.com/csebuetnlp/xl-sum#license"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Text Summarization","url":"/task/text-summarization","datasets_with_task":"/datasets/task/text-summarization"},{"name":"Abstractive Text Summarization","url":"/task/abstractive-text-summarization","datasets_with_task":"/datasets/task/abstractive-text-summarization"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"French","url":"/datasets/language/french"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"Chinese","url":"/datasets/language/chinese"},{"name":"Bengali","url":"/datasets/language/bengali"},{"name":"Japanese","url":"/datasets/language/japanese"},{"name":"Russian","url":"/datasets/language/russian"},{"name":"Portuguese","url":"/datasets/language/portuguese"},{"name":"Amharic","url":"/datasets/language/amharic"},{"name":"Arabic","url":"/datasets/language/arabic"},{"name":"Hindi","url":"/datasets/language/hindi"},{"name":"Indonesian","url":"/datasets/language/indonesian"},{"name":"Korean","url":"/datasets/language/korean"},{"name":"Marathi","url":"/datasets/language/marathi"},{"name":"Persian","url":"/datasets/language/persian"},{"name":"Scottish Gaelic","url":"/datasets/language/scottish-gaelic"},{"name":"Serbian","url":"/datasets/language/serbian"},{"name":"Tamil","url":"/datasets/language/tamil"},{"name":"Telugu","url":"/datasets/language/telugu"},{"name":"Thai","url":"/datasets/language/thai"},{"name":"Turkish","url":"/datasets/language/turkish"},{"name":"Ukrainian","url":"/datasets/language/ukrainian"},{"name":"Urdu","url":"/datasets/language/urdu"},{"name":"Vietnamese","url":"/datasets/language/vietnamese"},{"name":"Welsh","url":"/datasets/language/welsh"},{"name":"Yoruba","url":"/datasets/language/yoruba"},{"name":"Swahili","url":"/datasets/language/swahili"},{"name":"Azerbaijani","url":"/datasets/language/azerbaijani"},{"name":"Gujarati","url":"/datasets/language/gujarati"},{"name":"Hausa","url":"/datasets/language/hausa"},{"name":"Igbo","url":"/datasets/language/igbo"},{"name":"Kirghiz","url":"/datasets/language/kirghiz"},{"name":"Burmese","url":"/datasets/language/burmese"},{"name":"Nepali (macrolanguage)","url":"/datasets/language/nepali-macrolanguage"},{"name":"Oromo","url":"/datasets/language/oromo"},{"name":"Punjabi","url":"/datasets/language/punjabi"},{"name":"Central Pashto","url":"/datasets/language/central-pashto"},{"name":"Sinhala","url":"/datasets/language/sinhala"},{"name":"Somali","url":"/datasets/language/somali"},{"name":"Tigrinya","url":"/datasets/language/tigrinya"},{"name":"Uzbek","url":"/datasets/language/uzbek"}],"variants":["XL-Sum","csebuetnlp/xlsum russian"],"data_loaders":[{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/1-800-SHARED-TASKS/xlsum","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/csebuetnlp/xlsum","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/GEM/xlsum","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/Hindi-Gemma/xlsum","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/1-800-SHARED-TASKS/xlsum-subset","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/RUCAIBox/LLMBox","url":"https://github.com/RUCAIBox/LLMBox","frameworks":["pytorch"]},{"repo":"https://github.com/csebuetnlp/xl-sum","url":"https://github.com/csebuetnlp/xl-sum/tree/master/seq2seq","frameworks":["pytorch"]}],"num_papers_in_archive":64,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}