{"url":"/dataset/xglue","name":"XGLUE","full_name":null,"description_markdown":"**XGLUE** is an evaluation benchmark XGLUE,which is composed of 11 tasks that span 19 languages. For each task, the training data is only available in English. This means that to succeed at XGLUE, a model must have a strong zero-shot cross-lingual transfer capability to learn from the English data of a specific task and transfer what it learned to other languages. Comparing to its concurrent work XTREME, XGLUE has two characteristics: First, it includes cross-lingual NLU and cross-lingual NLG tasks at the same time; Second, besides including 5 existing cross-lingual tasks (i.e. NER, POS, MLQA, PAWS-X and XNLI), XGLUE selects 6 new tasks from Bing scenarios as well, including News Classification (NC), Query-Ad Matching (QADSM), Web Page Ranking (WPR), QA Matching (QAM), Question Generation (QG) and News Title Generation (NTG). Such diversities of languages, tasks and task origin provide a comprehensive benchmark for quantifying the quality of a pre-trained model on cross-lingual natural language understanding and generation.","description_withheld":null,"homepage":"https://microsoft.github.io/XGLUE/","introduced_date":"2020-04-03","introduced_date_note":null,"introduced_by":{"paper":"/paper/xglue-a-new-benchmark-dataset-for-cross","title":"XGLUE: A New Benchmark Dataset for Cross-lingual Pre-training, Understanding and Generation","first_author":"Yaobo Liang","url":null},"license":{"name":"Custom (non-commercial)","url":null},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Natural Language Inference","url":"/task/natural-language-inference","datasets_with_task":"/datasets/task/natural-language-inference"},{"name":"Cross-Lingual NER","url":"/task/cross-lingual-ner","datasets_with_task":"/datasets/task/cross-lingual-ner"},{"name":"Part-Of-Speech Tagging","url":"/task/part-of-speech-tagging","datasets_with_task":"/datasets/task/part-of-speech-tagging"},{"name":"Natural Language Understanding","url":"/task/natural-language-understanding","datasets_with_task":"/datasets/task/natural-language-understanding"},{"name":"Cross-Lingual Natural Language Inference","url":"/task/cross-lingual-natural-language-inference","datasets_with_task":"/datasets/task/cross-lingual-natural-language-inference"},{"name":"Few-shot NER","url":"/task/few-shot-ner","datasets_with_task":"/datasets/task/few-shot-ner"},{"name":"Cross-Lingual POS Tagging","url":"/task/cross-lingual-pos-tagging","datasets_with_task":"/datasets/task/cross-lingual-pos-tagging"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"French","url":"/datasets/language/french"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"German","url":"/datasets/language/german"},{"name":"Italian","url":"/datasets/language/italian"},{"name":"Chinese","url":"/datasets/language/chinese"},{"name":"Japanese","url":"/datasets/language/japanese"},{"name":"Russian","url":"/datasets/language/russian"},{"name":"Portuguese","url":"/datasets/language/portuguese"},{"name":"Arabic","url":"/datasets/language/arabic"},{"name":"Bulgarian","url":"/datasets/language/bulgarian"},{"name":"Danish","url":"/datasets/language/danish"},{"name":"Dutch","url":"/datasets/language/dutch"},{"name":"Finnish","url":"/datasets/language/finnish"},{"name":"Hebrew","url":"/datasets/language/hebrew"},{"name":"Hindi","url":"/datasets/language/hindi"},{"name":"Hungarian","url":"/datasets/language/hungarian"},{"name":"Indonesian","url":"/datasets/language/indonesian"},{"name":"Korean","url":"/datasets/language/korean"},{"name":"Polish","url":"/datasets/language/polish"},{"name":"Swedish","url":"/datasets/language/swedish"},{"name":"Thai","url":"/datasets/language/thai"},{"name":"Turkish","url":"/datasets/language/turkish"},{"name":"Urdu","url":"/datasets/language/urdu"},{"name":"Vietnamese","url":"/datasets/language/vietnamese"},{"name":"Greek","url":"/datasets/language/greek"},{"name":"Swahili","url":"/datasets/language/swahili"}],"variants":["XGLUE"],"data_loaders":[],"num_papers_in_archive":22,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/few-shot-ner-on-xglue","task":"Few-shot NER","dataset_variant":"XGLUE","rows":1,"metrics":["Avg F1"],"first_row_in_archive_order":{"model":"mGPT","paper":"/paper/mgpt-few-shot-learners-go-multilingual","metrics":{"Avg F1":"0.85"},"code_links":[{"title":"ai-forever/mgpt","url":"https://github.com/ai-forever/mgpt"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/part-of-speech-tagging-on-xglue","task":"Part-Of-Speech Tagging","dataset_variant":"XGLUE","rows":1,"metrics":["Avg. F1"],"first_row_in_archive_order":{"model":"mGPT","paper":"/paper/mgpt-few-shot-learners-go-multilingual","metrics":{"Avg. F1":"0.56"},"code_links":[{"title":"ai-forever/mgpt","url":"https://github.com/ai-forever/mgpt"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/mgpt-few-shot-learners-go-multilingual","title":"mGPT: Few-Shot Learners Go Multilingual","date":"2022-04-15","rows_on_this_dataset":2,"code_links":1,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}