{"url":"/dataset/xmind","name":"xMIND","full_name":"A Multilingual Dataset for Cross-lingual News Recommendation","description_markdown":"xMIND is an open, large-scale multilingual news dataset for multi- and cross-lingual news recommendation. xMIND is derived from the English [MIND](https://msnews.github.io/) dataset using open-source neural machine translation (i.e., [NLLB](https://arxiv.org/pdf/2207.04672.pdf) 3.3B). \r\n\r\nxMIND contains 130K news translated into 14 linguistically and geographically diverse languages, with digital footprints of varying sizes. The goal of xMIND is to serve as a benchmark dataset for news recommendation, and to foster broader research into multilingual and cross-lingual news recommendation, for speakers of both high and low-resource languages.","description_withheld":null,"homepage":"https://github.com/andreeaiana/xMIND","introduced_date":"2024-03-26","introduced_date_note":null,"introduced_by":{"paper":"/paper/mind-your-language-a-multilingual-dataset-for","title":"MIND Your Language: A Multilingual Dataset for Cross-lingual News Recommendation","first_author":"Andreea Iana","url":null},"license":{"name":"CC BY-NC-SA 4.0","url":"https://creativecommons.org/licenses/by-nc-sa/4.0/"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Recommendation Systems","url":"/task/recommendation-systems","datasets_with_task":"/datasets/task/recommendation-systems"},{"name":"News Recommendation","url":"/task/news-recommendation","datasets_with_task":"/datasets/task/news-recommendation"}],"languages":[{"name":"Japanese","url":"/datasets/language/japanese"},{"name":"Finnish","url":"/datasets/language/finnish"},{"name":"Indonesian","url":"/datasets/language/indonesian"},{"name":"Romanian","url":"/datasets/language/romanian"},{"name":"Tamil","url":"/datasets/language/tamil"},{"name":"Thai","url":"/datasets/language/thai"},{"name":"Turkish","url":"/datasets/language/turkish"},{"name":"Vietnamese","url":"/datasets/language/vietnamese"},{"name":"Swahili","url":"/datasets/language/swahili"},{"name":"Mandarin Chinese","url":"/datasets/language/mandarin-chinese"},{"name":"Guarani","url":"/datasets/language/guarani"},{"name":"Haitian","url":"/datasets/language/haitian"},{"name":"Georgian","url":"/datasets/language/georgian"},{"name":"Somali","url":"/datasets/language/somali"}],"variants":["xMIND"],"data_loaders":[],"num_papers_in_archive":3,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}