{"url":"/dataset/polynewsparallel","name":"PolyNewsParallel","full_name":null,"description_markdown":"PolyNews is a multilingual parallel dataset containing news titles 833 language pairs, spanning in 64 languages and 17 scripts.\r\n\r\nPolyNewsParallel aims to provide an easily-accessible, unified and de-duplicated dataset that combines three disparate data sources. It can be used for machine translation or text retrieval in both high-resource and low-resource languages.","description_withheld":null,"homepage":"https://huggingface.co/datasets/aiana94/polynews-parallel","introduced_date":"2024-06-18","introduced_date_note":null,"introduced_by":{"paper":"/paper/news-without-borders-domain-adaptation-of","title":"News Without Borders: Domain Adaptation of Multilingual Sentence Embeddings for Cross-lingual News Recommendation","first_author":"Andreea Iana","url":null},"license":{"name":"CC-BY-NC-4.0","url":"https://spdx.org/licenses/CC-BY-NC-4.0"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Machine Translation","url":"/task/machine-translation","datasets_with_task":"/datasets/task/machine-translation"},{"name":"Text Retrieval","url":"/task/text-retrieval","datasets_with_task":"/datasets/task/text-retrieval"},{"name":"News Retrieval","url":"/task/news-retrieval","datasets_with_task":"/datasets/task/news-retrieval"},{"name":"NMT","url":"/task/nmt","datasets_with_task":"/datasets/task/nmt"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"French","url":"/datasets/language/french"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"German","url":"/datasets/language/german"},{"name":"Italian","url":"/datasets/language/italian"},{"name":"Chinese","url":"/datasets/language/chinese"},{"name":"Bengali","url":"/datasets/language/bengali"},{"name":"Japanese","url":"/datasets/language/japanese"},{"name":"Russian","url":"/datasets/language/russian"},{"name":"Portuguese","url":"/datasets/language/portuguese"},{"name":"Albanian","url":"/datasets/language/albanian"},{"name":"Amharic","url":"/datasets/language/amharic"},{"name":"Arabic","url":"/datasets/language/arabic"},{"name":"Bambara","url":"/datasets/language/bambara"},{"name":"Bulgarian","url":"/datasets/language/bulgarian"},{"name":"Catalan","url":"/datasets/language/catalan"},{"name":"Czech","url":"/datasets/language/czech"},{"name":"Danish","url":"/datasets/language/danish"},{"name":"Dutch","url":"/datasets/language/dutch"},{"name":"Estonian","url":"/datasets/language/estonian"},{"name":"Finnish","url":"/datasets/language/finnish"},{"name":"Hebrew","url":"/datasets/language/hebrew"},{"name":"Hindi","url":"/datasets/language/hindi"},{"name":"Hungarian","url":"/datasets/language/hungarian"},{"name":"Indonesian","url":"/datasets/language/indonesian"},{"name":"Kazakh","url":"/datasets/language/kazakh"},{"name":"Korean","url":"/datasets/language/korean"},{"name":"Latvian","url":"/datasets/language/latvian"},{"name":"Lithuanian","url":"/datasets/language/lithuanian"},{"name":"Nigerian Pidgin","url":"/datasets/language/nigerian-pidgin"},{"name":"Persian","url":"/datasets/language/persian"},{"name":"Polish","url":"/datasets/language/polish"},{"name":"Romanian","url":"/datasets/language/romanian"},{"name":"Serbian","url":"/datasets/language/serbian"},{"name":"Swedish","url":"/datasets/language/swedish"},{"name":"Thai","url":"/datasets/language/thai"},{"name":"Turkish","url":"/datasets/language/turkish"},{"name":"Urdu","url":"/datasets/language/urdu"},{"name":"Wolof","url":"/datasets/language/wolof"},{"name":"Yoruba","url":"/datasets/language/yoruba"},{"name":"Greek","url":"/datasets/language/greek"},{"name":"Swahili","url":"/datasets/language/swahili"},{"name":"Aymara","url":"/datasets/language/aymara"},{"name":"Ewe","url":"/datasets/language/ewe"},{"name":"Filipino","url":"/datasets/language/filipino"},{"name":"Fon","url":"/datasets/language/fon"},{"name":"Gujarati","url":"/datasets/language/gujarati"},{"name":"Hausa","url":"/datasets/language/hausa"},{"name":"Igbo","url":"/datasets/language/igbo"},{"name":"Central Khmer","url":"/datasets/language/central-khmer"},{"name":"Kurdish","url":"/datasets/language/kurdish"},{"name":"Ganda","url":"/datasets/language/ganda"},{"name":"Luo (Kenya and Tanzania)","url":"/datasets/language/luo-kenya-and-tanzania"},{"name":"Macedonian","url":"/datasets/language/macedonian"},{"name":"Malagasy","url":"/datasets/language/malagasy"},{"name":"Mossi","url":"/datasets/language/mossi"},{"name":"Burmese","url":"/datasets/language/burmese"},{"name":"Nepali (macrolanguage)","url":"/datasets/language/nepali-macrolanguage"},{"name":"Odia","url":"/datasets/language/odia"},{"name":"Western Panjabi","url":"/datasets/language/western-panjabi"},{"name":"Tetum","url":"/datasets/language/tetum"},{"name":"Tswana","url":"/datasets/language/tswana"},{"name":"Zulu","url":"/datasets/language/zulu"}],"variants":["PolyNewsParallel"],"data_loaders":[],"num_papers_in_archive":1,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}