{"url":"/dataset/wmt-2018-news","name":"WMT 2018 News","full_name":"WMT 2018 News Translation Task","description_markdown":"News translation is a recurring WMT task. The test set is a collection of parallel corpora consisting of about 1500 English sentences translated into 5 languages (Chinese, Czech, Estonian, German, Finnish, Russian, Turkish) and additional 1500 sentences from each of the 7 languages translated to English. The sentences were selected from dozens of news websites and translated by professional translators.\r\n\r\nThe training data consists of parallel corpora to train translation models, monolingual corpora to train language models and development sets for tuning.\r\nSome training corpora were identical from WMT 2017 (Europarl, Common Crawl, SETIMES2, Russian-English parallel data provided by Yandex, Wikipedia Headlines provided by CMU) and some were update (United Nations, CzEng v1.7, News Commentary v13, monolingual news data).\r\nAdditionally, the EU Press Release parallel corpus for German, Finnish and Estonian was added.\r\n\r\nSource: [https://www.statmt.org/wmt18/translation-task.html](https://www.statmt.org/wmt18/translation-task.html)","description_withheld":null,"homepage":"http://www.statmt.org/wmt18/translation-task.html","introduced_date":"2018-01-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/findings-of-the-2018-conference-on-machine","title":"Findings of the 2018 Conference on Machine Translation (WMT18)","first_author":"Ond{\\v{r}}ej Bojar","url":null},"license":{"name":"Custom (research)","url":"http://www.statmt.org/wmt18/translation-task.html"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Machine Translation","url":"/task/machine-translation","datasets_with_task":"/datasets/task/machine-translation"},{"name":"Language Modelling","url":"/task/language-modelling","datasets_with_task":"/datasets/task/language-modelling"},{"name":"Automatic Post-Editing","url":"/task/automatic-post-editing","datasets_with_task":"/datasets/task/automatic-post-editing"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"German","url":"/datasets/language/german"},{"name":"Chinese","url":"/datasets/language/chinese"},{"name":"Russian","url":"/datasets/language/russian"},{"name":"Czech","url":"/datasets/language/czech"},{"name":"Estonian","url":"/datasets/language/estonian"},{"name":"Finnish","url":"/datasets/language/finnish"},{"name":"Turkish","url":"/datasets/language/turkish"}],"variants":["WMT 2018 News"],"data_loaders":[{"repo":"https://github.com/tensorflow/datasets","url":"https://www.tensorflow.org/datasets/catalog/wmt18_translate","frameworks":["tf","jax"]}],"num_papers_in_archive":8,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}