{"url":"/dataset/wmt-2020","name":"WMT 2020","full_name":null,"description_markdown":"**WMT 2020** is a collection of datasets used in shared tasks of the Fifth Conference on Machine Translation. The conference builds on a series of annual workshops and conferences on  Statistical Machine Translation.\r\n\r\nThe conference featured ten shared tasks:\r\n\r\n* a news translation task,\r\n* a biomedical translation task,\r\n* a similar language translation task,\r\n* an unsupervised and very low resource translation task,\r\n* an automatic post-editing task,\r\n* a metrics task (assess MT quality given reference translation),\r\n* a quality estimation task (assess MT quality without access to any reference),\r\n* a parallel corpus filtering and alignment task,\r\n* a lifelong learning in MT task,\r\n* a chat translation task.\r\n\r\nSource: [https://www.statmt.org/wmt20/](https://www.statmt.org/wmt20/)","description_withheld":null,"homepage":"https://www.statmt.org/wmt20/","introduced_date":"2020-11-19","introduced_date_note":null,"introduced_by":{"paper":"/paper/findings-of-the-2020-conference-on-machine","title":"Findings of the 2020 Conference on Machine Translation (WMT20)","first_author":"Loïc Barrault","url":null},"license":null,"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Machine Translation","url":"/task/machine-translation","datasets_with_task":"/datasets/task/machine-translation"},{"name":"Document Translation","url":"/task/document-translation","datasets_with_task":"/datasets/task/document-translation"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"French","url":"/datasets/language/french"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"German","url":"/datasets/language/german"},{"name":"Italian","url":"/datasets/language/italian"},{"name":"Chinese","url":"/datasets/language/chinese"},{"name":"Japanese","url":"/datasets/language/japanese"},{"name":"Russian","url":"/datasets/language/russian"},{"name":"Portuguese","url":"/datasets/language/portuguese"},{"name":"Basque","url":"/datasets/language/basque"},{"name":"Czech","url":"/datasets/language/czech"},{"name":"Polish","url":"/datasets/language/polish"},{"name":"Tamil","url":"/datasets/language/tamil"},{"name":"Upper Sorbian","url":"/datasets/language/upper-sorbian"},{"name":"Inuktitut","url":"/datasets/language/inuktitut"}],"variants":["WMT 2020"],"data_loaders":[{"repo":"https://github.com/egsandbacon/WMT20-Data","url":"https://github.com/egsandbacon/WMT20-Data","frameworks":[]}],"num_papers_in_archive":33,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}