{"url":"/dataset/gatitos","name":"GATITOS","full_name":"Google's Additional Translations Into Tail-languages: Often Short","description_markdown":"The GATITOS (Google's Additional Translations Into Tail-languages: Often Short) dataset is a high-quality, multi-way parallel dataset of tokens and short phrases, intended for training and improving machine translation models. This dataset consists in 4,000 English segments (4,500 tokens) that have been translated into each of 26 low-resource languages, as well as three higher-resource pivot languages (es, fr, hi). All translations were made directly from English, with the exception of Aymara, which was translated from the Spanish.","description_withheld":null,"homepage":"https://github.com/google-research/url-nlp/tree/main/gatitos","introduced_date":"2023-03-27","introduced_date_note":null,"introduced_by":{"paper":"/paper/bilex-rx-lexical-data-augmentation-for","title":"Bilex Rx: Lexical Data Augmentation for Massively Multilingual Machine Translation","first_author":"Alex Jones","url":null},"license":{"name":"CC-BY-4.0","url":"https://github.com/google-research/url-nlp/blob/main/LICENSE"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Machine Translation","url":"/task/machine-translation","datasets_with_task":"/datasets/task/machine-translation"},{"name":"Zero-Shot Machine Translation","url":"/task/zero-shot-machine-translation","datasets_with_task":"/datasets/task/zero-shot-machine-translation"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"French","url":"/datasets/language/french"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"Bambara","url":"/datasets/language/bambara"},{"name":"Bhojpuri","url":"/datasets/language/bhojpuri"},{"name":"Hindi","url":"/datasets/language/hindi"},{"name":"Sanskrit","url":"/datasets/language/sanskrit"},{"name":"Assamese","url":"/datasets/language/assamese"},{"name":"Aymara","url":"/datasets/language/aymara"},{"name":"Dhivehi","url":"/datasets/language/dhivehi"},{"name":"Dogri (macrolanguage)","url":"/datasets/language/dogri-macrolanguage"},{"name":"Ewe","url":"/datasets/language/ewe"},{"name":"Fulah","url":"/datasets/language/fulah"},{"name":"Goan Konkani","url":"/datasets/language/goan-konkani"},{"name":"Guarani","url":"/datasets/language/guarani"},{"name":"Iloko","url":"/datasets/language/iloko"},{"name":"Kalaallisut","url":"/datasets/language/kalaallisut"},{"name":"Krio","url":"/datasets/language/krio"},{"name":"Kurdish","url":"/datasets/language/kurdish"},{"name":"Ganda","url":"/datasets/language/ganda"},{"name":"Lushai","url":"/datasets/language/lushai"},{"name":"Maithili","url":"/datasets/language/maithili"},{"name":"Oromo","url":"/datasets/language/oromo"},{"name":"Quechua","url":"/datasets/language/quechua"},{"name":"Tigrinya","url":"/datasets/language/tigrinya"},{"name":"Tsonga","url":"/datasets/language/tsonga"},{"name":"Twi","url":"/datasets/language/twi"}],"variants":["GATITOS"],"data_loaders":[],"num_papers_in_archive":2,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}