{"url":"/dataset/tilde-model-corpus","name":"Tilde MODEL Corpus","full_name":"Tilde Multilingual Open Data for European Languages","description_markdown":"Tilde MODEL Corpus is a multilingual corpora for European languages – particularly focused on the smaller languages. The collected resources have been cleaned, aligned, and formatted into a corpora standard TMX format useable for developing new Language technology products and services.\r\n\r\nIt contains over 10M segments of multilingual open data.\r\n\r\nThe data has been collected from sites allowing free use and reuse of its content, as well as from Public Sector web sites.\r\n\r\nSource: [Tilde MODEL - Multilingual Open Data for EU Languages](/paper/tilde-model-multilingual-open-data-for-eu)","description_withheld":null,"homepage":"http://opus.nlpl.eu/TildeMODEL.php","introduced_date":null,"introduced_date_note":null,"introduced_by":{"paper":"/paper/tilde-model-multilingual-open-data-for-eu","title":"Tilde MODEL - Multilingual Open Data for EU Languages","first_author":"Roberts Rozis","url":null},"license":null,"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Speech Recognition","url":"/task/speech-recognition","datasets_with_task":"/datasets/task/speech-recognition"},{"name":"Machine Translation","url":"/task/machine-translation","datasets_with_task":"/datasets/task/machine-translation"},{"name":"Speech Synthesis","url":"/task/speech-synthesis","datasets_with_task":"/datasets/task/speech-synthesis"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"French","url":"/datasets/language/french"},{"name":"German","url":"/datasets/language/german"},{"name":"Italian","url":"/datasets/language/italian"},{"name":"Portuguese","url":"/datasets/language/portuguese"},{"name":"Hungarian","url":"/datasets/language/hungarian"},{"name":"Polish","url":"/datasets/language/polish"},{"name":"Romanian","url":"/datasets/language/romanian"}],"variants":["Tilde MODEL Corpus"],"data_loaders":[{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/Helsinki-NLP/tilde_model","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/tilde_model","frameworks":["tf","pytorch","jax"]}],"num_papers_in_archive":2,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}