{"url":"/dataset/multilingual-dataset-for-training-and","name":"Multilingual Dataset for Training and Evaluating Diacritics Restoration Systems","full_name":null,"description_markdown":"The dataset contains training and evaluation data for 12 languages:\r\n- Vietnamese\r\n- Romanian\r\n- Latvian\r\n- Czech\r\n- Polish\r\n- Slovak\r\n- Irish\r\n- Hungarian\r\n- French\r\n- Turkish\r\n- Spanish\r\n- Croatian\r\n\r\nFor each language, one training, one development and one testing set acquired from Wikipedia articles is provided. Moreover, each language dataset contains (substantially larger) training set collected from (general) Web texts. All sets, except for Wikipedia and Web training sets that can contain similar sentences, are disjoint. Data are segmented into sentences which are further word tokenized.","description_withheld":null,"homepage":"https://lindat.mff.cuni.cz/repository/xmlui/handle/11234/1-2607","introduced_date":"2018-05-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/diacritics-restoration-using-neural-networks","title":"Diacritics Restoration Using Neural Networks","first_author":"Jakub N{\\'a}plava","url":null},"license":{"name":"CC BY-NC-SA 4.0","url":"https://creativecommons.org/licenses/by-nc-sa/4.0/"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Czech Text Diacritization","url":"/task/czech-text-diacritization","datasets_with_task":"/datasets/task/czech-text-diacritization"},{"name":"Vietnamese Text Diacritization","url":"/task/vietnamese-text-diacritization","datasets_with_task":"/datasets/task/vietnamese-text-diacritization"},{"name":"Romanian Text Diacritization","url":"/task/romanian-text-diacritization","datasets_with_task":"/datasets/task/romanian-text-diacritization"},{"name":"Slovak Text Diacritization","url":"/task/slovak-text-diacritization","datasets_with_task":"/datasets/task/slovak-text-diacritization"},{"name":"Latvian Text Diacritization","url":"/task/latvian-text-diacritization","datasets_with_task":"/datasets/task/latvian-text-diacritization"},{"name":"Polish Text Diacritization","url":"/task/polish-text-diacritization","datasets_with_task":"/datasets/task/polish-text-diacritization"},{"name":"Irish Text Diacritization","url":"/task/irish-text-diacritization","datasets_with_task":"/datasets/task/irish-text-diacritization"},{"name":"Hungarian Text Diacritization","url":"/task/hungarian-text-diacritization","datasets_with_task":"/datasets/task/hungarian-text-diacritization"},{"name":"French Text Diacritization","url":"/task/french-text-diacritization","datasets_with_task":"/datasets/task/french-text-diacritization"},{"name":"Turkish Text Diacritization","url":"/task/turkish-text-diacritization","datasets_with_task":"/datasets/task/turkish-text-diacritization"},{"name":"Spanish Text Diacritization","url":"/task/spanish-text-diacritization","datasets_with_task":"/datasets/task/spanish-text-diacritization"},{"name":"Croatian Text Diacritization","url":"/task/croatian-text-diacritization","datasets_with_task":"/datasets/task/croatian-text-diacritization"}],"languages":[{"name":"French","url":"/datasets/language/french"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"Croatian","url":"/datasets/language/croatian"},{"name":"Czech","url":"/datasets/language/czech"},{"name":"Hungarian","url":"/datasets/language/hungarian"},{"name":"Irish","url":"/datasets/language/irish"},{"name":"Latvian","url":"/datasets/language/latvian"},{"name":"Polish","url":"/datasets/language/polish"},{"name":"Romanian","url":"/datasets/language/romanian"},{"name":"Slovak","url":"/datasets/language/slovak"},{"name":"Turkish","url":"/datasets/language/turkish"},{"name":"Vietnamese","url":"/datasets/language/vietnamese"}],"variants":["Multilingual Dataset for Training and Evaluating Diacritics Restoration Systems"],"data_loaders":[],"num_papers_in_archive":2,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/czech-text-diacritization-on-multilingual","task":"Czech Text Diacritization","dataset_variant":"Multilingual Dataset for Training and Evaluating Diacritics Restoration Systems","rows":3,"metrics":["Alpha-Word accuracy"],"first_row_in_archive_order":{"model":"BERT","paper":"/paper/diacritics-restoration-using-bert-with","metrics":{"Alpha-Word accuracy":"99.22"},"code_links":[{"title":"ufal/bert-diacritics-restoration","url":"https://github.com/ufal/bert-diacritics-restoration"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/vietnamese-text-diacritization-on","task":"Vietnamese Text Diacritization","dataset_variant":"Multilingual Dataset for Training and Evaluating Diacritics Restoration Systems","rows":3,"metrics":["Alpha-Word accuracy"],"first_row_in_archive_order":{"model":"BERT","paper":"/paper/diacritics-restoration-using-bert-with","metrics":{"Alpha-Word accuracy":"98.53"},"code_links":[{"title":"ufal/bert-diacritics-restoration","url":"https://github.com/ufal/bert-diacritics-restoration"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/croatian-text-diacritization-on-multilingual","task":"Croatian Text Diacritization","dataset_variant":"Multilingual Dataset for Training and Evaluating Diacritics Restoration Systems","rows":1,"metrics":["Alpha-Word accuracy"],"first_row_in_archive_order":{"model":"BERT","paper":"/paper/diacritics-restoration-using-bert-with","metrics":{"Alpha-Word accuracy":"99.73"},"code_links":[{"title":"ufal/bert-diacritics-restoration","url":"https://github.com/ufal/bert-diacritics-restoration"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/french-text-diacritization-on-multilingual","task":"French Text Diacritization","dataset_variant":"Multilingual Dataset for Training and Evaluating Diacritics Restoration Systems","rows":1,"metrics":["Alpha-Word accuracy"],"first_row_in_archive_order":{"model":"BERT","paper":"/paper/diacritics-restoration-using-bert-with","metrics":{"Alpha-Word accuracy":"99.71"},"code_links":[{"title":"ufal/bert-diacritics-restoration","url":"https://github.com/ufal/bert-diacritics-restoration"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/hungarian-text-diacritization-on-multilingual","task":"Hungarian Text Diacritization","dataset_variant":"Multilingual Dataset for Training and Evaluating Diacritics Restoration Systems","rows":1,"metrics":["Alpha-Word accuracy"],"first_row_in_archive_order":{"model":"BERT","paper":"/paper/diacritics-restoration-using-bert-with","metrics":{"Alpha-Word accuracy":"99.41"},"code_links":[{"title":"ufal/bert-diacritics-restoration","url":"https://github.com/ufal/bert-diacritics-restoration"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/irish-text-diacritization-on-multilingual","task":"Irish Text Diacritization","dataset_variant":"Multilingual Dataset for Training and Evaluating Diacritics Restoration Systems","rows":1,"metrics":["Alpha-Word accuracy"],"first_row_in_archive_order":{"model":"BERT","paper":"/paper/diacritics-restoration-using-bert-with","metrics":{"Alpha-Word accuracy":"98.88"},"code_links":[{"title":"ufal/bert-diacritics-restoration","url":"https://github.com/ufal/bert-diacritics-restoration"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/latvian-text-diacritization-on-multilingual","task":"Latvian Text Diacritization","dataset_variant":"Multilingual Dataset for Training and Evaluating Diacritics Restoration Systems","rows":1,"metrics":["Alpha-Word accuracy"],"first_row_in_archive_order":{"model":"BERT","paper":"/paper/diacritics-restoration-using-bert-with","metrics":{"Alpha-Word accuracy":"98.63"},"code_links":[{"title":"ufal/bert-diacritics-restoration","url":"https://github.com/ufal/bert-diacritics-restoration"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/polish-text-diacritization-on-multilingual","task":"Polish Text Diacritization","dataset_variant":"Multilingual Dataset for Training and Evaluating Diacritics Restoration Systems","rows":1,"metrics":["Alpha-Word accuracy"],"first_row_in_archive_order":{"model":"BERT","paper":"/paper/diacritics-restoration-using-bert-with","metrics":{"Alpha-Word accuracy":"99.66"},"code_links":[{"title":"ufal/bert-diacritics-restoration","url":"https://github.com/ufal/bert-diacritics-restoration"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/romanian-text-diacritization-on-multilingual","task":"Romanian Text Diacritization","dataset_variant":"Multilingual Dataset for Training and Evaluating Diacritics Restoration Systems","rows":1,"metrics":["Alpha-Word accuracy"],"first_row_in_archive_order":{"model":"BERT","paper":"/paper/diacritics-restoration-using-bert-with","metrics":{"Alpha-Word accuracy":"98.64"},"code_links":[{"title":"ufal/bert-diacritics-restoration","url":"https://github.com/ufal/bert-diacritics-restoration"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/slovak-text-diacritization-on-multilingual","task":"Slovak Text Diacritization","dataset_variant":"Multilingual Dataset for Training and Evaluating Diacritics Restoration Systems","rows":1,"metrics":["Alpha-Word accuracy"],"first_row_in_archive_order":{"model":"BERT","paper":"/paper/diacritics-restoration-using-bert-with","metrics":{"Alpha-Word accuracy":"99.32"},"code_links":[{"title":"ufal/bert-diacritics-restoration","url":"https://github.com/ufal/bert-diacritics-restoration"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/spanish-text-diacritization-on-multilingual","task":"Spanish Text Diacritization","dataset_variant":"Multilingual Dataset for Training and Evaluating Diacritics Restoration Systems","rows":1,"metrics":["Alpha-Word accuracy"],"first_row_in_archive_order":{"model":"BERT","paper":"/paper/diacritics-restoration-using-bert-with","metrics":{"Alpha-Word accuracy":"99.62"},"code_links":[{"title":"ufal/bert-diacritics-restoration","url":"https://github.com/ufal/bert-diacritics-restoration"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/turkish-text-diacritization-on-multilingual","task":"Turkish Text Diacritization","dataset_variant":"Multilingual Dataset for Training and Evaluating Diacritics Restoration Systems","rows":1,"metrics":["Alpha-Word accuracy"],"first_row_in_archive_order":{"model":"BERT","paper":"/paper/diacritics-restoration-using-bert-with","metrics":{"Alpha-Word accuracy":"98.95"},"code_links":[{"title":"ufal/bert-diacritics-restoration","url":"https://github.com/ufal/bert-diacritics-restoration"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/diacritics-restoration-using-bert-with","title":"Diacritics Restoration using BERT with Analysis on Czech language","date":"2021-05-24","rows_on_this_dataset":12,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/diacritics-restoration-using-neural-networks","title":"Diacritics Restoration Using Neural Networks","date":"2018-05-01","rows_on_this_dataset":4,"code_links":1,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":1,"samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":1,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}