{"url":"/dataset/wikinews-dataset","name":"WikiNews Dataset","full_name":"WikiNews Arabic Diacritization Benchmark Dataset","description_markdown":"The WikiNews Arabic Diacritization dataset is a test set composed of 70 WikiNews articles (majority are from 2013 and 2014) that cover a variety of themes, namely: politics, economics, health, science and technology, sports, arts, and culture.\r\nThe articles are evenly distributed among the different themes (10 per theme).\r\nThe articles contain 18,300 words with around 400 different sentences (Each line is considered as a sentence).","description_withheld":null,"homepage":"https://github.com/kdarwish/Farasa","introduced_date":"2016-10-29","introduced_date_note":null,"introduced_by":{"paper":"/paper/arabic-diacritization-stats-rules-and-hacks","title":"Arabic Diacritization: Stats, Rules, and Hacks","first_author":"Kareem Darwish","url":null},"license":null,"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Arabic Text Diacritization","url":"/task/arabic-text-diacritization","datasets_with_task":"/datasets/task/arabic-text-diacritization"}],"languages":[{"name":"Arabic","url":"/datasets/language/arabic"}],"variants":["WikiNews Dataset"],"data_loaders":[],"num_papers_in_archive":6,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}