{"url":"/dataset/wikireading","name":"WikiReading","full_name":null,"description_markdown":"WikiReading is a large-scale natural language understanding task and publicly-available dataset with 18 million instances. The task is to predict textual values from the structured knowledge base Wikidata by reading the text of the corresponding Wikipedia articles. The task contains a rich variety of challenging classification and extraction sub-tasks, making it well-suited for end-to-end models such as deep neural networks (DNNs).\r\n\r\nSource: [WIKIREADING: A Novel Large-scale Language Understanding Task over Wikipedia](https://www.aclweb.org/anthology/P16-1145.pdf)\r\nImage Source: [Hewlett et al](https://arxiv.org/pdf/1608.03542v2.pdf)","description_withheld":null,"homepage":"https://github.com/google-research-datasets/wiki-reading","introduced_date":"2016-08-11","introduced_date_note":null,"introduced_by":{"paper":"/paper/wikireading-a-novel-large-scale-language","title":"WikiReading: A Novel Large-scale Language Understanding Task over Wikipedia","first_author":"Daniel Hewlett","url":null},"license":{"name":"CC BY-SA 3.0","url":"https://creativecommons.org/licenses/by-sa/3.0/"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Question Answering","url":"/task/question-answering","datasets_with_task":"/datasets/task/question-answering"},{"name":"Information Retrieval","url":"/task/information-retrieval","datasets_with_task":"/datasets/task/information-retrieval"},{"name":"Reading Comprehension","url":"/task/reading-comprehension","datasets_with_task":"/datasets/task/reading-comprehension"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"Spanish","url":"/datasets/language/spanish"}],"variants":["WikiReading"],"data_loaders":[{"repo":"https://github.com/google-research-datasets/wiki-reading","url":"https://github.com/google-research-datasets/wiki-reading","frameworks":["tf"]}],"num_papers_in_archive":26,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}