{"url":"/dataset/x-fact","name":"X-Fact","full_name":null,"description_markdown":"X-FACT is a large publicly available multilingual dataset for factual verification of naturally existing real-world claims. The dataset contains short statements in 25 languages and is labeled for veracity by expert fact-checkers. The dataset includes a multilingual evaluation benchmark that measures both out-of-domain generalization, and zero-shot capabilities of the multilingual models.","description_withheld":null,"homepage":"https://github.com/utahnlp/x-fact","introduced_date":"2021-06-17","introduced_date_note":null,"introduced_by":{"paper":"/paper/x-fact-a-new-benchmark-dataset-for","title":"X-FACT: A New Benchmark Dataset for Multilingual Fact Checking","first_author":"Ashim Gupta","url":null},"license":{"name":"Unknown","url":null},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Fact Verification","url":"/task/fact-verification","datasets_with_task":"/datasets/task/fact-verification"},{"name":"Zero-shot Cross-lingual Fact-checking","url":"/task/zero-shot-cross-lingual-fact-checking","datasets_with_task":"/datasets/task/zero-shot-cross-lingual-fact-checking"}],"languages":[{"name":"French","url":"/datasets/language/french"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"German","url":"/datasets/language/german"},{"name":"Italian","url":"/datasets/language/italian"},{"name":"Bengali","url":"/datasets/language/bengali"},{"name":"Russian","url":"/datasets/language/russian"},{"name":"Portuguese","url":"/datasets/language/portuguese"},{"name":"Albanian","url":"/datasets/language/albanian"},{"name":"Arabic","url":"/datasets/language/arabic"},{"name":"Dutch","url":"/datasets/language/dutch"},{"name":"Hindi","url":"/datasets/language/hindi"},{"name":"Indonesian","url":"/datasets/language/indonesian"},{"name":"Marathi","url":"/datasets/language/marathi"},{"name":"Norwegian","url":"/datasets/language/norwegian"},{"name":"Persian","url":"/datasets/language/persian"},{"name":"Polish","url":"/datasets/language/polish"},{"name":"Romanian","url":"/datasets/language/romanian"},{"name":"Serbian","url":"/datasets/language/serbian"},{"name":"Tamil","url":"/datasets/language/tamil"},{"name":"Turkish","url":"/datasets/language/turkish"},{"name":"Azerbaijani","url":"/datasets/language/azerbaijani"},{"name":"Gujarati","url":"/datasets/language/gujarati"},{"name":"Georgian","url":"/datasets/language/georgian"},{"name":"Punjabi","url":"/datasets/language/punjabi"},{"name":"Sinhala","url":"/datasets/language/sinhala"}],"variants":["X-Fact"],"data_loaders":[],"num_papers_in_archive":16,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}