{"url":"/dataset/poly-fever","name":"Poly-FEVER","full_name":null,"description_markdown":"Poly-FEVER is a multilingual fact verification benchmark designed to evaluate hallucination detection in large language models (LLMs). It extends three widely used fact-checking datasets—FEVER, Climate-FEVER, and SciFact—by translating claims into 11 languages, enabling cross-linguistic analysis of LLM performance.\r\n\r\nPoly-FEVER consists of 77,973 factual claims with binary labels (SUPPORTS or REFUTES), making it suitable for benchmarking multilingual hallucination detection. The dataset covers various domains, including Arts, Science, Politics, and History.\r\n\r\nFunded by [optional]: Google Cloud Translation\r\nLanguage(s) (NLP): English(en), Mandarin Chinese (zh-CN), Hindi (hi), Arabic (ar), Bengali (bn), Japanese (ja), Korean (ko), Tamil (ta), Thai (th), Georgian (ka), and Amharic (am)","description_withheld":null,"homepage":"https://huggingface.co/datasets/HanzhiZhang/Poly-FEVER","introduced_date":"2025-03-19","introduced_date_note":null,"introduced_by":{"paper":"/paper/poly-fever-a-multilingual-fact-verification","title":"Poly-FEVER: A Multilingual Fact Verification Benchmark for Hallucination Detection in Large Language Models","first_author":"Hanzhi Zhang","url":null},"license":null,"modalities":[],"tasks":[],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"Bengali","url":"/datasets/language/bengali"},{"name":"Japanese","url":"/datasets/language/japanese"},{"name":"Amharic","url":"/datasets/language/amharic"},{"name":"Arabic","url":"/datasets/language/arabic"},{"name":"Hindi","url":"/datasets/language/hindi"},{"name":"Korean","url":"/datasets/language/korean"},{"name":"Tamil","url":"/datasets/language/tamil"},{"name":"Mandarin Chinese","url":"/datasets/language/mandarin-chinese"},{"name":"Georgian","url":"/datasets/language/georgian"}],"variants":["Poly-FEVER"],"data_loaders":[],"num_papers_in_archive":1,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}