{"url":"/dataset/weathub","name":"WEATHub","full_name":null,"description_markdown":"WEATHub is a dataset containing 24 languages. It contains words organized into groups of (target1, target2, attribute1, attribute2) to measure the association target1:target2 :: attribute1:attribute2. For example target1 can be insects, target2 can be flowers. And we might be trying to measure whether we find insects or flowers pleasant or unpleasant. The measurement of word associations is quantified using the WEAT metric in our paper. It is a metric that calculates an effect size (Cohen's d) and also provides a p-value (to measure statistical significance of the results). In our paper, we use word embeddings from language models to perform these tests and understand biased associations in language models across different languages.","description_withheld":null,"homepage":"https://huggingface.co/datasets/iamshnoo/WEATHub","introduced_date":"2023-10-26","introduced_date_note":null,"introduced_by":{"paper":"/paper/global-voices-local-biases-socio-cultural","title":"Global Voices, Local Biases: Socio-Cultural Prejudices across Languages","first_author":"Anjishnu Mukherjee","url":null},"license":{"name":"cc-by-4.0","url":null},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Bias Detection","url":"/task/bias-detection","datasets_with_task":"/datasets/task/bias-detection"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"French","url":"/datasets/language/french"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"German","url":"/datasets/language/german"},{"name":"Italian","url":"/datasets/language/italian"},{"name":"Chinese","url":"/datasets/language/chinese"},{"name":"Bengali","url":"/datasets/language/bengali"},{"name":"Japanese","url":"/datasets/language/japanese"},{"name":"Russian","url":"/datasets/language/russian"},{"name":"Danish","url":"/datasets/language/danish"},{"name":"Hindi","url":"/datasets/language/hindi"},{"name":"Korean","url":"/datasets/language/korean"},{"name":"Marathi","url":"/datasets/language/marathi"},{"name":"Persian","url":"/datasets/language/persian"},{"name":"Tagalog","url":"/datasets/language/tagalog"},{"name":"Telugu","url":"/datasets/language/telugu"},{"name":"Thai","url":"/datasets/language/thai"},{"name":"Turkish","url":"/datasets/language/turkish"},{"name":"Urdu","url":"/datasets/language/urdu"},{"name":"Vietnamese","url":"/datasets/language/vietnamese"},{"name":"Greek","url":"/datasets/language/greek"},{"name":"Central Kurdish","url":"/datasets/language/central-kurdish"},{"name":"Kurdish","url":"/datasets/language/kurdish"},{"name":"Western Panjabi","url":"/datasets/language/western-panjabi"}],"variants":["WEATHub"],"data_loaders":[{"repo":"https://github.com/iamshnoo/weathub","url":"https://huggingface.co/datasets/iamshnoo/WEATHub","frameworks":["pytorch"]}],"num_papers_in_archive":1,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}