{"url":"/dataset/halvest","name":"HALvest","full_name":null,"description_markdown":"HALvest is a textual dataset comprising 17 billion tokens in 56 languages and 13 domains.\r\n\r\nAlthough HALvest is mostly in English and French, the gathered 670,861 papers are written in 56 languages across 16 domains for the unfiltered version, accounting for approximately 17 billion tokens. HALvest’s text can also serve as a valuable asset for low-resource languages, hosting documents in Basque, Catalan, or Persian to mention a few.","description_withheld":null,"homepage":"https://huggingface.co/datasets/almanach/HALvest","introduced_date":"2024-07-30","introduced_date_note":null,"introduced_by":{"paper":"/paper/harvesting-textual-and-structured-data-from","title":"Harvesting Textual and Structured Data from the HAL Publication Repository","first_author":"Francis Kulumba","url":null},"license":null,"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Text Generation","url":"/task/text-generation","datasets_with_task":"/datasets/task/text-generation"},{"name":"Language Modelling","url":"/task/language-modelling","datasets_with_task":"/datasets/task/language-modelling"},{"name":"Fill Mask","url":"/task/fill-mask","datasets_with_task":"/datasets/task/fill-mask"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"French","url":"/datasets/language/french"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"German","url":"/datasets/language/german"},{"name":"Italian","url":"/datasets/language/italian"},{"name":"Chinese","url":"/datasets/language/chinese"},{"name":"Japanese","url":"/datasets/language/japanese"},{"name":"Russian","url":"/datasets/language/russian"},{"name":"Portuguese","url":"/datasets/language/portuguese"},{"name":"Albanian","url":"/datasets/language/albanian"},{"name":"Arabic","url":"/datasets/language/arabic"},{"name":"Armenian","url":"/datasets/language/armenian"},{"name":"Basque","url":"/datasets/language/basque"},{"name":"Breton","url":"/datasets/language/breton"},{"name":"Bulgarian","url":"/datasets/language/bulgarian"},{"name":"Catalan","url":"/datasets/language/catalan"},{"name":"Croatian","url":"/datasets/language/croatian"},{"name":"Czech","url":"/datasets/language/czech"},{"name":"Danish","url":"/datasets/language/danish"},{"name":"Estonian","url":"/datasets/language/estonian"},{"name":"Finnish","url":"/datasets/language/finnish"},{"name":"Galician","url":"/datasets/language/galician"},{"name":"Hebrew","url":"/datasets/language/hebrew"},{"name":"Hindi","url":"/datasets/language/hindi"},{"name":"Hungarian","url":"/datasets/language/hungarian"},{"name":"Indonesian","url":"/datasets/language/indonesian"},{"name":"Kazakh","url":"/datasets/language/kazakh"},{"name":"Korean","url":"/datasets/language/korean"},{"name":"Lithuanian","url":"/datasets/language/lithuanian"},{"name":"Marathi","url":"/datasets/language/marathi"},{"name":"Norwegian","url":"/datasets/language/norwegian"},{"name":"Persian","url":"/datasets/language/persian"},{"name":"Polish","url":"/datasets/language/polish"},{"name":"Romanian","url":"/datasets/language/romanian"},{"name":"Serbian","url":"/datasets/language/serbian"},{"name":"Slovak","url":"/datasets/language/slovak"},{"name":"Slovenian","url":"/datasets/language/slovenian"},{"name":"Swedish","url":"/datasets/language/swedish"},{"name":"Tagalog","url":"/datasets/language/tagalog"},{"name":"Tamil","url":"/datasets/language/tamil"},{"name":"Thai","url":"/datasets/language/thai"},{"name":"Turkish","url":"/datasets/language/turkish"},{"name":"Ukrainian","url":"/datasets/language/ukrainian"},{"name":"Vietnamese","url":"/datasets/language/vietnamese"},{"name":"Greek","url":"/datasets/language/greek"},{"name":"Swahili","url":"/datasets/language/swahili"},{"name":"Azerbaijani","url":"/datasets/language/azerbaijani"},{"name":"Tibetan","url":"/datasets/language/tibetan"},{"name":"Bosnian","url":"/datasets/language/bosnian"},{"name":"Corsican","url":"/datasets/language/corsican"},{"name":"Esperanto","url":"/datasets/language/esperanto"},{"name":"Guarani","url":"/datasets/language/guarani"},{"name":"Interlingue","url":"/datasets/language/interlingue"},{"name":"Macedonian","url":"/datasets/language/macedonian"},{"name":"Occitan (post 1500)","url":"/datasets/language/occitan-post-1500"},{"name":"Tetum","url":"/datasets/language/tetum"},{"name":"Turkmen","url":"/datasets/language/turkmen"}],"variants":["HALvest"],"data_loaders":[],"num_papers_in_archive":1,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}