{"url":"/dataset/nusacrowd","name":"NusaCrowd","full_name":null,"description_markdown":"**NusaCrowd** is a collaborative initiative to collect and unite existing resources for Indonesian languages, including opening access to previously non-public resources. Through this initiative, the authors have has brought together 137 datasets and 117 standardized data loaders. The quality of the datasets has been assessed manually and automatically, and their effectiveness has been demonstrated in multiple experiments. \r\n\r\nSource: [https://arxiv.org/pdf/2212.09648v2.pdf](https://arxiv.org/pdf/2212.09648v2.pdf)\r\n\r\nImage Source: [NusaCrowd: Open Source Initiative for Indonesian NLP Resources](https://arxiv.org/pdf/2212.09648v2.pdf)","description_withheld":null,"homepage":"https://github.com/IndoNLP/nusa-crowd/","introduced_date":"2022-12-19","introduced_date_note":null,"introduced_by":{"paper":"/paper/nusacrowd-open-source-initiative-for","title":"NusaCrowd: Open Source Initiative for Indonesian NLP Resources","first_author":"Samuel Cahyawijaya","url":null},"license":{"name":"Apache-2.0 license","url":"https://github.com/IndoNLP/nusa-crowd/blob/master/LICENSE"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"},{"name":"Speech","url":"/datasets/modality/speech"}],"tasks":[{"name":"Speech Recognition","url":"/task/speech-recognition","datasets_with_task":"/datasets/task/speech-recognition"},{"name":"Automatic Speech Recognition (ASR)","url":"/task/automatic-speech-recognition","datasets_with_task":"/datasets/task/automatic-speech-recognition"},{"name":"Natural Language Understanding","url":"/task/natural-language-understanding","datasets_with_task":"/datasets/task/natural-language-understanding"}],"languages":[{"name":"Indonesian","url":"/datasets/language/indonesian"}],"variants":["NusaCrowd"],"data_loaders":[],"num_papers_in_archive":3,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}