{"url":"/dataset/openslr","name":"OpenSLR","full_name":"Open Speech and Language Resources","description_markdown":"OpenSLR is a repository of open speech and language resources, including large-scale transcribed audio corpora and related software. It serves as a central platform for researchers and practitioners to access and share datasets used in speech recognition (ASR), text-to-speech (TTS), and linguistic research.\r\n\r\nThe OpenSLR collection includes over 30 diverse datasets spanning more than 25 languages, such as Javanese, Nepali, Malayalam, Yoruba, and various English and Spanish dialects. These datasets are contributed by institutions including Google, North West University, and others. Most contain audio recordings along with transcriptions, covering both crowd-sourced and professionally recorded material.\r\n\r\nMany of the datasets are high-quality multi-speaker corpora intended for use in building ASR and TTS models, particularly for under-resourced languages. Use cases include multilingual speech recognition, dialect modeling, language technology research, and building open-source voice applications.\r\n\r\nThe OpenSLR site also acts as a mirror for widely-used tools and models to ensure continued availability. \r\n\r\nWebsite: [OpenSLR website](https://www.openslr.org)\r\n\r\nSource: [openslr/openslr](https://huggingface.co/datasets/openslr/openslr)","description_withheld":null,"homepage":"https://www.openslr.org","introduced_date":"2020-05-22","introduced_date_note":null,"introduced_by":{"paper":"/paper/open-source-high-quality-speech-datasets-for","title":"Open-Source High Quality Speech Datasets for Basque, Catalan and Galician","first_author":"Oddur Kjartansson","url":null},"license":{"name":"Creative Commons Attribution-ShareAlike 4.0 International (CC BY-SA 4.0)","url":"https://huggingface.co/datasets/openslr/openslr"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"},{"name":"Audio","url":"/datasets/modality/audio"}],"tasks":[{"name":"Speech Recognition","url":"/task/speech-recognition","datasets_with_task":"/datasets/task/speech-recognition"},{"name":"Automatic Speech Recognition","url":"/task/automatic-speech-recognition-2","datasets_with_task":"/datasets/task/automatic-speech-recognition-2"},{"name":"Automatic Speech Recognition (ASR)","url":"/task/automatic-speech-recognition","datasets_with_task":"/datasets/task/automatic-speech-recognition"},{"name":"Text-To-Speech Synthesis","url":"/task/text-to-speech-synthesis","datasets_with_task":"/datasets/task/text-to-speech-synthesis"},{"name":"Text to Speech","url":"/task/text-to-speech","datasets_with_task":"/datasets/task/text-to-speech"},{"name":"speech-recognition","url":"/task/speech-recognition-1","datasets_with_task":"/datasets/task/speech-recognition-1"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"Bengali","url":"/datasets/language/bengali"},{"name":"Afrikaans","url":"/datasets/language/afrikaans"},{"name":"Basque","url":"/datasets/language/basque"},{"name":"Catalan","url":"/datasets/language/catalan"},{"name":"Galician","url":"/datasets/language/galician"},{"name":"Marathi","url":"/datasets/language/marathi"},{"name":"Tamil","url":"/datasets/language/tamil"},{"name":"Telugu","url":"/datasets/language/telugu"},{"name":"Yoruba","url":"/datasets/language/yoruba"},{"name":"Gujarati","url":"/datasets/language/gujarati"},{"name":"Javanese","url":"/datasets/language/javanese"},{"name":"Kannada","url":"/datasets/language/kannada"},{"name":"Central Khmer","url":"/datasets/language/central-khmer"},{"name":"Malayalam","url":"/datasets/language/malayalam"},{"name":"Burmese","url":"/datasets/language/burmese"},{"name":"Nepali (individual language)","url":"/datasets/language/nepali-individual-language"},{"name":"Sinhala","url":"/datasets/language/sinhala"},{"name":"Sundanese","url":"/datasets/language/sundanese"},{"name":"Venda","url":"/datasets/language/venda"},{"name":"Xhosa","url":"/datasets/language/xhosa"}],"variants":["OpenSLR"],"data_loaders":[],"num_papers_in_archive":2,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/speech-recognition-on-openslr","task":"Speech Recognition","dataset_variant":"OpenSLR","rows":0,"metrics":["Test WER"],"first_row_in_archive_order":null,"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}