{"url":"/dataset/cc100","name":"CC100","full_name":null,"description_markdown":"This corpus comprises of monolingual data for 100+ languages and also includes data for romanized languages. This was constructed using the urls and paragraph indices provided by the CC-Net repository by processing January-December 2018 Commoncrawl snapshots. Each file comprises of documents separated by double-newlines and paragraphs within the same document separated by a newline. The data is generated using the open source CC-Net repository.\r\n\r\nSource: [Unsupervised Cross-lingual Representation Learning at Scale](/paper/unsupervised-cross-lingual-representation-1)","description_withheld":null,"homepage":"http://data.statmt.org/cc-100/","introduced_date":null,"introduced_date_note":null,"introduced_by":{"paper":"/paper/unsupervised-cross-lingual-representation-1","title":"Unsupervised Cross-lingual Representation Learning at Scale","first_author":"Alexis Conneau","url":null},"license":null,"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Language Modelling","url":"/task/language-modelling","datasets_with_task":"/datasets/task/language-modelling"},{"name":"Cross-Lingual Transfer","url":"/task/cross-lingual-transfer","datasets_with_task":"/datasets/task/cross-lingual-transfer"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"French","url":"/datasets/language/french"},{"name":"Spanish","url":"/datasets/language/spanish"},{"name":"German","url":"/datasets/language/german"},{"name":"Italian","url":"/datasets/language/italian"},{"name":"Chinese","url":"/datasets/language/chinese"},{"name":"Bengali","url":"/datasets/language/bengali"},{"name":"Japanese","url":"/datasets/language/japanese"},{"name":"Russian","url":"/datasets/language/russian"},{"name":"Portuguese","url":"/datasets/language/portuguese"},{"name":"Afrikaans","url":"/datasets/language/afrikaans"},{"name":"Albanian","url":"/datasets/language/albanian"},{"name":"Amharic","url":"/datasets/language/amharic"},{"name":"Arabic","url":"/datasets/language/arabic"},{"name":"Armenian","url":"/datasets/language/armenian"},{"name":"Basque","url":"/datasets/language/basque"},{"name":"Belarusian","url":"/datasets/language/belarusian"},{"name":"Breton","url":"/datasets/language/breton"},{"name":"Bulgarian","url":"/datasets/language/bulgarian"},{"name":"Catalan","url":"/datasets/language/catalan"},{"name":"Croatian","url":"/datasets/language/croatian"},{"name":"Czech","url":"/datasets/language/czech"},{"name":"Danish","url":"/datasets/language/danish"},{"name":"Dutch","url":"/datasets/language/dutch"},{"name":"Estonian","url":"/datasets/language/estonian"},{"name":"Finnish","url":"/datasets/language/finnish"},{"name":"Galician","url":"/datasets/language/galician"},{"name":"Hebrew","url":"/datasets/language/hebrew"},{"name":"Hindi","url":"/datasets/language/hindi"},{"name":"Hungarian","url":"/datasets/language/hungarian"},{"name":"Icelandic","url":"/datasets/language/icelandic"},{"name":"Indonesian","url":"/datasets/language/indonesian"},{"name":"Irish","url":"/datasets/language/irish"},{"name":"Kazakh","url":"/datasets/language/kazakh"},{"name":"Korean","url":"/datasets/language/korean"},{"name":"Latin","url":"/datasets/language/latin"},{"name":"Latvian","url":"/datasets/language/latvian"},{"name":"Lithuanian","url":"/datasets/language/lithuanian"},{"name":"Marathi","url":"/datasets/language/marathi"},{"name":"Norwegian","url":"/datasets/language/norwegian"},{"name":"Persian","url":"/datasets/language/persian"},{"name":"Polish","url":"/datasets/language/polish"},{"name":"Romanian","url":"/datasets/language/romanian"},{"name":"Sanskrit","url":"/datasets/language/sanskrit"},{"name":"Scottish Gaelic","url":"/datasets/language/scottish-gaelic"},{"name":"Serbian","url":"/datasets/language/serbian"},{"name":"Slovak","url":"/datasets/language/slovak"},{"name":"Slovenian","url":"/datasets/language/slovenian"},{"name":"Swedish","url":"/datasets/language/swedish"},{"name":"Tagalog","url":"/datasets/language/tagalog"},{"name":"Tamil","url":"/datasets/language/tamil"},{"name":"Telugu","url":"/datasets/language/telugu"},{"name":"Thai","url":"/datasets/language/thai"},{"name":"Turkish","url":"/datasets/language/turkish"},{"name":"Ukrainian","url":"/datasets/language/ukrainian"},{"name":"Urdu","url":"/datasets/language/urdu"},{"name":"Vietnamese","url":"/datasets/language/vietnamese"},{"name":"Welsh","url":"/datasets/language/welsh"},{"name":"Wolof","url":"/datasets/language/wolof"},{"name":"Yoruba","url":"/datasets/language/yoruba"},{"name":"Greek","url":"/datasets/language/greek"},{"name":"Swahili","url":"/datasets/language/swahili"},{"name":"Assamese","url":"/datasets/language/assamese"},{"name":"Azerbaijani","url":"/datasets/language/azerbaijani"},{"name":"Bosnian","url":"/datasets/language/bosnian"},{"name":"Esperanto","url":"/datasets/language/esperanto"},{"name":"Fulah","url":"/datasets/language/fulah"},{"name":"Guarani","url":"/datasets/language/guarani"},{"name":"Gujarati","url":"/datasets/language/gujarati"},{"name":"Haitian","url":"/datasets/language/haitian"},{"name":"Hausa","url":"/datasets/language/hausa"},{"name":"Igbo","url":"/datasets/language/igbo"},{"name":"Javanese","url":"/datasets/language/javanese"},{"name":"Kannada","url":"/datasets/language/kannada"},{"name":"Georgian","url":"/datasets/language/georgian"},{"name":"Kurdish","url":"/datasets/language/kurdish"},{"name":"Lao","url":"/datasets/language/lao"},{"name":"Lingala","url":"/datasets/language/lingala"},{"name":"Ganda","url":"/datasets/language/ganda"},{"name":"Malayalam","url":"/datasets/language/malayalam"},{"name":"Macedonian","url":"/datasets/language/macedonian"},{"name":"Malagasy","url":"/datasets/language/malagasy"},{"name":"Mongolian","url":"/datasets/language/mongolian"},{"name":"Burmese","url":"/datasets/language/burmese"},{"name":"Oromo","url":"/datasets/language/oromo"},{"name":"Punjabi","url":"/datasets/language/punjabi"},{"name":"Quechua","url":"/datasets/language/quechua"},{"name":"Romansh","url":"/datasets/language/romansh"},{"name":"Sinhala","url":"/datasets/language/sinhala"},{"name":"Sindhi","url":"/datasets/language/sindhi"},{"name":"Somali","url":"/datasets/language/somali"},{"name":"Sardinian","url":"/datasets/language/sardinian"},{"name":"Swati","url":"/datasets/language/swati"},{"name":"Sundanese","url":"/datasets/language/sundanese"},{"name":"Tswana","url":"/datasets/language/tswana"},{"name":"Uzbek","url":"/datasets/language/uzbek"},{"name":"Xhosa","url":"/datasets/language/xhosa"},{"name":"Yiddish","url":"/datasets/language/yiddish"}],"variants":["CC100"],"data_loaders":[{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/xu-song/cc100-samples","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/statmt/cc100","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/eson/cc100","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/eson/cc100-samples","frameworks":["tf","pytorch","jax"]},{"repo":"https://github.com/huggingface/datasets","url":"https://huggingface.co/datasets/cc100","frameworks":["tf","pytorch","jax"]}],"num_papers_in_archive":115,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}