{"url":"/dataset/taiga-corpus","name":"Taiga Corpus","full_name":"An open-source corpus for machine learning.","description_markdown":"Taiga is a corpus, where text sources and their meta-information are collected according to popular ML tasks.\r\n\r\nEach text in corpus is represented in plain text and with morphological and syntactic annotation (UDPipe, homonymy resolved automatically) + has metainformation - date, theme, authorship, text difficulcy…etc (depending on source)\r\n\r\nBy now, about 5 billions of words are 77% literary texts (33 literary magazines), 19% of naive poetry, 2% of news (4 popular sites) and 2% of other (popular science, culture mags, social networks, amateur poems and prose), with documentation available.\r\n\r\n**Segments Info**\r\n\r\n| Genres           | Tokens, millions | %   |\r\n|------------------|------------------|-----|\r\n| News             | 92               | 1.5 |\r\n| Literary Texts   | 4605             | 76  |\r\n| Special datasets | 2.5              | 0.5 |\r\n| Social media     | 80               | 1.5 |\r\n| Subtitles        | 101              | 1.5 |\r\n| Poems            | 1130             | 19  |\r\n\r\n**Annotation Example **\r\n(CONLL-u):\r\n```\r\n# newdoc\r\n# newpar\r\n# sent_id = 1\r\n# 2003Armeniya.xml 1\r\n# text = В советский период времени число ИТ- специалистов в Армении составляло около десяти тысяч.\r\n# sent_id = 1\r\n1\tВ\tв\tADP\t_\t_\t3\tcase\t3:case\t_\r\n2\tсоветский\tсоветский\tADJ\t_\tAnimacy=Inan|Case=Acc|Degree=Pos|Gender=Masc|Number=Sing\t3\tamod\t3:amod\t_\r\n3\tпериод\tпериод\tNOUN\t_\tAnimacy=Inan|Case=Acc|Gender=Masc|Number=Sing\t11\tobl\t11:obl\t_\r\n4\tвремени\tвремя\tNOUN\t_\tAnimacy=Inan|Case=Gen|Gender=Neut|Number=Sing\t3\tnmod\t3:nmod\t_\r\n5\tчисло\tчисло\tNOUN\t_\tAnimacy=Inan|Case=Acc|Gender=Neut|Number=Sing\t11\tobj\t11:obj\t_\r\n6\tИТ\tит\tPROPN\t_\tAnimacy=Inan|Case=Nom|Gender=Neut|Number=Sing\t8\tcompound\t8:compound\tSpaceAfter=No\r\n7\t-\t-\tPUNCT\t_\t_\t6\tpunct\t6:punct\t_\r\n8\tспециалистов\tспециалист\tNOUN\t_\tAnimacy=Anim|Case=Gen|Gender=Masc|Number=Plur\t5\tnmod\t5:nmod\t_\r\n9\tв\tв\tADP\t_\t_\t10\tcase\t10:case\t_\r\n10\tАрмении\tармения\tPROPN\t_\tAnimacy=Inan|Case=Loc|Gender=Fem|Number=Sing\t5\tnmod\t5:nmod\t_\r\n11\tсоставляло\tсоставлять\tVERB\t_\tAspect=Imp|Gender=Neut|Mood=Ind|Number=Sing|Tense=Past|VerbForm=Fin|Voice=Act\t0\troot\t0:root\t_\r\n12\tоколо\tоколо\tADP\t_\t_\t14\tcase\t14:case\t_\r\n13\tдесяти\tдесять\tNUM\t_\tCase=Gen\t14\tnummod\t14:nummod\t_\r\n14\tтысяч\tтысяча\tNOUN\t_\tAnimacy=Inan|Case=Gen|Gender=Fem|Number=Plur\t11\tnsubj\t11:nsubj\tSpaceAfter=No\r\n15\t.\t.\tPUNCT\t_\t_\t14\tpunct\t14:punct\t_\r\n\r\n```","description_withheld":null,"homepage":"https://tatianashavrina.github.io/taiga_site/","introduced_date":"2017-07-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/to-the-methodology-of-corpus-construction-for","title":"To the methodology of corpus construction for machine learning:“Taiga” syntax tree corpus and parser","first_author":"Tatiana Shavrina","url":null},"license":{"name":"Apache-2.0 License","url":"https://github.com/TatianaShavrina/taiga"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Text Classification","url":"/task/text-classification","datasets_with_task":"/datasets/task/text-classification"},{"name":"Text Generation","url":"/task/text-generation","datasets_with_task":"/datasets/task/text-generation"},{"name":"Reading Comprehension","url":"/task/reading-comprehension","datasets_with_task":"/datasets/task/reading-comprehension"},{"name":"Chatbot","url":"/task/chatbot","datasets_with_task":"/datasets/task/chatbot"},{"name":"Constituency Parsing","url":"/task/constituency-parsing","datasets_with_task":"/datasets/task/constituency-parsing"},{"name":"Topic Classification","url":"/task/topic-classification","datasets_with_task":"/datasets/task/topic-classification"},{"name":"Author Attribution","url":"/task/author-attribution","datasets_with_task":"/datasets/task/author-attribution"}],"languages":[{"name":"Russian","url":"/datasets/language/russian"}],"variants":["Taiga Corpus"],"data_loaders":[{"repo":"https://github.com/natasha/corus","url":"https://natasha.github.io/corus/","frameworks":[]}],"num_papers_in_archive":5,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}