{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/tape-assessing-few-shot-russian-language","title":"TAPE: Assessing Few-shot Russian Language Understanding","arxiv_id":"2210.12813","date":"2022-10-23","proceeding":null,"authors":["Ekaterina Taktasheva","Tatiana Shavrina","Alena Fenogenova","Denis Shevelev","Nadezhda Katricheva","Maria Tikhonova","Albina Akhmetgareeva","Oleg Zinkevich","Anastasiia Bashmakova","Svetlana Iordanskaia","Alena Spiridonova","Valentina Kurenshchikova","Ekaterina Artemova","Vladislav Mikhailov"],"abstract":"Recent advances in zero-shot and few-shot learning have shown promise for a scope of research and practical purposes. However, this fast-growing area lacks standardized evaluation suites for non-English languages, hindering progress outside the Anglo-centric paradigm. To address this line of research, we propose TAPE (Text Attack and Perturbation Evaluation), a novel benchmark that includes six more complex NLU tasks for Russian, covering multi-hop reasoning, ethical concepts, logic and commonsense knowledge. The TAPE's design focuses on systematic zero-shot and few-shot NLU evaluation: (i) linguistic-oriented adversarial attacks and perturbations for analyzing robustness, and (ii) subpopulations for nuanced interpretation. The detailed analysis of testing the autoregressive baselines indicates that simple spelling-based perturbations affect the performance the most, while paraphrasing the input has a more negligible effect. At the same time, the results demonstrate a significant gap between the neural and human baselines for most tasks. We publicly release TAPE (tape-benchmark.com) to foster research on robust LMs that can generalize to new tasks when little to no supervision is available.","url_abs":"https://arxiv.org/abs/2210.12813v1","url_pdf":"https://arxiv.org/pdf/2210.12813v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"tape-assessing-few-shot-russian-language","repo_url":"https://github.com/RussianNLP/TAPE","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"none","reach":null}],"tasks":[{"task_slug":"adversarial-attack","task_name":"Adversarial Attack"},{"task_slug":"adversarial-text","task_name":"Adversarial Text"},{"task_slug":"ethics","task_name":"Ethics"},{"task_slug":"few-shot-learning","task_name":"Few-Shot Learning"},{"task_slug":"logical-reasoning","task_name":"Logical Reasoning"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"zero-shot-learning","task_name":"Zero-Shot Learning"}],"methods":[],"datasets_introduced":[{"slug":"chegeka","name":"CheGeKa","full_name":"CheGeKa"},{"slug":"ethics-2","name":"Ethics (per ethics)","full_name":""},{"slug":"multiq","name":"MultiQ","full_name":"MultiQ"},{"slug":"ruopenbookqa","name":"RuOpenBookQA","full_name":"RuOpenBookQA"},{"slug":"ruworldtree","name":"RuWorldTree","full_name":"RuWorldTree"},{"slug":"winograd-automatic","name":"Winograd Automatic","full_name":"Winograd"}],"methods_introduced":[],"results":[{"leaderboard":"/sota/ethics-on-ethics","task":"Ethics","dataset":"Ethics","model":"RuGPT-3 Large","rank_in_archive_order":1,"of":4,"metrics":{"Accuracy":"68.6"},"uses_additional_data":false},{"leaderboard":"/sota/ethics-on-ethics","task":"Ethics","dataset":"Ethics","model":"RuGPT-3 Meduim","rank_in_archive_order":2,"of":4,"metrics":{"Accuracy":"68.3"},"uses_additional_data":false},{"leaderboard":"/sota/ethics-on-ethics","task":"Ethics","dataset":"Ethics","model":"RuGPT-3 Small","rank_in_archive_order":3,"of":4,"metrics":{"Accuracy":"55.5"},"uses_additional_data":false},{"leaderboard":"/sota/ethics-on-ethics","task":"Ethics","dataset":"Ethics","model":"Human benchmark","rank_in_archive_order":4,"of":4,"metrics":{"Accuracy":"52.9"},"uses_additional_data":false},{"leaderboard":"/sota/ethics-on-ethics-2","task":"Ethics","dataset":"Ethics (per ethics)","model":"Human benchmark","rank_in_archive_order":1,"of":4,"metrics":{"Accuracy":"67.6"},"uses_additional_data":false},{"leaderboard":"/sota/ethics-on-ethics-2","task":"Ethics","dataset":"Ethics (per ethics)","model":"RuGPT-3 Small","rank_in_archive_order":2,"of":4,"metrics":{"Accuracy":"60.9"},"uses_additional_data":false},{"leaderboard":"/sota/ethics-on-ethics-2","task":"Ethics","dataset":"Ethics (per ethics)","model":"RuGPT-3 Large","rank_in_archive_order":3,"of":4,"metrics":{"Accuracy":"44.9"},"uses_additional_data":false},{"leaderboard":"/sota/ethics-on-ethics-2","task":"Ethics","dataset":"Ethics (per ethics)","model":"RuGPT-3 Medium","rank_in_archive_order":4,"of":4,"metrics":{"Accuracy":"44.1"},"uses_additional_data":false},{"leaderboard":"/sota/logical-reasoning-on-ruworldtree","task":"Logical Reasoning","dataset":"RuWorldTree","model":"Human benchmark","rank_in_archive_order":1,"of":4,"metrics":{"Accuracy ":"83.7"},"uses_additional_data":false},{"leaderboard":"/sota/logical-reasoning-on-ruworldtree","task":"Logical Reasoning","dataset":"RuWorldTree","model":"RuGPT-3 Large","rank_in_archive_order":2,"of":4,"metrics":{"Accuracy ":"40.7"},"uses_additional_data":false},{"leaderboard":"/sota/logical-reasoning-on-ruworldtree","task":"Logical Reasoning","dataset":"RuWorldTree","model":"RuGPT-3 Medium","rank_in_archive_order":3,"of":4,"metrics":{"Accuracy ":"38.0"},"uses_additional_data":false},{"leaderboard":"/sota/logical-reasoning-on-ruworldtree","task":"Logical Reasoning","dataset":"RuWorldTree","model":"RuGPT-3 Small","rank_in_archive_order":4,"of":4,"metrics":{"Accuracy ":"34.0"},"uses_additional_data":false},{"leaderboard":"/sota/logical-reasoning-on-winograd-automatic","task":"Logical Reasoning","dataset":"Winograd Automatic","model":"Human benchmark","rank_in_archive_order":1,"of":4,"metrics":{"Accuracy":"87.0"},"uses_additional_data":false},{"leaderboard":"/sota/logical-reasoning-on-winograd-automatic","task":"Logical Reasoning","dataset":"Winograd Automatic","model":"RuGPT-3 Small","rank_in_archive_order":2,"of":4,"metrics":{"Accuracy":"57.9"},"uses_additional_data":false},{"leaderboard":"/sota/logical-reasoning-on-winograd-automatic","task":"Logical Reasoning","dataset":"Winograd Automatic","model":"RuGPT-3 Medium","rank_in_archive_order":3,"of":4,"metrics":{"Accuracy":"57.2"},"uses_additional_data":false},{"leaderboard":"/sota/logical-reasoning-on-winograd-automatic","task":"Logical Reasoning","dataset":"Winograd Automatic","model":"RuGPT-3 Large","rank_in_archive_order":4,"of":4,"metrics":{"Accuracy":"55.5"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-chegeka","task":"Question Answering","dataset":"CheGeKa","model":"Human benchmark","rank_in_archive_order":1,"of":4,"metrics":{"Accuracy":"64.5"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-chegeka","task":"Question Answering","dataset":"CheGeKa","model":"RuGPT-3 Large","rank_in_archive_order":2,"of":4,"metrics":{"Accuracy":"00"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-chegeka","task":"Question Answering","dataset":"CheGeKa","model":"RuGPT-3 Medium","rank_in_archive_order":3,"of":4,"metrics":{"Accuracy":"00"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-chegeka","task":"Question Answering","dataset":"CheGeKa","model":"RuGPT-3 Small","rank_in_archive_order":4,"of":4,"metrics":{"Accuracy":"00"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-multiq","task":"Question Answering","dataset":"MultiQ","model":"Human benchmark","rank_in_archive_order":1,"of":4,"metrics":{"Accuracy":"91.0"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-multiq","task":"Question Answering","dataset":"MultiQ","model":"RuGPT-3 Large","rank_in_archive_order":2,"of":4,"metrics":{"Accuracy":"00"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-multiq","task":"Question Answering","dataset":"MultiQ","model":"RuGPT-3 Medium","rank_in_archive_order":3,"of":4,"metrics":{"Accuracy":"00"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-multiq","task":"Question Answering","dataset":"MultiQ","model":"RuGPT-3 Small","rank_in_archive_order":4,"of":4,"metrics":{"Accuracy":"00"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-ruopenbookqa","task":"Question Answering","dataset":"RuOpenBookQA","model":"Human benchmark","rank_in_archive_order":1,"of":4,"metrics":{"Accuracy":"86.5"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-ruopenbookqa","task":"Question Answering","dataset":"RuOpenBookQA","model":"RuGPT-3 Small","rank_in_archive_order":2,"of":4,"metrics":{"Accuracy":"57.9"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-ruopenbookqa","task":"Question Answering","dataset":"RuOpenBookQA","model":"RuGPT-3 Medium","rank_in_archive_order":3,"of":4,"metrics":{"Accuracy":"57.2"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-ruopenbookqa","task":"Question Answering","dataset":"RuOpenBookQA","model":"RuGPT-3 Large","rank_in_archive_order":4,"of":4,"metrics":{"Accuracy":"55.5"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":"https://app.syntology.ai/?focus=2210.12813","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}