{"url":"/dataset/turkcorpus","name":"TurkCorpus","full_name":null,"description_markdown":"TurkCorpus, a dataset with 2,359 original sentences from English Wikipedia, each with 8 manual reference simplifications.\r\nThe dataset is divided into two subsets: 2,000 sentences for validation and 359 for testing of sentence simplification models.","description_withheld":null,"homepage":"https://github.com/cocoxu/simplification/tree/master/data/turkcorpus/GEM","introduced_date":"2016-01-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/optimizing-statistical-machine-translation","title":"Optimizing Statistical Machine Translation for Text Simplification","first_author":"Wei Xu","url":null},"license":null,"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Text Simplification","url":"/task/text-simplification","datasets_with_task":"/datasets/task/text-simplification"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["TurkCorpus"],"data_loaders":[{"repo":"https://github.com/cocoxu/simplification","url":"https://github.com/cocoxu/simplification","frameworks":[]}],"num_papers_in_archive":44,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/text-simplification-on-turkcorpus","task":"Text Simplification","dataset_variant":"TurkCorpus","rows":25,"metrics":["SARI (EASSE>=0.2.1)","BLEU","METEOR","FKGL","QuestEval (Reference-less, BERTScore)"],"first_row_in_archive_order":{"model":"GPT-175B (6 SARI-selected examples, high/low)","paper":"/paper/metric-based-in-context-learning-a-case-study","metrics":{"BLEU":"79.83","FKGL":"9.33","SARI (EASSE>=0.2.1)":"43.46"},"code_links":[{"title":"nlp-ku/metric-based-in-context-learning","url":"https://github.com/nlp-ku/metric-based-in-context-learning"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/metric-based-in-context-learning-a-case-study","title":"Metric-Based In-context Learning: A Case Study in Text Simplification","date":"2023-07-27","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/control-prefixes-for-text-generation","title":"Control Prefixes for Parameter-Efficient Text Generation","date":"2021-10-15","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/text-simplification-by-tagging","title":"Text Simplification by Tagging","date":"2021-03-08","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/the-gem-benchmark-natural-language-generation","title":"The GEM Benchmark: Natural Language Generation, its Evaluation and Metrics","date":"2021-02-02","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/iterative-edit-based-unsupervised-sentence","title":"Iterative Edit-Based Unsupervised Sentence Simplification","date":"2020-06-17","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/multilingual-unsupervised-sentence","title":"MUSS: Multilingual Unsupervised Sentence Simplification by Mining Paraphrases","date":"2020-05-01","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/controllable-sentence-simplification","title":"Controllable Sentence Simplification","date":"2019-10-07","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/editnts-an-neural-programmer-interpreter","title":"EditNTS: An Neural Programmer-Interpreter Model for Sentence Simplification through Explicit Editing","date":"2019-06-19","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/integrating-transformer-and-paraphrase-rules","title":"Integrating Transformer and Paraphrase Rules for Sentence Simplification","date":"2018-10-26","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/unsupervised-neural-text-simplification","title":"Unsupervised Neural Text Simplification","date":"2018-10-18","rows_on_this_dataset":3,"code_links":1,"syntology":null},{"paper":"/paper/simple-and-effective-text-simplification","title":"Simple and Effective Text Simplification Using Semantic and Neural Methods","date":"2018-10-11","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/dynamic-multi-level-multi-task-learning-for","title":"Dynamic Multi-Level Multi-Task Learning for Sentence Simplification","date":"2018-06-19","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/sentence-simplification-with-memory-augmented","title":"Sentence Simplification with Memory-Augmented Neural Networks","date":"2018-04-20","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/learning-how-to-simplify-from-explicit","title":"Learning How to Simplify From Explicit Labeling of Complex-Simplified Text Pairs","date":"2017-11-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/exploring-neural-text-simplification-models","title":"Exploring Neural Text Simplification Models","date":"2017-07-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/sentence-simplification-with-deep","title":"Sentence Simplification with Deep Reinforcement Learning","date":"2017-03-31","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/optimizing-statistical-machine-translation","title":"Optimizing Statistical Machine Translation for Text Simplification","date":"2016-01-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/hybrid-simplification-using-deep-semantics","title":"Hybrid Simplification using Deep Semantics and Machine Translation","date":"2014-06-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/sentence-simplification-by-monolingual","title":"Sentence Simplification by Monolingual Machine Translation","date":"2012-07-01","rows_on_this_dataset":1,"code_links":0,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}