{"url":"/task/document-summarization","name":"Document Summarization","slug":"document-summarization","description_markdown":"Automatic **Document Summarization** is the task of rewriting a document into its shorter form while still retaining its important content. The most popular two paradigms are extractive approaches and abstractive approaches. Extractive approaches generate summaries by extracting parts of the original document (usually sentences), while abstractive methods may generate new words or phrases which are not in the original document.\n\n\n<span class=\"description-source\">Source: [HIBERT: Document Level Pre-training of Hierarchical Bidirectional Transformers for Document Summarization ](https://arxiv.org/abs/1905.06566)</span>","categories":[{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":760,"papers_with_code":226,"benchmarks":7,"benchmark_tables_in_archive":7,"benchmark_tables_shown":7,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":28,"subtasks":1,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/document-summarization-on-cnn-daily-mail","slug":"document-summarization-on-cnn-daily-mail","dataset":"CNN / Daily Mail","dataset_url":"/dataset/cnn-daily-mail-1","rows_in_archive":26,"metrics":["ROUGE-1","ROUGE-2","ROUGE-L","PPL"],"first_row_in_archive_order":{"model":"Scrambled code + broken (alter)","paper_title":"Universal Evasion Attacks on Summarization Scoring","paper_url":"/paper/universal-evasion-attacks-on-summarization","paper_date":"2022-10-25","arxiv_id":"2210.14260","code_links":[{"title":"cestwc/universal-evasion","url":"https://github.com/cestwc/universal-evasion"}],"syntology":null}},{"leaderboard":"/sota/document-summarization-on-howsumm-step","slug":"document-summarization-on-howsumm-step","dataset":"HowSumm-Step","dataset_url":"/dataset/howsumm","rows_in_archive":11,"metrics":["ROUGE-1"],"first_row_in_archive_order":{"model":"LexRank (query: step title)","paper_title":"HowSumm: A Multi-Document Summarization Dataset Derived from WikiHow Articles","paper_url":"/paper/howsumm-a-multi-document-summarization","paper_date":"2021-10-07","arxiv_id":"2110.03179","code_links":[{"title":"odelliab/HowSumm","url":"https://github.com/odelliab/HowSumm"}],"syntology":null}},{"leaderboard":"/sota/document-summarization-on-howsumm-method","slug":"document-summarization-on-howsumm-method","dataset":"HowSumm-Method","dataset_url":"/dataset/howsumm","rows_in_archive":9,"metrics":["ROUGE-1"],"first_row_in_archive_order":{"model":"LexRank (query: method + article + steps titles)","paper_title":"HowSumm: A Multi-Document Summarization Dataset Derived from WikiHow Articles","paper_url":"/paper/howsumm-a-multi-document-summarization","paper_date":"2021-10-07","arxiv_id":"2110.03179","code_links":[{"title":"odelliab/HowSumm","url":"https://github.com/odelliab/HowSumm"}],"syntology":null}},{"leaderboard":"/sota/document-summarization-on-arxiv","slug":"document-summarization-on-arxiv","dataset":"Arxiv HEP-TH citation graph","dataset_url":"/dataset/arxiv","rows_in_archive":1,"metrics":["ROUGE-1"],"first_row_in_archive_order":{"model":"DeepPyramidion","paper_title":"Sparsifying Transformer Models with Trainable Representation Pooling","paper_url":"/paper/sparsifying-transformer-models-with-trainable","paper_date":"2021-11-16","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/document-summarization-on-arxiv-summarization","slug":"document-summarization-on-arxiv-summarization","dataset":"arXiv Summarization Dataset","dataset_url":"/dataset/arxiv-summarization-dataset","rows_in_archive":1,"metrics":["Rouge-2"],"first_row_in_archive_order":{"model":"DeepPyramidion","paper_title":"Sparsifying Transformer Models with Trainable Representation Pooling","paper_url":"/paper/sparsifying-transformer-models-with-trainable","paper_date":"2021-11-16","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/document-summarization-on-bbc-xsum","slug":"document-summarization-on-bbc-xsum","dataset":"BBC XSum","dataset_url":null,"rows_in_archive":1,"metrics":["ROUGE-1","ROUGE-2","ROUGE-L"],"first_row_in_archive_order":{"model":"BigBird-Pegasus","paper_title":"Big Bird: Transformers for Longer Sequences","paper_url":"/paper/big-bird-transformers-for-longer-sequences","paper_date":"2020-07-28","arxiv_id":"2007.14062","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"tensorflow/models","url":"https://github.com/tensorflow/models/tree/master/official/nlp/projects/bigbird"},{"title":"PaddlePaddle/PaddleNLP","url":"https://github.com/PaddlePaddle/PaddleNLP/tree/develop/paddlenlp/transformers/bigbird"},{"title":"facebookresearch/xformers","url":"https://github.com/facebookresearch/xformers"},{"title":"google-research/bigbird","url":"https://github.com/google-research/bigbird"},{"title":"monologg/kobigbird","url":"https://github.com/monologg/kobigbird"},{"title":"mim-solutions/bert_for_longer_texts","url":"https://github.com/mim-solutions/bert_for_longer_texts"},{"title":"mim-solutions/roberta_for_longer_texts","url":"https://github.com/mim-solutions/roberta_for_longer_texts"},{"title":"sajjjadayobi/ParsBigBird","url":"https://github.com/sajjjadayobi/ParsBigBird"},{"title":"thefonseca/factorsum","url":"https://github.com/thefonseca/factorsum"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/big_bird"},{"title":"sergeykramp/mthesis-bigbird-embeddings","url":"https://github.com/sergeykramp/mthesis-bigbird-embeddings"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/big_bird"},{"title":"pwc-1/Paper-8","url":"https://github.com/pwc-1/Paper-8/tree/main/bigbird_pegasus"}],"syntology":{"n":15,"n_ran":10,"n_unverified":5,"n_pointer_only":11}}},{"leaderboard":"/sota/document-summarization-on-wikilingua-tr-en","slug":"document-summarization-on-wikilingua-tr-en","dataset":"WikiLingua (tr->en)","dataset_url":"/dataset/wikilingua","rows_in_archive":1,"metrics":["Rouge-L"],"first_row_in_archive_order":{"model":"DOCmT5","paper_title":"DOCmT5: Document-Level Pretraining of Multilingual Language Models","paper_url":"/paper/docmt5-document-level-pretraining-of","paper_date":"2021-12-16","arxiv_id":"2112.08709","code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/cnn-daily-mail-1","name":"CNN/Daily Mail","full_name":"CNN/Daily Mail","num_papers_in_archive":530},{"url":"/dataset/new-york-times-annotated-corpus","name":"New York Times Annotated Corpus","full_name":"","num_papers_in_archive":262},{"url":"/dataset/multi-news","name":"Multi-News","full_name":"Multi-News","num_papers_in_archive":122},{"url":"/dataset/newsroom","name":"NEWSROOM","full_name":"CORNELL NEWSROOM","num_papers_in_archive":107},{"url":"/dataset/wikisum","name":"WikiSum","full_name":"WikiSum","num_papers_in_archive":54},{"url":"/dataset/wikilingua","name":"WikiLingua","full_name":"","num_papers_in_archive":52},{"url":"/dataset/booksum","name":"BookSum","full_name":"","num_papers_in_archive":39},{"url":"/dataset/arxiv","name":"Arxiv HEP-TH citation graph","full_name":"","num_papers_in_archive":35},{"url":"/dataset/wcep","name":"WCEP","full_name":"Wikipedia Current Events Portal","num_papers_in_archive":31},{"url":"/dataset/aeslc","name":"AESLC","full_name":"","num_papers_in_archive":22},{"url":"/dataset/scisummnet","name":"ScisummNet","full_name":"","num_papers_in_archive":20},{"url":"/dataset/arxiv-summarization-dataset","name":"arXiv Summarization Dataset","full_name":"","num_papers_in_archive":13},{"url":"/dataset/aquamuse","name":"aquamuse","full_name":"","num_papers_in_archive":11},{"url":"/dataset/multi-xscience","name":"Multi-XScience","full_name":null,"num_papers_in_archive":10},{"url":"/dataset/cqasumm","name":"CQASUMM","full_name":"","num_papers_in_archive":9},{"url":"/dataset/eur-lex-sum","name":"EUR-Lex-Sum","full_name":"","num_papers_in_archive":8},{"url":"/dataset/oposum","name":"OpoSum","full_name":"","num_papers_in_archive":7},{"url":"/dataset/talksumm","name":"TalkSumm","full_name":"TalkSumm","num_papers_in_archive":6},{"url":"/dataset/matinf","name":"MATINF","full_name":"Maternal and Infant Dataset","num_papers_in_archive":5},{"url":"/dataset/facetsum","name":"FacetSum","full_name":"","num_papers_in_archive":4},{"url":"/dataset/wikipedia-generation","name":"Wikipedia Generation","full_name":"Wikipedia Generation","num_papers_in_archive":4},{"url":"/dataset/elsevier-oa-cc-by","name":"Elsevier OA CC-BY","full_name":"","num_papers_in_archive":2},{"url":"/dataset/findsum","name":"FINDSum","full_name":"Financial Report Document Summarization","num_papers_in_archive":2},{"url":"/dataset/gamewikisum","name":"GameWikiSum","full_name":null,"num_papers_in_archive":1},{"url":"/dataset/howsumm","name":"HowSumm","full_name":"","num_papers_in_archive":1},{"url":"/dataset/pmc-sa","name":"PMC-SA","full_name":"PMC Structured Abstracts","num_papers_in_archive":1},{"url":"/dataset/qbsum","name":"QBSUM","full_name":"","num_papers_in_archive":1},{"url":"/dataset/subsume","name":"SubSumE","full_name":"","num_papers_in_archive":1}],"subtasks":[{"url":"/task/email-thread-summarization","name":"Email Thread Summarization"}],"parent_tasks":[{"url":"/task/text-summarization","name":"Text Summarization"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":226,"tagged_in_all":760,"items":[{"url":"/paper/get-to-the-point-summarization-with-pointer","title":"Get To The Point: Summarization with Pointer-Generator Networks","date":"2017-04-14","arxiv_id":"1704.04368","repositories_listed":39,"syntology":{"n":64,"n_ran":30,"n_unverified":34,"n_pointer_only":44}},{"url":"/paper/language-models-are-unsupervised-multitask","title":"Language Models are Unsupervised Multitask Learners","date":"2019-02-14","arxiv_id":null,"repositories_listed":21,"syntology":null},{"url":"/paper/text-summarization-with-pretrained-encoders","title":"Text Summarization with Pretrained Encoders","date":"2019-08-22","arxiv_id":"1908.08345","repositories_listed":19,"syntology":{"n":21,"n_ran":7,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/unified-language-model-pre-training-for","title":"Unified Language Model Pre-training for Natural Language Understanding and Generation","date":"2019-05-08","arxiv_id":"1905.03197","repositories_listed":9,"syntology":null},{"url":"/paper/all-nlp-tasks-are-generation-tasks-a-general","title":"GLM: General Language Model Pretraining with Autoregressive Blank Infilling","date":"2021-03-18","arxiv_id":"2103.10360","repositories_listed":8,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/extending-context-window-of-large-language","title":"Extending Context Window of Large Language Models via Positional Interpolation","date":"2023-06-27","arxiv_id":"2306.15595","repositories_listed":7,"syntology":{"n":15,"n_ran":9,"n_unverified":6,"n_pointer_only":8}},{"url":"/paper/summarunner-a-recurrent-neural-network-based","title":"SummaRuNNer: A Recurrent Neural Network based Sequence Model for Extractive Summarization of Documents","date":"2016-11-14","arxiv_id":"1611.04230","repositories_listed":7,"syntology":{"n":7,"n_ran":0,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/bottom-up-abstractive-summarization","title":"Bottom-Up Abstractive Summarization","date":"2018-08-31","arxiv_id":"1808.10792","repositories_listed":5,"syntology":{"n":6,"n_ran":5,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/generating-wikipedia-by-summarizing-long","title":"Generating Wikipedia by Summarizing Long Sequences","date":"2018-01-30","arxiv_id":"1801.10198","repositories_listed":4,"syntology":null},{"url":"/paper/primer-pyramid-based-masked-sentence-pre","title":"PRIMERA: Pyramid-based Masked Sentence Pre-training for Multi-document Summarization","date":"2021-10-16","arxiv_id":"2110.08499","repositories_listed":3,"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/debatesum-a-large-scale-argument-mining-and","title":"DebateSum: A large-scale argument mining and summarization dataset","date":"2020-11-14","arxiv_id":"2011.07251","repositories_listed":3,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/aredsum-adaptive-redundancy-aware-iterative","title":"AREDSUM: Adaptive Redundancy-Aware Iterative Sentence Ranking for Extractive Document Summarization","date":"2020-04-13","arxiv_id":"2004.06176","repositories_listed":3,"syntology":null},{"url":"/paper/190600077","title":"Scoring Sentence Singletons and Pairs for Abstractive Summarization","date":"2019-05-31","arxiv_id":"1906.00077","repositories_listed":3,"syntology":null},{"url":"/paper/dont-give-me-the-details-just-the-summary","title":"Don't Give Me the Details, Just the Summary! Topic-Aware Convolutional Neural Networks for Extreme Summarization","date":"2018-08-27","arxiv_id":"1808.08745","repositories_listed":3,"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/arctic-long-sequence-training-scalable-and","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","date":"2025-06-16","arxiv_id":"2506.13996","repositories_listed":2,"syntology":null},{"url":"/paper/l-citeeval-do-long-context-models-truly","title":"L-CiteEval: Do Long-Context Models Truly Leverage Context for Responding?","date":"2024-10-03","arxiv_id":"2410.02115","repositories_listed":2,"syntology":null},{"url":"/paper/oarelatedwork-a-large-scale-dataset-of","title":"OARelatedWork: A Large-Scale Dataset of Related Work Sections with Full-texts from Open Access Sources","date":"2024-05-03","arxiv_id":"2405.01930","repositories_listed":2,"syntology":null},{"url":"/paper/an-extractive-abstractive-approach-for-multi","title":"An Extractive-Abstractive Approach for Multi-document Summarization of Scientific Articles for Literature Review","date":"2022-10-01","arxiv_id":null,"repositories_listed":2,"syntology":null},{"url":"/paper/a-proposition-level-clustering-approach-for","title":"Proposition-Level Clustering for Multi-Document Summarization","date":"2021-12-16","arxiv_id":"2112.08770","repositories_listed":2,"syntology":null},{"url":"/paper/summ-n-a-multi-stage-summarization-framework","title":"Summ^N: A Multi-Stage Summarization Framework for Long Input Dialogues and Documents","date":"2021-10-16","arxiv_id":"2110.10150","repositories_listed":2,"syntology":null},{"url":"/paper/ms2-multi-document-summarization-of-medical","title":"MS2: Multi-Document Summarization of Medical Studies","date":"2021-04-13","arxiv_id":"2104.06486","repositories_listed":2,"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/quantitative-argument-summarization-and","title":"Quantitative Argument Summarization and Beyond: Cross-Domain Key Point Analysis","date":"2020-10-11","arxiv_id":"2010.05369","repositories_listed":2,"syntology":null},{"url":"/paper/attention-aware-inference-for-neural","title":"Global-aware Beam Search for Neural Abstractive Summarization","date":"2020-09-15","arxiv_id":"2009.06891","repositories_listed":2,"syntology":null},{"url":"/paper/generating-factual-narrative-summaries-of","title":"Generating (Factual?) Narrative Summaries of RCTs: Experiments with Neural Multi-Document Summarization","date":"2020-08-25","arxiv_id":"2008.11293","repositories_listed":2,"syntology":null},{"url":"/paper/pre-training-via-paraphrasing","title":"Pre-training via Paraphrasing","date":"2020-06-26","arxiv_id":"2006.15020","repositories_listed":2,"syntology":{"n":18,"n_ran":15,"n_unverified":3,"n_pointer_only":3}},{"url":"/paper/leveraging-graph-to-improve-abstractive-multi","title":"Leveraging Graph to Improve Abstractive Multi-Document Summarization","date":"2020-05-20","arxiv_id":"2005.10043","repositories_listed":2,"syntology":null},{"url":"/paper/on-faithfulness-and-factuality-in-abstractive","title":"On Faithfulness and Factuality in Abstractive Summarization","date":"2020-05-02","arxiv_id":"2005.00661","repositories_listed":2,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/screenplay-summarization-using-latent","title":"Screenplay Summarization Using Latent Narrative Structure","date":"2020-04-27","arxiv_id":"2004.12727","repositories_listed":2,"syntology":null},{"url":"/paper/extractive-summarization-as-text-matching","title":"Extractive Summarization as Text Matching","date":"2020-04-19","arxiv_id":"2004.08795","repositories_listed":2,"syntology":null},{"url":"/paper/tf-ranking-scalable-tensorflow-library-for","title":"TF-Ranking: Scalable TensorFlow Library for Learning-to-Rank","date":"2018-11-30","arxiv_id":"1812.00073","repositories_listed":2,"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}}],"syntology_records":13,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}