{"url":"/task/extractive-document-summarization","name":"Extractive Text Summarization","slug":"extractive-document-summarization","description_markdown":"Given a document, selecting a subset of the words or sentences which best represents a summary of the document.","categories":[{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":95,"papers_with_code":34,"benchmarks":5,"benchmark_tables_in_archive":5,"benchmark_tables_shown":5,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":5,"subtasks":1,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/extractive-document-summarization-on-cnn","slug":"extractive-document-summarization-on-cnn","dataset":"CNN / Daily Mail","dataset_url":"/dataset/cnn-daily-mail-1","rows_in_archive":15,"metrics":["ROUGE-1","ROUGE-2","ROUGE-L"],"first_row_in_archive_order":{"model":"HAHSum","paper_title":"Neural Extractive Summarization with Hierarchical Attentive Heterogeneous Graph Network","paper_url":"/paper/neural-extractive-summarization-with","paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/extractive-document-summarization-on","slug":"extractive-document-summarization-on","dataset":"DebateSum","dataset_url":"/dataset/debatesum","rows_in_archive":3,"metrics":["ROUGE-L"],"first_row_in_archive_order":{"model":"Longformer-Base","paper_title":"DebateSum: A large-scale argument mining and summarization dataset","paper_url":"/paper/debatesum-a-large-scale-argument-mining-and","paper_date":"2020-11-14","arxiv_id":"2011.07251","code_links":[{"title":"Hellisotherpeople/DebateSum","url":"https://github.com/Hellisotherpeople/DebateSum"},{"title":"arvind-balaji/debate-cards","url":"https://github.com/arvind-balaji/debate-cards"},{"title":"Hellisotherpeople/debate2vec","url":"https://github.com/Hellisotherpeople/debate2vec"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}}},{"leaderboard":"/sota/extractive-text-summarization-on-govreport","slug":"extractive-text-summarization-on-govreport","dataset":"GovReport","dataset_url":"/dataset/govreport","rows_in_archive":2,"metrics":["Avg. Test Rouge1","Avg. Test Rouge2","Avg. Test RougeLsum"],"first_row_in_archive_order":{"model":"MemSum (extractive)","paper_title":"MemSum: Extractive Summarization of Long Documents Using Multi-Step Episodic Markov Decision Processes","paper_url":"/paper/memsum-extractive-summarization-of-long","paper_date":"2021-07-19","arxiv_id":"2107.08929","code_links":[{"title":"nianlonggu/memsum","url":"https://github.com/nianlonggu/memsum"}],"syntology":null}},{"leaderboard":"/sota/extractive-text-summarization-on-duc-2004","slug":"extractive-text-summarization-on-duc-2004","dataset":"DUC 2004 Task 1","dataset_url":"/dataset/duc-2004","rows_in_archive":1,"metrics":["ROUGE-1","ROUGE-2","ROUGE-L"],"first_row_in_archive_order":{"model":"Abs","paper_title":"A Neural Attention Model for Abstractive Sentence Summarization","paper_url":"/paper/a-neural-attention-model-for-abstractive","paper_date":"2015-09-02","arxiv_id":"1509.00685","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models/tree/master/research/textsum"},{"title":"toru34/rush_emnlp_2015","url":"https://github.com/toru34/rush_emnlp_2015"},{"title":"Ganeshpadmanaban/Neural-Attention-Model-Abstractive-Summarization","url":"https://github.com/Ganeshpadmanaban/Neural-Attention-Model-Abstractive-Summarization"},{"title":"Ganeshpadmanaban/Neural-Attention-Model","url":"https://github.com/Ganeshpadmanaban/Neural-Attention-Model"}],"syntology":null}},{"leaderboard":"/sota/extractive-text-summarization-on-duc-2004-1","slug":"extractive-text-summarization-on-duc-2004-1","dataset":"DUC 2004","dataset_url":"/dataset/duc-2004","rows_in_archive":1,"metrics":["Test ROGUE-1","Test ROGUE-2"],"first_row_in_archive_order":{"model":"Pre-training-meets-Clustering-A-Hybrid-Extractive-Multi-Document-Summarization-Model","paper_title":"Pre-training Meets Clustering: A Hybrid Extractive Multi-document Summarization Model","paper_url":"/paper/pre-training-meets-clustering-a-hybrid","paper_date":"2023-05-25","arxiv_id":null,"code_links":[{"title":"Akankshakarotia/Pre-training-meets-Clustering-A-Hybrid-Extractive-Multi-Document-Summarization-Model","url":"https://github.com/Akankshakarotia/Pre-training-meets-Clustering-A-Hybrid-Extractive-Multi-Document-Summarization-Model"}],"syntology":null}}],"datasets":[{"url":"/dataset/cnn-daily-mail-1","name":"CNN/Daily Mail","full_name":"CNN/Daily Mail","num_papers_in_archive":530},{"url":"/dataset/govreport","name":"GovReport","full_name":"","num_papers_in_archive":83},{"url":"/dataset/duc-2004","name":"DUC 2004","full_name":"DUC 2004","num_papers_in_archive":15},{"url":"/dataset/debatesum","name":"DebateSum","full_name":"","num_papers_in_archive":6},{"url":"/dataset/subsume","name":"SubSumE","full_name":"","num_papers_in_archive":1}],"subtasks":[{"url":"/task/reader-aware-summarization","name":"Reader-Aware Summarization"}],"parent_tasks":[{"url":"/task/text-summarization","name":"Text Summarization"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":34,"tagged_in_all":95,"items":[{"url":"/paper/get-to-the-point-summarization-with-pointer","title":"Get To The Point: Summarization with Pointer-Generator Networks","date":"2017-04-14","arxiv_id":"1704.04368","repositories_listed":39,"syntology":{"n":64,"n_ran":30,"n_unverified":34,"n_pointer_only":44}},{"url":"/paper/text-summarization-with-pretrained-encoders","title":"Text Summarization with Pretrained Encoders","date":"2019-08-22","arxiv_id":"1908.08345","repositories_listed":19,"syntology":{"n":21,"n_ran":7,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/factorized-attention-self-attention-with","title":"Efficient Attention: Attention with Linear Complexities","date":"2018-12-04","arxiv_id":"1812.01243","repositories_listed":14,"syntology":{"n":8,"n_ran":7,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/fine-tune-bert-for-extractive-summarization","title":"Fine-tune BERT for Extractive Summarization","date":"2019-03-25","arxiv_id":"1903.10318","repositories_listed":12,"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/leveraging-bert-for-extractive-text","title":"Leveraging BERT for Extractive Text Summarization on Lectures","date":"2019-06-07","arxiv_id":"1906.04165","repositories_listed":8,"syntology":null},{"url":"/paper/a-neural-attention-model-for-abstractive","title":"A Neural Attention Model for Abstractive Sentence Summarization","date":"2015-09-02","arxiv_id":"1509.00685","repositories_listed":4,"syntology":null},{"url":"/paper/debatesum-a-large-scale-argument-mining-and","title":"DebateSum: A large-scale argument mining and summarization dataset","date":"2020-11-14","arxiv_id":"2011.07251","repositories_listed":3,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/aredsum-adaptive-redundancy-aware-iterative","title":"AREDSUM: Adaptive Redundancy-Aware Iterative Sentence Ranking for Extractive Document Summarization","date":"2020-04-13","arxiv_id":"2004.06176","repositories_listed":3,"syntology":null},{"url":"/paper/align-and-attend-multimodal-summarization","title":"Align and Attend: Multimodal Summarization with Dual Contrastive Losses","date":"2023-03-13","arxiv_id":"2303.07284","repositories_listed":2,"syntology":null},{"url":"/paper/cx-db8-a-queryable-extractive-summarizer-and","title":"CX DB8: A queryable extractive summarizer and semantic search engine","date":"2020-12-07","arxiv_id":"2012.03942","repositories_listed":2,"syntology":null},{"url":"/paper/screenplay-summarization-using-latent","title":"Screenplay Summarization Using Latent Narrative Structure","date":"2020-04-27","arxiv_id":"2004.12727","repositories_listed":2,"syntology":null},{"url":"/paper/extractive-summarization-as-text-matching","title":"Extractive Summarization as Text Matching","date":"2020-04-19","arxiv_id":"2004.08795","repositories_listed":2,"syntology":null},{"url":"/paper/searching-for-effective-neural-extractive","title":"Searching for Effective Neural Extractive Summarization: What Works and What's Next","date":"2019-07-08","arxiv_id":"1907.03491","repositories_listed":2,"syntology":null},{"url":"/paper/tap-dlnd-10-a-corpus-for-document-level","title":"TAP-DLND 1.0 : A Corpus for Document Level Novelty Detection","date":"2018-02-20","arxiv_id":"1802.06950","repositories_listed":2,"syntology":null},{"url":"/paper/centroid-based-text-summarization-through","title":"Centroid-based Text Summarization through Compositionality of Word Embeddings","date":"2017-04-01","arxiv_id":null,"repositories_listed":2,"syntology":null},{"url":"/paper/a-novel-word-pair-based-gaussian-sentence","title":"A Novel Word Pair-based Gaussian Sentence Similarity Algorithm For Bengali Extractive Text Summarization","date":"2024-11-26","arxiv_id":"2411.17181","repositories_listed":1,"syntology":null},{"url":"/paper/pre-training-meets-clustering-a-hybrid","title":"Pre-training Meets Clustering: A Hybrid Extractive Multi-document Summarization Model","date":"2023-05-25","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/gusum-graph-based-unsupervised-summarization-1","title":"GUSUM: Graph-based Unsupervised Summarization Using Sentence Features Scoring and Sentence-BERT","date":"2022-10-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/idn-sum-a-new-dataset-for-interactive-digital","title":"IDN-Sum: A New Dataset for Interactive Digital Narrative Extractive Text Summarisation","date":"2022-10-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/memsum-extractive-summarization-of-long","title":"MemSum: Extractive Summarization of Long Documents Using Multi-Step Episodic Markov Decision Processes","date":"2021-07-19","arxiv_id":"2107.08929","repositories_listed":1,"syntology":null},{"url":"/paper/unsupervised-extractive-summarization-by-pre","title":"Unsupervised Extractive Summarization by Pre-training Hierarchical Transformers","date":"2020-10-16","arxiv_id":"2010.08242","repositories_listed":1,"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":3}},{"url":"/paper/heterogeneous-graph-neural-networks-for-1","title":"Heterogeneous Graph Neural Networks for Extractive Document Summarization","date":"2020-04-26","arxiv_id":"2004.12393","repositories_listed":1,"syntology":null},{"url":"/paper/extractive-multi-document-summarization-using-2","title":"Extractive Multi-document Summarization using K-means, Centroid-based Method, MMR, and Sentence Position","date":"2019-12-04","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/reading-like-her-human-reading-inspired","title":"Reading Like HER: Human Reading Inspired Extractive Summarization","date":"2019-11-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/discourse-aware-neural-extractive-model-for","title":"Discourse-Aware Neural Extractive Text Summarization","date":"2019-10-30","arxiv_id":"1910.14142","repositories_listed":1,"syntology":{"n":11,"n_ran":1,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/strass-a-light-and-effective-method-for","title":"STRASS: A Light and Effective Method for Extractive Summarization Based on Sentence Embeddings","date":"2019-07-16","arxiv_id":"1907.07323","repositories_listed":1,"syntology":null},{"url":"/paper/neural-extractive-text-summarization-with","title":"Neural Extractive Text Summarization with Syntactic Compression","date":"2019-02-03","arxiv_id":"1902.00863","repositories_listed":1,"syntology":null},{"url":"/paper/deepchannel-salience-estimation-by","title":"DeepChannel: Salience Estimation by Contrastive Learning for Extractive Document Summarization","date":"2018-11-06","arxiv_id":"1811.02394","repositories_listed":1,"syntology":null},{"url":"/paper/iterative-document-representation-learning","title":"Iterative Document Representation Learning Towards Summarization with Polishing","date":"2018-09-27","arxiv_id":"1809.10324","repositories_listed":1,"syntology":null},{"url":"/paper/banditsum-extractive-summarization-as-a","title":"BanditSum: Extractive Summarization as a Contextual Bandit","date":"2018-09-25","arxiv_id":"1809.09672","repositories_listed":1,"syntology":null}],"syntology_records":7,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}