{"url":"/task/multi-document-summarization","name":"Multi-Document Summarization","slug":"multi-document-summarization","description_markdown":"**Multi-Document Summarization** is a process of representing a set of documents with a short piece of text by capturing the relevant information and filtering out the redundant information. Two prominent approaches to Multi-Document Summarization are extractive and abstractive summarization. Extractive summarization systems aim to extract salient snippets, sentences or passages from documents, while abstractive summarization systems aim to concisely paraphrase the content of the documents.\r\n\r\n\r\n<span class=\"description-source\">Source: [Multi-Document Summarization using Distributed Bag-of-Words Model ](https://arxiv.org/abs/1710.02745)</span>","categories":[{"name":"Adversarial","url":"/area/adversarial"},{"name":"Computer Code","url":"/area/computer-code"},{"name":"Knowledge Base","url":"/area/knowledge-base"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"},{"name":"Speech","url":"/area/speech"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":359,"papers_with_code":113,"benchmarks":5,"benchmark_tables_in_archive":5,"benchmark_tables_shown":5,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":15,"subtasks":0,"parent_tasks":2},"benchmarks":[{"leaderboard":"/sota/multi-document-summarization-on-multi-news","slug":"multi-document-summarization-on-multi-news","dataset":"Multi-News","dataset_url":"/dataset/multi-news","rows_in_archive":6,"metrics":["ROUGE-1","ROUGE-2","ROUGE-SU4","ROUGE-L"],"first_row_in_archive_order":{"model":"PRIMER","paper_title":"PRIMERA: Pyramid-based Masked Sentence Pre-training for Multi-document Summarization","paper_url":"/paper/primer-pyramid-based-masked-sentence-pre","paper_date":"2021-10-16","arxiv_id":"2110.08499","code_links":[{"title":"allenai/primer","url":"https://github.com/allenai/primer"},{"title":"allenai/open-mds","url":"https://github.com/allenai/open-mds"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/longformer"}],"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/multi-document-summarization-on-duc-2004","slug":"multi-document-summarization-on-duc-2004","dataset":"DUC 2004","dataset_url":"/dataset/duc-2004","rows_in_archive":1,"metrics":["ROUGE-1"],"first_row_in_archive_order":{"model":"GCN: Personalized Discourse Graph","paper_title":"Graph-based Neural Multi-Document Summarization","paper_url":"/paper/graph-based-neural-multi-document","paper_date":"2017-06-20","arxiv_id":"1706.06681","code_links":[],"syntology":null}},{"leaderboard":"/sota/multi-document-summarization-on-ms-2","slug":"multi-document-summarization-on-ms-2","dataset":"MS^2","dataset_url":"/dataset/ms-2","rows_in_archive":1,"metrics":["BertScoreF1"],"first_row_in_archive_order":{"model":"led-base-16384-ms2","paper_title":"Open Domain Multi-document Summarization: A Comprehensive Study of Model Brittleness under Retrieval","paper_url":"/paper/exploring-the-challenges-of-open-domain-multi","paper_date":"2022-12-20","arxiv_id":"2212.10526","code_links":[],"syntology":null}},{"leaderboard":"/sota/multi-document-summarization-on-review","slug":"multi-document-summarization-on-review","dataset":"review","dataset_url":null,"rows_in_archive":1,"metrics":["1-of-100 Accuracy"],"first_row_in_archive_order":{"model":"solar","paper_title":"Solar Cell Surface Defect Inspection Based on Multispectral Convolutional Neural Network","paper_url":"/paper/solar-cell-surface-defect-inspection-based-on","paper_date":"2018-12-15","arxiv_id":"1812.06220","code_links":[],"syntology":null}},{"leaderboard":"/sota/multi-document-summarization-on-wcep","slug":"multi-document-summarization-on-wcep","dataset":"WCEP","dataset_url":"/dataset/wcep","rows_in_archive":1,"metrics":["ROUGE-1","ROUGE-2","ROUGE-L"],"first_row_in_archive_order":{"model":"PRIMER","paper_title":"PRIMERA: Pyramid-based Masked Sentence Pre-training for Multi-document Summarization","paper_url":"/paper/primer-pyramid-based-masked-sentence-pre","paper_date":"2021-10-16","arxiv_id":"2110.08499","code_links":[{"title":"allenai/primer","url":"https://github.com/allenai/primer"},{"title":"allenai/open-mds","url":"https://github.com/allenai/open-mds"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/longformer"}],"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/multi-news","name":"Multi-News","full_name":"Multi-News","num_papers_in_archive":122},{"url":"/dataset/wikisum","name":"WikiSum","full_name":"WikiSum","num_papers_in_archive":54},{"url":"/dataset/wcep","name":"WCEP","full_name":"Wikipedia Current Events Portal","num_papers_in_archive":31},{"url":"/dataset/duc-2004","name":"DUC 2004","full_name":"DUC 2004","num_papers_in_archive":15},{"url":"/dataset/aquamuse","name":"aquamuse","full_name":"","num_papers_in_archive":11},{"url":"/dataset/multi-xscience","name":"Multi-XScience","full_name":null,"num_papers_in_archive":10},{"url":"/dataset/oposum","name":"OpoSum","full_name":"","num_papers_in_archive":7},{"url":"/dataset/matinf","name":"MATINF","full_name":"Maternal and Infant Dataset","num_papers_in_archive":5},{"url":"/dataset/ms-2","name":"MS^2","full_name":"Multi-Document Summarization of Medical Studies","num_papers_in_archive":4},{"url":"/dataset/wikipedia-generation","name":"Wikipedia Generation","full_name":"Wikipedia Generation","num_papers_in_archive":4},{"url":"/dataset/healthline","name":"Healthline","full_name":"","num_papers_in_archive":3},{"url":"/dataset/openasp","name":"OpenAsp","full_name":"","num_papers_in_archive":2},{"url":"/dataset/brwac2wiki","name":"BrWac2Wiki","full_name":"","num_papers_in_archive":1},{"url":"/dataset/gamewikisum","name":"GameWikiSum","full_name":null,"num_papers_in_archive":1},{"url":"/dataset/lsars","name":"LSARS","full_name":"Large Scale Abstractive multi-Review Summarization","num_papers_in_archive":0}],"subtasks":[],"parent_tasks":[{"url":"/task/text-generation","name":"Text Generation"},{"url":"/task/text-summarization","name":"Text Summarization"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":113,"tagged_in_all":359,"items":[{"url":"/paper/bottom-up-abstractive-summarization","title":"Bottom-Up Abstractive Summarization","date":"2018-08-31","arxiv_id":"1808.10792","repositories_listed":5,"syntology":{"n":6,"n_ran":5,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/longt5-efficient-text-to-text-transformer-for","title":"LongT5: Efficient Text-To-Text Transformer for Long Sequences","date":"2021-12-15","arxiv_id":"2112.07916","repositories_listed":4,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/generating-wikipedia-by-summarizing-long","title":"Generating Wikipedia by Summarizing Long Sequences","date":"2018-01-30","arxiv_id":"1801.10198","repositories_listed":4,"syntology":null},{"url":"/paper/primer-pyramid-based-masked-sentence-pre","title":"PRIMERA: Pyramid-based Masked Sentence Pre-training for Multi-document Summarization","date":"2021-10-16","arxiv_id":"2110.08499","repositories_listed":3,"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/190600077","title":"Scoring Sentence Singletons and Pairs for Abstractive Summarization","date":"2019-05-31","arxiv_id":"1906.00077","repositories_listed":3,"syntology":null},{"url":"/paper/oarelatedwork-a-large-scale-dataset-of","title":"OARelatedWork: A Large-Scale Dataset of Related Work Sections with Full-texts from Open Access Sources","date":"2024-05-03","arxiv_id":"2405.01930","repositories_listed":2,"syntology":null},{"url":"/paper/an-extractive-abstractive-approach-for-multi","title":"An Extractive-Abstractive Approach for Multi-document Summarization of Scientific Articles for Literature Review","date":"2022-10-01","arxiv_id":null,"repositories_listed":2,"syntology":null},{"url":"/paper/a-proposition-level-clustering-approach-for","title":"Proposition-Level Clustering for Multi-Document Summarization","date":"2021-12-16","arxiv_id":"2112.08770","repositories_listed":2,"syntology":null},{"url":"/paper/ms2-multi-document-summarization-of-medical","title":"MS2: Multi-Document Summarization of Medical Studies","date":"2021-04-13","arxiv_id":"2104.06486","repositories_listed":2,"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/quantitative-argument-summarization-and","title":"Quantitative Argument Summarization and Beyond: Cross-Domain Key Point Analysis","date":"2020-10-11","arxiv_id":"2010.05369","repositories_listed":2,"syntology":null},{"url":"/paper/attention-aware-inference-for-neural","title":"Global-aware Beam Search for Neural Abstractive Summarization","date":"2020-09-15","arxiv_id":"2009.06891","repositories_listed":2,"syntology":null},{"url":"/paper/generating-factual-narrative-summaries-of","title":"Generating (Factual?) Narrative Summaries of RCTs: Experiments with Neural Multi-Document Summarization","date":"2020-08-25","arxiv_id":"2008.11293","repositories_listed":2,"syntology":null},{"url":"/paper/pre-training-via-paraphrasing","title":"Pre-training via Paraphrasing","date":"2020-06-26","arxiv_id":"2006.15020","repositories_listed":2,"syntology":{"n":18,"n_ran":15,"n_unverified":3,"n_pointer_only":3}},{"url":"/paper/leveraging-graph-to-improve-abstractive-multi","title":"Leveraging Graph to Improve Abstractive Multi-Document Summarization","date":"2020-05-20","arxiv_id":"2005.10043","repositories_listed":2,"syntology":null},{"url":"/paper/centroid-based-text-summarization-through","title":"Centroid-based Text Summarization through Compositionality of Word Embeddings","date":"2017-04-01","arxiv_id":null,"repositories_listed":2,"syntology":null},{"url":"/paper/generationprograms-fine-grained-attribution","title":"GenerationPrograms: Fine-grained Attribution with Executable Programs","date":"2025-06-17","arxiv_id":"2506.14580","repositories_listed":1,"syntology":null},{"url":"/paper/improving-fairness-of-large-language-models","title":"Improving Fairness of Large Language Models in Multi-document Summarization","date":"2025-06-09","arxiv_id":"2506.07479","repositories_listed":1,"syntology":null},{"url":"/paper/ask-retrieve-summarize-a-modular-pipeline-for","title":"Ask, Retrieve, Summarize: A Modular Pipeline for Scientific Literature Summarization","date":"2025-05-22","arxiv_id":"2505.16349","repositories_listed":1,"syntology":null},{"url":"/paper/estimating-optimal-context-length-for-hybrid","title":"Estimating Optimal Context Length for Hybrid Retrieval-augmented Multi-document Summarization","date":"2025-04-17","arxiv_id":"2504.12972","repositories_listed":1,"syntology":null},{"url":"/paper/scaling-multi-document-event-summarization","title":"Scaling Multi-Document Event Summarization: Evaluating Compression vs. Full-Text Approaches","date":"2025-02-10","arxiv_id":"2502.06617","repositories_listed":1,"syntology":null},{"url":"/paper/coverage-based-fairness-in-multi-document","title":"Coverage-based Fairness in Multi-document Summarization","date":"2024-12-11","arxiv_id":"2412.08795","repositories_listed":1,"syntology":null},{"url":"/paper/fair-summarization-bridging-quality-and","title":"Fair Summarization: Bridging Quality and Diversity in Extractive Summaries","date":"2024-11-12","arxiv_id":"2411.07521","repositories_listed":1,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":5}},{"url":"/paper/from-single-to-multi-how-llms-hallucinate-in","title":"From Single to Multi: How LLMs Hallucinate in Multi-Document Summarization","date":"2024-10-17","arxiv_id":"2410.13961","repositories_listed":1,"syntology":null},{"url":"/paper/globesumm-a-challenging-benchmark-towards","title":"GlobeSumm: A Challenging Benchmark Towards Unifying Multi-lingual, Cross-lingual and Multi-document News Summarization","date":"2024-10-05","arxiv_id":"2410.04087","repositories_listed":1,"syntology":null},{"url":"/paper/glimmer-incorporating-graph-and-lexical","title":"GLIMMER: Incorporating Graph and Lexical Features in Unsupervised Multi-Document Summarization","date":"2024-08-19","arxiv_id":"2408.10115","repositories_listed":1,"syntology":null},{"url":"/paper/glimpse-pragmatically-informative-multi","title":"GLIMPSE: Pragmatically Informative Multi-Document Summarization for Scholarly Reviews","date":"2024-06-11","arxiv_id":"2406.07359","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/the-power-of-summary-source-alignments","title":"The Power of Summary-Source Alignments","date":"2024-06-02","arxiv_id":"2406.00842","repositories_listed":1,"syntology":null},{"url":"/paper/text-generation-a-systematic-literature","title":"Text Generation: A Systematic Literature Review of Tasks, Evaluation, and Challenges","date":"2024-05-24","arxiv_id":"2405.15604","repositories_listed":1,"syntology":null},{"url":"/paper/which-information-matters-dissecting-human","title":"Which Information Matters? Dissecting Human-written Multi-document Summaries with Partial Information Decomposition","date":"2024-05-23","arxiv_id":"2405.14470","repositories_listed":1,"syntology":null},{"url":"/paper/disentangling-specificity-for-abstractive","title":"Disentangling Specificity for Abstractive Multi-document Summarization","date":"2024-05-12","arxiv_id":"2406.00005","repositories_listed":1,"syntology":null}],"syntology_records":7,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}