{"url":"/dataset/duc-2004","name":"DUC 2004","full_name":"DUC 2004","description_markdown":"The DUC2004 dataset is a dataset for document summarization. Is designed and used for testing only. It consists of 500 news articles, each paired with four human written summaries. Specifically it consists of 50 clusters of Text REtrieval Conference (TREC) documents, from the following collections: AP newswire, 1998-2000; New York Times newswire, 1998-2000; Xinhua News Agency (English version), 1996-2000. Each cluster contained on average 10 documents.\r\n\r\nSource: [Discrete Optimization for Unsupervised Sentence Summarization with Word-Level Extraction](https://arxiv.org/abs/2005.01791)\r\nImage Source: [https://duc.nist.gov/duc2004/](https://duc.nist.gov/duc2004/)","description_withheld":null,"homepage":"https://duc.nist.gov/duc2004/","introduced_date":null,"introduced_date_note":null,"introduced_by":null,"license":null,"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Text Summarization","url":"/task/text-summarization","datasets_with_task":"/datasets/task/text-summarization"},{"name":"Extractive Text Summarization","url":"/task/extractive-document-summarization","datasets_with_task":"/datasets/task/extractive-document-summarization"},{"name":"Multi-Document Summarization","url":"/task/multi-document-summarization","datasets_with_task":"/datasets/task/multi-document-summarization"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["DUC 2004 Task 1","DUC 2004"],"data_loaders":[],"num_papers_in_archive":15,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/text-summarization-on-duc-2004-task-1","task":"Text Summarization","dataset_variant":"DUC 2004 Task 1","rows":13,"metrics":["ROUGE-1","ROUGE-2","ROUGE-L"],"first_row_in_archive_order":{"model":"Transformer+WDrop","paper":"/paper/rethinking-perturbations-in-encoder-decoders","metrics":{"ROUGE-1":"33.06","ROUGE-2":"11.45","ROUGE-L":"28.51"},"code_links":[{"title":"takase/rethink_perturbations","url":"https://github.com/takase/rethink_perturbations"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/extractive-text-summarization-on-duc-2004","task":"Extractive Text Summarization","dataset_variant":"DUC 2004 Task 1","rows":1,"metrics":["ROUGE-1","ROUGE-2","ROUGE-L"],"first_row_in_archive_order":{"model":"Abs","paper":"/paper/a-neural-attention-model-for-abstractive","metrics":{"ROUGE-1":"26.55","ROUGE-2":"7.06","ROUGE-L":"22.05"},"code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models/tree/master/research/textsum"},{"title":"toru34/rush_emnlp_2015","url":"https://github.com/toru34/rush_emnlp_2015"},{"title":"Ganeshpadmanaban/Neural-Attention-Model-Abstractive-Summarization","url":"https://github.com/Ganeshpadmanaban/Neural-Attention-Model-Abstractive-Summarization"},{"title":"Ganeshpadmanaban/Neural-Attention-Model","url":"https://github.com/Ganeshpadmanaban/Neural-Attention-Model"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/extractive-text-summarization-on-duc-2004-1","task":"Extractive Text Summarization","dataset_variant":"DUC 2004","rows":1,"metrics":["Test ROGUE-1","Test ROGUE-2"],"first_row_in_archive_order":{"model":"Pre-training-meets-Clustering-A-Hybrid-Extractive-Multi-Document-Summarization-Model","paper":"/paper/pre-training-meets-clustering-a-hybrid","metrics":{"Test ROGUE-1":"34.013","Test ROGUE-2":"8.266"},"code_links":[{"title":"Akankshakarotia/Pre-training-meets-Clustering-A-Hybrid-Extractive-Multi-Document-Summarization-Model","url":"https://github.com/Akankshakarotia/Pre-training-meets-Clustering-A-Hybrid-Extractive-Multi-Document-Summarization-Model"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/multi-document-summarization-on-duc-2004","task":"Multi-Document Summarization","dataset_variant":"DUC 2004","rows":1,"metrics":["ROUGE-1"],"first_row_in_archive_order":{"model":"GCN: Personalized Discourse Graph","paper":"/paper/graph-based-neural-multi-document","metrics":{"ROUGE-1":"38.23"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/pre-training-meets-clustering-a-hybrid","title":"Pre-training Meets Clustering: A Hybrid Extractive Multi-document Summarization Model","date":"2023-05-25","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/rethinking-perturbations-in-encoder-decoders","title":"Rethinking Perturbations in Encoder-Decoders for Fast Training","date":"2021-04-05","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/all-word-embeddings-from-one-embedding","title":"All Word Embeddings from One Embedding","date":"2020-04-25","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/sample-efficient-text-summarization-using-a","title":"Sample Efficient Text Summarization Using a Single Pre-Trained Transformer","date":"2019-05-21","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/positional-encoding-to-control-output","title":"Positional Encoding to Control Output Sequence Length","date":"2019-04-16","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":0,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/ensure-the-correctness-of-the-summary","title":"Ensure the Correctness of the Summary: Incorporate Entailment Knowledge into Abstractive Sentence Summarization","date":"2018-08-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/a-reinforced-topic-aware-convolutional","title":"A Reinforced Topic-Aware Convolutional Sequence-to-Sequence Model for Abstractive Text Summarization","date":"2018-05-09","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/deep-recurrent-generative-decoder-for","title":"Deep Recurrent Generative Decoder for Abstractive Text Summarization","date":"2017-08-02","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/graph-based-neural-multi-document","title":"Graph-based Neural Multi-Document Summarization","date":"2017-06-20","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/selective-encoding-for-abstractive-sentence","title":"Selective Encoding for Abstractive Sentence Summarization","date":"2017-04-24","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/cutting-off-redundant-repeating-generations","title":"Cutting-off Redundant Repeating Generations for Neural Abstractive Summarization","date":"2016-12-31","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/abstractive-sentence-summarization-with","title":"Abstractive Sentence Summarization with Attentive Recurrent Neural Networks","date":"2016-06-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/abstractive-text-summarization-using-sequence","title":"Abstractive Text Summarization Using Sequence-to-Sequence RNNs and Beyond","date":"2016-02-19","rows_on_this_dataset":1,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":5,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/a-neural-attention-model-for-abstractive","title":"A Neural Attention Model for Abstractive Sentence Summarization","date":"2015-09-02","rows_on_this_dataset":3,"code_links":4,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":4,"samples_harvested":12,"samples_ran":7,"samples_unverified":5,"pointer_only_for_licence":1,"papers_with_no_sample_that_ran":1,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}