{"url":"/dataset/facetsum","name":"FacetSum","full_name":null,"description_markdown":"**FacetSum** is a faceted summarization dataset for scientific documents. FacetSum has been built on Emerald journal articles, covering a diverse range of domains. Different from traditional document-summary pairs, FacetSum provides multiple summaries, each targeted at specific sections of a long document, including the purpose, method, findings, and value.","description_withheld":null,"homepage":"https://github.com/hfthair/emerald_crawler","introduced_date":"2021-05-31","introduced_date_note":null,"introduced_by":{"paper":"/paper/bringing-structure-into-summaries-a-faceted","title":"Bringing Structure into Summaries: a Faceted Summarization Dataset for Long Scientific Documents","first_author":"Rui Meng","url":null},"license":{"name":"Custom (non-commercial)","url":null},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Document Summarization","url":"/task/document-summarization","datasets_with_task":"/datasets/task/document-summarization"},{"name":"Scientific Document Summarization","url":"/task/scientific-article-summarization","datasets_with_task":"/datasets/task/scientific-article-summarization"},{"name":"Unsupervised Extractive Summarization","url":"/task/unsupervised-extractive-summarization","datasets_with_task":"/datasets/task/unsupervised-extractive-summarization"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["FacetSum"],"data_loaders":[],"num_papers_in_archive":4,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/unsupervised-extractive-summarization-on-2","task":"Unsupervised Extractive Summarization","dataset_variant":"FacetSum","rows":5,"metrics":["ROUGE-L"],"first_row_in_archive_order":{"model":"HipoRank","paper":"/paper/bringing-structure-into-summaries-a-faceted","metrics":{"ROUGE-L":"42.89"},"code_links":[{"title":"hfthair/emerald_crawler","url":"https://github.com/hfthair/emerald_crawler"},{"title":"bnitsan/papertweet","url":"https://github.com/bnitsan/papertweet"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/bringing-structure-into-summaries-a-faceted","title":"Bringing Structure into Summaries: a Faceted Summarization Dataset for Long Scientific Documents","date":"2021-05-31","rows_on_this_dataset":5,"code_links":2,"syntology":null}],"syntology_totals":{"read_at":"2026-09-25T09:33:49+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}