{"url":"/dataset/summe","name":"SumMe","full_name":"SumMe","description_markdown":"The **SumMe** dataset is a video summarization dataset consisting of 25 videos, each annotated with at least 15 human summaries (390 in total).\r\n\r\nSource: [https://gyglim.github.io/me/vsum/index.html](https://gyglim.github.io/me/vsum/index.html)\r\nImage Source: [https://gyglim.github.io/me/vsum/index.html](https://gyglim.github.io/me/vsum/index.html)","description_withheld":null,"homepage":"https://gyglim.github.io/me/vsum/index.html","introduced_date":"2014-01-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/creating-summaries-from-user-videos","title":"Creating Summaries from User Videos","first_author":"Michael Gygli","url":null},"license":{"name":"Custom (research-only, non-commercial)","url":"https://gyglim.github.io/me/vsum/index.html#benchmark"},"modalities":[{"name":"Images","url":"/datasets/modality/images"},{"name":"Videos","url":"/datasets/modality/videos"},{"name":"Audio","url":"/datasets/modality/audio"}],"tasks":[{"name":"Video Summarization","url":"/task/video-summarization","datasets_with_task":"/datasets/task/video-summarization"},{"name":"Unsupervised Video Summarization","url":"/task/unsupervised-video-summarization","datasets_with_task":"/datasets/task/unsupervised-video-summarization"},{"name":"Supervised Video Summarization","url":"/task/supervised-video-summarization","datasets_with_task":"/datasets/task/supervised-video-summarization"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["SumMe"],"data_loaders":[{"repo":"https://github.com/KaiyangZhou/pytorch-vsumm-reinforce","url":"https://github.com/KaiyangZhou/pytorch-vsumm-reinforce","frameworks":["pytorch"]},{"repo":"https://github.com/e-apostolidis/CA-SUM","url":"https://github.com/e-apostolidis/CA-SUM/#data","frameworks":["pytorch"]}],"num_papers_in_archive":146,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/supervised-video-summarization-on-summe","task":"Supervised Video Summarization","dataset_variant":"SumMe","rows":21,"metrics":["F1-score (Canonical)","F1-score (Augmented)","Kendall's Tau","Spearman's Rho"],"first_row_in_archive_order":{"model":"PGL-SUM (maximum learning capacity)","paper":"/paper/combining-global-and-local-attention-with","metrics":{"F1-score (Canonical)":"57.1"},"code_links":[{"title":"e-apostolidis/PGL-SUM","url":"https://github.com/e-apostolidis/PGL-SUM"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/unsupervised-video-summarization-on-summe","task":"Unsupervised Video Summarization","dataset_variant":"SumMe","rows":10,"metrics":["F1-score","training time (s)","Parameters (M)"],"first_row_in_archive_order":{"model":"TAC-SUM","paper":"/paper/cluster-based-video-summarization-with","metrics":{"F1-score":"54.48"},"code_links":[{"title":"hcmus-thesis-gulu/tac-sum","url":"https://github.com/hcmus-thesis-gulu/tac-sum"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-summarization-on-summe","task":"Video Summarization","dataset_variant":"SumMe","rows":6,"metrics":["F1-score (Canonical)","F1-score (Augmented)","Kendall's Tau","Spearman's Rho"],"first_row_in_archive_order":{"model":"PGL-SUM","paper":"/paper/combining-global-and-local-attention-with","metrics":{"F1-score (Canonical)":"55.6"},"code_links":[{"title":"e-apostolidis/PGL-SUM","url":"https://github.com/e-apostolidis/PGL-SUM"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/integrate-the-temporal-scheme-for","title":"Integrate the temporal scheme for unsupervised video summarization via attention mechanism","date":"2025-02-26","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/csta-cnn-based-spatiotemporal-attention-for","title":"CSTA: CNN-based Spatiotemporal Attention for Video Summarization","date":"2024-05-20","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":7,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/cluster-based-video-summarization-with","title":"Cluster-based Video Summarization with Temporal Context Awareness","date":"2024-04-06","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/adopting-self-supervised-learning-into-1","title":"Adopting Self-Supervised Learning into Unsupervised Video Summarization through Restorative Score.","date":"2023-09-11","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/align-and-attend-multimodal-summarization","title":"Align and Attend: Multimodal Summarization with Dual Contrastive Losses","date":"2023-03-13","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/summarizing-videos-using-concentrated","title":"Summarizing Videos using Concentrated Attention and Considering the Uniqueness and Diversity of the Video Frames","date":"2022-06-29","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/relational-reasoning-over-spatial-temporal","title":"Relational Reasoning Over Spatial-Temporal Graphs for Video Summarization","date":"2022-04-06","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/video-summarization-based-on-video-text","title":"Progressive Video Summarization via Multimodal Self-supervised Learning","date":"2022-01-07","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/joint-video-summarization-and-moment","title":"Joint Video Summarization and Moment Localization by Cross-Task Sample Transfer","date":"2022-01-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/video-joint-modelling-based-on-hierarchical","title":"Video Joint Modelling Based on Hierarchical Transformer for Co-summarization","date":"2021-12-27","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/combining-global-and-local-attention-with","title":"Combining Global and Local Attention with Positional Encoding for Video Summarization","date":"2021-12-01","rows_on_this_dataset":3,"code_links":1,"syntology":null},{"paper":"/paper/hierarchical-multimodal-transformer-to","title":"Hierarchical Multimodal Transformer to Summarize Videos","date":"2021-09-22","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/clip-it-language-guided-video-summarization","title":"CLIP-It! Language-Guided Video Summarization","date":"2021-07-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/supervised-video-summarization-via-multiple","title":"Supervised Video Summarization via Multiple Feature Sets with Parallel Attention","date":"2021-04-23","rows_on_this_dataset":6,"code_links":3,"syntology":null},{"paper":"/paper/dsnet-a-flexible-detect-to-summarize-network","title":"DSNet: A Flexible Detect-to-Summarize Network for Video Summarization","date":"2020-12-01","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/ac-sum-gan-connecting-actor-critic-and","title":"AC-SUM-GAN: Connecting Actor-Critic and Generative Adversarial Networks for Unsupervised Video Summarization","date":"2020-11-16","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/query-twice-dual-mixture-attention-meta","title":"Query Twice: Dual Mixture Attention Meta Learning for Video Summarization","date":"2020-08-19","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/unsupervised-video-summarization-via","title":"Unsupervised Video Summarization via Attention-Driven Adversarial Learning","date":"2019-12-24","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/a-stepwise-label-based-approach-for-improving","title":"A Stepwise, Label-based Approach for Improving the Adversarial Training in Unsupervised Video Summarization","date":"2019-10-21","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/cycle-sum-cycle-consistent-adversarial-lstm","title":"Cycle-SUM: Cycle-consistent Adversarial LSTM Networks for Unsupervised Video Summarization","date":"2019-04-17","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/summarizing-videos-with-attention","title":"Summarizing Videos with Attention","date":"2018-12-05","rows_on_this_dataset":1,"code_links":5,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":15,"samples_ran":1,"samples_unverified":14,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/discriminative-feature-learning-for","title":"Discriminative Feature Learning for Unsupervised Video Summarization","date":"2018-11-24","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/deep-reinforcement-learning-for-unsupervised","title":"Deep Reinforcement Learning for Unsupervised Video Summarization with Diversity-Representativeness Reward","date":"2017-12-29","rows_on_this_dataset":2,"code_links":6,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/video-summarization-with-attention-based","title":"Video Summarization with Attention-Based Encoder-Decoder Networks","date":"2017-08-31","rows_on_this_dataset":1,"code_links":0,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":3,"samples_harvested":24,"samples_ran":9,"samples_unverified":15,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}