{"url":"/dataset/tvsum","name":"TvSum","full_name":"TVSum: Summarizing Web Videos Using Titles","description_markdown":"Introduced by Song et al. in TVSum: Summarizing web videos using titles.\r\n\r\nThe TVSum dataset comprises 50 videos, with durations ranging from 1 to 11 minutes. These videos belong to 10 different categories associated with the TRECVid MED task, with 5 videos in each category, and were collected from YouTube. The video categories include various activities like changing a vehicle tire, making a sandwich, and flash mob gatherings. For annotation, each video was reviewed and rated by 20 users, who assigned frame-level importance scores on a scale from 1 (not important) to 5 (very important).","description_withheld":null,"homepage":"https://github.com/yalesong/tvsum","introduced_date":"2015-01-01","introduced_date_note":null,"introduced_by":null,"license":{"name":"Creative Commons CC-BY (v3.0) license","url":"https://support.google.com/youtube/answer/2797468?hl=en"},"modalities":[],"tasks":[{"name":"Video Summarization","url":"/task/video-summarization","datasets_with_task":"/datasets/task/video-summarization"},{"name":"Highlight Detection","url":"/task/highlight-detection","datasets_with_task":"/datasets/task/highlight-detection"},{"name":"Unsupervised Video Summarization","url":"/task/unsupervised-video-summarization","datasets_with_task":"/datasets/task/unsupervised-video-summarization"},{"name":"Supervised Video Summarization","url":"/task/supervised-video-summarization","datasets_with_task":"/datasets/task/supervised-video-summarization"}],"languages":[],"variants":["TvSum"],"data_loaders":[],"num_papers_in_archive":28,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/supervised-video-summarization-on-tvsum","task":"Supervised Video Summarization","dataset_variant":"TvSum","rows":21,"metrics":["F1-score (Canonical)","F1-score (Augmented)","Kendall's Tau","Spearman's Rho"],"first_row_in_archive_order":{"model":"MAVS [DBLP:conf/mm/FengLKZ18]","paper":"/paper/supervised-video-summarization-via-multiple","metrics":{"F1-score (Canonical)":"67.5"},"code_links":[{"title":"thswodnjs3/CSTA","url":"https://github.com/thswodnjs3/CSTA"},{"title":"TIBHannover/MSVA","url":"https://github.com/TIBHannover/MSVA"},{"title":"StevRamos/video_summarization","url":"https://github.com/StevRamos/video_summarization"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/unsupervised-video-summarization-on-tvsum","task":"Unsupervised Video Summarization","dataset_variant":"TvSum","rows":8,"metrics":["F1-score","Kendall's Tau","Spearman's Rho","training time (s)","Parameters (M)"],"first_row_in_archive_order":{"model":"SegSum","paper":"/paper/integrate-the-temporal-scheme-for","metrics":{"F1-score":"62","Parameters (M)":"5.25"},"code_links":[{"title":"bavo96/SegSum","url":"https://github.com/bavo96/SegSum"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/highlight-detection-on-tvsum","task":"Highlight Detection","dataset_variant":"TvSum","rows":7,"metrics":["mAP"],"first_row_in_archive_order":{"model":"FlashVTG","paper":"/paper/flashvtg-feature-layering-and-adaptive-score","metrics":{"mAP":"88"},"code_links":[{"title":"zhuo-cao/flashvtg","url":"https://github.com/zhuo-cao/flashvtg"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-summarization-on-tvsum","task":"Video Summarization","dataset_variant":"TvSum","rows":6,"metrics":["F1-score (Canonical)","F1-score (Augmented)","Kendall's Tau","Spearman's Rho"],"first_row_in_archive_order":{"model":"RR-STG","paper":"/paper/relational-reasoning-over-spatial-temporal","metrics":{"F1-score (Augmented)":"63.6","F1-score (Canonical)":"63.0"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/integrate-the-temporal-scheme-for","title":"Integrate the temporal scheme for unsupervised video summarization via attention mechanism","date":"2025-02-26","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/flashvtg-feature-layering-and-adaptive-score","title":"FlashVTG: Feature Layering and Adaptive Score Handling Network for Video Temporal Grounding","date":"2024-12-18","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":2,"samples_unverified":11,"pointer_only_for_licence":13,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/saliency-guided-detr-for-moment-retrieval-and","title":"Saliency-Guided DETR for Moment Retrieval and Highlight Detection","date":"2024-10-02","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/csta-cnn-based-spatiotemporal-attention-for","title":"CSTA: CNN-based Spatiotemporal Attention for Video Summarization","date":"2024-05-20","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":7,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/bridging-the-gap-a-unified-video","title":"Bridging the Gap: A Unified Video Comprehension Framework for Moment Retrieval and Highlight Detection","date":"2023-11-28","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":9,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/correlation-guided-query-dependency","title":"Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding","date":"2023-11-15","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":11,"samples_ran":2,"samples_unverified":9,"pointer_only_for_licence":11,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/adopting-self-supervised-learning-into-1","title":"Adopting Self-Supervised Learning into Unsupervised Video Summarization through Restorative Score.","date":"2023-09-11","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/query-dependent-video-representation-for","title":"Query-Dependent Video Representation for Moment Retrieval and Highlight Detection","date":"2023-03-24","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/align-and-attend-multimodal-summarization","title":"Align and Attend: Multimodal Summarization with Dual Contrastive Losses","date":"2023-03-13","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/relational-reasoning-over-spatial-temporal","title":"Relational Reasoning Over Spatial-Temporal Graphs for Video Summarization","date":"2022-04-06","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/umt-unified-multi-modal-transformers-for","title":"UMT: Unified Multi-modal Transformers for Joint Video Moment Retrieval and Highlight Detection","date":"2022-03-23","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/video-summarization-based-on-video-text","title":"Progressive Video Summarization via Multimodal Self-supervised Learning","date":"2022-01-07","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/joint-video-summarization-and-moment","title":"Joint Video Summarization and Moment Localization by Cross-Task Sample Transfer","date":"2022-01-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/video-joint-modelling-based-on-hierarchical","title":"Video Joint Modelling Based on Hierarchical Transformer for Co-summarization","date":"2021-12-27","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/combining-global-and-local-attention-with","title":"Combining Global and Local Attention with Positional Encoding for Video Summarization","date":"2021-12-01","rows_on_this_dataset":3,"code_links":1,"syntology":null},{"paper":"/paper/hierarchical-multimodal-transformer-to","title":"Hierarchical Multimodal Transformer to Summarize Videos","date":"2021-09-22","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/clip-it-language-guided-video-summarization","title":"CLIP-It! Language-Guided Video Summarization","date":"2021-07-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/supervised-video-summarization-via-multiple","title":"Supervised Video Summarization via Multiple Feature Sets with Parallel Attention","date":"2021-04-23","rows_on_this_dataset":6,"code_links":3,"syntology":null},{"paper":"/paper/dsnet-a-flexible-detect-to-summarize-network","title":"DSNet: A Flexible Detect-to-Summarize Network for Video Summarization","date":"2020-12-01","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/ac-sum-gan-connecting-actor-critic-and","title":"AC-SUM-GAN: Connecting Actor-Critic and Generative Adversarial Networks for Unsupervised Video Summarization","date":"2020-11-16","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/query-twice-dual-mixture-attention-meta","title":"Query Twice: Dual Mixture Attention Meta Learning for Video Summarization","date":"2020-08-19","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/unsupervised-video-summarization-via","title":"Unsupervised Video Summarization via Attention-Driven Adversarial Learning","date":"2019-12-24","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/a-stepwise-label-based-approach-for-improving","title":"A Stepwise, Label-based Approach for Improving the Adversarial Training in Unsupervised Video Summarization","date":"2019-10-21","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/cycle-sum-cycle-consistent-adversarial-lstm","title":"Cycle-SUM: Cycle-consistent Adversarial LSTM Networks for Unsupervised Video Summarization","date":"2019-04-17","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/summarizing-videos-with-attention","title":"Summarizing Videos with Attention","date":"2018-12-05","rows_on_this_dataset":1,"code_links":5,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":15,"samples_ran":1,"samples_unverified":14,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/discriminative-feature-learning-for","title":"Discriminative Feature Learning for Unsupervised Video Summarization","date":"2018-11-24","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/deep-reinforcement-learning-for-unsupervised","title":"Deep Reinforcement Learning for Unsupervised Video Summarization with Diversity-Representativeness Reward","date":"2017-12-29","rows_on_this_dataset":2,"code_links":6,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/video-summarization-with-attention-based","title":"Video Summarization with Attention-Based Encoder-Decoder Networks","date":"2017-08-31","rows_on_this_dataset":1,"code_links":0,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":7,"samples_harvested":61,"samples_ran":23,"samples_unverified":38,"pointer_only_for_licence":25,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}