{"url":"/task/dense-video-captioning","name":"Dense Video Captioning","slug":"dense-video-captioning","description_markdown":"Most natural videos contain numerous events. For example, in a video of a “man playing a piano”, the video might also contain “another man dancing” or “a crowd clapping”. The task of dense video captioning involves both detecting and describing events in a video.","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":76,"papers_with_code":39,"benchmarks":4,"benchmark_tables_in_archive":4,"benchmark_tables_shown":4,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":9,"subtasks":1,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/dense-video-captioning-on-activitynet","slug":"dense-video-captioning-on-activitynet","dataset":"ActivityNet Captions","dataset_url":"/dataset/activitynet-captions","rows_in_archive":12,"metrics":["METEOR","BLEU-3","BLEU-4","CIDEr","SODA","DIV-1","DIV-2","RE-4","BLEU4","F1","Precision","Recall"],"first_row_in_archive_order":{"model":"Vid2Seq","paper_title":"Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning","paper_url":"/paper/vid2seq-large-scale-pretraining-of-a-visual","paper_date":"2023-02-27","arxiv_id":"2302.14115","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/vid2seq"},{"title":"antoyang/VidChapters","url":"https://github.com/antoyang/VidChapters"},{"title":"KastanDay/video-pretrained-transformer","url":"https://github.com/KastanDay/video-pretrained-transformer"}],"syntology":null}},{"leaderboard":"/sota/dense-video-captioning-on-youcook2","slug":"dense-video-captioning-on-youcook2","dataset":"YouCook2","dataset_url":"/dataset/youcook2","rows_in_archive":7,"metrics":["CIDEr","METEOR","SODA","BLEU4","ROUGE-L","F1","Precision","Recall"],"first_row_in_archive_order":{"model":"HiCM²","paper_title":"HiCM$^2$: Hierarchical Compact Memory Modeling for Dense Video Captioning","paper_url":"/paper/hicm-2-hierarchical-compact-memory-modeling","paper_date":"2024-12-19","arxiv_id":"2412.14585","code_links":[{"title":"ailab-kyunghee/HiCM2-DVC","url":"https://github.com/ailab-kyunghee/HiCM2-DVC"}],"syntology":null}},{"leaderboard":"/sota/dense-video-captioning-on-vitt","slug":"dense-video-captioning-on-vitt","dataset":"ViTT","dataset_url":"/dataset/vitt","rows_in_archive":4,"metrics":["SODA","CIDEr","METEOR"],"first_row_in_archive_order":{"model":"Vid2Seq (VidChapters-7M PT)","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/dense-video-captioning-on-vidchapters-7m","slug":"dense-video-captioning-on-vidchapters-7m","dataset":"VidChapters-7M","dataset_url":"/dataset/vidchapters-7m","rows_in_archive":1,"metrics":["CIDEr"],"first_row_in_archive_order":{"model":"Vid2Seq","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/activitynet-captions","name":"ActivityNet Captions","full_name":"","num_papers_in_archive":255},{"url":"/dataset/youcook2","name":"YouCook2","full_name":"","num_papers_in_archive":198},{"url":"/dataset/youcook","name":"YouCook","full_name":"","num_papers_in_archive":45},{"url":"/dataset/mtl-aqa","name":"MTL-AQA","full_name":"","num_papers_in_archive":33},{"url":"/dataset/vitt","name":"ViTT","full_name":"Video Timeline Tags","num_papers_in_archive":14},{"url":"/dataset/vidchapters-7m","name":"VidChapters-7M","full_name":"","num_papers_in_archive":5},{"url":"/dataset/longvale","name":"LongVALE","full_name":"","num_papers_in_archive":2},{"url":"/dataset/sieve-swap-howto100m-cooking","name":"Sieve & Swap - HowTo100M (Cooking)","full_name":"","num_papers_in_archive":1},{"url":"/dataset/vript","name":"Vript","full_name":"🎬 Vript: A Video Is Worth Thousands of Words","num_papers_in_archive":0}],"subtasks":[{"url":"/task/zero-shot-dense-video-captioning","name":"Zero-shot dense video captioning"}],"parent_tasks":[{"url":"/task/video-captioning","name":"Video Captioning"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":39,"tagged_in_all":76,"items":[{"url":"/paper/multi-modal-dense-video-captioning","title":"Multi-modal Dense Video Captioning","date":"2020-03-17","arxiv_id":"2003.07758","repositories_listed":4,"syntology":null},{"url":"/paper/vid2seq-large-scale-pretraining-of-a-visual","title":"Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning","date":"2023-02-27","arxiv_id":"2302.14115","repositories_listed":3,"syntology":null},{"url":"/paper/soccernet-2023-challenges-results","title":"SoccerNet 2023 Challenges Results","date":"2023-09-12","arxiv_id":"2309.06006","repositories_listed":2,"syntology":null},{"url":"/paper/soccernet-caption-dense-video-captioning-for","title":"SoccerNet-Caption: Dense Video Captioning for Soccer Broadcasts Commentaries","date":"2023-04-10","arxiv_id":"2304.04565","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/end-to-end-dense-video-captioning-with","title":"End-to-End Dense Video Captioning with Parallel Decoding","date":"2021-08-17","arxiv_id":"2108.07781","repositories_listed":2,"syntology":{"n":7,"n_ran":3,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/a-better-use-of-audio-visual-cues-dense-video","title":"A Better Use of Audio-Visual Cues: Dense Video Captioning with Bi-modal Transformer","date":"2020-05-17","arxiv_id":"2005.08271","repositories_listed":2,"syntology":{"n":7,"n_ran":0,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/vidchain-chain-of-tasks-with-metric-based","title":"VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning","date":"2025-01-12","arxiv_id":"2501.06761","repositories_listed":1,"syntology":null},{"url":"/paper/hicm-2-hierarchical-compact-memory-modeling","title":"HiCM$^2$: Hierarchical Compact Memory Modeling for Dense Video Captioning","date":"2024-12-19","arxiv_id":"2412.14585","repositories_listed":1,"syntology":null},{"url":"/paper/implicit-location-caption-alignment-via","title":"Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning","date":"2024-12-17","arxiv_id":"2412.12791","repositories_listed":1,"syntology":{"n":12,"n_ran":0,"n_unverified":12,"n_pointer_only":0}},{"url":"/paper/longvale-vision-audio-language-event","title":"LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos","date":"2024-11-29","arxiv_id":"2411.19772","repositories_listed":1,"syntology":{"n":12,"n_ran":2,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/videollm-knows-when-to-speak-enhancing-time","title":"VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format","date":"2024-11-27","arxiv_id":"2411.17991","repositories_listed":1,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/grounded-videollm-sharpening-fine-grained","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","date":"2024-10-04","arxiv_id":"2410.03290","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/soccernet-2024-challenges-results","title":"SoccerNet 2024 Challenges Results","date":"2024-09-16","arxiv_id":"2409.10587","repositories_listed":1,"syntology":null},{"url":"/paper/2408-02272","title":"COM Kitchens: An Unedited Overhead-view Video Dataset as a Vision-Language Benchmark","date":"2024-08-05","arxiv_id":"2408.02272","repositories_listed":1,"syntology":null},{"url":"/paper/live-video-captioning","title":"Live Video Captioning","date":"2024-06-20","arxiv_id":"2406.14206","repositories_listed":1,"syntology":null},{"url":"/paper/videogpt-integrating-image-and-video-encoders","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","date":"2024-06-13","arxiv_id":"2406.09418","repositories_listed":1,"syntology":{"n":8,"n_ran":6,"n_unverified":2,"n_pointer_only":8}},{"url":"/paper/vtg-llm-integrating-timestamp-knowledge-into","title":"VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding","date":"2024-05-22","arxiv_id":"2405.13382","repositories_listed":1,"syntology":{"n":17,"n_ran":13,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/trafficvlm-a-controllable-visual-language","title":"TrafficVLM: A Controllable Visual Language Model for Traffic Video Captioning","date":"2024-04-14","arxiv_id":"2404.09275","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/enhancing-traffic-safety-with-parallel-dense","title":"Enhancing Traffic Safety with Parallel Dense Video Captioning for End-to-End Event Analysis","date":"2024-04-12","arxiv_id":"2404.08229","repositories_listed":1,"syntology":null},{"url":"/paper/do-you-remember-dense-video-captioning-with","title":"Do You Remember? Dense Video Captioning with Cross-Modal Memory Retrieval","date":"2024-04-11","arxiv_id":"2404.07610","repositories_listed":1,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/streaming-dense-video-captioning","title":"Streaming Dense Video Captioning","date":"2024-04-01","arxiv_id":"2404.01297","repositories_listed":1,"syntology":null},{"url":"/paper/omnivid-a-generative-framework-for-universal","title":"OmniVid: A Generative Framework for Universal Video Understanding","date":"2024-03-26","arxiv_id":"2403.17935","repositories_listed":1,"syntology":{"n":11,"n_ran":3,"n_unverified":8,"n_pointer_only":11}},{"url":"/paper/vtimellm-empower-llm-to-grasp-video-moments","title":"VTimeLLM: Empower LLM to Grasp Video Moments","date":"2023-11-30","arxiv_id":"2311.18445","repositories_listed":1,"syntology":{"n":11,"n_ran":5,"n_unverified":6,"n_pointer_only":11}},{"url":"/paper/vidchapters-7m-video-chapters-at-scale","title":"VidChapters-7M: Video Chapters at Scale","date":"2023-09-25","arxiv_id":"2309.13952","repositories_listed":1,"syntology":{"n":9,"n_ran":0,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/visual-transformation-telling","title":"Visual Transformation Telling","date":"2023-05-03","arxiv_id":"2305.01928","repositories_listed":1,"syntology":null},{"url":"/paper/learning-grounded-vision-language","title":"Learning Grounded Vision-Language Representation for Versatile Understanding in Untrimmed Videos","date":"2023-03-11","arxiv_id":"2303.06378","repositories_listed":1,"syntology":{"n":12,"n_ran":1,"n_unverified":11,"n_pointer_only":0}},{"url":"/paper/semantic-metadata-extraction-from-dense-video","title":"Event and Entity Extraction from Generated Video Captions","date":"2022-11-05","arxiv_id":"2211.02982","repositories_listed":1,"syntology":null},{"url":"/paper/unifying-event-detection-and-captioning-as","title":"Unifying Event Detection and Captioning as Sequence Generation via Pre-Training","date":"2022-07-18","arxiv_id":"2207.08625","repositories_listed":1,"syntology":{"n":13,"n_ran":7,"n_unverified":6,"n_pointer_only":13}},{"url":"/paper/dense-video-captioning-using-unsupervised","title":"Dense Video Captioning Using Unsupervised Semantic Information","date":"2021-12-15","arxiv_id":"2112.08455","repositories_listed":1,"syntology":null},{"url":"/paper/global-object-proposals-for-improving-multi","title":"Global Object Proposals for Improving Multi-Sentence Video Descriptions","date":"2021-07-18","arxiv_id":null,"repositories_listed":1,"syntology":null}],"syntology_records":16,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}