{"url":"/task/video-question-answering","name":"Video Question Answering","slug":"video-question-answering","description_markdown":null,"categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Reasoning","url":"/area/reasoning"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":460,"papers_with_code":250,"benchmarks":28,"benchmark_tables_in_archive":28,"benchmark_tables_shown":28,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":43,"subtasks":2,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/video-question-answering-on-next-qa","slug":"video-question-answering-on-next-qa","dataset":"NExT-QA","dataset_url":"/dataset/next-qa","rows_in_archive":47,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"LinVT-Qwen2-VL\n(7B)","paper_title":"LinVT: Empower Your Image-level Large Language Model to Understand Videos","paper_url":"/paper/linvt-empower-your-image-level-large-language","paper_date":"2024-12-06","arxiv_id":"2412.05185","code_links":[{"title":"gls0425/linvt","url":"https://github.com/gls0425/linvt"}],"syntology":{"n":12,"n_ran":4,"n_unverified":8,"n_pointer_only":12}}},{"leaderboard":"/sota/video-question-answering-on-activitynet-qa","slug":"video-question-answering-on-activitynet-qa","dataset":"ActivityNet-QA","dataset_url":"/dataset/activitynet-qa","rows_in_archive":36,"metrics":["Accuracy","Confidence score"],"first_row_in_archive_order":{"model":"GPT-2 + CLIP-14 + CLIP-multilingual (Zero-Shot)","paper_title":"Composing Ensembles of Pre-trained Models via Iterative Consensus","paper_url":"/paper/composing-ensembles-of-pre-trained-models-via","paper_date":"2022-10-20","arxiv_id":"2210.11522","code_links":[],"syntology":null}},{"leaderboard":"/sota/video-question-answering-on-tvbench","slug":"video-question-answering-on-tvbench","dataset":"TVBench","dataset_url":"/dataset/tvbench","rows_in_archive":28,"metrics":["Average Accuracy"],"first_row_in_archive_order":{"model":"Seed1.5-VL thinking","paper_title":"Seed1.5-VL Technical Report","paper_url":"/paper/seed1-5-vl-technical-report","paper_date":"2025-05-11","arxiv_id":"2505.07062","code_links":[],"syntology":null}},{"leaderboard":"/sota/video-question-answering-on-mvbench","slug":"video-question-answering-on-mvbench","dataset":"MVBench","dataset_url":"/dataset/mvbench","rows_in_archive":22,"metrics":["Avg."],"first_row_in_archive_order":{"model":"LinVT-Qwen2-VL\n(7B)","paper_title":"LinVT: Empower Your Image-level Large Language Model to Understand Videos","paper_url":"/paper/linvt-empower-your-image-level-large-language","paper_date":"2024-12-06","arxiv_id":"2412.05185","code_links":[{"title":"gls0425/linvt","url":"https://github.com/gls0425/linvt"}],"syntology":{"n":12,"n_ran":4,"n_unverified":8,"n_pointer_only":12}}},{"leaderboard":"/sota/video-question-answering-on-situated","slug":"video-question-answering-on-situated","dataset":"STAR Benchmark","dataset_url":"/dataset/situated-reasoning-star","rows_in_archive":17,"metrics":["Average Accuracy"],"first_row_in_archive_order":{"model":"VLAP (4 frames)","paper_title":"ViLA: Efficient Video-Language Alignment for Video Question Answering","paper_url":"/paper/vlap-efficient-video-language-alignment-via","paper_date":"2023-12-13","arxiv_id":"2312.08367","code_links":[{"title":"xijun-cs/vila","url":"https://github.com/xijun-cs/vila"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/video-question-answering-on-ovbench","slug":"video-question-answering-on-ovbench","dataset":"OVBench","dataset_url":"/dataset/ovbench","rows_in_archive":16,"metrics":["AVG"],"first_row_in_archive_order":{"model":"Seed1.5-VL","paper_title":"Seed1.5-VL Technical Report","paper_url":"/paper/seed1-5-vl-technical-report","paper_date":"2025-05-11","arxiv_id":"2505.07062","code_links":[],"syntology":null}},{"leaderboard":"/sota/video-question-answering-on-msrvtt-qa","slug":"video-question-answering-on-msrvtt-qa","dataset":"MSRVTT-QA","dataset_url":"/dataset/msrvtt-qa","rows_in_archive":14,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Mirasol3B","paper_title":"Mirasol3B: A Multimodal Autoregressive model for time-aligned and contextual modalities","paper_url":"/paper/mirasol3b-a-multimodal-autoregressive-model","paper_date":"2023-11-09","arxiv_id":"2311.05698","code_links":[],"syntology":null}},{"leaderboard":"/sota/video-question-answering-on-agqa-2-0-balanced","slug":"video-question-answering-on-agqa-2-0-balanced","dataset":"AGQA 2.0 balanced","dataset_url":null,"rows_in_archive":8,"metrics":["Average Accuracy"],"first_row_in_archive_order":{"model":"GF (sup) - Faster RCNN","paper_title":"Glance and Focus: Memory Prompting for Multi-Event Video Question Answering","paper_url":"/paper/glance-and-focus-memory-prompting-for-multi-1","paper_date":"2024-01-03","arxiv_id":"2401.01529","code_links":[{"title":"byz0e/glance-focus","url":"https://github.com/byz0e/glance-focus"}],"syntology":{"n":18,"n_ran":9,"n_unverified":9,"n_pointer_only":0}}},{"leaderboard":"/sota/video-question-answering-on-how2qa","slug":"video-question-answering-on-how2qa","dataset":"How2QA","dataset_url":"/dataset/how2qa","rows_in_archive":8,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Text + Text (no Multimodal Pretext Training)","paper_title":"Towards Fast Adaptation of Pretrained Contrastive Models for Multi-channel Video-Language Retrieval","paper_url":"/paper/towards-fast-adaptation-of-pretrained","paper_date":"2022-06-05","arxiv_id":"2206.02082","code_links":[{"title":"xudonglinthu/upgradable-multimodal-intelligence","url":"https://github.com/xudonglinthu/upgradable-multimodal-intelligence"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/video-question-answering-on-ivqa","slug":"video-question-answering-on-ivqa","dataset":"iVQA","dataset_url":"/dataset/ivqa","rows_in_archive":7,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Text + Text (no Multimodal Pretext Training)","paper_title":"Towards Fast Adaptation of Pretrained Contrastive Models for Multi-channel Video-Language Retrieval","paper_url":"/paper/towards-fast-adaptation-of-pretrained","paper_date":"2022-06-05","arxiv_id":"2206.02082","code_links":[{"title":"xudonglinthu/upgradable-multimodal-intelligence","url":"https://github.com/xudonglinthu/upgradable-multimodal-intelligence"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/video-question-answering-on-msrvtt-mc","slug":"video-question-answering-on-msrvtt-mc","dataset":"MSRVTT-MC","dataset_url":"/dataset/msrvtt-mc","rows_in_archive":7,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"VIOLETv2","paper_title":"An Empirical Study of End-to-End Video-Language Transformers with Masked Visual Modeling","paper_url":"/paper/an-empirical-study-of-end-to-end-video","paper_date":"2022-09-04","arxiv_id":"2209.01540","code_links":[{"title":"tsujuifu/pytorch_empirical-mvm","url":"https://github.com/tsujuifu/pytorch_empirical-mvm"}],"syntology":null}},{"leaderboard":"/sota/video-question-answering-on-intentqa","slug":"video-question-answering-on-intentqa","dataset":"IntentQA","dataset_url":"/dataset/intentqa","rows_in_archive":6,"metrics":["Accuarcy","CW","CH","TP&TN"],"first_row_in_archive_order":{"model":"VideoChat2_HD_mistral","paper_title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","paper_url":"/paper/mvbench-a-comprehensive-multi-modal-video","paper_date":"2023-11-28","arxiv_id":"2311.17005","code_links":[{"title":"opengvlab/ask-anything","url":"https://github.com/opengvlab/ask-anything"},{"title":"magic-research/PLLaVA","url":"https://github.com/magic-research/PLLaVA"},{"title":"bytedance/tarsier","url":"https://github.com/bytedance/tarsier"}],"syntology":{"n":10,"n_ran":7,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/video-question-answering-on-perception-test","slug":"video-question-answering-on-perception-test","dataset":"Perception Test","dataset_url":"/dataset/perception-test","rows_in_archive":6,"metrics":["Accuracy (Top-1)"],"first_row_in_archive_order":{"model":"Oyrx (34B)","paper_title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","paper_url":"/paper/oryx-mllm-on-demand-spatial-temporal","paper_date":"2024-09-19","arxiv_id":"2409.12961","code_links":[{"title":"oryx-mllm/oryx","url":"https://github.com/oryx-mllm/oryx"}],"syntology":{"n":6,"n_ran":3,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/video-question-answering-on-sutd-trafficqa","slug":"video-question-answering-on-sutd-trafficqa","dataset":"SUTD-TrafficQA","dataset_url":"/dataset/trafficqa","rows_in_archive":6,"metrics":["1/4","1/2"],"first_row_in_archive_order":{"model":"CFMMC-Align","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/video-question-answering-on-tvqa","slug":"video-question-answering-on-tvqa","dataset":"TVQA","dataset_url":"/dataset/tvqa","rows_in_archive":6,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"LLaMA-VQA","paper_title":"Large Language Models are Temporal and Causal Reasoners for Video Question Answering","paper_url":"/paper/large-language-models-are-temporal-and-causal","paper_date":"2023-10-24","arxiv_id":"2310.15747","code_links":[{"title":"mlvlab/Flipped-VQA","url":"https://github.com/mlvlab/Flipped-VQA"}],"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}}},{"leaderboard":"/sota/video-question-answering-on-wildqa","slug":"video-question-answering-on-wildqa","dataset":"WildQA","dataset_url":"/dataset/wildqa","rows_in_archive":5,"metrics":["ROUGE-1","ROUGE-2","ROUGE-L"],"first_row_in_archive_order":{"model":"Multi (text + video, IO)","paper_title":"WildQA: In-the-Wild Video Question Answering","paper_url":"/paper/wildqa-in-the-wild-video-question-answering","paper_date":"2022-09-14","arxiv_id":"2209.06650","code_links":[],"syntology":null}},{"leaderboard":"/sota/video-question-answering-on-lsmdc-mc","slug":"video-question-answering-on-lsmdc-mc","dataset":"LSMDC-MC","dataset_url":null,"rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"VIOLETv2","paper_title":"An Empirical Study of End-to-End Video-Language Transformers with Masked Visual Modeling","paper_url":"/paper/an-empirical-study-of-end-to-end-video","paper_date":"2022-09-04","arxiv_id":"2209.01540","code_links":[{"title":"tsujuifu/pytorch_empirical-mvm","url":"https://github.com/tsujuifu/pytorch_empirical-mvm"}],"syntology":null}},{"leaderboard":"/sota/video-question-answering-on-next-qa-efficient","slug":"video-question-answering-on-next-qa-efficient","dataset":"NExT-QA (Efficient)","dataset_url":null,"rows_in_archive":2,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"ViLA (3B, 4 frames)","paper_title":"ViLA: Efficient Video-Language Alignment for Video Question Answering","paper_url":"/paper/vlap-efficient-video-language-alignment-via","paper_date":"2023-12-13","arxiv_id":"2312.08367","code_links":[{"title":"xijun-cs/vila","url":"https://github.com/xijun-cs/vila"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/video-question-answering-on-roadtextvqa","slug":"video-question-answering-on-roadtextvqa","dataset":"RoadTextVQA","dataset_url":"/dataset/roadtextvqa","rows_in_archive":2,"metrics":["\t ACCURACY"],"first_row_in_archive_order":{"model":"GIT","paper_title":"Reading Between the Lanes: Text VideoQA on the Road","paper_url":"/paper/reading-between-the-lanes-text-videoqa-on-the","paper_date":"2023-07-08","arxiv_id":"2307.03948","code_links":[{"title":"georg3tom/RoadTextVQA","url":"https://github.com/georg3tom/RoadTextVQA"}],"syntology":null}},{"leaderboard":"/sota/video-question-answering-on-dramaqa","slug":"video-question-answering-on-dramaqa","dataset":"DramaQA","dataset_url":"/dataset/dramaqa","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"LLaMA-VQA","paper_title":"Large Language Models are Temporal and Causal Reasoners for Video Question Answering","paper_url":"/paper/large-language-models-are-temporal-and-causal","paper_date":"2023-10-24","arxiv_id":"2310.15747","code_links":[{"title":"mlvlab/Flipped-VQA","url":"https://github.com/mlvlab/Flipped-VQA"}],"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}}},{"leaderboard":"/sota/video-question-answering-on-howto100m-qa","slug":"video-question-answering-on-howto100m-qa","dataset":"Howto100M-QA","dataset_url":"/dataset/howto100m","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"TimeSformer","paper_title":"Is Space-Time Attention All You Need for Video Understanding?","paper_url":"/paper/is-space-time-attention-all-you-need-for","paper_date":"2021-02-09","arxiv_id":"2102.05095","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee"},{"title":"facebookresearch/TimeSformer","url":"https://github.com/facebookresearch/TimeSformer"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/zh-CN/model_zoo/recognition/timesformer.md"},{"title":"The-AI-Summer/self-attention-cv","url":"https://github.com/The-AI-Summer/self-attention-cv"},{"title":"lucidrains/TimeSformer-pytorch","url":"https://github.com/lucidrains/TimeSformer-pytorch"},{"title":"mx-mark/videotransformer-pytorch","url":"https://github.com/mx-mark/videotransformer-pytorch"},{"title":"jerrywn121/TianChi_AIEarth","url":"https://github.com/jerrywn121/TianChi_AIEarth"},{"title":"davide-coccomini/TimeSformer-Video-Classification","url":"https://github.com/davide-coccomini/TimeSformer-Video-Classification"},{"title":"yiyixuxu/TimeSformer-rolled-attention","url":"https://github.com/yiyixuxu/TimeSformer-rolled-attention"},{"title":"m-bain/video-transformers","url":"https://github.com/m-bain/video-transformers"},{"title":"md-mohaiminul/objectstatechange","url":"https://github.com/md-mohaiminul/objectstatechange"},{"title":"MindCode-4/code-5","url":"https://github.com/MindCode-4/code-5/tree/main/timesformer"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/1/timesformer"},{"title":"pwc-1/Paper-10","url":"https://github.com/pwc-1/Paper-10/tree/main/timesformer"},{"title":"halixness/generative_timesformer_pytorch","url":"https://github.com/halixness/generative_timesformer_pytorch"}],"syntology":{"n":43,"n_ran":35,"n_unverified":8,"n_pointer_only":14}}},{"leaderboard":"/sota/video-question-answering-on-lsmdc-fib","slug":"video-question-answering-on-lsmdc-fib","dataset":"LSMDC-FiB","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Clover","paper_title":"Clover: Towards A Unified Video-Language Alignment and Fusion Model","paper_url":"/paper/clover-towards-a-unified-video-language","paper_date":"2022-07-16","arxiv_id":"2207.07885","code_links":[{"title":"leeyn-43/clover","url":"https://github.com/leeyn-43/clover"}],"syntology":null}},{"leaderboard":"/sota/video-question-answering-on-msr-vtt","slug":"video-question-answering-on-msr-vtt","dataset":"MSR-VTT","dataset_url":"/dataset/msr-vtt","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"LocVLM-Vid-B","paper_title":"Learning to Localize Objects Improves Spatial Reasoning in Visual-LLMs","paper_url":"/paper/learning-to-localize-objects-improves-spatial","paper_date":"2024-04-11","arxiv_id":"2404.07449","code_links":[{"title":"kahnchana/locvlm","url":"https://github.com/kahnchana/locvlm"}],"syntology":null}},{"leaderboard":"/sota/video-question-answering-on-msr-vtt-mc","slug":"video-question-answering-on-msr-vtt-mc","dataset":"MSR-VTT-MC","dataset_url":"/dataset/msrvtt-mc","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ATP (1<-16)","paper_title":"Revisiting the \"Video\" in Video-Language Understanding","paper_url":"/paper/revisiting-the-video-in-video-language","paper_date":"2022-06-03","arxiv_id":"2206.01720","code_links":[{"title":"stanfordvl/atp-video-language","url":"https://github.com/stanfordvl/atp-video-language"}],"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/video-question-answering-on-msvd-qa","slug":"video-question-answering-on-msvd-qa","dataset":"MSVD-QA","dataset_url":"/dataset/msvd-qa","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"LocVLM-Vid-B","paper_title":"Learning to Localize Objects Improves Spatial Reasoning in Visual-LLMs","paper_url":"/paper/learning-to-localize-objects-improves-spatial","paper_date":"2024-04-11","arxiv_id":"2404.07449","code_links":[{"title":"kahnchana/locvlm","url":"https://github.com/kahnchana/locvlm"}],"syntology":null}},{"leaderboard":"/sota/video-question-answering-on-tgif-qa","slug":"video-question-answering-on-tgif-qa","dataset":"TGIF-QA","dataset_url":"/dataset/tgif-qa","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"LocVLM-Vid-B","paper_title":"Learning to Localize Objects Improves Spatial Reasoning in Visual-LLMs","paper_url":"/paper/learning-to-localize-objects-improves-spatial","paper_date":"2024-04-11","arxiv_id":"2404.07449","code_links":[{"title":"kahnchana/locvlm","url":"https://github.com/kahnchana/locvlm"}],"syntology":null}},{"leaderboard":"/sota/video-question-answering-on-videoqa","slug":"video-question-answering-on-videoqa","dataset":"VideoQA","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Just Ask (fine-tune)","paper_title":"Just Ask: Learning to Answer Questions from Millions of Narrated Videos","paper_url":"/paper/just-ask-learning-to-answer-questions-from","paper_date":"2020-12-01","arxiv_id":"2012.00451","code_links":[{"title":"antoyang/just-ask","url":"https://github.com/antoyang/just-ask"}],"syntology":null}},{"leaderboard":"/sota/video-question-answering-on-vlep","slug":"video-question-answering-on-vlep","dataset":"VLEP","dataset_url":"/dataset/vlep","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"LLaMA-VQA","paper_title":"Large Language Models are Temporal and Causal Reasoners for Video Question Answering","paper_url":"/paper/large-language-models-are-temporal-and-causal","paper_date":"2023-10-24","arxiv_id":"2310.15747","code_links":[{"title":"mlvlab/Flipped-VQA","url":"https://github.com/mlvlab/Flipped-VQA"}],"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/msr-vtt","name":"MSR-VTT","full_name":"","num_papers_in_archive":640},{"url":"/dataset/howto100m","name":"HowTo100M","full_name":"HowTo100M","num_papers_in_archive":286},{"url":"/dataset/next-qa","name":"NExT-QA","full_name":"","num_papers_in_archive":174},{"url":"/dataset/activitynet-qa","name":"ActivityNet-QA","full_name":"","num_papers_in_archive":146},{"url":"/dataset/tvqa","name":"TVQA","full_name":"TVQA","num_papers_in_archive":146},{"url":"/dataset/mvbench","name":"MVBench","full_name":"","num_papers_in_archive":139},{"url":"/dataset/tgif-qa","name":"TGIF-QA","full_name":"TGIF-QA","num_papers_in_archive":92},{"url":"/dataset/movieqa","name":"MovieQA","full_name":"MovieQA","num_papers_in_archive":86},{"url":"/dataset/msrvtt-qa","name":"MSRVTT-QA","full_name":"","num_papers_in_archive":66},{"url":"/dataset/msvd-qa","name":"MSVD-QA","full_name":"","num_papers_in_archive":61},{"url":"/dataset/tvqa-1","name":"TVQA+","full_name":"","num_papers_in_archive":60},{"url":"/dataset/tgif","name":"TGIF","full_name":"Tumblr GIF","num_papers_in_archive":51},{"url":"/dataset/agqa","name":"AGQA","full_name":"Action Genome Question Answering","num_papers_in_archive":30},{"url":"/dataset/value","name":"VALUE","full_name":"Video-And-Language Understanding Evaluation","num_papers_in_archive":30},{"url":"/dataset/videoinstruct","name":"VideoInstruct","full_name":"Video Instruction Dataset","num_papers_in_archive":30},{"url":"/dataset/how2qa","name":"How2QA","full_name":"How2QA","num_papers_in_archive":28},{"url":"/dataset/intentqa","name":"IntentQA","full_name":"","num_papers_in_archive":27},{"url":"/dataset/ivqa","name":"iVQA","full_name":"Instructional Video Question Answering","num_papers_in_archive":22},{"url":"/dataset/tvbench","name":"TVBench","full_name":"","num_papers_in_archive":22},{"url":"/dataset/trafficqa","name":"SUTD-TrafficQA","full_name":"","num_papers_in_archive":19},{"url":"/dataset/egotaskqa","name":"EgoTaskQA","full_name":"","num_papers_in_archive":17},{"url":"/dataset/situated-reasoning-star","name":"STAR Benchmark","full_name":"Situated Reasoning","num_papers_in_archive":17},{"url":"/dataset/msrvtt-mc","name":"MSRVTT-MC","full_name":"","num_papers_in_archive":14},{"url":"/dataset/ovbench","name":"OVBench","full_name":"","num_papers_in_archive":14},{"url":"/dataset/dramaqa","name":"DramaQA","full_name":"","num_papers_in_archive":12},{"url":"/dataset/neptune","name":"Neptune","full_name":"Neptune Long Video Understanding Benchmark","num_papers_in_archive":12},{"url":"/dataset/vlep","name":"VLEP","full_name":"Video-and-Language Event Prediction","num_papers_in_archive":11},{"url":"/dataset/perception-test","name":"Perception Test","full_name":"","num_papers_in_archive":10},{"url":"/dataset/knowit-vqa","name":"KnowIT VQA","full_name":"","num_papers_in_archive":9},{"url":"/dataset/vlm2-bench","name":"VLM2-Bench","full_name":"VLM²-Bench","num_papers_in_archive":9},{"url":"/dataset/moviefib","name":"MovieFIB","full_name":"Movie Fill-in-the-Blank","num_papers_in_archive":6},{"url":"/dataset/sqa69m","name":"HowToVQA69M","full_name":"HowToVQA69M","num_papers_in_archive":5},{"url":"/dataset/tutorialvqa","name":"TutorialVQA","full_name":"TutorialVQA","num_papers_in_archive":5},{"url":"/dataset/roadtextvqa","name":"RoadTextVQA","full_name":"","num_papers_in_archive":4},{"url":"/dataset/video-localized-narratives","name":"Video Localized Narratives","full_name":"","num_papers_in_archive":3},{"url":"/dataset/cripp-vqa","name":"CRIPP-VQA","full_name":"Counterfactual Reasoning about Implicit Physical Properties via Video Question Answering","num_papers_in_archive":2},{"url":"/dataset/causalchaos","name":"CausalChaos!","full_name":"CausalChaos!QA","num_papers_in_archive":1},{"url":"/dataset/cinepile","name":"CinePile: A Long Video Question Answering Dataset and Benchmark","full_name":"","num_papers_in_archive":1},{"url":"/dataset/sfd","name":"SF20K","full_name":"Short-Films 20K","num_papers_in_archive":1},{"url":"/dataset/social-iq-2-0","name":"Social-IQ 2.0","full_name":"","num_papers_in_archive":1},{"url":"/dataset/vcg-112k","name":"VCG+112K","full_name":"Video Instruction Dataset 112K","num_papers_in_archive":1},{"url":"/dataset/wildqa","name":"WildQA","full_name":"","num_papers_in_archive":1},{"url":"/dataset/vript","name":"Vript","full_name":"🎬 Vript: A Video Is Worth Thousands of Words","num_papers_in_archive":0}],"subtasks":[{"url":"/task/few-shot-video-question-answering","name":"Few-shot Video Question Answering"},{"url":"/task/zeroshot-video-question-answer","name":"Zero-Shot Video Question Answer"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":250,"tagged_in_all":460,"items":[{"url":"/paper/is-space-time-attention-all-you-need-for","title":"Is Space-Time Attention All You Need for Video Understanding?","date":"2021-02-09","arxiv_id":"2102.05095","repositories_listed":16,"syntology":{"n":43,"n_ran":35,"n_unverified":8,"n_pointer_only":14}},{"url":"/paper/visual-instruction-tuning-1","title":"Visual Instruction Tuning","date":"2023-04-17","arxiv_id":"2304.08485","repositories_listed":13,"syntology":{"n":51,"n_ran":16,"n_unverified":35,"n_pointer_only":0}},{"url":"/paper/qwen2-vl-enhancing-vision-language-model-s","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","date":"2024-09-18","arxiv_id":"2409.12191","repositories_listed":8,"syntology":{"n":12,"n_ran":8,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/video-llava-learning-united-visual-1","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","date":"2023-11-16","arxiv_id":"2311.10122","repositories_listed":6,"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":1}},{"url":"/paper/minigpt-4-enhancing-vision-language","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","date":"2023-04-20","arxiv_id":"2304.10592","repositories_listed":6,"syntology":null},{"url":"/paper/flamingo-a-visual-language-model-for-few-shot-1","title":"Flamingo: a Visual Language Model for Few-Shot Learning","date":"2022-04-29","arxiv_id":"2204.14198","repositories_listed":5,"syntology":{"n":24,"n_ran":18,"n_unverified":6,"n_pointer_only":7}},{"url":"/paper/i-srt-aligning-large-multimodal-models-for","title":"ISR-DPO: Aligning Large Multimodal Models for Videos by Iterative Self-Retrospective DPO","date":"2024-06-17","arxiv_id":"2406.11280","repositories_listed":4,"syntology":{"n":30,"n_ran":20,"n_unverified":10,"n_pointer_only":15}},{"url":"/paper/chat-univi-unified-visual-representation","title":"Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding","date":"2023-11-14","arxiv_id":"2311.08046","repositories_listed":4,"syntology":null},{"url":"/paper/video-llama-an-instruction-tuned-audio-visual","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","date":"2023-06-05","arxiv_id":"2306.02858","repositories_listed":4,"syntology":{"n":25,"n_ran":18,"n_unverified":7,"n_pointer_only":9}},{"url":"/paper/instructblip-towards-general-purpose-vision","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","date":"2023-05-11","arxiv_id":"2305.06500","repositories_listed":4,"syntology":null},{"url":"/paper/video-text-as-game-players-hierarchical","title":"Video-Text as Game Players: Hierarchical Banzhaf Interaction for Cross-Modal Representation Learning","date":"2023-03-25","arxiv_id":"2303.14369","repositories_listed":4,"syntology":{"n":16,"n_ran":11,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/mplug-2-a-modularized-multi-modal-foundation","title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","date":"2023-02-01","arxiv_id":"2302.00402","repositories_listed":4,"syntology":{"n":19,"n_ran":9,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/expectation-maximization-contrastive-learning","title":"Expectation-Maximization Contrastive Learning for Compact Video-and-Language Representations","date":"2022-11-21","arxiv_id":"2211.11427","repositories_listed":4,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/tvqa-localized-compositional-video-question","title":"TVQA: Localized, Compositional Video Question Answering","date":"2018-09-05","arxiv_id":"1809.01696","repositories_listed":4,"syntology":{"n":8,"n_ran":3,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/llava-next-interleave-tackling-multi-image","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","date":"2024-07-10","arxiv_id":"2407.07895","repositories_listed":3,"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":4}},{"url":"/paper/videollama-2-advancing-spatial-temporal","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","date":"2024-06-11","arxiv_id":"2406.07476","repositories_listed":3,"syntology":{"n":17,"n_ran":7,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/mvbench-a-comprehensive-multi-modal-video","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","date":"2023-11-28","arxiv_id":"2311.17005","repositories_listed":3,"syntology":{"n":10,"n_ran":7,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/llama-adapter-v2-parameter-efficient-visual","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","date":"2023-04-28","arxiv_id":"2304.15010","repositories_listed":3,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/zero-shot-video-question-answering-via-frozen","title":"Zero-Shot Video Question Answering via Frozen Bidirectional Language Models","date":"2022-06-16","arxiv_id":"2206.08155","repositories_listed":3,"syntology":{"n":34,"n_ran":14,"n_unverified":20,"n_pointer_only":1}},{"url":"/paper/trafficqa-a-question-answering-benchmark-and","title":"SUTD-TrafficQA: A Question Answering Benchmark and an Efficient Network for Video Reasoning over Traffic Events","date":"2021-03-29","arxiv_id":"2103.15538","repositories_listed":3,"syntology":{"n":9,"n_ran":1,"n_unverified":8,"n_pointer_only":2}},{"url":"/paper/hero-hierarchical-encoder-for-video-language","title":"HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training","date":"2020-05-01","arxiv_id":"2005.00200","repositories_listed":3,"syntology":{"n":13,"n_ran":5,"n_unverified":8,"n_pointer_only":8}},{"url":"/paper/tvqa-spatio-temporal-grounding-for-video","title":"TVQA+: Spatio-Temporal Grounding for Video Question Answering","date":"2019-04-25","arxiv_id":"1904.11574","repositories_listed":3,"syntology":{"n":13,"n_ran":6,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/exploring-models-and-data-for-image-question","title":"Exploring Models and Data for Image Question Answering","date":"2015-05-08","arxiv_id":"1505.02074","repositories_listed":3,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":2}},{"url":"/paper/nvila-efficient-frontier-visual-language","title":"NVILA: Efficient Frontier Visual Language Models","date":"2024-12-05","arxiv_id":"2412.04468","repositories_listed":2,"syntology":null},{"url":"/paper/llava-onevision-easy-visual-task-transfer","title":"LLaVA-OneVision: Easy Visual Task Transfer","date":"2024-08-06","arxiv_id":"2408.03326","repositories_listed":2,"syntology":null},{"url":"/paper/long-context-transfer-from-language-to-vision","title":"Long Context Transfer from Language to Vision","date":"2024-06-24","arxiv_id":"2406.16852","repositories_listed":2,"syntology":{"n":5,"n_ran":5,"n_unverified":0,"n_pointer_only":5}},{"url":"/paper/minigpt4-video-advancing-multimodal-llms-for","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","date":"2024-04-04","arxiv_id":"2404.03413","repositories_listed":2,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/internvideo2-scaling-video-foundation-models","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","date":"2024-03-22","arxiv_id":"2403.15377","repositories_listed":2,"syntology":null},{"url":"/paper/lstp-language-guided-spatial-temporal-prompt","title":"Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge","date":"2024-02-25","arxiv_id":"2402.16050","repositories_listed":2,"syntology":{"n":8,"n_ran":5,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/lingoqa-video-question-answering-for","title":"LingoQA: Visual Question Answering for Autonomous Driving","date":"2023-12-21","arxiv_id":"2312.14115","repositories_listed":2,"syntology":{"n":10,"n_ran":8,"n_unverified":2,"n_pointer_only":0}}],"syntology_records":24,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}