{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/videochat-chat-centric-video-understanding","title":"VideoChat: Chat-Centric Video Understanding","arxiv_id":"2305.06355","date":"2023-05-10","proceeding":null,"authors":["Kunchang Li","Yinan He","Yi Wang","Yizhuo Li","Wenhai Wang","Ping Luo","Yali Wang","LiMin Wang","Yu Qiao"],"abstract":"In this paper, we initiate an attempt of developing an end-to-end chat-centric video understanding system, coined as VideoChat. It integrates video foundation models and large language models via a learnable neural interface, excelling in spatiotemporal reasoning, event localization, and causal relationship inference. To instructively tune this system, we build a video-centric instruction dataset, composed of thousands of videos associated with detailed descriptions and conversations. This dataset emphasizes spatiotemporal reasoning and captures causal relationships, providing a valuable asset for training our chat-centric video understanding system. Preliminary qualitative experiments demonstrate the potential of our system across a broad spectrum of video applications, which could serve as a simple prototype system for future research on chat-centric video understanding. Access our code and data at https://github.com/OpenGVLab/Ask-Anything","url_abs":"https://arxiv.org/abs/2305.06355v2","url_pdf":"https://arxiv.org/pdf/2305.06355v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"videochat-chat-centric-video-understanding","repo_url":"https://github.com/opengvlab/ask-anything","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}}],"tasks":[{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"video-question-answering","task_name":"Video Question Answering"},{"task_slug":"video-understanding","task_name":"Video Understanding"},{"task_slug":"video-based-generative-performance","task_name":"Video-based Generative Performance Benchmarking"},{"task_slug":"video-based-generative-performance-5","task_name":"Video-based Generative Performance Benchmarking (Consistency)"},{"task_slug":"video-based-generative-performance-3","task_name":"Video-based Generative Performance Benchmarking (Contextual Understanding)"},{"task_slug":"video-based-generative-performance-1","task_name":"Video-based Generative Performance Benchmarking (Correctness of Information)"},{"task_slug":"video-based-generative-performance-2","task_name":"Video-based Generative Performance Benchmarking (Detail Orientation))"},{"task_slug":"video-based-generative-performance-4","task_name":"Video-based Generative Performance Benchmarking (Temporal Understanding)"},{"task_slug":"zeroshot-video-question-answer","task_name":"Zero-Shot Video Question Answer"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/question-answering-on-next-qa-open-ended","task":"Question Answering","dataset":"NExT-QA (Open-ended VideoQA)","model":"VideoChat","rank_in_archive_order":3,"of":6,"metrics":{"Accuracy":"56.6","Confidence Score":"3.2"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-activitynet-qa","task":"Video Question Answering","dataset":"ActivityNet-QA","model":"Video Chat","rank_in_archive_order":33,"of":36,"metrics":{"Accuracy":"26.5","Confidence score":"2.2"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-mvbench","task":"Video Question Answering","dataset":"MVBench","model":"VideoChat","rank_in_archive_order":18,"of":22,"metrics":{"Avg.":"35.5"},"uses_additional_data":false},{"leaderboard":"/sota/video-based-generative-performance","task":"Video-based Generative Performance Benchmarking","dataset":"VideoInstruct","model":"Video Chat","rank_in_archive_order":21,"of":23,"metrics":{"Consistency":"2.24","Contextual Understanding":"2.53","Correctness of Information":"2.23","Detail Orientation":"2.50","Temporal Understanding":"1.94","mean":"2.29"},"uses_additional_data":false},{"leaderboard":"/sota/video-based-generative-performance-2","task":"Video-based Generative Performance Benchmarking (Consistency)","dataset":"VideoInstruct","model":"Video Chat","rank_in_archive_order":15,"of":18,"metrics":{"gpt-score":"2.24"},"uses_additional_data":false},{"leaderboard":"/sota/video-based-generative-performance-3","task":"Video-based Generative Performance Benchmarking (Contextual Understanding)","dataset":"VideoInstruct","model":"Video Chat","rank_in_archive_order":16,"of":18,"metrics":{"gpt-score":"2.53"},"uses_additional_data":false},{"leaderboard":"/sota/video-based-generative-performance-1","task":"Video-based Generative Performance Benchmarking (Correctness of Information)","dataset":"VideoInstruct","model":"Video Chat","rank_in_archive_order":15,"of":18,"metrics":{"gpt-score":"2.32"},"uses_additional_data":false},{"leaderboard":"/sota/video-based-generative-performance-4","task":"Video-based Generative Performance Benchmarking (Detail Orientation))","dataset":"VideoInstruct","model":"Video Chat","rank_in_archive_order":15,"of":18,"metrics":{"gpt-score":"2.50"},"uses_additional_data":false},{"leaderboard":"/sota/video-based-generative-performance-5","task":"Video-based Generative Performance Benchmarking (Temporal Understanding)","dataset":"VideoInstruct","model":"Video Chat","rank_in_archive_order":17,"of":18,"metrics":{"gpt-score":"1.94"},"uses_additional_data":false},{"leaderboard":"/sota/zeroshot-video-question-answer-on-activitynet","task":"Zero-Shot Video Question Answer","dataset":"ActivityNet-QA","model":"Video Chat","rank_in_archive_order":26,"of":28,"metrics":{"Accuracy":"26.5","Confidence Score":"2.2"},"uses_additional_data":false},{"leaderboard":"/sota/zeroshot-video-question-answer-on-msrvtt-qa","task":"Zero-Shot Video Question Answer","dataset":"MSRVTT-QA","model":"Video Chat-7B","rank_in_archive_order":28,"of":30,"metrics":{"Accuracy":"45.0","Confidence Score":"2.5"},"uses_additional_data":false},{"leaderboard":"/sota/zeroshot-video-question-answer-on-msvd-qa","task":"Zero-Shot Video Question Answer","dataset":"MSVD-QA","model":"Video Chat-7B","rank_in_archive_order":25,"of":28,"metrics":{"Accuracy":"56.3","Confidence Score":"2.8"},"uses_additional_data":false},{"leaderboard":"/sota/zeroshot-video-question-answer-on-tgif-qa","task":"Zero-Shot Video Question Answer","dataset":"TGIF-QA","model":"Video Chat-7B","rank_in_archive_order":14,"of":14,"metrics":{"Accuracy":"34.4","Confidence Score":"2.3"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-video-question-answer-on-vnbench","task":"Zero-Shot Video Question Answer","dataset":"VNBench","model":"VideoChat2","rank_in_archive_order":7,"of":9,"metrics":{"Accuracy":"12.4"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2305.06355","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}