{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/video-text-modeling-with-zero-shot-transfer","title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","arxiv_id":"2212.04979","date":"2022-12-09","proceeding":null,"authors":["Shen Yan","Tao Zhu","ZiRui Wang","Yuan Cao","Mi Zhang","Soham Ghosh","Yonghui Wu","Jiahui Yu"],"abstract":"We explore an efficient approach to establish a foundational video-text model. We present VideoCoCa that maximally reuses a pretrained image-text contrastive captioner (CoCa) model and adapt it to video-text tasks with minimal extra training. While previous works adapt image-text models with various cross-frame fusion modules, we find that the generative attentional pooling and contrastive attentional pooling layers in CoCa are instantly adaptable to flattened frame embeddings, yielding state-of-the-art results on zero-shot video classification and zero-shot text-to-video retrieval. Furthermore, we explore lightweight finetuning on top of VideoCoCa, and achieve strong results on video question-answering and video captioning.","url_abs":"https://arxiv.org/abs/2212.04979v3","url_pdf":"https://arxiv.org/pdf/2212.04979v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"retrieval","task_name":"Retrieval"},{"task_slug":"text-to-video-retrieval","task_name":"Text to Video Retrieval"},{"task_slug":"video-captioning","task_name":"Video Captioning"},{"task_slug":"video-classification","task_name":"Video Classification"},{"task_slug":"video-question-answering","task_name":"Video Question Answering"},{"task_slug":"video-retrieval","task_name":"Video Retrieval"},{"task_slug":"video-to-text-retrieval","task_name":"Video to Text Retrieval"},{"task_slug":"visual-question-answering","task_name":"Visual Question Answering (VQA)"},{"task_slug":"zero-shot-action-recognition","task_name":"Zero-Shot Action Recognition"},{"task_slug":"zero-shot-video-retrieval","task_name":"Zero-Shot Video Retrieval"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/video-captioning-on-activitynet-captions","task":"Video Captioning","dataset":"ActivityNet Captions","model":"VideoCoCa","rank_in_archive_order":1,"of":5,"metrics":{"BLEU4":"14.7","CIDEr":"39.3","ROUGE-L":"35.0"},"uses_additional_data":true},{"leaderboard":"/sota/video-captioning-on-msr-vtt-1","task":"Video Captioning","dataset":"MSR-VTT","model":"VideoCoCa","rank_in_archive_order":8,"of":24,"metrics":{"BLEU-4":"53.8","CIDEr":"73.2","ROUGE-L":"68.0"},"uses_additional_data":true},{"leaderboard":"/sota/video-captioning-on-vatex-1","task":"Video Captioning","dataset":"VATEX","model":"VideoCoCa","rank_in_archive_order":4,"of":10,"metrics":{"BLEU-4":"39.7","CIDEr":"77.8","ROUGE-L":"54.5"},"uses_additional_data":true},{"leaderboard":"/sota/video-captioning-on-youcook2","task":"Video Captioning","dataset":"YouCook2","model":"VideoCoCa","rank_in_archive_order":4,"of":14,"metrics":{"BLEU-4":"14.2","CIDEr":"1.28","ROUGE-L":"37.7"},"uses_additional_data":true},{"leaderboard":"/sota/video-question-answering-on-activitynet-qa","task":"Video Question Answering","dataset":"ActivityNet-QA","model":"VideoCoCa","rank_in_archive_order":3,"of":36,"metrics":{"Accuracy":"56.1"},"uses_additional_data":true},{"leaderboard":"/sota/video-question-answering-on-ivqa","task":"Video Question Answering","dataset":"iVQA","model":"VideoCoCa","rank_in_archive_order":3,"of":7,"metrics":{"Accuracy":"39.0"},"uses_additional_data":true},{"leaderboard":"/sota/video-retrieval-on-msr-vtt","task":"Video Retrieval","dataset":"MSR-VTT","model":"VideoCoCa (zero-shot)","rank_in_archive_order":18,"of":40,"metrics":{"text-to-video R@1":"34.3","text-to-video R@10":"67.0","text-to-video R@5":"57.8","video-to-text R@1":"64.7","video-to-text R@10":"91.4","video-to-text R@5":"85.2"},"uses_additional_data":true},{"leaderboard":"/sota/video-retrieval-on-youcook2","task":"Video Retrieval","dataset":"YouCook2","model":"VideoCoCa (zero-shot)","rank_in_archive_order":9,"of":16,"metrics":{"text-to-video R@1":"21.7","text-to-video R@10":"55.2","text-to-video R@5":"43.9"},"uses_additional_data":false},{"leaderboard":"/sota/visual-question-answering-on-msrvtt-qa-1","task":"Visual Question Answering (VQA)","dataset":"MSRVTT-QA","model":"VideoCoCa","rank_in_archive_order":10,"of":34,"metrics":{"Accuracy":"0.463"},"uses_additional_data":true},{"leaderboard":"/sota/visual-question-answering-on-msvd-qa-1","task":"Visual Question Answering (VQA)","dataset":"MSVD-QA","model":"VideoCoCa","rank_in_archive_order":8,"of":36,"metrics":{"Accuracy":"0.569"},"uses_additional_data":true},{"leaderboard":"/sota/zero-shot-action-recognition-on-charades-1","task":"Zero-Shot Action Recognition","dataset":"Charades","model":"VideoCoCa","rank_in_archive_order":2,"of":4,"metrics":{"mAP":"25.8"},"uses_additional_data":true},{"leaderboard":"/sota/zero-shot-action-recognition-on-hmdb51","task":"Zero-Shot Action Recognition","dataset":"HMDB51","model":"VideoCoCa","rank_in_archive_order":6,"of":29,"metrics":{"Top-1 Accuracy":"58.7","Top-5 Accuracy":"84.5"},"uses_additional_data":true},{"leaderboard":"/sota/zero-shot-action-recognition-on-kinetics","task":"Zero-Shot Action Recognition","dataset":"Kinetics","model":"VideoCoCa","rank_in_archive_order":6,"of":20,"metrics":{"Top-1 Accuracy":"70.1","Top-5 Accuracy":"88.9"},"uses_additional_data":true},{"leaderboard":"/sota/zero-shot-action-recognition-on-ucf101","task":"Zero-Shot Action Recognition","dataset":"UCF101","model":"VideoCoCa","rank_in_archive_order":4,"of":35,"metrics":{"Top-1 Accuracy":"86.6","Top-5 accuracy":"98.4"},"uses_additional_data":true},{"leaderboard":"/sota/zero-shot-video-retrieval-on-activitynet","task":"Zero-Shot Video Retrieval","dataset":"ActivityNet","model":"VideoCoCa","rank_in_archive_order":9,"of":12,"metrics":{"text-to-video R@1":"34.5","text-to-video R@10":"76.6","text-to-video R@5":"63.2","video-to-text R@1":"33.0","video-to-text R@10":"75.3","video-to-text R@5":"61.6"},"uses_additional_data":true},{"leaderboard":"/sota/zero-shot-video-retrieval-on-msr-vtt-full","task":"Zero-Shot Video Retrieval","dataset":"MSR-VTT-full","model":"VideoCoCa","rank_in_archive_order":3,"of":3,"metrics":{"text-to-video R@1":"34.3","text-to-video R@10":"67.0","text-to-video R@5":"57.8","video-to-text R@1":"64.7","video-to-text R@10":"91.4","video-to-text R@5":"85.2"},"uses_additional_data":true},{"leaderboard":"/sota/zero-shot-video-retrieval-on-vatex","task":"Zero-Shot Video Retrieval","dataset":"VATEX","model":"VideoCoCa","rank_in_archive_order":4,"of":5,"metrics":{"text-to-video R@1":"53.2","text-to-video R@10":"90.1","text-to-video R@5":"83.3","video-to-text R@1":"73.6","video-to-text R@10":"97.2","video-to-text R@5":"93.2"},"uses_additional_data":true},{"leaderboard":"/sota/zero-shot-video-retrieval-on-youcook2","task":"Zero-Shot Video Retrieval","dataset":"YouCook2","model":"VideoCOca","rank_in_archive_order":4,"of":9,"metrics":{"text-to-video R@1":"20.3","text-to-video R@10":"53.3","text-to-video R@5":"43.0"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2212.04979","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}