{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/videoclip-contrastive-pre-training-for-zero","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","arxiv_id":"2109.14084","date":"2021-09-28","proceeding":"EMNLP 2021 11","authors":["Hu Xu","Gargi Ghosh","Po-Yao Huang","Dmytro Okhonko","Armen Aghajanyan","Florian Metze","Luke Zettlemoyer","Christoph Feichtenhofer"],"abstract":"We present VideoCLIP, a contrastive approach to pre-train a unified model for zero-shot video and text understanding, without using any labels on downstream tasks. VideoCLIP trains a transformer for video and text by contrasting temporally overlapping positive video-text pairs with hard negatives from nearest neighbor retrieval. Our experiments on a diverse series of downstream tasks, including sequence-level text-video retrieval, VideoQA, token-level action localization, and action segmentation reveal state-of-the-art performance, surpassing prior work, and in some cases even outperforming supervised approaches. Code is made available at https://github.com/pytorch/fairseq/tree/main/examples/MMPT.","url_abs":"https://arxiv.org/abs/2109.14084v2","url_pdf":"https://arxiv.org/pdf/2109.14084v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"videoclip-contrastive-pre-training-for-zero","repo_url":"https://github.com/pytorch/fairseq","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"videoclip-contrastive-pre-training-for-zero","repo_url":"https://github.com/facebookresearch/fairseq","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}}],"tasks":[{"task_slug":"action-localization","task_name":"Action Localization"},{"task_slug":"action-segmentation","task_name":"Action Segmentation"},{"task_slug":"long-video-retrieval-background-removed","task_name":"Long Video Retrieval (Background Removed)"},{"task_slug":"retrieval","task_name":"Retrieval"},{"task_slug":"action-recognition","task_name":"Temporal Action Localization"},{"task_slug":"temporal-relation-extraction","task_name":"Temporal Relation Extraction"},{"task_slug":"video-retrieval","task_name":"Video Retrieval"},{"task_slug":"zero-shot-video-retrieval","task_name":"Zero-Shot Video Retrieval"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/action-segmentation-on-coin","task":"Action Segmentation","dataset":"COIN","model":"VideoClip","rank_in_archive_order":4,"of":9,"metrics":{"Frame accuracy":"68.7"},"uses_additional_data":true},{"leaderboard":"/sota/long-video-retrieval-background-removed-on","task":"Long Video Retrieval (Background Removed)","dataset":"YouCook2","model":"VideoCLIP","rank_in_archive_order":3,"of":6,"metrics":{"Cap. Avg. R@1":"74.5","Cap. Avg. R@10":"97.9","Cap. Avg. R@5":"94.5","DTW R@1":"56.0","DTW R@10":"89.9","DTW R@5":"96.3","OTAM R@1":"52.8","OTAM R@10":"89.2","OTAM R@5":"95.0"},"uses_additional_data":false},{"leaderboard":"/sota/temporal-action-localization-on-crosstask","task":"Temporal Action Localization","dataset":"CrossTask","model":"VideoCLIP","rank_in_archive_order":1,"of":7,"metrics":{"Recall":"47.3"},"uses_additional_data":true},{"leaderboard":"/sota/temporal-relation-extraction-on-vinoground","task":"Temporal Relation Extraction","dataset":"Vinoground","model":"VideoCLIP","rank_in_archive_order":22,"of":24,"metrics":{"Group Score":"1.2","Text Score":"17","Video Score":"2.8"},"uses_additional_data":false},{"leaderboard":"/sota/video-retrieval-on-msr-vtt-1ka","task":"Video Retrieval","dataset":"MSR-VTT-1kA","model":"VideoCLIP","rank_in_archive_order":50,"of":63,"metrics":{"text-to-video R@1":"30.9","text-to-video R@10":"66.8","text-to-video R@5":"55.4"},"uses_additional_data":true},{"leaderboard":"/sota/video-retrieval-on-youcook2","task":"Video Retrieval","dataset":"YouCook2","model":"VideoCLIP","rank_in_archive_order":3,"of":16,"metrics":{"text-to-video R@1":"32.2","text-to-video R@10":"75.0","text-to-video R@5":"62.6"},"uses_additional_data":true},{"leaderboard":"/sota/video-retrieval-on-youcook2","task":"Video Retrieval","dataset":"YouCook2","model":"VideoCLIP (zero-shot)","rank_in_archive_order":8,"of":16,"metrics":{"text-to-video R@1":"22.7","text-to-video R@10":"63.1","text-to-video R@5":"50.4"},"uses_additional_data":true},{"leaderboard":"/sota/zero-shot-video-retrieval-on-didemo","task":"Zero-Shot Video Retrieval","dataset":"DiDeMo","model":"VideoCLIP","rank_in_archive_order":26,"of":26,"metrics":{"text-to-video R@1":"16.6","text-to-video R@5":"46.9"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-video-retrieval-on-msr-vtt","task":"Zero-Shot Video Retrieval","dataset":"MSR-VTT","model":"VideoCLIP","rank_in_archive_order":36,"of":41,"metrics":{"text-to-video R@1":"10.4","text-to-video R@10":"30.0","text-to-video R@5":"22.2"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-video-retrieval-on-youcook2","task":"Zero-Shot Video Retrieval","dataset":"YouCook2","model":"VideoCLIP","rank_in_archive_order":3,"of":9,"metrics":{"text-to-video R@1":"22.7","text-to-video R@10":" 63.1","text-to-video R@5":"50.4"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2109.14084","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}