{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/an-empirical-study-of-end-to-end-video","title":"An Empirical Study of End-to-End Video-Language Transformers with Masked Visual Modeling","arxiv_id":"2209.01540","date":"2022-09-04","proceeding":"CVPR 2023 1","authors":["Tsu-Jui Fu","Linjie Li","Zhe Gan","Kevin Lin","William Yang Wang","Lijuan Wang","Zicheng Liu"],"abstract":"Masked visual modeling (MVM) has been recently proven effective for visual pre-training. While similar reconstructive objectives on video inputs (e.g., masked frame modeling) have been explored in video-language (VidL) pre-training, previous studies fail to find a truly effective MVM strategy that can largely benefit the downstream performance. In this work, we systematically examine the potential of MVM in the context of VidL learning. Specifically, we base our study on a fully end-to-end VIdeO-LanguagE Transformer (VIOLET), where the supervision from MVM training can be backpropagated to the video pixel space. In total, eight different reconstructive targets of MVM are explored, from low-level pixel values and oriented gradients to high-level depth maps, optical flow, discrete visual tokens, and latent visual features. We conduct comprehensive experiments and provide insights into the factors leading to effective MVM training, resulting in an enhanced model VIOLETv2. Empirically, we show VIOLETv2 pre-trained with MVM objective achieves notable improvements on 13 VidL benchmarks, ranging from video question answering, video captioning, to text-to-video retrieval.","url_abs":"https://arxiv.org/abs/2209.01540v5","url_pdf":"https://arxiv.org/pdf/2209.01540v5.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"an-empirical-study-of-end-to-end-video","repo_url":"https://github.com/tsujuifu/pytorch_empirical-mvm","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":{"status":"ok"}}],"tasks":[{"task_slug":"fill-mask","task_name":"Fill Mask"},{"task_slug":"optical-flow-estimation","task_name":"Optical Flow Estimation"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"retrieval","task_name":"Retrieval"},{"task_slug":"tgif-action","task_name":"TGIF-Action"},{"task_slug":"tgif-frame","task_name":"TGIF-Frame"},{"task_slug":"tgif-transition","task_name":"TGIF-Transition"},{"task_slug":"text-to-video-retrieval","task_name":"Text to Video Retrieval"},{"task_slug":"video-captioning","task_name":"Video Captioning"},{"task_slug":"video-question-answering","task_name":"Video Question Answering"},{"task_slug":"video-retrieval","task_name":"Video Retrieval"},{"task_slug":"visual-question-answering","task_name":"Visual Question Answering (VQA)"}],"methods":[{"method_slug":"absolute-position-encodings","method_name":"Absolute Position Encodings"},{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"base","method_name":"BASE"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"label-smoothing","method_name":"Label Smoothing"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"position-wise-feed-forward-layer","method_name":"Position-Wise Feed-Forward Layer"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"transformer","method_name":"Transformer"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/video-captioning-on-msr-vtt-1","task":"Video Captioning","dataset":"MSR-VTT","model":"VIOLETv2","rank_in_archive_order":18,"of":24,"metrics":{"CIDEr":"58"},"uses_additional_data":false},{"leaderboard":"/sota/video-captioning-on-msvd-1","task":"Video Captioning","dataset":"MSVD","model":"VIOLETv2","rank_in_archive_order":9,"of":16,"metrics":{"CIDEr":"139.2"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-lsmdc-mc","task":"Video Question Answering","dataset":"LSMDC-MC","model":"VIOLETv2","rank_in_archive_order":1,"of":2,"metrics":{"Accuracy":"84.4"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-msrvtt-mc","task":"Video Question Answering","dataset":"MSRVTT-MC","model":"VIOLETv2","rank_in_archive_order":1,"of":7,"metrics":{"Accuracy":"97.6"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-msrvtt-qa","task":"Video Question Answering","dataset":"MSRVTT-QA","model":"VIOLETv2","rank_in_archive_order":11,"of":14,"metrics":{"Accuracy":"44.5"},"uses_additional_data":false},{"leaderboard":"/sota/video-retrieval-on-didemo","task":"Video Retrieval","dataset":"DiDeMo","model":"VIOLETv2","rank_in_archive_order":28,"of":40,"metrics":{"text-to-video R@1":"47.9","text-to-video R@10":"84.1","text-to-video R@5":"76.5"},"uses_additional_data":false},{"leaderboard":"/sota/video-retrieval-on-lsmdc","task":"Video Retrieval","dataset":"LSMDC","model":"VIOLETv2","rank_in_archive_order":21,"of":38,"metrics":{"text-to-video R@1":"24","text-to-video R@10":"54.1","text-to-video R@5":"43.5"},"uses_additional_data":false},{"leaderboard":"/sota/video-retrieval-on-msr-vtt","task":"Video Retrieval","dataset":"MSR-VTT","model":"VIOLETv2","rank_in_archive_order":16,"of":40,"metrics":{"text-to-video R@1":"37.2","text-to-video R@10":"75.8","text-to-video R@5":"64.8"},"uses_additional_data":true},{"leaderboard":"/sota/visual-question-answering-on-msvd-qa-1","task":"Visual Question Answering (VQA)","dataset":"MSVD-QA","model":"VIOLETv2","rank_in_archive_order":15,"of":36,"metrics":{"Accuracy":"0.547"},"uses_additional_data":true}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2209.01540","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}