{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/vlmo-unified-vision-language-pre-training","title":"VLMo: Unified Vision-Language Pre-Training with Mixture-of-Modality-Experts","arxiv_id":"2111.02358","date":"2021-11-03","proceeding":null,"authors":["Hangbo Bao","Wenhui Wang","Li Dong","Qiang Liu","Owais Khan Mohammed","Kriti Aggarwal","Subhojit Som","Furu Wei"],"abstract":"We present a unified Vision-Language pretrained Model (VLMo) that jointly learns a dual encoder and a fusion encoder with a modular Transformer network. Specifically, we introduce Mixture-of-Modality-Experts (MoME) Transformer, where each block contains a pool of modality-specific experts and a shared self-attention layer. Because of the modeling flexibility of MoME, pretrained VLMo can be fine-tuned as a fusion encoder for vision-language classification tasks, or used as a dual encoder for efficient image-text retrieval. Moreover, we propose a stagewise pre-training strategy, which effectively leverages large-scale image-only and text-only data besides image-text pairs. Experimental results show that VLMo achieves state-of-the-art results on various vision-language tasks, including VQA, NLVR2 and image-text retrieval. The code and pretrained models are available at https://aka.ms/vlmo.","url_abs":"https://arxiv.org/abs/2111.02358v2","url_pdf":"https://arxiv.org/pdf/2111.02358v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"vlmo-unified-vision-language-pre-training","repo_url":"https://github.com/microsoft/unilm/tree/master/vlmo","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null},{"paper_slug":"vlmo-unified-vision-language-pre-training","repo_url":"https://github.com/ylsung/vl-merging","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok"}}],"tasks":[{"task_slug":"image-retrieval","task_name":"Image Retrieval"},{"task_slug":"image-text-retrieval","task_name":"Image-text Retrieval"},{"task_slug":"retrieval","task_name":"Retrieval"},{"task_slug":"text-retrieval","task_name":"Text Retrieval"},{"task_slug":"visual-question-answering","task_name":"Visual Question Answering (VQA)"},{"task_slug":"visual-reasoning","task_name":"Visual Reasoning"}],"methods":[{"method_slug":"absolute-position-encodings","method_name":"Absolute Position Encodings"},{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"label-smoothing","method_name":"Label Smoothing"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"position-wise-feed-forward-layer","method_name":"Position-Wise Feed-Forward Layer"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"transformer","method_name":"Transformer"},{"method_slug":"vlmo","method_name":"VLMo"}],"datasets_introduced":[],"methods_introduced":[{"slug":"vlmo","name":"VLMo","full_name":"Vision-Language pretrained Model"}],"results":[{"leaderboard":"/sota/image-retrieval-on-photochat","task":"Image Retrieval","dataset":"PhotoChat","model":"VLMo","rank_in_archive_order":2,"of":5,"metrics":{"R1":"11.5","R@10":"39.4","R@5":"30.0","Sum(R@1,5,10)":"83.2"},"uses_additional_data":false},{"leaderboard":"/sota/text-retrieval-on-image-chat","task":"Text Retrieval","dataset":"Image-Chat","model":"VLMo","rank_in_archive_order":3,"of":3,"metrics":{"R@1":"46.8","R@5":"67.5","Sum(R@1,5)":"114.3"},"uses_additional_data":false},{"leaderboard":"/sota/visual-question-answering-on-vqa-v2-test-dev","task":"Visual Question Answering (VQA)","dataset":"VQA v2 test-dev","model":"VLMo","rank_in_archive_order":3,"of":56,"metrics":{"Accuracy":"82.78"},"uses_additional_data":false},{"leaderboard":"/sota/visual-question-answering-on-vqa-v2-test-std","task":"Visual Question Answering (VQA)","dataset":"VQA v2 test-std","model":"VLMo","rank_in_archive_order":5,"of":38,"metrics":{"number":"67.26","other":"72.87","overall":"81.30","yes/no":"94.68"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-nlvr2-dev","task":"Visual Reasoning","dataset":"NLVR2 Dev","model":"VLMo","rank_in_archive_order":6,"of":15,"metrics":{"Accuracy":"85.64"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-nlvr2-test","task":"Visual Reasoning","dataset":"NLVR2 Test","model":"VLMo","rank_in_archive_order":6,"of":14,"metrics":{"Accuracy":"86.86"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2111.02358","atlas_url":"https://app.syntology.ai/?focus=2111.02358","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}