{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/image-as-a-foreign-language-beit-pretraining","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","arxiv_id":"2208.10442","date":"2022-08-22","proceeding":null,"authors":["Wenhui Wang","Hangbo Bao","Li Dong","Johan Bjorck","Zhiliang Peng","Qiang Liu","Kriti Aggarwal","Owais Khan Mohammed","Saksham Singhal","Subhojit Som","Furu Wei"],"abstract":"A big convergence of language, vision, and multimodal pretraining is emerging. In this work, we introduce a general-purpose multimodal foundation model BEiT-3, which achieves state-of-the-art transfer performance on both vision and vision-language tasks. Specifically, we advance the big convergence from three aspects: backbone architecture, pretraining task, and model scaling up. We introduce Multiway Transformers for general-purpose modeling, where the modular architecture enables both deep fusion and modality-specific encoding. Based on the shared backbone, we perform masked \"language\" modeling on images (Imglish), texts (English), and image-text pairs (\"parallel sentences\") in a unified manner. Experimental results show that BEiT-3 obtains state-of-the-art performance on object detection (COCO), semantic segmentation (ADE20K), image classification (ImageNet), visual reasoning (NLVR2), visual question answering (VQAv2), image captioning (COCO), and cross-modal retrieval (Flickr30K, COCO).","url_abs":"https://arxiv.org/abs/2208.10442v2","url_pdf":"https://arxiv.org/pdf/2208.10442v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"image-as-a-foreign-language-beit-pretraining","repo_url":"https://github.com/microsoft/unilm/tree/master/beit","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null},{"paper_slug":"image-as-a-foreign-language-beit-pretraining","repo_url":"https://github.com/lyan62/data-curation","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok"}}],"tasks":[{"task_slug":"all","task_name":"All"},{"task_slug":"cross-modal-retrieval","task_name":"Cross-Modal Retrieval"},{"task_slug":"image-captioning","task_name":"Image Captioning"},{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"instance-segmentation","task_name":"Instance Segmentation"},{"task_slug":"language-modeling","task_name":"Language Modeling"},{"task_slug":"language-modelling","task_name":"Language Modelling"},{"task_slug":"masked-language-modeling","task_name":"Masked Language Modeling"},{"task_slug":"object-detection","task_name":"Object Detection"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"retrieval","task_name":"Retrieval"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"},{"task_slug":"visual-question-answering-1","task_name":"Visual Question Answering"},{"task_slug":"visual-question-answering","task_name":"Visual Question Answering (VQA)"},{"task_slug":"visual-reasoning","task_name":"Visual Reasoning"},{"task_slug":"zero-shot-cross-modal-retrieval","task_name":"Zero-Shot Cross-Modal Retrieval"},{"task_slug":"image-classification","task_name":"image-classification"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/cross-modal-retrieval-on-coco-2014","task":"Cross-Modal Retrieval","dataset":"COCO 2014","model":"BEiT-3","rank_in_archive_order":3,"of":36,"metrics":{"Image-to-text R@1":"84.8","Image-to-text R@10":"98.3","Image-to-text R@5":"96.5","Text-to-image R@1":"67.2","Text-to-image R@10":"87.7","Text-to-image R@5":"92.8"},"uses_additional_data":true},{"leaderboard":"/sota/cross-modal-retrieval-on-flickr30k","task":"Cross-Modal Retrieval","dataset":"Flickr30k","model":"BEiT-3","rank_in_archive_order":3,"of":27,"metrics":{"Image-to-text R@1":"98.0","Image-to-text R@10":"100.0","Image-to-text R@5":"100.0","Text-to-image R@1":"90.3","Text-to-image R@10":"99.5","Text-to-image R@5":"98.7"},"uses_additional_data":true},{"leaderboard":"/sota/instance-segmentation-on-coco","task":"Instance Segmentation","dataset":"COCO test-dev","model":"BEiT-3","rank_in_archive_order":6,"of":112,"metrics":{"mask AP":"54.8"},"uses_additional_data":false},{"leaderboard":"/sota/object-detection-on-coco","task":"Object Detection","dataset":"COCO test-dev","model":"BEiT-3","rank_in_archive_order":14,"of":225,"metrics":{"box mAP":"63.7"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-ade20k","task":"Semantic Segmentation","dataset":"ADE20K","model":"BEiT-3","rank_in_archive_order":5,"of":235,"metrics":{"Params (M)":"1900","Validation mIoU":"62.8"},"uses_additional_data":true},{"leaderboard":"/sota/semantic-segmentation-on-ade20k-val","task":"Semantic Segmentation","dataset":"ADE20K val","model":"BEiT-3","rank_in_archive_order":1,"of":95,"metrics":{"mIoU":"62.8"},"uses_additional_data":true},{"leaderboard":"/sota/visual-question-answering-on-vqa-v2-test-dev","task":"Visual Question Answering (VQA)","dataset":"VQA v2 test-dev","model":"BEiT-3","rank_in_archive_order":2,"of":56,"metrics":{"Accuracy":"84.19"},"uses_additional_data":false},{"leaderboard":"/sota/visual-question-answering-on-vqa-v2-test-std","task":"Visual Question Answering (VQA)","dataset":"VQA v2 test-std","model":"BEiT-3","rank_in_archive_order":1,"of":38,"metrics":{"overall":"84.03"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-nlvr2-dev","task":"Visual Reasoning","dataset":"NLVR2 Dev","model":"BEiT-3","rank_in_archive_order":1,"of":15,"metrics":{"Accuracy":"91.51"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-nlvr2-test","task":"Visual Reasoning","dataset":"NLVR2 Test","model":"BEiT-3","rank_in_archive_order":1,"of":14,"metrics":{"Accuracy":"92.58"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-cross-modal-retrieval-on-flickr30k","task":"Zero-Shot Cross-Modal Retrieval","dataset":"Flickr30k","model":"BEiT-3","rank_in_archive_order":2,"of":22,"metrics":{"Image-to-text R@1":"94.9","Image-to-text R@10":"100.0","Image-to-text R@5":"99.9","Text-to-image R@1":"81.5","Text-to-image R@10":"97.8","Text-to-image R@5":"95.6"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2208.10442","atlas_url":"https://app.syntology.ai/?focus=2208.10442","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}