{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/toward-building-general-foundation-models-for","title":"Toward Building General Foundation Models for Language, Vision, and Vision-Language Understanding Tasks","arxiv_id":"2301.05065","date":"2023-01-12","proceeding":null,"authors":["Xinsong Zhang","Yan Zeng","Jipeng Zhang","Hang Li"],"abstract":"Foundation models or pre-trained models have substantially improved the performance of various language, vision, and vision-language understanding tasks. However, existing foundation models can only perform the best in one type of tasks, namely language, vision, or vision-language. It is still an open question whether it is possible to construct a foundation model performing the best for all the understanding tasks, which we call a general foundation model. In this paper, we propose a new general foundation model, X-FM (the X-Foundation Model). X-FM has one language encoder, one vision encoder, and one fusion encoder, as well as a new training method. The training method includes two new techniques for learning X-FM from text, image, and image-text pair data. One is to stop gradients from the vision-language training when learning the language encoder. The other is to leverage the vision-language training to guide the learning of the vision encoder. Extensive experiments on benchmark datasets show that X-FM can significantly outperform existing general foundation models and perform better than or comparable to existing foundation models specifically for language, vision, or vision-language understanding. Code and pre-trained models are released at https://github.com/zhangxinsong-nlp/XFM.","url_abs":"https://arxiv.org/abs/2301.05065v2","url_pdf":"https://arxiv.org/pdf/2301.05065v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"toward-building-general-foundation-models-for","repo_url":"https://github.com/zhangxinsong-nlp/XFM","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"cross-modal-retrieval","task_name":"Cross-Modal Retrieval"},{"task_slug":"open-question","task_name":"Open-Ended Question Answering"},{"task_slug":"visual-grounding","task_name":"Visual Grounding"},{"task_slug":"visual-question-answering","task_name":"Visual Question Answering (VQA)"},{"task_slug":"visual-reasoning","task_name":"Visual Reasoning"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/cross-modal-retrieval-on-coco-2014","task":"Cross-Modal Retrieval","dataset":"COCO 2014","model":"XFM (base)","rank_in_archive_order":4,"of":36,"metrics":{"Image-to-text R@1":"84.2","Image-to-text R@10":"98.4","Image-to-text R@5":"96.4","Text-to-image R@1":"67.0","Text-to-image R@10":"92.4","Text-to-image R@5":"87.2"},"uses_additional_data":true},{"leaderboard":"/sota/visual-grounding-on-refcoco-test-b","task":"Visual Grounding","dataset":"RefCOCO+ test B","model":"XFM (base)","rank_in_archive_order":4,"of":6,"metrics":{"Accuracy (%)":"79.8"},"uses_additional_data":false},{"leaderboard":"/sota/visual-grounding-on-refcoco-testa","task":"Visual Grounding","dataset":"RefCOCO+ testA","model":"XFM (base)","rank_in_archive_order":4,"of":7,"metrics":{"Accuracy (%)":"90.4"},"uses_additional_data":false},{"leaderboard":"/sota/visual-grounding-on-refcoco-val","task":"Visual Grounding","dataset":"RefCOCO+ val","model":"XFM (base)","rank_in_archive_order":4,"of":6,"metrics":{"Accuracy (%)":"86.1"},"uses_additional_data":false},{"leaderboard":"/sota/visual-question-answering-on-vqa-v2-test-dev","task":"Visual Question Answering (VQA)","dataset":"VQA v2 test-dev","model":"XFM (base)","rank_in_archive_order":12,"of":56,"metrics":{"Accuracy":"80.4"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-nlvr2-dev","task":"Visual Reasoning","dataset":"NLVR2 Dev","model":"XFM (base)","rank_in_archive_order":3,"of":15,"metrics":{"Accuracy":"87.6"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-nlvr2-test","task":"Visual Reasoning","dataset":"NLVR2 Test","model":"XFM (base)","rank_in_archive_order":3,"of":14,"metrics":{"Accuracy":"88.4"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2301.05065","atlas_url":"https://app.syntology.ai/?focus=2301.05065","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}