{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/blip-bootstrapping-language-image-pre","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","arxiv_id":"2201.12086","date":"2022-01-28","proceeding":null,"authors":["Junnan Li","Dongxu Li","Caiming Xiong","Steven Hoi"],"abstract":"Vision-Language Pre-training (VLP) has advanced the performance for many vision-language tasks. However, most existing pre-trained models only excel in either understanding-based tasks or generation-based tasks. Furthermore, performance improvement has been largely achieved by scaling up the dataset with noisy image-text pairs collected from the web, which is a suboptimal source of supervision. In this paper, we propose BLIP, a new VLP framework which transfers flexibly to both vision-language understanding and generation tasks. BLIP effectively utilizes the noisy web data by bootstrapping the captions, where a captioner generates synthetic captions and a filter removes the noisy ones. We achieve state-of-the-art results on a wide range of vision-language tasks, such as image-text retrieval (+2.7% in average recall@1), image captioning (+2.8% in CIDEr), and VQA (+1.6% in VQA score). BLIP also demonstrates strong generalization ability when directly transferred to video-language tasks in a zero-shot manner. Code, models, and datasets are released at https://github.com/salesforce/BLIP.","url_abs":"https://arxiv.org/abs/2201.12086v2","url_pdf":"https://arxiv.org/pdf/2201.12086v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"blip-bootstrapping-language-image-pre","repo_url":"https://github.com/salesforce/lavis","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"BSD-3-Clause"}},{"paper_slug":"blip-bootstrapping-language-image-pre","repo_url":"https://github.com/salesforce/blip","is_official":0,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"BSD-3-Clause"}},{"paper_slug":"blip-bootstrapping-language-image-pre","repo_url":"https://github.com/huggingface/transformers","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"blip-bootstrapping-language-image-pre","repo_url":"https://github.com/ninatu/howtocaption","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"blip-bootstrapping-language-image-pre","repo_url":"https://github.com/2023-MindSpore-4/Code12/tree/main/MindFormers/blip2","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null},{"paper_slug":"blip-bootstrapping-language-image-pre","repo_url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/blip","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null},{"paper_slug":"blip-bootstrapping-language-image-pre","repo_url":"https://github.com/alibaba/EasyNLP/tree/master/examples/blip_retrieval","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"jax","reach":null},{"paper_slug":"blip-bootstrapping-language-image-pre","repo_url":"https://github.com/pwc-1/Paper-8/tree/main/blip","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null},{"paper_slug":"blip-bootstrapping-language-image-pre","repo_url":"https://github.com/towhee-io/towhee","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"image-captioning","task_name":"Image Captioning"},{"task_slug":"image-text-retrieval","task_name":"Image-text Retrieval"},{"task_slug":"image-text-matching","task_name":"Image-text matching"},{"task_slug":"open-vocabulary-attribute-detection","task_name":"Open Vocabulary Attribute Detection"},{"task_slug":"retrieval","task_name":"Retrieval"},{"task_slug":"text-retrieval","task_name":"Text Retrieval"},{"task_slug":"visual-question-answering","task_name":"Visual Question Answering (VQA)"},{"task_slug":"visual-reasoning","task_name":"Visual Reasoning"}],"methods":[{"method_slug":"blip","method_name":"BLIP"}],"datasets_introduced":[],"methods_introduced":[{"slug":"blip","name":"BLIP","full_name":"BLIP: Bootstrapping Language-Image Pre-training"}],"results":[{"leaderboard":"/sota/image-captioning-on-nocaps-val-in-domain","task":"Image Captioning","dataset":"nocaps-val-in-domain","model":"BLIP_ViT-L","rank_in_archive_order":5,"of":11,"metrics":{"CIDEr":"114.9","Pre-train (#images)":"129M","SPICE":"15.2"},"uses_additional_data":false},{"leaderboard":"/sota/image-captioning-on-nocaps-val-in-domain","task":"Image Captioning","dataset":"nocaps-val-in-domain","model":"BLIP_CapFilt-L","rank_in_archive_order":7,"of":11,"metrics":{"CIDEr":"111.8","Pre-train (#images)":"129M","SPICE":"14.9"},"uses_additional_data":false},{"leaderboard":"/sota/image-captioning-on-nocaps-val-near-domain","task":"Image Captioning","dataset":"nocaps-val-near-domain","model":"BLIP_ViT-L","rank_in_archive_order":5,"of":10,"metrics":{"CIDEr":"112.1","Pre-train (#images)":"129M","SPICE":" 14.9"},"uses_additional_data":false},{"leaderboard":"/sota/image-captioning-on-nocaps-val-near-domain","task":"Image Captioning","dataset":"nocaps-val-near-domain","model":"BLIP_CapFilt-L","rank_in_archive_order":7,"of":10,"metrics":{"CIDEr":"108.6","Pre-train (#images)":"129M","SPICE":"14.8"},"uses_additional_data":false},{"leaderboard":"/sota/image-captioning-on-nocaps-val-out-domain","task":"Image Captioning","dataset":"nocaps-val-out-domain","model":"BLIP_ViT-L","rank_in_archive_order":4,"of":10,"metrics":{"CIDEr":"115.3","Pretrain (#images)":"129M","SPICE":" 14.4"},"uses_additional_data":false},{"leaderboard":"/sota/image-captioning-on-nocaps-val-out-domain","task":"Image Captioning","dataset":"nocaps-val-out-domain","model":"BLIP_CapFilt-L","rank_in_archive_order":6,"of":10,"metrics":{"CIDEr":"111.5","Pretrain (#images)":"129M","SPICE":"14.2"},"uses_additional_data":false},{"leaderboard":"/sota/image-captioning-on-nocaps-val-overall","task":"Image Captioning","dataset":"nocaps-val-overall","model":"BLIP_ViT-L","rank_in_archive_order":5,"of":11,"metrics":{"CIDEr":" 113.2","Pretrain (#images)":"129M","SPICE":"14.8"},"uses_additional_data":false},{"leaderboard":"/sota/image-captioning-on-nocaps-val-overall","task":"Image Captioning","dataset":"nocaps-val-overall","model":"BLIP_CapFilt-L","rank_in_archive_order":7,"of":11,"metrics":{"CIDEr":"109.6","Pretrain (#images)":"129M","SPICE":"14.7"},"uses_additional_data":false},{"leaderboard":"/sota/image-text-matching-on-commercialadsdataset","task":"Image-text matching","dataset":"CommercialAdsDataset","model":"BLIP","rank_in_archive_order":6,"of":8,"metrics":{"ADD(S) AUC":"83.51"},"uses_additional_data":false},{"leaderboard":"/sota/open-vocabulary-attribute-detection-on-ovad-1","task":"Open Vocabulary Attribute Detection","dataset":"OVAD-Box benchmark","model":"BLIP","rank_in_archive_order":3,"of":7,"metrics":{"mean average precision":"24.3"},"uses_additional_data":true},{"leaderboard":"/sota/visual-reasoning-on-nlvr2-test","task":"Visual Reasoning","dataset":"NLVR2 Test","model":"BLIP-129M","rank_in_archive_order":9,"of":14,"metrics":{"Accuracy":"83.09"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2201.12086","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}