{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/conceptual-12m-pushing-web-scale-image-text","title":"Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual Concepts","arxiv_id":"2102.08981","date":"2021-02-17","proceeding":"CVPR 2021 1","authors":["Soravit Changpinyo","Piyush Sharma","Nan Ding","Radu Soricut"],"abstract":"The availability of large-scale image captioning and visual question answering datasets has contributed significantly to recent successes in vision-and-language pre-training. However, these datasets are often collected with overrestrictive requirements inherited from their original target tasks (e.g., image caption generation), which limit the resulting dataset scale and diversity. We take a step further in pushing the limits of vision-and-language pre-training data by relaxing the data collection pipeline used in Conceptual Captions 3M (CC3M) [Sharma et al. 2018] and introduce the Conceptual 12M (CC12M), a dataset with 12 million image-text pairs specifically meant to be used for vision-and-language pre-training. We perform an analysis of this dataset and benchmark its effectiveness against CC3M on multiple downstream tasks with an emphasis on long-tail visual recognition. Our results clearly illustrate the benefit of scaling up pre-training data for vision-and-language tasks, as indicated by the new state-of-the-art results on both the nocaps and Conceptual Captions benchmarks.","url_abs":"https://arxiv.org/abs/2102.08981v2","url_pdf":"https://arxiv.org/pdf/2102.08981v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"conceptual-12m-pushing-web-scale-image-text","repo_url":"https://github.com/google-research-datasets/conceptual-12m","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"none","reach":{"status":"unanswered"}},{"paper_slug":"conceptual-12m-pushing-web-scale-image-text","repo_url":"https://github.com/facebookresearch/meru","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"conceptual-12m-pushing-web-scale-image-text","repo_url":"https://github.com/gicheonkang/gst-visdial","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"caption-generation","task_name":"Caption Generation"},{"task_slug":"diversity","task_name":"Diversity"},{"task_slug":"image-captioning","task_name":"Image Captioning"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"visual-question-answering-1","task_name":"Visual Question Answering"},{"task_slug":"visual-question-answering","task_name":"Visual Question Answering (VQA)"}],"methods":[],"datasets_introduced":[{"slug":"cc12m","name":"CC12M","full_name":"Conceptual 12M"}],"methods_introduced":[],"results":[{"leaderboard":"/sota/image-captioning-on-nocaps-val-in-domain","task":"Image Captioning","dataset":"nocaps-val-in-domain","model":"Enc-Dec","rank_in_archive_order":11,"of":11,"metrics":{"CIDEr":"92.6","Pre-train (#images)":"15M","SPICE":" 12.5"},"uses_additional_data":false},{"leaderboard":"/sota/image-captioning-on-nocaps-val-near-domain","task":"Image Captioning","dataset":"nocaps-val-near-domain","model":"Enc-Dec","rank_in_archive_order":10,"of":10,"metrics":{"CIDEr":"88.3","SPICE":"12.1"},"uses_additional_data":false},{"leaderboard":"/sota/image-captioning-on-nocaps-val-out-domain","task":"Image Captioning","dataset":"nocaps-val-out-domain","model":"Enc-Dec","rank_in_archive_order":9,"of":10,"metrics":{"CIDEr":"94.5","SPICE":"11.9"},"uses_additional_data":false},{"leaderboard":"/sota/image-captioning-on-nocaps-val-overall","task":"Image Captioning","dataset":"nocaps-val-overall","model":"Enc-Dec","rank_in_archive_order":10,"of":11,"metrics":{"CIDEr":"90.2","SPICE":"12.1"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2102.08981","atlas_url":"https://app.syntology.ai/?focus=2102.08981","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}