{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/cocot-contrastive-chain-of-thought-prompting","title":"CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs","arxiv_id":"2401.02582","date":"2024-01-05","proceeding":null,"authors":["Daoan Zhang","Junming Yang","Hanjia Lyu","Zijian Jin","Yuan YAO","Mingkai Chen","Jiebo Luo"],"abstract":"When exploring the development of Artificial General Intelligence (AGI), a critical task for these models involves interpreting and processing information from multiple image inputs. However, Large Multimodal Models (LMMs) encounter two issues in such scenarios: (1) a lack of fine-grained perception, and (2) a tendency to blend information across multiple images. We first extensively investigate the capability of LMMs to perceive fine-grained visual details when dealing with multiple input images. The research focuses on two aspects: first, image-to-image matching (to evaluate whether LMMs can effectively reason and pair relevant images), and second, multi-image-to-text matching (to assess whether LMMs can accurately capture and summarize detailed image information). We conduct evaluations on a range of both open-source and closed-source large models, including GPT-4V, Gemini, OpenFlamingo, and MMICL. To enhance model performance, we further develop a Contrastive Chain-of-Thought (CoCoT) prompting approach based on multi-input multimodal models. This method requires LMMs to compare the similarities and differences among multiple image inputs, and then guide the models to answer detailed questions about multi-image inputs based on the identified similarities and differences. Our experimental results showcase CoCoT's proficiency in enhancing the multi-image comprehension capabilities of large multimodal models.","url_abs":"https://arxiv.org/abs/2401.02582v1","url_pdf":"https://arxiv.org/pdf/2401.02582v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"cocot-contrastive-chain-of-thought-prompting","repo_url":"https://github.com/vista-h/gpt-4v_social_media","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"ok"}}],"tasks":[{"task_slug":"image-comprehension","task_name":"Image Comprehension"},{"task_slug":"image-to-text","task_name":"Image to text"},{"task_slug":"text-matching","task_name":"Text Matching"},{"task_slug":"visual-reasoning","task_name":"Visual Reasoning"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/visual-reasoning-on-winoground","task":"Visual Reasoning","dataset":"Winoground","model":"MMICL + CoCoT","rank_in_archive_order":4,"of":114,"metrics":{"Group Score":"50.75","Image Score":"52.5","Text Score":"64.25"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-winoground","task":"Visual Reasoning","dataset":"Winoground","model":"GPT-4V + CoCoT","rank_in_archive_order":5,"of":114,"metrics":{"Group Score":"44.5","Image Score":"49.5","Text Score":"58.5"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-winoground","task":"Visual Reasoning","dataset":"Winoground","model":"OpenFlamingo + CoCoT","rank_in_archive_order":6,"of":114,"metrics":{"Group Score":"41.5","Image Score":"55.25","Text Score":"58.25"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-winoground","task":"Visual Reasoning","dataset":"Winoground","model":"GPT-4V","rank_in_archive_order":7,"of":114,"metrics":{"Group Score":"37.75","Image Score":"42.5","Text Score":"54.5"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-winoground","task":"Visual Reasoning","dataset":"Winoground","model":"MMICL + CCoT","rank_in_archive_order":10,"of":114,"metrics":{"Group Score":"47.5","Image Score":"48","Text Score":"51"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-winoground","task":"Visual Reasoning","dataset":"Winoground","model":"OpenFlamingo + DDCoT","rank_in_archive_order":11,"of":114,"metrics":{"Group Score":"39","Image Score":"47.25","Text Score":"47.5"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-winoground","task":"Visual Reasoning","dataset":"Winoground","model":"MMICL + DDCoT","rank_in_archive_order":13,"of":114,"metrics":{"Group Score":"36.75","Image Score":"45","Text Score":"46.75"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-winoground","task":"Visual Reasoning","dataset":"Winoground","model":"Gemini + DDCoT","rank_in_archive_order":19,"of":114,"metrics":{"Group Score":"23.75","Image Score":"25","Text Score":"45"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-winoground","task":"Visual Reasoning","dataset":"Winoground","model":"OpenFlamingo + CCoT","rank_in_archive_order":28,"of":114,"metrics":{"Group Score":"20","Image Score":"27.5","Text Score":"42.5"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-winoground","task":"Visual Reasoning","dataset":"Winoground","model":"Gemini + CoCoT","rank_in_archive_order":37,"of":114,"metrics":{"Group Score":"27.75","Image Score":"32.5","Text Score":"40"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-winoground","task":"Visual Reasoning","dataset":"Winoground","model":"OpenFlamingo","rank_in_archive_order":40,"of":114,"metrics":{"Group Score":"33.25","Image Score":"41.25","Text Score":"39"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-winoground","task":"Visual Reasoning","dataset":"Winoground","model":"Gemini","rank_in_archive_order":63,"of":114,"metrics":{"Group Score":"25","Image Score":"26","Text Score":"30.75"},"uses_additional_data":false},{"leaderboard":"/sota/visual-reasoning-on-winoground","task":"Visual Reasoning","dataset":"Winoground","model":"Gemini + CCoT","rank_in_archive_order":96,"of":114,"metrics":{"Group Score":"20.75","Image Score":"33","Text Score":"22.5"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2401.02582","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}