{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multimodal-reasoning/papers/2","list_of":"/task/multimodal-reasoning","task":"Multimodal Reasoning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":4,"rows_per_page":100,"rows":[101,200],"of":302,"counts":{"archive_papers_tagged":302,"with_a_code_link":138,"where_syntology_ran_a_sample":52,"not_listed_spam_title":0,"listed":302,"listed_where_code_ran":52,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":43,"every_run_a_failure_of_syntologys_instrument":9,"listed_with_a_run_with_no_instrument_failure":43,"listed_every_run_a_failure_of_syntologys_instrument":9,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multimodal-reasoning","prev":"/task/multimodal-reasoning","next":"/task/multimodal-reasoning/papers/3","papers":[{"url":"/paper/controllable-contextualized-image-captioning","slug":"controllable-contextualized-image-captioning","title":"Controllable Contextualized Image Captioning: Directing the Visual Narrative through User-Defined Highlights","date":"2024-07-16","arxiv_id":"2407.11449","repositories_listed":1,"syntology":null},{"url":"/paper/mfc-bench-benchmarking-multimodal-fact","slug":"mfc-bench-benchmarking-multimodal-fact","title":"MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models","date":"2024-06-17","arxiv_id":"2406.11288","repositories_listed":1,"syntology":null},{"url":"/paper/don-t-buy-it-reassessing-the-ad-understanding","slug":"don-t-buy-it-reassessing-the-ad-understanding","title":"Don't Buy it! Reassessing the Ad Understanding Abilities of Contrastive Multimodal Models","date":"2024-05-31","arxiv_id":"2405.20846","repositories_listed":1,"syntology":null},{"url":"/paper/m4u-evaluating-multilingual-understanding-and","slug":"m4u-evaluating-multilingual-understanding-and","title":"M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal Models","date":"2024-05-24","arxiv_id":"2405.15638","repositories_listed":1,"syntology":null},{"url":"/paper/cofipara-a-coarse-to-fine-paradigm-for","slug":"cofipara-a-coarse-to-fine-paradigm-for","title":"CofiPara: A Coarse-to-fine Paradigm for Multimodal Sarcasm Target Identification with Large Multimodal Models","date":"2024-05-01","arxiv_id":"2405.00390","repositories_listed":1,"syntology":{"n":21,"n_ran":18,"n_constructed":0,"n_ran_checked":18,"n_instrument":0,"n_unverified":3,"n_honours":0,"n_violates":0,"n_no_contract":18,"n_pointer_only":21,"phrase":"18 ran (of which 0 constructed an object rather than computing a result; 18 with no instrument failure: 0 honoured, 0 violated, 18 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/cofipara-a-coarse-to-fine-paradigm-for#ran","syntology_url":"https://syntology.ai/paper/2405.00390","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2405.00390"}},"official":{"repos":["lbotirx/cofipara"],"state":"official: no sample here; runs from other or unrecorded repositories","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["found_in_text"]}}},{"url":"/paper/exploring-the-transferability-of-visual","slug":"exploring-the-transferability-of-visual","title":"Exploring the Transferability of Visual Prompting for Multimodal Large Language Models","date":"2024-04-17","arxiv_id":"2404.11207","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"0 ran · 1 unverified","sample_list":"/paper/exploring-the-transferability-of-visual#ran","syntology_url":"https://syntology.ai/paper/2404.11207","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2404.11207"}},"official":{"repos":["zycheiheihei/transferable-visual-prompting"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/advancing-geometric-problem-solving-a","slug":"advancing-geometric-problem-solving-a","title":"MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification","date":"2024-04-07","arxiv_id":"2404.05091","repositories_listed":1,"syntology":null},{"url":"/paper/a-picture-is-worth-a-graph-blueprint-debate","slug":"a-picture-is-worth-a-graph-blueprint-debate","title":"A Picture Is Worth a Graph: A Blueprint Debate Paradigm for Multimodal Reasoning","date":"2024-03-22","arxiv_id":"2403.14972","repositories_listed":1,"syntology":null},{"url":"/paper/veglue-testing-visual-entailment-systems-via","slug":"veglue-testing-visual-entailment-systems-via","title":"VEglue: Testing Visual Entailment Systems via Object-Aligned Joint Erasing","date":"2024-03-05","arxiv_id":"2403.02581","repositories_listed":1,"syntology":null},{"url":"/paper/all-in-a-single-image-large-multimodal-models","slug":"all-in-a-single-image-large-multimodal-models","title":"All in an Aggregated Image for In-Image Learning","date":"2024-02-28","arxiv_id":"2402.17971","repositories_listed":1,"syntology":null},{"url":"/paper/measuring-vision-language-stem-skills-of","slug":"measuring-vision-language-stem-skills-of","title":"Measuring Vision-Language STEM Skills of Neural Models","date":"2024-02-27","arxiv_id":"2402.17205","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/measuring-vision-language-stem-skills-of#ran","syntology_url":"https://syntology.ai/paper/2402.17205","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2402.17205"}},"official":{"repos":["stemdataset/STEM"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/measuring-multimodal-mathematical-reasoning","slug":"measuring-multimodal-mathematical-reasoning","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","date":"2024-02-22","arxiv_id":"2402.14804","repositories_listed":1,"syntology":null},{"url":"/paper/stop-reasoning-when-multimodal-llms-with","slug":"stop-reasoning-when-multimodal-llms-with","title":"Stop Reasoning! When Multimodal LLM with Chain-of-Thought Reasoning Meets Adversarial Image","date":"2024-02-22","arxiv_id":"2402.14899","repositories_listed":1,"syntology":{"n":7,"n_ran":6,"n_constructed":0,"n_ran_checked":3,"n_instrument":3,"n_unverified":1,"n_honours":0,"n_violates":1,"n_no_contract":2,"n_pointer_only":7,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 1 violated, 2 with no contract checked; 3 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/stop-reasoning-when-multimodal-llms-with#ran","syntology_url":"https://syntology.ai/paper/2402.14899","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2402.14899"}},"official":{"repos":["aipenguin/stopreasoning"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/crema-multimodal-compositional-video","slug":"crema-multimodal-compositional-video","title":"CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion","date":"2024-02-08","arxiv_id":"2402.05889","repositories_listed":1,"syntology":{"n":10,"n_ran":8,"n_constructed":0,"n_ran_checked":3,"n_instrument":5,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":1,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 5 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/crema-multimodal-compositional-video#ran","syntology_url":"https://syntology.ai/paper/2402.05889","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2402.05889"}},"official":{"repos":["Yui010206/CREMA"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/on-the-generalization-capacity-of-neural","slug":"on-the-generalization-capacity-of-neural","title":"On the generalization capacity of neural networks during generic multimodal reasoning","date":"2024-01-26","arxiv_id":"2401.15030","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/on-the-generalization-capacity-of-neural#ran","syntology_url":"https://syntology.ai/paper/2401.15030","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2401.15030"}},"official":{"repos":["ibm/gcog"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/towards-a-unified-multimodal-reasoning","slug":"towards-a-unified-multimodal-reasoning","title":"Towards a Unified Multimodal Reasoning Framework","date":"2023-12-22","arxiv_id":"2312.15021","repositories_listed":1,"syntology":null},{"url":"/paper/beneath-the-surface-unveiling-harmful-memes","slug":"beneath-the-surface-unveiling-harmful-memes","title":"Beneath the Surface: Unveiling Harmful Memes with Multimodal Reasoning Distilled from Large Language Models","date":"2023-12-09","arxiv_id":"2312.05434","repositories_listed":1,"syntology":null},{"url":"/paper/boosting-the-power-of-small-multimodal","slug":"boosting-the-power-of-small-multimodal","title":"Boosting the Power of Small Multimodal Reasoning Models to Match Larger Models with Self-Consistency Training","date":"2023-11-23","arxiv_id":"2311.14109","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/boosting-the-power-of-small-multimodal#ran","syntology_url":"https://syntology.ai/paper/2311.14109","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2311.14109"}},"official":{"repos":["chengtan9907/mc-cot"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/apollo-zero-shot-multimodal-reasoning-with","slug":"apollo-zero-shot-multimodal-reasoning-with","title":"Apollo: Zero-shot MultiModal Reasoning with Multiple Experts","date":"2023-10-25","arxiv_id":"2310.18369","repositories_listed":1,"syntology":null},{"url":"/paper/domino-a-dual-system-for-multi-step-visual","slug":"domino-a-dual-system-for-multi-step-visual","title":"DOMINO: A Dual-System for Multi-step Visual Language Reasoning","date":"2023-10-04","arxiv_id":"2310.02804","repositories_listed":1,"syntology":null},{"url":"/paper/enhancing-human-like-multi-modal-reasoning-a","slug":"enhancing-human-like-multi-modal-reasoning-a","title":"Enhancing Human-like Multi-Modal Reasoning: A New Challenging Dataset and Comprehensive Framework","date":"2023-07-24","arxiv_id":"2307.12626","repositories_listed":1,"syntology":{"n":9,"n_ran":7,"n_constructed":0,"n_ran_checked":3,"n_instrument":4,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":9,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 4 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/enhancing-human-like-multi-modal-reasoning-a#ran","syntology_url":"https://syntology.ai/paper/2307.12626","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2307.12626"}},"official":{"repos":["weijingxuan/COCO-MMR"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/llm-itself-can-read-and-generate-cxr-images","slug":"llm-itself-can-read-and-generate-cxr-images","title":"LLM-CXR: Instruction-Finetuned LLM for CXR Image Understanding and Generation","date":"2023-05-19","arxiv_id":"2305.11490","repositories_listed":1,"syntology":{"n":12,"n_ran":7,"n_constructed":0,"n_ran_checked":5,"n_instrument":2,"n_unverified":5,"n_honours":0,"n_violates":0,"n_no_contract":5,"n_pointer_only":1,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 2 where Syntology's instrument failed) · 5 unverified","sample_list":"/paper/llm-itself-can-read-and-generate-cxr-images#ran","syntology_url":"https://syntology.ai/paper/2305.11490","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2305.11490"}},"official":{"repos":["hyn2028/llm-cxr"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":0,"n_ran_no_instrument_failure":5,"n_unverified":5,"ran_from_kinds":["official"]}}},{"url":"/paper/mm-react-prompting-chatgpt-for-multimodal","slug":"mm-react-prompting-chatgpt-for-multimodal","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","date":"2023-03-20","arxiv_id":"2303.11381","repositories_listed":1,"syntology":{"n":4,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/mm-react-prompting-chatgpt-for-multimodal#ran","syntology_url":"https://syntology.ai/paper/2303.11381","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2303.11381"}},"official":{"repos":["microsoft/MM-REACT"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/variational-causal-inference-network-for","slug":"variational-causal-inference-network-for","title":"Variational Causal Inference Network for Explanatory Visual Question Answering","date":"2023-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/modal-specific-pseudo-query-generation-for","slug":"modal-specific-pseudo-query-generation-for","title":"Modal-specific Pseudo Query Generation for Video Corpus Moment Retrieval","date":"2022-10-23","arxiv_id":"2210.12617","repositories_listed":1,"syntology":null},{"url":"/paper/do-vision-and-language-transformers-learn","slug":"do-vision-and-language-transformers-learn","title":"Do Vision-and-Language Transformers Learn Grounded Predicate-Noun Dependencies?","date":"2022-10-21","arxiv_id":"2210.12079","repositories_listed":1,"syntology":null},{"url":"/paper/learn-to-explain-multimodal-reasoning-via","slug":"learn-to-explain-multimodal-reasoning-via","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","date":"2022-09-20","arxiv_id":"2209.09513","repositories_listed":1,"syntology":{"n":5,"n_ran":4,"n_constructed":0,"n_ran_checked":0,"n_instrument":4,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":2,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 4 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/learn-to-explain-multimodal-reasoning-via#ran","syntology_url":"https://syntology.ai/paper/2209.09513","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2209.09513"}},"official":{"repos":["lupantech/ScienceQA"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official","unlocated"]}}},{"url":"/paper/socratic-models-composing-zero-shot","slug":"socratic-models-composing-zero-shot","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","date":"2022-04-01","arxiv_id":"2204.00598","repositories_listed":1,"syntology":null},{"url":"/paper/do-vision-language-pretrained-models-learn","slug":"do-vision-language-pretrained-models-learn","title":"Do Vision-Language Pretrained Models Learn Composable Primitive Concepts?","date":"2022-03-31","arxiv_id":"2203.17271","repositories_listed":1,"syntology":{"n":4,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 1 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/do-vision-language-pretrained-models-learn#ran","syntology_url":"https://syntology.ai/paper/2203.17271","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2203.17271"}},"official":{"repos":["tttyuntian/vlm_primitive_concepts"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/fine-grained-visual-entailment","slug":"fine-grained-visual-entailment","title":"Fine-Grained Visual Entailment","date":"2022-03-29","arxiv_id":"2203.15704","repositories_listed":1,"syntology":null},{"url":"/paper/shifting-more-attention-to-visual-backbone","slug":"shifting-more-attention-to-visual-backbone","title":"Shifting More Attention to Visual Backbone: Query-modulated Refinement Networks for End-to-End Visual Grounding","date":"2022-03-29","arxiv_id":"2203.15442","repositories_listed":1,"syntology":null},{"url":"/paper/pacs-a-dataset-for-physical-audiovisual","slug":"pacs-a-dataset-for-physical-audiovisual","title":"PACS: A Dataset for Physical Audiovisual CommonSense Reasoning","date":"2022-03-21","arxiv_id":"2203.11130","repositories_listed":1,"syntology":null},{"url":"/paper/towers-of-babel-combining-images-language-and","slug":"towers-of-babel-combining-images-language-and","title":"Towers of Babel: Combining Images, Language, and 3D Geometry for Learning Multimodal Vision","date":"2021-08-12","arxiv_id":"2108.05863","repositories_listed":1,"syntology":null},{"url":"/paper/merlot-multimodal-neural-script-knowledge","slug":"merlot-multimodal-neural-script-knowledge","title":"MERLOT: Multimodal Neural Script Knowledge Models","date":"2021-06-04","arxiv_id":"2106.02636","repositories_listed":1,"syntology":{"n":14,"n_ran":9,"n_constructed":0,"n_ran_checked":9,"n_instrument":0,"n_unverified":5,"n_honours":0,"n_violates":0,"n_no_contract":9,"n_pointer_only":2,"phrase":"9 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 0 honoured, 0 violated, 9 with no contract checked; 0 where Syntology's instrument failed) · 5 unverified","sample_list":"/paper/merlot-multimodal-neural-script-knowledge#ran","syntology_url":"https://syntology.ai/paper/2106.02636","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2106.02636"}},"official":null}},{"url":"/paper/visual-goal-step-inference-using-wikihow","slug":"visual-goal-step-inference-using-wikihow","title":"Visual Goal-Step Inference using wikiHow","date":"2021-04-12","arxiv_id":"2104.05845","repositories_listed":1,"syntology":null},{"url":"/paper/transformer-is-all-you-need-multimodal","slug":"transformer-is-all-you-need-multimodal","title":"UniT: Multimodal Multitask Learning with a Unified Transformer","date":"2021-02-22","arxiv_id":"2102.10772","repositories_listed":1,"syntology":null},{"url":"/paper/a-multimodal-framework-for-the-detection-of","slug":"a-multimodal-framework-for-the-detection-of","title":"A Multimodal Framework for the Detection of Hateful Memes","date":"2020-12-23","arxiv_id":"2012.12871","repositories_listed":1,"syntology":null},{"url":"/paper/dmrm-a-dual-channel-multi-hop-reasoning-model","slug":"dmrm-a-dual-channel-multi-hop-reasoning-model","title":"DMRM: A Dual-channel Multi-hop Reasoning Model for Visual Dialog","date":"2019-12-18","arxiv_id":"1912.08360","repositories_listed":1,"syntology":null},{"url":null,"slug":"egoprune-efficient-token-pruning-for","title":"EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent","date":"2025-07-21","arxiv_id":"2507.15428","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-reliability-in-the-reasoning-based","title":"Revisiting Reliability in the Reasoning-based Pose Estimation Benchmark","date":"2025-07-17","arxiv_id":"2507.13314","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-synergy-dilemma-of-long-cot-sft-and-rl","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","date":"2025-07-10","arxiv_id":"2507.07562","repositories_listed":0,"syntology":null},{"url":null,"slug":"magic-evaluating-multimodal-cognition-toward","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","date":"2025-07-09","arxiv_id":"2507.07297","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-scientific-visual-question","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","date":"2025-07-08","arxiv_id":"2507.06183","repositories_listed":0,"syntology":null},{"url":null,"slug":"perception-aware-policy-optimization-for","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","date":"2025-07-08","arxiv_id":"2507.06448","repositories_listed":0,"syntology":null},{"url":null,"slug":"apo-enhancing-reasoning-ability-of-mllms-via","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","date":"2025-06-26","arxiv_id":"2506.21655","repositories_listed":0,"syntology":null},{"url":null,"slug":"multifinrag-an-optimized-multimodal-retrieval","title":"MultiFinRAG: An Optimized Multimodal Retrieval-Augmented Generation (RAG) Framework for Financial Question Answering","date":"2025-06-25","arxiv_id":"2506.20821","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-vision-language-models-for","title":"Adapting Vision-Language Models for Evaluating World Models","date":"2025-06-22","arxiv_id":"2506.17967","repositories_listed":0,"syntology":null},{"url":null,"slug":"geoguess-multimodal-reasoning-based-on","title":"GeoGuess: Multimodal Reasoning based on Hierarchy of Visual Information in Street View","date":"2025-06-19","arxiv_id":"2506.16633","repositories_listed":0,"syntology":null},{"url":null,"slug":"grpo-care-consistency-aware-reinforcement","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","date":"2025-06-19","arxiv_id":"2506.16141","repositories_listed":0,"syntology":null},{"url":null,"slug":"megc2025-micro-expression-grand-challenge-on","title":"MEGC2025: Micro-Expression Grand Challenge on Spot Then Recognize and Visual Question Answering","date":"2025-06-18","arxiv_id":"2506.15298","repositories_listed":0,"syntology":null},{"url":null,"slug":"perl-permutation-enhanced-reinforcement","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","date":"2025-06-17","arxiv_id":"2506.14907","repositories_listed":0,"syntology":null},{"url":null,"slug":"radfabric-agentic-ai-system-with-reasoning","title":"RadFabric: Agentic AI System with Reasoning Capability for Radiology","date":"2025-06-17","arxiv_id":"2506.14142","repositories_listed":0,"syntology":null},{"url":null,"slug":"finlmm-r1-enhancing-financial-reasoning-in","title":"FinLMM-R1: Enhancing Financial Reasoning in LMM through Scalable Data and Reward Design","date":"2025-06-16","arxiv_id":"2506.13066","repositories_listed":0,"syntology":null},{"url":null,"slug":"vl-genrm-enhancing-vision-language","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","date":"2025-06-16","arxiv_id":"2506.13888","repositories_listed":0,"syntology":null},{"url":null,"slug":"mm-r5-multimodal-reasoning-enhanced-reranker","title":"MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval","date":"2025-06-14","arxiv_id":"2506.12364","repositories_listed":0,"syntology":null},{"url":null,"slug":"fednano-toward-lightweight-federated-tuning","title":"FedNano: Toward Lightweight Federated Tuning for Pretrained Multimodal Large Language Models","date":"2025-06-12","arxiv_id":"2506.14824","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmmg-a-massive-multidisciplinary-multi-tier","title":"MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning","date":"2025-06-12","arxiv_id":"2506.10963","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimus-3-towards-generalist-multimodal","title":"Optimus-3: Towards Generalist Multimodal Minecraft Agents with Scalable Task Experts","date":"2025-06-12","arxiv_id":"2506.10357","repositories_listed":0,"syntology":null},{"url":null,"slug":"scientists-first-exam-probing-cognitive","title":"Scientists' First Exam: Probing Cognitive Abilities of MLLM via Perception, Understanding, and Reasoning","date":"2025-06-12","arxiv_id":"2506.10521","repositories_listed":0,"syntology":null},{"url":null,"slug":"chartreasoner-code-driven-modality-bridging","title":"ChartReasoner: Code-Driven Modality Bridging for Long-Chain Reasoning in Chart Question Answering","date":"2025-06-11","arxiv_id":"2506.10116","repositories_listed":0,"syntology":null},{"url":null,"slug":"wait-we-don-t-need-to-wait-removing-thinking","title":"Wait, We Don't Need to \"Wait\"! Removing Thinking Tokens Improves Reasoning Efficiency","date":"2025-06-10","arxiv_id":"2506.08343","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoupling-the-image-perception-and","title":"Decoupling the Image Perception and Multimodal Reasoning for Reasoning Segmentation with Digital Twin Representations","date":"2025-06-09","arxiv_id":"2506.07943","repositories_listed":0,"syntology":null},{"url":null,"slug":"kokushimd-10-benchmark-for-evaluating-large","title":"KokushiMD-10: Benchmark for Evaluating Large Language Models on Ten Japanese National Healthcare Licensing Examinations","date":"2025-06-09","arxiv_id":"2506.11114","repositories_listed":0,"syntology":null},{"url":null,"slug":"look-before-you-leap-a-gui-critic-r1-model","title":"Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation","date":"2025-06-05","arxiv_id":"2506.04614","repositories_listed":0,"syntology":null},{"url":null,"slug":"musciclaims-multimodal-scientific-claim","title":"MuSciClaims: Multimodal Scientific Claim Verification","date":"2025-06-05","arxiv_id":"2506.04585","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-multimodal-reasoning-from-optimized","title":"Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning","date":"2025-06-04","arxiv_id":"2506.04207","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmr-v-what-s-left-unsaid-a-benchmark-for","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","date":"2025-06-04","arxiv_id":"2506.04141","repositories_listed":0,"syntology":null},{"url":null,"slug":"rsvp-reasoning-segmentation-via-visual","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","date":"2025-06-04","arxiv_id":"2506.04277","repositories_listed":0,"syntology":null},{"url":null,"slug":"srpo-enhancing-multimodal-llm-reasoning-via","title":"SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning","date":"2025-06-02","arxiv_id":"2506.01713","repositories_listed":0,"syntology":null},{"url":null,"slug":"gthinker-towards-general-multimodal-reasoning","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","date":"2025-06-01","arxiv_id":"2506.01078","repositories_listed":0,"syntology":null},{"url":null,"slug":"mirage-assessing-hallucination-in-multimodal","title":"MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM","date":"2025-05-30","arxiv_id":"2505.24238","repositories_listed":0,"syntology":null},{"url":null,"slug":"argus-vision-centric-reasoning-with-grounded","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","date":"2025-05-29","arxiv_id":"2505.23766","repositories_listed":0,"syntology":null},{"url":null,"slug":"elicit-and-enhance-advancing-multimodal","title":"Elicit and Enhance: Advancing Multimodal Reasoning in Medical Scenarios","date":"2025-05-29","arxiv_id":"2505.23118","repositories_listed":0,"syntology":null},{"url":null,"slug":"gam-agent-game-theoretic-and-uncertainty","title":"GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning","date":"2025-05-29","arxiv_id":"2505.23399","repositories_listed":0,"syntology":null},{"url":null,"slug":"infi-med-low-resource-medical-mllms-with","title":"Infi-Med: Low-Resource Medical MLLMs with Robust Reasoning Evaluation","date":"2025-05-29","arxiv_id":"2505.23867","repositories_listed":0,"syntology":null},{"url":null,"slug":"infi-mmr-curriculum-based-unlocking","title":"Infi-MMR: Curriculum-based Unlocking Multimodal Reasoning via Phased Reinforcement Learning in Multimodal Small Language Models","date":"2025-05-29","arxiv_id":"2505.23091","repositories_listed":0,"syntology":null},{"url":null,"slug":"preemptive-hallucination-reduction-an-input","title":"Preemptive Hallucination Reduction: An Input-Level Approach for Multimodal Language Model","date":"2025-05-29","arxiv_id":"2505.24007","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualsphinx-large-scale-synthetic-vision","title":"VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL","date":"2025-05-29","arxiv_id":"2505.23977","repositories_listed":0,"syntology":null},{"url":null,"slug":"omniad-detect-and-understand-industrial","title":"OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning","date":"2025-05-28","arxiv_id":"2505.22039","repositories_listed":0,"syntology":null},{"url":null,"slug":"sam-r1-leveraging-sam-for-reward-feedback-in","title":"SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning","date":"2025-05-28","arxiv_id":"2505.22596","repositories_listed":0,"syntology":null},{"url":null,"slug":"mme-reasoning-a-comprehensive-benchmark-for","title":"MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs","date":"2025-05-27","arxiv_id":"2505.21327","repositories_listed":0,"syntology":null},{"url":null,"slug":"agentic-3d-scene-generation-with-spatially","title":"Agentic 3D Scene Generation with Spatially Contextualized VLMs","date":"2025-05-26","arxiv_id":"2505.20129","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamprm-domain-reweighted-process-reward","title":"DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning","date":"2025-05-26","arxiv_id":"2505.20241","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-reasoning-agent-for-zero-shot","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","date":"2025-05-26","arxiv_id":"2505.19952","repositories_listed":0,"syntology":null},{"url":null,"slug":"point-rft-improving-multimodal-reasoning-with","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","date":"2025-05-26","arxiv_id":"2505.19702","repositories_listed":0,"syntology":null},{"url":null,"slug":"aspo-adaptive-sentence-level-preference","title":"ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning","date":"2025-05-25","arxiv_id":"2505.19100","repositories_listed":0,"syntology":null},{"url":null,"slug":"don-t-look-only-once-towards-multimodal","title":"Don't Look Only Once: Towards Multimodal Interactive Reasoning with Selective Visual Revisitation","date":"2025-05-24","arxiv_id":"2505.18842","repositories_listed":0,"syntology":null},{"url":null,"slug":"evade-multimodal-benchmark-for-evasive","title":"EVADE: Multimodal Benchmark for Evasive Content Detection in E-Commerce Applications","date":"2025-05-23","arxiv_id":"2505.17654","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmmg-a-comprehensive-and-reliable-evaluation","title":"MMMG: a Comprehensive and Reliable Evaluation Suite for Multitask Multimodal Generation","date":"2025-05-23","arxiv_id":"2505.17613","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-thinking-less-seeing-assessing-amplified","title":"More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models","date":"2025-05-23","arxiv_id":"2505.21523","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-free-reasoning-and-reflection-in","title":"Training-Free Reasoning and Reflection in MLLMs","date":"2025-05-22","arxiv_id":"2505.16151","repositories_listed":0,"syntology":null},{"url":null,"slug":"chain-of-focus-adaptive-visual-search-and","title":"Chain-of-Focus: Adaptive Visual Search and Zooming for Multimodal Reasoning via RL","date":"2025-05-21","arxiv_id":"2505.15436","repositories_listed":0,"syntology":null},{"url":null,"slug":"lens-multi-level-evaluation-of-multimodal","title":"LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models","date":"2025-05-21","arxiv_id":"2505.15616","repositories_listed":0,"syntology":null},{"url":null,"slug":"moralise-a-structured-benchmark-for-moral","title":"MORALISE: A Structured Benchmark for Moral Alignment in Visual Language Models","date":"2025-05-20","arxiv_id":"2505.14728","repositories_listed":0,"syntology":null},{"url":null,"slug":"adatoken-3d-dynamic-spatial-gating-for","title":"AdaToken-3D: Dynamic Spatial Gating for Efficient 3D Large Multimodal-Models Reasoning","date":"2025-05-19","arxiv_id":"2505.12782","repositories_listed":0,"syntology":null},{"url":null,"slug":"incentivizing-multimodal-reasoning-in-large","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","date":"2025-05-19","arxiv_id":"2505.12744","repositories_listed":0,"syntology":null},{"url":null,"slug":"unlocking-the-potential-of-difficulty-prior","title":"Unlocking the Potential of Difficulty Prior in RL-based Multimodal Reasoning","date":"2025-05-19","arxiv_id":"2505.13261","repositories_listed":0,"syntology":null},{"url":null,"slug":"mms-vpr-multimodal-street-level-visual-place","title":"MMS-VPR: Multimodal Street-Level Visual Place Recognition Dataset and Benchmark","date":"2025-05-18","arxiv_id":"2505.12254","repositories_listed":0,"syntology":null},{"url":null,"slug":"prs-med-position-reasoning-segmentation-with","title":"PRS-Med: Position Reasoning Segmentation with Vision-Language Model in Medical Imaging","date":"2025-05-17","arxiv_id":"2505.11872","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-11141","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","date":"2025-05-16","arxiv_id":"2505.11141","repositories_listed":0,"syntology":null}],"record_sha256":"3dbcb05bf50f30c145a8171176a31c3fc4bccbaaa05484c16619f97ac3d81cd2","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}