{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multimodal-reasoning/papers/3","list_of":"/task/multimodal-reasoning","task":"Multimodal Reasoning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":4,"rows_per_page":100,"rows":[201,300],"of":302,"counts":{"archive_papers_tagged":302,"with_a_code_link":138,"where_syntology_ran_a_sample":52,"not_listed_spam_title":0,"listed":302,"listed_where_code_ran":52,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":43,"every_run_a_failure_of_syntologys_instrument":9,"listed_with_a_run_with_no_instrument_failure":43,"listed_every_run_a_failure_of_syntologys_instrument":9,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multimodal-reasoning","prev":"/task/multimodal-reasoning/papers/2","next":"/task/multimodal-reasoning/papers/4","papers":[{"url":null,"slug":"critique-before-thinking-mitigating","title":"Critique Before Thinking: Mitigating Hallucination through Rationale-Augmented Instruction Tuning","date":"2025-05-12","arxiv_id":"2505.07172","repositories_listed":0,"syntology":null},{"url":null,"slug":"skywork-vl-reward-an-effective-reward-model","title":"Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning","date":"2025-05-12","arxiv_id":"2505.07263","repositories_listed":0,"syntology":null},{"url":null,"slug":"overview-of-the-nlpcc-2025-shared-task-4","title":"Overview of the NLPCC 2025 Shared Task 4: Multi-modal, Multilingual, and Multi-hop Medical Instructional Video Question Answering Challenge","date":"2025-05-11","arxiv_id":"2505.06814","repositories_listed":0,"syntology":null},{"url":"/paper/seed1-5-vl-technical-report","slug":"seed1-5-vl-technical-report","title":"Seed1.5-VL Technical Report","date":"2025-05-11","arxiv_id":"2505.07062","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-heart-ecg-question-answering-via-knowledge","title":"Q-Heart: ECG Question Answering via Knowledge-Informed Multimodal LLMs","date":"2025-05-07","arxiv_id":"2505.06296","repositories_listed":0,"syntology":null},{"url":null,"slug":"stola-self-adaptive-touch-language-framework","title":"SToLa: Self-Adaptive Touch-Language Framework with Tactile Commonsense Reasoning in Open-Ended Scenarios","date":"2025-05-07","arxiv_id":"2505.04201","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-conversational-diagnostic-ai-with","title":"Advancing Conversational Diagnostic AI with Multimodal Reasoning","date":"2025-05-06","arxiv_id":"2505.04653","repositories_listed":0,"syntology":null},{"url":null,"slug":"x-reasoner-towards-generalizable-reasoning","title":"X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains","date":"2025-05-06","arxiv_id":"2505.03981","repositories_listed":0,"syntology":null},{"url":null,"slug":"r-bench-graduate-level-multi-disciplinary","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","date":"2025-05-04","arxiv_id":"2505.02018","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-mllm-a-survey-on-rl-based","title":"Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models","date":"2025-04-30","arxiv_id":"2504.21277","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimind-enhancing-werewolf-agents-with","title":"MultiMind: Enhancing Werewolf Agents with Multimodal Reasoning and Theory of Mind","date":"2025-04-25","arxiv_id":"2504.18039","repositories_listed":0,"syntology":null},{"url":null,"slug":"geosense-evaluating-identification-and","title":"GeoSense: Evaluating Identification and Application of Geometric Principles in Multimodal Reasoning","date":"2025-04-17","arxiv_id":"2504.12597","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlmguard-r1-proactive-safety-alignment-for","title":"VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt Optimization","date":"2025-04-17","arxiv_id":"2504.12661","repositories_listed":0,"syntology":null},{"url":null,"slug":"2506-10008","title":"Structured Graph Representations for Visual Narrative Reasoning: A Hierarchical Framework for Comics","date":"2025-04-14","arxiv_id":"2506.10008","repositories_listed":0,"syntology":null},{"url":null,"slug":"slowfastvad-video-anomaly-detection-via","title":"SlowFastVAD: Video Anomaly Detection via Integrating Simple Detector and RAG-Enhanced Vision-Language Model","date":"2025-04-14","arxiv_id":"2504.10320","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualpuzzles-decoupling-multimodal-reasoning","title":"VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge","date":"2025-04-14","arxiv_id":"2504.10342","repositories_listed":0,"syntology":null},{"url":null,"slug":"draw-with-thought-unleashing-multimodal","title":"Draw with Thought: Unleashing Multimodal Reasoning for Scientific Diagram Generation","date":"2025-04-13","arxiv_id":"2504.09479","repositories_listed":0,"syntology":null},{"url":null,"slug":"notes-bank-benchmarking-neural-transcription","title":"NoTeS-Bank: Benchmarking Neural Transcription and Search for Scientific Notes Understanding","date":"2025-04-12","arxiv_id":"2504.09249","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlmt-vision-language-multimodal-transformer","title":"VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering","date":"2025-04-11","arxiv_id":"2504.08269","repositories_listed":0,"syntology":null},{"url":null,"slug":"mme-unify-a-comprehensive-benchmark-for","title":"MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models","date":"2025-04-04","arxiv_id":"2504.03641","repositories_listed":0,"syntology":null},{"url":null,"slug":"why-reasoning-matters-a-survey-of","title":"Why Reasoning Matters? A Survey of Advancements in Multimodal Reasoning (v1)","date":"2025-04-04","arxiv_id":"2504.03151","repositories_listed":0,"syntology":null},{"url":null,"slug":"agentic-multimodal-ai-for-hyperpersonalized","title":"Agentic Multimodal AI for Hyperpersonalized B2B and B2C Advertising in Competitive Markets: An AI-Driven Competitive Advertising Framework","date":"2025-04-01","arxiv_id":"2504.00338","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-prompt-optimization-discovers","title":"Evolutionary Prompt Optimization Discovers Emergent Multimodal Reasoning Strategies in Vision-Language Models","date":"2025-03-30","arxiv_id":"2503.23503","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualquest-a-diverse-image-dataset-for","title":"VisualQuest: A Diverse Image Dataset for Evaluating Visual Recognition in LLMs","date":"2025-03-25","arxiv_id":"2503.19936","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-free-personalization-via-retrieval","title":"Training-Free Personalization via Retrieval and Reasoning on Fingerprints","date":"2025-03-24","arxiv_id":"2503.18623","repositories_listed":0,"syntology":null},{"url":null,"slug":"mind-with-eyes-from-language-reasoning-to","title":"Mind with Eyes: from Language Reasoning to Multimodal Reasoning","date":"2025-03-23","arxiv_id":"2503.18071","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-agentic-recommender-systems-in-the","title":"Towards Agentic Recommender Systems in the Era of Multimodal Large Language Models","date":"2025-03-20","arxiv_id":"2503.16734","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficientllava-generalizable-auto-pruning-for","title":"EfficientLLaVA:Generalizable Auto-Pruning for Large Vision-language Models","date":"2025-03-19","arxiv_id":"2503.15369","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-visual-forgetting-via-take-along","title":"Mitigating Visual Forgetting via Take-along Visual Conditioning for Multi-modal Long CoT Reasoning","date":"2025-03-17","arxiv_id":"2503.13360","repositories_listed":0,"syntology":null},{"url":null,"slug":"mpbench-a-comprehensive-multimodal-reasoning","title":"MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification","date":"2025-03-16","arxiv_id":"2503.12505","repositories_listed":0,"syntology":null},{"url":null,"slug":"verify-a-benchmark-of-visual-explanation-and","title":"VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity","date":"2025-03-14","arxiv_id":"2503.11557","repositories_listed":0,"syntology":null},{"url":null,"slug":"chat-ts-enhancing-multi-modal-reasoning-over","title":"Chat-TS: Enhancing Multi-Modal Reasoning Over Time-Series and Natural Language Data","date":"2025-03-13","arxiv_id":"2503.10883","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualprm-an-effective-process-reward-model","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","date":"2025-03-13","arxiv_id":"2503.10291","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-and-reasoning-with-confidence","title":"Seeing and Reasoning with Confidence: Supercharging Multimodal LLMs with an Uncertainty-Aware Agentic Framework","date":"2025-03-11","arxiv_id":"2503.08308","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-chain-of-thought-for-multimodal","title":"Integrating Chain-of-Thought for Multimodal Alignment: A Study on 3D Vision-Language Learning","date":"2025-03-08","arxiv_id":"2503.06232","repositories_listed":0,"syntology":null},{"url":null,"slug":"cosint-agent-a-knowledge-driven-multimodal","title":"COSINT-Agent: A Knowledge-Driven Multimodal Agent for Chinese Open Source Intelligence","date":"2025-03-05","arxiv_id":"2503.03215","repositories_listed":0,"syntology":null},{"url":null,"slug":"all-in-one-understanding-and-generation-in","title":"All-in-one: Understanding and Generation in Multimodal Reasoning with the MAIA Benchmark","date":"2025-02-24","arxiv_id":"2502.16989","repositories_listed":0,"syntology":null},{"url":null,"slug":"shakti-vlms-scalable-vision-language-models","title":"Shakti-VLMs: Scalable Vision-Language Models for Enterprise AI","date":"2025-02-24","arxiv_id":"2502.17092","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-inconsistency-reasoning-mmir-a-new","title":"Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models","date":"2025-02-22","arxiv_id":"2502.16033","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-advanced-techniques-for-visual","title":"Exploring Advanced Techniques for Visual Question Answering: A Comprehensive Comparison","date":"2025-02-20","arxiv_id":"2502.14827","repositories_listed":0,"syntology":null},{"url":null,"slug":"cutpaste-find-efficient-multimodal","title":"CutPaste&Find: Efficient Multimodal Hallucination Detector with Visual-aid Knowledge Base","date":"2025-02-18","arxiv_id":"2502.12591","repositories_listed":0,"syntology":null},{"url":null,"slug":"enigmaeval-a-benchmark-of-long-multimodal","title":"EnigmaEval: A Benchmark of Long Multimodal Reasoning Challenges","date":"2025-02-13","arxiv_id":"2502.08859","repositories_listed":0,"syntology":null},{"url":null,"slug":"mme-cot-benchmarking-chain-of-thought-in","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","date":"2025-02-13","arxiv_id":"2502.09621","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-generative-framework-for-bidirectional","title":"A Generative Framework for Bidirectional Image-Report Understanding in Chest Radiography","date":"2025-02-09","arxiv_id":"2502.05926","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-multimodal-reasoning-with-mcts","title":"Boosting Multimodal Reasoning with MCTS-Automated Structured Thinking","date":"2025-02-04","arxiv_id":"2502.02339","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-object-hallucinations-in-large-1","title":"Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration","date":"2025-02-04","arxiv_id":"2502.01969","repositories_listed":0,"syntology":null},{"url":null,"slug":"position-empowering-time-series-reasoning","title":"Position: Empowering Time Series Reasoning with Multimodal LLMs","date":"2025-02-03","arxiv_id":"2502.01477","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-mllms-reason-in-multimodality-emma-an","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","date":"2025-01-09","arxiv_id":"2501.05444","repositories_listed":0,"syntology":null},{"url":null,"slug":"drivingvqa-analyzing-visual-chain-of-thought","title":"DRIVINGVQA: Analyzing Visual Chain-of-Thought Reasoning of Vision Language Models in Real-World Scenarios with Driving Theory Tests","date":"2025-01-08","arxiv_id":"2501.04671","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficientllava-generalizable-auto-pruning-for-1","title":"EfficientLLaVA: Generalizable Auto-Pruning for Large Vision-language Models","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"diving-into-self-evolving-training-for","title":"Diving into Self-Evolving Training for Multimodal Reasoning","date":"2024-12-23","arxiv_id":"2412.17451","repositories_listed":0,"syntology":null},{"url":null,"slug":"fivl-a-framework-for-improved-vision-language","title":"FiVL: A Framework for Improved Vision-Language Alignment","date":"2024-12-19","arxiv_id":"2412.14672","repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-multimodal-reasoning-via-active","title":"Progressive Multimodal Reasoning via Active Retrieval","date":"2024-12-19","arxiv_id":"2412.14835","repositories_listed":0,"syntology":null},{"url":null,"slug":"cracking-the-code-of-hallucination-in-lvlms","title":"Cracking the Code of Hallucination in LVLMs with Vision-aware Head Divergence","date":"2024-12-18","arxiv_id":"2412.13949","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-mathematical-reasoning-in-the-era","title":"A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challenges","date":"2024-12-16","arxiv_id":"2412.11936","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-retrieval-augmented-tags-for-large","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","date":"2024-12-16","arxiv_id":"2412.11396","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-vision-language-interactions","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","date":"2024-12-14","arxiv_id":"2412.10758","repositories_listed":0,"syntology":null},{"url":null,"slug":"evlm-self-reflective-multimodal-reasoning-for","title":"EVLM: Self-Reflective Multimodal Reasoning for Cross-Dimensional Visual Editing","date":"2024-12-13","arxiv_id":"2412.10566","repositories_listed":0,"syntology":null},{"url":null,"slug":"critic-v-vlm-critics-help-catch-vlm-errors-in","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","date":"2024-11-27","arxiv_id":"2411.18203","repositories_listed":0,"syntology":null},{"url":null,"slug":"hints-of-prompt-enhancing-visual","title":"Hints of Prompt: Enhancing Visual Representation for Multimodal LLMs in Autonomous Driving","date":"2024-11-20","arxiv_id":"2411.13076","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-grounded-video-reasoning-understanding","title":"Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level","date":"2024-11-15","arxiv_id":"2411.09921","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-ground-vlms-without-forgetting","title":"Learning to Ground VLMs without Forgetting","date":"2024-10-14","arxiv_id":"2410.10491","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-x-ray-is-worth-15-features-sparse","title":"An X-Ray Is Worth 15 Features: Sparse Autoencoders for Interpretable Radiology Report Generation","date":"2024-10-04","arxiv_id":"2410.03334","repositories_listed":0,"syntology":null},{"url":null,"slug":"nl-eye-abductive-nli-for-images","title":"NL-Eye: Abductive NLI for Images","date":"2024-10-03","arxiv_id":"2410.02613","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-and-machine-learning-advancing-2","title":"Deep Learning and Machine Learning, Advancing Big Data Analytics and Management: Unveiling AI's Potential Through Tools, Techniques, and Applications","date":"2024-10-02","arxiv_id":"2410.01268","repositories_listed":0,"syntology":null},{"url":null,"slug":"proof-of-thought-neurosymbolic-program","title":"Proof of Thought : Neurosymbolic Program Synthesis allows Robust and Interpretable Reasoning","date":"2024-09-25","arxiv_id":"2409.17270","repositories_listed":0,"syntology":null},{"url":null,"slug":"nvlm-open-frontier-class-multimodal-llms","title":"NVLM: Open Frontier-Class Multimodal LLMs","date":"2024-09-17","arxiv_id":"2409.11402","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-aware-reasoning-over-multimodal","title":"Knowledge-Aware Reasoning over Multimodal Semi-structured Tables","date":"2024-08-25","arxiv_id":"2408.13860","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-holistic-disease-risk-prediction","title":"Towards Holistic Disease Risk Prediction using Small Language Models","date":"2024-08-13","arxiv_id":"2408.06943","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-03160","title":"User-in-the-loop Evaluation of Multimodal LLMs for Activity Assistance","date":"2024-08-04","arxiv_id":"2408.03160","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-scalable-oversight-with-weak-llms-judging","title":"On scalable oversight with weak LLMs judging strong LLMs","date":"2024-07-05","arxiv_id":"2407.04622","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-multi-agent-debate-with-sparse","title":"Improving Multi-Agent Debate with Sparse Communication Topology","date":"2024-06-17","arxiv_id":"2406.11776","repositories_listed":0,"syntology":null},{"url":null,"slug":"poem-interactive-prompt-optimization-for","title":"POEM: Interactive Prompt Optimization for Enhancing Multimodal Reasoning of Large Language Models","date":"2024-06-06","arxiv_id":"2406.03843","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-reasoning-with-multimodal","title":"Multimodal Reasoning with Multimodal Knowledge Graph","date":"2024-06-04","arxiv_id":"2406.02030","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-meets-reasoning-even-high-school","title":"Retrieval Meets Reasoning: Even High-school Textbook Knowledge Benefits Multimodal Reasoning","date":"2024-05-31","arxiv_id":"2405.20834","repositories_listed":0,"syntology":null},{"url":"/paper/image-of-thought-prompting-for-visual","slug":"image-of-thought-prompting-for-visual","title":"Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models","date":"2024-05-22","arxiv_id":"2405.13872","repositories_listed":0,"syntology":null},{"url":null,"slug":"inquire-interact-and-integrate-a-proactive","title":"Inquire, Interact, and Integrate: A Proactive Agent Collaborative Framework for Zero-Shot Multimodal Medical Reasoning","date":"2024-05-19","arxiv_id":"2405.11640","repositories_listed":0,"syntology":null},{"url":null,"slug":"accidentblip2-accident-detection-with-multi","title":"AccidentBlip: Agent of Accident Warning based on MA-former","date":"2024-04-18","arxiv_id":"2404.12149","repositories_listed":0,"syntology":null},{"url":null,"slug":"closed-loop-open-vocabulary-mobile","title":"Closed-Loop Open-Vocabulary Mobile Manipulation with GPT-4V","date":"2024-04-16","arxiv_id":"2404.10220","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-is-mass-modeling-as-stochastic-embedding","title":"Text Is MASS: Modeling as Stochastic Embedding for Text-Video Retrieval","date":"2024-03-26","arxiv_id":"2403.17998","repositories_listed":0,"syntology":null},{"url":"/paper/robocodex-multimodal-code-generation-for","slug":"robocodex-multimodal-code-generation-for","title":"RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis","date":"2024-02-25","arxiv_id":"2402.16117","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-failure-cases-in-multimodal","title":"Exploring Failure Cases in Multimodal Reasoning About Physical Dynamics","date":"2024-02-24","arxiv_id":"2402.15654","repositories_listed":0,"syntology":null},{"url":null,"slug":"bba-bi-modal-behavioral-alignment-for","title":"BBA: Bi-Modal Behavioral Alignment for Reasoning with Large Vision-Language Models","date":"2024-02-21","arxiv_id":"2402.13577","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-aware-vision-transformer-for","title":"Question Aware Vision Transformer for Multimodal Reasoning","date":"2024-02-08","arxiv_id":"2402.05472","repositories_listed":0,"syntology":null},{"url":null,"slug":"hidden-flaws-behind-expert-level-accuracy-of","title":"Hidden flaws behind expert-level accuracy of multimodal GPT-4 vision in medicine","date":"2024-01-16","arxiv_id":"2401.08396","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-reasoning-abilities-of","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","date":"2024-01-10","arxiv_id":"2401.06805","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-gpt4-v-on-structured-reasoning","title":"Assessing GPT4-V on Structured Reasoning Tasks","date":"2023-12-13","arxiv_id":"2312.11524","repositories_listed":0,"syntology":null},{"url":null,"slug":"ddcot-duty-distinct-chain-of-thought","title":"DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models","date":"2023-10-25","arxiv_id":"2310.16436","repositories_listed":0,"syntology":null},{"url":null,"slug":"personality-aware-human-centric-multimodal","title":"Personality-aware Human-centric Multimodal Reasoning: A New Task, Dataset and Baselines","date":"2023-04-05","arxiv_id":"2304.02313","repositories_listed":0,"syntology":null},{"url":null,"slug":"autofraudnet-a-multimodal-network-to-detect","title":"AutoFraudNet: A Multimodal Network to Detect Fraud in the Auto Insurance Industry","date":"2023-01-15","arxiv_id":"2301.07526","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-neural-networks-for-visual-reasoning","title":"Deep Neural Networks for Visual Reasoning","date":"2022-09-24","arxiv_id":"2209.11990","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-the-vision-and-language-bias-for","title":"Reducing the Vision and Language Bias for Temporal Sentence Grounding","date":"2022-07-27","arxiv_id":"2207.13457","repositories_listed":0,"syntology":null},{"url":null,"slug":"disinfomeme-a-multimodal-dataset-for","title":"DisinfoMeme: A Multimodal Dataset for Detecting Meme Intentionally Spreading Out Disinformation","date":"2022-05-25","arxiv_id":"2205.12617","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-inside-self-driven-siamese","title":"Learning from Inside: Self-driven Siamese Sampling and Reasoning for Video Question Answering","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-pre-trained-vision-and-language","title":"Improving Pre-trained Vision-and-Language Embeddings for Phrase Grounding","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"txt-crossmodal-end-to-end-learning-with","title":"TxT: Crossmodal End-to-End Learning with Transformers","date":"2021-09-09","arxiv_id":"2109.04422","repositories_listed":0,"syntology":null},{"url":null,"slug":"c-3-compositional-counterfactual-constrastive","title":"$C^3$: Compositional Counterfactual Contrastive Learning for Video-grounded Dialogues","date":"2021-06-16","arxiv_id":"2106.08914","repositories_listed":0,"syntology":null},{"url":null,"slug":"premise-based-multimodal-reasoning-a-human","title":"Premise-based Multimodal Reasoning: Conditional Inference on Joint Textual and Visual Clues","date":"2021-05-15","arxiv_id":"2105.07122","repositories_listed":0,"syntology":null},{"url":null,"slug":"doc2ppt-automatic-presentation-slides","title":"DOC2PPT: Automatic Presentation Slides Generation from Scientific Documents","date":"2021-01-28","arxiv_id":"2101.11796","repositories_listed":0,"syntology":null},{"url":null,"slug":"sound2sight-generating-visual-dynamics-from","title":"Sound2Sight: Generating Visual Dynamics from Sound and Context","date":"2020-07-23","arxiv_id":"2007.12130","repositories_listed":0,"syntology":null}],"record_sha256":"725a0dbfc3ecaaa7d80993a7e31a870a17e8a8b906abedfb7d2f7791b10b22f2","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}