{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-reasoning/papers/5","list_of":"/task/visual-reasoning","task":"Visual Reasoning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":5,"pages_in_order":7,"rows_per_page":100,"rows":[401,500],"of":698,"counts":{"archive_papers_tagged":698,"with_a_code_link":356,"where_syntology_ran_a_sample":165,"not_listed_spam_title":0,"listed":698,"listed_where_code_ran":165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":130,"every_run_a_failure_of_syntologys_instrument":35,"listed_with_a_run_with_no_instrument_failure":130,"listed_every_run_a_failure_of_syntologys_instrument":35,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-reasoning","prev":"/task/visual-reasoning/papers/4","next":"/task/visual-reasoning/papers/6","papers":[{"url":null,"slug":"chartmuseum-testing-visual-reasoning","title":"ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models","date":"2025-05-19","arxiv_id":"2505.13444","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-11141","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","date":"2025-05-16","arxiv_id":"2505.11141","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlm-q-learning-aligning-vision-language","title":"VLM Q-Learning: Aligning Vision-Language Models for Interactive Decision-Making","date":"2025-05-06","arxiv_id":"2505.03181","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-slow-thinking-based-reasoning","title":"A Survey of Slow Thinking-based Reasoning LLMs using Reinforced Learning and Inference-time Scaling Law","date":"2025-05-05","arxiv_id":"2505.02665","repositories_listed":0,"syntology":null},{"url":null,"slug":"localizing-before-answering-a-hallucination","title":"Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs","date":"2025-04-30","arxiv_id":"2505.00744","repositories_listed":0,"syntology":null},{"url":null,"slug":"nora-a-small-open-sourced-generalist-vision","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","date":"2025-04-28","arxiv_id":"2504.19854","repositories_listed":0,"syntology":null},{"url":"/paper/doxing-via-the-lens-revealing-privacy-leakage","slug":"doxing-via-the-lens-revealing-privacy-leakage","title":"Doxing via the Lens: Revealing Location-related Privacy Leakage on Multi-modal Large Reasoning Models","date":"2025-04-27","arxiv_id":"2504.19373","repositories_listed":0,"syntology":{"n":14,"n_ran":14,"n_constructed":0,"n_ran_checked":14,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":14,"n_pointer_only":0,"phrase":"14 ran (of which 0 constructed an object rather than computing a result; 14 with no instrument failure: 0 honoured, 0 violated, 14 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/doxing-via-the-lens-revealing-privacy-leakage#ran","syntology_url":"https://syntology.ai/paper/2504.19373","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2504.19373"}},"official":null}},{"url":null,"slug":"a-comprehensive-survey-of-knowledge-based","title":"A Comprehensive Survey of Knowledge-Based Vision Question Answering Systems: The Lifecycle of Knowledge in Visual Reasoning Task","date":"2025-04-24","arxiv_id":"2504.17547","repositories_listed":0,"syntology":null},{"url":null,"slug":"longperceptualthoughts-distilling-system-2","title":"LongPerceptualThoughts: Distilling System-2 Reasoning for System-1 Perception","date":"2025-04-21","arxiv_id":"2504.15362","repositories_listed":0,"syntology":null},{"url":null,"slug":"visulogic-a-benchmark-for-evaluating-visual","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","date":"2025-04-21","arxiv_id":"2504.15279","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-reinforcement-learning-really","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","date":"2025-04-18","arxiv_id":"2504.13837","repositories_listed":0,"syntology":null},{"url":null,"slug":"lvlm-csp-accelerating-large-vision-language","title":"LVLM_CSP: Accelerating Large Vision Language Models via Clustering, Scattering, and Pruning for Reasoning Segmentation","date":"2025-04-15","arxiv_id":"2504.10854","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-language-models-show-widespread-visual","title":"Visual Language Models show widespread visual deficits on neuropsychological tests","date":"2025-04-15","arxiv_id":"2504.10786","repositories_listed":0,"syntology":null},{"url":null,"slug":"camerabench-benchmarking-visual-reasoning-in","title":"CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography","date":"2025-04-14","arxiv_id":"2504.10090","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualpuzzles-decoupling-multimodal-reasoning","title":"VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge","date":"2025-04-14","arxiv_id":"2504.10342","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-data-synthesis-and-post-training-for","title":"On Data Synthesis and Post-training for Visual Abstract Reasoning","date":"2025-04-02","arxiv_id":"2504.01324","repositories_listed":0,"syntology":null},{"url":null,"slug":"genvp-generating-visual-puzzles-with","title":"GenVP: Generating Visual Puzzles with Contrastive Hierarchical VAEs","date":"2025-03-30","arxiv_id":"2503.23598","repositories_listed":0,"syntology":null},{"url":null,"slug":"dwim-towards-tool-aware-visual-reasoning-via","title":"DWIM: Towards Tool-aware Visual Reasoning via Discrepancy-aware Workflow Generation & Instruct-Masking Tuning","date":"2025-03-25","arxiv_id":"2503.19263","repositories_listed":0,"syntology":null},{"url":null,"slug":"rgb-th-bench-a-dense-benchmark-for-visual","title":"RGB-Th-Bench: A Dense benchmark for Visual-Thermal Understanding of Vision Language Models","date":"2025-03-25","arxiv_id":"2503.19654","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuro-symbolic-scene-graph-conditioning-for","title":"Neuro-Symbolic Scene Graph Conditioning for Synthetic Image Dataset Generation","date":"2025-03-21","arxiv_id":"2503.17224","repositories_listed":0,"syntology":null},{"url":null,"slug":"chain-of-functions-a-programmatic-pipeline","title":"Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data","date":"2025-03-20","arxiv_id":"2503.16260","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-head-to-tail-towards-balanced","title":"From Head to Tail: Towards Balanced Representation in Large Vision-Language Models through Adaptive Data Calibration","date":"2025-03-17","arxiv_id":"2503.12821","repositories_listed":0,"syntology":null},{"url":null,"slug":"verify-a-benchmark-of-visual-explanation-and","title":"VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity","date":"2025-03-14","arxiv_id":"2503.11557","repositories_listed":0,"syntology":null},{"url":null,"slug":"sciverse-unveiling-the-knowledge","title":"SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems","date":"2025-03-13","arxiv_id":"2503.10627","repositories_listed":0,"syntology":null},{"url":null,"slug":"silent-hazards-of-token-reduction-in-vision","title":"Does Acceleration Cause Hidden Instability in Vision Language Models? Uncovering Instance-Level Divergence Through a Large-Scale Empirical Study","date":"2025-03-09","arxiv_id":"2503.06794","repositories_listed":0,"syntology":null},{"url":null,"slug":"poisoned-mrag-knowledge-poisoning-attacks-to","title":"Poisoned-MRAG: Knowledge Poisoning Attacks to Multimodal Retrieval Augmented Generation","date":"2025-03-08","arxiv_id":"2503.06254","repositories_listed":0,"syntology":null},{"url":null,"slug":"lvlm-compress-bench-benchmarking-the-broader","title":"LVLM-Compress-Bench: Benchmarking the Broader Impact of Large Vision-Language Model Compression","date":"2025-03-06","arxiv_id":"2503.04982","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-visual-discrimination-and-reasoning","title":"Towards Visual Discrimination and Reasoning of Real-World Physical Dynamics: Physics-Grounded Anomaly Detection","date":"2025-03-05","arxiv_id":"2503.03562","repositories_listed":0,"syntology":null},{"url":null,"slug":"exclaim-an-explainable-cross-modal-agentic","title":"EXCLAIM: An Explainable Cross-Modal Agentic System for Misinformation Detection with Hierarchical Retrieval","date":"2025-03-01","arxiv_id":"2504.06269","repositories_listed":0,"syntology":null},{"url":null,"slug":"m-llm-based-video-frame-selection-for","title":"M-LLM Based Video Frame Selection for Efficient Video Understanding","date":"2025-02-27","arxiv_id":"2502.19680","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmscibench-benchmarking-language-models-on","title":"MMSciBench: Benchmarking Language Models on Multimodal Scientific Problems","date":"2025-02-27","arxiv_id":"2503.01891","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-chart-summarization-via-visual","title":"End-to-End Chart Summarization via Visual Chain-of-Thought in Vision-Language Models","date":"2025-02-24","arxiv_id":"2502.17589","repositories_listed":0,"syntology":null},{"url":null,"slug":"shakti-vlms-scalable-vision-language-models","title":"Shakti-VLMs: Scalable Vision-Language Models for Enterprise AI","date":"2025-02-24","arxiv_id":"2502.17092","repositories_listed":0,"syntology":null},{"url":null,"slug":"visfactor-benchmarking-fundamental-visual","title":"VisFactor: Benchmarking Fundamental Visual Cognition in Multimodal Large Language Models","date":"2025-02-23","arxiv_id":"2502.16435","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-reasoning-evaluation-of-grok-deepseek","title":"Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT","date":"2025-02-23","arxiv_id":"2502.16428","repositories_listed":0,"syntology":null},{"url":null,"slug":"chitrarth-bridging-vision-and-language-for-a","title":"Chitrarth: Bridging Vision and Language for a Billion People","date":"2025-02-21","arxiv_id":"2502.15392","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-we-really-need-visual-instructions-towards","title":"Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models","date":"2025-02-17","arxiv_id":"2502.11427","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-stop-overthinking-at-test-time","title":"Learning to Stop Overthinking at Test Time","date":"2025-02-16","arxiv_id":"2502.10954","repositories_listed":0,"syntology":null},{"url":null,"slug":"met-bench-multimodal-entity-tracking-for","title":"MET-Bench: Multimodal Entity Tracking for Evaluating the Limitations of Vision-Language and Reasoning Models","date":"2025-02-15","arxiv_id":"2502.10886","repositories_listed":0,"syntology":null},{"url":null,"slug":"zerobench-an-impossible-visual-benchmark-for","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","date":"2025-02-13","arxiv_id":"2502.09696","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-agentic-ai-for-spatial-reasoning-with","title":"Visual Agentic AI for Spatial Reasoning with a Dynamic API","date":"2025-02-10","arxiv_id":"2502.06787","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-multimodal-reasoning-with-mcts","title":"Boosting Multimodal Reasoning with MCTS-Automated Structured Thinking","date":"2025-02-04","arxiv_id":"2502.02339","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-lmm-planners-and-3d-skill","title":"Integrating LMM Planners and 3D Skill Policies for Generalizable Manipulation","date":"2025-01-30","arxiv_id":"2501.18733","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-bottlenecks-in-safety-fine-tuning","title":"Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models","date":"2025-01-30","arxiv_id":"2501.18533","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-moe-a-mixture-of-experts-multi-modal-llm","title":"3D-MoE: A Mixture-of-Experts Multi-modal LLM for 3D Vision and Pose Diffusion via Rectified Flow","date":"2025-01-28","arxiv_id":"2501.16698","repositories_listed":0,"syntology":null},{"url":"/paper/cognitive-paradigms-for-evaluating-vlms-on","slug":"cognitive-paradigms-for-evaluating-vlms-on","title":"A Cognitive Paradigm Approach to Probe the Perception-Reasoning Interface in VLMs","date":"2025-01-23","arxiv_id":"2501.13620","repositories_listed":0,"syntology":null},{"url":null,"slug":"systematic-abductive-reasoning-via-diverse","title":"Systematic Abductive Reasoning via Diverse Relation Representations in Vector-symbolic Architecture","date":"2025-01-21","arxiv_id":"2501.11896","repositories_listed":0,"syntology":null},{"url":null,"slug":"maps-advancing-multi-modal-reasoning-in","title":"MAPS: Advancing Multi-Modal Reasoning in Expert-Level Physical Science","date":"2025-01-18","arxiv_id":"2501.10768","repositories_listed":0,"syntology":null},{"url":null,"slug":"cityloc-6-dof-localization-of-text","title":"CityLoc: 6DoF Pose Distributional Localization for Text Descriptions in Large-Scale Scenes with Gaussian Representation","date":"2025-01-15","arxiv_id":"2501.08982","repositories_listed":0,"syntology":null},{"url":null,"slug":"drivingvqa-analyzing-visual-chain-of-thought","title":"DRIVINGVQA: Analyzing Visual Chain-of-Thought Reasoning of Vision Language Models in Real-World Scenarios with Driving Theory Tests","date":"2025-01-08","arxiv_id":"2501.04671","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-code-to-compliance-assessing-chatgpt-s","title":"From Code to Compliance: Assessing ChatGPT's Utility in Designing an Accessible Webpage -- A Case Study","date":"2025-01-07","arxiv_id":"2501.03572","repositories_listed":0,"syntology":null},{"url":null,"slug":"logicad-explainable-anomaly-detection-via-vlm","title":"LogicAD: Explainable Anomaly Detection via VLM-based Text Feature Extraction","date":"2025-01-03","arxiv_id":"2501.01767","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-guided-salient-object-ranking","title":"Language-Guided Salient Object Ranking","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-visual-language-priors-in-vlms","title":"Probing Visual Language Priors in VLMs","date":"2024-12-31","arxiv_id":"2501.00569","repositories_listed":0,"syntology":null},{"url":null,"slug":"slow-perception-let-s-perceive-geometric","title":"Slow Perception: Let's Perceive Geometric Figures Step-by-step","date":"2024-12-30","arxiv_id":"2412.20631","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-mllms-an-in-depth-analysis-of","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","date":"2024-12-21","arxiv_id":"2412.16418","repositories_listed":0,"syntology":null},{"url":null,"slug":"earthdial-turning-multi-sensory-earth","title":"EarthDial: Turning Multi-sensory Earth Observations to Interactive Dialogues","date":"2024-12-19","arxiv_id":"2412.15190","repositories_listed":0,"syntology":null},{"url":null,"slug":"viunit-visual-unit-tests-for-more-robust","title":"ViUniT: Visual Unit Tests for More Robust Visual Programming","date":"2024-12-12","arxiv_id":"2412.08859","repositories_listed":0,"syntology":null},{"url":null,"slug":"perception-tokens-enhance-visual-reasoning-in","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","date":"2024-12-04","arxiv_id":"2412.03548","repositories_listed":0,"syntology":null},{"url":null,"slug":"visco-benchmarking-fine-grained-critique-and","title":"VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning","date":"2024-12-03","arxiv_id":"2412.02172","repositories_listed":0,"syntology":null},{"url":null,"slug":"abductive-symbolic-solver-on-abstraction-and","title":"Abductive Symbolic Solver on Abstraction and Reasoning Corpus","date":"2024-11-27","arxiv_id":"2411.18158","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-visual-reasoning-with-autonomous","title":"Enhancing Visual Reasoning with Autonomous Imagination in Multimodal Large Language Models","date":"2024-11-27","arxiv_id":"2411.18142","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-visual-understanding-introducing","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","date":"2024-11-20","arxiv_id":"2411.15201","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-reason-iteratively-and-parallelly","title":"Learning to Reason Iteratively and Parallelly for Complex Visual Reasoning Scenarios","date":"2024-11-20","arxiv_id":"2411.13754","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-3d-physical-simulation-of-open","title":"Automated 3D Physical Simulation of Open-world Scene with Gaussian Splatting","date":"2024-11-19","arxiv_id":"2411.12789","repositories_listed":0,"syntology":null},{"url":null,"slug":"bootstrapping-top-down-information-for-self","title":"Bootstrapping Top-down Information for Self-modulating Slot Attention","date":"2024-11-04","arxiv_id":"2411.01801","repositories_listed":0,"syntology":null},{"url":null,"slug":"reasoning-limitations-of-multimodal-large","title":"Reasoning Limitations of Multimodal Large Language Models. A case study of Bongard Problems","date":"2024-11-02","arxiv_id":"2411.01173","repositories_listed":0,"syntology":null},{"url":null,"slug":"replace-then-perturb-targeted-adversarial","title":"Replace-then-Perturb: Targeted Adversarial Attacks With Visual Reasoning for Vision-Language Models","date":"2024-11-01","arxiv_id":"2411.00898","repositories_listed":0,"syntology":null},{"url":null,"slug":"visaidmath-benchmarking-visual-aided","title":"VisAidMath: Benchmarking Visual-Aided Mathematical Reasoning","date":"2024-10-30","arxiv_id":"2410.22995","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-in-visual-reasoning","title":"Improving Generalization in Visual Reasoning via Self-Ensemble","date":"2024-10-28","arxiv_id":"2410.20883","repositories_listed":0,"syntology":null},{"url":null,"slug":"proreason-multi-modal-proactive-reasoning","title":"ProReason: Multi-Modal Proactive Reasoning with Decoupled Eyesight and Wisdom","date":"2024-10-18","arxiv_id":"2410.14138","repositories_listed":0,"syntology":null},{"url":null,"slug":"forgerygpt-multimodal-large-language-model","title":"ForgeryGPT: Multimodal Large Language Model For Explainable Image Forgery Detection and Localization","date":"2024-10-14","arxiv_id":"2410.10238","repositories_listed":0,"syntology":null},{"url":"/paper/tvbench-redesigning-video-language-evaluation","slug":"tvbench-redesigning-video-language-evaluation","title":"TVBench: Redesigning Video-Language Evaluation","date":"2024-10-10","arxiv_id":"2410.07752","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformers-utilization-in-chart","title":"Transformers Utilization in Chart Understanding: A Review of Recent Advances & Future Trends","date":"2024-10-05","arxiv_id":"2410.13883","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-object-detection-in-transportation","title":"Advancing Object Detection in Transportation with Multimodal Large Language Models (MLLMs): A Comprehensive Review and Empirical Testing","date":"2024-09-26","arxiv_id":"2409.18286","repositories_listed":0,"syntology":null},{"url":null,"slug":"gson-a-group-based-social-navigation","title":"GSON: A Group-based Social Navigation Framework with Large Multimodal Model","date":"2024-09-26","arxiv_id":"2409.18084","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-advanced-visual-reasoning-ability","title":"Enhancing Advanced Visual Reasoning Ability of Large Language Models","date":"2024-09-21","arxiv_id":"2409.13980","repositories_listed":0,"syntology":null},{"url":null,"slug":"impact-of-ml-optimization-tactics-on-greener","title":"Impact of ML Optimization Tactics on Greener Pre-Trained ML Models","date":"2024-09-19","arxiv_id":"2409.12878","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-makes-a-maze-look-like-a-maze","title":"What Makes a Maze Look Like a Maze?","date":"2024-09-12","arxiv_id":"2409.08202","repositories_listed":0,"syntology":null},{"url":null,"slug":"critical-features-tracking-on-triangulated","title":"Critical Features Tracking on Triangulated Irregular Networks by a Scale-Space Method","date":"2024-09-10","arxiv_id":"2409.06638","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmevol-empowering-multimodal-large-language","title":"MMEvol: Empowering Multimodal Large Language Models with Evol-Instruct","date":"2024-09-09","arxiv_id":"2409.05840","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-visual-reasoning-by-vision-language","title":"Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis","date":"2024-08-27","arxiv_id":"2409.00106","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02882","title":"Compromising Embodied Agents with Contextual Backdoor Attacks","date":"2024-08-06","arxiv_id":"2408.02882","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02210","title":"ExoViP: Step-by-step Verification and Exploration with Exoskeleton Modules for Compositional Visual Reasoning","date":"2024-08-05","arxiv_id":"2408.02210","repositories_listed":0,"syntology":null},{"url":null,"slug":"chat2layout-interactive-3d-furniture-layout","title":"Chat2Layout: Interactive 3D Furniture Layout with a Multimodal LLM","date":"2024-07-31","arxiv_id":"2407.21333","repositories_listed":0,"syntology":null},{"url":null,"slug":"pyramid-coder-hierarchical-code-generator-for","title":"Pyramid Coder: Hierarchical Code Generator for Compositional Visual Question Answering","date":"2024-07-30","arxiv_id":"2407.20563","repositories_listed":0,"syntology":null},{"url":null,"slug":"take-a-step-back-rethinking-the-two-stages-in","title":"Take A Step Back: Rethinking the Two Stages in Visual Reasoning","date":"2024-07-29","arxiv_id":"2407.19666","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-vlms-be-used-on-videos-for-action","title":"Can VLMs be used on videos for action recognition? LLMs are Visual Reasoning Coordinators","date":"2024-07-20","arxiv_id":"2407.14834","repositories_listed":0,"syntology":null},{"url":null,"slug":"i-know-about-up-enhancing-spatial-reasoning","title":"I Know About \"Up\"! Enhancing Spatial Reasoning in Visual Language Models Through 3D Reconstruction","date":"2024-07-19","arxiv_id":"2407.14133","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-world-visual-reasoning-by-a-neuro","title":"Open-World Visual Reasoning by a Neuro-Symbolic Program of Zero-Shot Symbols","date":"2024-07-18","arxiv_id":"2407.13382","repositories_listed":0,"syntology":null},{"url":null,"slug":"x-former-unifying-contrastive-and","title":"X-Former: Unifying Contrastive and Reconstruction Learning for MLLMs","date":"2024-07-18","arxiv_id":"2407.13851","repositories_listed":0,"syntology":null},{"url":null,"slug":"switchcit-switching-for-continual-instruction","title":"SwitchCIT: Switching for Continual Instruction Tuning","date":"2024-07-16","arxiv_id":"2407.11780","repositories_listed":0,"syntology":null},{"url":null,"slug":"ntsebench-cognitive-reasoning-benchmark-for","title":"NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language Models","date":"2024-07-15","arxiv_id":"2407.10380","repositories_listed":0,"syntology":null},{"url":null,"slug":"affordance-guided-reinforcement-learning-via","title":"Affordance-Guided Reinforcement Learning via Visual Prompting","date":"2024-07-14","arxiv_id":"2407.10341","repositories_listed":0,"syntology":null},{"url":null,"slug":"node-adapter-neural-ordinary-differential","title":"NODE-Adapter: Neural Ordinary Differential Equations for Better Vision-Language Reasoning","date":"2024-07-11","arxiv_id":"2407.08672","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmro-are-multimodal-llms-eligible-as-the","title":"MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?","date":"2024-06-28","arxiv_id":"2406.19693","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-knowledge-based-and-visual","title":"Disentangling Knowledge-based and Visual Reasoning by Question Decomposition in KB-VQA","date":"2024-06-27","arxiv_id":"2406.18839","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-visual-and-cultural-interpretation","title":"Evaluating Visual and Cultural Interpretation: The K-Viscuit Benchmark with Human-VLM Collaboration","date":"2024-06-24","arxiv_id":"2406.16469","repositories_listed":0,"syntology":null},{"url":null,"slug":"whiteboard-of-thought-thinking-step-by-step","title":"Whiteboard-of-Thought: Thinking Step-by-Step Across Modalities","date":"2024-06-20","arxiv_id":"2406.14562","repositories_listed":0,"syntology":null},{"url":null,"slug":"gsr-bench-a-benchmark-for-grounded-spatial","title":"GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs","date":"2024-06-19","arxiv_id":"2406.13246","repositories_listed":0,"syntology":null}],"record_sha256":"9e28e4f1b204d4b957ac9781ef593310c907663cad673631ab1c65e2e165deae","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}