{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/spatial-reasoning/papers/3","list_of":"/task/spatial-reasoning","task":"Spatial Reasoning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":5,"rows_per_page":100,"rows":[201,300],"of":453,"counts":{"archive_papers_tagged":453,"with_a_code_link":198,"where_syntology_ran_a_sample":70,"not_listed_spam_title":0,"listed":453,"listed_where_code_ran":70,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":59,"every_run_a_failure_of_syntologys_instrument":11,"listed_with_a_run_with_no_instrument_failure":59,"listed_every_run_a_failure_of_syntologys_instrument":11,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/spatial-reasoning","prev":"/task/spatial-reasoning/papers/2","next":"/task/spatial-reasoning/papers/4","papers":[{"url":null,"slug":"bydeway-boost-your-multimodal-llm-with-depth","title":"ByDeWay: Boost Your multimodal LLM with DEpth prompting in a Training-Free Way","date":"2025-07-11","arxiv_id":"2507.08679","repositories_listed":0,"syntology":null},{"url":null,"slug":"m2-reasoning-empowering-mllms-with-unified","title":"M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning","date":"2025-07-11","arxiv_id":"2507.08306","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-neural-representation-framework-with-llm","title":"A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding","date":"2025-07-09","arxiv_id":"2507.06719","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimising-language-models-for-downstream","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","date":"2025-06-26","arxiv_id":"2506.20917","repositories_listed":0,"syntology":null},{"url":null,"slug":"shotbench-expert-level-cinematic","title":"ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models","date":"2025-06-26","arxiv_id":"2506.21356","repositories_listed":0,"syntology":null},{"url":null,"slug":"world-aware-planning-narratives-enhance-large","title":"World-aware Planning Narratives Enhance Large Vision-Language Model Planner","date":"2025-06-26","arxiv_id":"2506.21230","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-2d-to-3d-cognition-a-brief-survey-of","title":"From 2D to 3D Cognition: A Brief Survey of General World Models","date":"2025-06-25","arxiv_id":"2506.20134","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-perception-models-for-3d-scene","title":"Video Perception Models for 3D Scene Synthesis","date":"2025-06-25","arxiv_id":"2506.20601","repositories_listed":0,"syntology":null},{"url":null,"slug":"immersegen-agent-guided-immersive-world","title":"ImmerseGen: Agent-Guided Immersive World Generation with Alpha-Textured Proxies","date":"2025-06-17","arxiv_id":"2506.14315","repositories_listed":0,"syntology":null},{"url":null,"slug":"perl-permutation-enhanced-reinforcement","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","date":"2025-06-17","arxiv_id":"2506.14907","repositories_listed":0,"syntology":null},{"url":null,"slug":"siri-bench-challenging-vlms-spatial","title":"SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks","date":"2025-06-17","arxiv_id":"2506.14512","repositories_listed":0,"syntology":null},{"url":null,"slug":"2506-10093","title":"Leveraging LLMs for Mission Planning in Precision Agriculture","date":"2025-06-11","arxiv_id":"2506.10093","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multi-modal-spatial-risk-framework-for-ev","title":"A Multi-Modal Spatial Risk Framework for EV Charging Infrastructure Using Remote Sensing","date":"2025-06-10","arxiv_id":"2506.19860","repositories_listed":0,"syntology":null},{"url":null,"slug":"phyblock-a-progressive-benchmark-for-physical","title":"PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly","date":"2025-06-10","arxiv_id":"2506.08708","repositories_listed":0,"syntology":null},{"url":null,"slug":"direct-numerical-layout-generation-for-3d","title":"Direct Numerical Layout Generation for 3D Indoor Scene Synthesis via Spatial Reasoning","date":"2025-06-05","arxiv_id":"2506.05341","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-objects-to-anywhere-a-holistic-benchmark","title":"From Objects to Anywhere: A Holistic Benchmark for Multi-level Visual Grounding in 3D Scenes","date":"2025-06-05","arxiv_id":"2506.04897","repositories_listed":0,"syntology":null},{"url":null,"slug":"roborefer-towards-spatial-referring-with","title":"RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics","date":"2025-06-04","arxiv_id":"2506.04308","repositories_listed":0,"syntology":null},{"url":null,"slug":"savvy-spatial-awareness-via-audio-visual-llms","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","date":"2025-06-04","arxiv_id":"2506.05414","repositories_listed":0,"syntology":null},{"url":null,"slug":"omnispatial-towards-comprehensive-spatial","title":"OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models","date":"2025-06-03","arxiv_id":"2506.03135","repositories_listed":0,"syntology":null},{"url":null,"slug":"respace-text-driven-3d-scene-synthesis-and","title":"ReSpace: Text-Driven 3D Scene Synthesis and Editing with Preference Alignment","date":"2025-06-03","arxiv_id":"2506.02459","repositories_listed":0,"syntology":null},{"url":null,"slug":"out-of-sight-not-out-of-context-egocentric","title":"Out of Sight, Not Out of Context? Egocentric Spatial Reasoning in VLMs Across Disjoint Frames","date":"2025-05-30","arxiv_id":"2505.24257","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-embodied-brain-let-multimodal-large","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","date":"2025-05-30","arxiv_id":"2506.00123","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmsi-bench-a-benchmark-for-multi-image","title":"MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence","date":"2025-05-29","arxiv_id":"2505.23764","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-mllm-boosting-mllm-capabilities-in","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","date":"2025-05-29","arxiv_id":"2505.23747","repositories_listed":0,"syntology":null},{"url":null,"slug":"jigsaw-puzzles-from-seeing-to-understanding","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","date":"2025-05-27","arxiv_id":"2505.20728","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlm-can-be-a-good-assistant-enhancing","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","date":"2025-05-27","arxiv_id":"2505.20718","repositories_listed":0,"syntology":null},{"url":null,"slug":"agentic-3d-scene-generation-with-spatially","title":"Agentic 3D Scene Generation with Spatially Contextualized VLMs","date":"2025-05-26","arxiv_id":"2505.20129","repositories_listed":0,"syntology":null},{"url":null,"slug":"mebench-a-novel-benchmark-for-understanding","title":"MEBench: A Novel Benchmark for Understanding Mutual Exclusivity Bias in Vision-Language Models","date":"2025-05-26","arxiv_id":"2505.20122","repositories_listed":0,"syntology":null},{"url":null,"slug":"vitapes-visuotactile-position-encodings-for","title":"ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers","date":"2025-05-26","arxiv_id":"2505.20032","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-mllms-guide-me-home-a-benchmark-study-on","title":"Can MLLMs Guide Me Home? A Benchmark Study on Fine-Grained Visual Reasoning from Transit Maps","date":"2025-05-24","arxiv_id":"2505.18675","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-dynamic-3d-reconstruction-of-hand","title":"Towards Dynamic 3D Reconstruction of Hand-Instrument Interaction in Ophthalmic Surgery","date":"2025-05-23","arxiv_id":"2505.17677","repositories_listed":0,"syntology":null},{"url":"/paper/u2-bench-benchmarking-large-vision-language","slug":"u2-bench-benchmarking-large-vision-language","title":"U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding","date":"2025-05-23","arxiv_id":"2505.17779","repositories_listed":0,"syntology":null},{"url":null,"slug":"megohand-multimodal-egocentric-hand-object","title":"MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation","date":"2025-05-22","arxiv_id":"2505.16602","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmmr-benchmarking-massive-multi-modal","title":"MMMR: Benchmarking Massive Multi-Modal Reasoning Tasks","date":"2025-05-22","arxiv_id":"2505.16459","repositories_listed":0,"syntology":null},{"url":null,"slug":"sem-enhancing-spatial-understanding-for","title":"SEM: Enhancing Spatial Understanding for Robust Robot Manipulation","date":"2025-05-22","arxiv_id":"2505.16196","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlm-r-3-region-recognition-reasoning-and","title":"VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought","date":"2025-05-22","arxiv_id":"2505.16192","repositories_listed":0,"syntology":null},{"url":null,"slug":"reguide-data-efficient-gui-grounding-via","title":"ReGUIDE: Data Efficient GUI Grounding via Spatial Reasoning and Search","date":"2025-05-21","arxiv_id":"2505.15259","repositories_listed":0,"syntology":null},{"url":null,"slug":"star-r1-spacial-transformation-reasoning-by","title":"STAR-R1: Spacial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","date":"2025-05-21","arxiv_id":"2505.15804","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-templates-to-natural-language","title":"From Templates to Natural Language: Generalization Challenges in Instruction-Tuned LLMs for Spatial Reasoning","date":"2025-05-20","arxiv_id":"2505.14425","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-embodied-cognition-in-robots-via","title":"Towards Embodied Cognition in Robots via Spatially Grounded Synthetic Worlds","date":"2025-05-20","arxiv_id":"2505.14366","repositories_listed":0,"syntology":null},{"url":null,"slug":"incentivizing-multimodal-reasoning-in-large","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","date":"2025-05-19","arxiv_id":"2505.12744","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-large-multimodal-models-understand","title":"Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind","date":"2025-05-18","arxiv_id":"2505.12207","repositories_listed":0,"syntology":null},{"url":null,"slug":"ssr-enhancing-depth-perception-in-vision","title":"SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning","date":"2025-05-18","arxiv_id":"2505.12448","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-multimodal-large-language-models-ready","title":"Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?","date":"2025-05-17","arxiv_id":"2505.11907","repositories_listed":0,"syntology":null},{"url":null,"slug":"prs-med-position-reasoning-segmentation-with","title":"PRS-Med: Position Reasoning Segmentation with Vision-Language Model in Medical Imaging","date":"2025-05-17","arxiv_id":"2505.11872","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-10875","title":"A Light and Smart Wearable Platform with Multimodal Foundation Model for Enhanced Spatial Reasoning in People with Blindness and Low Vision","date":"2025-05-16","arxiv_id":"2505.10875","repositories_listed":0,"syntology":null},{"url":null,"slug":"site-towards-spatial-intelligence-thorough","title":"SITE: towards Spatial Intelligence Thorough Evaluation","date":"2025-05-08","arxiv_id":"2505.05456","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatialprompting-keyframe-driven-zero-shot","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","date":"2025-05-08","arxiv_id":"2505.04911","repositories_listed":0,"syntology":null},{"url":null,"slug":"preliminary-explorations-with-gpt-4o-mni","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","date":"2025-05-06","arxiv_id":"2505.05501","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-recognition-evaluating-visual","title":"Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models","date":"2025-05-03","arxiv_id":"2505.03821","repositories_listed":0,"syntology":null},{"url":null,"slug":"freeinsert-disentangled-text-guided-object","title":"FreeInsert: Disentangled Text-Guided Object Insertion in 3D Gaussian Scene without Spatial Priors","date":"2025-05-02","arxiv_id":"2505.01322","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatialllm-a-compound-3d-informed-design","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","date":"2025-05-01","arxiv_id":"2505.00788","repositories_listed":0,"syntology":null},{"url":null,"slug":"first-order-logic-with-fuzzy-semantics-for","title":"First Order Logic with Fuzzy Semantics for Describing and Recognizing Nerves in Medical Images","date":"2025-04-30","arxiv_id":"2505.00173","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatialreasoner-towards-explicit-and","title":"SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning","date":"2025-04-28","arxiv_id":"2504.20024","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-3d-object-detection-with-vision","title":"A Review of 3D Object Detection with Vision-Language Models","date":"2025-04-25","arxiv_id":"2504.18738","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-reasoner-a-3d-inference-pipeline-for","title":"Spatial Reasoner: A 3D Inference Pipeline for XR Applications","date":"2025-04-25","arxiv_id":"2504.18380","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-call-for-new-recipes-to-enhance-spatial","title":"A Call for New Recipes to Enhance Spatial Reasoning in MLLMs","date":"2025-04-21","arxiv_id":"2504.15037","repositories_listed":0,"syntology":null},{"url":null,"slug":"earthgpt-x-enabling-mllms-to-flexibly-and","title":"EarthGPT-X: Enabling MLLMs to Flexibly and Comprehensively Understand Multi-Source Remote Sensing Imagery","date":"2025-04-17","arxiv_id":"2504.12795","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligence-of-things-a-spatial-context","title":"Intelligence of Things: A Spatial Context-Aware Control System for Smart Devices","date":"2025-04-16","arxiv_id":"2504.13942","repositories_listed":0,"syntology":null},{"url":null,"slug":"embodied-world-models-emerge-from","title":"Embodied World Models Emerge from Navigational Task in Open-Ended Environments","date":"2025-04-15","arxiv_id":"2504.11419","repositories_listed":0,"syntology":null},{"url":null,"slug":"lvlm-csp-accelerating-large-vision-language","title":"LVLM_CSP: Accelerating Large Vision Language Models via Clustering, Scattering, and Pruning for Reasoning Segmentation","date":"2025-04-15","arxiv_id":"2504.10854","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-large-language-model-powered","title":"A Survey of Large Language Model-Powered Spatial Intelligence Across Scales: Advances in Embodied Agents, Smart Cities, and Earth Science","date":"2025-04-14","arxiv_id":"2504.09848","repositories_listed":0,"syntology":null},{"url":null,"slug":"foundation-models-for-remote-sensing-an","title":"Foundation Models for Remote Sensing: An Analysis of MLLMs for Object Localization","date":"2025-04-14","arxiv_id":"2504.10727","repositories_listed":0,"syntology":null},{"url":null,"slug":"perturbed-state-space-feature-encoders-for","title":"Perturbed State Space Feature Encoders for Optical Flow with Event Cameras","date":"2025-04-14","arxiv_id":"2504.10669","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualpuzzles-decoupling-multimodal-reasoning","title":"VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge","date":"2025-04-14","arxiv_id":"2504.10342","repositories_listed":0,"syntology":null},{"url":null,"slug":"embodied-chain-of-action-reasoning-with-multi","title":"Embodied Chain of Action Reasoning with Multi-Modal Foundation Model for Humanoid Loco-manipulation","date":"2025-04-13","arxiv_id":"2504.09532","repositories_listed":0,"syntology":null},{"url":null,"slug":"visuothink-empowering-lvlm-reasoning-with","title":"VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search","date":"2025-04-12","arxiv_id":"2504.09130","repositories_listed":0,"syntology":null},{"url":null,"slug":"aerialvg-a-challenging-benchmark-for-aerial","title":"AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional Relations","date":"2025-04-10","arxiv_id":"2504.07836","repositories_listed":0,"syntology":null},{"url":null,"slug":"endowing-embodied-agents-with-spatial","title":"Endowing Embodied Agents with Spatial Reasoning Capabilities for Vision-and-Language Navigation","date":"2025-04-09","arxiv_id":"2504.08806","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-enable-llm-with-3d-capacity-a-survey","title":"How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM","date":"2025-04-08","arxiv_id":"2504.05786","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-visual-text-grounding-of-multimodal","title":"Towards Visual Text Grounding of Multimodal Large Language Model","date":"2025-04-07","arxiv_id":"2504.04974","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-egocentric-video-question-answering","title":"Advancing Egocentric Video Question Answering with Multimodal Large Language Models","date":"2025-04-06","arxiv_id":"2504.04550","repositories_listed":0,"syntology":null},{"url":null,"slug":"nuscenes-spatialqa-a-spatial-understanding","title":"NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving","date":"2025-04-04","arxiv_id":"2504.03164","repositories_listed":0,"syntology":null},{"url":null,"slug":"rsrwkv-a-linear-complexity-2d-attention","title":"RSRWKV: A Linear-Complexity 2D Attention Mechanism for Efficient Remote Sensing Vision Task","date":"2025-03-26","arxiv_id":"2503.20382","repositories_listed":0,"syntology":null},{"url":null,"slug":"dataplatter-boosting-robotic-manipulation","title":"DataPlatter: Boosting Robotic Manipulation Generalization with Minimal Costly Data","date":"2025-03-25","arxiv_id":"2503.19516","repositories_listed":0,"syntology":null},{"url":null,"slug":"lego-puzzles-how-good-are-mllms-at-multi-step","title":"LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?","date":"2025-03-25","arxiv_id":"2503.19990","repositories_listed":0,"syntology":null},{"url":null,"slug":"st-vlm-kinematic-instruction-tuning-for","title":"ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models","date":"2025-03-25","arxiv_id":"2503.19355","repositories_listed":0,"syntology":null},{"url":null,"slug":"aether-geometric-aware-unified-world-modeling","title":"Aether: Geometric-Aware Unified World Modeling","date":"2025-03-24","arxiv_id":"2503.18945","repositories_listed":0,"syntology":null},{"url":null,"slug":"alphaspace-enabling-robotic-actions-through","title":"AlphaSpace: Enabling Robotic Actions through Semantic Tokenization and Symbolic Reasoning","date":"2025-03-24","arxiv_id":"2503.18769","repositories_listed":0,"syntology":null},{"url":null,"slug":"mllm-for3d-adapting-multimodal-large-language","title":"MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation","date":"2025-03-23","arxiv_id":"2503.18135","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-semantics-rediscovering-spatial","title":"Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models","date":"2025-03-21","arxiv_id":"2503.17349","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-vision-centric-remote-sensing-benchmark","title":"A Vision Centric Remote Sensing Benchmark","date":"2025-03-20","arxiv_id":"2503.15816","repositories_listed":0,"syntology":null},{"url":null,"slug":"omnigeo-towards-a-multimodal-large-language","title":"OmniGeo: Towards a Multimodal Large Language Models for Geospatial Artificial Intelligence","date":"2025-03-20","arxiv_id":"2503.16326","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-applications-of-the-20-60-20-rule","title":"Statistical applications of the 20/60/20 rule in risk management and portfolio optimization","date":"2025-03-19","arxiv_id":"2504.02840","repositories_listed":0,"syntology":null},{"url":null,"slug":"ui-vision-a-desktop-centric-gui-benchmark-for","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","date":"2025-03-19","arxiv_id":"2503.15661","repositories_listed":0,"syntology":null},{"url":null,"slug":"embodiedvsr-dynamic-scene-graph-guided-chain","title":"EmbodiedVSR: Dynamic Scene Graph-Guided Chain-of-Thought Reasoning for Visual Spatial Tasks","date":"2025-03-14","arxiv_id":"2503.11089","repositories_listed":0,"syntology":null},{"url":null,"slug":"cleverdistiller-simple-and-spatially","title":"CleverDistiller: Simple and Spatially Consistent Cross-modal Distillation","date":"2025-03-12","arxiv_id":"2503.09878","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-diffusion-based-text-image-super","title":"Boosting Diffusion-Based Text Image Super-Resolution Model Towards Generalized Real-World Scenarios","date":"2025-03-10","arxiv_id":"2503.07232","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-path-navigation-for-motion-agents","title":"Navigating Motion Agents in Dynamic and Cluttered Environments through LLM Reasoning","date":"2025-03-10","arxiv_id":"2503.07323","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-of-conformal-prediction-in","title":"An Empirical Study of Conformal Prediction in LLM with ASP Scaffolds for Robust Reasoning","date":"2025-03-07","arxiv_id":"2503.05439","repositories_listed":0,"syntology":null},{"url":null,"slug":"rocket-2-steering-visuomotor-policy-via-cross","title":"ROCKET-2: Steering Visuomotor Policy via Cross-View Goal Alignment","date":"2025-03-04","arxiv_id":"2503.02505","repositories_listed":0,"syntology":null},{"url":null,"slug":"visfactor-benchmarking-fundamental-visual","title":"VisFactor: Benchmarking Fundamental Visual Cognition in Multimodal Large Language Models","date":"2025-02-23","arxiv_id":"2502.16435","repositories_listed":0,"syntology":null},{"url":null,"slug":"mem2ego-empowering-vision-language-models","title":"Mem2Ego: Empowering Vision-Language Models with Global-to-Ego Memory for Long-Horizon Embodied Navigation","date":"2025-02-20","arxiv_id":"2502.14254","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-language-models-and-mathematical","title":"Large Language Models and Mathematical Reasoning Failures","date":"2025-02-17","arxiv_id":"2502.11574","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-language-geometry-model-when-llm-meets","title":"Large Language-Geometry Model: When LLM meets Equivariance","date":"2025-02-16","arxiv_id":"2502.11149","repositories_listed":0,"syntology":null},{"url":null,"slug":"stma-a-spatio-temporal-memory-agent-for-long","title":"STMA: A Spatio-Temporal Memory Agent for Long-Horizon Embodied Task Planning","date":"2025-02-14","arxiv_id":"2502.10177","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-solver-aided-hierarchical-language-for-llm","title":"A Solver-Aided Hierarchical Language for LLM-Driven CAD Design","date":"2025-02-13","arxiv_id":"2502.09819","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-agentic-ai-for-spatial-reasoning-with","title":"Visual Agentic AI for Spatial Reasoning with a Dynamic API","date":"2025-02-10","arxiv_id":"2502.06787","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-integrated-llms-for-autonomous-driving","title":"Vision-Integrated LLMs for Autonomous Driving Assistance : Human Performance Comparison and Trust Evaluation","date":"2025-02-06","arxiv_id":"2502.06843","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-schema-guided-reason-while-retrieve","title":"A Schema-Guided Reason-while-Retrieve framework for Reasoning on Scene Graphs with Large-Language-Models (LLMs)","date":"2025-02-05","arxiv_id":"2502.03450","repositories_listed":0,"syntology":null}],"record_sha256":"ab2209cfac603fd5d61f1d0a063c1b6e33428d18a443553bc087de2baaf8b81e","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}