{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-grounding/papers/4","list_of":"/task/visual-grounding","task":"Visual Grounding","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":4,"pages_in_order":6,"rows_per_page":100,"rows":[301,400],"of":571,"counts":{"archive_papers_tagged":571,"with_a_code_link":299,"where_syntology_ran_a_sample":111,"not_listed_spam_title":0,"listed":571,"listed_where_code_ran":111,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":95,"every_run_a_failure_of_syntologys_instrument":16,"listed_with_a_run_with_no_instrument_failure":95,"listed_every_run_a_failure_of_syntologys_instrument":16,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-grounding","prev":"/task/visual-grounding/papers/3","next":"/task/visual-grounding/papers/5","papers":[{"url":null,"slug":"a-neural-representation-framework-with-llm","title":"A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding","date":"2025-07-09","arxiv_id":"2507.06719","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualtrap-a-stealthy-backdoor-attack-on-gui","title":"VisualTrap: A Stealthy Backdoor Attack on GUI Agents via Visual Grounding Manipulation","date":"2025-07-09","arxiv_id":"2507.06899","repositories_listed":0,"syntology":null},{"url":null,"slug":"spazer-spatial-semantic-progressive-reasoning","title":"SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding","date":"2025-06-27","arxiv_id":"2506.21924","repositories_listed":0,"syntology":null},{"url":null,"slug":"groundflow-a-plug-in-module-for-temporal","title":"GroundFlow: A Plug-in Module for Temporal Reasoning on 3D Point Cloud Sequential Grounding","date":"2025-06-26","arxiv_id":"2506.21188","repositories_listed":0,"syntology":null},{"url":null,"slug":"hallusegbench-counterfactual-visual-reasoning","title":"HalluSegBench: Counterfactual Visual Reasoning for Segmentation Hallucination Evaluation","date":"2025-06-26","arxiv_id":"2506.21546","repositories_listed":0,"syntology":null},{"url":null,"slug":"gemex-thinkvg-towards-thinking-with-visual","title":"GEMeX-ThinkVG: Towards Thinking with Visual Grounding in Medical VQA via Reinforcement Learning","date":"2025-06-22","arxiv_id":"2506.17939","repositories_listed":0,"syntology":null},{"url":null,"slug":"i-speak-and-you-find-robust-3d-visual","title":"I Speak and You Find: Robust 3D Visual Grounding with Noisy and Ambiguous Speech Inputs","date":"2025-06-17","arxiv_id":"2506.14495","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-representation-space-for-3d-visual","title":"Unified Representation Space for 3D Visual Grounding","date":"2025-06-17","arxiv_id":"2506.14238","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-localization-guiding-segment","title":"Semantic Localization Guiding Segment Anything Model For Reference Remote Sensing Image Segmentation","date":"2025-06-12","arxiv_id":"2506.10503","repositories_listed":0,"syntology":null},{"url":null,"slug":"econwebarena-benchmarking-autonomous-agents","title":"EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments","date":"2025-06-09","arxiv_id":"2506.08136","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-your-3d-encoder-really-work-when","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","date":"2025-06-05","arxiv_id":"2506.05318","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-objects-to-anywhere-a-holistic-benchmark","title":"From Objects to Anywhere: A Holistic Benchmark for Multi-level Visual Grounding in 3D Scenes","date":"2025-06-05","arxiv_id":"2506.04897","repositories_listed":0,"syntology":null},{"url":null,"slug":"perceptual-decoupling-for-scalable-multi","title":"Perceptual Decoupling for Scalable Multi-modal Reasoning via Reward-Optimized Captioning","date":"2025-06-05","arxiv_id":"2506.04559","repositories_listed":0,"syntology":null},{"url":null,"slug":"rsvp-reasoning-segmentation-via-visual","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","date":"2025-06-04","arxiv_id":"2506.04277","repositories_listed":0,"syntology":null},{"url":null,"slug":"gui-actor-coordinate-free-visual-grounding","title":"GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents","date":"2025-06-03","arxiv_id":"2506.03143","repositories_listed":0,"syntology":null},{"url":null,"slug":"moda-modulation-adapter-for-fine-grained","title":"MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs","date":"2025-06-02","arxiv_id":"2506.01850","repositories_listed":0,"syntology":null},{"url":null,"slug":"d2af-a-dual-driven-annotation-and-filtering","title":"D2AF: A Dual-Driven Annotation and Filtering Framework for Visual Grounding","date":"2025-05-30","arxiv_id":"2505.24372","repositories_listed":0,"syntology":null},{"url":null,"slug":"mrag-elucidating-the-design-space-of-multi","title":"mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation","date":"2025-05-29","arxiv_id":"2505.24073","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-3d-visual-grounding-from-vision","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","date":"2025-05-28","arxiv_id":"2505.22429","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-hallucination-in-large-vision","title":"Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration","date":"2025-05-27","arxiv_id":"2505.21472","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-causally-related-needles-in-a-video","title":"Two Causally Related Needles in a Video Haystack","date":"2025-05-26","arxiv_id":"2505.19853","repositories_listed":0,"syntology":null},{"url":null,"slug":"don-t-look-only-once-towards-multimodal","title":"Don't Look Only Once: Towards Multimodal Interactive Reasoning with Selective Visual Revisitation","date":"2025-05-24","arxiv_id":"2505.18842","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-thinking-less-seeing-assessing-amplified","title":"More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models","date":"2025-05-23","arxiv_id":"2505.21523","repositories_listed":0,"syntology":null},{"url":null,"slug":"redemption-score-an-evaluation-framework-to","title":"Redemption Score: An Evaluation Framework to Rank Image Captions While Redeeming Image Semantics and Language Pragmatics","date":"2025-05-22","arxiv_id":"2505.16180","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-free-reasoning-and-reflection-in","title":"Training-Free Reasoning and Reflection in MLLMs","date":"2025-05-22","arxiv_id":"2505.16151","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-the-trees-for-the-forest-rethinking","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","date":"2025-05-21","arxiv_id":"2505.15123","repositories_listed":0,"syntology":null},{"url":null,"slug":"univg-r1-reasoning-guided-universal-visual","title":"UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning","date":"2025-05-20","arxiv_id":"2505.14231","repositories_listed":0,"syntology":null},{"url":null,"slug":"medsg-bench-a-benchmark-for-medical-image","title":"MedSG-Bench: A Benchmark for Medical Image Sequences Grounding","date":"2025-05-17","arxiv_id":"2505.11852","repositories_listed":0,"syntology":null},{"url":null,"slug":"tinyrs-r1-compact-multimodal-language-model","title":"TinyRS-R1: Compact Multimodal Language Model for Remote Sensing","date":"2025-05-17","arxiv_id":"2505.12099","repositories_listed":0,"syntology":null},{"url":null,"slug":"densegrounding-improving-dense-language","title":"DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding","date":"2025-05-08","arxiv_id":"2505.04965","repositories_listed":0,"syntology":null},{"url":null,"slug":"3dwg-3d-weakly-supervised-visual-grounding","title":"3DWG: 3D Weakly Supervised Visual Grounding via Category and Instance-Level Alignment","date":"2025-05-03","arxiv_id":"2505.01809","repositories_listed":0,"syntology":null},{"url":null,"slug":"vist-gpt-ushering-in-the-era-of-visual","title":"VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?","date":"2025-04-27","arxiv_id":"2504.19267","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-data-auditing-in-large-vision","title":"Revisiting Data Auditing in Large Vision-Language Models","date":"2025-04-25","arxiv_id":"2504.18349","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-intention-grounding-for-egocentric","title":"Visual Intention Grounding for Egocentric Assistants","date":"2025-04-18","arxiv_id":"2504.13621","repositories_listed":0,"syntology":null},{"url":null,"slug":"counts-benchmarking-object-detectors-and","title":"COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts","date":"2025-04-14","arxiv_id":"2504.10158","repositories_listed":0,"syntology":null},{"url":null,"slug":"dsm-building-a-diverse-semantic-map-for-3d","title":"DSM: Building A Diverse Semantic Map for 3D Visual Grounding","date":"2025-04-11","arxiv_id":"2504.08307","repositories_listed":0,"syntology":null},{"url":null,"slug":"aerialvg-a-challenging-benchmark-for-aerial","title":"AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional Relations","date":"2025-04-10","arxiv_id":"2504.07836","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-visual-text-grounding-of-multimodal","title":"Towards Visual Text Grounding of Multimodal Large Language Model","date":"2025-04-07","arxiv_id":"2504.04974","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-difference-grounding-with-natural","title":"Image Difference Grounding with Natural Language","date":"2025-04-02","arxiv_id":"2504.01952","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-reference-visual-grounding","title":"Multimodal Reference Visual Grounding","date":"2025-04-02","arxiv_id":"2504.02876","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-unified-referring-expression","title":"Towards Unified Referring Expression Segmentation Across Omni-Level Visual Target Granularities","date":"2025-04-02","arxiv_id":"2504.01954","repositories_listed":0,"syntology":null},{"url":null,"slug":"reasongrounder-lvlm-guided-hierarchical","title":"ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning","date":"2025-03-30","arxiv_id":"2503.23297","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-adaptation-for-remote-sensing","title":"Efficient Adaptation For Remote Sensing Visual Grounding","date":"2025-03-29","arxiv_id":"2503.23083","repositories_listed":0,"syntology":null},{"url":null,"slug":"nugrounding-a-multi-view-3d-visual-grounding","title":"NuGrounding: A Multi-View 3D Visual Grounding Framework in Autonomous Driving","date":"2025-03-28","arxiv_id":"2503.22436","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-object-categories-multi-attribute","title":"Beyond Object Categories: Multi-Attribute Reference Understanding for Visual Grounding","date":"2025-03-25","arxiv_id":"2503.19240","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-speech-and-sound-distinguishing-and","title":"Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes","date":"2025-03-24","arxiv_id":"2503.18880","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-vision-centric-remote-sensing-benchmark","title":"A Vision Centric Remote Sensing Benchmark","date":"2025-03-20","arxiv_id":"2503.15816","repositories_listed":0,"syntology":null},{"url":null,"slug":"your-large-vision-language-model-only-needs-a","title":"Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding","date":"2025-03-08","arxiv_id":"2503.06287","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-abnormality-grounding-for-vision","title":"Enhancing Abnormality Grounding for Vision Language Models with Knowledge Descriptions","date":"2025-03-05","arxiv_id":"2503.03278","repositories_listed":0,"syntology":null},{"url":null,"slug":"teaching-metric-distance-to-autoregressive","title":"Teaching Metric Distance to Autoregressive Multimodal Foundational Models","date":"2025-03-04","arxiv_id":"2503.02379","repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-preference-optimization-for-vision","title":"Structured Preference Optimization for Vision-Language Long-Horizon Task Planning","date":"2025-02-28","arxiv_id":"2502.20742","repositories_listed":0,"syntology":null},{"url":null,"slug":"proxytransformation-preshaping-point-cloud","title":"ProxyTransformation: Preshaping Point Cloud Manifold With Proxy Attention For 3D Visual Grounding","date":"2025-02-26","arxiv_id":"2502.19247","repositories_listed":0,"syntology":null},{"url":null,"slug":"programming-with-pixels-computer-use-meets","title":"Programming with Pixels: Computer-Use Meets Software Engineering","date":"2025-02-24","arxiv_id":"2502.18525","repositories_listed":0,"syntology":null},{"url":"/paper/groundcap-a-visually-grounded-image","slug":"groundcap-a-visually-grounded-image","title":"GroundCap: A Visually Grounded Image Captioning Dataset","date":"2025-02-19","arxiv_id":"2502.13898","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-multimodal-llms-assisted-by","title":"Leveraging Multimodal-LLMs Assisted by Instance Segmentation for Intelligent Traffic Monitoring","date":"2025-02-16","arxiv_id":"2502.11304","repositories_listed":0,"syntology":null},{"url":null,"slug":"travel-training-free-retrieval-and-alignment","title":"TRAVEL: Training-Free Retrieval and Alignment for Vision-and-Language Navigation","date":"2025-02-11","arxiv_id":"2502.07306","repositories_listed":0,"syntology":null},{"url":null,"slug":"rls3-rl-based-synthetic-sample-selection-to","title":"RLS3: RL-Based Synthetic Sample Selection to Enhance Spatial Reasoning in Vision-Language Models for Indoor Autonomous Perception","date":"2025-01-31","arxiv_id":"2501.18880","repositories_listed":0,"syntology":null},{"url":"/paper/referdino-referring-video-object-segmentation","slug":"referdino-referring-video-object-segmentation","title":"ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations","date":"2025-01-24","arxiv_id":"2501.14607","repositories_listed":0,"syntology":null},{"url":null,"slug":"flora-formal-language-model-enables-robust","title":"FLORA: Formal Language Model Enables Robust Training-free Zero-shot Object Referring Analysis","date":"2025-01-17","arxiv_id":"2501.09887","repositories_listed":0,"syntology":null},{"url":null,"slug":"augrefer-advancing-3d-visual-grounding-via","title":"AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring","date":"2025-01-16","arxiv_id":"2501.09428","repositories_listed":0,"syntology":null},{"url":null,"slug":"geopix-multi-modal-large-language-model-for","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","date":"2025-01-12","arxiv_id":"2501.06828","repositories_listed":0,"syntology":null},{"url":null,"slug":"eagle-enhanced-visual-grounding-minimizes","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","date":"2025-01-06","arxiv_id":"2501.02699","repositories_listed":0,"syntology":null},{"url":null,"slug":"vigil3d-a-linguistically-diverse-dataset-for","title":"ViGiL3D: A Linguistically Diverse Dataset for 3D Visual Grounding","date":"2025-01-02","arxiv_id":"2501.01366","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-human-perception-understanding-multi","title":"Beyond Human Perception: Understanding Multi-Object World from Monocular View","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-speech-and-sound-distinguishing-and-1","title":"Seeing Speech and Sound: Distinguishing and Locating Audio Sources in Visual Scenes","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"task-aware-cross-modal-feature-refinement","title":"Task-aware Cross-modal Feature Refinement Transformer with Large Language Models for Visual Grounding","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"videoglamm-a-large-multimodal-model-for-pixel-1","title":"VideoGLaMM : A Large Multimodal Model for Pixel-Level Visual Grounding in Videos","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"referencing-where-to-focus-improving","title":"Referencing Where to Focus: Improving VisualGrounding with Referential Query","date":"2024-12-26","arxiv_id":"2412.19155","repositories_listed":0,"syntology":null},{"url":null,"slug":"earthdial-turning-multi-sensory-earth","title":"EarthDial: Turning Multi-sensory Earth Observations to Interactive Dialogues","date":"2024-12-19","arxiv_id":"2412.15190","repositories_listed":0,"syntology":null},{"url":null,"slug":"fivl-a-framework-for-improved-vision-language","title":"FiVL: A Framework for Improved Vision-Language Alignment","date":"2024-12-19","arxiv_id":"2412.14672","repositories_listed":0,"syntology":null},{"url":null,"slug":"gags-granularity-aware-feature-distillation","title":"GAGS: Granularity-Aware Feature Distillation for Language Gaussian Splatting","date":"2024-12-18","arxiv_id":"2412.13654","repositories_listed":0,"syntology":null},{"url":null,"slug":"barking-up-the-syntactic-tree-enhancing-vlm","title":"Barking Up The Syntactic Tree: Enhancing VLM Training with Syntactic Losses","date":"2024-12-11","arxiv_id":"2412.08110","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-spatial-understanding-in-mllms","title":"3D Spatial Understanding in MLLMs: Disambiguation and Evaluation","date":"2024-12-09","arxiv_id":"2412.06613","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeground-see-and-ground-for-zero-shot-open","title":"SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding","date":"2024-12-05","arxiv_id":"2412.04383","repositories_listed":0,"syntology":null},{"url":null,"slug":"paint-outside-the-box-synthesizing-and","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","date":"2024-12-01","arxiv_id":"2412.00684","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-scene-graph-guided-vision-language-pre","title":"3D Scene Graph Guided Vision-Language Pre-training","date":"2024-11-27","arxiv_id":"2411.18666","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-grounded-video-reasoning-understanding","title":"Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level","date":"2024-11-15","arxiv_id":"2411.09921","repositories_listed":0,"syntology":null},{"url":null,"slug":"lidarefer-outdoor-3d-visual-grounding-for","title":"LidaRefer: Outdoor 3D Visual Grounding for Autonomous Driving with Transformers","date":"2024-11-07","arxiv_id":"2411.04351","repositories_listed":0,"syntology":null},{"url":null,"slug":"videoglamm-a-large-multimodal-model-for-pixel","title":"VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos","date":"2024-11-07","arxiv_id":"2411.04923","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-spatial-and-verbal-losses-for-3d","title":"Fine-Grained Spatial and Verbal Losses for 3D Visual Grounding","date":"2024-11-05","arxiv_id":"2411.03405","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-efficient-fine-tuning-medical","title":"Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding","date":"2024-10-31","arxiv_id":"2410.23822","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-top-down-and-bottom-up-frameworks-for","title":"Joint Top-Down and Bottom-Up Frameworks for 3D Visual Grounding","date":"2024-10-21","arxiv_id":"2410.15615","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-ground-vlms-without-forgetting","title":"Learning to Ground VLMs without Forgetting","date":"2024-10-14","arxiv_id":"2410.10491","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-material-adaptor-for-visual-grounding","title":"Neural Material Adaptor for Visual Grounding of Intrinsic Dynamics","date":"2024-10-10","arxiv_id":"2410.08257","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounding-robot-policies-with-visuomotor","title":"GRAPPA: Generalizing and Adapting Robot Policies via Online Agentic Guidance","date":"2024-10-09","arxiv_id":"2410.06473","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-aware-command-understanding-for","title":"Context-Aware Command Understanding for Tabletop Scenarios","date":"2024-10-08","arxiv_id":"2410.06355","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlm2vec-training-vision-language-models-for","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","date":"2024-10-07","arxiv_id":"2410.05160","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-masking-enhances-visual-grounding","title":"Adaptive Masking Enhances Visual Grounding","date":"2024-10-04","arxiv_id":"2410.03161","repositories_listed":0,"syntology":null},{"url":null,"slug":"individuation-in-neural-models-with-and","title":"Individuation in Neural Models with and without Visual Grounding","date":"2024-09-27","arxiv_id":"2409.18868","repositories_listed":0,"syntology":null},{"url":null,"slug":"zalm3-zero-shot-enhancement-of-vision","title":"ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue","date":"2024-09-26","arxiv_id":"2409.17610","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-self-training-for-semi-supervised-3d","title":"Bayesian Self-Training for Semi-Supervised 3D Segmentation","date":"2024-09-12","arxiv_id":"2409.08102","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-prompting-in-multimodal-large-language","title":"Visual Prompting in Multimodal Large Language Models: A Survey","date":"2024-09-05","arxiv_id":"2409.15310","repositories_listed":0,"syntology":null},{"url":null,"slug":"nanomvg-usv-centric-low-power-multi-task","title":"NanoMVG: USV-Centric Low-Power Multi-Task Visual Grounding based on Prompt-Guided Camera and 4D mmWave Radar","date":"2024-08-30","arxiv_id":"2408.17207","repositories_listed":0,"syntology":null},{"url":null,"slug":"m4cxr-exploring-multi-task-potentials-of","title":"M4CXR: Exploring Multi-task Potentials of Multi-modal Large Language Models for Chest X-ray Interpretation","date":"2024-08-29","arxiv_id":"2408.16213","repositories_listed":0,"syntology":null},{"url":"/paper/mmr-evaluating-reading-ability-of-large","slug":"mmr-evaluating-reading-ability-of-large","title":"MMR: Evaluating Reading Ability of Large Multimodal Models","date":"2024-08-26","arxiv_id":"2408.14594","repositories_listed":0,"syntology":null},{"url":null,"slug":"polaris-open-ended-interactive-robotic","title":"Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models","date":"2024-08-15","arxiv_id":"2408.07975","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-oriented-sequential-grounding-in-3d","title":"Task-oriented Sequential Grounding in 3D Scenes","date":"2024-08-07","arxiv_id":"2408.04034","repositories_listed":0,"syntology":null},{"url":null,"slug":"uouo-uncontextualized-uncommon-objects-for","title":"UOUO: Uncontextualized Uncommon Objects for Measuring Knowledge Horizons of Vision Language Models","date":"2024-07-25","arxiv_id":"2407.18391","repositories_listed":0,"syntology":null},{"url":null,"slug":"unveiling-and-mitigating-bias-in-audio-visual","title":"Unveiling and Mitigating Bias in Audio Visual Segmentation","date":"2024-07-23","arxiv_id":"2407.16638","repositories_listed":0,"syntology":null},{"url":null,"slug":"pd-tpe-parallel-decoder-with-text-guided","title":"PD-APE: A Parallel Decoding Framework with Adaptive Position Encoding for 3D Visual Grounding","date":"2024-07-19","arxiv_id":"2407.14491","repositories_listed":0,"syntology":null}],"record_sha256":"b5cf3038855ed318922ababde33a200d1b0b51d9291cc05e81616e05efa0891d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}