{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/learning-to-localize-objects-improves-spatial","title":"Learning to Localize Objects Improves Spatial Reasoning in Visual-LLMs","arxiv_id":"2404.07449","date":"2024-04-11","proceeding":"CVPR 2024 1","authors":["Kanchana Ranasinghe","Satya Narayan Shukla","Omid Poursaeed","Michael S. Ryoo","Tsung-Yu Lin"],"abstract":"Integration of Large Language Models (LLMs) into visual domain tasks, resulting in visual-LLMs (V-LLMs), has enabled exceptional performance in vision-language tasks, particularly for visual question answering (VQA). However, existing V-LLMs (e.g. BLIP-2, LLaVA) demonstrate weak spatial reasoning and localization awareness. Despite generating highly descriptive and elaborate textual answers, these models fail at simple tasks like distinguishing a left vs right location. In this work, we explore how image-space coordinate based instruction fine-tuning objectives could inject spatial awareness into V-LLMs. We discover optimal coordinate representations, data-efficient instruction fine-tuning objectives, and pseudo-data generation strategies that lead to improved spatial awareness in V-LLMs. Additionally, our resulting model improves VQA across image and video domains, reduces undesired hallucination, and generates better contextual object descriptions. Experiments across 5 vision-language tasks involving 14 different datasets establish the clear performance improvements achieved by our proposed framework.","url_abs":"https://arxiv.org/abs/2404.07449v1","url_pdf":"https://arxiv.org/pdf/2404.07449v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"learning-to-localize-objects-improves-spatial","repo_url":"https://github.com/kahnchana/locvlm","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"none","reach":{"status":"ok","spdx":"MIT"}}],"tasks":[{"task_slug":"descriptive","task_name":"Descriptive"},{"task_slug":"hallucination","task_name":"Hallucination"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"spatial-reasoning","task_name":"Spatial Reasoning"},{"task_slug":"video-question-answering","task_name":"Video Question Answering"},{"task_slug":"visual-question-answering-1","task_name":"Visual Question Answering"},{"task_slug":"visual-question-answering","task_name":"Visual Question Answering (VQA)"},{"task_slug":"zero-shot-region-description","task_name":"Zero-Shot Region Description"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/video-question-answering-on-activitynet-qa","task":"Video Question Answering","dataset":"ActivityNet-QA","model":"LocVLM-Vid-B+","rank_in_archive_order":27,"of":36,"metrics":{"Accuracy":"38.2"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-activitynet-qa","task":"Video Question Answering","dataset":"ActivityNet-QA","model":"LocVLM-Vid-B","rank_in_archive_order":28,"of":36,"metrics":{"Accuracy":"37.4"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-msr-vtt","task":"Video Question Answering","dataset":"MSR-VTT","model":"LocVLM-Vid-B","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"51.2"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-msvd-qa","task":"Video Question Answering","dataset":"MSVD-QA","model":"LocVLM-Vid-B","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"66.1"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-tgif-qa","task":"Video Question Answering","dataset":"TGIF-QA","model":"LocVLM-Vid-B","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"51.8"},"uses_additional_data":false},{"leaderboard":"/sota/visual-question-answering-on-gqa-1","task":"Visual Question Answering","dataset":"GQA","model":"LocVLM-L","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"50.2"},"uses_additional_data":false},{"leaderboard":"/sota/visual-question-answering-on-vqa-v2-test-dev-1","task":"Visual Question Answering","dataset":"VQA v2 test-dev","model":"LocVLM-L","rank_in_archive_order":11,"of":11,"metrics":{"Accuracy":"56.2"},"uses_additional_data":false},{"leaderboard":"/sota/visual-question-answering-on-vqa-v2-val-1","task":"Visual Question Answering","dataset":"VQA v2 val","model":"LocVLM-L","rank_in_archive_order":4,"of":4,"metrics":{"Accuracy":"55.9"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2404.07449","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}