{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering-1/papers/15","list_of":"/task/visual-question-answering-1","task":"Visual Question Answering","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":15,"pages_in_order":22,"rows_per_page":100,"rows":[1401,1500],"of":2177,"counts":{"archive_papers_tagged":2177,"with_a_code_link":1042,"where_syntology_ran_a_sample":378,"not_listed_spam_title":0,"listed":2177,"listed_where_code_ran":378,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":308,"every_run_a_failure_of_syntologys_instrument":70,"listed_with_a_run_with_no_instrument_failure":308,"listed_every_run_a_failure_of_syntologys_instrument":70,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering-1","prev":"/task/visual-question-answering-1/papers/14","next":"/task/visual-question-answering-1/papers/16","papers":[{"url":"/paper/claude-3-5-sonnet-model-card-addendum","slug":"claude-3-5-sonnet-model-card-addendum","title":"Claude 3.5 Sonnet Model Card Addendum","date":"2024-06-24","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"gpt-4v-explorations-mining-autonomous-driving","title":"GPT-4V Explorations: Mining Autonomous Driving","date":"2024-06-24","arxiv_id":"2406.16817","repositories_listed":0,"syntology":null},{"url":null,"slug":"mm-spubench-towards-better-understanding-of","title":"MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs","date":"2024-06-24","arxiv_id":"2406.17126","repositories_listed":0,"syntology":null},{"url":null,"slug":"mr-mllm-mutual-reinforcement-of-multimodal","title":"MR-MLLM: Mutual Reinforcement of Multimodal Comprehension and Vision Perception","date":"2024-06-22","arxiv_id":"2406.15768","repositories_listed":0,"syntology":null},{"url":null,"slug":"tri-vqa-triangular-reasoning-medical-visual","title":"Tri-VQA: Triangular Reasoning Medical Visual Question Answering for Multi-Attribute Analysis","date":"2024-06-21","arxiv_id":"2406.15050","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-object-grounding-really-reduce","title":"Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?","date":"2024-06-20","arxiv_id":"2406.14492","repositories_listed":0,"syntology":null},{"url":null,"slug":"llarva-vision-action-instruction-tuning","title":"LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning","date":"2024-06-17","arxiv_id":"2406.11815","repositories_listed":0,"syntology":null},{"url":null,"slug":"program-synthesis-benchmark-for-visual","title":"Program Synthesis Benchmark for Visual Programming in XLogoOnline Environment","date":"2024-06-17","arxiv_id":"2406.11334","repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-and-evaluating-medical","title":"Detecting and Evaluating Medical Hallucinations in Large Vision Language Models","date":"2024-06-14","arxiv_id":"2406.10185","repositories_listed":0,"syntology":null},{"url":null,"slug":"precision-empowers-excess-distracts-visual","title":"Precision Empowers, Excess Distracts: Visual Question Answering With Dynamically Infused Knowledge In Language Models","date":"2024-06-14","arxiv_id":"2406.09994","repositories_listed":0,"syntology":null},{"url":null,"slug":"shmamba-structured-hyperbolic-state-space","title":"SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering","date":"2024-06-14","arxiv_id":"2406.09833","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-visual-question-answering-models","title":"Optimizing Visual Question Answering Models for Driving: Bridging the Gap Between Human and Machine Attention Patterns","date":"2024-06-13","arxiv_id":"2406.09203","repositories_listed":0,"syntology":null},{"url":null,"slug":"distildoc-knowledge-distillation-for-visually","title":"DistilDoc: Knowledge Distillation for Visually-Rich Document Applications","date":"2024-06-12","arxiv_id":"2406.08226","repositories_listed":0,"syntology":null},{"url":"/paper/what-if-we-recaption-billions-of-web-images","slug":"what-if-we-recaption-billions-of-web-images","title":"What If We Recaption Billions of Web Images with LLaMA-3?","date":"2024-06-12","arxiv_id":"2406.08478","repositories_listed":0,"syntology":null},{"url":null,"slug":"cvqa-culturally-diverse-multilingual-visual","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","date":"2024-06-10","arxiv_id":"2406.05967","repositories_listed":0,"syntology":null},{"url":null,"slug":"solution-for-smart-101-challenge-of-cvpr","title":"Solution for SMART-101 Challenge of CVPR Multi-modal Algorithmic Reasoning Task 2024","date":"2024-06-10","arxiv_id":"2406.05963","repositories_listed":0,"syntology":null},{"url":"/paper/towards-semantic-equivalence-of-tokenization","slug":"towards-semantic-equivalence-of-tokenization","title":"Towards Semantic Equivalence of Tokenization in Multimodal LLM","date":"2024-06-07","arxiv_id":"2406.05127","repositories_listed":0,"syntology":null},{"url":"/paper/deepstack-deeply-stacking-visual-tokens-is","slug":"deepstack-deeply-stacking-visual-tokens-is","title":"DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs","date":"2024-06-06","arxiv_id":"2406.04334","repositories_listed":0,"syntology":null},{"url":"/paper/robomamba-multimodal-state-space-model-for","slug":"robomamba-multimodal-state-space-model-for","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","date":"2024-06-06","arxiv_id":"2406.04339","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-information-storage-and","title":"Understanding Information Storage and Transfer in Multi-modal Large Language Models","date":"2024-06-06","arxiv_id":"2406.04236","repositories_listed":0,"syntology":null},{"url":null,"slug":"balancing-performance-and-efficiency-in-zero","title":"Balancing Performance and Efficiency in Zero-shot Robotic Navigation","date":"2024-06-05","arxiv_id":"2406.03015","repositories_listed":0,"syntology":null},{"url":null,"slug":"story-generation-from-visual-inputs","title":"Story Generation from Visual Inputs: Techniques, Related Tasks, and Challenges","date":"2024-06-04","arxiv_id":"2406.02748","repositories_listed":0,"syntology":null},{"url":null,"slug":"translation-deserves-better-analyzing","title":"Translation Deserves Better: Analyzing Translation Artifacts in Cross-lingual Visual Question Answering","date":"2024-06-04","arxiv_id":"2406.02331","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixture-of-rationale-multi-modal-reasoning","title":"Mixture of Rationale: Multi-Modal Reasoning Mixture for Visual Question Answering","date":"2024-06-03","arxiv_id":"2406.01402","repositories_listed":0,"syntology":null},{"url":null,"slug":"selectively-answering-visual-questions","title":"Selectively Answering Visual Questions","date":"2024-06-03","arxiv_id":"2406.00980","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncovering-bias-in-large-vision-language-1","title":"Uncovering Bias in Large Vision-Language Models at Scale with Counterfactuals","date":"2024-05-30","arxiv_id":"2405.20152","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-question-answering-for-people-with","title":"Video Question Answering for People with Visual Impairments Using an Egocentric 360-Degree Camera","date":"2024-05-30","arxiv_id":"2405.19794","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqa-training-sets-are-self-play-environments","title":"VQA Training Sets are Self-play Environments for Generating Few-shot Pools","date":"2024-05-30","arxiv_id":"2405.19773","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-zero-shot-gpt-4v-performance-on-3d","title":"Evaluating Zero-Shot GPT-4V Performance on 3D Visual Question Answering Benchmarks","date":"2024-05-29","arxiv_id":"2405.18831","repositories_listed":0,"syntology":null},{"url":null,"slug":"metatoken-detecting-hallucination-in-image","title":"MetaToken: Detecting Hallucination in Image Descriptions by Meta Classification","date":"2024-05-29","arxiv_id":"2405.19186","repositories_listed":0,"syntology":null},{"url":"/paper/mitigating-object-hallucination-via-data","slug":"mitigating-object-hallucination-via-data","title":"Data-augmented phrase-level alignment for mitigating object hallucination","date":"2024-05-28","arxiv_id":"2405.18654","repositories_listed":0,"syntology":{"n":10,"n_ran":6,"n_constructed":0,"n_ran_checked":3,"n_instrument":3,"n_unverified":4,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":10,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 3 where Syntology's instrument failed) · 4 unverified","sample_list":"/paper/mitigating-object-hallucination-via-data#ran","syntology_url":"https://syntology.ai/paper/2405.18654","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2405.18654"}},"official":null}},{"url":"/paper/mmctagent-multi-modal-critical-thinking-agent","slug":"mmctagent-multi-modal-critical-thinking-agent","title":"MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning","date":"2024-05-28","arxiv_id":"2405.18358","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-aware-adapter-towards-learning","title":"Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models","date":"2024-05-24","arxiv_id":"2405.15684","repositories_listed":0,"syntology":null},{"url":"/paper/aligngpt-multi-modal-large-language-models","slug":"aligngpt-multi-modal-large-language-models","title":"AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability","date":"2024-05-23","arxiv_id":"2405.14129","repositories_listed":0,"syntology":null},{"url":null,"slug":"udkag-augmenting-large-vision-language-models","title":"SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge","date":"2024-05-23","arxiv_id":"2405.14554","repositories_listed":0,"syntology":null},{"url":"/paper/image-of-thought-prompting-for-visual","slug":"image-of-thought-prompting-for-visual","title":"Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models","date":"2024-05-22","arxiv_id":"2405.13872","repositories_listed":0,"syntology":null},{"url":null,"slug":"inquire-interact-and-integrate-a-proactive","title":"Inquire, Interact, and Integrate: A Proactive Agent Collaborative Framework for Zero-Shot Multimodal Medical Reasoning","date":"2024-05-19","arxiv_id":"2405.11640","repositories_listed":0,"syntology":null},{"url":null,"slug":"eyefound-a-multimodal-generalist-foundation","title":"EyeFound: A Multimodal Generalist Foundation Model for Ophthalmic Imaging","date":"2024-05-18","arxiv_id":"2405.11338","repositories_listed":0,"syntology":null},{"url":null,"slug":"stackoverflowvqa-stack-overflow-visual","title":"StackOverflowVQA: Stack Overflow Visual Question Answering Dataset","date":"2024-05-17","arxiv_id":"2405.10736","repositories_listed":0,"syntology":null},{"url":null,"slug":"clip-powered-tass-target-aware-single-stream","title":"CLIP-Powered TASS: Target-Aware Single-Stream Network for Audio-Visual Question Answering","date":"2024-05-13","arxiv_id":"2405.07451","repositories_listed":0,"syntology":null},{"url":null,"slug":"realizing-visual-question-answering-for","title":"Realizing Visual Question Answering for Education: GPT-4V as a Multimodal AI","date":"2024-05-12","arxiv_id":"2405.07163","repositories_listed":0,"syntology":null},{"url":null,"slug":"s-eqa-tackling-situational-queries-in","title":"Is the House Ready For Sleeptime? Generating and Evaluating Situational Queries for Embodied Question Answering","date":"2024-05-08","arxiv_id":"2405.04732","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-multimodal-medical-capabilities-of","title":"Advancing Multimodal Medical Capabilities of Gemini","date":"2024-05-06","arxiv_id":"2405.03162","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-image-models-with-3d-understanding","title":"Language-Image Models with 3D Understanding","date":"2024-05-06","arxiv_id":"2405.03685","repositories_listed":0,"syntology":null},{"url":null,"slug":"vsa4vqa-scaling-a-vector-symbolic","title":"VSA4VQA: Scaling a Vector Symbolic Architecture to Visual Question Answering on Natural Images","date":"2024-05-06","arxiv_id":"2405.03852","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-human-vision-the-role-of-large-vision","title":"Beyond Human Vision: The Role of Large Vision Language Models in Microscope Image Analysis","date":"2024-05-01","arxiv_id":"2405.00876","repositories_listed":0,"syntology":null},{"url":null,"slug":"crepe-coordinate-aware-end-to-end-document","title":"CREPE: Coordinate-Aware End-to-End Document Parser","date":"2024-05-01","arxiv_id":"2405.00260","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-visual-question-answering-a","title":"Enhanced Textual Feature Extraction for Visual Question Answering: A Simple Convolutional Approach","date":"2024-05-01","arxiv_id":"2405.00479","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficiency-in-focus-layernorm-as-a-catalyst","title":"Efficiency in Focus: LayerNorm as a Catalyst for Fine-tuning Medical Visual Language Pre-trained Models","date":"2024-04-25","arxiv_id":"2404.16385","repositories_listed":0,"syntology":null},{"url":null,"slug":"fusion-of-domain-adapted-vision-and-language","title":"Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering","date":"2024-04-24","arxiv_id":"2404.16192","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounded-knowledge-enhanced-medical-vlp-for","title":"Grounded Knowledge-Enhanced Medical VLP for Chest X-Ray","date":"2024-04-23","arxiv_id":"2404.14750","repositories_listed":0,"syntology":null},{"url":null,"slug":"wiki-llava-hierarchical-retrieval-augmented","title":"Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs","date":"2024-04-23","arxiv_id":"2404.15406","repositories_listed":0,"syntology":null},{"url":null,"slug":"wanglab-at-mediqa-m3g-2024-multimodal-medical","title":"WangLab at MEDIQA-M3G 2024: Multimodal Medical Answer Generation using Large Language Models","date":"2024-04-22","arxiv_id":"2404.14567","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-diverse-methods-in-visual-question","title":"Exploring Diverse Methods in Visual Question Answering","date":"2024-04-21","arxiv_id":"2404.13565","repositories_listed":0,"syntology":null},{"url":null,"slug":"eyes-can-deceive-benchmarking-counterfactual","title":"Look Before You Decide: Prompting Active Deduction of MLLMs for Assumptive Reasoning","date":"2024-04-19","arxiv_id":"2404.12966","repositories_listed":0,"syntology":null},{"url":null,"slug":"pdf-mvqa-a-dataset-for-multimodal-information","title":"PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering","date":"2024-04-19","arxiv_id":"2404.12720","repositories_listed":0,"syntology":null},{"url":null,"slug":"textsquare-scaling-up-text-centric-visual","title":"TextSquare: Scaling up Text-Centric Visual Instruction Tuning","date":"2024-04-19","arxiv_id":"2404.12803","repositories_listed":0,"syntology":null},{"url":null,"slug":"medthink-explaining-medical-visual-question","title":"MedThink: Explaining Medical Visual Question Answering via Multimodal Decision-Making Rationale","date":"2024-04-18","arxiv_id":"2404.12372","repositories_listed":0,"syntology":null},{"url":null,"slug":"consistency-and-uncertainty-identifying","title":"Consistency and Uncertainty: Identifying Unreliable Responses From Black-Box Vision-Language Models for Selective Visual Question Answering","date":"2024-04-16","arxiv_id":"2404.10193","repositories_listed":0,"syntology":null},{"url":null,"slug":"find-the-gap-knowledge-base-reasoning-for","title":"Find The Gap: Knowledge Base Reasoning For Visual Question Answering","date":"2024-04-16","arxiv_id":"2404.10226","repositories_listed":0,"syntology":null},{"url":null,"slug":"hoi-ref-hand-object-interaction-referral-in","title":"HOI-Ref: Hand-Object Interaction Referral in Egocentric Vision","date":"2024-04-15","arxiv_id":"2404.09933","repositories_listed":0,"syntology":null},{"url":"/paper/omnifusion-technical-report","slug":"omnifusion-technical-report","title":"OmniFusion Technical Report","date":"2024-04-09","arxiv_id":"2404.06212","repositories_listed":0,"syntology":null},{"url":null,"slug":"hammr-hierarchical-multimodal-react-agents","title":"HAMMR: HierArchical MultiModal React agents for generic VQA","date":"2024-04-08","arxiv_id":"2404.05465","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-training-large-language-models-for","title":"Self-Training Large Language Models for Improved Visual Program Synthesis With Visual Reinforcement","date":"2024-04-06","arxiv_id":"2404.04627","repositories_listed":0,"syntology":null},{"url":null,"slug":"buddie-a-business-document-dataset-for-multi","title":"BuDDIE: A Business Document Dataset for Multi-task Information Extraction","date":"2024-04-05","arxiv_id":"2404.04003","repositories_listed":0,"syntology":null},{"url":null,"slug":"tinyvqa-compact-multimodal-deep-neural","title":"TinyVQA: Compact Multimodal Deep Neural Network for Visual Question Answering on Resource-Constrained Devices","date":"2024-04-04","arxiv_id":"2404.03574","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-human-computer-interaction-in-chest","title":"Enhancing Human-Computer Interaction in Chest X-ray Analysis using Vision and Language Model with Eye Gaze Patterns","date":"2024-04-03","arxiv_id":"2404.02370","repositories_listed":0,"syntology":null},{"url":null,"slug":"detect2interact-localizing-object-key-field","title":"Detect2Interact: Localizing Object Key Field in Visual Question Answering (VQA) with LLMs","date":"2024-04-01","arxiv_id":"2404.01151","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncovering-bias-in-large-vision-language","title":"Uncovering Bias in Large Vision-Language Models with Counterfactuals","date":"2024-03-29","arxiv_id":"2404.00166","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-gaze-grounded-visual-question-answering","title":"A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions","date":"2024-03-26","arxiv_id":"2403.17545","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-hallucination-definition","title":"Visual Hallucination: Definition, Quantification, and Prescriptive Remediations","date":"2024-03-26","arxiv_id":"2403.17306","repositories_listed":0,"syntology":null},{"url":null,"slug":"proptest-automatic-property-testing-for","title":"PropTest: Automatic Property Testing for Improved Visual Programming","date":"2024-03-25","arxiv_id":"2403.16921","repositories_listed":0,"syntology":null},{"url":null,"slug":"synthesize-step-by-step-tools-templates-and","title":"Synthesize Step-by-Step: Tools, Templates and LLMs as Data Generators for Reasoning-Based Chart VQA","date":"2024-03-25","arxiv_id":"2403.16385","repositories_listed":0,"syntology":null},{"url":null,"slug":"surgical-lvlm-learning-to-adapt-large-vision","title":"Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery","date":"2024-03-22","arxiv_id":"2405.10948","repositories_listed":0,"syntology":null},{"url":null,"slug":"myvlm-personalizing-vlms-for-user-specific","title":"MyVLM: Personalizing VLMs for User-Specific Queries","date":"2024-03-21","arxiv_id":"2403.14599","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-baselines-for-data-efficient","title":"Improved Baselines for Data-efficient Perceptual Augmentation of LLMs","date":"2024-03-20","arxiv_id":"2403.13499","repositories_listed":0,"syntology":null},{"url":"/paper/vl-mamba-exploring-state-space-models-for","slug":"vl-mamba-exploring-state-space-models-for","title":"VL-Mamba: Exploring State Space Models for Multimodal Learning","date":"2024-03-20","arxiv_id":"2403.13600","repositories_listed":0,"syntology":null},{"url":null,"slug":"as-firm-as-their-foundations-can-open-sourced","title":"As Firm As Their Foundations: Can open-sourced foundation models be used to create adversarial examples for downstream tasks?","date":"2024-03-19","arxiv_id":"2403.12693","repositories_listed":0,"syntology":null},{"url":null,"slug":"wolf-large-language-model-framework-for-cxr","title":"WoLF: Wide-scope Large Language Model Framework for CXR Understanding","date":"2024-03-19","arxiv_id":"2403.15456","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-llms-generate-human-like-wayfinding","title":"Can LLMs Generate Human-Like Wayfinding Instructions? Towards Platform-Agnostic Embodied Instruction Synthesis","date":"2024-03-18","arxiv_id":"2403.11487","repositories_listed":0,"syntology":null},{"url":null,"slug":"flexcap-generating-rich-localized-and","title":"FlexCap: Describe Anything in Images in Controllable Detail","date":"2024-03-18","arxiv_id":"2403.12026","repositories_listed":0,"syntology":null},{"url":null,"slug":"see-imagine-plan-discovering-and","title":"SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors","date":"2024-03-18","arxiv_id":"2403.13438","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-vqa-with-frozen-llms-a-tale-of-two","title":"Few-Shot VQA with Frozen LLMs: A Tale of Two Approaches","date":"2024-03-17","arxiv_id":"2403.11317","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-image-classification-and","title":"Few-Shot Image Classification and Segmentation as Visual Question Answering Using Vision-Language Models","date":"2024-03-15","arxiv_id":"2403.10287","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-condensation-and-reasoning-for","title":"Knowledge Condensation and Reasoning for Knowledge-based VQA","date":"2024-03-15","arxiv_id":"2403.10037","repositories_listed":0,"syntology":null},{"url":null,"slug":"perl-parameter-efficient-reinforcement","title":"Parameter Efficient Reinforcement Learning from Human Feedback","date":"2024-03-15","arxiv_id":"2403.10704","repositories_listed":0,"syntology":null},{"url":"/paper/mm1-methods-analysis-insights-from-multimodal","slug":"mm1-methods-analysis-insights-from-multimodal","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","date":"2024-03-14","arxiv_id":"2403.09611","repositories_listed":0,"syntology":null},{"url":null,"slug":"visiongpt-vision-language-understanding-agent","title":"VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework","date":"2024-03-14","arxiv_id":"2403.09027","repositories_listed":0,"syntology":null},{"url":"/paper/strengthening-multimodal-large-language-model","slug":"strengthening-multimodal-large-language-model","title":"Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization","date":"2024-03-13","arxiv_id":"2403.08730","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-large-language-models-with","title":"Fine-tuning Large Language Models with Sequential Instructions","date":"2024-03-12","arxiv_id":"2403.07794","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-the-impact-of-attribute-editing-on","title":"Mitigating the Impact of Attribute Editing on Face Recognition","date":"2024-03-12","arxiv_id":"2403.08092","repositories_listed":0,"syntology":null},{"url":null,"slug":"snapntell-enhancing-entity-centric-visual","title":"SnapNTell: Enhancing Entity-Centric Visual Question Answering with Retrieval Augmented Multimodal LLM","date":"2024-03-07","arxiv_id":"2403.04735","repositories_listed":0,"syntology":null},{"url":null,"slug":"clevr-poc-reasoning-intensive-visual-question","title":"CLEVR-POC: Reasoning-Intensive Visual Question Answering in Partially Observable Environments","date":"2024-03-05","arxiv_id":"2403.03203","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-generalization-in-medical-visual","title":"Enhancing Generalization in Medical Visual Question Answering Tasks via Gradient-Guided Model Perturbation","date":"2024-03-05","arxiv_id":"2403.02707","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-collaborator-enabling-subjective","title":"Modeling Collaborator: Enabling Subjective Vision Classification With Minimal Human Effort via LLM Tool-Use","date":"2024-03-05","arxiv_id":"2403.02626","repositories_listed":0,"syntology":null},{"url":null,"slug":"moka-open-vocabulary-robotic-manipulation","title":"MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting","date":"2024-03-05","arxiv_id":"2403.03174","repositories_listed":0,"syntology":null},{"url":"/paper/infimm-hd-a-leap-forward-in-high-resolution","slug":"infimm-hd-a-leap-forward-in-high-resolution","title":"InfiMM-HD: A Leap Forward in High-Resolution Multimodal Understanding","date":"2024-03-03","arxiv_id":"2403.01487","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-cognitive-evaluation-benchmark-of-image","title":"A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models","date":"2024-02-28","arxiv_id":"2402.18409","repositories_listed":0,"syntology":null},{"url":null,"slug":"arcsin-adaptive-ranged-cosine-similarity","title":"ArcSin: Adaptive ranged cosine Similarity injected noise for Language-Driven Visual Tasks","date":"2024-02-27","arxiv_id":"2402.17298","repositories_listed":0,"syntology":null},{"url":null,"slug":"vcd-knowledge-base-guided-visual-commonsense","title":"VCD: Knowledge Base Guided Visual Commonsense Discovery in Images","date":"2024-02-27","arxiv_id":"2402.17213","repositories_listed":0,"syntology":null}],"record_sha256":"dc7845e665eefbcab5f68fe3e8ce2cdbcef8e63371556bb97fd742896cce0ea5","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}