{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering-1/papers/16","list_of":"/task/visual-question-answering-1","task":"Visual Question Answering","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":16,"pages_in_order":22,"rows_per_page":100,"rows":[1501,1600],"of":2177,"counts":{"archive_papers_tagged":2177,"with_a_code_link":1042,"where_syntology_ran_a_sample":378,"not_listed_spam_title":0,"listed":2177,"listed_where_code_ran":378,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":308,"every_run_a_failure_of_syntologys_instrument":70,"listed_with_a_run_with_no_instrument_failure":308,"listed_every_run_a_failure_of_syntologys_instrument":70,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering-1","prev":"/task/visual-question-answering-1/papers/15","next":"/task/visual-question-answering-1/papers/17","papers":[{"url":null,"slug":"cfret-dvqa-coarse-to-fine-retrieval-and","title":"Read and Think: An Efficient Step-wise Multimodal Language Model for Document Understanding and Reasoning","date":"2024-02-26","arxiv_id":"2403.00816","repositories_listed":0,"syntology":null},{"url":"/paper/robocodex-multimodal-code-generation-for","slug":"robocodex-multimodal-code-generation-for","title":"RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis","date":"2024-02-25","arxiv_id":"2402.16117","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-transformer-with-a-low","title":"Multimodal Transformer With a Low-Computational-Cost Guarantee","date":"2024-02-23","arxiv_id":"2402.15096","repositories_listed":0,"syntology":null},{"url":null,"slug":"visreas-complex-visual-reasoning-with","title":"VISREAS: Complex Visual Reasoning with Unanswerable Questions","date":"2024-02-23","arxiv_id":"2403.10534","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-frontier-of-vision-language","title":"Exploring the Frontier of Vision-Language Models: A Survey of Current Methodologies and Future Directions","date":"2024-02-20","arxiv_id":"2404.07214","repositories_listed":0,"syntology":null},{"url":null,"slug":"modality-aware-integration-with-large","title":"Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering","date":"2024-02-20","arxiv_id":"2402.12728","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-tailor-mitigating-catastrophic","title":"Model Tailor: Mitigating Catastrophic Forgetting in Multi-modal Large Language Models","date":"2024-02-19","arxiv_id":"2402.12048","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-flan-scaling-human-labeled-tasks-in","title":"Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning","date":"2024-02-18","arxiv_id":"2402.11690","repositories_listed":0,"syntology":null},{"url":null,"slug":"palm2-vadapter-progressively-aligned-language","title":"PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter","date":"2024-02-16","arxiv_id":"2402.10896","repositories_listed":0,"syntology":null},{"url":"/paper/vqattack-transferable-adversarial-attacks-on","slug":"vqattack-transferable-adversarial-attacks-on","title":"VQAttack: Transferable Adversarial Attacks on Visual Question Answering via Pre-trained Models","date":"2024-02-16","arxiv_id":"2402.11083","repositories_listed":0,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":2,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/vqattack-transferable-adversarial-attacks-on#ran","syntology_url":"https://syntology.ai/paper/2402.11083","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2402.11083"}},"official":null}},{"url":null,"slug":"prompt-based-personalized-federated-learning","title":"Prompt-based Personalized Federated Learning for Medical Visual Question Answering","date":"2024-02-15","arxiv_id":"2402.09677","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-how-to-ask-cycle-consistency-refines","title":"Learning How To Ask: Cycle-Consistency Refines Prompts in Multimodal Foundation Models","date":"2024-02-13","arxiv_id":"2402.08756","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-instruction","title":"Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks","date":"2024-02-13","arxiv_id":"2402.08360","repositories_listed":0,"syntology":null},{"url":null,"slug":"pivot-iterative-visual-prompting-elicits","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","date":"2024-02-12","arxiv_id":"2402.07872","repositories_listed":0,"syntology":null},{"url":null,"slug":"cic-a-framework-for-culturally-aware-image","title":"CIC: A Framework for Culturally-Aware Image Captioning","date":"2024-02-08","arxiv_id":"2402.05374","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-generative-ai-systems-capable-of","title":"Can Generative AI Support Patients' & Caregivers' Informational Needs? Towards Task-Centric Evaluation Of AI Systems","date":"2024-01-31","arxiv_id":"2402.00234","repositories_listed":0,"syntology":null},{"url":"/paper/enhancing-multimodal-large-language-models","slug":"enhancing-multimodal-large-language-models","title":"From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information","date":"2024-01-31","arxiv_id":"2401.17981","repositories_listed":0,"syntology":null},{"url":null,"slug":"lcvo-an-efficient-pretraining-free-framework","title":"LCV2: An Efficient Pretraining-Free Framework for Grounded Visual Question Answering","date":"2024-01-29","arxiv_id":"2401.15842","repositories_listed":0,"syntology":null},{"url":null,"slug":"muffin-or-chihuahua-challenging-large-vision","title":"Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA","date":"2024-01-29","arxiv_id":"2401.15847","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-data-augmentation-for-robust-visual","title":"Improving Data Augmentation for Robust Visual Question Answering with Effective Curriculum Learning","date":"2024-01-28","arxiv_id":"2401.15646","repositories_listed":0,"syntology":null},{"url":null,"slug":"free-form-medical-visual-question-answering","title":"Free Form Medical Visual Question Answering in Radiology","date":"2024-01-23","arxiv_id":"2401.13081","repositories_listed":0,"syntology":null},{"url":"/paper/small-language-model-meets-with-reinforced","slug":"small-language-model-meets-with-reinforced","title":"Small Language Model Meets with Reinforced Vision Vocabulary","date":"2024-01-23","arxiv_id":"2401.12503","repositories_listed":0,"syntology":null},{"url":"/paper/spatialvlm-endowing-vision-language-models","slug":"spatialvlm-endowing-vision-language-models","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","date":"2024-01-22","arxiv_id":"2401.12168","repositories_listed":0,"syntology":null},{"url":"/paper/coco-is-all-you-need-for-visual-instruction","slug":"coco-is-all-you-need-for-visual-instruction","title":"COCO is \"ALL'' You Need for Visual Instruction Fine-tuning","date":"2024-01-17","arxiv_id":"2401.08968","repositories_listed":0,"syntology":null},{"url":null,"slug":"bok-vqa-bilingual-outside-knowledge-based","title":"BOK-VQA: Bilingual outside Knowledge-Based Visual Question Answering via Graph Representation Pretraining","date":"2024-01-12","arxiv_id":"2401.06443","repositories_listed":0,"syntology":null},{"url":null,"slug":"gram-global-reasoning-for-multi-page-vqa","title":"GRAM: Global Reasoning for Multi-Page VQA","date":"2024-01-07","arxiv_id":"2401.03411","repositories_listed":0,"syntology":null},{"url":"/paper/sycoca-symmetrizing-contrastive-captioners","slug":"sycoca-symmetrizing-contrastive-captioners","title":"SyCoCa: Symmetrizing Contrastive Captioners with Attentive Masking for Multimodal Alignment","date":"2024-01-04","arxiv_id":"2401.02137","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-truly-zero-shot-compositional-visual","title":"Towards Truly Zero-shot Compositional Visual Reasoning with LLMs as Programmers","date":"2024-01-03","arxiv_id":"2401.01974","repositories_listed":0,"syntology":null},{"url":null,"slug":"cog-dqa-chain-of-guiding-learning-with-large","title":"CoG-DQA: Chain-of-Guiding Learning with Large Language Models for Diagram Question Answering","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mask4align-aligned-entity-prompting-with","title":"Mask4Align: Aligned Entity Prompting with Color Masks for Multi-Entity Localization Problems","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/synthesize-step-by-step-tools-templates-and-1","slug":"synthesize-step-by-step-tools-templates-and-1","title":"Synthesize Step-by-Step: Tools Templates and LLMs as Data Generators for Reasoning-Based Chart VQA","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"text-conditioned-generative-model-of-3d","title":"Text-Conditioned Generative Model of 3D Strand-based Human Hairstyles","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mivc-multiple-instance-visual-component-for","title":"MIVC: Multiple Instance Visual Component for Visual-Language Models","date":"2023-12-28","arxiv_id":"2312.17109","repositories_listed":0,"syntology":null},{"url":null,"slug":"gemini-pro-defeated-by-gpt-4v-evidence-from","title":"Gemini Pro Defeated by GPT-4V: Evidence from Education","date":"2023-12-27","arxiv_id":"2401.08660","repositories_listed":0,"syntology":null},{"url":null,"slug":"detection-based-intermediate-supervision-for","title":"Detection-based Intermediate Supervision for Visual Question Answering","date":"2023-12-26","arxiv_id":"2312.16012","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-promises-and-challenges-of-multimodal","title":"On the Promises and Challenges of Multimodal Foundation Models for Geographical, Environmental, Agricultural, and Urban Planning Applications","date":"2023-12-23","arxiv_id":"2312.17016","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-hallucinations-enhancing-vqa-for","title":"Reducing Hallucinations: Enhancing VQA for Flood Disaster Damage Assessment with Visual Contexts","date":"2023-12-21","arxiv_id":"2312.13848","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-visual-task-learning-for-robots","title":"Interactive Visual Task Learning for Robots","date":"2023-12-20","arxiv_id":"2312.13219","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-clue-reasoning-with-memory-augmentation","title":"Multi-Clue Reasoning with Memory Augmentation for Knowledge-based Visual Question Answering","date":"2023-12-20","arxiv_id":"2312.12723","repositories_listed":0,"syntology":null},{"url":null,"slug":"clova-a-closed-loop-visual-assistant-with","title":"CLOVA: A Closed-Loop Visual Assistant with Tool Usage and Update","date":"2023-12-18","arxiv_id":"2312.10908","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-evaluation-of-gpt-4v-and-gemini-in-online","title":"An Evaluation of GPT-4V and Gemini in Online VQA","date":"2023-12-17","arxiv_id":"2312.10637","repositories_listed":0,"syntology":null},{"url":"/paper/silkie-preference-distillation-for-large","slug":"silkie-preference-distillation-for-large","title":"Silkie: Preference Distillation for Large Visual Language Models","date":"2023-12-17","arxiv_id":"2312.10665","repositories_listed":0,"syntology":null},{"url":null,"slug":"bestmvqa-a-benchmark-evaluation-system-for","title":"BESTMVQA: A Benchmark Evaluation System for Medical Visual Question Answering","date":"2023-12-13","arxiv_id":"2312.07867","repositories_listed":0,"syntology":null},{"url":null,"slug":"remote-sensing-vision-language-foundation","title":"Remote Sensing Vision-Language Foundation Models without Annotations via Ground Remote Alignment","date":"2023-12-12","arxiv_id":"2312.06960","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-cog-a-causal-effect-look-at-context","title":"Causal-CoG: A Causal-Effect Look at Context Generation for Boosting Multi-modal Language Models","date":"2023-12-09","arxiv_id":"2312.06685","repositories_listed":0,"syntology":null},{"url":null,"slug":"clamp-contrastive-language-model-prompt","title":"CLAMP: Contrastive LAnguage Model Prompt-tuning","date":"2023-12-04","arxiv_id":"2312.01629","repositories_listed":0,"syntology":null},{"url":null,"slug":"medxchat-bridging-cxr-modalities-with-a","title":"MedXChat: A Unified Multimodal Large Language Model Framework towards CXRs Understanding and Generation","date":"2023-12-04","arxiv_id":"2312.02233","repositories_listed":0,"syntology":null},{"url":null,"slug":"unleashing-the-potential-of-large-language","title":"Unleashing the Potential of Large Language Model: Zero-shot VQA for Flood Disaster Scenario","date":"2023-12-04","arxiv_id":"2312.01882","repositories_listed":0,"syntology":null},{"url":"/paper/merlin-empowering-multimodal-llms-with","slug":"merlin-empowering-multimodal-llms-with","title":"Merlin:Empowering Multimodal LLMs with Foresight Minds","date":"2023-11-30","arxiv_id":"2312.00589","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamsync-aligning-text-to-image-generation","title":"DreamSync: Aligning Text-to-Image Generation with Image Understanding Feedback","date":"2023-11-29","arxiv_id":"2311.17946","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-top-down-reasoning-an-explainable","title":"Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering","date":"2023-11-29","arxiv_id":"2311.17331","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-curse-of-language-biases-in-remote","title":"The curse of language biases in remote sensing VQA: the role of spatial attributes, language diversity, and the need for clear evaluation","date":"2023-11-28","arxiv_id":"2311.16782","repositories_listed":0,"syntology":null},{"url":null,"slug":"lego-learning-to-disentangle-and-invert","title":"Lego: Learning to Disentangle and Invert Personalized Concepts Beyond Object Appearance in Text-to-Image Diffusion Models","date":"2023-11-23","arxiv_id":"2311.13833","repositories_listed":0,"syntology":null},{"url":null,"slug":"asking-more-informative-questions-for","title":"Asking More Informative Questions for Grounded Retrieval","date":"2023-11-14","arxiv_id":"2311.08584","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-large-language-models-bring-to-text-rich","title":"What Large Language Models Bring to Text-rich VQA?","date":"2023-11-13","arxiv_id":"2311.07306","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-commonsense-based-heterogeneous-graph","title":"Visual Commonsense based Heterogeneous Graph Contrastive Learning","date":"2023-11-11","arxiv_id":"2311.06553","repositories_listed":0,"syntology":null},{"url":null,"slug":"covlm-composing-visual-entities-and","title":"CoVLM: Composing Visual Entities and Relationships in Large Language Models Via Communicative Decoding","date":"2023-11-06","arxiv_id":"2311.03354","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-image-to-language-a-critical-analysis-of","title":"From Image to Language: A Critical Analysis of Visual Question Answering (VQA) Approaches, Challenges, and Opportunities","date":"2023-11-01","arxiv_id":"2311.00308","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqa-gen-a-visual-question-answering-benchmark","title":"VQA-GEN: A Visual Question Answering Benchmark for Domain Generalization","date":"2023-11-01","arxiv_id":"2311.00807","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comprehensive-study-of-gpt-4v-s-multimodal","title":"A Systematic Evaluation of GPT-4V's Multimodal Capability for Medical Image Analysis","date":"2023-10-31","arxiv_id":"2310.20381","repositories_listed":0,"syntology":null},{"url":null,"slug":"davidsonian-scene-graph-improving-reliability","title":"Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation","date":"2023-10-27","arxiv_id":"2310.18235","repositories_listed":0,"syntology":null},{"url":"/paper/cad-contextual-multi-modal-alignment-for","slug":"cad-contextual-multi-modal-alignment-for","title":"CAD -- Contextual Multi-modal Alignment for Dynamic AVQA","date":"2023-10-25","arxiv_id":"2310.16754","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-document-information-analysis-with","title":"Enhancing Document Information Analysis with Multi-Task Pre-training: A Robust Approach for Information Extraction in Visually-Rich Documents","date":"2023-10-25","arxiv_id":"2310.16527","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-question-decomposition-for-zero","title":"Exploring Question Decomposition for Zero-Shot VQA","date":"2023-10-25","arxiv_id":"2310.17050","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-representations-for-teacher-guided","title":"Multimodal Representations for Teacher-Guided Compositional Visual Reasoning","date":"2023-10-24","arxiv_id":"2310.15585","repositories_listed":0,"syntology":null},{"url":null,"slug":"dataset-bias-mitigation-in-multiple-choice","title":"Dataset Bias Mitigation in Multiple-Choice Visual Question Answering and Beyond","date":"2023-10-23","arxiv_id":"2310.14670","repositories_listed":0,"syntology":null},{"url":"/paper/a-simple-baseline-for-knowledge-based-visual","slug":"a-simple-baseline-for-knowledge-based-visual","title":"A Simple Baseline for Knowledge-Based Visual Question Answering","date":"2023-10-20","arxiv_id":"2310.13570","repositories_listed":0,"syntology":{"n":3,"n_ran":2,"n_constructed":0,"n_ran_checked":0,"n_instrument":2,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":3,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/a-simple-baseline-for-knowledge-based-visual#ran","syntology_url":"https://syntology.ai/paper/2310.13570","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2310.13570"}},"official":null}},{"url":"/paper/silc-improving-vision-language-pretraining","slug":"silc-improving-vision-language-pretraining","title":"SILC: Improving Vision Language Pretraining with Self-Distillation","date":"2023-10-20","arxiv_id":"2310.13355","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-bert-based-visual-question","title":"Enhancing BERT-Based Visual Question Answering through Keyword-Driven Sentence Selection","date":"2023-10-13","arxiv_id":"2310.09432","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-sparse-spatial-relation-in-graph","title":"Exploring Sparse Spatial Relation in Graph Inference for Text-Based VQA","date":"2023-10-13","arxiv_id":"2310.09147","repositories_listed":0,"syntology":null},{"url":null,"slug":"ziya-vl-bilingual-large-vision-language-model","title":"Ziya-Visual: Bilingual Large Vision-Language Model via Multi-Task Instruction Tuning","date":"2023-10-12","arxiv_id":"2310.08166","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-mitosis-detection-on-histopathology","title":"Improving mitosis detection on histopathology images using large vision-language models","date":"2023-10-11","arxiv_id":"2310.07176","repositories_listed":0,"syntology":null},{"url":null,"slug":"jaeger-a-concatenation-based-multi","title":"Jaeger: A Concatenation-Based Multi-Transformer VQA Model","date":"2023-10-11","arxiv_id":"2310.07091","repositories_listed":0,"syntology":null},{"url":null,"slug":"solution-for-smart-101-challenge-of-iccv","title":"Solution for SMART-101 Challenge of ICCV Multi-modal Algorithmic Reasoning Task 2023","date":"2023-10-10","arxiv_id":"2310.06440","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-reasoning-through-two-layers-of","title":"Causal Reasoning through Two Layers of Cognition for Improving Generalization in Visual Question Answering","date":"2023-10-09","arxiv_id":"2310.05410","repositories_listed":0,"syntology":null},{"url":null,"slug":"negative-object-presence-evaluation-nope-to","title":"Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models","date":"2023-10-09","arxiv_id":"2310.05338","repositories_listed":0,"syntology":null},{"url":null,"slug":"lightweight-in-context-tuning-for-multimodal","title":"Lightweight In-Context Tuning for Multimodal Unified Models","date":"2023-10-08","arxiv_id":"2310.05109","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-automatic-vqa-evaluation-using","title":"Improving Automatic VQA Evaluation Using Large Language Models","date":"2023-10-04","arxiv_id":"2310.02567","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-cognition-of-visual-question-answering","title":"On the Cognition of Visual Question Answering Models and Human Intelligence: A Comparative Study","date":"2023-10-04","arxiv_id":"2310.02528","repositories_listed":0,"syntology":null},{"url":null,"slug":"selfgraphvqa-a-self-supervised-graph-neural","title":"SelfGraphVQA: A Self-Supervised Graph Neural Network for Scene-based Question Answering","date":"2023-10-03","arxiv_id":"2310.01842","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-mobility-question-answering-vision","title":"Human Mobility Question Answering (Vision Paper)","date":"2023-10-02","arxiv_id":"2310.04443","repositories_listed":0,"syntology":null},{"url":null,"slug":"tackling-vqa-with-pretrained-foundation","title":"Tackling VQA with Pretrained Foundation Models without Further Training","date":"2023-09-27","arxiv_id":"2309.15487","repositories_listed":0,"syntology":null},{"url":null,"slug":"kosmos-2-5-a-multimodal-literate-model","title":"KOSMOS-2.5: A Multimodal Literate Model","date":"2023-09-20","arxiv_id":"2309.11419","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentence-attention-blocks-for-answer","title":"Sentence Attention Blocks for Answer Grounding","date":"2023-09-20","arxiv_id":"2309.11593","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-in-the-medical","title":"Visual Question Answering in the Medical Domain","date":"2023-09-20","arxiv_id":"2309.11080","repositories_listed":0,"syntology":null},{"url":null,"slug":"syntax-tree-constrained-graph-network-for","title":"Syntax Tree Constrained Graph Network for Visual Question Answering","date":"2023-09-17","arxiv_id":"2309.09179","repositories_listed":0,"syntology":null},{"url":null,"slug":"rank2tell-a-multimodal-driving-dataset-for","title":"Rank2Tell: A Multimodal Driving Dataset for Joint Importance Ranking and Reasoning","date":"2023-09-12","arxiv_id":"2309.06597","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluation-and-mitigation-of-agnosia-in","title":"Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models","date":"2023-09-07","arxiv_id":"2309.04041","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-visual-question-answering-via","title":"Interpretable Visual Question Answering via Reasoning Supervision","date":"2023-09-07","arxiv_id":"2309.03726","repositories_listed":0,"syntology":null},{"url":null,"slug":"physically-grounded-vision-language-models","title":"Physically Grounded Vision-Language Models for Robotic Manipulation","date":"2023-09-05","arxiv_id":"2309.02561","repositories_listed":0,"syntology":null},{"url":null,"slug":"expanding-frozen-vision-language-models","title":"Expanding Frozen Vision-Language Models without Retraining: Towards Improved Robot Perception","date":"2023-08-31","arxiv_id":"2308.16493","repositories_listed":0,"syntology":null},{"url":null,"slug":"dlip-distilling-language-image-pre-training","title":"DLIP: Distilling Language-Image Pre-training","date":"2023-08-24","arxiv_id":"2308.12956","repositories_listed":0,"syntology":null},{"url":null,"slug":"eve-efficient-vision-language-pre-training","title":"EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE","date":"2023-08-23","arxiv_id":"2308.11971","repositories_listed":0,"syntology":null},{"url":null,"slug":"sculpt-shape-conditioned-unpaired-learning-of","title":"SCULPT: Shape-Conditioned Unpaired Learning of Pose-dependent Clothed and Textured Human Meshes","date":"2023-08-21","arxiv_id":"2308.10638","repositories_listed":0,"syntology":null},{"url":null,"slug":"generic-attention-model-explainability-by","title":"Generic Attention-model Explainability by Weighted Relevance Accumulation","date":"2023-08-20","arxiv_id":"2308.10240","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-grounded-visual-spatial-reasoning-in","title":"Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models","date":"2023-08-18","arxiv_id":"2308.09778","repositories_listed":0,"syntology":null},{"url":null,"slug":"tijo-trigger-inversion-with-joint","title":"TIJO: Trigger Inversion with Joint Optimization for Defending Multimodal Backdoored Models","date":"2023-08-07","arxiv_id":"2308.03906","repositories_listed":0,"syntology":null},{"url":null,"slug":"elixr-towards-a-general-purpose-x-ray","title":"ELIXR: Towards a general purpose X-ray artificial intelligence system through alignment of large language models and radiology vision encoders","date":"2023-08-02","arxiv_id":"2308.01317","repositories_listed":0,"syntology":null},{"url":null,"slug":"bartphobeit-pre-trained-sequence-to-sequence","title":"BARTPhoBEiT: Pre-trained Sequence-to-Sequence and Image Transformers Models for Vietnamese Visual Question Answering","date":"2023-07-28","arxiv_id":"2307.15335","repositories_listed":0,"syntology":null},{"url":null,"slug":"lois-looking-out-of-instance-semantics-for","title":"LOIS: Looking Out of Instance Semantics for Visual Question Answering","date":"2023-07-26","arxiv_id":"2307.14142","repositories_listed":0,"syntology":null}],"record_sha256":"3f9b9a56fb4d208d0fa0020b40a910f4741760d7a30530a0aa50f71a0ff89a7a","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}