{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering/papers/14","list_of":"/task/visual-question-answering","task":"Visual Question Answering (VQA)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":14,"pages_in_order":22,"rows_per_page":100,"rows":[1301,1400],"of":2167,"counts":{"archive_papers_tagged":2167,"with_a_code_link":1039,"where_syntology_ran_a_sample":359,"not_listed_spam_title":0,"listed":2167,"listed_where_code_ran":359,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":287,"every_run_a_failure_of_syntologys_instrument":72,"listed_with_a_run_with_no_instrument_failure":287,"listed_every_run_a_failure_of_syntologys_instrument":72,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering","prev":"/task/visual-question-answering/papers/13","next":"/task/visual-question-answering/papers/15","papers":[{"url":null,"slug":"vintern-1b-an-efficient-multimodal-large","title":"Vintern-1B: An Efficient Multimodal Large Language Model for Vietnamese","date":"2024-08-22","arxiv_id":"2408.12480","repositories_listed":0,"syntology":null},{"url":null,"slug":"swarm-intelligence-in-geo-localization-a","title":"Swarm Intelligence in Geo-Localization: A Multi-Agent Large Vision-Language Model Collaborative Framework","date":"2024-08-21","arxiv_id":"2408.11312","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-the-hype-a-dispassionate-look-at","title":"Beyond the Hype: A dispassionate look at vision-language models in medical scenario","date":"2024-08-16","arxiv_id":"2408.08704","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-visual-question-answering-through-1","title":"Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion","date":"2024-08-14","arxiv_id":"2408.07303","repositories_listed":0,"syntology":null},{"url":null,"slug":"subjective-and-objective-quality-assessment-5","title":"Subjective and Objective Quality Assessment of Rendered Human Avatar Videos in Virtual Reality","date":"2024-08-13","arxiv_id":"2408.07041","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-form-answers-to-visual-questions-from","title":"Long-Form Answers to Visual Questions from Blind and Low Vision People","date":"2024-08-12","arxiv_id":"2408.06303","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-quantum-gradient-and-higher-order","title":"Efficient Quantum Gradient and Higher-order Derivative Estimation via Generalized Hadamard Test","date":"2024-08-10","arxiv_id":"2408.05406","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-multi-modal-llm-evaluation","title":"Revisiting Multi-Modal LLM Evaluation","date":"2024-08-09","arxiv_id":"2408.05334","repositories_listed":0,"syntology":null},{"url":null,"slug":"2407-21368","title":"Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering","date":"2024-07-31","arxiv_id":"2407.21368","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-aigc-video-quality-assessment-a","title":"Benchmarking Multi-dimensional AIGC Video Quality Assessment: A Dataset and Unified Model","date":"2024-07-31","arxiv_id":"2407.21408","repositories_listed":0,"syntology":null},{"url":null,"slug":"simplellm4ad-an-end-to-end-vision-language","title":"SimpleLLM4AD: An End-to-End Vision-Language Model with Graph Visual Question Answering for Autonomous Driving","date":"2024-07-31","arxiv_id":"2407.21293","repositories_listed":0,"syntology":null},{"url":null,"slug":"highly-efficient-no-reference-4k-video","title":"Highly Efficient No-reference 4K Video Quality Assessment with Full-Pixel Covering Sampling and Training Strategy","date":"2024-07-30","arxiv_id":"2407.20766","repositories_listed":0,"syntology":null},{"url":null,"slug":"pyramid-coder-hierarchical-code-generator-for","title":"Pyramid Coder: Hierarchical Code Generator for Compositional Visual Question Answering","date":"2024-07-30","arxiv_id":"2407.20563","repositories_listed":0,"syntology":null},{"url":null,"slug":"take-a-step-back-rethinking-the-two-stages-in","title":"Take A Step Back: Rethinking the Two Stages in Visual Reasoning","date":"2024-07-29","arxiv_id":"2407.19666","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-few-shot-image-classification","title":"Improved Few-Shot Image Classification Through Multiple-Choice Questions","date":"2024-07-23","arxiv_id":"2407.16145","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-effectiveness-of-object-centric","title":"Exploring the Effectiveness of Object-Centric Representations in Visual Question Answering: Comparative Insights with Foundation Models","date":"2024-07-22","arxiv_id":"2407.15589","repositories_listed":0,"syntology":null},{"url":null,"slug":"echosight-advancing-visual-language-models","title":"EchoSight: Advancing Visual-Language Models with Wiki Knowledge","date":"2024-07-17","arxiv_id":"2407.12735","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-reranking-for-knowledge-intensive","title":"Multimodal Reranking for Knowledge-Intensive Visual Question Answering","date":"2024-07-17","arxiv_id":"2407.12277","repositories_listed":0,"syntology":null},{"url":null,"slug":"tm-pathvqa-90000-textless-multilingual","title":"TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering","date":"2024-07-16","arxiv_id":"2407.11383","repositories_listed":0,"syntology":null},{"url":null,"slug":"extracting-training-data-from-document-based","title":"Extracting Training Data from Document-Based VQA Models","date":"2024-07-11","arxiv_id":"2407.08707","repositories_listed":0,"syntology":null},{"url":null,"slug":"segmentation-guided-attention-for-visual","title":"Segmentation-guided Attention for Visual Question Answering from Remote Sensing Images","date":"2024-07-11","arxiv_id":"2407.08669","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqa-diff-exploiting-vqa-and-diffusion-for","title":"VQA-Diff: Exploiting VQA and Diffusion for Zero-Shot Image-to-3D Vehicle Asset Generation in Autonomous Driving","date":"2024-07-09","arxiv_id":"2407.06516","repositories_listed":0,"syntology":null},{"url":null,"slug":"bacon-supercharge-your-vlm-with-bag-of","title":"BACON: Improving Clarity of Image Captions via Bag-of-Concept Graphs","date":"2024-07-03","arxiv_id":"2407.03314","repositories_listed":0,"syntology":null},{"url":null,"slug":"mindbench-a-comprehensive-benchmark-for-mind","title":"MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis","date":"2024-07-03","arxiv_id":"2407.02842","repositories_listed":0,"syntology":null},{"url":null,"slug":"certainly-uncertain-a-benchmark-and-metric","title":"Certainly Uncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness","date":"2024-07-02","arxiv_id":"2407.01942","repositories_listed":0,"syntology":null},{"url":null,"slug":"d-rax-domain-specific-radiologic-assistant","title":"D-Rax: Domain-specific Radiologic assistant leveraging multi-modal data and eXpert model predictions","date":"2024-07-02","arxiv_id":"2407.02604","repositories_listed":0,"syntology":null},{"url":null,"slug":"https-arxiv-org-abs-2407-00634","title":"https://arxiv.org/abs/2407.00634","date":"2024-07-02","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-memory-for-long-video-qa","title":"Hierarchical Memory for Long Video QA","date":"2024-06-30","arxiv_id":"2407.00603","repositories_listed":0,"syntology":null},{"url":null,"slug":"sk-vqa-synthetic-knowledge-generation-at","title":"SK-VQA: Synthetic Knowledge Generation at Scale for Training Context-Augmented Multimodal LLMs","date":"2024-06-28","arxiv_id":"2406.19593","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-knowledge-based-and-visual","title":"Disentangling Knowledge-based and Visual Reasoning by Question Decomposition in KB-VQA","date":"2024-06-27","arxiv_id":"2406.18839","repositories_listed":0,"syntology":null},{"url":null,"slug":"raven-multitask-retrieval-augmented-vision","title":"RAVEN: Multitask Retrieval Augmented Vision-Language Learning","date":"2024-06-27","arxiv_id":"2406.19150","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-role-of-visual-grounding-in-vqa","title":"On the Role of Visual Grounding in VQA","date":"2024-06-26","arxiv_id":"2406.18253","repositories_listed":0,"syntology":null},{"url":null,"slug":"losing-visual-needles-in-image-haystacks","title":"Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts","date":"2024-06-24","arxiv_id":"2406.16851","repositories_listed":0,"syntology":null},{"url":null,"slug":"mm-spubench-towards-better-understanding-of","title":"MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs","date":"2024-06-24","arxiv_id":"2406.17126","repositories_listed":0,"syntology":null},{"url":null,"slug":"priorformer-a-ugc-vqa-method-with-content-and","title":"Priorformer: A UGC-VQA Method with content and distortion priors","date":"2024-06-24","arxiv_id":"2406.16297","repositories_listed":0,"syntology":null},{"url":null,"slug":"tri-vqa-triangular-reasoning-medical-visual","title":"Tri-VQA: Triangular Reasoning Medical Visual Question Answering for Multi-Attribute Analysis","date":"2024-06-21","arxiv_id":"2406.15050","repositories_listed":0,"syntology":null},{"url":null,"slug":"precision-empowers-excess-distracts-visual","title":"Precision Empowers, Excess Distracts: Visual Question Answering With Dynamically Infused Knowledge In Language Models","date":"2024-06-14","arxiv_id":"2406.09994","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-visual-question-answering-models","title":"Optimizing Visual Question Answering Models for Driving: Bridging the Gap Between Human and Machine Attention Patterns","date":"2024-06-13","arxiv_id":"2406.09203","repositories_listed":0,"syntology":null},{"url":null,"slug":"cvqa-culturally-diverse-multilingual-visual","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","date":"2024-06-10","arxiv_id":"2406.05967","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-information-storage-and","title":"Understanding Information Storage and Transfer in Multi-modal Large Language Models","date":"2024-06-06","arxiv_id":"2406.04236","repositories_listed":0,"syntology":null},{"url":null,"slug":"translation-deserves-better-analyzing","title":"Translation Deserves Better: Analyzing Translation Artifacts in Cross-lingual Visual Question Answering","date":"2024-06-04","arxiv_id":"2406.02331","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixture-of-rationale-multi-modal-reasoning","title":"Mixture of Rationale: Multi-Modal Reasoning Mixture for Visual Question Answering","date":"2024-06-03","arxiv_id":"2406.01402","repositories_listed":0,"syntology":null},{"url":null,"slug":"selectively-answering-visual-questions","title":"Selectively Answering Visual Questions","date":"2024-06-03","arxiv_id":"2406.00980","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqa-training-sets-are-self-play-environments","title":"VQA Training Sets are Self-play Environments for Generating Few-shot Pools","date":"2024-05-30","arxiv_id":"2405.19773","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-zero-shot-gpt-4v-performance-on-3d","title":"Evaluating Zero-Shot GPT-4V Performance on 3D Visual Question Answering Benchmarks","date":"2024-05-29","arxiv_id":"2405.18831","repositories_listed":0,"syntology":null},{"url":null,"slug":"ptm-vqa-efficient-video-quality-assessment","title":"PTM-VQA: Efficient Video Quality Assessment Leveraging Diverse PreTrained Models from the Wild","date":"2024-05-28","arxiv_id":"2405.17765","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-aware-visual-language-models","title":"Privacy-Aware Visual Language Models","date":"2024-05-27","arxiv_id":"2405.17423","repositories_listed":0,"syntology":null},{"url":null,"slug":"udkag-augmenting-large-vision-language-models","title":"SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge","date":"2024-05-23","arxiv_id":"2405.14554","repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-multimodal-situations-with","title":"Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions","date":"2024-05-18","arxiv_id":"2405.11145","repositories_listed":0,"syntology":null},{"url":null,"slug":"eyefound-a-multimodal-generalist-foundation","title":"EyeFound: A Multimodal Generalist Foundation Model for Ophthalmic Imaging","date":"2024-05-18","arxiv_id":"2405.11338","repositories_listed":0,"syntology":null},{"url":null,"slug":"stackoverflowvqa-stack-overflow-visual","title":"StackOverflowVQA: Stack Overflow Visual Question Answering Dataset","date":"2024-05-17","arxiv_id":"2405.10736","repositories_listed":0,"syntology":null},{"url":null,"slug":"rmt-bvqa-recurrent-memory-transformer-based","title":"RMT-BVQA: Recurrent Memory Transformer-based Blind Video Quality Assessment for Enhanced Video Content","date":"2024-05-14","arxiv_id":"2405.08621","repositories_listed":0,"syntology":null},{"url":null,"slug":"realizing-visual-question-answering-for","title":"Realizing Visual Question Answering for Education: GPT-4V as a Multimodal AI","date":"2024-05-12","arxiv_id":"2405.07163","repositories_listed":0,"syntology":null},{"url":null,"slug":"s-eqa-tackling-situational-queries-in","title":"Is the House Ready For Sleeptime? Generating and Evaluating Situational Queries for Embodied Question Answering","date":"2024-05-08","arxiv_id":"2405.04732","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-multimodal-medical-capabilities-of","title":"Advancing Multimodal Medical Capabilities of Gemini","date":"2024-05-06","arxiv_id":"2405.03162","repositories_listed":0,"syntology":null},{"url":null,"slug":"vsa4vqa-scaling-a-vector-symbolic","title":"VSA4VQA: Scaling a Vector Symbolic Architecture to Visual Question Answering on Natural Images","date":"2024-05-06","arxiv_id":"2405.03852","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-human-vision-the-role-of-large-vision","title":"Beyond Human Vision: The Role of Large Vision Language Models in Microscope Image Analysis","date":"2024-05-01","arxiv_id":"2405.00876","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-visual-question-answering-a","title":"Enhanced Textual Feature Extraction for Visual Question Answering: A Simple Convolutional Approach","date":"2024-05-01","arxiv_id":"2405.00479","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-fact-checker-enabling-high-fidelity","title":"Visual Fact Checker: Enabling High-Fidelity Detailed Caption Generation","date":"2024-04-30","arxiv_id":"2404.19752","repositories_listed":0,"syntology":null},{"url":null,"slug":"ntire-2024-quality-assessment-of-ai-generated","title":"NTIRE 2024 Quality Assessment of AI-Generated Content Challenge","date":"2024-04-25","arxiv_id":"2404.16687","repositories_listed":0,"syntology":null},{"url":null,"slug":"fusion-of-domain-adapted-vision-and-language","title":"Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering","date":"2024-04-24","arxiv_id":"2404.16192","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-diverse-methods-in-visual-question","title":"Exploring Diverse Methods in Visual Question Answering","date":"2024-04-21","arxiv_id":"2404.13565","repositories_listed":0,"syntology":null},{"url":null,"slug":"eyes-can-deceive-benchmarking-counterfactual","title":"Look Before You Decide: Prompting Active Deduction of MLLMs for Assumptive Reasoning","date":"2024-04-19","arxiv_id":"2404.12966","repositories_listed":0,"syntology":null},{"url":null,"slug":"pdf-mvqa-a-dataset-for-multimodal-information","title":"PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering","date":"2024-04-19","arxiv_id":"2404.12720","repositories_listed":0,"syntology":null},{"url":null,"slug":"textsquare-scaling-up-text-centric-visual","title":"TextSquare: Scaling up Text-Centric Visual Instruction Tuning","date":"2024-04-19","arxiv_id":"2404.12803","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-scene-representation-and","title":"Unified Scene Representation and Reconstruction for 3D Large Language Models","date":"2024-04-19","arxiv_id":"2404.13044","repositories_listed":0,"syntology":null},{"url":null,"slug":"medthink-explaining-medical-visual-question","title":"MedThink: Explaining Medical Visual Question Answering via Multimodal Decision-Making Rationale","date":"2024-04-18","arxiv_id":"2404.12372","repositories_listed":0,"syntology":null},{"url":null,"slug":"reka-core-flash-and-edge-a-series-of-powerful","title":"Reka Core, Flash, and Edge: A Series of Powerful Multimodal Language Models","date":"2024-04-18","arxiv_id":"2404.12387","repositories_listed":0,"syntology":null},{"url":null,"slug":"find-the-gap-knowledge-base-reasoning-for","title":"Find The Gap: Knowledge Base Reasoning For Visual Question Answering","date":"2024-04-16","arxiv_id":"2404.10226","repositories_listed":0,"syntology":null},{"url":null,"slug":"brave-broadening-the-visual-encoding-of","title":"BRAVE: Broadening the visual encoding of vision-language models","date":"2024-04-10","arxiv_id":"2404.07204","repositories_listed":0,"syntology":null},{"url":"/paper/omnifusion-technical-report","slug":"omnifusion-technical-report","title":"OmniFusion Technical Report","date":"2024-04-09","arxiv_id":"2404.06212","repositories_listed":0,"syntology":null},{"url":null,"slug":"hammr-hierarchical-multimodal-react-agents","title":"HAMMR: HierArchical MultiModal React agents for generic VQA","date":"2024-04-08","arxiv_id":"2404.05465","repositories_listed":0,"syntology":null},{"url":null,"slug":"study-of-the-effect-of-sharpness-on-blind","title":"Study of the effect of Sharpness on Blind Video Quality Assessment","date":"2024-04-06","arxiv_id":"2404.05764","repositories_listed":0,"syntology":null},{"url":null,"slug":"buddie-a-business-document-dataset-for-multi","title":"BuDDIE: A Business Document Dataset for Multi-task Information Extraction","date":"2024-04-05","arxiv_id":"2404.04003","repositories_listed":0,"syntology":null},{"url":null,"slug":"tinyvqa-compact-multimodal-deep-neural","title":"TinyVQA: Compact Multimodal Deep Neural Network for Visual Question Answering on Resource-Constrained Devices","date":"2024-04-04","arxiv_id":"2404.03574","repositories_listed":0,"syntology":null},{"url":null,"slug":"detect2interact-localizing-object-key-field","title":"Detect2Interact: Localizing Object Key Field in Visual Question Answering (VQA) with LLMs","date":"2024-04-01","arxiv_id":"2404.01151","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-gaze-grounded-visual-question-answering","title":"A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions","date":"2024-03-26","arxiv_id":"2403.17545","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-hallucination-definition","title":"Visual Hallucination: Definition, Quantification, and Prescriptive Remediations","date":"2024-03-26","arxiv_id":"2403.17306","repositories_listed":0,"syntology":null},{"url":null,"slug":"synthesize-step-by-step-tools-templates-and","title":"Synthesize Step-by-Step: Tools, Templates and LLMs as Data Generators for Reasoning-Based Chart VQA","date":"2024-03-25","arxiv_id":"2403.16385","repositories_listed":0,"syntology":null},{"url":null,"slug":"surgical-lvlm-learning-to-adapt-large-vision","title":"Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery","date":"2024-03-22","arxiv_id":"2405.10948","repositories_listed":0,"syntology":null},{"url":null,"slug":"agfsync-leveraging-ai-generated-feedback-for","title":"AGFSync: Leveraging AI-Generated Feedback for Preference Optimization in Text-to-Image Generation","date":"2024-03-20","arxiv_id":"2403.13352","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-hallucination-control-by-visual","title":"Multi-Modal Hallucination Control by Visual Information Grounding","date":"2024-03-20","arxiv_id":"2403.14003","repositories_listed":0,"syntology":null},{"url":null,"slug":"wolf-large-language-model-framework-for-cxr","title":"WoLF: Wide-scope Large Language Model Framework for CXR Understanding","date":"2024-03-19","arxiv_id":"2403.15456","repositories_listed":0,"syntology":null},{"url":null,"slug":"flexcap-generating-rich-localized-and","title":"FlexCap: Describe Anything in Images in Controllable Detail","date":"2024-03-18","arxiv_id":"2403.12026","repositories_listed":0,"syntology":null},{"url":null,"slug":"see-imagine-plan-discovering-and","title":"SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors","date":"2024-03-18","arxiv_id":"2403.13438","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-vqa-with-frozen-llms-a-tale-of-two","title":"Few-Shot VQA with Frozen LLMs: A Tale of Two Approaches","date":"2024-03-17","arxiv_id":"2403.11317","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-image-classification-and","title":"Few-Shot Image Classification and Segmentation as Visual Question Answering Using Vision-Language Models","date":"2024-03-15","arxiv_id":"2403.10287","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-condensation-and-reasoning-for","title":"Knowledge Condensation and Reasoning for Knowledge-based VQA","date":"2024-03-15","arxiv_id":"2403.10037","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-dialogue-hallucination-for-large","title":"Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning","date":"2024-03-15","arxiv_id":"2403.10492","repositories_listed":0,"syntology":null},{"url":null,"slug":"unicode-learning-a-unified-codebook-for","title":"UniCode: Learning a Unified Codebook for Multimodal Large Language Models","date":"2024-03-14","arxiv_id":"2403.09072","repositories_listed":0,"syntology":null},{"url":"/paper/omnicount-multi-label-object-counting-with","slug":"omnicount-multi-label-object-counting-with","title":"OmniCount: Multi-label Object Counting with Semantic-Geometric Priors","date":"2024-03-08","arxiv_id":"2403.05435","repositories_listed":0,"syntology":null},{"url":null,"slug":"snapntell-enhancing-entity-centric-visual","title":"SnapNTell: Enhancing Entity-Centric Visual Question Answering with Retrieval Augmented Multimodal LLM","date":"2024-03-07","arxiv_id":"2403.04735","repositories_listed":0,"syntology":null},{"url":null,"slug":"clevr-poc-reasoning-intensive-visual-question","title":"CLEVR-POC: Reasoning-Intensive Visual Question Answering in Partially Observable Environments","date":"2024-03-05","arxiv_id":"2403.03203","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-generalization-in-medical-visual","title":"Enhancing Generalization in Medical Visual Question Answering Tasks via Gradient-Guided Model Perturbation","date":"2024-03-05","arxiv_id":"2403.02707","repositories_listed":0,"syntology":null},{"url":null,"slug":"arcsin-adaptive-ranged-cosine-similarity","title":"ArcSin: Adaptive ranged cosine Similarity injected noise for Language-Driven Visual Tasks","date":"2024-02-27","arxiv_id":"2402.17298","repositories_listed":0,"syntology":null},{"url":null,"slug":"asclepius-a-spectrum-evaluation-benchmark-for","title":"A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models","date":"2024-02-17","arxiv_id":"2402.11217","repositories_listed":0,"syntology":null},{"url":null,"slug":"palm2-vadapter-progressively-aligned-language","title":"PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter","date":"2024-02-16","arxiv_id":"2402.10896","repositories_listed":0,"syntology":null},{"url":"/paper/vqattack-transferable-adversarial-attacks-on","slug":"vqattack-transferable-adversarial-attacks-on","title":"VQAttack: Transferable Adversarial Attacks on Visual Question Answering via Pre-trained Models","date":"2024-02-16","arxiv_id":"2402.11083","repositories_listed":0,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":2,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/vqattack-transferable-adversarial-attacks-on#ran","syntology_url":"https://syntology.ai/paper/2402.11083","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2402.11083"}},"official":null}},{"url":"/paper/lapdoc-layout-aware-prompting-for-documents","slug":"lapdoc-layout-aware-prompting-for-documents","title":"LAPDoc: Layout-Aware Prompting for Documents","date":"2024-02-15","arxiv_id":"2402.09841","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-based-personalized-federated-learning","title":"Prompt-based Personalized Federated Learning for Medical Visual Question Answering","date":"2024-02-15","arxiv_id":"2402.09677","repositories_listed":0,"syntology":null}],"record_sha256":"00cc1935aea5018e6d8335f348ce42a444cb6bd13c520eb49d47003fd150a30a","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}