{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering/papers/15","list_of":"/task/visual-question-answering","task":"Visual Question Answering (VQA)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":15,"pages_in_order":22,"rows_per_page":100,"rows":[1401,1500],"of":2167,"counts":{"archive_papers_tagged":2167,"with_a_code_link":1039,"where_syntology_ran_a_sample":359,"not_listed_spam_title":0,"listed":2167,"listed_where_code_ran":359,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":287,"every_run_a_failure_of_syntologys_instrument":72,"listed_with_a_run_with_no_instrument_failure":287,"listed_every_run_a_failure_of_syntologys_instrument":72,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering","prev":"/task/visual-question-answering/papers/14","next":"/task/visual-question-answering/papers/16","papers":[{"url":null,"slug":"visual-question-answering-instruction","title":"Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks","date":"2024-02-13","arxiv_id":"2402.08360","repositories_listed":0,"syntology":null},{"url":null,"slug":"cic-a-framework-for-culturally-aware-image","title":"CIC: A Framework for Culturally-Aware Image Captioning","date":"2024-02-08","arxiv_id":"2402.05374","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-reinforcement-learning-for-quantum","title":"Curriculum reinforcement learning for quantum architecture search under hardware errors","date":"2024-02-05","arxiv_id":"2402.03500","repositories_listed":0,"syntology":null},{"url":null,"slug":"binding-touch-to-everything-learning-unified","title":"Binding Touch to Everything: Learning Unified Multimodal Tactile Representations","date":"2024-01-31","arxiv_id":"2401.18084","repositories_listed":0,"syntology":null},{"url":null,"slug":"lcvo-an-efficient-pretraining-free-framework","title":"LCV2: An Efficient Pretraining-Free Framework for Grounded Visual Question Answering","date":"2024-01-29","arxiv_id":"2401.15842","repositories_listed":0,"syntology":null},{"url":null,"slug":"muffin-or-chihuahua-challenging-large-vision","title":"Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA","date":"2024-01-29","arxiv_id":"2401.15847","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-data-augmentation-for-robust-visual","title":"Improving Data Augmentation for Robust Visual Question Answering with Effective Curriculum Learning","date":"2024-01-28","arxiv_id":"2401.15646","repositories_listed":0,"syntology":null},{"url":null,"slug":"free-form-medical-visual-question-answering","title":"Free Form Medical Visual Question Answering in Radiology","date":"2024-01-23","arxiv_id":"2401.13081","repositories_listed":0,"syntology":null},{"url":"/paper/spatialvlm-endowing-vision-language-models","slug":"spatialvlm-endowing-vision-language-models","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","date":"2024-01-22","arxiv_id":"2401.12168","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-large-multi-modal-models-with","title":"Advancing Large Multi-modal Models with Explicit Chain-of-Reasoning and Visual Question Generation","date":"2024-01-18","arxiv_id":"2401.10005","repositories_listed":0,"syntology":null},{"url":"/paper/coco-is-all-you-need-for-visual-instruction","slug":"coco-is-all-you-need-for-visual-instruction","title":"COCO is \"ALL'' You Need for Visual Instruction Fine-tuning","date":"2024-01-17","arxiv_id":"2401.08968","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-quality-assessment-based-on-swin","title":"Video Quality Assessment Based on Swin TransformerV2 and Coarse to Fine Strategy","date":"2024-01-16","arxiv_id":"2401.08522","repositories_listed":0,"syntology":null},{"url":null,"slug":"bok-vqa-bilingual-outside-knowledge-based","title":"BOK-VQA: Bilingual outside Knowledge-Based Visual Question Answering via Graph Representation Pretraining","date":"2024-01-12","arxiv_id":"2401.06443","repositories_listed":0,"syntology":null},{"url":null,"slug":"gram-global-reasoning-for-multi-page-vqa","title":"GRAM: Global Reasoning for Multi-Page VQA","date":"2024-01-07","arxiv_id":"2401.03411","repositories_listed":0,"syntology":null},{"url":null,"slug":"diem-decomposition-integration-enhancing","title":"DIEM: Decomposition-Integration Enhancing Multimodal Insights","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mask4align-aligned-entity-prompting-with","title":"Mask4Align: Aligned Entity Prompting with Color Masks for Multi-Entity Localization Problems","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/synthesize-step-by-step-tools-templates-and-1","slug":"synthesize-step-by-step-tools-templates-and-1","title":"Synthesize Step-by-Step: Tools Templates and LLMs as Data Generators for Reasoning-Based Chart VQA","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"text-conditioned-generative-model-of-3d","title":"Text-Conditioned Generative Model of 3D Strand-based Human Hairstyles","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-io-2-scaling-autoregressive-1","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision Language Audio and Action","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-prompts-learning-with-cross-modal","title":"Multi-Prompts Learning with Cross-Modal Alignment for Attribute-based Person Re-Identification","date":"2023-12-28","arxiv_id":"2312.16797","repositories_listed":0,"syntology":null},{"url":null,"slug":"gemini-pro-defeated-by-gpt-4v-evidence-from","title":"Gemini Pro Defeated by GPT-4V: Evidence from Education","date":"2023-12-27","arxiv_id":"2401.08660","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-boost-on-visual-quality-assessment-ability","title":"Q-Boost: On Visual Quality Assessment Ability of Low-level Multi-Modality Foundation Models","date":"2023-12-23","arxiv_id":"2312.15300","repositories_listed":0,"syntology":null},{"url":null,"slug":"llm4vg-large-language-models-evaluation-for","title":"LLM4VG: Large Language Models Evaluation for Video Grounding","date":"2023-12-21","arxiv_id":"2312.14206","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-hallucinations-enhancing-vqa-for","title":"Reducing Hallucinations: Enhancing VQA for Flood Disaster Damage Assessment with Visual Contexts","date":"2023-12-21","arxiv_id":"2312.13848","repositories_listed":0,"syntology":null},{"url":null,"slug":"bloomvqa-assessing-hierarchical-multi-modal","title":"BloomVQA: Assessing Hierarchical Multi-modal Comprehension","date":"2023-12-20","arxiv_id":"2312.12716","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-visual-task-learning-for-robots","title":"Interactive Visual Task Learning for Robots","date":"2023-12-20","arxiv_id":"2312.13219","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-clue-reasoning-with-memory-augmentation","title":"Multi-Clue Reasoning with Memory Augmentation for Knowledge-based Visual Question Answering","date":"2023-12-20","arxiv_id":"2312.12723","repositories_listed":0,"syntology":null},{"url":null,"slug":"full-reference-video-quality-assessment-for-1","title":"Full-reference Video Quality Assessment for User Generated Content Transcoding","date":"2023-12-19","arxiv_id":"2312.12317","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-evaluation-of-gpt-4v-and-gemini-in-online","title":"An Evaluation of GPT-4V and Gemini in Online VQA","date":"2023-12-17","arxiv_id":"2312.10637","repositories_listed":0,"syntology":null},{"url":null,"slug":"rankdvqa-mini-knowledge-distillation-driven","title":"RankDVQA-mini: Knowledge Distillation-Driven Deep Video Quality Assessment","date":"2023-12-14","arxiv_id":"2312.08864","repositories_listed":0,"syntology":null},{"url":null,"slug":"bestmvqa-a-benchmark-evaluation-system-for","title":"BESTMVQA: A Benchmark Evaluation System for Medical Visual Question Answering","date":"2023-12-13","arxiv_id":"2312.07867","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-cog-a-causal-effect-look-at-context","title":"Causal-CoG: A Causal-Effect Look at Context Generation for Boosting Multi-modal Language Models","date":"2023-12-09","arxiv_id":"2312.06685","repositories_listed":0,"syntology":null},{"url":"/paper/lyrics-boosting-fine-grained-language-vision","slug":"lyrics-boosting-fine-grained-language-vision","title":"Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects","date":"2023-12-08","arxiv_id":"2312.05278","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-robustness-of-large-multimodal-models","title":"On the Robustness of Large Multimodal Models Against Image Adversarial Attacks","date":"2023-12-06","arxiv_id":"2312.03777","repositories_listed":0,"syntology":null},{"url":"/paper/visual-program-distillation-distilling-tools","slug":"visual-program-distillation-distilling-tools","title":"Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models","date":"2023-12-05","arxiv_id":"2312.03052","repositories_listed":0,"syntology":null},{"url":null,"slug":"medxchat-bridging-cxr-modalities-with-a","title":"MedXChat: A Unified Multimodal Large Language Model Framework towards CXRs Understanding and Generation","date":"2023-12-04","arxiv_id":"2312.02233","repositories_listed":0,"syntology":null},{"url":null,"slug":"unleashing-the-potential-of-large-language","title":"Unleashing the Potential of Large Language Model: Zero-shot VQA for Flood Disaster Scenario","date":"2023-12-04","arxiv_id":"2312.01882","repositories_listed":0,"syntology":null},{"url":"/paper/omni-smola-boosting-generalist-multimodal","slug":"omni-smola-boosting-generalist-multimodal","title":"Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts","date":"2023-12-01","arxiv_id":"2312.00968","repositories_listed":0,"syntology":null},{"url":"/paper/zero-shot-video-question-answering-with","slug":"zero-shot-video-question-answering-with","title":"Zero-Shot Video Question Answering with Procedural Programs","date":"2023-12-01","arxiv_id":"2312.00937","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-top-down-reasoning-an-explainable","title":"Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering","date":"2023-11-29","arxiv_id":"2311.17331","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-curse-of-language-biases-in-remote","title":"The curse of language biases in remote sensing VQA: the role of spatial attributes, language diversity, and the need for clear evaluation","date":"2023-11-28","arxiv_id":"2311.16782","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-wrong-to-right-a-recursive-approach","title":"From Wrong To Right: A Recursive Approach Towards Vision-Language Explanation","date":"2023-11-21","arxiv_id":"2311.12391","repositories_listed":0,"syntology":null},{"url":null,"slug":"knvqa-a-benchmark-for-evaluation-knowledge","title":"KNVQA: A Benchmark for evaluation knowledge-based VQA","date":"2023-11-21","arxiv_id":"2311.12639","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-and-mitigating-classification","title":"Understanding and Mitigating Classification Errors Through Interpretable Token Patterns","date":"2023-11-18","arxiv_id":"2311.10920","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiple-question-multiple-answer-text-vqa","title":"Multiple-Question Multiple-Answer Text-VQA","date":"2023-11-15","arxiv_id":"2311.08622","repositories_listed":0,"syntology":null},{"url":null,"slug":"asking-more-informative-questions-for","title":"Asking More Informative Questions for Grounded Retrieval","date":"2023-11-14","arxiv_id":"2311.08584","repositories_listed":0,"syntology":null},{"url":null,"slug":"clif-vqa-enhancing-video-quality-assessment","title":"CLiF-VQA: Enhancing Video Quality Assessment by Incorporating High-Level Semantic Information related to Human Feelings","date":"2023-11-13","arxiv_id":"2311.07090","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-large-language-models-bring-to-text-rich","title":"What Large Language Models Bring to Text-rich VQA?","date":"2023-11-13","arxiv_id":"2311.07306","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-commonsense-based-heterogeneous-graph","title":"Visual Commonsense based Heterogeneous Graph Contrastive Learning","date":"2023-11-11","arxiv_id":"2311.06553","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-vision-and-language-reasoning-via","title":"Improving Vision-and-Language Reasoning via Spatial Relations Modeling","date":"2023-11-09","arxiv_id":"2311.05298","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-image-to-language-a-critical-analysis-of","title":"From Image to Language: A Critical Analysis of Visual Question Answering (VQA) Approaches, Challenges, and Opportunities","date":"2023-11-01","arxiv_id":"2311.00308","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqa-gen-a-visual-question-answering-benchmark","title":"VQA-GEN: A Visual Question Answering Benchmark for Domain Generalization","date":"2023-11-01","arxiv_id":"2311.00807","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comprehensive-study-of-gpt-4v-s-multimodal","title":"A Systematic Evaluation of GPT-4V's Multimodal Capability for Medical Image Analysis","date":"2023-10-31","arxiv_id":"2310.20381","repositories_listed":0,"syntology":null},{"url":null,"slug":"davidsonian-scene-graph-improving-reliability","title":"Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation","date":"2023-10-27","arxiv_id":"2310.18235","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-question-decomposition-for-zero","title":"Exploring Question Decomposition for Zero-Shot VQA","date":"2023-10-25","arxiv_id":"2310.17050","repositories_listed":0,"syntology":null},{"url":null,"slug":"geometry-aware-video-quality-assessment-for","title":"Geometry-Aware Video Quality Assessment for Dynamic Digital Human","date":"2023-10-24","arxiv_id":"2310.15984","repositories_listed":0,"syntology":null},{"url":"/paper/a-simple-baseline-for-knowledge-based-visual","slug":"a-simple-baseline-for-knowledge-based-visual","title":"A Simple Baseline for Knowledge-Based Visual Question Answering","date":"2023-10-20","arxiv_id":"2310.13570","repositories_listed":0,"syntology":{"n":3,"n_ran":2,"n_constructed":0,"n_ran_checked":0,"n_instrument":2,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":3,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/a-simple-baseline-for-knowledge-based-visual#ran","syntology_url":"https://syntology.ai/paper/2310.13570","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2310.13570"}},"official":null}},{"url":null,"slug":"exploring-sparse-spatial-relation-in-graph","title":"Exploring Sparse Spatial Relation in Graph Inference for Text-Based VQA","date":"2023-10-13","arxiv_id":"2310.09147","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-mitosis-detection-on-histopathology","title":"Improving mitosis detection on histopathology images using large vision-language models","date":"2023-10-11","arxiv_id":"2310.07176","repositories_listed":0,"syntology":null},{"url":null,"slug":"jaeger-a-concatenation-based-multi","title":"Jaeger: A Concatenation-Based Multi-Transformer VQA Model","date":"2023-10-11","arxiv_id":"2310.07091","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-for-human-feedback","title":"Off-Policy Evaluation for Human Feedback","date":"2023-10-11","arxiv_id":"2310.07123","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-not-to-ensemble-lvlms-for-vqa","title":"How (not) to ensemble LVLMs for VQA","date":"2023-10-10","arxiv_id":"2310.06641","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-reasoning-through-two-layers-of","title":"Causal Reasoning through Two Layers of Cognition for Improving Generalization in Visual Question Answering","date":"2023-10-09","arxiv_id":"2310.05410","repositories_listed":0,"syntology":null},{"url":null,"slug":"negative-object-presence-evaluation-nope-to","title":"Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models","date":"2023-10-09","arxiv_id":"2310.05338","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-automatic-vqa-evaluation-using","title":"Improving Automatic VQA Evaluation Using Large Language Models","date":"2023-10-04","arxiv_id":"2310.02567","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-cognition-of-visual-question-answering","title":"On the Cognition of Visual Question Answering Models and Human Intelligence: A Comparative Study","date":"2023-10-04","arxiv_id":"2310.02528","repositories_listed":0,"syntology":null},{"url":null,"slug":"selfgraphvqa-a-self-supervised-graph-neural","title":"SelfGraphVQA: A Self-Supervised Graph Neural Network for Scene-based Question Answering","date":"2023-10-03","arxiv_id":"2310.01842","repositories_listed":0,"syntology":null},{"url":null,"slug":"tackling-vqa-with-pretrained-foundation","title":"Tackling VQA with Pretrained Foundation Models without Further Training","date":"2023-09-27","arxiv_id":"2309.15487","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentence-attention-blocks-for-answer","title":"Sentence Attention Blocks for Answer Grounding","date":"2023-09-20","arxiv_id":"2309.11593","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-in-the-medical","title":"Visual Question Answering in the Medical Domain","date":"2023-09-20","arxiv_id":"2309.11080","repositories_listed":0,"syntology":null},{"url":null,"slug":"syntax-tree-constrained-graph-network-for","title":"Syntax Tree Constrained Graph Network for Visual Question Answering","date":"2023-09-17","arxiv_id":"2309.09179","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-visual-question-answering-via","title":"Interpretable Visual Question Answering via Reasoning Supervision","date":"2023-09-07","arxiv_id":"2309.03726","repositories_listed":0,"syntology":null},{"url":null,"slug":"s3c-semi-supervised-vqa-natural-language-1","title":"S3C: Semi-Supervised VQA Natural Language Explanation via Self-Critical Learning","date":"2023-09-05","arxiv_id":"2309.02155","repositories_listed":0,"syntology":null},{"url":null,"slug":"distraction-free-embeddings-for-robust-vqa","title":"Distraction-free Embeddings for Robust VQA","date":"2023-08-31","arxiv_id":"2309.00133","repositories_listed":0,"syntology":null},{"url":null,"slug":"ada-dqa-adaptive-diverse-quality-aware","title":"Ada-DQA: Adaptive Diverse Quality-aware Feature Acquisition for Video Quality Assessment","date":"2023-08-01","arxiv_id":"2308.00729","repositories_listed":0,"syntology":null},{"url":null,"slug":"making-the-v-in-text-vqa-matter","title":"Making the V in Text-VQA Matter","date":"2023-08-01","arxiv_id":"2308.00295","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-the-gap-exploring-the-capabilities","title":"Bridging the Gap: Exploring the Capabilities of Bridge-Architectures for Complex Visual Reasoning Tasks","date":"2023-07-31","arxiv_id":"2307.16395","repositories_listed":0,"syntology":null},{"url":null,"slug":"capturing-co-existing-distortions-in-user","title":"Capturing Co-existing Distortions in User-Generated Content for No-reference Video Quality Assessment","date":"2023-07-31","arxiv_id":"2307.16813","repositories_listed":0,"syntology":null},{"url":null,"slug":"workshop-on-document-intelligence","title":"Workshop on Document Intelligence Understanding","date":"2023-07-31","arxiv_id":"2307.16369","repositories_listed":0,"syntology":null},{"url":null,"slug":"bartphobeit-pre-trained-sequence-to-sequence","title":"BARTPhoBEiT: Pre-trained Sequence-to-Sequence and Image Transformers Models for Vietnamese Visual Question Answering","date":"2023-07-28","arxiv_id":"2307.15335","repositories_listed":0,"syntology":null},{"url":null,"slug":"lois-looking-out-of-instance-semantics-for","title":"LOIS: Looking Out of Instance Semantics for Visual Question Answering","date":"2023-07-26","arxiv_id":"2307.14142","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-visual-question-answering-datasets","title":"Robust Visual Question Answering: Datasets, Methods, and Future Challenges","date":"2023-07-21","arxiv_id":"2307.11471","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-vqa","title":"A reinforcement learning approach for VQA validation: an application to diabetic macular edema grading","date":"2023-07-19","arxiv_id":"2307.09886","repositories_listed":0,"syntology":null},{"url":null,"slug":"ntire-2023-quality-assessment-of-video","title":"NTIRE 2023 Quality Assessment of Video Enhancement Challenge","date":"2023-07-19","arxiv_id":"2307.09729","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-visual-question-answering","title":"Generative Visual Question Answering","date":"2023-07-18","arxiv_id":"2307.10405","repositories_listed":0,"syntology":null},{"url":null,"slug":"let-s-vice-mimicking-human-cognitive-behavior","title":"Let's ViCE! Mimicking Human Cognitive Behavior in Image Generation Evaluation","date":"2023-07-18","arxiv_id":"2307.09416","repositories_listed":0,"syntology":null},{"url":null,"slug":"divide-evaluate-and-refine-evaluating-and","title":"Divide, Evaluate, and Refine: Evaluating and Improving Text-to-Image Alignment with Iterative VQA Feedback","date":"2023-07-10","arxiv_id":"2307.04749","repositories_listed":0,"syntology":null},{"url":null,"slug":"uit-saviors-at-medvqa-gi-2023-improving","title":"UIT-Saviors at MEDVQA-GI 2023: Improving Multimodal Learning with Image Enhancement for Gastrointestinal Visual Question Answering","date":"2023-07-06","arxiv_id":"2307.02783","repositories_listed":0,"syntology":null},{"url":null,"slug":"doremi-grounding-language-model-by-detecting","title":"DoReMi: Grounding Language Model by Detecting and Recovering from Plan-Execution Misalignment","date":"2023-07-01","arxiv_id":"2307.00329","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-equilibrium-multimodal-fusion","title":"Deep Equilibrium Multimodal Fusion","date":"2023-06-29","arxiv_id":"2306.16645","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-in-remote-sensing","title":"Visual Question Answering in Remote Sensing with Cross-Attention and Multimodal Information Bottleneck","date":"2023-06-25","arxiv_id":"2306.14264","repositories_listed":0,"syntology":null},{"url":null,"slug":"avis-autonomous-visual-information-seeking","title":"AVIS: Autonomous Visual Information Seeking with Large Language Model Agent","date":"2023-06-13","arxiv_id":"2306.08129","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-vqa-on-images-with","title":"Visual Question Answering (VQA) on Images with Superimposed Text","date":"2023-06-13","arxiv_id":"2307.02489","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-visual-question-answer","title":"Weakly Supervised Visual Question Answer Generation","date":"2023-06-11","arxiv_id":"2306.06622","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-detection-by-relevant-question-and","title":"Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering","date":"2023-06-08","arxiv_id":"2306.04938","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-clip-contrastive-vision-language-pre","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes","date":"2023-06-04","arxiv_id":"2306.02329","repositories_listed":0,"syntology":null},{"url":null,"slug":"metavl-transferring-in-context-learning","title":"MetaVL: Transferring In-Context Learning Ability From Language Models to Vision-Language Models","date":"2023-06-02","arxiv_id":"2306.01311","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-the-capabilities-of-multi-modal","title":"Evaluating the Capabilities of Multi-modal Reasoning Models with Synthetic Task Data","date":"2023-06-01","arxiv_id":"2306.01144","repositories_listed":0,"syntology":null},{"url":null,"slug":"lit-4-rsvqa-lightweight-transformer-based","title":"LiT-4-RSVQA: Lightweight Transformer-based Visual Question Answering in Remote Sensing","date":"2023-06-01","arxiv_id":"2306.00758","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-language-bias-in-remote-sensing","title":"Overcoming Language Bias in Remote Sensing Visual Question Answering via Adversarial Training","date":"2023-06-01","arxiv_id":"2306.00483","repositories_listed":0,"syntology":null}],"record_sha256":"b0790b845c01357589f7b59d93c00a60b913475c2aafc1afeeb9ab4158ec71ba","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}