Browse State-of-the-Art › Visual Question Answering › Papers, page 18
Visual Question Answering
Papers archive 2025-07-28
archive papers tagged: 2,177 · with a code link: 1,042 · where Syntology ran a sample: 378 (308 with a run with no instrument failure, 70 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (378 of 2,177 tagged: 308 with a run with no instrument failure, 70 where every run was a failure of Syntology's instrument)
Page 18 of 22: papers 1,701 to 1,800 of 2,177, in archive order: by repositories listed in the archive (most first), then newest first, not by stars (the archive holds no stars, so PwC's “Social” and “Latest” sorts cannot be reproduced). Papers that list no repository come after every paper that lists one.
Papers without a page here are shown as plain text. A Syntology line reads “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the figure “where Syntology's instrument failed” counts failures of Syntology's instrument, not of the code. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code); hover it for the repositories the samples that ran came from. Abstracts are on each paper's page.
-
On the Effects of Video Grounding on Language Models1 Oct 2022 0 repositories listed
-
RepsNet: Combining Vision with Language for Automated Medical Reports27 Sep 2022 0 repositories listed
-
Toward 3D Spatial Reasoning for Human-like Text-based Visual Question Answering21 Sep 2022 0 repositories listed
-
Correlation Information Bottleneck: Towards Adapting Pretrained Multimodal Models for Robust Visual Question Answering14 Sep 2022 0 repositories listed
-
MUST-VQA: MUltilingual Scene-text VQA14 Sep 2022 0 repositories listed
-
PreSTU: Pre-Training for Scene-Text Understanding12 Sep 2022 0 repositories listed
-
Pre-training image-language transformers for open-vocabulary tasks9 Sep 2022 0 repositories listed
-
FashionVQA: A Domain-Specific Visual Question Answering System24 Aug 2022 0 repositories listed
-
Bidirectional Contrastive Split Learning for Visual Question Answering24 Aug 2022 0 repositories listed
-
How good are deep models in understanding the generated images?23 Aug 2022 0 repositories listed
-
VLMAE: Vision-Language Masked Autoencoder19 Aug 2022 0 repositories listed
-
10 Aug 2022 0 repositories listed
-
Uncertainty-based Visual Question Answering: Estimating Semantic Inconsistency between Image and Knowledge Base27 Jul 2022 0 repositories listed
-
Is GPT-3 all you need for Visual Question Answering in Cultural Heritage?25 Jul 2022 0 repositories listed
-
Towards Complex Document Understanding By Discrete Reasoning25 Jul 2022 0 repositories listed
-
Visual Perturbation-aware Collaborative Learning for Overcoming the Language Prior Problem24 Jul 2022 0 repositories listed
-
Semantic-aware Modular Capsule Routing for Visual Question Answering21 Jul 2022 0 repositories listed
-
7 Jul 2022 0 repositories listed
-
American == White in Multimodal Language-and-Image AI1 Jul 2022 0 repositories listed
-
VGNMN: Video-grounded Neural Module Networks for Video-Grounded Dialogue Systems1 Jul 2022 0 repositories listed
-
Modern Question Answering Datasets and Benchmarks: A Survey30 Jun 2022 0 repositories listed
-
EBMs vs. CL: Exploring Self-Supervised Visual Pretraining for Visual Question Answering29 Jun 2022 0 repositories listed
-
From Shallow to Deep: Compositional Reasoning over Graphs for Visual Question Answering25 Jun 2022 0 repositories listed
-
Tell Me the Evidence? Dual Visual-Linguistic Interaction for Answer Grounding21 Jun 2022 0 repositories listed
-
Grounding Answers for Visual Questions Asked by Visually Impaired People20 Jun 2022 0 repositories listed
-
Test-Time Adaptation for Visual Document Understanding15 Jun 2022 0 repositories listed
-
10 Jun 2022 0 repositories listed
-
From Pixels to Objects: Cubic Visual Attention for Visual Question Answering4 Jun 2022 0 repositories listed
-
Structured Two-stream Attention Network for Video Question Answering2 Jun 2022 0 repositories listed
-
VL-BEiT: Generative Vision-Language Pretraining2 Jun 2022 0 repositories listed
-
Fine-tuning vs From Scratch: Do Vision & Language Models Have Similar Capabilities on Out-of-Distribution Visual Question Answering?1 Jun 2022 0 repositories listed
-
Question Modifiers in Visual Question Answering1 Jun 2022 0 repositories listed
-
Un jeu de données pour répondre à des questions visuelles à propos d’entités nommées en utilisant des bases de connaissances (ViQuAE, a Dataset for Knowledge-based Visual Question Answering about Named Entities)1 Jun 2022 0 repositories listed
-
Visual Superordinate Abstraction for Robust Concept Learning28 May 2022 0 repositories listed
-
V-Doc : Visual questions answers with Documents27 May 2022 0 repositories listed
-
Guiding Visual Question Answering with Attention Priors25 May 2022 0 repositories listed
-
On Advances in Text Generation from Images Beyond Captioning: A Case Study in Self-Rationalization24 May 2022 0 repositories listed
-
Reassessing Evaluation Practices in Visual Question Answering: A Case Study on Out-of-Distribution Generalization24 May 2022 0 repositories listed
-
VQA-GNN: Reasoning with Multimodal Knowledge via Graph Neural Networks for Visual Question Answering23 May 2022 0 repositories listed
-
Gender and Racial Bias in Visual Question Answering Datasets17 May 2022 0 repositories listed
-
Serving and Optimizing Machine Learning Workflows on Heterogeneous Infrastructures10 May 2022 0 repositories listed
-
Joint learning of object graph and relation graph for visual question answering9 May 2022 0 repositories listed
-
From Easy to Hard: Learning Language-guided Curriculum for Visual Question Answering on Remote Sensing Data6 May 2022 0 repositories listed
-
Answer-Me: Multi-Task Open-Vocabulary Visual Question Answering2 May 2022 0 repositories listed
-
Vision-Language Pretraining: Current Trends and the Future1 May 2022 0 repositories listed
-
22 Apr 2022 0 repositories listed
-
Attention Mechanism based Cognition-level Scene Understanding17 Apr 2022 0 repositories listed
-
Improving Cross-Modal Understanding in Visual Dialog via Contrastive Learning15 Apr 2022 0 repositories listed
-
Question-Driven Graph Fusion Network For Visual Question Answering3 Apr 2022 0 repositories listed
-
Co-VQA : Answering by Interactive Sub Question Sequence2 Apr 2022 0 repositories listed
-
SimVQA: Exploring Simulated Environments for Visual Question Answering31 Mar 2022 0 repositories listed
-
Towards Escaping from Language Bias and OCR Error: Semantics-Centered Text Visual Question Answering24 Mar 2022 0 repositories listed
-
Can you even tell left from right? Presenting a new challenge for VQA15 Mar 2022 0 repositories listed
-
CLIP Models are Few-shot Learners: Empirical Studies on VQA and Visual Entailment14 Mar 2022 0 repositories listed
-
Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation12 Mar 2022 0 repositories listed
-
Modeling Coreference Relations in Visual Dialog6 Mar 2022 0 repositories listed
-
Recent, rapid advancement in visual question answering architecture: a review2 Mar 2022 0 repositories listed
-
Measuring CLEVRness: Blackbox testing of Visual Reasoning Models24 Feb 2022 0 repositories listed
-
Privacy Preserving Visual Question Answering15 Feb 2022 0 repositories listed
-
An experimental study of the vision-bottleneck in VQA14 Feb 2022 0 repositories listed
-
Can Open Domain Question Answering Systems Answer Visual Knowledge Questions?9 Feb 2022 0 repositories listed
-
8 Feb 2022 0 repositories listed
-
Learning to Compose Diversified Prompts for Image Emotion Classification26 Jan 2022 0 repositories listed
-
MGA-VQA: Multi-Granularity Alignment for Visual Question Answering25 Jan 2022 0 repositories listed
-
SA-VQA: Structured Alignment of Visual and Semantic Representations for Visual Question Answering25 Jan 2022 0 repositories listed
-
Question Generation for Evaluating Cross-Dataset Shifts in Multi-modal Grounding24 Jan 2022 0 repositories listed
-
All You May Need for VQA are Image Captions16 Jan 2022 0 repositories listed
-
MANGO: Enhancing the Robustness of VQA Models via Adversarial Noise Generation16 Jan 2022 0 repositories listed
-
Probing the Role of Positional Information in Vision-Language Models16 Jan 2022 0 repositories listed
-
Retrieving Visual Facts For Few-Shot Visual Question Answering16 Jan 2022 0 repositories listed
-
Task Formulation Matters When Learning Continuously: A Case Study in Visual Question Answering16 Jan 2022 0 repositories listed
-
CLIP-TD: CLIP Targeted Distillation for Vision-Language Tasks15 Jan 2022 0 repositories listed
-
A Thousand Words Are Worth More Than a Picture: Natural Language-Centric Outside-Knowledge Visual Question Answering14 Jan 2022 0 repositories listed
-
Towards Automated Error Analysis: Learning to Characterize Errors13 Jan 2022 0 repositories listed
-
On the Efficacy of Co-Attention Transformer Layers in Visual Question Answering11 Jan 2022 0 repositories listed
-
Uni-EDEN: Universal Encoder-Decoder Network by Multi-Granular Vision-Language Pre-training11 Jan 2022 0 repositories listed
-
COIN: Counterfactual Image Generation for VQA Interpretation10 Jan 2022 0 repositories listed
-
Interactive Attention AI to translate low light photos to captions for night scene understanding in women safety4 Jan 2022 0 repositories listed
-
Towards General Purpose Vision Systems: An End-to-End Task-Agnostic Vision-Language Architecture1 Jan 2022 0 repositories listed
-
1 Jan 2022 0 repositories listed
-
V-Doc: Visual Questions Answers With Documents1 Jan 2022 0 repositories listed
-
Does CLIP Benefit Visual Question Answering in the Medical Domain as Much as it Does in the General Domain?27 Dec 2021 0 repositories listed
-
Task-Oriented Multi-User Semantic Communications19 Dec 2021 0 repositories listed
-
Understanding Attention for Vision-and-Language Tasks17 Dec 2021 0 repositories listed
-
3D Question Answering15 Dec 2021 0 repositories listed
-
Improving and Diagnosing Knowledge-Based Visual Question Answering via Entity Enhanced Knowledge Injection13 Dec 2021 0 repositories listed
-
Unified Multimodal Pre-training and Prompt-based Tuning for Vision-Language Understanding and Generation10 Dec 2021 0 repositories listed
-
MoCA: Incorporating Multi-stage Domain Pretraining and Cross-guided Multimodal Attention for Textbook Question Answering6 Dec 2021 0 repositories listed
-
Curriculum Learning Effectively Improves Low Data VQA1 Dec 2021 0 repositories listed
-
eaVQA: An Experimental Analysis on Visual Question Answering Models1 Dec 2021 0 repositories listed
-
Robust Visual Reasoning via Language Guided Neural Module Networks1 Dec 2021 0 repositories listed
-
Scallop: From Probabilistic Deductive Databases to Scalable Differentiable Reasoning1 Dec 2021 0 repositories listed
-
Scene Graph Generation with Geometric Context25 Nov 2021 0 repositories listed
-
A Confidence-Based Interface for Neuro-Symbolic Visual Question Answering21 Nov 2021 0 repositories listed
-
Medical Visual Question Answering: A Survey19 Nov 2021 0 repositories listed
-
UFO: A UniFied TransfOrmer for Vision-Language Representation Learning19 Nov 2021 0 repositories listed
-
17 Nov 2021 0 repositories listed
-
Breaking Down Questions for Outside-Knowledge Visual Question Answering16 Nov 2021 0 repositories listed
-
Co-VQA : Answering by Interactive Sub Question Sequence16 Nov 2021 0 repositories listed
-
Document AI: Benchmarks, Models and Applications16 Nov 2021 0 repositories listed