{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering-1/papers/19","list_of":"/task/visual-question-answering-1","task":"Visual Question Answering","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":19,"pages_in_order":22,"rows_per_page":100,"rows":[1801,1900],"of":2177,"counts":{"archive_papers_tagged":2177,"with_a_code_link":1042,"where_syntology_ran_a_sample":378,"not_listed_spam_title":0,"listed":2177,"listed_where_code_ran":378,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":308,"every_run_a_failure_of_syntologys_instrument":70,"listed_with_a_run_with_no_instrument_failure":308,"listed_every_run_a_failure_of_syntologys_instrument":70,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering-1","prev":"/task/visual-question-answering-1/papers/18","next":"/task/visual-question-answering-1/papers/20","papers":[{"url":"/paper/enabling-multimodal-generation-on-clip-via","slug":"enabling-multimodal-generation-on-clip-via","title":"Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-bias-in-visual-question-answering-a","title":"Language bias in Visual Question Answering: A Survey and Taxonomy","date":"2021-11-16","arxiv_id":"2111.08531","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-led-semantic-structure-enhanced","title":"Question-Led Semantic Structure Enhanced Attentions for VQA","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-based-visual-question-answering","title":"Uncertainty-based Visual Question Answering: Estimating Semantic Inconsistency between Image and Knowledge Base","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"viquae-a-dataset-for-knowledge-based-visual","title":"ViQuAE, a Dataset for Knowledge-based Visual Question Answering about Named Entities","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-relation-transformer-incorporating","title":"Graph Relation Transformer: Incorporating pairwise object features into the Transformer architecture","date":"2021-11-11","arxiv_id":"2111.06075","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-based-on-formal","title":"Visual Question Answering based on Formal Logic","date":"2021-11-08","arxiv_id":"2111.04785","repositories_listed":0,"syntology":null},{"url":null,"slug":"crossvqa-scalably-generating-benchmarks-for","title":"CrossVQA: Scalably Generating Benchmarks for Systematically Testing VQA Generalization","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"diversity-and-consistency-exploring-visual","title":"Diversity and Consistency: Exploring Visual Question-Answer Pair Generation","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"single-modal-entropy-based-active-learning","title":"Single-Modal Entropy based Active Learning for Visual Question Answering","date":"2021-10-21","arxiv_id":"2110.10906","repositories_listed":0,"syntology":null},{"url":null,"slug":"xgqa-cross-lingual-visual-question-answering-1","title":"xGQA: Cross-Lingual Visual Question Answering","date":"2021-10-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-users-mental-model-with-attention","title":"Improving Users' Mental Model with Attention-directed Counterfactual Edits","date":"2021-10-13","arxiv_id":"2110.06863","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmiu-dataset-for-visual-intent-understanding","title":"MMIU: Dataset for Visual Intent Understanding in Multimodal Assistants","date":"2021-10-13","arxiv_id":"2110.06416","repositories_listed":0,"syntology":null},{"url":null,"slug":"asking-questions-on-handwritten-document","title":"Asking questions on handwritten document collections","date":"2021-10-02","arxiv_id":"2110.00711","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-down-questions-for-outside-knowledge","title":"Breaking Down Questions for Outside-Knowledge VQA","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"crossformer-transformer-with-alternated-cross","title":"Crossformer: Transformer with Alternated Cross-Layer Guidance","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"how-much-can-clip-benefit-vision-and-language-1","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-clevrness-black-box-testing-of","title":"Measuring CLEVRness: Black-box Testing of Visual Reasoning Models","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-disentangled-attention-for","title":"Variational Disentangled Attention for Regularized Visual Dialog","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-integration-of-human-like","title":"Multimodal Integration of Human-Like Attention in Visual Question Answering","date":"2021-09-27","arxiv_id":"2109.13139","repositories_listed":0,"syntology":null},{"url":"/paper/vqa-mhug-a-gaze-dataset-to-study-multimodal","slug":"vqa-mhug-a-gaze-dataset-to-study-multimodal","title":"VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering","date":"2021-09-27","arxiv_id":"2109.13116","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-find-a-good-image-text-embedding-for","title":"How to find a good image-text embedding for remote sensing visual question answering?","date":"2021-09-24","arxiv_id":"2109.11848","repositories_listed":0,"syntology":null},{"url":"/paper/towards-developing-a-multilingual-and-code","slug":"towards-developing-a-multilingual-and-code","title":"Towards Developing a Multilingual and Code-Mixed Visual Question Answering System by Knowledge Distillation","date":"2021-09-10","arxiv_id":"2109.04653","repositories_listed":0,"syntology":null},{"url":null,"slug":"txt-crossmodal-end-to-end-learning-with","title":"TxT: Crossmodal End-to-End Learning with Transformers","date":"2021-09-09","arxiv_id":"2109.04422","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-relative-spatial-reasoning","title":"Weakly Supervised Relative Spatial Reasoning for Visual Question Answering","date":"2021-09-04","arxiv_id":"2109.01934","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-significance-of-question-encoder","title":"On the Significance of Question Encoder Sequence Model in the Out-of-Distribution Performance in Visual Question Answering","date":"2021-08-28","arxiv_id":"2108.12585","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-parsing-network-for-image-captioning-and","title":"Auto-Parsing Network for Image Captioning and Visual Question Answering","date":"2021-08-24","arxiv_id":"2108.10568","repositories_listed":0,"syntology":null},{"url":null,"slug":"localize-group-and-select-boosting-text-vqa","title":"Localize, Group, and Select: Boosting Text-VQA by Scene Text Modeling","date":"2021-08-20","arxiv_id":"2108.08965","repositories_listed":0,"syntology":null},{"url":null,"slug":"valse-a-task-independent-benchmark-for-vision","title":"VALSE: A Task-Independent Benchmark for Vision and Language Models centered on Linguistic Phenomena","date":"2021-08-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"in-factuality-efficient-integration-of","title":"In Factuality: Efficient Integration of Relevant Facts for Visual Question Answering","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"li-yong-tu-xiang-miao-shu-yu-zhi-shi-tu-pu","title":"利用图像描述与知识图谱增强表示的视觉问答(Exploiting Image Captions and External Knowledge as Representation Enhancement for Visual Question Answering)","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"lrra-a-transparent-neural-symbolic-reasoning","title":"LRRA:A Transparent Neural-Symbolic Reasoning Framework for Real-World Visual Question Answering","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-visual-question-answering-on","title":"Towards Visual Question Answering on Pathology Images","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"muvam-a-multi-view-attention-based-model-for","title":"MuVAM: A Multi-View Attention-based Model for Medical Visual Question Answering","date":"2021-07-07","arxiv_id":"2107.03216","repositories_listed":0,"syntology":null},{"url":null,"slug":"adventurer-s-treasure-hunt-a-transparent","title":"Adventurer's Treasure Hunt: A Transparent System for Visually Grounded Compositional Visual Question Answering based on Scene Graphs","date":"2021-06-28","arxiv_id":"2106.14476","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-picture-may-be-worth-a-hundred-words-for","title":"A Picture May Be Worth a Hundred Words for Visual Question Answering","date":"2021-06-25","arxiv_id":"2106.13445","repositories_listed":0,"syntology":null},{"url":"/paper/multimodal-few-shot-learning-with-frozen","slug":"multimodal-few-shot-learning-with-frozen","title":"Multimodal Few-Shot Learning with Frozen Language Models","date":"2021-06-25","arxiv_id":"2106.13884","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-inter-modality-visual-parsing-with","title":"Probing Inter-modality: Visual Parsing with Self-Attention for Vision-Language Pre-training","date":"2021-06-25","arxiv_id":"2106.13488","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqa-aid-visual-question-answering-for-post","title":"VQA-Aid: Visual Question Answering for Post-Disaster Damage Assessment and Analysis","date":"2021-06-19","arxiv_id":"2106.10548","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-attention-belief-networks","title":"Bayesian Attention Belief Networks","date":"2021-06-09","arxiv_id":"2106.05251","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-vqa-systems-rad-measuring-robustness-to","title":"Are VQA Systems RAD? Measuring Robustness to Augmented Data with Focused Interventions","date":"2021-06-08","arxiv_id":"2106.04484","repositories_listed":0,"syntology":null},{"url":null,"slug":"pam-understanding-product-images-in-cross","title":"PAM: Understanding Product Images in Cross Product Category Attribute Extraction","date":"2021-06-08","arxiv_id":"2106.04630","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-adversarial-visual-question-answering","title":"Human-Adversarial Visual Question Answering","date":"2021-06-04","arxiv_id":"2106.02280","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounding-complex-navigational-instructions","title":"Grounding Complex Navigational Instructions Using Scene Graphs","date":"2021-06-03","arxiv_id":"2106.01607","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-vqa-a-new-benchmark-for","title":"Adversarial VQA: A New Benchmark for Evaluating the Robustness of VQA Models","date":"2021-06-01","arxiv_id":"2106.00245","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-select-question-relevant","title":"Learning to Select Question-Relevant Relations for Visual Question Answering","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mimoqa-multimodal-input-multimodal-output","title":"MIMOQA: Multimodal Input Multimodal Output Question Answering","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-aligned-multi-modal-transformer-for","title":"Semantic Aligned Multi-modal Transformer for Vision-LanguageUnderstanding: A Preliminary Study on Visual QA","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/probing-inter-modality-visual-parsing-with-1","slug":"probing-inter-modality-visual-parsing-with-1","title":"Probing Inter-modality: Visual Parsing with Self-Attention for Vision-and-Language Pre-training","date":"2021-05-21","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-visual-semantic-embedding-methods","title":"Survey of Visual-Semantic Embedding Methods for Zero-Shot Image Retrieval","date":"2021-05-16","arxiv_id":"2105.07391","repositories_listed":0,"syntology":null},{"url":null,"slug":"show-why-the-answer-is-correct-towards","title":"Show Why the Answer is Correct! Towards Explainable AI using Compositional Temporal Attention","date":"2021-05-15","arxiv_id":"2105.07141","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-generative-augmentation-for","title":"Cross-Modal Generative Augmentation for Visual Question Answering","date":"2021-05-11","arxiv_id":"2105.04780","repositories_listed":0,"syntology":null},{"url":null,"slug":"proposal-free-one-stage-referring-expression","title":"Proposal-free One-stage Referring Expression via Grid-Word Cross-Attention","date":"2021-05-05","arxiv_id":"2105.02061","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterated-learning-for-emergent-systematicity-1","title":"Iterated learning for emergent systematicity in VQA","date":"2021-05-03","arxiv_id":"2105.01119","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-vqa-datasets-and-approaches","title":"A survey on VQA_Datasets and Approaches","date":"2021-05-02","arxiv_id":"2105.00421","repositories_listed":0,"syntology":null},{"url":null,"slug":"chop-chop-bert-visual-question-answering-by","title":"Chop Chop BERT: Visual Question Answering by Chopping VisualBERT's Heads","date":"2021-04-30","arxiv_id":"2104.14741","repositories_listed":0,"syntology":null},{"url":"/paper/document-collection-visual-question-answering","slug":"document-collection-visual-question-answering","title":"Document Collection Visual Question Answering","date":"2021-04-27","arxiv_id":"2104.14336","repositories_listed":0,"syntology":null},{"url":"/paper/infographicvqa","slug":"infographicvqa","title":"InfographicVQA","date":"2021-04-26","arxiv_id":"2104.12756","repositories_listed":0,"syntology":null},{"url":null,"slug":"playing-lottery-tickets-with-vision-and","title":"Playing Lottery Tickets with Vision and Language","date":"2021-04-23","arxiv_id":"2104.11832","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-retrieval-augmentation-for-multi-1","title":"Cross-Modal Retrieval Augmentation for Multi-Modal Classification","date":"2021-04-16","arxiv_id":"2104.08108","repositories_listed":0,"syntology":null},{"url":null,"slug":"vgnmn-video-grounded-neural-module-network-to","title":"VGNMN: Video-grounded Neural Module Network to Video-Grounded Language Tasks","date":"2021-04-16","arxiv_id":"2104.07921","repositories_listed":0,"syntology":null},{"url":null,"slug":"jointly-learning-truth-conditional","title":"Jointly Learning Truth-Conditional Denotations and Groundings using Parallel Attention","date":"2021-04-14","arxiv_id":"2104.06645","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuro-symbolic-vqa-a-review-from-the","title":"Neuro-Symbolic VQA: A review from the perspective of AGI desiderata","date":"2021-04-13","arxiv_id":"2104.06365","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-transferable-are-reasoning-patterns-in","title":"How Transferable are Reasoning Patterns in VQA?","date":"2021-04-08","arxiv_id":"2104.03656","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-continuous-visual-attention","title":"Multimodal Continuous Visual Attention Mechanisms","date":"2021-04-07","arxiv_id":"2104.03046","repositories_listed":0,"syntology":null},{"url":null,"slug":"compressing-visual-linguistic-model-via","title":"Compressing Visual-linguistic Model via Knowledge Distillation","date":"2021-04-05","arxiv_id":"2104.02096","repositories_listed":0,"syntology":null},{"url":null,"slug":"just-because-you-are-right-doesn-t-mean-i-am-1","title":"`Just because you are right, doesn't mean I am wrong': Overcoming a bottleneck in development and evaluation of Open-Ended VQA tasks","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uc2-universal-cross-lingual-cross-modal","title":"UC2: Universal Cross-lingual Cross-modal Vision-and-Language Pre-training","date":"2021-04-01","arxiv_id":"2104.00332","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-on-image-set-visual-question","title":"Analysis on Image Set Visual Question Answering","date":"2021-03-31","arxiv_id":"2104.00107","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-robust-vqa-with-diverse-datasets-and","title":"Domain-robust VQA with diverse datasets and methods but no target labels","date":"2021-03-29","arxiv_id":"2103.15974","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowing-what-vqa-does-not-pointing-to-error","title":"Generating and Evaluating Explanations of Attended and Error-Inducing Input Regions for VQA Models","date":"2021-03-26","arxiv_id":"2103.14712","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-grounding-strategies-for-text-only","title":"Visual Grounding Strategies for Text-Only Natural Language Processing","date":"2021-03-25","arxiv_id":"2103.13942","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-design-sample-and-computationally","title":"How to Design Sample and Computationally Efficient VQA Models","date":"2021-03-22","arxiv_id":"2103.11537","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-graphs-a-survey-of-generations-and","title":"A Comprehensive Survey of Scene Graphs: Generation and Application","date":"2021-03-17","arxiv_id":"2104.01111","repositories_listed":0,"syntology":null},{"url":null,"slug":"characterizing-misclassifications-of-deep-nlp","title":"Characterizing Misclassifications of Deep NLP Models","date":"2021-03-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-csdia-representation-learning-of-computer","title":"RL-CSDia: Representation Learning of Computer Science Diagrams","date":"2021-03-10","arxiv_id":"2103.05900","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-reasoning-paths-over-semantic-graphs-1","title":"Learning Reasoning Paths over Semantic Graphs for Video-grounded Dialogues","date":"2021-03-01","arxiv_id":"2103.00820","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-compositional-representation-for-few","title":"Learning Compositional Representation for Few-shot Visual Question Answering","date":"2021-02-21","arxiv_id":"2102.10575","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-on-the-generalization","title":"An Empirical Study on the Generalization Power of Neural Representations Learned via Visual Guessing Games","date":"2021-01-31","arxiv_id":"2102.00424","repositories_listed":0,"syntology":null},{"url":null,"slug":"unanswerable-questions-about-images-and-texts","title":"Unanswerable Questions about Images and Texts","date":"2021-01-25","arxiv_id":"2102.06793","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-based-on-local","title":"Visual Question Answering based on Local-Scene-Aware Referring Expression Generation","date":"2021-01-22","arxiv_id":"2101.08978","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-in-artificial-intelligence","title":"Understanding in Artificial Intelligence","date":"2021-01-17","arxiv_id":"2101.06573","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-variable-models-for-visual-question","title":"Latent Variable Models for Visual Question Answering","date":"2021-01-16","arxiv_id":"2101.06399","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-role-of-scene-graphs-in","title":"Understanding the Role of Scene Graphs in Visual Question Answering","date":"2021-01-14","arxiv_id":"2101.05479","repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-relative-depth-between-objects","title":"Predicting Relative Depth between Objects from Semantic Features","date":"2021-01-12","arxiv_id":"2101.04626","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformers-in-vision-a-survey","title":"Transformers in Vision: A Survey","date":"2021-01-04","arxiv_id":"2101.01169","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentiable-end-to-end-program-executor","title":"Differentiable End-to-End Program Executor for Sample and Computationally Efficient VQA","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-graph-attention-network-for-few","title":"Hierarchical Graph Attention Network for Few-Shot Visual-Semantic Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"linguistically-routing-capsule-network-for","title":"Linguistically Routing Capsule Network for Out-of-Distribution Visual Question Answering","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unshuffling-data-for-improved-generalization-1","title":"Unshuffling Data for Improved Generalization in Visual Question Answering","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-is-knowing-fact-based-visual-question","title":"Seeing is Knowing! Fact-based Visual Question Answering using Knowledge Graph Embeddings","date":"2020-12-31","arxiv_id":"2012.15484","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-centric-diagnosis-of-visual-reasoning","title":"Object-Centric Diagnosis of Visual Reasoning","date":"2020-12-21","arxiv_id":"2012.11587","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-vqa-answering-visual","title":"WeaQA: Weak Supervision via Captions for Visual Question Answering","date":"2020-12-04","arxiv_id":"2012.02356","repositories_listed":0,"syntology":null},{"url":"/paper/a-unified-framework-for-multilingual-and-code","slug":"a-unified-framework-for-multilingual-and-code","title":"A Unified Framework for Multilingual and Code-Mixed Visual Question Answering","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-graph-networks-for-compositional","title":"Multimodal Graph Networks for Compositional Generalization in Visual Question Answering","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"modular-graph-attention-network-for-complex","title":"Modular Graph Attention Network for Complex Visual Relational Reasoning","date":"2020-11-22","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"logically-consistent-loss-for-visual-question","title":"Logically Consistent Loss for Visual Question Answering","date":"2020-11-19","arxiv_id":"2011.10094","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-natural-questions-from-images-for","title":"Generating Natural Questions from Images for Multimodal Assistants","date":"2020-11-17","arxiv_id":"2012.03678","repositories_listed":0,"syntology":null},{"url":null,"slug":"reasoning-over-history-context-aware-visual","title":"Reasoning Over History: Context Aware Visual Dialog","date":"2020-11-02","arxiv_id":"2011.00669","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-pre-training-help-vqa-with-lexical","title":"Can Pre-training help VQA with Lexical Variations?","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"bba7807c2b809a6fd618f38f4631b532d2566599fc705792d7ce8c23e87a0b7d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}