{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering/papers/18","list_of":"/task/visual-question-answering","task":"Visual Question Answering (VQA)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":18,"pages_in_order":22,"rows_per_page":100,"rows":[1701,1800],"of":2167,"counts":{"archive_papers_tagged":2167,"with_a_code_link":1039,"where_syntology_ran_a_sample":359,"not_listed_spam_title":0,"listed":2167,"listed_where_code_ran":359,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":287,"every_run_a_failure_of_syntologys_instrument":72,"listed_with_a_run_with_no_instrument_failure":287,"listed_every_run_a_failure_of_syntologys_instrument":72,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering","prev":"/task/visual-question-answering/papers/17","next":"/task/visual-question-answering/papers/19","papers":[{"url":null,"slug":"eavqa-an-experimental-analysis-on-visual","title":"eaVQA: An Experimental Analysis on Visual Question Answering Models","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-visual-reasoning-via-language-guided","title":"Robust Visual Reasoning via Language Guided Neural Module Networks","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"scallop-from-probabilistic-deductive","title":"Scallop: From Probabilistic Deductive Databases to Scalable Differentiable Reasoning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"livlr-a-lightweight-visual-linguistic","title":"LiVLR: A Lightweight Visual-Linguistic Reasoning Framework for Video Question Answering","date":"2021-11-29","arxiv_id":"2111.14547","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-graph-generation-with-geometric-context","title":"Scene Graph Generation with Geometric Context","date":"2021-11-25","arxiv_id":"2111.13131","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-confidence-based-interface-for-neuro","title":"A Confidence-Based Interface for Neuro-Symbolic Visual Question Answering","date":"2021-11-21","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"medical-visual-question-answering-a-survey","title":"Medical Visual Question Answering: A Survey","date":"2021-11-19","arxiv_id":"2111.10056","repositories_listed":0,"syntology":null},{"url":null,"slug":"ufo-a-unified-transformer-for-vision-language","title":"UFO: A UniFied TransfOrmer for Vision-Language Representation Learning","date":"2021-11-19","arxiv_id":"2111.10023","repositories_listed":0,"syntology":null},{"url":"/paper/achieving-human-parity-on-visual-question","slug":"achieving-human-parity-on-visual-question","title":"Achieving Human Parity on Visual Question Answering","date":"2021-11-17","arxiv_id":"2111.08896","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-good-prompt-is-worth-millions-of-parameters-1","title":"A Good Prompt Is Worth Millions of Parameters: Low-resource Prompt-based Learning for Vision-Language Models","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-down-questions-for-outside-knowledge-1","title":"Breaking Down Questions for Outside-Knowledge Visual Question Answering","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"co-vqa-answering-by-interactive-sub-question","title":"Co-VQA : Answering by Interactive Sub Question Sequence","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"document-ai-benchmarks-models-and","title":"Document AI: Benchmarks, Models and Applications","date":"2021-11-16","arxiv_id":"2111.08609","repositories_listed":0,"syntology":null},{"url":"/paper/enabling-multimodal-generation-on-clip-via","slug":"enabling-multimodal-generation-on-clip-via","title":"Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-bias-in-visual-question-answering-a","title":"Language bias in Visual Question Answering: A Survey and Taxonomy","date":"2021-11-16","arxiv_id":"2111.08531","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-led-semantic-structure-enhanced","title":"Question-Led Semantic Structure Enhanced Attentions for VQA","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-based-visual-question-answering","title":"Uncertainty-based Visual Question Answering: Estimating Semantic Inconsistency between Image and Knowledge Base","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"viquae-a-dataset-for-knowledge-based-visual","title":"ViQuAE, a Dataset for Knowledge-based Visual Question Answering about Named Entities","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-relation-transformer-incorporating","title":"Graph Relation Transformer: Incorporating pairwise object features into the Transformer architecture","date":"2021-11-11","arxiv_id":"2111.06075","repositories_listed":0,"syntology":null},{"url":null,"slug":"icdar-2021-competition-on-document","title":"ICDAR 2021 Competition on Document VisualQuestion Answering","date":"2021-11-10","arxiv_id":"2111.05547","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-based-on-formal","title":"Visual Question Answering based on Formal Logic","date":"2021-11-08","arxiv_id":"2111.04785","repositories_listed":0,"syntology":null},{"url":null,"slug":"crossvqa-scalably-generating-benchmarks-for","title":"CrossVQA: Scalably Generating Benchmarks for Systematically Testing VQA Generalization","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"diversity-and-consistency-exploring-visual","title":"Diversity and Consistency: Exploring Visual Question-Answer Pair Generation","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"subtleties-in-the-trainability-of-quantum","title":"Subtleties in the trainability of quantum machine learning models","date":"2021-10-27","arxiv_id":"2110.14753","repositories_listed":0,"syntology":null},{"url":null,"slug":"single-modal-entropy-based-active-learning","title":"Single-Modal Entropy based Active Learning for Visual Question Answering","date":"2021-10-21","arxiv_id":"2110.10906","repositories_listed":0,"syntology":null},{"url":null,"slug":"come-again-re-query-in-referring-expression","title":"Evaluating and Improving Interactions with Hazy Oracles","date":"2021-10-19","arxiv_id":"2110.10206","repositories_listed":0,"syntology":null},{"url":null,"slug":"explore-before-moving-a-feasible-path","title":"Explore before Moving: A Feasible Path Estimation and Memory Recalling Framework for Embodied Navigation","date":"2021-10-16","arxiv_id":"2110.08571","repositories_listed":0,"syntology":null},{"url":null,"slug":"xgqa-cross-lingual-visual-question-answering-1","title":"xGQA: Cross-Lingual Visual Question Answering","date":"2021-10-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"guiding-visual-question-generation","title":"Guiding Visual Question Generation","date":"2021-10-15","arxiv_id":"2110.08226","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-users-mental-model-with-attention","title":"Improving Users' Mental Model with Attention-directed Counterfactual Edits","date":"2021-10-13","arxiv_id":"2110.06863","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmiu-dataset-for-visual-intent-understanding","title":"MMIU: Dataset for Visual Intent Understanding in Multimodal Assistants","date":"2021-10-13","arxiv_id":"2110.06416","repositories_listed":0,"syntology":null},{"url":null,"slug":"asking-questions-on-handwritten-document","title":"Asking questions on handwritten document collections","date":"2021-10-02","arxiv_id":"2110.00711","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-down-questions-for-outside-knowledge","title":"Breaking Down Questions for Outside-Knowledge VQA","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"crossformer-transformer-with-alternated-cross","title":"Crossformer: Transformer with Alternated Cross-Layer Guidance","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"how-much-can-clip-benefit-vision-and-language-1","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-clevrness-black-box-testing-of","title":"Measuring CLEVRness: Black-box Testing of Visual Reasoning Models","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"prnet-a-progressive-regression-network-for-no","title":"PRNet: A Progressive Regression Network for No-Reference User-Generated-Content Video Quality Assessment","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-disentangled-attention-for","title":"Variational Disentangled Attention for Regularized Visual Dialog","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/high-frame-rate-video-quality-assessment","slug":"high-frame-rate-video-quality-assessment","title":"High Frame Rate Video Quality Assessment using VMAF and Entropic Differences","date":"2021-09-27","arxiv_id":"2109.12785","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-integration-of-human-like","title":"Multimodal Integration of Human-Like Attention in Visual Question Answering","date":"2021-09-27","arxiv_id":"2109.13139","repositories_listed":0,"syntology":null},{"url":"/paper/vqa-mhug-a-gaze-dataset-to-study-multimodal","slug":"vqa-mhug-a-gaze-dataset-to-study-multimodal","title":"VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering","date":"2021-09-27","arxiv_id":"2109.13116","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-find-a-good-image-text-embedding-for","title":"How to find a good image-text embedding for remote sensing visual question answering?","date":"2021-09-24","arxiv_id":"2109.11848","repositories_listed":0,"syntology":null},{"url":"/paper/towards-developing-a-multilingual-and-code","slug":"towards-developing-a-multilingual-and-code","title":"Towards Developing a Multilingual and Code-Mixed Visual Question Answering System by Knowledge Distillation","date":"2021-09-10","arxiv_id":"2109.04653","repositories_listed":0,"syntology":null},{"url":null,"slug":"txt-crossmodal-end-to-end-learning-with","title":"TxT: Crossmodal End-to-End Learning with Transformers","date":"2021-09-09","arxiv_id":"2109.04422","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-quantum-neural-networks-methods","title":"A review of Quantum Neural Networks: Methods, Models, Dilemma","date":"2021-09-04","arxiv_id":"2109.01840","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-relative-spatial-reasoning","title":"Weakly Supervised Relative Spatial Reasoning for Visual Question Answering","date":"2021-09-04","arxiv_id":"2109.01934","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-significance-of-question-encoder","title":"On the Significance of Question Encoder Sequence Model in the Out-of-Distribution Performance in Visual Question Answering","date":"2021-08-28","arxiv_id":"2108.12585","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-parsing-network-for-image-captioning-and","title":"Auto-Parsing Network for Image Captioning and Visual Question Answering","date":"2021-08-24","arxiv_id":"2108.10568","repositories_listed":0,"syntology":null},{"url":null,"slug":"external-knowledge-augmented-text-visual","title":"EKTVQA: Generalized use of External Knowledge to empower Scene Text in Text-VQA","date":"2021-08-22","arxiv_id":"2108.09717","repositories_listed":0,"syntology":null},{"url":null,"slug":"starvqa-space-time-attention-for-video","title":"StarVQA: Space-Time Attention for Video Quality Assessment","date":"2021-08-22","arxiv_id":"2108.09635","repositories_listed":0,"syntology":null},{"url":null,"slug":"localize-group-and-select-boosting-text-vqa","title":"Localize, Group, and Select: Boosting Text-VQA by Scene Text Modeling","date":"2021-08-20","arxiv_id":"2108.08965","repositories_listed":0,"syntology":null},{"url":null,"slug":"valse-a-task-independent-benchmark-for-vision","title":"VALSE: A Task-Independent Benchmark for Vision and Language Models centered on Linguistic Phenomena","date":"2021-08-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"in-factuality-efficient-integration-of","title":"In Factuality: Efficient Integration of Relevant Facts for Visual Question Answering","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"li-yong-tu-xiang-miao-shu-yu-zhi-shi-tu-pu","title":"利用图像描述与知识图谱增强表示的视觉问答(Exploiting Image Captions and External Knowledge as Representation Enhancement for Visual Question Answering)","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"lrra-a-transparent-neural-symbolic-reasoning","title":"LRRA:A Transparent Neural-Symbolic Reasoning Framework for Real-World Visual Question Answering","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-visual-question-answering-on","title":"Towards Visual Question Answering on Pathology Images","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"muvam-a-multi-view-attention-based-model-for","title":"MuVAM: A Multi-View Attention-based Model for Medical Visual Question Answering","date":"2021-07-07","arxiv_id":"2107.03216","repositories_listed":0,"syntology":null},{"url":null,"slug":"adventurer-s-treasure-hunt-a-transparent","title":"Adventurer's Treasure Hunt: A Transparent System for Visually Grounded Compositional Visual Question Answering based on Scene Graphs","date":"2021-06-28","arxiv_id":"2106.14476","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-picture-may-be-worth-a-hundred-words-for","title":"A Picture May Be Worth a Hundred Words for Visual Question Answering","date":"2021-06-25","arxiv_id":"2106.13445","repositories_listed":0,"syntology":null},{"url":"/paper/multimodal-few-shot-learning-with-frozen","slug":"multimodal-few-shot-learning-with-frozen","title":"Multimodal Few-Shot Learning with Frozen Language Models","date":"2021-06-25","arxiv_id":"2106.13884","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-inter-modality-visual-parsing-with","title":"Probing Inter-modality: Visual Parsing with Self-Attention for Vision-Language Pre-training","date":"2021-06-25","arxiv_id":"2106.13488","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-transformer-based-cross-modal-fusion-model","title":"A Transformer-based Cross-modal Fusion Model with Adversarial Training for VQA Challenge 2021","date":"2021-06-24","arxiv_id":"2106.13033","repositories_listed":0,"syntology":null},{"url":null,"slug":"fovqa-blind-foveated-video-quality-assessment","title":"FOVQA: Blind Foveated Video Quality Assessment","date":"2021-06-24","arxiv_id":"2106.13328","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqa-aid-visual-question-answering-for-post","title":"VQA-Aid: Visual Question Answering for Post-Disaster Damage Assessment and Analysis","date":"2021-06-19","arxiv_id":"2106.10548","repositories_listed":0,"syntology":null},{"url":"/paper/assessment-of-subjective-and-objective","slug":"assessment-of-subjective-and-objective","title":"Assessment of Subjective and Objective Quality of Live Streaming Sports Videos","date":"2021-06-15","arxiv_id":"2106.08431","repositories_listed":0,"syntology":null},{"url":null,"slug":"supervising-the-transfer-of-reasoning","title":"Supervising the Transfer of Reasoning Patterns in VQA","date":"2021-06-10","arxiv_id":"2106.05597","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-attention-belief-networks","title":"Bayesian Attention Belief Networks","date":"2021-06-09","arxiv_id":"2106.05251","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-vqa-systems-rad-measuring-robustness-to","title":"Are VQA Systems RAD? Measuring Robustness to Augmented Data with Focused Interventions","date":"2021-06-08","arxiv_id":"2106.04484","repositories_listed":0,"syntology":null},{"url":null,"slug":"pam-understanding-product-images-in-cross","title":"PAM: Understanding Product Images in Cross Product Category Attribute Extraction","date":"2021-06-08","arxiv_id":"2106.04630","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-adversarial-visual-question-answering","title":"Human-Adversarial Visual Question Answering","date":"2021-06-04","arxiv_id":"2106.02280","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounding-complex-navigational-instructions","title":"Grounding Complex Navigational Instructions Using Scene Graphs","date":"2021-06-03","arxiv_id":"2106.01607","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-vqa-a-new-benchmark-for","title":"Adversarial VQA: A New Benchmark for Evaluating the Robustness of VQA Models","date":"2021-06-01","arxiv_id":"2106.00245","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-select-question-relevant","title":"Learning to Select Question-Relevant Relations for Visual Question Answering","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mimoqa-multimodal-input-multimodal-output","title":"MIMOQA: Multimodal Input Multimodal Output Question Answering","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"minivqa-a-resource-to-build-your-tailored-vqa","title":"MiniVQA - A resource to build your tailored VQA competition","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-aligned-multi-modal-transformer-for","title":"Semantic Aligned Multi-modal Transformer for Vision-LanguageUnderstanding: A Preliminary Study on Visual QA","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/probing-inter-modality-visual-parsing-with-1","slug":"probing-inter-modality-visual-parsing-with-1","title":"Probing Inter-modality: Visual Parsing with Self-Attention for Vision-and-Language Pre-training","date":"2021-05-21","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-visual-semantic-embedding-methods","title":"Survey of Visual-Semantic Embedding Methods for Zero-Shot Image Retrieval","date":"2021-05-16","arxiv_id":"2105.07391","repositories_listed":0,"syntology":null},{"url":null,"slug":"show-why-the-answer-is-correct-towards","title":"Show Why the Answer is Correct! Towards Explainable AI using Compositional Temporal Attention","date":"2021-05-15","arxiv_id":"2105.07141","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-generative-augmentation-for","title":"Cross-Modal Generative Augmentation for Visual Question Answering","date":"2021-05-11","arxiv_id":"2105.04780","repositories_listed":0,"syntology":null},{"url":null,"slug":"proposal-free-one-stage-referring-expression","title":"Proposal-free One-stage Referring Expression via Grid-Word Cross-Attention","date":"2021-05-05","arxiv_id":"2105.02061","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterated-learning-for-emergent-systematicity-1","title":"Iterated learning for emergent systematicity in VQA","date":"2021-05-03","arxiv_id":"2105.01119","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-vqa-datasets-and-approaches","title":"A survey on VQA_Datasets and Approaches","date":"2021-05-02","arxiv_id":"2105.00421","repositories_listed":0,"syntology":null},{"url":null,"slug":"chop-chop-bert-visual-question-answering-by","title":"Chop Chop BERT: Visual Question Answering by Chopping VisualBERT's Heads","date":"2021-04-30","arxiv_id":"2104.14741","repositories_listed":0,"syntology":null},{"url":"/paper/document-collection-visual-question-answering","slug":"document-collection-visual-question-answering","title":"Document Collection Visual Question Answering","date":"2021-04-27","arxiv_id":"2104.14336","repositories_listed":0,"syntology":null},{"url":"/paper/infographicvqa","slug":"infographicvqa","title":"InfographicVQA","date":"2021-04-26","arxiv_id":"2104.12756","repositories_listed":0,"syntology":null},{"url":null,"slug":"playing-lottery-tickets-with-vision-and","title":"Playing Lottery Tickets with Vision and Language","date":"2021-04-23","arxiv_id":"2104.11832","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-retrieval-augmentation-for-multi-1","title":"Cross-Modal Retrieval Augmentation for Multi-Modal Classification","date":"2021-04-16","arxiv_id":"2104.08108","repositories_listed":0,"syntology":null},{"url":null,"slug":"vgnmn-video-grounded-neural-module-network-to","title":"VGNMN: Video-grounded Neural Module Network to Video-Grounded Language Tasks","date":"2021-04-16","arxiv_id":"2104.07921","repositories_listed":0,"syntology":null},{"url":null,"slug":"jointly-learning-truth-conditional","title":"Jointly Learning Truth-Conditional Denotations and Groundings using Parallel Attention","date":"2021-04-14","arxiv_id":"2104.06645","repositories_listed":0,"syntology":null},{"url":null,"slug":"dealing-with-missing-modalities-in-the-visual","title":"Dealing with Missing Modalities in the Visual Question Answer-Difference Prediction Task through Knowledge Distillation","date":"2021-04-13","arxiv_id":"2104.05965","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuro-symbolic-vqa-a-review-from-the","title":"Neuro-Symbolic VQA: A review from the perspective of AGI desiderata","date":"2021-04-13","arxiv_id":"2104.06365","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-transferable-are-reasoning-patterns-in","title":"How Transferable are Reasoning Patterns in VQA?","date":"2021-04-08","arxiv_id":"2104.03656","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-continuous-visual-attention","title":"Multimodal Continuous Visual Attention Mechanisms","date":"2021-04-07","arxiv_id":"2104.03046","repositories_listed":0,"syntology":null},{"url":null,"slug":"compressing-visual-linguistic-model-via","title":"Compressing Visual-linguistic Model via Knowledge Distillation","date":"2021-04-05","arxiv_id":"2104.02096","repositories_listed":0,"syntology":null},{"url":null,"slug":"just-because-you-are-right-doesn-t-mean-i-am-1","title":"`Just because you are right, doesn't mean I am wrong': Overcoming a bottleneck in development and evaluation of Open-Ended VQA tasks","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uc2-universal-cross-lingual-cross-modal","title":"UC2: Universal Cross-lingual Cross-modal Vision-and-Language Pre-training","date":"2021-04-01","arxiv_id":"2104.00332","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-on-image-set-visual-question","title":"Analysis on Image Set Visual Question Answering","date":"2021-03-31","arxiv_id":"2104.00107","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-robust-vqa-with-diverse-datasets-and","title":"Domain-robust VQA with diverse datasets and methods but no target labels","date":"2021-03-29","arxiv_id":"2103.15974","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowing-what-vqa-does-not-pointing-to-error","title":"Generating and Evaluating Explanations of Attended and Error-Inducing Input Regions for VQA Models","date":"2021-03-26","arxiv_id":"2103.14712","repositories_listed":0,"syntology":null}],"record_sha256":"2f9cb82569ef9144bc6478fc17c4dd17eb2c6c68916a315edfc09176a29890c4","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}