{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering-1/papers/22","list_of":"/task/visual-question-answering-1","task":"Visual Question Answering","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":22,"pages_in_order":22,"rows_per_page":100,"rows":[2101,2177],"of":2177,"counts":{"archive_papers_tagged":2177,"with_a_code_link":1042,"where_syntology_ran_a_sample":378,"not_listed_spam_title":0,"listed":2177,"listed_where_code_ran":378,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":308,"every_run_a_failure_of_syntologys_instrument":70,"listed_with_a_run_with_no_instrument_failure":308,"listed_every_run_a_failure_of_syntologys_instrument":70,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering-1","prev":"/task/visual-question-answering-1/papers/21","next":null,"papers":[{"url":null,"slug":"not-so-clevr-visual-relations-strain","title":"Not-So-CLEVR: Visual Relations Strain Feedforward Neural Networks","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/interpretable-counting-for-visual-question","slug":"interpretable-counting-for-visual-question","title":"Interpretable Counting for Visual Question Answering","date":"2017-12-23","arxiv_id":"1712.08697","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-explanations-from-hadamard-product-in","title":"Visual Explanations from Hadamard Product in Multimodal Deep Networks","date":"2017-12-18","arxiv_id":"1712.06228","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-by-asking-questions","title":"Learning by Asking Questions","date":"2017-12-04","arxiv_id":"1712.01238","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-external-knowledge-to-answer","title":"Incorporating External Knowledge to Answer Open-Domain Visual Questions with Dynamic Memory Networks","date":"2017-12-03","arxiv_id":"1712.00733","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-learning-and-reasoning-for-visual","title":"Multimodal Learning and Reasoning for Visual Question Answering","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hyper-dimensional-computing-for-a-visual","title":"Hyper-dimensional computing for a visual question-answering system that is trainable end-to-end","date":"2017-11-28","arxiv_id":"1711.10185","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-as-a-meta-learning","title":"Visual Question Answering as a Meta Learning Task","date":"2017-11-22","arxiv_id":"1711.08105","repositories_listed":0,"syntology":null},{"url":"/paper/are-you-talking-to-me-reasoned-visual-dialog","slug":"are-you-talking-to-me-reasoned-visual-dialog","title":"Are You Talking to Me? Reasoned Visual Dialog Generation through Adversarial Learning","date":"2017-11-21","arxiv_id":"1711.07613","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-beyond-the-image-space","title":"Adversarial Attacks Beyond the Image Space","date":"2017-11-20","arxiv_id":"1711.07183","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-framework-for-robustness-analysis-of","title":"A Novel Framework for Robustness Analysis of Visual QA Models","date":"2017-11-16","arxiv_id":"1711.06232","repositories_listed":0,"syntology":null},{"url":null,"slug":"ivqa-inverse-visual-question-answering","title":"iVQA: Inverse Visual Question Answering","date":"2017-10-10","arxiv_id":"1710.03370","repositories_listed":0,"syntology":null},{"url":null,"slug":"fooling-vision-and-language-models-despite","title":"Fooling Vision and Language Models Despite Localization and Attention Mechanism","date":"2017-09-25","arxiv_id":"1709.08693","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-recent-advances-in-visual-question","title":"Survey of Recent Advances in Visual Question Answering","date":"2017-09-24","arxiv_id":"1709.08203","repositories_listed":0,"syntology":null},{"url":"/paper/visual-reference-resolution-using-attention","slug":"visual-reference-resolution-using-attention","title":"Visual Reference Resolution using Attention Memory for Visual Dialog","date":"2017-09-23","arxiv_id":"1709.07992","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-generation-as-dual-task-of","title":"Visual Question Generation as Dual Task of Visual Question Answering","date":"2017-09-21","arxiv_id":"1709.07192","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-human-like-attention-supervision-in","title":"Exploring Human-like Attention Supervision in Visual Question Answering","date":"2017-09-19","arxiv_id":"1709.06308","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustness-analysis-of-visual-qa-models-by","title":"Robustness Analysis of Visual QA Models by Basic Questions","date":"2017-09-14","arxiv_id":"1709.04625","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-augmentation-for-visual-question","title":"Data Augmentation for Visual Question Answering","date":"2017-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"memory-augmented-neural-networks-for-natural","title":"Memory Augmented Neural Networks for Natural Language Processing","date":"2017-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/learning-to-disambiguate-by-asking","slug":"learning-to-disambiguate-by-asking","title":"Learning to Disambiguate by Asking Discriminative Questions","date":"2017-08-09","arxiv_id":"1708.02760","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-bilinear-pooling-with-cnns","title":"Improved Bilinear Pooling with CNNs","date":"2017-07-21","arxiv_id":"1707.06772","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-question-answering-via-attribute","title":"Video Question Answering via Attribute-Augmented Attention Network Learning","date":"2017-07-20","arxiv_id":"1707.06355","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-with-memory","title":"Visual Question Answering with Memory-Augmented Networks","date":"2017-07-17","arxiv_id":"1707.04968","repositories_listed":0,"syntology":null},{"url":"/paper/are-you-smarter-than-a-sixth-grader-textbook","slug":"are-you-smarter-than-a-sixth-grader-textbook","title":"Are You Smarter Than a Sixth Grader? Textbook Question Answering for Multimodal Machine Comprehension","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"kernel-pooling-for-convolutional-neural","title":"Kernel Pooling for Convolutional Neural Networks","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-acquisition-for-visual-question","title":"Knowledge Acquisition for Visual Question Answering via Iterative Querying","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-level-attention-networks-for-visual","title":"Multi-Level Attention Networks for Visual Question Answering","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"segmentation-guided-attention-networks-for","title":"Segmentation Guided Attention Networks for Visual Question Answering","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"compact-tensor-pooling-for-visual-question","title":"Compact Tensor Pooling for Visual Question Answering","date":"2017-06-20","arxiv_id":"1706.06706","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-evaluation-using-deep","title":"Deep learning evaluation using deep linguistic processing","date":"2017-06-05","arxiv_id":"1706.01322","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-visual-question-answering-datasets","title":"Survey of Visual Question Answering: Datasets and Techniques","date":"2017-05-10","arxiv_id":"1705.03865","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-forgettable-watcher-model-for-video","title":"The Forgettable-Watcher Model for Video Question Answering","date":"2017-05-03","arxiv_id":"1705.01253","repositories_listed":0,"syntology":null},{"url":null,"slug":"c-vqa-a-compositional-split-of-the-visual","title":"C-VQA: A Compositional Split of the Visual Question Answering (VQA) v1.0 Dataset","date":"2017-04-26","arxiv_id":"1704.08243","repositories_listed":0,"syntology":null},{"url":null,"slug":"being-negative-but-constructively-lessons","title":"Being Negative but Constructively: Lessons Learnt from Creating Better Visual Question Answering Datasets","date":"2017-04-24","arxiv_id":"1704.07121","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-evaluation-of-visual-question","title":"An Empirical Evaluation of Visual Question Answering for Novel Objects","date":"2017-04-08","arxiv_id":"1704.02516","repositories_listed":0,"syntology":null},{"url":null,"slug":"it-takes-two-to-tango-towards-theory-of-ais","title":"It Takes Two to Tango: Towards Theory of AI's Mind","date":"2017-04-03","arxiv_id":"1704.00717","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligned-image-word-representations-improve","title":"Aligned Image-Word Representations Improve Inductive Transfer Across Vision-Language Tasks","date":"2017-04-02","arxiv_id":"1704.00260","repositories_listed":0,"syntology":null},{"url":"/paper/an-analysis-of-visual-question-answering","slug":"an-analysis-of-visual-question-answering","title":"An Analysis of Visual Question Answering Algorithms","date":"2017-03-28","arxiv_id":"1703.09684","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-compact-bilinear-pooling-for-1","title":"Multimodal Compact Bilinear Pooling for Multimodal Neural Machine Translation","date":"2017-03-23","arxiv_id":"1703.08084","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-and-contextual-models-for-visual","title":"Recurrent and Contextual Models for Visual Question Answering","date":"2017-03-23","arxiv_id":"1703.08120","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqabq-visual-question-answering-by-basic","title":"VQABQ: Visual Question Answering by Basic Questions","date":"2017-03-19","arxiv_id":"1703.06492","repositories_listed":0,"syntology":null},{"url":null,"slug":"tree-memory-networks-for-modelling-long-term","title":"Tree Memory Networks for Modelling Long-term Temporal Dependencies","date":"2017-03-12","arxiv_id":"1703.04706","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-driven-visual-saliency-and-attention","title":"Task-driven Visual Saliency and Attention-based Visual Question Answering","date":"2017-02-22","arxiv_id":"1702.06700","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-vqa-machine-learning-how-to-use-existing","title":"The VQA-Machine: Learning How to Use Existing Vision Algorithms to Answer New Questions","date":"2016-12-16","arxiv_id":"1612.05386","repositories_listed":0,"syntology":null},{"url":null,"slug":"attentive-explanations-justifying-decisions","title":"Attentive Explanations: Justifying Decisions and Pointing to the Evidence","date":"2016-12-14","arxiv_id":"1612.04757","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-with-question","title":"Visual Question Answering with Question Representation Update (QRU)","date":"2016-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-visual-question-answering","title":"Zero-Shot Visual Question Answering","date":"2016-11-17","arxiv_id":"1611.05546","repositories_listed":0,"syntology":null},{"url":null,"slug":"proposing-plausible-answers-for-open-ended","title":"Proposing Plausible Answers for Open-ended Visual Question Answering","date":"2016-10-20","arxiv_id":"1610.06620","repositories_listed":0,"syntology":null},{"url":"/paper/the-color-of-the-cat-is-gray-1-million-full","slug":"the-color-of-the-cat-is-gray-1-million-full","title":"The Color of the Cat is Gray: 1 Million Full-Sentences Visual Question Answering (FSVQA)","date":"2016-09-21","arxiv_id":"1609.06657","repositories_listed":0,"syntology":null},{"url":"/paper/graph-structured-representations-for-visual","slug":"graph-structured-representations-for-visual","title":"Graph-Structured Representations for Visual Question Answering","date":"2016-09-19","arxiv_id":"1609.05600","repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-machine-intelligence-through-visual","title":"Measuring Machine Intelligence Through Visual Question Answering","date":"2016-08-31","arxiv_id":"1608.08716","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-transparent-ai-systems-interpreting","title":"Towards Transparent AI Systems: Interpreting Visual Question Answering Models","date":"2016-08-31","arxiv_id":"1608.08974","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-predicting-if-a-crowd-will","title":"Visual Question: Predicting If a Crowd Will Agree on the Answer","date":"2016-08-29","arxiv_id":"1608.08188","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-visual-madlibs-with-multiple-cues","title":"Solving Visual Madlibs with Multiple Cues","date":"2016-08-11","arxiv_id":"1608.03410","repositories_listed":0,"syntology":null},{"url":null,"slug":"annotation-methodologies-for-vision-and","title":"Annotation Methodologies for Vision and Language Dataset Creation","date":"2016-07-10","arxiv_id":"1607.02769","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-relevance-in-vqa-identifying-non","title":"Question Relevance in VQA: Identifying Non-Visual And False-Premise Questions","date":"2016-06-21","arxiv_id":"1606.06622","repositories_listed":0,"syntology":null},{"url":null,"slug":"dualnet-domain-invariant-network-for-visual","title":"DualNet: Domain-Invariant Network for Visual Question Answering","date":"2016-06-20","arxiv_id":"1606.06108","repositories_listed":0,"syntology":null},{"url":"/paper/fvqa-fact-based-visual-question-answering","slug":"fvqa-fact-based-visual-question-answering","title":"FVQA: Fact-based Visual Question Answering","date":"2016-06-17","arxiv_id":"1606.05433","repositories_listed":0,"syntology":null},{"url":"/paper/human-attention-in-visual-question-answering","slug":"human-attention-in-visual-question-answering","title":"Human Attention in Visual Question Answering: Do Humans and Deep Networks Look at the Same Regions?","date":"2016-06-17","arxiv_id":"1606.05589","repositories_listed":0,"syntology":null},{"url":"/paper/training-recurrent-answering-units-with-joint","slug":"training-recurrent-answering-units-with-joint","title":"Training Recurrent Answering Units with Joint Loss Minimization for VQA","date":"2016-06-12","arxiv_id":"1606.03647","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-attention-in-visual-question-answering-1","title":"Human Attention in Visual Question Answering: Do Humans and Deep Networks Look at the Same Regions?","date":"2016-06-11","arxiv_id":"1606.03556","repositories_listed":0,"syntology":null},{"url":null,"slug":"answer-type-prediction-for-visual-question","title":"Answer-Type Prediction for Visual Question Answering","date":"2016-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-visual-question-answering-for","title":"Leveraging Visual Question Answering for Image-Caption Ranking","date":"2016-05-04","arxiv_id":"1605.01379","repositories_listed":0,"syntology":null},{"url":"/paper/learning-models-for-actions-and-person-object","slug":"learning-models-for-actions-and-person-object","title":"Learning Models for Actions and Person-Object Interactions with Transfer to Question Answering","date":"2016-04-16","arxiv_id":"1604.04808","repositories_listed":0,"syntology":null},{"url":"/paper/a-focused-dynamic-attention-model-for-visual","slug":"a-focused-dynamic-attention-model-for-visual","title":"A Focused Dynamic Attention Model for Visual Question Answering","date":"2016-04-06","arxiv_id":"1604.01485","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-attention-models-for-sequence","title":"Neural Attention Models for Sequence Classification: Analysis and Application to Key Term Extraction and Dialogue Act Detection","date":"2016-03-31","arxiv_id":"1604.00077","repositories_listed":0,"syntology":null},{"url":"/paper/image-captioning-and-visual-question","slug":"image-captioning-and-visual-question","title":"Image Captioning and Visual Question Answering Based on Attributes and External Knowledge","date":"2016-03-09","arxiv_id":"1603.02814","repositories_listed":0,"syntology":null},{"url":"/paper/neural-self-talk-image-understanding-via","slug":"neural-self-talk-image-understanding-via","title":"Neural Self Talk: Image Understanding via Continuous Questioning and Answering","date":"2015-12-10","arxiv_id":"1512.03460","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-restricted-visual-turing-test-for-deep","title":"A Restricted Visual Turing Test for Deep Scene and Event Understanding","date":"2015-12-06","arxiv_id":"1512.01715","repositories_listed":0,"syntology":null},{"url":null,"slug":"where-to-look-focus-regions-for-visual","title":"Where To Look: Focus Regions for Visual Question Answering","date":"2015-11-23","arxiv_id":"1511.07394","repositories_listed":0,"syntology":null},{"url":null,"slug":"ask-me-anything-free-form-visual-question","title":"Ask Me Anything: Free-form Visual Question Answering Based on Knowledge from External Sources","date":"2015-11-22","arxiv_id":"1511.06973","repositories_listed":0,"syntology":null},{"url":null,"slug":"abc-cnn-an-attention-based-convolutional","title":"ABC-CNN: An Attention Based Convolutional Neural Network for Visual Question Answering","date":"2015-11-18","arxiv_id":"1511.05960","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-memory-for-visual-question","title":"Compositional Memory for Visual Question Answering","date":"2015-11-18","arxiv_id":"1511.05676","repositories_listed":0,"syntology":null},{"url":null,"slug":"yin-and-yang-balancing-and-answering-binary","title":"Yin and Yang: Balancing and Answering Binary Visual Questions","date":"2015-11-16","arxiv_id":"1511.05099","repositories_listed":0,"syntology":null},{"url":"/paper/visual7w-grounded-question-answering-in","slug":"visual7w-grounded-question-answering-in","title":"Visual7W: Grounded Question Answering in Images","date":"2015-11-11","arxiv_id":"1511.03416","repositories_listed":0,"syntology":null},{"url":null,"slug":"explicit-knowledge-based-reasoning-for-visual","title":"Explicit Knowledge-based Reasoning for Visual Question Answering","date":"2015-11-09","arxiv_id":"1511.02570","repositories_listed":0,"syntology":null}],"record_sha256":"e2f074529df12bc855889f95f1568fd2177c06500c56ba88a92b69ef99937868","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}