{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering/papers/22","list_of":"/task/visual-question-answering","task":"Visual Question Answering (VQA)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":22,"pages_in_order":22,"rows_per_page":100,"rows":[2101,2167],"of":2167,"counts":{"archive_papers_tagged":2167,"with_a_code_link":1039,"where_syntology_ran_a_sample":359,"not_listed_spam_title":0,"listed":2167,"listed_where_code_ran":359,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":287,"every_run_a_failure_of_syntologys_instrument":72,"listed_with_a_run_with_no_instrument_failure":287,"listed_every_run_a_failure_of_syntologys_instrument":72,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering","prev":"/task/visual-question-answering/papers/21","next":null,"papers":[{"url":null,"slug":"video-question-answering-via-attribute","title":"Video Question Answering via Attribute-Augmented Attention Network Learning","date":"2017-07-20","arxiv_id":"1707.06355","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-with-memory","title":"Visual Question Answering with Memory-Augmented Networks","date":"2017-07-17","arxiv_id":"1707.04968","repositories_listed":0,"syntology":null},{"url":"/paper/a-corpus-of-natural-language-for-visual","slug":"a-corpus-of-natural-language-for-visual","title":"A Corpus of Natural Language for Visual Reasoning","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/are-you-smarter-than-a-sixth-grader-textbook","slug":"are-you-smarter-than-a-sixth-grader-textbook","title":"Are You Smarter Than a Sixth Grader? Textbook Question Answering for Multimodal Machine Comprehension","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"kernel-pooling-for-convolutional-neural","title":"Kernel Pooling for Convolutional Neural Networks","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-acquisition-for-visual-question","title":"Knowledge Acquisition for Visual Question Answering via Iterative Querying","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-level-attention-networks-for-visual","title":"Multi-Level Attention Networks for Visual Question Answering","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-machine-learning-integrating","title":"Multimodal Machine Learning: Integrating Language, Vision and Speech","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"segmentation-guided-attention-networks-for","title":"Segmentation Guided Attention Networks for Visual Question Answering","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"compact-tensor-pooling-for-visual-question","title":"Compact Tensor Pooling for Visual Question Answering","date":"2017-06-20","arxiv_id":"1706.06706","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-evaluation-using-deep","title":"Deep learning evaluation using deep linguistic processing","date":"2017-06-05","arxiv_id":"1706.01322","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-visual-question-answering-datasets","title":"Survey of Visual Question Answering: Datasets and Techniques","date":"2017-05-10","arxiv_id":"1705.03865","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-forgettable-watcher-model-for-video","title":"The Forgettable-Watcher Model for Video Question Answering","date":"2017-05-03","arxiv_id":"1705.01253","repositories_listed":0,"syntology":null},{"url":null,"slug":"c-vqa-a-compositional-split-of-the-visual","title":"C-VQA: A Compositional Split of the Visual Question Answering (VQA) v1.0 Dataset","date":"2017-04-26","arxiv_id":"1704.08243","repositories_listed":0,"syntology":null},{"url":null,"slug":"being-negative-but-constructively-lessons","title":"Being Negative but Constructively: Lessons Learnt from Creating Better Visual Question Answering Datasets","date":"2017-04-24","arxiv_id":"1704.07121","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-evaluation-of-visual-question","title":"An Empirical Evaluation of Visual Question Answering for Novel Objects","date":"2017-04-08","arxiv_id":"1704.02516","repositories_listed":0,"syntology":null},{"url":null,"slug":"it-takes-two-to-tango-towards-theory-of-ais","title":"It Takes Two to Tango: Towards Theory of AI's Mind","date":"2017-04-03","arxiv_id":"1704.00717","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligned-image-word-representations-improve","title":"Aligned Image-Word Representations Improve Inductive Transfer Across Vision-Language Tasks","date":"2017-04-02","arxiv_id":"1704.00260","repositories_listed":0,"syntology":null},{"url":"/paper/an-analysis-of-visual-question-answering","slug":"an-analysis-of-visual-question-answering","title":"An Analysis of Visual Question Answering Algorithms","date":"2017-03-28","arxiv_id":"1703.09684","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-compact-bilinear-pooling-for-1","title":"Multimodal Compact Bilinear Pooling for Multimodal Neural Machine Translation","date":"2017-03-23","arxiv_id":"1703.08084","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-and-contextual-models-for-visual","title":"Recurrent and Contextual Models for Visual Question Answering","date":"2017-03-23","arxiv_id":"1703.08120","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqabq-visual-question-answering-by-basic","title":"VQABQ: Visual Question Answering by Basic Questions","date":"2017-03-19","arxiv_id":"1703.06492","repositories_listed":0,"syntology":null},{"url":null,"slug":"tree-memory-networks-for-modelling-long-term","title":"Tree Memory Networks for Modelling Long-term Temporal Dependencies","date":"2017-03-12","arxiv_id":"1703.04706","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-driven-visual-saliency-and-attention","title":"Task-driven Visual Saliency and Attention-based Visual Question Answering","date":"2017-02-22","arxiv_id":"1702.06700","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-and-language-integration-moving-beyond","title":"Vision and Language Integration: Moving beyond Objects","date":"2017-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-vqa-machine-learning-how-to-use-existing","title":"The VQA-Machine: Learning How to Use Existing Vision Algorithms to Answer New Questions","date":"2016-12-16","arxiv_id":"1612.05386","repositories_listed":0,"syntology":null},{"url":null,"slug":"attentive-explanations-justifying-decisions","title":"Attentive Explanations: Justifying Decisions and Pointing to the Evidence","date":"2016-12-14","arxiv_id":"1612.04757","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dataset-for-multimodal-question-answering","title":"A Dataset for Multimodal Question Answering in the Cultural Heritage Domain","date":"2016-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-development-of-multimodal-lexical","title":"The Development of Multimodal Lexical Resources","date":"2016-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-with-question","title":"Visual Question Answering with Question Representation Update (QRU)","date":"2016-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-visual-question-answering","title":"Zero-Shot Visual Question Answering","date":"2016-11-17","arxiv_id":"1611.05546","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-video-descriptions-to-learn-video","title":"Leveraging Video Descriptions to Learn Video Question Answering","date":"2016-11-12","arxiv_id":"1611.04021","repositories_listed":0,"syntology":null},{"url":null,"slug":"proposing-plausible-answers-for-open-ended","title":"Proposing Plausible Answers for Open-ended Visual Question Answering","date":"2016-10-20","arxiv_id":"1610.06620","repositories_listed":0,"syntology":null},{"url":"/paper/the-color-of-the-cat-is-gray-1-million-full","slug":"the-color-of-the-cat-is-gray-1-million-full","title":"The Color of the Cat is Gray: 1 Million Full-Sentences Visual Question Answering (FSVQA)","date":"2016-09-21","arxiv_id":"1609.06657","repositories_listed":0,"syntology":null},{"url":"/paper/graph-structured-representations-for-visual","slug":"graph-structured-representations-for-visual","title":"Graph-Structured Representations for Visual Question Answering","date":"2016-09-19","arxiv_id":"1609.05600","repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-machine-intelligence-through-visual","title":"Measuring Machine Intelligence Through Visual Question Answering","date":"2016-08-31","arxiv_id":"1608.08716","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-transparent-ai-systems-interpreting","title":"Towards Transparent AI Systems: Interpreting Visual Question Answering Models","date":"2016-08-31","arxiv_id":"1608.08974","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-predicting-if-a-crowd-will","title":"Visual Question: Predicting If a Crowd Will Agree on the Answer","date":"2016-08-29","arxiv_id":"1608.08188","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-visual-madlibs-with-multiple-cues","title":"Solving Visual Madlibs with Multiple Cues","date":"2016-08-11","arxiv_id":"1608.03410","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-shared-task-on-multimodal-machine","title":"A Shared Task on Multimodal Machine Translation and Crosslingual Image Description","date":"2016-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"alook-some-green-circlesa-learning-to","title":"``Look, some Green Circles!'': Learning to Quantify from Images","date":"2016-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"focused-evaluation-for-image-description-with","title":"Focused Evaluation for Image Description with Binary Forced-Choice Tasks","date":"2016-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"annotation-methodologies-for-vision-and","title":"Annotation Methodologies for Vision and Language Dataset Creation","date":"2016-07-10","arxiv_id":"1607.02769","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-relevance-in-vqa-identifying-non","title":"Question Relevance in VQA: Identifying Non-Visual And False-Premise Questions","date":"2016-06-21","arxiv_id":"1606.06622","repositories_listed":0,"syntology":null},{"url":null,"slug":"dualnet-domain-invariant-network-for-visual","title":"DualNet: Domain-Invariant Network for Visual Question Answering","date":"2016-06-20","arxiv_id":"1606.06108","repositories_listed":0,"syntology":null},{"url":"/paper/fvqa-fact-based-visual-question-answering","slug":"fvqa-fact-based-visual-question-answering","title":"FVQA: Fact-based Visual Question Answering","date":"2016-06-17","arxiv_id":"1606.05433","repositories_listed":0,"syntology":null},{"url":"/paper/human-attention-in-visual-question-answering","slug":"human-attention-in-visual-question-answering","title":"Human Attention in Visual Question Answering: Do Humans and Deep Networks Look at the Same Regions?","date":"2016-06-17","arxiv_id":"1606.05589","repositories_listed":0,"syntology":null},{"url":"/paper/training-recurrent-answering-units-with-joint","slug":"training-recurrent-answering-units-with-joint","title":"Training Recurrent Answering Units with Joint Loss Minimization for VQA","date":"2016-06-12","arxiv_id":"1606.03647","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-attention-in-visual-question-answering-1","title":"Human Attention in Visual Question Answering: Do Humans and Deep Networks Look at the Same Regions?","date":"2016-06-11","arxiv_id":"1606.03556","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-distorted-skull-lies-in-the-bottom-center","title":"``A Distorted Skull Lies in the Bottom Center...'' Identifying Paintings from Text Descriptions","date":"2016-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"answer-type-prediction-for-visual-question","title":"Answer-Type Prediction for Visual Question Answering","date":"2016-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-visual-question-answering-for","title":"Leveraging Visual Question Answering for Image-Caption Ranking","date":"2016-05-04","arxiv_id":"1605.01379","repositories_listed":0,"syntology":null},{"url":"/paper/learning-models-for-actions-and-person-object","slug":"learning-models-for-actions-and-person-object","title":"Learning Models for Actions and Person-Object Interactions with Transfer to Question Answering","date":"2016-04-16","arxiv_id":"1604.04808","repositories_listed":0,"syntology":null},{"url":"/paper/a-focused-dynamic-attention-model-for-visual","slug":"a-focused-dynamic-attention-model-for-visual","title":"A Focused Dynamic Attention Model for Visual Question Answering","date":"2016-04-06","arxiv_id":"1604.01485","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-attention-models-for-sequence","title":"Neural Attention Models for Sequence Classification: Analysis and Application to Key Term Extraction and Dialogue Act Detection","date":"2016-03-31","arxiv_id":"1604.00077","repositories_listed":0,"syntology":null},{"url":"/paper/image-captioning-and-visual-question","slug":"image-captioning-and-visual-question","title":"Image Captioning and Visual Question Answering Based on Attributes and External Knowledge","date":"2016-03-09","arxiv_id":"1603.02814","repositories_listed":0,"syntology":null},{"url":"/paper/neural-self-talk-image-understanding-via","slug":"neural-self-talk-image-understanding-via","title":"Neural Self Talk: Image Understanding via Continuous Questioning and Answering","date":"2015-12-10","arxiv_id":"1512.03460","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-restricted-visual-turing-test-for-deep","title":"A Restricted Visual Turing Test for Deep Scene and Event Understanding","date":"2015-12-06","arxiv_id":"1512.01715","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-you-talking-to-a-machine-dataset-and-1","title":"Are You Talking to a Machine? Dataset and Methods for Multilingual Image Question","date":"2015-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"where-to-look-focus-regions-for-visual","title":"Where To Look: Focus Regions for Visual Question Answering","date":"2015-11-23","arxiv_id":"1511.07394","repositories_listed":0,"syntology":null},{"url":null,"slug":"ask-me-anything-free-form-visual-question","title":"Ask Me Anything: Free-form Visual Question Answering Based on Knowledge from External Sources","date":"2015-11-22","arxiv_id":"1511.06973","repositories_listed":0,"syntology":null},{"url":null,"slug":"abc-cnn-an-attention-based-convolutional","title":"ABC-CNN: An Attention Based Convolutional Neural Network for Visual Question Answering","date":"2015-11-18","arxiv_id":"1511.05960","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-memory-for-visual-question","title":"Compositional Memory for Visual Question Answering","date":"2015-11-18","arxiv_id":"1511.05676","repositories_listed":0,"syntology":null},{"url":null,"slug":"yin-and-yang-balancing-and-answering-binary","title":"Yin and Yang: Balancing and Answering Binary Visual Questions","date":"2015-11-16","arxiv_id":"1511.05099","repositories_listed":0,"syntology":null},{"url":"/paper/visual7w-grounded-question-answering-in","slug":"visual7w-grounded-question-answering-in","title":"Visual7W: Grounded Question Answering in Images","date":"2015-11-11","arxiv_id":"1511.03416","repositories_listed":0,"syntology":null},{"url":null,"slug":"explicit-knowledge-based-reasoning-for-visual","title":"Explicit Knowledge-based Reasoning for Visual Question Answering","date":"2015-11-09","arxiv_id":"1511.02570","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-answer-questions-from-image-using","title":"Learning to Answer Questions From Image Using Convolutional Neural Network","date":"2015-06-01","arxiv_id":"1506.00333","repositories_listed":0,"syntology":null}],"record_sha256":"4ff6e336e90e67c51c26b57cf36337f8e56960977c967e3f5bc2c5df8ef04c91","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}