{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering/papers/21","list_of":"/task/visual-question-answering","task":"Visual Question Answering (VQA)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":21,"pages_in_order":22,"rows_per_page":100,"rows":[2001,2100],"of":2167,"counts":{"archive_papers_tagged":2167,"with_a_code_link":1039,"where_syntology_ran_a_sample":359,"not_listed_spam_title":0,"listed":2167,"listed_where_code_ran":359,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":287,"every_run_a_failure_of_syntologys_instrument":72,"listed_with_a_run_with_no_instrument_failure":287,"listed_every_run_a_failure_of_syntologys_instrument":72,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering","prev":"/task/visual-question-answering/papers/20","next":"/task/visual-question-answering/papers/22","papers":[{"url":null,"slug":"text-guided-person-image-synthesis","title":"Text Guided Person Image Synthesis","date":"2019-04-10","arxiv_id":"1904.05118","repositories_listed":0,"syntology":null},{"url":null,"slug":"actively-seeking-and-learning-from-live-data","title":"Actively Seeking and Learning from Live Data","date":"2019-04-05","arxiv_id":"1904.02865","repositories_listed":0,"syntology":null},{"url":null,"slug":"lucid-explanations-help-using-a-human-ai","title":"Can You Explain That? Lucid Explanations Help Human-AI Collaborative Image Retrieval","date":"2019-04-05","arxiv_id":"1904.03285","repositories_listed":0,"syntology":null},{"url":"/paper/mmed-a-multi-domain-and-multi-modality-event","slug":"mmed-a-multi-domain-and-multi-modality-event","title":"MMED: A Multi-domain and Multi-modality Event Dataset","date":"2019-04-04","arxiv_id":"1904.02354","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-query-answering-by-entity-attribute","title":"Visual Query Answering by Entity-Attribute Graph Matching and Reasoning","date":"2019-03-16","arxiv_id":"1903.06994","repositories_listed":0,"syntology":null},{"url":"/paper/raven-a-dataset-for-relational-and-analogical","slug":"raven-a-dataset-for-relational-and-analogical","title":"RAVEN: A Dataset for Relational and Analogical Visual rEasoNing","date":"2019-03-07","arxiv_id":"1903.02741","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-neural-symbolic-models-for","title":"Probabilistic Neural-symbolic Models for Interpretable Visual Question Answering","date":"2019-02-21","arxiv_id":"1902.07864","repositories_listed":0,"syntology":null},{"url":null,"slug":"cycle-consistency-for-robust-visual-question","title":"Cycle-Consistency for Robust Visual Question Answering","date":"2019-02-15","arxiv_id":"1902.05660","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-natural-language-explanations-for","title":"Generating Natural Language Explanations for Visual Question Answering using Scene Graphs and Visual Attention","date":"2019-02-15","arxiv_id":"1902.05715","repositories_listed":0,"syntology":null},{"url":null,"slug":"taking-a-hint-leveraging-explanations-to-make","title":"Taking a HINT: Leveraging Explanations to Make Vision and Language Models More Grounded","date":"2019-02-11","arxiv_id":"1902.03751","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-visual-relationships-for-high","title":"VrR-VG: Refocusing Visually-Relevant Relationships","date":"2019-02-01","arxiv_id":"1902.00313","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-meaning-of-most-for-visual-question","title":"The meaning of \"most\" for visual question answering models","date":"2018-12-31","arxiv_id":"1812.11737","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-learning-with-prior-visual","title":"Scene Graph Reasoning with Prior Visual Relationship for Visual Question Answering","date":"2018-12-23","arxiv_id":"1812.09681","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-fusion-with-intra-and-inter-modality","title":"Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering","date":"2018-12-13","arxiv_id":"1812.05252","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-knowledge-distillation-to-aid-visual","title":"Spatial Knowledge Distillation to aid Visual Reasoning","date":"2018-12-10","arxiv_id":"1812.03631","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-learning-of-hierarchical-vision","title":"Multi-task Learning of Hierarchical Vision-Language Representation","date":"2018-12-03","arxiv_id":"1812.00500","repositories_listed":0,"syntology":null},{"url":null,"slug":"chain-of-reasoning-for-visual-question","title":"Chain of Reasoning for Visual Question Answering","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-specialize-with-knowledge","title":"Learning to Specialize with Knowledge Distillation for Visual Question Answering","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"from-known-to-the-unknown-transferring","title":"From Known to the Unknown: Transferring Knowledge to Answer Questions about Novel Visual and Semantic Concepts","date":"2018-11-30","arxiv_id":"1811.12772","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-as-reading","title":"Visual Question Answering as Reading Comprehension","date":"2018-11-29","arxiv_id":"1811.11903","repositories_listed":0,"syntology":null},{"url":"/paper/a-dataset-of-clinically-generated-visual","slug":"a-dataset-of-clinically-generated-visual","title":"A dataset of clinically generated visual questions and answers about radiology images","date":"2018-11-20","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"explicit-bias-discovery-in-visual-question","title":"Explicit Bias Discovery in Visual Question Answering Models","date":"2018-11-19","arxiv_id":"1811.07789","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-transfer-vqa-dataset","title":"Zero-Shot Transfer VQA Dataset","date":"2018-11-02","arxiv_id":"1811.00692","repositories_listed":0,"syntology":null},{"url":null,"slug":"out-of-the-box-reasoning-with-graph","title":"Out of the Box: Reasoning with Graph Convolution Nets for Factual Visual Question Answering","date":"2018-11-01","arxiv_id":"1811.00538","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-attention-networks-for","title":"Compositional Attention Networks for Interpretability in Natural Language Question Answering","date":"2018-10-30","arxiv_id":"1810.12698","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-explanations-make-vqa-models-more","title":"Do Explanations make VQA Models more Predictable to a Human?","date":"2018-10-29","arxiv_id":"1810.12366","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowing-where-to-look-analysis-on-attention","title":"Knowing Where to Look? Analysis on Attention of Visual Question Answering System","date":"2018-10-09","arxiv_id":"1810.03821","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-language-priors-in-visual-question","title":"Overcoming Language Priors in Visual Question Answering with Adversarial Regularization","date":"2018-10-08","arxiv_id":"1810.03649","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-differential-network-for-visual-1","title":"Multimodal Differential Network for Visual Question Generation","date":"2018-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"convolutional-neural-networks-for-video","title":"Convolutional Neural Networks for Video Quality Assessment","date":"2018-09-26","arxiv_id":"1809.10117","repositories_listed":0,"syntology":null},{"url":null,"slug":"textually-enriched-neural-module-networks-for","title":"Textually Enriched Neural Module Networks for Visual Question Answering","date":"2018-09-23","arxiv_id":"1809.08697","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-wisdom-of-masses-majority-subjectivity","title":"The Wisdom of MaSSeS: Majority, Subjectivity, and Semantic Similarity in the Evaluation of VQA","date":"2018-09-12","arxiv_id":"1809.04344","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-visual-question-answering-by","title":"Interpretable Visual Question Answering by Reasoning on Dependency Trees","date":"2018-09-06","arxiv_id":"1809.01810","repositories_listed":0,"syntology":null},{"url":null,"slug":"straight-to-the-facts-learning-knowledge-base","title":"Straight to the Facts: Learning Knowledge Base Retrieval for Factual Visual Question Answering","date":"2018-09-04","arxiv_id":"1809.01124","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-attention-neural-tensor-network-for","title":"Deep Attention Neural Tensor Network for Visual Question Answering","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-video-quality-assessor-from-spatio","title":"Deep Video Quality Assessor: From Spatio-temporal Visual Sensitivity to A Convolutional Neural Aggregation Network","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/question-guided-hybrid-convolution-for-visual","slug":"question-guided-hybrid-convolution-for-visual","title":"Question-Guided Hybrid Convolution for Visual Question Answering","date":"2018-08-08","arxiv_id":"1808.02632","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-framework-for","title":"A Reinforcement Learning Framework for Natural Question Generation using Bi-discriminators","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-visual-question-answering-by-1","title":"Interpretable Visual Question Answering by Visual Grounding from Attention Supervision Mining","date":"2018-08-01","arxiv_id":"1808.00265","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-dataset-for","title":"Visual Question Answering Dataset for Bilingual Image Understanding: A Study of Cross-Lingual Transfer Using Attention Maps","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"question-relevance-in-visual-question","title":"Question Relevance in Visual Question Answering","date":"2018-07-23","arxiv_id":"1807.08435","repositories_listed":0,"syntology":null},{"url":null,"slug":"connecting-language-and-vision-to-actions","title":"Connecting Language and Vision to Actions","date":"2018-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-neural-machine-translation-for-low","title":"Multimodal Neural Machine Translation for Low-resource Language Pairs using Synthetic Data","date":"2018-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pushing-the-limits-of-radiology-with-joint","title":"Pushing the Limits of Radiology with Joint Modeling of Visual and Textual Information","date":"2018-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-visual-knowledge-memory-networks-for","title":"Learning Visual Knowledge Memory Networks for Visual Question Answering","date":"2018-06-13","arxiv_id":"1806.04860","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-dataset-adaptation-for-visual-question","title":"Cross-Dataset Adaptation for Visual Question Answering","date":"2018-06-10","arxiv_id":"1806.03726","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-answer-embeddings-for-visual","title":"Learning Answer Embeddings for Visual Question Answering","date":"2018-06-10","arxiv_id":"1806.03724","repositories_listed":0,"syntology":null},{"url":null,"slug":"cs-vqa-visual-question-answering-with","title":"CS-VQA: Visual Question Answering with Compressively Sensed Images","date":"2018-06-08","arxiv_id":"1806.03379","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-flip-side-identifying-counterexamples","title":"On the Flip Side: Identifying Counterexamples in Visual Question Answering","date":"2018-06-03","arxiv_id":"1806.00857","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-evaluation-of-image-based-verb-prediction","title":"An Evaluation of Image-Based Verb Prediction Models against Human Eye-Tracking Data","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"categorizing-concepts-with-basic-level-for","title":"Categorizing Concepts With Basic Level for Vision-to-Language","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stacked-latent-attention-for-multimodal","title":"Stacked Latent Attention for Multimodal Reasoning","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stacking-with-auxiliary-features-for-visual","title":"Stacking with Auxiliary Features for Visual Question Answering","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"visually-guided-spatial-relation-extraction","title":"Visually Guided Spatial Relation Extraction from Text","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperbolic-attention-networks","title":"Hyperbolic Attention Networks","date":"2018-05-24","arxiv_id":"1805.09786","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-image-captioning-and-question-answering","title":"Joint Image Captioning and Question Answering","date":"2018-05-22","arxiv_id":"1805.08389","repositories_listed":0,"syntology":null},{"url":null,"slug":"reproducibility-report-for-learning-to-count","title":"Reproducibility Report for \"Learning To Count Objects In Natural Images For Visual Question Answering\"","date":"2018-05-21","arxiv_id":"1805.08174","repositories_listed":0,"syntology":null},{"url":null,"slug":"reciprocal-attention-fusion-for-visual","title":"Reciprocal Attention Fusion for Visual Question Answering","date":"2018-05-11","arxiv_id":"1805.04247","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-verb-corpus","title":"Action Verb Corpus","date":"2018-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"augmenting-image-question-answering-dataset","title":"Augmenting Image Question Answering Dataset by Exploiting Image Captions","date":"2018-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"edit-me-a-corpus-and-a-framework-for","title":"Edit me: A Corpus and a Framework for Understanding Natural Language Image Editing","date":"2018-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-scene-text-verification-with","title":"Large Scale Scene Text Verification with Guided Attention","date":"2018-04-23","arxiv_id":"1804.08588","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-type-guided-attention-in-visual","title":"Question Type Guided Attention in Visual Question Answering","date":"2018-04-06","arxiv_id":"1804.02088","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-reasoning-on-general","title":"Visual Question Reasoning on General Dependency Tree","date":"2018-03-31","arxiv_id":"1804.00105","repositories_listed":0,"syntology":null},{"url":"/paper/ddrprog-a-clevr-differentiable-dynamic","slug":"ddrprog-a-clevr-differentiable-dynamic","title":"DDRprog: A CLEVR Differentiable Dynamic Reasoning Programmer","date":"2018-03-30","arxiv_id":"1803.11361","repositories_listed":0,"syntology":null},{"url":"/paper/motion-appearance-co-memory-networks-for","slug":"motion-appearance-co-memory-networks-for","title":"Motion-Appearance Co-Memory Networks for Video Question Answering","date":"2018-03-29","arxiv_id":"1803.10906","repositories_listed":0,"syntology":null},{"url":"/paper/two-can-play-this-game-visual-dialog-with","slug":"two-can-play-this-game-visual-dialog-with","title":"Two can play this Game: Visual Dialog with Discriminative Question Generation and Answering","date":"2018-03-29","arxiv_id":"1803.11186","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-hadamard-product-fusion-operators","title":"Generalized Hadamard-Product Fusion Operators for Visual Question Answering","date":"2018-03-26","arxiv_id":"1803.09374","repositories_listed":0,"syntology":null},{"url":null,"slug":"explicit-reasoning-over-end-to-end-neural","title":"Explicit Reasoning over End-to-End Neural Architectures for Visual Question Answering","date":"2018-03-23","arxiv_id":"1803.08896","repositories_listed":0,"syntology":null},{"url":"/paper/vqa-e-explaining-elaborating-and-enhancing","slug":"vqa-e-explaining-elaborating-and-enhancing","title":"VQA-E: Explaining, Elaborating, and Enhancing Your Answers for Visual Questions","date":"2018-03-20","arxiv_id":"1803.07464","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-visual-question-answering-a-new","title":"Inverse Visual Question Answering: A New Benchmark and VQA Diagnosis Tool","date":"2018-03-16","arxiv_id":"1803.06936","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-triples-with-adversarial-networks","title":"Generating Triples with Adversarial Networks for Scene Graph Construction","date":"2018-02-07","arxiv_id":"1802.02598","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-based-reasoning-in-vqa","title":"Object-based reasoning in VQA","date":"2018-01-29","arxiv_id":"1801.09718","repositories_listed":0,"syntology":null},{"url":null,"slug":"tell-and-answer-towards-explainable-visual","title":"Tell-and-Answer: Towards Explainable Visual Question Answering using Attributes and Captions","date":"2018-01-27","arxiv_id":"1801.09041","repositories_listed":0,"syntology":null},{"url":null,"slug":"not-so-clevr-visual-relations-strain","title":"Not-So-CLEVR: Visual Relations Strain Feedforward Neural Networks","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/interpretable-counting-for-visual-question","slug":"interpretable-counting-for-visual-question","title":"Interpretable Counting for Visual Question Answering","date":"2017-12-23","arxiv_id":"1712.08697","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-explanations-from-hadamard-product-in","title":"Visual Explanations from Hadamard Product in Multimodal Deep Networks","date":"2017-12-18","arxiv_id":"1712.06228","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-by-asking-questions","title":"Learning by Asking Questions","date":"2017-12-04","arxiv_id":"1712.01238","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-external-knowledge-to-answer","title":"Incorporating External Knowledge to Answer Open-Domain Visual Questions with Dynamic Memory Networks","date":"2017-12-03","arxiv_id":"1712.00733","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-learning-and-reasoning-for-visual","title":"Multimodal Learning and Reasoning for Visual Question Answering","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hyper-dimensional-computing-for-a-visual","title":"Hyper-dimensional computing for a visual question-answering system that is trainable end-to-end","date":"2017-11-28","arxiv_id":"1711.10185","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-as-a-meta-learning","title":"Visual Question Answering as a Meta Learning Task","date":"2017-11-22","arxiv_id":"1711.08105","repositories_listed":0,"syntology":null},{"url":"/paper/are-you-talking-to-me-reasoned-visual-dialog","slug":"are-you-talking-to-me-reasoned-visual-dialog","title":"Are You Talking to Me? Reasoned Visual Dialog Generation through Adversarial Learning","date":"2017-11-21","arxiv_id":"1711.07613","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-beyond-the-image-space","title":"Adversarial Attacks Beyond the Image Space","date":"2017-11-20","arxiv_id":"1711.07183","repositories_listed":0,"syntology":null},{"url":null,"slug":"attentive-explanations-justifying-decisions-1","title":"Attentive Explanations: Justifying Decisions and Pointing to the Evidence (Extended Abstract)","date":"2017-11-17","arxiv_id":"1711.07373","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-framework-for-robustness-analysis-of","title":"A Novel Framework for Robustness Analysis of Visual QA Models","date":"2017-11-16","arxiv_id":"1711.06232","repositories_listed":0,"syntology":null},{"url":null,"slug":"ivqa-inverse-visual-question-answering","title":"iVQA: Inverse Visual Question Answering","date":"2017-10-10","arxiv_id":"1710.03370","repositories_listed":0,"syntology":null},{"url":null,"slug":"fooling-vision-and-language-models-despite","title":"Fooling Vision and Language Models Despite Localization and Attention Mechanism","date":"2017-09-25","arxiv_id":"1709.08693","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-recent-advances-in-visual-question","title":"Survey of Recent Advances in Visual Question Answering","date":"2017-09-24","arxiv_id":"1709.08203","repositories_listed":0,"syntology":null},{"url":"/paper/visual-reference-resolution-using-attention","slug":"visual-reference-resolution-using-attention","title":"Visual Reference Resolution using Attention Memory for Visual Dialog","date":"2017-09-23","arxiv_id":"1709.07992","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-generation-as-dual-task-of","title":"Visual Question Generation as Dual Task of Visual Question Answering","date":"2017-09-21","arxiv_id":"1709.07192","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-human-like-attention-supervision-in","title":"Exploring Human-like Attention Supervision in Visual Question Answering","date":"2017-09-19","arxiv_id":"1709.06308","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustness-analysis-of-visual-qa-models-by","title":"Robustness Analysis of Visual QA Models by Basic Questions","date":"2017-09-14","arxiv_id":"1709.04625","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-augmentation-for-visual-question","title":"Data Augmentation for Visual Question Answering","date":"2017-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"memory-augmented-neural-networks-for-natural","title":"Memory Augmented Neural Networks for Natural Language Processing","date":"2017-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sheffield-multimt-using-object-posterior","title":"Sheffield MultiMT: Using Object Posterior Predictions for Multimodal Machine Translation","date":"2017-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-language-understanding-with","title":"Spatial Language Understanding with Multimodal Graphs using Declarative Learning based Programming","date":"2017-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/learning-to-disambiguate-by-asking","slug":"learning-to-disambiguate-by-asking","title":"Learning to Disambiguate by Asking Discriminative Questions","date":"2017-08-09","arxiv_id":"1708.02760","repositories_listed":0,"syntology":null},{"url":null,"slug":"spectral-graph-based-method-of-multimodal","title":"Spectral Graph-Based Method of Multimodal Word Embedding","date":"2017-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-bilinear-pooling-with-cnns","title":"Improved Bilinear Pooling with CNNs","date":"2017-07-21","arxiv_id":"1707.06772","repositories_listed":0,"syntology":null}],"record_sha256":"1a9343390eccf00c59be967bf1a76df2dceb17d2378cafbaf394b266fdfb7914","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}