{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering-1/papers/21","list_of":"/task/visual-question-answering-1","task":"Visual Question Answering","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":21,"pages_in_order":22,"rows_per_page":100,"rows":[2001,2100],"of":2177,"counts":{"archive_papers_tagged":2177,"with_a_code_link":1042,"where_syntology_ran_a_sample":378,"not_listed_spam_title":0,"listed":2177,"listed_where_code_ran":378,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":308,"every_run_a_failure_of_syntologys_instrument":70,"listed_with_a_run_with_no_instrument_failure":308,"listed_every_run_a_failure_of_syntologys_instrument":70,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering-1","prev":"/task/visual-question-answering-1/papers/20","next":"/task/visual-question-answering-1/papers/22","papers":[{"url":null,"slug":"190910128","title":"Explainable High-order Visual Question Reasoning: A New Benchmark and Knowledge-routed Network","date":"2019-09-23","arxiv_id":"1909.10128","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-monotonic-logical-reasoning-guiding-deep","title":"Non-monotonic Logical Reasoning Guiding Deep Learning for Explainable Visual Question Answering","date":"2019-09-23","arxiv_id":"1909.10650","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-sparse-mixture-of-experts-for-visual","title":"Learning Sparse Mixture of Experts for Visual Question Answering","date":"2019-09-19","arxiv_id":"1909.09192","repositories_listed":0,"syntology":null},{"url":null,"slug":"triplet-aware-scene-graph-embeddings","title":"Triplet-Aware Scene Graph Embeddings","date":"2019-09-19","arxiv_id":"1909.09256","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-visual-question-answering-with-multi","title":"Inverse Visual Question Answering with Multi-Level Attentions","date":"2019-09-17","arxiv_id":"1909.07583","repositories_listed":0,"syntology":null},{"url":null,"slug":"sunny-and-dark-outside-improving-answer","title":"Sunny and Dark Outside?! Improving Answer Consistency in VQA through Entailed Question Generation","date":"2019-09-10","arxiv_id":"1909.04696","repositories_listed":0,"syntology":null},{"url":"/paper/decoupled-box-proposal-and-featurization-with","slug":"decoupled-box-proposal-and-featurization-with","title":"Decoupled Box Proposal and Featurization with Ultrafine-Grained Semantic Labels Improve Image Captioning and Visual Question Answering","date":"2019-09-04","arxiv_id":"1909.02097","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-representation-learning-for-text","title":"Adversarial Representation Learning for Text-to-Image Matching","date":"2019-08-28","arxiv_id":"1908.10534","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-features-matter-effective-language","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","date":"2019-08-17","arxiv_id":"1908.06327","repositories_listed":0,"syntology":null},{"url":null,"slug":"u-cam-visual-explanation-using-uncertainty","title":"U-CAM: Visual Explanation using Uncertainty based Class Activation Maps","date":"2019-08-17","arxiv_id":"1908.06306","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-is-needed-for-simple-spatial-language","title":"What is needed for simple spatial language capabilities in VQA?","date":"2019-08-17","arxiv_id":"1908.06336","repositories_listed":0,"syntology":null},{"url":null,"slug":"reactive-multi-stage-feature-fusion-for","title":"Reactive Multi-Stage Feature Fusion for Multimodal Dialogue Modeling","date":"2019-08-14","arxiv_id":"1908.05067","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-unified-attention-networks-for","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","date":"2019-08-12","arxiv_id":"1908.04107","repositories_listed":0,"syntology":null},{"url":null,"slug":"why-does-a-visual-question-have-different","title":"Why Does a Visual Question Have Different Answers?","date":"2019-08-12","arxiv_id":"1908.04342","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modality-latent-interaction-network-for","title":"Multi-modality Latent Interaction Network for Visual Question Answering","date":"2019-08-10","arxiv_id":"1908.04289","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-agnostic-attention-for-visual","title":"Question-Agnostic Attention for Visual Question Answering","date":"2019-08-09","arxiv_id":"1908.03289","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-meaning-of-most-for-visual-question-1","title":"The Meaning of ``Most'' for Visual Question Answering Models","date":"2019-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-of-batch-normalization-and","title":"An Empirical Study of Batch Normalization and Group Normalization in Conditional Computation","date":"2019-07-31","arxiv_id":"1908.00061","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-on-leveraging-scene-graphs","title":"An Empirical Study on Leveraging Scene Graphs for Visual Question Answering","date":"2019-07-28","arxiv_id":"1907.12133","repositories_listed":0,"syntology":null},{"url":"/paper/graph-reasoning-networks-for-visual-question","slug":"graph-reasoning-networks-for-visual-question","title":"Bilinear Graph Networks for Visual Question Answering","date":"2019-07-23","arxiv_id":"1907.09815","repositories_listed":0,"syntology":null},{"url":"/paper/kvqa-knowledge-aware-visual-question","slug":"kvqa-knowledge-aware-visual-question","title":"KVQA: Knowledge-Aware Visual Question Answering","date":"2019-07-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"2nd-place-solution-to-the-gqa-challenge-2019","title":"2nd Place Solution to the GQA Challenge 2019","date":"2019-07-16","arxiv_id":"1907.06794","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-reason-with-relational-video","title":"Neural Reasoning, Fast and Slow, for Video Question Answering","date":"2019-07-10","arxiv_id":"1907.04553","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-grained-attention-with-object-level","title":"Multi-grained Attention with Object-level Grounding for Visual Question Answering","date":"2019-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"icdar-2019-competition-on-scene-text-visual","title":"ICDAR 2019 Competition on Scene Text Visual Question Answering","date":"2019-06-30","arxiv_id":"1907.00490","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-multimodal-network-for-movie","title":"Adversarial Multimodal Network for Movie Question Answering","date":"2019-06-24","arxiv_id":"1906.09844","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-knowledge-and-reasoning-in-image","title":"Integrating Knowledge and Reasoning in Image Understanding","date":"2019-06-24","arxiv_id":"1906.09954","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-biases-in-textual-entailment","title":"Investigating Biases in Textual Entailment Datasets","date":"2019-06-23","arxiv_id":"1906.09635","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-visual-question-answering-by","title":"Improving Visual Question Answering by Referring to Generated Paragraph Captions","date":"2019-06-14","arxiv_id":"1906.06216","repositories_listed":0,"syntology":null},{"url":null,"slug":"psycholinguistics-meets-continual-learning","title":"Psycholinguistics meets Continual Learning: Measuring Catastrophic Forgetting in Visual Question Answering","date":"2019-06-10","arxiv_id":"1906.04229","repositories_listed":0,"syntology":null},{"url":"/paper/190600513","slug":"190600513","title":"Generating Question Relevant Captions to Aid Visual Question Answering","date":"2019-06-03","arxiv_id":"1906.00513","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-fusion-with-intra-and-inter-modality-1","title":"Dynamic Fusion With Intra- and Inter-Modality Attention Flow for Visual Question Answering","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"grounded-word-sense-translation","title":"Grounded Word Sense Translation","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"imagettr-grounding-type-theory-with-records","title":"ImageTTR: Grounding Type Theory with Records in Image Classification for Visual Question Answering","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-to-language-tasks-based-on-attributes","title":"Vision-to-Language Tasks Based on Attributes and Attention Mechanism","date":"2019-05-29","arxiv_id":"1905.12243","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-medical-visual-question-answering","title":"Leveraging Medical Visual Question Answering with Supporting Facts","date":"2019-05-28","arxiv_id":"1905.12008","repositories_listed":0,"syntology":null},{"url":null,"slug":"structure-learning-for-neural-module-networks","title":"Structure Learning for Neural Module Networks","date":"2019-05-27","arxiv_id":"1905.11532","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-ttr-modelling-visual-question","title":"Visual TTR - Modelling Visual Question Answering in Type Theory with Records","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"question-guided-modular-routing-networks-for","title":"Question Guided Modular Routing Networks for Visual Question Answering","date":"2019-04-17","arxiv_id":"1904.08324","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-the-representational-hub-of","title":"Evaluating the Representational Hub of Language and Vision Models","date":"2019-04-12","arxiv_id":"1904.06038","repositories_listed":0,"syntology":null},{"url":null,"slug":"actively-seeking-and-learning-from-live-data","title":"Actively Seeking and Learning from Live Data","date":"2019-04-05","arxiv_id":"1904.02865","repositories_listed":0,"syntology":null},{"url":null,"slug":"lucid-explanations-help-using-a-human-ai","title":"Can You Explain That? Lucid Explanations Help Human-AI Collaborative Image Retrieval","date":"2019-04-05","arxiv_id":"1904.03285","repositories_listed":0,"syntology":null},{"url":"/paper/mmed-a-multi-domain-and-multi-modality-event","slug":"mmed-a-multi-domain-and-multi-modality-event","title":"MMED: A Multi-domain and Multi-modality Event Dataset","date":"2019-04-04","arxiv_id":"1904.02354","repositories_listed":0,"syntology":null},{"url":"/paper/raven-a-dataset-for-relational-and-analogical","slug":"raven-a-dataset-for-relational-and-analogical","title":"RAVEN: A Dataset for Relational and Analogical Visual rEasoNing","date":"2019-03-07","arxiv_id":"1903.02741","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-neural-symbolic-models-for","title":"Probabilistic Neural-symbolic Models for Interpretable Visual Question Answering","date":"2019-02-21","arxiv_id":"1902.07864","repositories_listed":0,"syntology":null},{"url":null,"slug":"cycle-consistency-for-robust-visual-question","title":"Cycle-Consistency for Robust Visual Question Answering","date":"2019-02-15","arxiv_id":"1902.05660","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-natural-language-explanations-for","title":"Generating Natural Language Explanations for Visual Question Answering using Scene Graphs and Visual Attention","date":"2019-02-15","arxiv_id":"1902.05715","repositories_listed":0,"syntology":null},{"url":null,"slug":"taking-a-hint-leveraging-explanations-to-make","title":"Taking a HINT: Leveraging Explanations to Make Vision and Language Models More Grounded","date":"2019-02-11","arxiv_id":"1902.03751","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-visual-relationships-for-high","title":"VrR-VG: Refocusing Visually-Relevant Relationships","date":"2019-02-01","arxiv_id":"1902.00313","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-meaning-of-most-for-visual-question","title":"The meaning of \"most\" for visual question answering models","date":"2018-12-31","arxiv_id":"1812.11737","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-learning-with-prior-visual","title":"Scene Graph Reasoning with Prior Visual Relationship for Visual Question Answering","date":"2018-12-23","arxiv_id":"1812.09681","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-fusion-with-intra-and-inter-modality","title":"Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering","date":"2018-12-13","arxiv_id":"1812.05252","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-knowledge-distillation-to-aid-visual","title":"Spatial Knowledge Distillation to aid Visual Reasoning","date":"2018-12-10","arxiv_id":"1812.03631","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-learning-of-hierarchical-vision","title":"Multi-task Learning of Hierarchical Vision-Language Representation","date":"2018-12-03","arxiv_id":"1812.00500","repositories_listed":0,"syntology":null},{"url":null,"slug":"chain-of-reasoning-for-visual-question","title":"Chain of Reasoning for Visual Question Answering","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-specialize-with-knowledge","title":"Learning to Specialize with Knowledge Distillation for Visual Question Answering","date":"2018-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"from-known-to-the-unknown-transferring","title":"From Known to the Unknown: Transferring Knowledge to Answer Questions about Novel Visual and Semantic Concepts","date":"2018-11-30","arxiv_id":"1811.12772","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-as-reading","title":"Visual Question Answering as Reading Comprehension","date":"2018-11-29","arxiv_id":"1811.11903","repositories_listed":0,"syntology":null},{"url":"/paper/a-dataset-of-clinically-generated-visual","slug":"a-dataset-of-clinically-generated-visual","title":"A dataset of clinically generated visual questions and answers about radiology images","date":"2018-11-20","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"explicit-bias-discovery-in-visual-question","title":"Explicit Bias Discovery in Visual Question Answering Models","date":"2018-11-19","arxiv_id":"1811.07789","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-transfer-vqa-dataset","title":"Zero-Shot Transfer VQA Dataset","date":"2018-11-02","arxiv_id":"1811.00692","repositories_listed":0,"syntology":null},{"url":null,"slug":"out-of-the-box-reasoning-with-graph","title":"Out of the Box: Reasoning with Graph Convolution Nets for Factual Visual Question Answering","date":"2018-11-01","arxiv_id":"1811.00538","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-attention-networks-for","title":"Compositional Attention Networks for Interpretability in Natural Language Question Answering","date":"2018-10-30","arxiv_id":"1810.12698","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-explanations-make-vqa-models-more","title":"Do Explanations make VQA Models more Predictable to a Human?","date":"2018-10-29","arxiv_id":"1810.12366","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowing-where-to-look-analysis-on-attention","title":"Knowing Where to Look? Analysis on Attention of Visual Question Answering System","date":"2018-10-09","arxiv_id":"1810.03821","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-language-priors-in-visual-question","title":"Overcoming Language Priors in Visual Question Answering with Adversarial Regularization","date":"2018-10-08","arxiv_id":"1810.03649","repositories_listed":0,"syntology":null},{"url":null,"slug":"textually-enriched-neural-module-networks-for","title":"Textually Enriched Neural Module Networks for Visual Question Answering","date":"2018-09-23","arxiv_id":"1809.08697","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-wisdom-of-masses-majority-subjectivity","title":"The Wisdom of MaSSeS: Majority, Subjectivity, and Semantic Similarity in the Evaluation of VQA","date":"2018-09-12","arxiv_id":"1809.04344","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-visual-question-answering-by","title":"Interpretable Visual Question Answering by Reasoning on Dependency Trees","date":"2018-09-06","arxiv_id":"1809.01810","repositories_listed":0,"syntology":null},{"url":null,"slug":"straight-to-the-facts-learning-knowledge-base","title":"Straight to the Facts: Learning Knowledge Base Retrieval for Factual Visual Question Answering","date":"2018-09-04","arxiv_id":"1809.01124","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-attention-neural-tensor-network-for","title":"Deep Attention Neural Tensor Network for Visual Question Answering","date":"2018-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/question-guided-hybrid-convolution-for-visual","slug":"question-guided-hybrid-convolution-for-visual","title":"Question-Guided Hybrid Convolution for Visual Question Answering","date":"2018-08-08","arxiv_id":"1808.02632","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-visual-question-answering-by-1","title":"Interpretable Visual Question Answering by Visual Grounding from Attention Supervision Mining","date":"2018-08-01","arxiv_id":"1808.00265","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-dataset-for","title":"Visual Question Answering Dataset for Bilingual Image Understanding: A Study of Cross-Lingual Transfer Using Attention Maps","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"question-relevance-in-visual-question","title":"Question Relevance in Visual Question Answering","date":"2018-07-23","arxiv_id":"1807.08435","repositories_listed":0,"syntology":null},{"url":null,"slug":"connecting-language-and-vision-to-actions","title":"Connecting Language and Vision to Actions","date":"2018-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pushing-the-limits-of-radiology-with-joint","title":"Pushing the Limits of Radiology with Joint Modeling of Visual and Textual Information","date":"2018-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-visual-knowledge-memory-networks-for","title":"Learning Visual Knowledge Memory Networks for Visual Question Answering","date":"2018-06-13","arxiv_id":"1806.04860","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-dataset-adaptation-for-visual-question","title":"Cross-Dataset Adaptation for Visual Question Answering","date":"2018-06-10","arxiv_id":"1806.03726","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-answer-embeddings-for-visual","title":"Learning Answer Embeddings for Visual Question Answering","date":"2018-06-10","arxiv_id":"1806.03724","repositories_listed":0,"syntology":null},{"url":null,"slug":"cs-vqa-visual-question-answering-with","title":"CS-VQA: Visual Question Answering with Compressively Sensed Images","date":"2018-06-08","arxiv_id":"1806.03379","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-flip-side-identifying-counterexamples","title":"On the Flip Side: Identifying Counterexamples in Visual Question Answering","date":"2018-06-03","arxiv_id":"1806.00857","repositories_listed":0,"syntology":null},{"url":null,"slug":"categorizing-concepts-with-basic-level-for","title":"Categorizing Concepts With Basic Level for Vision-to-Language","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stacked-latent-attention-for-multimodal","title":"Stacked Latent Attention for Multimodal Reasoning","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stacking-with-auxiliary-features-for-visual","title":"Stacking with Auxiliary Features for Visual Question Answering","date":"2018-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperbolic-attention-networks","title":"Hyperbolic Attention Networks","date":"2018-05-24","arxiv_id":"1805.09786","repositories_listed":0,"syntology":null},{"url":null,"slug":"reproducibility-report-for-learning-to-count","title":"Reproducibility Report for \"Learning To Count Objects In Natural Images For Visual Question Answering\"","date":"2018-05-21","arxiv_id":"1805.08174","repositories_listed":0,"syntology":null},{"url":null,"slug":"reciprocal-attention-fusion-for-visual","title":"Reciprocal Attention Fusion for Visual Question Answering","date":"2018-05-11","arxiv_id":"1805.04247","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-scene-text-verification-with","title":"Large Scale Scene Text Verification with Guided Attention","date":"2018-04-23","arxiv_id":"1804.08588","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-type-guided-attention-in-visual","title":"Question Type Guided Attention in Visual Question Answering","date":"2018-04-06","arxiv_id":"1804.02088","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-reasoning-on-general","title":"Visual Question Reasoning on General Dependency Tree","date":"2018-03-31","arxiv_id":"1804.00105","repositories_listed":0,"syntology":null},{"url":"/paper/ddrprog-a-clevr-differentiable-dynamic","slug":"ddrprog-a-clevr-differentiable-dynamic","title":"DDRprog: A CLEVR Differentiable Dynamic Reasoning Programmer","date":"2018-03-30","arxiv_id":"1803.11361","repositories_listed":0,"syntology":null},{"url":"/paper/two-can-play-this-game-visual-dialog-with","slug":"two-can-play-this-game-visual-dialog-with","title":"Two can play this Game: Visual Dialog with Discriminative Question Generation and Answering","date":"2018-03-29","arxiv_id":"1803.11186","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-hadamard-product-fusion-operators","title":"Generalized Hadamard-Product Fusion Operators for Visual Question Answering","date":"2018-03-26","arxiv_id":"1803.09374","repositories_listed":0,"syntology":null},{"url":null,"slug":"explicit-reasoning-over-end-to-end-neural","title":"Explicit Reasoning over End-to-End Neural Architectures for Visual Question Answering","date":"2018-03-23","arxiv_id":"1803.08896","repositories_listed":0,"syntology":null},{"url":"/paper/vqa-e-explaining-elaborating-and-enhancing","slug":"vqa-e-explaining-elaborating-and-enhancing","title":"VQA-E: Explaining, Elaborating, and Enhancing Your Answers for Visual Questions","date":"2018-03-20","arxiv_id":"1803.07464","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-visual-question-answering-a-new","title":"Inverse Visual Question Answering: A New Benchmark and VQA Diagnosis Tool","date":"2018-03-16","arxiv_id":"1803.06936","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-triples-with-adversarial-networks","title":"Generating Triples with Adversarial Networks for Scene Graph Construction","date":"2018-02-07","arxiv_id":"1802.02598","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-based-reasoning-in-vqa","title":"Object-based reasoning in VQA","date":"2018-01-29","arxiv_id":"1801.09718","repositories_listed":0,"syntology":null},{"url":null,"slug":"tell-and-answer-towards-explainable-visual","title":"Tell-and-Answer: Towards Explainable Visual Question Answering using Attributes and Captions","date":"2018-01-27","arxiv_id":"1801.09041","repositories_listed":0,"syntology":null}],"record_sha256":"8dcd50142e7ecf638a03d73525cd08e710889ebc0d51f3cb59a5f3844a9a625c","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}