{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering/papers/20","list_of":"/task/visual-question-answering","task":"Visual Question Answering (VQA)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":20,"pages_in_order":22,"rows_per_page":100,"rows":[1901,2000],"of":2167,"counts":{"archive_papers_tagged":2167,"with_a_code_link":1039,"where_syntology_ran_a_sample":359,"not_listed_spam_title":0,"listed":2167,"listed_where_code_ran":359,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":287,"every_run_a_failure_of_syntologys_instrument":72,"listed_with_a_run_with_no_instrument_failure":287,"listed_every_run_a_failure_of_syntologys_instrument":72,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering","prev":"/task/visual-question-answering/papers/19","next":"/task/visual-question-answering/papers/21","papers":[{"url":null,"slug":"visual-question-answering-for-cultural","title":"Visual Question Answering for Cultural Heritage","date":"2020-03-22","arxiv_id":"2003.09853","repositories_listed":0,"syntology":null},{"url":null,"slug":"normalized-and-geometry-aware-self-attention","title":"Normalized and Geometry-Aware Self-Attention Network for Image Captioning","date":"2020-03-19","arxiv_id":"2003.08897","repositories_listed":0,"syntology":null},{"url":null,"slug":"rsvqa-visual-question-answering-for-remote","title":"RSVQA: Visual Question Answering for Remote Sensing Data","date":"2020-03-16","arxiv_id":"2003.07333","repositories_listed":0,"syntology":null},{"url":"/paper/xgpt-cross-modal-generative-pre-training-for","slug":"xgpt-cross-modal-generative-pre-training-for","title":"XGPT: Cross-modal Generative Pre-Training for Image Captioning","date":"2020-03-03","arxiv_id":"2003.01473","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-on-multimodal-and-interactive","title":"A Study on Multimodal and Interactive Explanations for Visual Question Answering","date":"2020-03-01","arxiv_id":"2003.00431","repositories_listed":0,"syntology":null},{"url":null,"slug":"unshuffling-data-for-improved-generalization","title":"Unshuffling Data for Improved Generalization","date":"2020-02-27","arxiv_id":"2002.11894","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-evaluation-of-temporal-pooling","title":"A Comparative Evaluation of Temporal Pooling Methods for Blind Video Quality Assessment","date":"2020-02-25","arxiv_id":"2002.10651","repositories_listed":0,"syntology":null},{"url":null,"slug":"bert-can-see-out-of-the-box-on-the-cross","title":"What BERT Sees: Cross-Modal Transfer for Visual Question Generation","date":"2020-02-25","arxiv_id":"2002.10832","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-general-value-of-evidence-and","title":"On the General Value of Evidence, and Bilingual Scene-Text Visual Question Answering","date":"2020-02-24","arxiv_id":"2002.10215","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqa-lol-visual-question-answering-under-the","title":"VQA-LOL: Visual Question Answering under the Lens of Logic","date":"2020-02-19","arxiv_id":"2002.08325","repositories_listed":0,"syntology":null},{"url":null,"slug":"cq-vqa-visual-question-answering-on","title":"CQ-VQA: Visual Question Answering on Categorized Questions","date":"2020-02-17","arxiv_id":"2002.06800","repositories_listed":0,"syntology":null},{"url":null,"slug":"component-analysis-for-visual-question","title":"Component Analysis for Visual Question Answering Architectures","date":"2020-02-12","arxiv_id":"2002.05104","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-based-class-activation-maps-for","title":"Uncertainty based Class Activation Maps for Visual Question Answering","date":"2020-01-23","arxiv_id":"2002.10309","repositories_listed":0,"syntology":null},{"url":null,"slug":"accuracy-vs-complexity-a-trade-off-in-visual","title":"Accuracy vs. Complexity: A Trade-off in Visual Question Answering Models","date":"2020-01-20","arxiv_id":"2001.07059","repositories_listed":0,"syntology":null},{"url":null,"slug":"squinting-at-vqa-models-interrogating-vqa","title":"SQuINTing at VQA Models: Introspecting VQA Models with Sub-Questions","date":"2020-01-20","arxiv_id":"2001.06927","repositories_listed":0,"syntology":null},{"url":null,"slug":"extending-class-activation-mapping-using","title":"Extending Class Activation Mapping Using Gaussian Receptive Field","date":"2020-01-15","arxiv_id":"2001.05153","repositories_listed":0,"syntology":null},{"url":"/paper/visual-question-answering-on-360-images","slug":"visual-question-answering-on-360-images","title":"Visual Question Answering on 360° Images","date":"2020-01-10","arxiv_id":"2001.03339","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-layer-content-interaction-through","title":"Multi-Layer Content Interaction Through Quaternion Product For Visual Question Answering","date":"2020-01-03","arxiv_id":"2001.05840","repositories_listed":0,"syntology":null},{"url":null,"slug":"cost-function-dependent-barren-plateaus-in","title":"Cost Function Dependent Barren Plateaus in Shallow Parametrized Quantum Circuits","date":"2020-01-02","arxiv_id":"2001.00550","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-and-language-from-visual-perception-to","title":"Vision and Language: from Visual Perception to Content Creation","date":"2019-12-26","arxiv_id":"1912.11872","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-exemplar-networks-for-vqa-and-vqg","title":"Deep Exemplar Networks for VQA and VQG","date":"2019-12-19","arxiv_id":"1912.09551","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-reference-video-quality-assessment-using","title":"KonVid-150k: A Dataset for No-Reference Video Quality Assessment of Videos in-the-Wild","date":"2019-12-17","arxiv_id":"1912.07966","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-causal-vqa-revealing-and-reducing","title":"Towards Causal VQA: Revealing and Reducing Spurious Correlations by Invariant and Covariant Semantic Editing","date":"2019-12-16","arxiv_id":"1912.07538","repositories_listed":0,"syntology":null},{"url":"/paper/ai2d-rst-a-multimodal-corpus-of-1000-primary","slug":"ai2d-rst-a-multimodal-corpus-of-1000-primary","title":"AI2D-RST: A multimodal corpus of 1000 primary school science diagrams","date":"2019-12-09","arxiv_id":"1912.03879","repositories_listed":0,"syntology":null},{"url":null,"slug":"weak-supervision-helps-emergence-of-word","title":"Weak Supervision helps Emergence of Word-Object Alignment and improves Vision-Language Tasks","date":"2019-12-06","arxiv_id":"1912.03063","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-bayesian-active-learning-for-multiple","title":"Deep Bayesian Active Learning for Multiple Correct Outputs","date":"2019-12-02","arxiv_id":"1912.01119","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-free-lunch-in-generating-datasets-building","title":"A Free Lunch in Generating Datasets: Building a VQG and VQA System with Attention and Humans in the Loop","date":"2019-11-30","arxiv_id":"1912.00124","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-the-robustness-of-visual-question","title":"Assessing the Robustness of Visual Question Answering Models","date":"2019-11-30","arxiv_id":"1912.01452","repositories_listed":0,"syntology":null},{"url":null,"slug":"optibox-breaking-the-limits-of-proposals-for","title":"OptiBox: Breaking the Limits of Proposals for Visual Grounding","date":"2019-11-29","arxiv_id":"1912.00076","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-in-visual-and-relational","title":"Transfer Learning in Visual and Relational Reasoning","date":"2019-11-27","arxiv_id":"1911.11938","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-keyword-extraction-for-full","title":"Unsupervised Keyword Extraction for Full-sentence VQA","date":"2019-11-23","arxiv_id":"1911.10354","repositories_listed":0,"syntology":null},{"url":null,"slug":"explanation-vs-attention-a-two-player-game-to","title":"Explanation vs Attention: A Two-Player Game to Obtain Attention for VQA","date":"2019-11-19","arxiv_id":"1911.08618","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-conditioned-counterfactual-image","title":"Question-Conditioned Counterfactual Image Generation for VQA","date":"2019-11-14","arxiv_id":"1911.06352","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-ended-visual-question-answering-by-multi","title":"Open-Ended Visual Question Answering by Multi-Modal Domain Adaptation","date":"2019-11-11","arxiv_id":"1911.04058","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-intelligence-representation","title":"Multimodal Intelligence: Representation Learning, Information Fusion, and Applications","date":"2019-11-10","arxiv_id":"1911.03977","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-we-asking-the-right-questions-in-movieqa","title":"Are we asking the right questions in MovieQA?","date":"2019-11-08","arxiv_id":"1911.03083","repositories_listed":0,"syntology":null},{"url":null,"slug":"representing-movie-characters-in-dialogues","title":"Representing Movie Characters in Dialogues","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"youmakeup-a-large-scale-domain-specific","title":"YouMakeup: A Large-Scale Domain-Specific Multimodal Dataset for Fine-Grained Semantic Comprehension","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"c3dvqa-full-reference-video-quality","title":"C3DVQA: Full-Reference Video Quality Assessment with 3D Convolutional Neural Network","date":"2019-10-30","arxiv_id":"1910.13646","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-rich-image-region-representation-for","title":"Learning Rich Image Region Representation for Visual Question Answering","date":"2019-10-29","arxiv_id":"1910.13077","repositories_listed":0,"syntology":null},{"url":"/paper/knowit-vqa-answering-knowledge-based","slug":"knowit-vqa-answering-knowledge-based","title":"KnowIT VQA: Answering Knowledge-Based Questions about Videos","date":"2019-10-23","arxiv_id":"1910.10706","repositories_listed":0,"syntology":null},{"url":null,"slug":"enforcing-reasoning-in-visual-commonsense","title":"Enforcing Reasoning in Visual Commonsense Reasoning","date":"2019-10-21","arxiv_id":"1910.11124","repositories_listed":0,"syntology":null},{"url":null,"slug":"good-better-best-textual-distractors","title":"Good, Better, Best: Textual Distractors Generation for Multiple-Choice Visual Question Answering via Reinforcement Learning","date":"2019-10-21","arxiv_id":"1910.09134","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-memory-plasticity-for-anomaly","title":"Neural Memory Plasticity for Anomaly Detection","date":"2019-10-12","arxiv_id":"1910.05448","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-deep-analysis-for-multimedia","title":"Multi-modal Deep Analysis for Multimedia","date":"2019-10-11","arxiv_id":"1910.04964","repositories_listed":0,"syntology":null},{"url":null,"slug":"modulated-self-attention-convolutional","title":"Modulated Self-attention Convolutional Network for VQA","date":"2019-10-08","arxiv_id":"1910.03343","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-strings-to-things-knowledge-enabled-vqa","title":"From Strings to Things: Knowledge-Enabled VQA Model That Can Read and Reason","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"segeqa-video-segmentation-based-visual","title":"SegEQA: Video Segmentation Based Visual Attention for Embodied Question Answering","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-incorporating-semantic-prior-knowlegde-in-1","title":"On Incorporating Semantic Prior Knowledge in Deep Learning Through Embedding-Space Constraints","date":"2019-09-30","arxiv_id":"1909.13471","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-recognize-the-unseen-visual","title":"Learning to Recognize the Unseen Visual Predicates","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-incorporating-semantic-prior-knowlegde-in","title":"On Incorporating Semantic Prior Knowlegde in Deep Learning Through Embedding-Space Constraints","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uniter-learning-universal-image-text","title":"UNITER: Learning UNiversal Image-TExt Representations","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"why-does-the-vqa-model-answer-no-improving","title":"Why Does the VQA Model Answer No?: Improving Reasoning through Visual and Linguistic Inference","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"190910128","title":"Explainable High-order Visual Question Reasoning: A New Benchmark and Knowledge-routed Network","date":"2019-09-23","arxiv_id":"1909.10128","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-monotonic-logical-reasoning-guiding-deep","title":"Non-monotonic Logical Reasoning Guiding Deep Learning for Explainable Visual Question Answering","date":"2019-09-23","arxiv_id":"1909.10650","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-sparse-mixture-of-experts-for-visual","title":"Learning Sparse Mixture of Experts for Visual Question Answering","date":"2019-09-19","arxiv_id":"1909.09192","repositories_listed":0,"syntology":null},{"url":null,"slug":"triplet-aware-scene-graph-embeddings","title":"Triplet-Aware Scene Graph Embeddings","date":"2019-09-19","arxiv_id":"1909.09256","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-visual-question-answering-with-multi","title":"Inverse Visual Question Answering with Multi-Level Attentions","date":"2019-09-17","arxiv_id":"1909.07583","repositories_listed":0,"syntology":null},{"url":null,"slug":"sunny-and-dark-outside-improving-answer","title":"Sunny and Dark Outside?! Improving Answer Consistency in VQA through Entailed Question Generation","date":"2019-09-10","arxiv_id":"1909.04696","repositories_listed":0,"syntology":null},{"url":"/paper/decoupled-box-proposal-and-featurization-with","slug":"decoupled-box-proposal-and-featurization-with","title":"Decoupled Box Proposal and Featurization with Ultrafine-Grained Semantic Labels Improve Image Captioning and Visual Question Answering","date":"2019-09-04","arxiv_id":"1909.02097","repositories_listed":0,"syntology":null},{"url":"/paper/data-interpretation-over-plots","slug":"data-interpretation-over-plots","title":"PlotQA: Reasoning over Scientific Plots","date":"2019-09-03","arxiv_id":"1909.00997","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-representation-learning-for-text","title":"Adversarial Representation Learning for Text-to-Image Matching","date":"2019-08-28","arxiv_id":"1908.10534","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-features-matter-effective-language","title":"Language Features Matter: Effective Language Representations for Vision-Language Tasks","date":"2019-08-17","arxiv_id":"1908.06327","repositories_listed":0,"syntology":null},{"url":null,"slug":"u-cam-visual-explanation-using-uncertainty","title":"U-CAM: Visual Explanation using Uncertainty based Class Activation Maps","date":"2019-08-17","arxiv_id":"1908.06306","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-is-needed-for-simple-spatial-language","title":"What is needed for simple spatial language capabilities in VQA?","date":"2019-08-17","arxiv_id":"1908.06336","repositories_listed":0,"syntology":null},{"url":null,"slug":"reactive-multi-stage-feature-fusion-for","title":"Reactive Multi-Stage Feature Fusion for Multimodal Dialogue Modeling","date":"2019-08-14","arxiv_id":"1908.05067","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-unified-attention-networks-for","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","date":"2019-08-12","arxiv_id":"1908.04107","repositories_listed":0,"syntology":null},{"url":null,"slug":"why-does-a-visual-question-have-different","title":"Why Does a Visual Question Have Different Answers?","date":"2019-08-12","arxiv_id":"1908.04342","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modality-latent-interaction-network-for","title":"Multi-modality Latent Interaction Network for Visual Question Answering","date":"2019-08-10","arxiv_id":"1908.04289","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-agnostic-attention-for-visual","title":"Question-Agnostic Attention for Visual Question Answering","date":"2019-08-09","arxiv_id":"1908.03289","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-two-graphs-to-n-questions-a-vqa-dataset","title":"CRIC: A VQA Dataset for Compositional Reasoning on Vision and Commonsense","date":"2019-08-08","arxiv_id":"1908.02962","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-meaning-of-most-for-visual-question-1","title":"The Meaning of ``Most'' for Visual Question Answering Models","date":"2019-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-of-batch-normalization-and","title":"An Empirical Study of Batch Normalization and Group Normalization in Conditional Computation","date":"2019-07-31","arxiv_id":"1908.00061","repositories_listed":0,"syntology":null},{"url":"/paper/leaf-qa-locate-encode-attend-for-figure","slug":"leaf-qa-locate-encode-attend-for-figure","title":"LEAF-QA: Locate, Encode & Attend for Figure Question Answering","date":"2019-07-30","arxiv_id":"1907.12861","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-on-leveraging-scene-graphs","title":"An Empirical Study on Leveraging Scene Graphs for Visual Question Answering","date":"2019-07-28","arxiv_id":"1907.12133","repositories_listed":0,"syntology":null},{"url":"/paper/graph-reasoning-networks-for-visual-question","slug":"graph-reasoning-networks-for-visual-question","title":"Bilinear Graph Networks for Visual Question Answering","date":"2019-07-23","arxiv_id":"1907.09815","repositories_listed":0,"syntology":null},{"url":"/paper/kvqa-knowledge-aware-visual-question","slug":"kvqa-knowledge-aware-visual-question","title":"KVQA: Knowledge-Aware Visual Question Answering","date":"2019-07-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"2nd-place-solution-to-the-gqa-challenge-2019","title":"2nd Place Solution to the GQA Challenge 2019","date":"2019-07-16","arxiv_id":"1907.06794","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-visual-quality-of-omnidirectional","title":"Assessing Visual Quality of Omnidirectional Videos","date":"2019-07-14","arxiv_id":"1709.06342","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-reason-with-relational-video","title":"Neural Reasoning, Fast and Slow, for Video Question Answering","date":"2019-07-10","arxiv_id":"1907.04553","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-grained-attention-with-object-level","title":"Multi-grained Attention with Object-level Grounding for Visual Question Answering","date":"2019-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"icdar-2019-competition-on-scene-text-visual","title":"ICDAR 2019 Competition on Scene Text Visual Question Answering","date":"2019-06-30","arxiv_id":"1907.00490","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-multimodal-network-for-movie","title":"Adversarial Multimodal Network for Movie Question Answering","date":"2019-06-24","arxiv_id":"1906.09844","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-knowledge-and-reasoning-in-image","title":"Integrating Knowledge and Reasoning in Image Understanding","date":"2019-06-24","arxiv_id":"1906.09954","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-biases-in-textual-entailment","title":"Investigating Biases in Textual Entailment Datasets","date":"2019-06-23","arxiv_id":"1906.09635","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-visual-question-answering-by","title":"Improving Visual Question Answering by Referring to Generated Paragraph Captions","date":"2019-06-14","arxiv_id":"1906.06216","repositories_listed":0,"syntology":null},{"url":null,"slug":"psycholinguistics-meets-continual-learning","title":"Psycholinguistics meets Continual Learning: Measuring Catastrophic Forgetting in Visual Question Answering","date":"2019-06-10","arxiv_id":"1906.04229","repositories_listed":0,"syntology":null},{"url":"/paper/190600513","slug":"190600513","title":"Generating Question Relevant Captions to Aid Visual Question Answering","date":"2019-06-03","arxiv_id":"1906.00513","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-fusion-with-intra-and-inter-modality-1","title":"Dynamic Fusion With Intra- and Inter-Modality Attention Flow for Visual Question Answering","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"grounded-word-sense-translation","title":"Grounded Word Sense Translation","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"imagettr-grounding-type-theory-with-records","title":"ImageTTR: Grounding Type Theory with Records in Image Classification for Visual Question Answering","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-to-language-tasks-based-on-attributes","title":"Vision-to-Language Tasks Based on Attributes and Attention Mechanism","date":"2019-05-29","arxiv_id":"1905.12243","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-medical-visual-question-answering","title":"Leveraging Medical Visual Question Answering with Supporting Facts","date":"2019-05-28","arxiv_id":"1905.12008","repositories_listed":0,"syntology":null},{"url":null,"slug":"structure-learning-for-neural-module-networks","title":"Structure Learning for Neural Module Networks","date":"2019-05-27","arxiv_id":"1905.11532","repositories_listed":0,"syntology":null},{"url":null,"slug":"misleading-failures-of-partial-input","title":"Misleading Failures of Partial-input Baselines","date":"2019-05-14","arxiv_id":"1905.05778","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-ttr-modelling-visual-question","title":"Visual TTR - Modelling Visual Question Answering in Type Theory with Records","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-collocate-neural-modules-for","title":"Learning to Collocate Neural Modules for Image Captioning","date":"2019-04-18","arxiv_id":"1904.08608","repositories_listed":0,"syntology":null},{"url":"/paper/progressive-attention-memory-network-for","slug":"progressive-attention-memory-network-for","title":"Progressive Attention Memory Network for Movie Story Question Answering","date":"2019-04-18","arxiv_id":"1904.08607","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-guided-modular-routing-networks-for","title":"Question Guided Modular Routing Networks for Visual Question Answering","date":"2019-04-17","arxiv_id":"1904.08324","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-the-representational-hub-of","title":"Evaluating the Representational Hub of Language and Vision Models","date":"2019-04-12","arxiv_id":"1904.06038","repositories_listed":0,"syntology":null}],"record_sha256":"29fea0c43b7110297edbb7ca1335b85b0c970e4b96cc38538f748862734b8686","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}