{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering-1/papers/20","list_of":"/task/visual-question-answering-1","task":"Visual Question Answering","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":20,"pages_in_order":22,"rows_per_page":100,"rows":[1901,2000],"of":2177,"counts":{"archive_papers_tagged":2177,"with_a_code_link":1042,"where_syntology_ran_a_sample":378,"not_listed_spam_title":0,"listed":2177,"listed_where_code_ran":378,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":308,"every_run_a_failure_of_syntologys_instrument":70,"listed_with_a_run_with_no_instrument_failure":308,"listed_every_run_a_failure_of_syntologys_instrument":70,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering-1","prev":"/task/visual-question-answering-1/papers/19","next":"/task/visual-question-answering-1/papers/21","papers":[{"url":null,"slug":"capwap-image-captioning-with-a-purpose","title":"CapWAP: Image Captioning with a Purpose","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"isaaq-mastering-textbook-questions-with-pre-1","title":"ISAAQ - Mastering Textbook Questions with Pre-trained Transformers and Bottom-Up and Top-Down Attention","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-learning-and-reasoning-on","title":"Representation, Learning and Reasoning on Spatial Language for Downstream NLP Tasks","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-visual-question-answering-to","title":"Leveraging Visual Question Answering to Improve Text-to-Image Synthesis","date":"2020-10-28","arxiv_id":"2010.14953","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-vqa-generating-multi-word-answer-and","title":"Beyond VQA: Generating Multi-word Answer and Rationale to Visual Questions","date":"2020-10-24","arxiv_id":"2010.12852","repositories_listed":0,"syntology":null},{"url":null,"slug":"answer-checking-in-context-a-multi-modal","title":"Answer-checking in Context: A Multi-modal FullyAttention Network for Visual Question Answering","date":"2020-10-17","arxiv_id":"2010.08708","repositories_listed":0,"syntology":null},{"url":null,"slug":"new-ideas-and-trends-in-deep-multimodal","title":"New Ideas and Trends in Deep Multimodal Content Understanding: A Review","date":"2020-10-16","arxiv_id":"2010.08189","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-my-multimodal-model-learn-cross-modal","title":"Does my multimodal model learn cross-modal interactions? It's harder to tell than you might think!","date":"2020-10-13","arxiv_id":"2010.06572","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-neural-computation-for-real","title":"Interpretable Neural Computation for Real-World Compositional Visual Question Answering","date":"2020-10-10","arxiv_id":"2010.04913","repositories_listed":0,"syntology":null},{"url":"/paper/characterizing-datasets-for-social-visual","slug":"characterizing-datasets-for-social-visual","title":"Characterizing Datasets for Social Visual Question Answering, and the New TinySocial Dataset","date":"2020-10-08","arxiv_id":"2010.11997","repositories_listed":0,"syntology":null},{"url":null,"slug":"finding-the-evidence-localization-aware","title":"Finding the Evidence: Localization-aware Answer Prediction for Text Visual Question Answering","date":"2020-10-06","arxiv_id":"2010.02582","repositories_listed":0,"syntology":null},{"url":null,"slug":"pathological-visual-question-answering-1","title":"Pathological Visual Question Answering","date":"2020-10-06","arxiv_id":"2010.12435","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-guided-semantic-relationship","title":"Attention Guided Semantic Relationship Parsing for Visual Question Answering","date":"2020-10-05","arxiv_id":"2010.01725","repositories_listed":0,"syntology":null},{"url":null,"slug":"caption-correction-by-analyses-pos-tagging","title":"CAPTION: Correction by Analyses, POS-Tagging and Interpretation of Objects using only Nouns","date":"2020-10-02","arxiv_id":"2010.00839","repositories_listed":0,"syntology":null},{"url":null,"slug":"isaaq-mastering-textbook-questions-with-pre","title":"ISAAQ -- Mastering Textbook Questions with Pre-trained Transformers and Bottom-Up and Top-Down Attention","date":"2020-10-01","arxiv_id":"2010.00562","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-based-heuristic-search-for-module","title":"Graph-based Heuristic Search for Module Selection Procedure in Neural Module Network","date":"2020-09-30","arxiv_id":"2009.14759","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-attention-as-an-interface-for-image","title":"Spatial Attention as an Interface for Image Captioning Models","date":"2020-09-29","arxiv_id":"2010.11701","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularizing-attention-networks-for-anomaly","title":"Regularizing Attention Networks for Anomaly Detection in Visual Question Answering","date":"2020-09-21","arxiv_id":"2009.10054","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multimodal-memes-classification-a-survey","title":"A Multimodal Memes Classification: A Survey and Open Research Issues","date":"2020-09-17","arxiv_id":"2009.08395","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-knowledge-reasoning-for-knowledge","title":"Cross-modal Knowledge Reasoning for Knowledge-based Visual Question Answering","date":"2020-08-31","arxiv_id":"2009.00145","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-on-image-sets","title":"Visual Question Answering on Image Sets","date":"2020-08-27","arxiv_id":"2008.11976","repositories_listed":0,"syntology":null},{"url":null,"slug":"document-visual-question-answering-challenge","title":"Document Visual Question Answering Challenge 2020","date":"2020-08-20","arxiv_id":"2008.08899","repositories_listed":0,"syntology":null},{"url":null,"slug":"assisting-scene-graph-generation-with-self","title":"Assisting Scene Graph Generation with Self-Supervision","date":"2020-08-08","arxiv_id":"2008.03555","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-visual-reasoning-via","title":"Interpretable Visual Reasoning via Probabilistic Formulation under Natural Supervision","date":"2020-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"trrnet-tiered-relation-reasoning-for","title":"TRRNet: Tiered Relation Reasoning for Compositional Visual Question Answering","date":"2020-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-language-biases-in-visual-question","title":"Reducing Language Biases in Visual Question Answering with Visually-Grounded Question Encoder","date":"2020-07-13","arxiv_id":"2007.06198","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-with-compositional-neural","title":"Image Captioning with Compositional Neural Module Networks","date":"2020-07-10","arxiv_id":"2007.05608","repositories_listed":0,"syntology":null},{"url":null,"slug":"eliminating-catastrophic-interference-with","title":"Eliminating Catastrophic Interference with Biased Competition","date":"2020-07-03","arxiv_id":"2007.02833","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-as-a-multi-task","title":"Visual Question Answering as a Multi-Task Problem","date":"2020-07-03","arxiv_id":"2007.01780","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-graph-reasoning-for-visual-question","title":"Scene Graph Reasoning for Visual Question Answering","date":"2020-07-02","arxiv_id":"2007.01072","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-impact-of-explanations-on-ai-competency","title":"The Impact of Explanations on AI Competency Prediction in VQA","date":"2020-07-02","arxiv_id":"2007.00900","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligned-dual-channel-graph-convolutional","title":"Aligned Dual Channel Graph Convolutional Network for Visual Question Answering","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-neural-graph-memory-networks-for","title":"Multimodal Neural Graph Memory Networks for Visual Question Answering","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-visual-dialog-for-radiology","title":"Towards Visual Dialog for Radiology","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-vqa-and-its-explanations-by","title":"Improving VQA and its Explanations \\\\ by Comparing Competing Explanations","date":"2020-06-28","arxiv_id":"2006.15631","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-segregating-and-coordinated-segregating","title":"Self-Segregating and Coordinated-Segregating Transformer for Focused Deep Multi-Modular Network for Visual Question Answering","date":"2020-06-25","arxiv_id":"2006.14264","repositories_listed":0,"syntology":null},{"url":"/paper/neuro-symbolic-visual-reasoning-disentangling","slug":"neuro-symbolic-visual-reasoning-disentangling","title":"Neuro-Symbolic Visual Reasoning: Disentangling \"Visual\" from \"Reasoning\"","date":"2020-06-20","arxiv_id":"2006.11524","repositories_listed":0,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/neuro-symbolic-visual-reasoning-disentangling#ran","syntology_url":"https://syntology.ai/paper/2006.11524","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2006.11524"}},"official":null}},{"url":null,"slug":"mucko-multi-layer-cross-modal-knowledge","title":"Mucko: Multi-Layer Cross-Modal Knowledge Reasoning for Fact-based Visual Question Answering","date":"2020-06-16","arxiv_id":"2006.09073","repositories_listed":0,"syntology":null},{"url":null,"slug":"ord-object-relationship-discovery-for-visual","title":"ORD: Object Relationship Discovery for Visual Dialogue Generation","date":"2020-06-15","arxiv_id":"2006.08322","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-weaknesses-of-vqa-models-through","title":"Exploring Weaknesses of VQA Models through Attribution Driven Insights","date":"2020-06-11","arxiv_id":"2006.06637","repositories_listed":0,"syntology":null},{"url":null,"slug":"estimating-semantic-structure-for-the-vqa","title":"Estimating semantic structure for the VQA answer space","date":"2020-06-10","arxiv_id":"2006.05726","repositories_listed":0,"syntology":null},{"url":null,"slug":"counterfactual-vision-and-language-learning","title":"Counterfactual Vision and Language Learning","date":"2020-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-grid-features-and-cell-pointers","title":"Multimodal grid features and cell pointers for Scene Text Visual Question Answering","date":"2020-06-01","arxiv_id":"2006.00923","repositories_listed":0,"syntology":null},{"url":null,"slug":"ta-student-vqa-multi-agents-training-by-self","title":"TA-Student VQA: Multi-Agents Training by Self-Questioning","date":"2020-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-value-of-out-of-distribution-testing","title":"On the Value of Out-of-Distribution Testing: An Example of Goodhart's Law","date":"2020-05-19","arxiv_id":"2005.09241","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-relationship-detection-using-scene","title":"Visual Relationship Detection using Scene Graphs: A Survey","date":"2020-05-16","arxiv_id":"2005.08045","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-with-prior-class","title":"Visual Question Answering with Prior Class Semantics","date":"2020-05-04","arxiv_id":"2005.01239","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-corpus-for-visual-question-answering","title":"A Corpus for Visual Question Answering Annotated with Frame Semantic Information","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"image-position-prediction-in-multimodal","title":"Image Position Prediction in Multimodal Documents","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-attention-based-aggregation-function","title":"A Novel Attention-based Aggregation Function to Combine Vision and Language","date":"2020-04-27","arxiv_id":"2004.13073","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-using-semantic","title":"Visual Question Answering Using Semantic Information from Image Descriptions","date":"2020-04-23","arxiv_id":"2004.10966","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-what-makes-a-difference-from","title":"Learning What Makes a Difference from Counterfactual Examples and Gradient Supervision","date":"2020-04-20","arxiv_id":"2004.09034","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-based-visual-question-answering-in","title":"Knowledge-Based Visual Question Answering in Videos","date":"2020-04-17","arxiv_id":"2004.08385","repositories_listed":0,"syntology":null},{"url":null,"slug":"rephrasing-visual-questions-by-specifying-the","title":"Rephrasing visual questions by specifying the entropy of the answer distribution","date":"2020-04-10","arxiv_id":"2004.04963","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-knowledge-gaps-in-visual","title":"Understanding Knowledge Gaps in Visual Question Answering: Implications for Gap Identification and Testing","date":"2020-04-08","arxiv_id":"2004.03755","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-rationales-in-visual-question","title":"Generating Rationales in Visual Question Answering","date":"2020-04-04","arxiv_id":"2004.02032","repositories_listed":0,"syntology":null},{"url":"/paper/assessing-image-quality-issues-for-real-world","slug":"assessing-image-quality-issues-for-real-world","title":"Assessing Image Quality Issues for Real-World Problems","date":"2020-03-27","arxiv_id":"2003.12511","repositories_listed":0,"syntology":null},{"url":null,"slug":"linguistically-driven-graph-capsule-network","title":"Linguistically Driven Graph Capsule Network for Visual Question Reasoning","date":"2020-03-23","arxiv_id":"2003.10065","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-for-cultural","title":"Visual Question Answering for Cultural Heritage","date":"2020-03-22","arxiv_id":"2003.09853","repositories_listed":0,"syntology":null},{"url":null,"slug":"normalized-and-geometry-aware-self-attention","title":"Normalized and Geometry-Aware Self-Attention Network for Image Captioning","date":"2020-03-19","arxiv_id":"2003.08897","repositories_listed":0,"syntology":null},{"url":null,"slug":"rsvqa-visual-question-answering-for-remote","title":"RSVQA: Visual Question Answering for Remote Sensing Data","date":"2020-03-16","arxiv_id":"2003.07333","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-on-multimodal-and-interactive","title":"A Study on Multimodal and Interactive Explanations for Visual Question Answering","date":"2020-03-01","arxiv_id":"2003.00431","repositories_listed":0,"syntology":null},{"url":null,"slug":"unshuffling-data-for-improved-generalization","title":"Unshuffling Data for Improved Generalization","date":"2020-02-27","arxiv_id":"2002.11894","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-general-value-of-evidence-and","title":"On the General Value of Evidence, and Bilingual Scene-Text Visual Question Answering","date":"2020-02-24","arxiv_id":"2002.10215","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqa-lol-visual-question-answering-under-the","title":"VQA-LOL: Visual Question Answering under the Lens of Logic","date":"2020-02-19","arxiv_id":"2002.08325","repositories_listed":0,"syntology":null},{"url":null,"slug":"cq-vqa-visual-question-answering-on","title":"CQ-VQA: Visual Question Answering on Categorized Questions","date":"2020-02-17","arxiv_id":"2002.06800","repositories_listed":0,"syntology":null},{"url":null,"slug":"component-analysis-for-visual-question","title":"Component Analysis for Visual Question Answering Architectures","date":"2020-02-12","arxiv_id":"2002.05104","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-based-class-activation-maps-for","title":"Uncertainty based Class Activation Maps for Visual Question Answering","date":"2020-01-23","arxiv_id":"2002.10309","repositories_listed":0,"syntology":null},{"url":null,"slug":"accuracy-vs-complexity-a-trade-off-in-visual","title":"Accuracy vs. Complexity: A Trade-off in Visual Question Answering Models","date":"2020-01-20","arxiv_id":"2001.07059","repositories_listed":0,"syntology":null},{"url":"/paper/visual-question-answering-on-360-images","slug":"visual-question-answering-on-360-images","title":"Visual Question Answering on 360° Images","date":"2020-01-10","arxiv_id":"2001.03339","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-layer-content-interaction-through","title":"Multi-Layer Content Interaction Through Quaternion Product For Visual Question Answering","date":"2020-01-03","arxiv_id":"2001.05840","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-and-language-from-visual-perception-to","title":"Vision and Language: from Visual Perception to Content Creation","date":"2019-12-26","arxiv_id":"1912.11872","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-exemplar-networks-for-vqa-and-vqg","title":"Deep Exemplar Networks for VQA and VQG","date":"2019-12-19","arxiv_id":"1912.09551","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-causal-vqa-revealing-and-reducing","title":"Towards Causal VQA: Revealing and Reducing Spurious Correlations by Invariant and Covariant Semantic Editing","date":"2019-12-16","arxiv_id":"1912.07538","repositories_listed":0,"syntology":null},{"url":"/paper/ai2d-rst-a-multimodal-corpus-of-1000-primary","slug":"ai2d-rst-a-multimodal-corpus-of-1000-primary","title":"AI2D-RST: A multimodal corpus of 1000 primary school science diagrams","date":"2019-12-09","arxiv_id":"1912.03879","repositories_listed":0,"syntology":null},{"url":null,"slug":"weak-supervision-helps-emergence-of-word","title":"Weak Supervision helps Emergence of Word-Object Alignment and improves Vision-Language Tasks","date":"2019-12-06","arxiv_id":"1912.03063","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-bayesian-active-learning-for-multiple","title":"Deep Bayesian Active Learning for Multiple Correct Outputs","date":"2019-12-02","arxiv_id":"1912.01119","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-free-lunch-in-generating-datasets-building","title":"A Free Lunch in Generating Datasets: Building a VQG and VQA System with Attention and Humans in the Loop","date":"2019-11-30","arxiv_id":"1912.00124","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-the-robustness-of-visual-question","title":"Assessing the Robustness of Visual Question Answering Models","date":"2019-11-30","arxiv_id":"1912.01452","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-keyword-extraction-for-full","title":"Unsupervised Keyword Extraction for Full-sentence VQA","date":"2019-11-23","arxiv_id":"1911.10354","repositories_listed":0,"syntology":null},{"url":null,"slug":"explanation-vs-attention-a-two-player-game-to","title":"Explanation vs Attention: A Two-Player Game to Obtain Attention for VQA","date":"2019-11-19","arxiv_id":"1911.08618","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-conditioned-counterfactual-image","title":"Question-Conditioned Counterfactual Image Generation for VQA","date":"2019-11-14","arxiv_id":"1911.06352","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-ended-visual-question-answering-by-multi","title":"Open-Ended Visual Question Answering by Multi-Modal Domain Adaptation","date":"2019-11-11","arxiv_id":"1911.04058","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-intelligence-representation","title":"Multimodal Intelligence: Representation Learning, Information Fusion, and Applications","date":"2019-11-10","arxiv_id":"1911.03977","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-we-asking-the-right-questions-in-movieqa","title":"Are we asking the right questions in MovieQA?","date":"2019-11-08","arxiv_id":"1911.03083","repositories_listed":0,"syntology":null},{"url":null,"slug":"representing-movie-characters-in-dialogues","title":"Representing Movie Characters in Dialogues","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"youmakeup-a-large-scale-domain-specific","title":"YouMakeup: A Large-Scale Domain-Specific Multimodal Dataset for Fine-Grained Semantic Comprehension","date":"2019-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-rich-image-region-representation-for","title":"Learning Rich Image Region Representation for Visual Question Answering","date":"2019-10-29","arxiv_id":"1910.13077","repositories_listed":0,"syntology":null},{"url":null,"slug":"enforcing-reasoning-in-visual-commonsense","title":"Enforcing Reasoning in Visual Commonsense Reasoning","date":"2019-10-21","arxiv_id":"1910.11124","repositories_listed":0,"syntology":null},{"url":null,"slug":"good-better-best-textual-distractors","title":"Good, Better, Best: Textual Distractors Generation for Multiple-Choice Visual Question Answering via Reinforcement Learning","date":"2019-10-21","arxiv_id":"1910.09134","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-memory-plasticity-for-anomaly","title":"Neural Memory Plasticity for Anomaly Detection","date":"2019-10-12","arxiv_id":"1910.05448","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-deep-analysis-for-multimedia","title":"Multi-modal Deep Analysis for Multimedia","date":"2019-10-11","arxiv_id":"1910.04964","repositories_listed":0,"syntology":null},{"url":null,"slug":"modulated-self-attention-convolutional","title":"Modulated Self-attention Convolutional Network for VQA","date":"2019-10-08","arxiv_id":"1910.03343","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-strings-to-things-knowledge-enabled-vqa","title":"From Strings to Things: Knowledge-Enabled VQA Model That Can Read and Reason","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"segeqa-video-segmentation-based-visual","title":"SegEQA: Video Segmentation Based Visual Attention for Embodied Question Answering","date":"2019-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-incorporating-semantic-prior-knowlegde-in-1","title":"On Incorporating Semantic Prior Knowledge in Deep Learning Through Embedding-Space Constraints","date":"2019-09-30","arxiv_id":"1909.13471","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-recognize-the-unseen-visual","title":"Learning to Recognize the Unseen Visual Predicates","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-incorporating-semantic-prior-knowlegde-in","title":"On Incorporating Semantic Prior Knowlegde in Deep Learning Through Embedding-Space Constraints","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uniter-learning-universal-image-text","title":"UNITER: Learning UNiversal Image-TExt Representations","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"why-does-the-vqa-model-answer-no-improving","title":"Why Does the VQA Model Answer No?: Improving Reasoning through Visual and Linguistic Inference","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"139d9ec749ad89c4fbc6a617ffc7faccb182d8dbc41e9aeeac8e92e12526a12c","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}