{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering/papers/19","list_of":"/task/visual-question-answering","task":"Visual Question Answering (VQA)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":19,"pages_in_order":22,"rows_per_page":100,"rows":[1801,1900],"of":2167,"counts":{"archive_papers_tagged":2167,"with_a_code_link":1039,"where_syntology_ran_a_sample":359,"not_listed_spam_title":0,"listed":2167,"listed_where_code_ran":359,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":287,"every_run_a_failure_of_syntologys_instrument":72,"listed_with_a_run_with_no_instrument_failure":287,"listed_every_run_a_failure_of_syntologys_instrument":72,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering","prev":"/task/visual-question-answering/papers/18","next":"/task/visual-question-answering/papers/20","papers":[{"url":null,"slug":"visual-grounding-strategies-for-text-only","title":"Visual Grounding Strategies for Text-Only Natural Language Processing","date":"2021-03-25","arxiv_id":"2103.13942","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-design-sample-and-computationally","title":"How to Design Sample and Computationally Efficient VQA Models","date":"2021-03-22","arxiv_id":"2103.11537","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-graphs-a-survey-of-generations-and","title":"A Comprehensive Survey of Scene Graphs: Generation and Application","date":"2021-03-17","arxiv_id":"2104.01111","repositories_listed":0,"syntology":null},{"url":null,"slug":"vmaf-and-variants-towards-a-unified-vqa","title":"VMAF And Variants: Towards A Unified VQA","date":"2021-03-13","arxiv_id":"2103.07770","repositories_listed":0,"syntology":null},{"url":null,"slug":"characterizing-misclassifications-of-deep-nlp","title":"Characterizing Misclassifications of Deep NLP Models","date":"2021-03-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-csdia-representation-learning-of-computer","title":"RL-CSDia: Representation Learning of Computer Science Diagrams","date":"2021-03-10","arxiv_id":"2103.05900","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-reasoning-paths-over-semantic-graphs-1","title":"Learning Reasoning Paths over Semantic Graphs for Video-grounded Dialogues","date":"2021-03-01","arxiv_id":"2103.00820","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-compositional-representation-for-few","title":"Learning Compositional Representation for Few-shot Visual Question Answering","date":"2021-02-21","arxiv_id":"2102.10575","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-on-the-generalization","title":"An Empirical Study on the Generalization Power of Neural Representations Learned via Visual Guessing Games","date":"2021-01-31","arxiv_id":"2102.00424","repositories_listed":0,"syntology":null},{"url":null,"slug":"unanswerable-questions-about-images-and-texts","title":"Unanswerable Questions about Images and Texts","date":"2021-01-25","arxiv_id":"2102.06793","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-based-on-local","title":"Visual Question Answering based on Local-Scene-Aware Referring Expression Generation","date":"2021-01-22","arxiv_id":"2101.08978","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-in-artificial-intelligence","title":"Understanding in Artificial Intelligence","date":"2021-01-17","arxiv_id":"2101.06573","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-variable-models-for-visual-question","title":"Latent Variable Models for Visual Question Answering","date":"2021-01-16","arxiv_id":"2101.06399","repositories_listed":0,"syntology":null},{"url":null,"slug":"reasoning-over-vision-and-language-exploring","title":"Reasoning over Vision and Language: Exploring the Benefits of Supplemental Knowledge","date":"2021-01-15","arxiv_id":"2101.06013","repositories_listed":0,"syntology":null},{"url":null,"slug":"recent-advances-in-video-question-answering-a","title":"Recent Advances in Video Question Answering: A Review of Datasets and Methods","date":"2021-01-15","arxiv_id":"2101.05954","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-role-of-scene-graphs-in","title":"Understanding the Role of Scene Graphs in Visual Question Answering","date":"2021-01-14","arxiv_id":"2101.05479","repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-relative-depth-between-objects","title":"Predicting Relative Depth between Objects from Semantic Features","date":"2021-01-12","arxiv_id":"2101.04626","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformers-in-vision-a-survey","title":"Transformers in Vision: A Survey","date":"2021-01-04","arxiv_id":"2101.01169","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentiable-end-to-end-program-executor","title":"Differentiable End-to-End Program Executor for Sample and Computationally Efficient VQA","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"erasure-for-advancing-dynamic-self-supervised","title":"Erasure for Advancing: Dynamic Self-Supervised Learning for Commonsense Reasoning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-graph-attention-network-for-few","title":"Hierarchical Graph Attention Network for Few-Shot Visual-Semantic Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"linguistically-routing-capsule-network-for","title":"Linguistically Routing Capsule Network for Out-of-Distribution Visual Question Answering","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unshuffling-data-for-improved-generalization-1","title":"Unshuffling Data for Improved Generalization in Visual Question Answering","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-is-knowing-fact-based-visual-question","title":"Seeing is Knowing! Fact-based Visual Question Answering using Knowledge Graph Embeddings","date":"2020-12-31","arxiv_id":"2012.15484","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-centric-diagnosis-of-visual-reasoning","title":"Object-Centric Diagnosis of Visual Reasoning","date":"2020-12-21","arxiv_id":"2012.11587","repositories_listed":0,"syntology":null},{"url":"/paper/krisp-integrating-implicit-and-symbolic","slug":"krisp-integrating-implicit-and-symbolic","title":"KRISP: Integrating Implicit and Symbolic Knowledge for Open-Domain Knowledge-Based VQA","date":"2020-12-20","arxiv_id":"2012.11014","repositories_listed":0,"syntology":null},{"url":null,"slug":"trying-bilinear-pooling-in-video-qa","title":"Trying Bilinear Pooling in Video-QA","date":"2020-12-18","arxiv_id":"2012.10285","repositories_listed":0,"syntology":null},{"url":"/paper/kvl-bert-knowledge-enhanced-visual-and","slug":"kvl-bert-knowledge-enhanced-visual-and","title":"KVL-BERT: Knowledge Enhanced Visual-and-Linguistic BERT for Visual Commonsense Reasoning","date":"2020-12-13","arxiv_id":"2012.07000","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-vqa-answering-visual","title":"WeaQA: Weak Supervision via Captions for Visual Question Answering","date":"2020-12-04","arxiv_id":"2012.02356","repositories_listed":0,"syntology":null},{"url":"/paper/a-unified-framework-for-multilingual-and-code","slug":"a-unified-framework-for-multilingual-and-code","title":"A Unified Framework for Multilingual and Code-Mixed Visual Question Answering","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-graph-networks-for-compositional","title":"Multimodal Graph Networks for Compositional Generalization in Visual Question Answering","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"modular-graph-attention-network-for-complex","title":"Modular Graph Attention Network for Complex Visual Relational Reasoning","date":"2020-11-22","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"logically-consistent-loss-for-visual-question","title":"Logically Consistent Loss for Visual Question Answering","date":"2020-11-19","arxiv_id":"2011.10094","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-natural-questions-from-images-for","title":"Generating Natural Questions from Images for Multimodal Assistants","date":"2020-11-17","arxiv_id":"2012.03678","repositories_listed":0,"syntology":null},{"url":null,"slug":"reasoning-over-history-context-aware-visual","title":"Reasoning Over History: Context Aware Visual Dialog","date":"2020-11-02","arxiv_id":"2011.00669","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-pre-training-help-vqa-with-lexical","title":"Can Pre-training help VQA with Lexical Variations?","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"capwap-image-captioning-with-a-purpose","title":"CapWAP: Image Captioning with a Purpose","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"isaaq-mastering-textbook-questions-with-pre-1","title":"ISAAQ - Mastering Textbook Questions with Pre-trained Transformers and Bottom-Up and Top-Down Attention","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-learning-and-reasoning-on","title":"Representation, Learning and Reasoning on Spatial Language for Downstream NLP Tasks","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stl-cqa-structure-based-transformers-with","title":"STL-CQA: Structure-based Transformers with Localization and Encoding for Chart Question Answering","date":"2020-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-visual-question-answering-to","title":"Leveraging Visual Question Answering to Improve Text-to-Image Synthesis","date":"2020-10-28","arxiv_id":"2010.14953","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-vqa-generating-multi-word-answer-and","title":"Beyond VQA: Generating Multi-word Answer and Rationale to Visual Questions","date":"2020-10-24","arxiv_id":"2010.12852","repositories_listed":0,"syntology":null},{"url":null,"slug":"answer-checking-in-context-a-multi-modal","title":"Answer-checking in Context: A Multi-modal FullyAttention Network for Visual Question Answering","date":"2020-10-17","arxiv_id":"2010.08708","repositories_listed":0,"syntology":null},{"url":null,"slug":"new-ideas-and-trends-in-deep-multimodal","title":"New Ideas and Trends in Deep Multimodal Content Understanding: A Review","date":"2020-10-16","arxiv_id":"2010.08189","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-my-multimodal-model-learn-cross-modal","title":"Does my multimodal model learn cross-modal interactions? It's harder to tell than you might think!","date":"2020-10-13","arxiv_id":"2010.06572","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-neural-computation-for-real","title":"Interpretable Neural Computation for Real-World Compositional Visual Question Answering","date":"2020-10-10","arxiv_id":"2010.04913","repositories_listed":0,"syntology":null},{"url":"/paper/characterizing-datasets-for-social-visual","slug":"characterizing-datasets-for-social-visual","title":"Characterizing Datasets for Social Visual Question Answering, and the New TinySocial Dataset","date":"2020-10-08","arxiv_id":"2010.11997","repositories_listed":0,"syntology":null},{"url":null,"slug":"finding-the-evidence-localization-aware","title":"Finding the Evidence: Localization-aware Answer Prediction for Text Visual Question Answering","date":"2020-10-06","arxiv_id":"2010.02582","repositories_listed":0,"syntology":null},{"url":null,"slug":"pathological-visual-question-answering-1","title":"Pathological Visual Question Answering","date":"2020-10-06","arxiv_id":"2010.12435","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-guided-semantic-relationship","title":"Attention Guided Semantic Relationship Parsing for Visual Question Answering","date":"2020-10-05","arxiv_id":"2010.01725","repositories_listed":0,"syntology":null},{"url":null,"slug":"caption-correction-by-analyses-pos-tagging","title":"CAPTION: Correction by Analyses, POS-Tagging and Interpretation of Objects using only Nouns","date":"2020-10-02","arxiv_id":"2010.00839","repositories_listed":0,"syntology":null},{"url":null,"slug":"isaaq-mastering-textbook-questions-with-pre","title":"ISAAQ -- Mastering Textbook Questions with Pre-trained Transformers and Bottom-Up and Top-Down Attention","date":"2020-10-01","arxiv_id":"2010.00562","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-based-heuristic-search-for-module","title":"Graph-based Heuristic Search for Module Selection Procedure in Neural Module Network","date":"2020-09-30","arxiv_id":"2009.14759","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-attention-as-an-interface-for-image","title":"Spatial Attention as an Interface for Image Captioning Models","date":"2020-09-29","arxiv_id":"2010.11701","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularizing-attention-networks-for-anomaly","title":"Regularizing Attention Networks for Anomaly Detection in Visual Question Answering","date":"2020-09-21","arxiv_id":"2009.10054","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multimodal-memes-classification-a-survey","title":"A Multimodal Memes Classification: A Survey and Open Research Issues","date":"2020-09-17","arxiv_id":"2009.08395","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-knowledge-reasoning-for-knowledge","title":"Cross-modal Knowledge Reasoning for Knowledge-based Visual Question Answering","date":"2020-08-31","arxiv_id":"2009.00145","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-on-image-sets","title":"Visual Question Answering on Image Sets","date":"2020-08-27","arxiv_id":"2008.11976","repositories_listed":0,"syntology":null},{"url":null,"slug":"document-visual-question-answering-challenge","title":"Document Visual Question Answering Challenge 2020","date":"2020-08-20","arxiv_id":"2008.08899","repositories_listed":0,"syntology":null},{"url":null,"slug":"linguistically-aware-attention-for-reducing","title":"Linguistically-aware Attention for Reducing the Semantic-Gap in Vision-Language Tasks","date":"2020-08-18","arxiv_id":"2008.08012","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-edit-distance-reward-learning-to-edit","title":"Graph Edit Distance Reward: Learning to Edit Scene Graph","date":"2020-08-15","arxiv_id":"2008.06651","repositories_listed":0,"syntology":null},{"url":null,"slug":"assisting-scene-graph-generation-with-self","title":"Assisting Scene Graph Generation with Self-Supervision","date":"2020-08-08","arxiv_id":"2008.03555","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-visual-reasoning-via","title":"Interpretable Visual Reasoning via Probabilistic Formulation under Natural Supervision","date":"2020-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"trrnet-tiered-relation-reasoning-for","title":"TRRNet: Tiered Relation Reasoning for Compositional Visual Question Answering","date":"2020-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-visual-linguistic-pretraining","title":"Contrastive Visual-Linguistic Pretraining","date":"2020-07-26","arxiv_id":"2007.13135","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-language-biases-in-visual-question","title":"Reducing Language Biases in Visual Question Answering with Visually-Grounded Question Encoder","date":"2020-07-13","arxiv_id":"2007.06198","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-with-compositional-neural","title":"Image Captioning with Compositional Neural Module Networks","date":"2020-07-10","arxiv_id":"2007.05608","repositories_listed":0,"syntology":null},{"url":null,"slug":"eliminating-catastrophic-interference-with","title":"Eliminating Catastrophic Interference with Biased Competition","date":"2020-07-03","arxiv_id":"2007.02833","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-as-a-multi-task","title":"Visual Question Answering as a Multi-Task Problem","date":"2020-07-03","arxiv_id":"2007.01780","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-graph-reasoning-for-visual-question","title":"Scene Graph Reasoning for Visual Question Answering","date":"2020-07-02","arxiv_id":"2007.01072","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-impact-of-explanations-on-ai-competency","title":"The Impact of Explanations on AI Competency Prediction in VQA","date":"2020-07-02","arxiv_id":"2007.00900","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligned-dual-channel-graph-convolutional","title":"Aligned Dual Channel Graph Convolutional Network for Visual Question Answering","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-neural-graph-memory-networks-for","title":"Multimodal Neural Graph Memory Networks for Visual Question Answering","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-visual-dialog-for-radiology","title":"Towards Visual Dialog for Radiology","date":"2020-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/ernie-vil-knowledge-enhanced-vision-language","slug":"ernie-vil-knowledge-enhanced-vision-language","title":"ERNIE-ViL: Knowledge Enhanced Vision-Language Representations Through Scene Graph","date":"2020-06-30","arxiv_id":"2006.16934","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-vqa-and-its-explanations-by","title":"Improving VQA and its Explanations \\\\ by Comparing Competing Explanations","date":"2020-06-28","arxiv_id":"2006.15631","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-segregating-and-coordinated-segregating","title":"Self-Segregating and Coordinated-Segregating Transformer for Focused Deep Multi-Modular Network for Visual Question Answering","date":"2020-06-25","arxiv_id":"2006.14264","repositories_listed":0,"syntology":null},{"url":"/paper/neuro-symbolic-visual-reasoning-disentangling","slug":"neuro-symbolic-visual-reasoning-disentangling","title":"Neuro-Symbolic Visual Reasoning: Disentangling \"Visual\" from \"Reasoning\"","date":"2020-06-20","arxiv_id":"2006.11524","repositories_listed":0,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/neuro-symbolic-visual-reasoning-disentangling#ran","syntology_url":"https://syntology.ai/paper/2006.11524","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2006.11524"}},"official":null}},{"url":null,"slug":"mucko-multi-layer-cross-modal-knowledge","title":"Mucko: Multi-Layer Cross-Modal Knowledge Reasoning for Fact-based Visual Question Answering","date":"2020-06-16","arxiv_id":"2006.09073","repositories_listed":0,"syntology":null},{"url":null,"slug":"ord-object-relationship-discovery-for-visual","title":"ORD: Object Relationship Discovery for Visual Dialogue Generation","date":"2020-06-15","arxiv_id":"2006.08322","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-weaknesses-of-vqa-models-through","title":"Exploring Weaknesses of VQA Models through Attribution Driven Insights","date":"2020-06-11","arxiv_id":"2006.06637","repositories_listed":0,"syntology":null},{"url":null,"slug":"estimating-semantic-structure-for-the-vqa","title":"Estimating semantic structure for the VQA answer space","date":"2020-06-10","arxiv_id":"2006.05726","repositories_listed":0,"syntology":null},{"url":null,"slug":"counterfactual-vision-and-language-learning","title":"Counterfactual Vision and Language Learning","date":"2020-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-grid-features-and-cell-pointers","title":"Multimodal grid features and cell pointers for Scene Text Visual Question Answering","date":"2020-06-01","arxiv_id":"2006.00923","repositories_listed":0,"syntology":null},{"url":null,"slug":"ta-student-vqa-multi-agents-training-by-self","title":"TA-Student VQA: Multi-Agents Training by Self-Questioning","date":"2020-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-value-of-out-of-distribution-testing","title":"On the Value of Out-of-Distribution Testing: An Example of Goodhart's Law","date":"2020-05-19","arxiv_id":"2005.09241","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-relationship-detection-using-scene","title":"Visual Relationship Detection using Scene Graphs: A Survey","date":"2020-05-16","arxiv_id":"2005.08045","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-with-prior-class","title":"Visual Question Answering with Prior Class Semantics","date":"2020-05-04","arxiv_id":"2005.01239","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-corpus-for-visual-question-answering","title":"A Corpus for Visual Question Answering Annotated with Frame Semantic Information","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"image-position-prediction-in-multimodal","title":"Image Position Prediction in Multimodal Documents","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-attention-based-aggregation-function","title":"A Novel Attention-based Aggregation Function to Combine Vision and Language","date":"2020-04-27","arxiv_id":"2004.13073","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-using-semantic","title":"Visual Question Answering Using Semantic Information from Image Descriptions","date":"2020-04-23","arxiv_id":"2004.10966","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-what-makes-a-difference-from","title":"Learning What Makes a Difference from Counterfactual Examples and Gradient Supervision","date":"2020-04-20","arxiv_id":"2004.09034","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-we-pretraining-it-right-digging-deeper","title":"Are we pretraining it right? Digging deeper into visio-linguistic pretraining","date":"2020-04-19","arxiv_id":"2004.08744","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-based-visual-question-answering-in","title":"Knowledge-Based Visual Question Answering in Videos","date":"2020-04-17","arxiv_id":"2004.08385","repositories_listed":0,"syntology":null},{"url":null,"slug":"rephrasing-visual-questions-by-specifying-the","title":"Rephrasing visual questions by specifying the entropy of the answer distribution","date":"2020-04-10","arxiv_id":"2004.04963","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-knowledge-gaps-in-visual","title":"Understanding Knowledge Gaps in Visual Question Answering: Implications for Gap Identification and Testing","date":"2020-04-08","arxiv_id":"2004.03755","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-rationales-in-visual-question","title":"Generating Rationales in Visual Question Answering","date":"2020-04-04","arxiv_id":"2004.02032","repositories_listed":0,"syntology":null},{"url":"/paper/assessing-image-quality-issues-for-real-world","slug":"assessing-image-quality-issues-for-real-world","title":"Assessing Image Quality Issues for Real-World Problems","date":"2020-03-27","arxiv_id":"2003.12511","repositories_listed":0,"syntology":null},{"url":null,"slug":"linguistically-driven-graph-capsule-network","title":"Linguistically Driven Graph Capsule Network for Visual Question Reasoning","date":"2020-03-23","arxiv_id":"2003.10065","repositories_listed":0,"syntology":null}],"record_sha256":"731b0169d6a783d79afb59818c0cd8d6f22795369a9ab546679f26ea3b2a3f6e","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}