{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering-1/papers/10","list_of":"/task/visual-question-answering-1","task":"Visual Question Answering","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":10,"pages_in_order":22,"rows_per_page":100,"rows":[901,1000],"of":2177,"counts":{"archive_papers_tagged":2177,"with_a_code_link":1042,"where_syntology_ran_a_sample":378,"not_listed_spam_title":0,"listed":2177,"listed_where_code_ran":378,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":308,"every_run_a_failure_of_syntologys_instrument":70,"listed_with_a_run_with_no_instrument_failure":308,"listed_every_run_a_failure_of_syntologys_instrument":70,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering-1","prev":"/task/visual-question-answering-1/papers/9","next":"/task/visual-question-answering-1/papers/11","papers":[{"url":"/paper/mdetr-modulated-detection-for-end-to-end-1","slug":"mdetr-modulated-detection-for-end-to-end-1","title":"MDETR - Modulated Detection for End-to-End Multi-Modal Understanding","date":"2021-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/multimodal-co-attention-transformer-for","slug":"multimodal-co-attention-transformer-for","title":"Multimodal Co-Attention Transformer for Survival Prediction in Gigapixel Whole Slide Images","date":"2021-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/pano-avqa-grounded-audio-visual-question","slug":"pano-avqa-grounded-audio-visual-question","title":"Pano-AVQA: Grounded Audio-Visual Question Answering on 360deg Videos","date":"2021-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/trar-routing-the-attention-spans-in","slug":"trar-routing-the-attention-spans-in","title":"TRAR: Routing the Attention Spans in Transformer for Visual Question Answering","date":"2021-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/detecting-hate-speech-in-multi-modal-memes","slug":"detecting-hate-speech-in-multi-modal-memes","title":"Detecting Hate Speech in Multi-modal Memes","date":"2020-12-29","arxiv_id":"2012.14891","repositories_listed":1,"syntology":null},{"url":"/paper/learning-content-and-context-with-language","slug":"learning-content-and-context-with-language","title":"Learning content and context with language bias for Visual Question Answering","date":"2020-12-21","arxiv_id":"2012.11134","repositories_listed":1,"syntology":null},{"url":"/paper/overcoming-language-priors-with-self","slug":"overcoming-language-priors-with-self","title":"Overcoming Language Priors with Self-supervised Learning for Visual Question Answering","date":"2020-12-17","arxiv_id":"2012.11528","repositories_listed":1,"syntology":{"n":8,"n_ran":7,"n_constructed":3,"n_ran_checked":5,"n_instrument":2,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":5,"n_pointer_only":8,"phrase":"7 ran (of which 3 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 2 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/overcoming-language-priors-with-self#ran","syntology_url":"https://syntology.ai/paper/2012.11528","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2012.11528"}},"official":{"repos":["CrossmodalGroup/SSL-VQA"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":3,"n_ran_no_instrument_failure":5,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/knowledge-routed-visual-question-reasoning","slug":"knowledge-routed-visual-question-reasoning","title":"Knowledge-Routed Visual Question Reasoning: Challenges for Deep Representation Embedding","date":"2020-12-14","arxiv_id":"2012.07192","repositories_listed":1,"syntology":null},{"url":"/paper/simple-is-not-easy-a-simple-strong-baseline","slug":"simple-is-not-easy-a-simple-strong-baseline","title":"Simple is not Easy: A Simple Strong Baseline for TextVQA and TextCaps","date":"2020-12-09","arxiv_id":"2012.05153","repositories_listed":1,"syntology":null},{"url":"/paper/just-ask-learning-to-answer-questions-from","slug":"just-ask-learning-to-answer-questions-from","title":"Just Ask: Learning to Answer Questions from Millions of Narrated Videos","date":"2020-12-01","arxiv_id":"2012.00451","repositories_listed":1,"syntology":null},{"url":"/paper/towards-knowledge-augmented-visual-question","slug":"towards-knowledge-augmented-visual-question","title":"Towards Knowledge-Augmented Visual Question Answering","date":"2020-12-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/point-and-ask-incorporating-pointing-into","slug":"point-and-ask-incorporating-pointing-into","title":"Point and Ask: Incorporating Pointing into Visual Question Answering","date":"2020-11-27","arxiv_id":"2011.13681","repositories_listed":1,"syntology":null},{"url":"/paper/learning-from-lexical-perturbations-for","slug":"learning-from-lexical-perturbations-for","title":"Learning from Lexical Perturbations for Consistent Visual Question Answering","date":"2020-11-26","arxiv_id":"2011.13406","repositories_listed":1,"syntology":null},{"url":"/paper/large-scale-multimodal-classification-using","slug":"large-scale-multimodal-classification-using","title":"Large Scale Multimodal Classification Using an Ensemble of Transformer Models and Co-Attention","date":"2020-11-23","arxiv_id":"2011.11735","repositories_listed":1,"syntology":null},{"url":"/paper/siamese-tracking-with-lingual-object","slug":"siamese-tracking-with-lingual-object","title":"Siamese Tracking with Lingual Object Constraints","date":"2020-11-23","arxiv_id":"2011.11721","repositories_listed":1,"syntology":null},{"url":"/paper/capwap-captioning-with-a-purpose","slug":"capwap-captioning-with-a-purpose","title":"CapWAP: Captioning with a Purpose","date":"2020-11-09","arxiv_id":"2011.04264","repositories_listed":1,"syntology":null},{"url":"/paper/learning-to-model-and-ignore-dataset-bias","slug":"learning-to-model-and-ignore-dataset-bias","title":"Learning to Model and Ignore Dataset Bias with Mixed Capacity Ensembles","date":"2020-11-07","arxiv_id":"2011.03856","repositories_listed":1,"syntology":{"n":18,"n_ran":10,"n_constructed":5,"n_ran_checked":8,"n_instrument":2,"n_unverified":8,"n_honours":2,"n_violates":1,"n_no_contract":5,"n_pointer_only":0,"phrase":"10 ran (of which 5 constructed an object rather than computing a result; 8 with no instrument failure: 2 honoured, 1 violated, 5 with no contract checked; 2 where Syntology's instrument failed) · 8 unverified","sample_list":"/paper/learning-to-model-and-ignore-dataset-bias#ran","syntology_url":"https://syntology.ai/paper/2011.03856","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2011.03856"}},"official":{"repos":["chrisc36/autobias"],"state":"official (archive's flag): 10 ran","n_ran":10,"n_constructed":5,"n_ran_no_instrument_failure":8,"n_unverified":8,"ran_from_kinds":["official"]}}},{"url":"/paper/disentangling-3d-prototypical-networks-for-1","slug":"disentangling-3d-prototypical-networks-for-1","title":"Disentangling 3D Prototypical Networks For Few-Shot Concept Learning","date":"2020-11-06","arxiv_id":"2011.03367","repositories_listed":1,"syntology":null},{"url":"/paper/an-improved-attention-for-visual-question","slug":"an-improved-attention-for-visual-question","title":"An Improved Attention for Visual Question Answering","date":"2020-11-04","arxiv_id":"2011.02164","repositories_listed":1,"syntology":null},{"url":"/paper/learning-to-contrast-the-counterfactual","slug":"learning-to-contrast-the-counterfactual","title":"Learning to Contrast the Counterfactual Samples for Robust Visual Question Answering","date":"2020-11-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/loss-rescaling-vqa-revisiting-language-prior","slug":"loss-rescaling-vqa-revisiting-language-prior","title":"Loss re-scaling VQA: Revisiting the LanguagePrior Problem from a Class-imbalance View","date":"2020-10-30","arxiv_id":"2010.16010","repositories_listed":1,"syntology":{"n":6,"n_ran":5,"n_constructed":0,"n_ran_checked":4,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":1,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/loss-rescaling-vqa-revisiting-language-prior#ran","syntology_url":"https://syntology.ai/paper/2010.16010","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2010.16010"}},"official":{"repos":["guoyang9/class-imbalance-VQA"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/mmft-bert-multimodal-fusion-transformer-with","slug":"mmft-bert-multimodal-fusion-transformer-with","title":"MMFT-BERT: Multimodal Fusion Transformer with BERT Encodings for Visual Question Answering","date":"2020-10-27","arxiv_id":"2010.14095","repositories_listed":1,"syntology":null},{"url":"/paper/ruart-a-novel-text-centered-solution-for-text","slug":"ruart-a-novel-text-centered-solution-for-text","title":"RUArt: A Novel Text-Centered Solution for Text-Based Visual Question Answering","date":"2020-10-24","arxiv_id":"2010.12917","repositories_listed":1,"syntology":null},{"url":"/paper/removing-bias-in-multi-modal-classifiers","slug":"removing-bias-in-multi-modal-classifiers","title":"Removing Bias in Multi-modal Classifiers: Regularization by Maximizing Functional Entropies","date":"2020-10-21","arxiv_id":"2010.10802","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"0 ran · 1 unverified","sample_list":"/paper/removing-bias-in-multi-modal-classifiers#ran","syntology_url":"https://syntology.ai/paper/2010.10802","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2010.10802"}},"official":{"repos":["itaigat/removing-bias-in-multi-modal-classifiers"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/bayesian-attention-modules","slug":"bayesian-attention-modules","title":"Bayesian Attention Modules","date":"2020-10-20","arxiv_id":"2010.10604","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"0 ran · 1 unverified","sample_list":"/paper/bayesian-attention-modules#ran","syntology_url":"https://syntology.ai/paper/2010.10604","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2010.10604"}},"official":{"repos":["zhougroup/BAM"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/sort-ing-vqa-models-contrastive-gradient","slug":"sort-ing-vqa-models-contrastive-gradient","title":"SOrT-ing VQA Models : Contrastive Gradient Learning for Improved Consistency","date":"2020-10-20","arxiv_id":"2010.10038","repositories_listed":1,"syntology":{"n":4,"n_ran":2,"n_constructed":0,"n_ran_checked":0,"n_instrument":2,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":4,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/sort-ing-vqa-models-contrastive-gradient#ran","syntology_url":"https://syntology.ai/paper/2010.10038","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2010.10038"}},"official":{"repos":["sameerdharur/sorting-vqa"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/natural-language-rationales-with-full-stack","slug":"natural-language-rationales-with-full-stack","title":"Natural Language Rationales with Full-Stack Visual Reasoning: From Pixels to Semantic Frames to Commonsense Graphs","date":"2020-10-15","arxiv_id":"2010.07526","repositories_listed":1,"syntology":null},{"url":"/paper/contrast-and-classify-alternate-training-for","slug":"contrast-and-classify-alternate-training-for","title":"Contrast and Classify: Training Robust VQA Models","date":"2020-10-13","arxiv_id":"2010.06087","repositories_listed":1,"syntology":null},{"url":"/paper/hierarchical-deep-multi-modal-network-for","slug":"hierarchical-deep-multi-modal-network-for","title":"Hierarchical Deep Multi-modal Network for Medical Visual Question Answering","date":"2020-09-27","arxiv_id":"2009.12770","repositories_listed":1,"syntology":null},{"url":"/paper/multiple-interaction-learning-with-question","slug":"multiple-interaction-learning-with-question","title":"Multiple interaction learning with question-type prior knowledge for constraining answer search space in visual question answering","date":"2020-09-23","arxiv_id":"2009.11118","repositories_listed":1,"syntology":null},{"url":"/paper/a-comparison-of-pre-trained-vision-and","slug":"a-comparison-of-pre-trained-vision-and","title":"A Comparison of Pre-trained Vision-and-Language Models for Multimodal Representation Learning across Medical Images and Reports","date":"2020-09-03","arxiv_id":"2009.01523","repositories_listed":1,"syntology":null},{"url":"/paper/a-dataset-and-baselines-for-visual-question","slug":"a-dataset-and-baselines-for-visual-question","title":"A Dataset and Baselines for Visual Question Answering on Art","date":"2020-08-28","arxiv_id":"2008.12520","repositories_listed":1,"syntology":null},{"url":"/paper/devlbert-learning-deconfounded-visio","slug":"devlbert-learning-deconfounded-visio","title":"DeVLBert: Learning Deconfounded Visio-Linguistic Representations","date":"2020-08-16","arxiv_id":"2008.06884","repositories_listed":1,"syntology":null},{"url":"/paper/rexup-i-reason-i-extract-i-update-with","slug":"rexup-i-reason-i-extract-i-update-with","title":"REXUP: I REason, I EXtract, I UPdate with Structured Compositional Reasoning for Visual Question Answering","date":"2020-07-27","arxiv_id":"2007.13262","repositories_listed":1,"syntology":null},{"url":"/paper/semantic-equivalent-adversarial-data","slug":"semantic-equivalent-adversarial-data","title":"Semantic Equivalent Adversarial Data Augmentation for Visual Question Answering","date":"2020-07-19","arxiv_id":"2007.09592","repositories_listed":1,"syntology":null},{"url":"/paper/learning-to-discretely-compose-reasoning","slug":"learning-to-discretely-compose-reasoning","title":"Learning to Discretely Compose Reasoning Module Networks for Video Captioning","date":"2020-07-17","arxiv_id":"2007.09049","repositories_listed":1,"syntology":null},{"url":"/paper/applying-recent-advances-in-visual-question","slug":"applying-recent-advances-in-visual-question","title":"Applying recent advances in Visual Question Answering to Record Linkage","date":"2020-07-12","arxiv_id":"2007.05881","repositories_listed":1,"syntology":null},{"url":"/paper/iq-vqa-intelligent-visual-question-answering","slug":"iq-vqa-intelligent-visual-question-answering","title":"IQ-VQA: Intelligent Visual Question Answering","date":"2020-07-08","arxiv_id":"2007.04422","repositories_listed":1,"syntology":null},{"url":"/paper/ontology-guided-semantic-composition-for-zero","slug":"ontology-guided-semantic-composition-for-zero","title":"Ontology-guided Semantic Composition for Zero-Shot Learning","date":"2020-06-30","arxiv_id":"2006.16917","repositories_listed":1,"syntology":null},{"url":"/paper/graph-optimal-transport-for-cross-domain","slug":"graph-optimal-transport-for-cross-domain","title":"Graph Optimal Transport for Cross-Domain Alignment","date":"2020-06-26","arxiv_id":"2006.14744","repositories_listed":1,"syntology":{"n":10,"n_ran":9,"n_constructed":0,"n_ran_checked":9,"n_instrument":0,"n_unverified":1,"n_honours":1,"n_violates":2,"n_no_contract":6,"n_pointer_only":3,"phrase":"9 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 1 honoured, 2 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/graph-optimal-transport-for-cross-domain#ran","syntology_url":"https://syntology.ai/paper/2006.14744","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2006.14744"}},"official":{"repos":["LiqunChen0606/Graph-Optimal-Transport"],"state":"official (archive's flag): 9 ran","n_ran":9,"n_constructed":0,"n_ran_no_instrument_failure":9,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/closed-loop-neural-symbolic-learning-via","slug":"closed-loop-neural-symbolic-learning-via","title":"Closed Loop Neural-Symbolic Learning via Integrating Neural Perception, Grammar Parsing, and Symbolic Reasoning","date":"2020-06-11","arxiv_id":"2006.06649","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":2,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/closed-loop-neural-symbolic-learning-via#ran","syntology_url":"https://syntology.ai/paper/2006.06649","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2006.06649"}},"official":{"repos":["liqing-ustc/NGS"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/roses-are-red-violets-are-blue-but-should-vqa","slug":"roses-are-red-violets-are-blue-but-should-vqa","title":"Roses Are Red, Violets Are Blue... but Should Vqa Expect Them To?","date":"2020-06-09","arxiv_id":"2006.05121","repositories_listed":1,"syntology":null},{"url":"/paper/attention-based-context-aware-reasoning-for","slug":"attention-based-context-aware-reasoning-for","title":"Attention-Based Context Aware Reasoning for Situation Recognition","date":"2020-06-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/cross-modality-relevance-for-reasoning-on","slug":"cross-modality-relevance-for-reasoning-on","title":"Cross-Modality Relevance for Reasoning on Language and Vision","date":"2020-05-12","arxiv_id":"2005.06035","repositories_listed":1,"syntology":null},{"url":"/paper/cobra-contrastive-bi-modal-representation","slug":"cobra-contrastive-bi-modal-representation","title":"COBRA: Contrastive Bi-Modal Representation Algorithm","date":"2020-05-07","arxiv_id":"2005.03687","repositories_listed":1,"syntology":{"n":4,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/cobra-contrastive-bi-modal-representation#ran","syntology_url":"https://syntology.ai/paper/2005.03687","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2005.03687"}},"official":{"repos":["ovshake/cobra"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/dynamic-language-binding-in-relational-visual","slug":"dynamic-language-binding-in-relational-visual","title":"Dynamic Language Binding in Relational Visual Reasoning","date":"2020-04-30","arxiv_id":"2004.14603","repositories_listed":1,"syntology":{"n":9,"n_ran":6,"n_constructed":5,"n_ran_checked":6,"n_instrument":0,"n_unverified":3,"n_honours":0,"n_violates":0,"n_no_contract":6,"n_pointer_only":0,"phrase":"6 ran (of which 5 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/dynamic-language-binding-in-relational-visual#ran","syntology_url":"https://syntology.ai/paper/2004.14603","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2004.14603"}},"official":null}},{"url":"/paper/pragmatic-issue-sensitive-image-captioning","slug":"pragmatic-issue-sensitive-image-captioning","title":"Pragmatic Issue-Sensitive Image Captioning","date":"2020-04-29","arxiv_id":"2004.14451","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":2,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/pragmatic-issue-sensitive-image-captioning#ran","syntology_url":"https://syntology.ai/paper/2004.14451","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2004.14451"}},"official":{"repos":["windweller/Pragmatic-ISIC"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["unlocated"]}}},{"url":"/paper/deep-multimodal-neural-architecture-search","slug":"deep-multimodal-neural-architecture-search","title":"Deep Multimodal Neural Architecture Search","date":"2020-04-25","arxiv_id":"2004.12070","repositories_listed":1,"syntology":null},{"url":"/paper/a-negative-case-analysis-of-visual-grounding","slug":"a-negative-case-analysis-of-visual-grounding","title":"Visual Grounding Methods for VQA are Working for the Wrong Reasons!","date":"2020-04-12","arxiv_id":"2004.05704","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":2,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/a-negative-case-analysis-of-visual-grounding#ran","syntology_url":"https://syntology.ai/paper/2004.05704","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2004.05704"}},"official":{"repos":["erobic/negative_analysis_of_grounding"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/which-visual-questions-are-difficult-to","slug":"which-visual-questions-are-difficult-to","title":"An Entropy Clustering Approach for Assessing Visual Question Difficulty","date":"2020-04-12","arxiv_id":"2004.05595","repositories_listed":1,"syntology":null},{"url":"/paper/evaluating-multimodal-representations-on-1","slug":"evaluating-multimodal-representations-on-1","title":"Evaluating Multimodal Representations on Visual Semantic Textual Similarity","date":"2020-04-04","arxiv_id":"2004.01894","repositories_listed":1,"syntology":null},{"url":"/paper/pixel-bert-aligning-image-pixels-with-text-by","slug":"pixel-bert-aligning-image-pixels-with-text-by","title":"Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers","date":"2020-04-02","arxiv_id":"2004.00849","repositories_listed":1,"syntology":null},{"url":"/paper/p-approx-np-at-least-in-visual-question","slug":"p-approx-np-at-least-in-visual-question","title":"P $\\approx$ NP, at least in Visual Question Answering","date":"2020-03-26","arxiv_id":"2003.11844","repositories_listed":1,"syntology":null},{"url":"/paper/mqa-answering-the-question-via-robotic","slug":"mqa-answering-the-question-via-robotic","title":"MQA: Answering the Question via Robotic Manipulation","date":"2020-03-10","arxiv_id":"2003.04641","repositories_listed":1,"syntology":null},{"url":"/paper/noise-estimation-using-density-estimation-for","slug":"noise-estimation-using-density-estimation-for","title":"Noise Estimation Using Density Estimation for Self-Supervised Multimodal Learning","date":"2020-03-06","arxiv_id":"2003.03186","repositories_listed":1,"syntology":null},{"url":"/paper/a-question-centric-model-for-visual-question","slug":"a-question-centric-model-for-visual-question","title":"A Question-Centric Model for Visual Question Answering in Medical Imaging","date":"2020-03-02","arxiv_id":"2003.08760","repositories_listed":1,"syntology":null},{"url":"/paper/sparse-and-structured-visual-attention-1","slug":"sparse-and-structured-visual-attention-1","title":"Sparse and Structured Visual Attention","date":"2020-02-13","arxiv_id":"2002.05556","repositories_listed":1,"syntology":null},{"url":"/paper/multimodal-fusion-of-imaging-and-genomics-for","slug":"multimodal-fusion-of-imaging-and-genomics-for","title":"Multimodal fusion of imaging and genomics for lung cancer recurrence prediction","date":"2020-02-05","arxiv_id":"2002.01982","repositories_listed":1,"syntology":null},{"url":"/paper/augmenting-visual-question-answering-with","slug":"augmenting-visual-question-answering-with","title":"Augmenting Visual Question Answering with Semantic Frame Information in a Multitask Learning Approach","date":"2020-01-31","arxiv_id":"2001.11673","repositories_listed":1,"syntology":null},{"url":"/paper/robust-explanations-for-visual-question","slug":"robust-explanations-for-visual-question","title":"Robust Explanations for Visual Question Answering","date":"2020-01-23","arxiv_id":"2001.08730","repositories_listed":1,"syntology":null},{"url":"/paper/recommending-themes-for-ad-creative-design","slug":"recommending-themes-for-ad-creative-design","title":"Recommending Themes for Ad Creative Design via Visual-Linguistic Representations","date":"2020-01-20","arxiv_id":"2001.07194","repositories_listed":1,"syntology":null},{"url":"/paper/mhsan-multi-head-self-attention-network-for","slug":"mhsan-multi-head-self-attention-network-for","title":"MHSAN: Multi-Head Self-Attention Network for Visual Semantic Embedding","date":"2020-01-11","arxiv_id":"2001.03712","repositories_listed":1,"syntology":null},{"url":"/paper/rubi-reducing-unimodal-biases-for-visual","slug":"rubi-reducing-unimodal-biases-for-visual","title":"RUBi: Reducing Unimodal Biases for Visual Question Answering","date":"2019-12-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/tab-vcr-tags-and-attributes-based-vcr-1","slug":"tab-vcr-tags-and-attributes-based-vcr-1","title":"TAB-VCR: Tags and Attributes based VCR Baselines","date":"2019-12-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/temporal-reasoning-via-audio-question","slug":"temporal-reasoning-via-audio-question","title":"Temporal Reasoning via Audio Question Answering","date":"2019-11-21","arxiv_id":"1911.09655","repositories_listed":1,"syntology":null},{"url":"/paper/dualvd-an-adaptive-dual-encoding-model-for","slug":"dualvd-an-adaptive-dual-encoding-model-for","title":"DualVD: An Adaptive Dual Encoding Model for Deep Visual Understanding in Visual Dialogue","date":"2019-11-17","arxiv_id":"1911.07251","repositories_listed":1,"syntology":null},{"url":"/paper/tab-vcr-tags-and-attributes-based-vcr","slug":"tab-vcr-tags-and-attributes-based-vcr","title":"TAB-VCR: Tags and Attributes based Visual Commonsense Reasoning Baselines","date":"2019-10-31","arxiv_id":"1910.14671","repositories_listed":1,"syntology":null},{"url":"/paper/remind-your-neural-network-to-prevent","slug":"remind-your-neural-network-to-prevent","title":"REMIND Your Neural Network to Prevent Catastrophic Forgetting","date":"2019-10-06","arxiv_id":"1910.02509","repositories_listed":1,"syntology":{"n":3,"n_ran":2,"n_constructed":0,"n_ran_checked":0,"n_instrument":2,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/remind-your-neural-network-to-prevent#ran","syntology_url":"https://syntology.ai/paper/1910.02509","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1910.02509"}},"official":{"repos":["tyler-hayes/REMIND"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/compact-trilinear-interaction-for-visual","slug":"compact-trilinear-interaction-for-visual","title":"Compact Trilinear Interaction for Visual Question Answering","date":"2019-09-26","arxiv_id":"1909.11874","repositories_listed":1,"syntology":{"n":5,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":1,"n_no_contract":2,"n_pointer_only":1,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 1 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/compact-trilinear-interaction-for-visual#ran","syntology_url":"https://syntology.ai/paper/1909.11874","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1909.11874"}},"official":{"repos":["aioz-ai/ICCV19_VQA-CTI"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/visual-question-answering-using-deep-learning","slug":"visual-question-answering-using-deep-learning","title":"Visual Question Answering using Deep Learning: A Survey and Performance Analysis","date":"2019-08-27","arxiv_id":"1909.01860","repositories_listed":1,"syntology":null},{"url":"/paper/fusion-of-detected-objects-in-text-for-visual","slug":"fusion-of-detected-objects-in-text-for-visual","title":"Fusion of Detected Objects in Text for Visual Question Answering","date":"2019-08-14","arxiv_id":"1908.05054","repositories_listed":1,"syntology":null},{"url":"/paper/answering-questions-about-data-visualizations","slug":"answering-questions-about-data-visualizations","title":"Answering Questions about Data Visualizations using Efficient Bimodal Fusion","date":"2019-08-05","arxiv_id":"1908.01801","repositories_listed":1,"syntology":null},{"url":"/paper/rubi-reducing-unimodal-biases-in-visual","slug":"rubi-reducing-unimodal-biases-in-visual","title":"RUBi: Reducing Unimodal Biases in Visual Question Answering","date":"2019-06-24","arxiv_id":"1906.10169","repositories_listed":1,"syntology":null},{"url":"/paper/adversarial-regularization-for-visual","slug":"adversarial-regularization-for-visual","title":"Adversarial Regularization for Visual Question Answering: Strengths, Shortcomings, and Side Effects","date":"2019-06-20","arxiv_id":"1906.08430","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":0,"n_instrument":3,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":3,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/adversarial-regularization-for-visual#ran","syntology_url":"https://syntology.ai/paper/1906.08430","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1906.08430"}},"official":{"repos":["gabegrand/adversarial-vqa"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official","unlocated"]}}},{"url":"/paper/190600067","slug":"190600067","title":"OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge","date":"2019-05-31","arxiv_id":"1906.00067","repositories_listed":1,"syntology":null},{"url":"/paper/what-can-neural-networks-reason-about","slug":"what-can-neural-networks-reason-about","title":"What Can Neural Networks Reason About?","date":"2019-05-30","arxiv_id":"1905.13211","repositories_listed":1,"syntology":null},{"url":"/paper/why-do-these-match-explaining-the-behavior-of","slug":"why-do-these-match-explaining-the-behavior-of","title":"Why do These Match? Explaining the Behavior of Image Similarity Models","date":"2019-05-26","arxiv_id":"1905.10797","repositories_listed":1,"syntology":null},{"url":"/paper/self-critical-reasoning-for-robust-visual","slug":"self-critical-reasoning-for-robust-visual","title":"Self-Critical Reasoning for Robust Visual Question Answering","date":"2019-05-24","arxiv_id":"1905.09998","repositories_listed":1,"syntology":null},{"url":"/paper/aligning-visual-regions-and-textual-concepts","slug":"aligning-visual-regions-and-textual-concepts","title":"Aligning Visual Regions and Textual Concepts for Semantic-Grounded Image Representations","date":"2019-05-15","arxiv_id":"1905.06139","repositories_listed":1,"syntology":null},{"url":"/paper/quantifying-and-alleviating-the-language","slug":"quantifying-and-alleviating-the-language","title":"Quantifying and Alleviating the Language Prior Problem in Visual Question Answering","date":"2019-05-13","arxiv_id":"1905.04877","repositories_listed":1,"syntology":null},{"url":"/paper/routing-networks-and-the-challenges-of","slug":"routing-networks-and-the-challenges-of","title":"Routing Networks and the Challenges of Modular and Compositional Computation","date":"2019-04-29","arxiv_id":"1904.12774","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/routing-networks-and-the-challenges-of#ran","syntology_url":"https://syntology.ai/paper/1904.12774","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1904.12774"}},"official":null}},{"url":"/paper/scene-graph-prediction-with-limited-labels","slug":"scene-graph-prediction-with-limited-labels","title":"Scene Graph Prediction with Limited Labels","date":"2019-04-25","arxiv_id":"1904.11622","repositories_listed":1,"syntology":{"n":6,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/scene-graph-prediction-with-limited-labels#ran","syntology_url":"https://syntology.ai/paper/1904.11622","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1904.11622"}},"official":null}},{"url":"/paper/factor-graph-attention","slug":"factor-graph-attention","title":"Factor Graph Attention","date":"2019-04-11","arxiv_id":"1904.05880","repositories_listed":1,"syntology":null},{"url":"/paper/relation-aware-graph-attention-network-for","slug":"relation-aware-graph-attention-network-for","title":"Relation-Aware Graph Attention Network for Visual Question Answering","date":"2019-03-29","arxiv_id":"1903.12314","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":2,"n_no_contract":0,"n_pointer_only":2,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 2 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/relation-aware-graph-attention-network-for#ran","syntology_url":"https://syntology.ai/paper/1903.12314","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1903.12314"}},"official":{"repos":["linjieli222/VQA_ReGAT"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/murel-multimodal-relational-reasoning-for","slug":"murel-multimodal-relational-reasoning-for","title":"MUREL: Multimodal Relational Reasoning for Visual Question Answering","date":"2019-02-25","arxiv_id":"1902.09487","repositories_listed":1,"syntology":null},{"url":"/paper/block-bilinear-superdiagonal-fusion-for","slug":"block-bilinear-superdiagonal-fusion-for","title":"BLOCK: Bilinear Superdiagonal Fusion for Visual Question Answering and Visual Relationship Detection","date":"2019-01-31","arxiv_id":"1902.00038","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/block-bilinear-superdiagonal-fusion-for#ran","syntology_url":"https://syntology.ai/paper/1902.00038","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1902.00038"}},"official":{"repos":["Cadene/block.bootstrap.pytorch"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/visual-entailment-a-novel-task-for-fine","slug":"visual-entailment-a-novel-task-for-fine","title":"Visual Entailment: A Novel Task for Fine-Grained Image Understanding","date":"2019-01-20","arxiv_id":"1901.06706","repositories_listed":1,"syntology":null},{"url":"/paper/focal-visual-text-attention-for-memex","slug":"focal-visual-text-attention-for-memex","title":"Focal Visual-Text Attention for Memex Question Answering","date":"2018-12-14","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/recursive-visual-attention-in-visual-dialog","slug":"recursive-visual-attention-in-visual-dialog","title":"Recursive Visual Attention in Visual Dialog","date":"2018-12-06","arxiv_id":"1812.02664","repositories_listed":1,"syntology":null},{"url":"/paper/clear-a-dataset-for-compositional-language","slug":"clear-a-dataset-for-compositional-language","title":"CLEAR: A Dataset for Compositional Language and Elementary Acoustic Reasoning","date":"2018-11-26","arxiv_id":"1811.10561","repositories_listed":1,"syntology":null},{"url":"/paper/visual-entailment-task-for-visually-grounded","slug":"visual-entailment-task-for-visually-grounded","title":"Visual Entailment Task for Visually-Grounded Language Learning","date":"2018-11-26","arxiv_id":"1811.10582","repositories_listed":1,"syntology":null},{"url":"/paper/gated-hierarchical-attention-for-image","slug":"gated-hierarchical-attention-for-image","title":"Gated Hierarchical Attention for Image Captioning","date":"2018-10-30","arxiv_id":"1810.12535","repositories_listed":1,"syntology":null},{"url":"/paper/tallyqa-answering-complex-counting-questions","slug":"tallyqa-answering-complex-counting-questions","title":"TallyQA: Answering Complex Counting Questions","date":"2018-10-29","arxiv_id":"1810.12440","repositories_listed":1,"syntology":null},{"url":"/paper/transfer-learning-via-unsupervised-task","slug":"transfer-learning-via-unsupervised-task","title":"Transfer Learning via Unsupervised Task Discovery for Visual Question Answering","date":"2018-10-03","arxiv_id":"1810.02358","repositories_listed":1,"syntology":null},{"url":"/paper/faithful-multimodal-explanation-for-visual","slug":"faithful-multimodal-explanation-for-visual","title":"Faithful Multimodal Explanation for Visual Question Answering","date":"2018-09-08","arxiv_id":"1809.02805","repositories_listed":1,"syntology":null},{"url":"/paper/cascaded-mutual-modulation-for-visual","slug":"cascaded-mutual-modulation-for-visual","title":"Cascaded Mutual Modulation for Visual Reasoning","date":"2018-09-06","arxiv_id":"1809.01943","repositories_listed":1,"syntology":null},{"url":"/paper/visual-coreference-resolution-in-visual","slug":"visual-coreference-resolution-in-visual","title":"Visual Coreference Resolution in Visual Dialog using Neural Module Networks","date":"2018-09-06","arxiv_id":"1809.01816","repositories_listed":1,"syntology":null},{"url":"/paper/from-vqa-to-multimodal-cqa-adapting-visual-qa","slug":"from-vqa-to-multimodal-cqa-adapting-visual-qa","title":"Adapting Visual Question Answering Models for Enhancing Multimodal Community Q&A Platforms","date":"2018-08-29","arxiv_id":"1808.09648","repositories_listed":1,"syntology":null},{"url":"/paper/visual-reasoning-with-multi-hop-feature","slug":"visual-reasoning-with-multi-hop-feature","title":"Visual Reasoning with Multi-hop Feature Modulation","date":"2018-08-03","arxiv_id":"1808.04446","repositories_listed":1,"syntology":null},{"url":"/paper/learning-visual-question-answering-by","slug":"learning-visual-question-answering-by","title":"Learning Visual Question Answering by Bootstrapping Hard Attention","date":"2018-08-01","arxiv_id":"1808.00300","repositories_listed":1,"syntology":null}],"record_sha256":"9613836e6e2cc7b29ae67352d20c8dda343d7360160601bcf7a9a14367e699e3","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}