{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering-1/papers/17","list_of":"/task/visual-question-answering-1","task":"Visual Question Answering","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":17,"pages_in_order":22,"rows_per_page":100,"rows":[1601,1700],"of":2177,"counts":{"archive_papers_tagged":2177,"with_a_code_link":1042,"where_syntology_ran_a_sample":378,"not_listed_spam_title":0,"listed":2177,"listed_where_code_ran":378,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":308,"every_run_a_failure_of_syntologys_instrument":70,"listed_with_a_run_with_no_instrument_failure":308,"listed_every_run_a_failure_of_syntologys_instrument":70,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering-1","prev":"/task/visual-question-answering-1/papers/16","next":"/task/visual-question-answering-1/papers/18","papers":[{"url":null,"slug":"robust-visual-question-answering-datasets","title":"Robust Visual Question Answering: Datasets, Methods, and Future Challenges","date":"2023-07-21","arxiv_id":"2307.11471","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-vqa","title":"A reinforcement learning approach for VQA validation: an application to diabetic macular edema grading","date":"2023-07-19","arxiv_id":"2307.09886","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-visual-question-answering","title":"Generative Visual Question Answering","date":"2023-07-18","arxiv_id":"2307.10405","repositories_listed":0,"syntology":null},{"url":null,"slug":"let-s-vice-mimicking-human-cognitive-behavior","title":"Let's ViCE! Mimicking Human Cognitive Behavior in Image Generation Evaluation","date":"2023-07-18","arxiv_id":"2307.09416","repositories_listed":0,"syntology":null},{"url":null,"slug":"pat-parallel-attention-transformer-for-visual","title":"PAT: Parallel Attention Transformer for Visual Question Answering in Vietnamese","date":"2023-07-17","arxiv_id":"2307.08247","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-scoping-review-on-multimodal-deep-learning","title":"A scoping review on multimodal deep learning in biomedical images and texts","date":"2023-07-14","arxiv_id":"2307.07362","repositories_listed":0,"syntology":null},{"url":null,"slug":"structure-guided-multi-modal-pre-trained","title":"Structure Guided Multi-modal Pre-trained Transformer for Knowledge Graph Reasoning","date":"2023-07-06","arxiv_id":"2307.03591","repositories_listed":0,"syntology":null},{"url":null,"slug":"uit-saviors-at-medvqa-gi-2023-improving","title":"UIT-Saviors at MEDVQA-GI 2023: Improving Multimodal Learning with Image Enhancement for Gastrointestinal Visual Question Answering","date":"2023-07-06","arxiv_id":"2307.02783","repositories_listed":0,"syntology":null},{"url":null,"slug":"switch-bert-learning-to-model-multimodal","title":"Switch-BERT: Learning to Model Multimodal Interactions by Switching Attention and Input","date":"2023-06-25","arxiv_id":"2306.14182","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-in-remote-sensing","title":"Visual Question Answering in Remote Sensing with Cross-Attention and Multimodal Information Bottleneck","date":"2023-06-25","arxiv_id":"2306.14264","repositories_listed":0,"syntology":null},{"url":null,"slug":"taca-upgrading-your-visual-foundation-model","title":"TaCA: Upgrading Your Visual Foundation Model with Task-agnostic Compatible Adapter","date":"2023-06-22","arxiv_id":"2306.12642","repositories_listed":0,"syntology":null},{"url":null,"slug":"avis-autonomous-visual-information-seeking","title":"AVIS: Autonomous Visual Information Seeking with Large Language Model Agent","date":"2023-06-13","arxiv_id":"2306.08129","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-vqa-on-images-with","title":"Visual Question Answering (VQA) on Images with Superimposed Text","date":"2023-06-13","arxiv_id":"2307.02489","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-vision-language-pre-training-from","title":"A Survey of Vision-Language Pre-training from the Lens of Multimodal Machine Translation","date":"2023-06-12","arxiv_id":"2306.07198","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-detection-by-relevant-question-and","title":"Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering","date":"2023-06-08","arxiv_id":"2306.04938","repositories_listed":0,"syntology":null},{"url":null,"slug":"diversifying-joint-vision-language","title":"Diversifying Joint Vision-Language Tokenization Learning","date":"2023-06-06","arxiv_id":"2306.03421","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-clip-contrastive-vision-language-pre","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes","date":"2023-06-04","arxiv_id":"2306.02329","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-the-capabilities-of-multi-modal","title":"Evaluating the Capabilities of Multi-modal Reasoning Models with Synthetic Task Data","date":"2023-06-01","arxiv_id":"2306.01144","repositories_listed":0,"syntology":null},{"url":null,"slug":"lit-4-rsvqa-lightweight-transformer-based","title":"LiT-4-RSVQA: Lightweight Transformer-based Visual Question Answering in Remote Sensing","date":"2023-06-01","arxiv_id":"2306.00758","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-language-bias-in-remote-sensing","title":"Overcoming Language Bias in Remote Sensing Visual Question Answering via Adversarial Training","date":"2023-06-01","arxiv_id":"2306.00483","repositories_listed":0,"syntology":null},{"url":null,"slug":"unveiling-cross-modality-bias-in-visual","title":"Unveiling Cross Modality Bias in Visual Question Answering: A Causal View with Possible Worlds VQA","date":"2023-05-31","arxiv_id":"2305.19664","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-visual-cropping-to-enhance-fine-detail","title":"Using Visual Cropping to Enhance Fine-Detail Question Answering of BLIP-Family Models","date":"2023-05-31","arxiv_id":"2306.00228","repositories_listed":0,"syntology":null},{"url":null,"slug":"generate-then-select-open-ended-visual","title":"Generate then Select: Open-ended Visual Question Answering Guided by World Knowledge","date":"2023-05-30","arxiv_id":"2305.18842","repositories_listed":0,"syntology":null},{"url":null,"slug":"mindstorms-in-natural-language-based","title":"Mindstorms in Natural Language-Based Societies of Mind","date":"2023-05-26","arxiv_id":"2305.17066","repositories_listed":0,"syntology":null},{"url":null,"slug":"embodiedgpt-vision-language-pre-training-via","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","date":"2023-05-24","arxiv_id":"2305.15021","repositories_listed":0,"syntology":null},{"url":null,"slug":"grill-grounded-vision-language-pre-training","title":"GRILL: Grounded Vision-language Pre-training via Aligning Text and Image Regions","date":"2023-05-24","arxiv_id":"2305.14676","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-by-design-visual-question","title":"Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering","date":"2023-05-24","arxiv_id":"2305.14882","repositories_listed":0,"syntology":null},{"url":"/paper/dublin-document-understanding-by-language","slug":"dublin-document-understanding-by-language","title":"DUBLIN -- Document Understanding By Language-Image Network","date":"2023-05-23","arxiv_id":"2305.14218","repositories_listed":0,"syntology":null},{"url":null,"slug":"i-code-studio-a-configurable-and-composable","title":"i-Code Studio: A Configurable and Composable Framework for Integrative AI","date":"2023-05-23","arxiv_id":"2305.13738","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-manipulation-via-multi-hop-instructions","title":"Image Manipulation via Multi-Hop Instructions -- A New Dataset and Weakly-Supervised Neuro-Symbolic Approach","date":"2023-05-23","arxiv_id":"2305.14410","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-a-survey-on","title":"Visual Question Answering: A Survey on Techniques and Common Trends in Recent Literature","date":"2023-05-18","arxiv_id":"2305.11033","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-on-the-language-modal-in","title":"An Empirical Study on the Language Modal in Visual Question Answering","date":"2023-05-17","arxiv_id":"2305.10143","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-the-role-of-positional-information-in-2","title":"Probing the Role of Positional Information in Vision-Language Models","date":"2023-05-17","arxiv_id":"2305.10046","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-composition-in-visually-grounded","title":"Semantic Composition in Visually Grounded Language Models","date":"2023-05-15","arxiv_id":"2305.16328","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-visual-question-answering","title":"Analysis of Visual Question Answering Algorithms with attention model","date":"2023-05-04","arxiv_id":"2305.09782","repositories_listed":0,"syntology":null},{"url":null,"slug":"making-the-most-of-what-you-have-adapting-pre","title":"Making the Most of What You Have: Adapting Pre-trained Visual Language Models in the Low-data Regime","date":"2023-05-03","arxiv_id":"2305.02297","repositories_listed":0,"syntology":null},{"url":null,"slug":"chic-corporate-document-for-visual-question","title":"CHIC: Corporate Document for Visual question Answering","date":"2023-05-01","arxiv_id":"2305.01054","repositories_listed":0,"syntology":null},{"url":null,"slug":"chain-of-thought-prompt-tuning-in-vision","title":"Chain of Thought Prompt Tuning in Vision Language Models","date":"2023-04-16","arxiv_id":"2304.07919","repositories_listed":0,"syntology":null},{"url":"/paper/pdf-vqa-a-new-dataset-for-real-world-vqa-on","slug":"pdf-vqa-a-new-dataset-for-real-world-vqa-on","title":"PDFVQA: A New Dataset for Real-World VQA on PDF Documents","date":"2023-04-13","arxiv_id":"2304.06447","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-medical-imaging-with-language","title":"Advancing Medical Imaging with Language Models: A Journey from N-grams to ChatGPT","date":"2023-04-11","arxiv_id":"2304.04920","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-cross-task-transferability-of","title":"Boosting Cross-task Transferability of Adversarial Patches with Visual Relations","date":"2023-04-11","arxiv_id":"2304.05402","repositories_listed":0,"syntology":null},{"url":null,"slug":"cavl-learning-contrastive-and-adaptive","title":"CAVL: Learning Contrastive and Adaptive Representations of Vision and Language","date":"2023-04-10","arxiv_id":"2304.04399","repositories_listed":0,"syntology":null},{"url":null,"slug":"multilingual-augmentation-for-robust-visual","title":"Multilingual Augmentation for Robust Visual Question Answering in Remote Sensing Images","date":"2023-04-07","arxiv_id":"2304.03844","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-visual-question-answering-models","title":"Improving Visual Question Answering Models through Robustness Analysis and In-Context Learning with a Chain of Basic Questions","date":"2023-04-06","arxiv_id":"2304.03147","repositories_listed":0,"syntology":null},{"url":null,"slug":"locate-then-generate-bridging-vision-and","title":"Locate Then Generate: Bridging Vision and Language with Bounding Box for Scene-Text VQA","date":"2023-04-04","arxiv_id":"2304.01603","repositories_listed":0,"syntology":null},{"url":null,"slug":"q2atransformer-improving-medical-vqa-via-an","title":"Q2ATransformer: Improving Medical VQA via an Answer Querying Decoder","date":"2023-04-04","arxiv_id":"2304.01611","repositories_listed":0,"syntology":null},{"url":null,"slug":"sc-ml-self-supervised-counterfactual-metric","title":"SC-ML: Self-supervised Counterfactual Metric Learning for Debiased Visual Question Answering","date":"2023-04-04","arxiv_id":"2304.01647","repositories_listed":0,"syntology":null},{"url":null,"slug":"instance-level-trojan-attacks-on-visual","title":"Instance-Level Trojan Attacks on Visual Question Answering via Adversarial Learning in Neuron Activation Space","date":"2023-04-02","arxiv_id":"2304.00436","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-learning-for-compositional-visual","title":"Curriculum Learning for Compositional Visual Reasoning","date":"2023-03-27","arxiv_id":"2303.15006","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-concept-learning-and-reasoning-from-multi","title":"3D Concept Learning and Reasoning from Multi-View Images","date":"2023-03-20","arxiv_id":"2303.11327","repositories_listed":0,"syntology":null},{"url":null,"slug":"fvqa-2-0-introducing-adversarial-samples-into","title":"FVQA 2.0: Introducing Adversarial Samples into Fact-based Visual Question Answering","date":"2023-03-19","arxiv_id":"2303.10699","repositories_listed":0,"syntology":null},{"url":"/paper/breaking-common-sense-whoops-a-vision-and","slug":"breaking-common-sense-whoops-a-vision-and","title":"Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images","date":"2023-03-13","arxiv_id":"2303.07274","repositories_listed":0,"syntology":null},{"url":null,"slug":"polar-vqa-visual-question-answering-on-remote","title":"Polar-VQA: Visual Question Answering on Remote Sensed Ice sheet Imagery from Polar Region","date":"2023-03-13","arxiv_id":"2303.07403","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-models-as-success-detectors","title":"Vision-Language Models as Success Detectors","date":"2023-03-13","arxiv_id":"2303.07280","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-and-constructing-latent","title":"Understanding and Constructing Latent Modality Structures in Multi-modal Representation Learning","date":"2023-03-10","arxiv_id":"2303.05952","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-unsupervised-realistic-visual-question","title":"Toward Unsupervised Realistic Visual Question Answering","date":"2023-03-09","arxiv_id":"2303.05068","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-visual-question-answering","title":"Interpretable Visual Question Answering Referring to Outside Knowledge","date":"2023-03-08","arxiv_id":"2303.04388","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-neural-networks-in-vision-language","title":"Graph Neural Networks in Vision-Language Image Understanding: A Survey","date":"2023-03-07","arxiv_id":"2303.03761","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-based-counterfactual-queries-for","title":"Knowledge-Based Counterfactual Queries for Visual Question Answering","date":"2023-03-05","arxiv_id":"2303.02601","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqa-with-cascade-of-self-and-co-attention","title":"VQA with Cascade of Self- and Co-Attention Blocks","date":"2023-02-28","arxiv_id":"2302.14777","repositories_listed":0,"syntology":null},{"url":null,"slug":"medical-visual-question-answering-using-joint","title":"Medical visual question answering using joint self-supervised learning","date":"2023-02-25","arxiv_id":"2302.13069","repositories_listed":0,"syntology":null},{"url":"/paper/vlsp-2022-evjvqa-challenge-multilingual","slug":"vlsp-2022-evjvqa-challenge-multilingual","title":"EVJVQA Challenge: Multilingual Visual Question Answering","date":"2023-02-23","arxiv_id":"2302.11752","repositories_listed":0,"syntology":null},{"url":null,"slug":"reusable-slotwise-mechanisms","title":"Reusable Slotwise Mechanisms","date":"2023-02-21","arxiv_id":"2302.10503","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-multimodal-multitask-multilingual","title":"Few-shot Multimodal Multitask Multilingual Learning","date":"2023-02-19","arxiv_id":"2303.12489","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-medical-image-visual-question","title":"Interpretable Medical Image Visual Question Answering via Multi-Modal Relationship Graph Learning","date":"2023-02-19","arxiv_id":"2302.09636","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridge-damage-cause-estimation-using-multiple","title":"Bridge Damage Cause Estimation Using Multiple Images Based on Visual Question Answering","date":"2023-02-18","arxiv_id":"2302.09208","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-unified-model-for-generating","title":"Towards a Unified Model for Generating Answers and Explanations in Visual Question Answering","date":"2023-01-25","arxiv_id":"2301.10799","repositories_listed":0,"syntology":null},{"url":null,"slug":"hrvqa-a-visual-question-answering-benchmark","title":"HRVQA: A Visual Question Answering Benchmark for High-Resolution Aerial Images","date":"2023-01-23","arxiv_id":"2301.09460","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-models-that-can-see-and-read","title":"Towards Models that Can See and Read","date":"2023-01-18","arxiv_id":"2301.07389","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-script-distillation-for","title":"Curriculum Script Distillation for Multilingual Visual Question Answering","date":"2023-01-17","arxiv_id":"2301.07227","repositories_listed":0,"syntology":null},{"url":null,"slug":"decouple-before-interact-multi-modal-prompt","title":"Decouple Before Interact: Multi-Modal Prompt Learning for Continual Visual Question Answering","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"from-images-to-textual-prompts-zero-shot","title":"From Images to Textual Prompts: Zero-Shot Visual Question Answering With Frozen Large Language Models","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"image-as-a-foreign-language-beit-pretraining-1","title":"Image as a Foreign Language: BEiT Pretraining for Vision and Vision-Language Tasks","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"promptcap-prompt-guided-image-captioning-for","title":"PromptCap: Prompt-Guided Image Captioning for VQA with GPT-3","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rmlvqa-a-margin-loss-approach-for-visual","title":"RMLVQA: A Margin Loss Approach for Visual Question Answering With Language Biases","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"when-are-lemons-purple-the-concept","title":"When are Lemons Purple? The Concept Association Bias of Vision-Language Models","date":"2022-12-22","arxiv_id":"2212.12043","repositories_listed":0,"syntology":null},{"url":null,"slug":"uniclam-contrastive-representation-learning","title":"UnICLAM:Contrastive Representation Learning with Adversarial Masking for Unified and Interpretable Medical Vision Question Answering","date":"2022-12-21","arxiv_id":"2212.10729","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-unsupervised-visual-reasoning-do-off","title":"Towards Unsupervised Visual Reasoning: Do Off-The-Shelf Features Know How to Reason?","date":"2022-12-20","arxiv_id":"2212.10292","repositories_listed":0,"syntology":null},{"url":null,"slug":"scenegate-scene-graph-based-co-attention","title":"SceneGATE: Scene-Graph based co-Attention networks for TExt visual question answering","date":"2022-12-16","arxiv_id":"2212.08283","repositories_listed":0,"syntology":null},{"url":"/paper/parsvqa-caps-a-benchmark-for-visual-question","slug":"parsvqa-caps-a-benchmark-for-visual-question","title":"ParsVQA-Caps: A Benchmark for Visual Question Answering and Image Captioning in Persian","date":"2022-12-07","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"compound-tokens-channel-fusion-for-vision","title":"Compound Tokens: Channel Fusion for Vision-Language Representation Learning","date":"2022-12-02","arxiv_id":"2212.01447","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-explanations-by-network","title":"Optimizing Explanations by Network Canonization and Hyperparameter Search","date":"2022-11-30","arxiv_id":"2211.17174","repositories_listed":0,"syntology":null},{"url":null,"slug":"piggyback-pretrained-visual-question","title":"PiggyBack: Pretrained Visual Question Answering Environment for Backing up Non-deep Learning Professionals","date":"2022-11-29","arxiv_id":"2211.15940","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuro-symbolic-spatio-temporal-reasoning","title":"Neuro-Symbolic Spatio-Temporal Reasoning","date":"2022-11-28","arxiv_id":"2211.15566","repositories_listed":0,"syntology":null},{"url":null,"slug":"look-read-and-ask-learning-to-ask-questions","title":"Look, Read and Ask: Learning to Ask Questions by Reading Text in Images","date":"2022-11-23","arxiv_id":"2211.12950","repositories_listed":0,"syntology":null},{"url":null,"slug":"cl-crossvqa-a-continual-learning-benchmark","title":"CL-CrossVQA: A Continual Learning Benchmark for Cross-Domain Visual Question Answering","date":"2022-11-19","arxiv_id":"2211.10567","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-aware-dual-routing-network-for-visual","title":"Text-Aware Dual Routing Network for Visual Question Answering","date":"2022-11-17","arxiv_id":"2211.14450","repositories_listed":0,"syntology":null},{"url":null,"slug":"alignve-visual-entailment-recognition-based","title":"AlignVE: Visual Entailment Recognition Based on Alignment Relations","date":"2022-11-16","arxiv_id":"2211.08736","repositories_listed":0,"syntology":null},{"url":null,"slug":"mf2-mvqa-a-multi-stage-feature-fusion-method","title":"MF2-MVQA: A Multi-stage Feature Fusion method for Medical Visual Question Answering","date":"2022-11-11","arxiv_id":"2211.05991","repositories_listed":0,"syntology":null},{"url":"/paper/ernie-unix2-a-unified-cross-lingual-cross","slug":"ernie-unix2-a-unified-cross-lingual-cross","title":"ERNIE-UniX2: A Unified Cross-lingual Cross-modal Framework for Understanding and Generation","date":"2022-11-09","arxiv_id":"2211.04861","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-reasoning-aware-explainable-vqa","title":"Towards Reasoning-Aware Explainable VQA","date":"2022-11-09","arxiv_id":"2211.05190","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-differences-between-end-to-end","title":"Generalization Differences between End-to-End and Neuro-Symbolic Vision-Language Reasoning Systems","date":"2022-10-26","arxiv_id":"2210.15037","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-by-hallucinating-vision-language-pre","title":"Learning by Hallucinating: Vision-Language Pre-training with Weak Supervision","date":"2022-10-24","arxiv_id":"2210.13591","repositories_listed":0,"syntology":null},{"url":null,"slug":"cpl-counterfactual-prompt-learning-for-vision","title":"CPL: Counterfactual Prompt Learning for Vision and Language Models","date":"2022-10-19","arxiv_id":"2210.10362","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-semantic-relation-generation","title":"Image Semantic Relation Generation","date":"2022-10-19","arxiv_id":"2210.11253","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligning-magma-by-few-shot-learning-and","title":"Aligning MAGMA by Few-Shot Learning and Finetuning","date":"2022-10-18","arxiv_id":"2210.14161","repositories_listed":0,"syntology":null},{"url":null,"slug":"entity-focused-dense-passage-retrieval-for","title":"Entity-Focused Dense Passage Retrieval for Outside-Knowledge Visual Question Answering","date":"2022-10-18","arxiv_id":"2210.10176","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-fusion-transformer-for-visual","title":"Multi-Modal Fusion Transformer for Visual Question Answering in Remote Sensing","date":"2022-10-10","arxiv_id":"2210.04510","repositories_listed":0,"syntology":null},{"url":null,"slug":"mamo-masked-multimodal-modeling-for-fine","title":"MAMO: Masked Multimodal Modeling for Fine-Grained Vision-Language Representation Learning","date":"2022-10-09","arxiv_id":"2210.04183","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-capsule-attention-mask-network-with","title":"Dual Capsule Attention Mask Network with Mutual Learning for Visual Question Answering","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"e1a874c43600b368566db94feae5f68fb34bd0e70707935630b3d622dff7fb51","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}