{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering/papers/16","list_of":"/task/visual-question-answering","task":"Visual Question Answering (VQA)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":16,"pages_in_order":22,"rows_per_page":100,"rows":[1501,1600],"of":2167,"counts":{"archive_papers_tagged":2167,"with_a_code_link":1039,"where_syntology_ran_a_sample":359,"not_listed_spam_title":0,"listed":2167,"listed_where_code_ran":359,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":287,"every_run_a_failure_of_syntologys_instrument":72,"listed_with_a_run_with_no_instrument_failure":287,"listed_every_run_a_failure_of_syntologys_instrument":72,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering","prev":"/task/visual-question-answering/papers/15","next":"/task/visual-question-answering/papers/17","papers":[{"url":null,"slug":"unveiling-cross-modality-bias-in-visual","title":"Unveiling Cross Modality Bias in Visual Question Answering: A Causal View with Possible Worlds VQA","date":"2023-05-31","arxiv_id":"2305.19664","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-visual-cropping-to-enhance-fine-detail","title":"Using Visual Cropping to Enhance Fine-Detail Question Answering of BLIP-Family Models","date":"2023-05-31","arxiv_id":"2306.00228","repositories_listed":0,"syntology":null},{"url":null,"slug":"generate-then-select-open-ended-visual","title":"Generate then Select: Open-ended Visual Question Answering Guided by World Knowledge","date":"2023-05-30","arxiv_id":"2305.18842","repositories_listed":0,"syntology":null},{"url":null,"slug":"study-of-subjective-and-objective-quality","title":"Study of Subjective and Objective Quality Assessment of Mobile Cloud Gaming Videos","date":"2023-05-26","arxiv_id":"2305.17260","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-by-design-visual-question","title":"Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering","date":"2023-05-24","arxiv_id":"2305.14882","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-visual-attributes-from-natural","title":"Transferring Visual Attributes from Natural Language to Verified Image Generation","date":"2023-05-24","arxiv_id":"2305.15026","repositories_listed":0,"syntology":null},{"url":"/paper/dublin-document-understanding-by-language","slug":"dublin-document-understanding-by-language","title":"DUBLIN -- Document Understanding By Language-Image Network","date":"2023-05-23","arxiv_id":"2305.14218","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-manipulation-via-multi-hop-instructions","title":"Image Manipulation via Multi-Hop Instructions -- A New Dataset and Weakly-Supervised Neuro-Symbolic Approach","date":"2023-05-23","arxiv_id":"2305.14410","repositories_listed":0,"syntology":null},{"url":"/paper/vlab-enhancing-video-language-pre-training-by","slug":"vlab-enhancing-video-language-pre-training-by","title":"VLAB: Enhancing Video Language Pre-training by Feature Adapting and Blending","date":"2023-05-22","arxiv_id":"2305.13167","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-a-survey-on","title":"Visual Question Answering: A Survey on Techniques and Common Trends in Recent Literature","date":"2023-05-18","arxiv_id":"2305.11033","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-stochastic-lstm-model-inspired-by","title":"A Novel Stochastic LSTM Model Inspired by Quantum Machine Learning","date":"2023-05-17","arxiv_id":"2305.10212","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-on-the-language-modal-in","title":"An Empirical Study on the Language Modal in Visual Question Answering","date":"2023-05-17","arxiv_id":"2305.10143","repositories_listed":0,"syntology":null},{"url":null,"slug":"tg-vqa-ternary-game-of-video-question","title":"TG-VQA: Ternary Game of Video Question Answering","date":"2023-05-17","arxiv_id":"2305.10049","repositories_listed":0,"syntology":null},{"url":null,"slug":"sb-vqa-a-stack-based-video-quality-assessment","title":"SB-VQA: A Stack-Based Video Quality Assessment Framework for Video Enhancement","date":"2023-05-15","arxiv_id":"2305.08408","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-visual-question-answering","title":"Analysis of Visual Question Answering Algorithms with attention model","date":"2023-05-04","arxiv_id":"2305.09782","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-comparison-of-optimizers-for","title":"An Empirical Comparison of Optimizers for Quantum Machine Learning with SPSA-based Gradients","date":"2023-04-27","arxiv_id":"2305.00224","repositories_listed":0,"syntology":null},{"url":null,"slug":"hdr-chipqa-no-reference-quality-assessment-on","title":"HDR-ChipQA: No-Reference Quality Assessment on High Dynamic Range Videos","date":"2023-04-25","arxiv_id":"2304.13156","repositories_listed":0,"syntology":null},{"url":null,"slug":"making-video-quality-assessment-models-robust","title":"Making Video Quality Assessment Models Robust to Bit Depth","date":"2023-04-25","arxiv_id":"2304.13092","repositories_listed":0,"syntology":null},{"url":"/paper/pdf-vqa-a-new-dataset-for-real-world-vqa-on","slug":"pdf-vqa-a-new-dataset-for-real-world-vqa-on","title":"PDFVQA: A New Dataset for Real-World VQA on PDF Documents","date":"2023-04-13","arxiv_id":"2304.06447","repositories_listed":0,"syntology":null},{"url":null,"slug":"cavl-learning-contrastive-and-adaptive","title":"CAVL: Learning Contrastive and Adaptive Representations of Vision and Language","date":"2023-04-10","arxiv_id":"2304.04399","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-visual-question-answering-models","title":"Improving Visual Question Answering Models through Robustness Analysis and In-Context Learning with a Chain of Basic Questions","date":"2023-04-06","arxiv_id":"2304.03147","repositories_listed":0,"syntology":null},{"url":null,"slug":"locate-then-generate-bridging-vision-and","title":"Locate Then Generate: Bridging Vision and Language with Bounding Box for Scene-Text VQA","date":"2023-04-04","arxiv_id":"2304.01603","repositories_listed":0,"syntology":null},{"url":null,"slug":"q2atransformer-improving-medical-vqa-via-an","title":"Q2ATransformer: Improving Medical VQA via an Answer Querying Decoder","date":"2023-04-04","arxiv_id":"2304.01611","repositories_listed":0,"syntology":null},{"url":null,"slug":"sc-ml-self-supervised-counterfactual-metric","title":"SC-ML: Self-supervised Counterfactual Metric Learning for Debiased Visual Question Answering","date":"2023-04-04","arxiv_id":"2304.01647","repositories_listed":0,"syntology":null},{"url":null,"slug":"instance-level-trojan-attacks-on-visual","title":"Instance-Level Trojan Attacks on Visual Question Answering via Adversarial Learning in Neuron Activation Space","date":"2023-04-02","arxiv_id":"2304.00436","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-learning-for-compositional-visual","title":"Curriculum Learning for Compositional Visual Reasoning","date":"2023-03-27","arxiv_id":"2303.15006","repositories_listed":0,"syntology":null},{"url":null,"slug":"cobit-a-contrastive-bi-directional-image-text","title":"CoBIT: A Contrastive Bi-directional Image-Text Generation Model","date":"2023-03-23","arxiv_id":"2303.13455","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-concept-learning-and-reasoning-from-multi","title":"3D Concept Learning and Reasoning from Multi-View Images","date":"2023-03-20","arxiv_id":"2303.11327","repositories_listed":0,"syntology":null},{"url":null,"slug":"fvqa-2-0-introducing-adversarial-samples-into","title":"FVQA 2.0: Introducing Adversarial Samples into Fact-based Visual Question Answering","date":"2023-03-19","arxiv_id":"2303.10699","repositories_listed":0,"syntology":null},{"url":"/paper/breaking-common-sense-whoops-a-vision-and","slug":"breaking-common-sense-whoops-a-vision-and","title":"Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images","date":"2023-03-13","arxiv_id":"2303.07274","repositories_listed":0,"syntology":null},{"url":null,"slug":"mret-multi-resolution-transformer-for-video","title":"MRET: Multi-resolution Transformer for Video Quality Assessment","date":"2023-03-13","arxiv_id":"2303.07489","repositories_listed":0,"syntology":null},{"url":null,"slug":"polar-vqa-visual-question-answering-on-remote","title":"Polar-VQA: Visual Question Answering on Remote Sensed Ice sheet Imagery from Polar Region","date":"2023-03-13","arxiv_id":"2303.07403","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-models-as-success-detectors","title":"Vision-Language Models as Success Detectors","date":"2023-03-13","arxiv_id":"2303.07280","repositories_listed":0,"syntology":null},{"url":"/paper/multi-efficient-video-and-language","slug":"multi-efficient-video-and-language","title":"MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling","date":"2023-03-10","arxiv_id":"2303.05707","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-and-constructing-latent","title":"Understanding and Constructing Latent Modality Structures in Multi-modal Representation Learning","date":"2023-03-10","arxiv_id":"2303.05952","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-unsupervised-realistic-visual-question","title":"Toward Unsupervised Realistic Visual Question Answering","date":"2023-03-09","arxiv_id":"2303.05068","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-visual-question-answering","title":"Interpretable Visual Question Answering Referring to Outside Knowledge","date":"2023-03-08","arxiv_id":"2303.04388","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-neural-networks-in-vision-language","title":"Graph Neural Networks in Vision-Language Image Understanding: A Survey","date":"2023-03-07","arxiv_id":"2303.03761","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-based-counterfactual-queries-for","title":"Knowledge-Based Counterfactual Queries for Visual Question Answering","date":"2023-03-05","arxiv_id":"2303.02601","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-visual-quality-assessment-for-user","title":"Audio-Visual Quality Assessment for User Generated Content: Database and Method","date":"2023-03-04","arxiv_id":"2303.02392","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqa-with-cascade-of-self-and-co-attention","title":"VQA with Cascade of Self- and Co-Attention Blocks","date":"2023-02-28","arxiv_id":"2302.14777","repositories_listed":0,"syntology":null},{"url":null,"slug":"medical-visual-question-answering-using-joint","title":"Medical visual question answering using joint self-supervised learning","date":"2023-02-25","arxiv_id":"2302.13069","repositories_listed":0,"syntology":null},{"url":"/paper/vlsp-2022-evjvqa-challenge-multilingual","slug":"vlsp-2022-evjvqa-challenge-multilingual","title":"EVJVQA Challenge: Multilingual Visual Question Answering","date":"2023-02-23","arxiv_id":"2302.11752","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-multimodal-multitask-multilingual","title":"Few-shot Multimodal Multitask Multilingual Learning","date":"2023-02-19","arxiv_id":"2303.12489","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-medical-image-visual-question","title":"Interpretable Medical Image Visual Question Answering via Multi-Modal Relationship Graph Learning","date":"2023-02-19","arxiv_id":"2302.09636","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridge-damage-cause-estimation-using-multiple","title":"Bridge Damage Cause Estimation Using Multiple Images Based on Visual Question Answering","date":"2023-02-18","arxiv_id":"2302.09208","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-unified-model-for-generating","title":"Towards a Unified Model for Generating Answers and Explanations in Visual Question Answering","date":"2023-01-25","arxiv_id":"2301.10799","repositories_listed":0,"syntology":null},{"url":null,"slug":"hrvqa-a-visual-question-answering-benchmark","title":"HRVQA: A Visual Question Answering Benchmark for High-Resolution Aerial Images","date":"2023-01-23","arxiv_id":"2301.09460","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-models-that-can-see-and-read","title":"Towards Models that Can See and Read","date":"2023-01-18","arxiv_id":"2301.07389","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-script-distillation-for","title":"Curriculum Script Distillation for Multilingual Visual Question Answering","date":"2023-01-17","arxiv_id":"2301.07227","repositories_listed":0,"syntology":null},{"url":null,"slug":"decouple-before-interact-multi-modal-prompt","title":"Decouple Before Interact: Multi-Modal Prompt Learning for Continual Visual Question Answering","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-inference-with-grounding-based-vision","title":"Dynamic Inference With Grounding Based Vision and Language Models","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"from-images-to-textual-prompts-zero-shot","title":"From Images to Textual Prompts: Zero-Shot Visual Question Answering With Frozen Large Language Models","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"promptcap-prompt-guided-image-captioning-for","title":"PromptCap: Prompt-Guided Image Captioning for VQA with GPT-3","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rmlvqa-a-margin-loss-approach-for-visual","title":"RMLVQA: A Margin Loss Approach for Visual Question Answering With Language Biases","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/hitea-hierarchical-temporal-aware-video","slug":"hitea-hierarchical-temporal-aware-video","title":"HiTeA: Hierarchical Temporal-Aware Video-Language Pre-training","date":"2022-12-30","arxiv_id":"2212.14546","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqa-and-visual-reasoning-an-overview-of","title":"VQA and Visual Reasoning: An Overview of Recent Datasets, Methods and Challenges","date":"2022-12-26","arxiv_id":"2212.13296","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-are-lemons-purple-the-concept","title":"When are Lemons Purple? The Concept Association Bias of Vision-Language Models","date":"2022-12-22","arxiv_id":"2212.12043","repositories_listed":0,"syntology":null},{"url":null,"slug":"uniclam-contrastive-representation-learning","title":"UnICLAM:Contrastive Representation Learning with Adversarial Masking for Unified and Interpretable Medical Vision Question Answering","date":"2022-12-21","arxiv_id":"2212.10729","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-unsupervised-visual-reasoning-do-off","title":"Towards Unsupervised Visual Reasoning: Do Off-The-Shelf Features Know How to Reason?","date":"2022-12-20","arxiv_id":"2212.10292","repositories_listed":0,"syntology":null},{"url":null,"slug":"scenegate-scene-graph-based-co-attention","title":"SceneGATE: Scene-Graph based co-Attention networks for TExt visual question answering","date":"2022-12-16","arxiv_id":"2212.08283","repositories_listed":0,"syntology":null},{"url":"/paper/video-text-modeling-with-zero-shot-transfer","slug":"video-text-modeling-with-zero-shot-transfer","title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","date":"2022-12-09","arxiv_id":"2212.04979","repositories_listed":0,"syntology":null},{"url":"/paper/parsvqa-caps-a-benchmark-for-visual-question","slug":"parsvqa-caps-a-benchmark-for-visual-question","title":"ParsVQA-Caps: A Benchmark for Visual Question Answering and Image Captioning in Persian","date":"2022-12-07","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"review-of-ansatz-designing-techniques-for","title":"Review of Ansatz Designing Techniques for Variational Quantum Algorithms","date":"2022-12-07","arxiv_id":"2212.04913","repositories_listed":0,"syntology":null},{"url":null,"slug":"compound-tokens-channel-fusion-for-vision","title":"Compound Tokens: Channel Fusion for Vision-Language Representation Learning","date":"2022-12-02","arxiv_id":"2212.01447","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-explanations-by-network","title":"Optimizing Explanations by Network Canonization and Hyperparameter Search","date":"2022-11-30","arxiv_id":"2211.17174","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-learning-of-perceptual-video","title":"Semi-supervised Learning of Perceptual Video Quality by Generating Consistent Pairwise Pseudo-Ranks","date":"2022-11-30","arxiv_id":"2211.17075","repositories_listed":0,"syntology":null},{"url":null,"slug":"piggyback-pretrained-visual-question","title":"PiggyBack: Pretrained Visual Question Answering Environment for Backing up Non-deep Learning Professionals","date":"2022-11-29","arxiv_id":"2211.15940","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuro-symbolic-spatio-temporal-reasoning","title":"Neuro-Symbolic Spatio-Temporal Reasoning","date":"2022-11-28","arxiv_id":"2211.15566","repositories_listed":0,"syntology":null},{"url":null,"slug":"look-read-and-ask-learning-to-ask-questions","title":"Look, Read and Ask: Learning to Ask Questions by Reading Text in Images","date":"2022-11-23","arxiv_id":"2211.12950","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-short-survey-of-systematic-generalization","title":"A Short Survey of Systematic Generalization","date":"2022-11-22","arxiv_id":"2211.11956","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-self-consistency-and-performance-of","title":"Enhancing Self-Consistency and Performance of Pre-Trained Language Models through Natural Language Inference","date":"2022-11-21","arxiv_id":"2211.11875","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-knowledge-enhanced-multimodal","title":"A survey on knowledge-enhanced multimodal learning","date":"2022-11-19","arxiv_id":"2211.12328","repositories_listed":0,"syntology":null},{"url":null,"slug":"cl-crossvqa-a-continual-learning-benchmark","title":"CL-CrossVQA: A Continual Learning Benchmark for Cross-Domain Visual Question Answering","date":"2022-11-19","arxiv_id":"2211.10567","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-aware-dual-routing-network-for-visual","title":"Text-Aware Dual Routing Network for Visual Question Answering","date":"2022-11-17","arxiv_id":"2211.14450","repositories_listed":0,"syntology":null},{"url":null,"slug":"alignve-visual-entailment-recognition-based","title":"AlignVE: Visual Entailment Recognition Based on Alignment Relations","date":"2022-11-16","arxiv_id":"2211.08736","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-answer-multilingual-and-code","title":"Learning to Answer Multilingual and Code-Mixed Questions","date":"2022-11-14","arxiv_id":"2211.07522","repositories_listed":0,"syntology":null},{"url":null,"slug":"mf2-mvqa-a-multi-stage-feature-fusion-method","title":"MF2-MVQA: A Multi-stage Feature Fusion method for Medical Visual Question Answering","date":"2022-11-11","arxiv_id":"2211.05991","repositories_listed":0,"syntology":null},{"url":null,"slug":"watching-the-news-towards-videoqa-models-that","title":"Watching the News: Towards VideoQA Models that can Read","date":"2022-11-10","arxiv_id":"2211.05588","repositories_listed":0,"syntology":null},{"url":"/paper/ernie-unix2-a-unified-cross-lingual-cross","slug":"ernie-unix2-a-unified-cross-lingual-cross","title":"ERNIE-UniX2: A Unified Cross-lingual Cross-modal Framework for Understanding and Generation","date":"2022-11-09","arxiv_id":"2211.04861","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-reasoning-aware-explainable-vqa","title":"Towards Reasoning-Aware Explainable VQA","date":"2022-11-09","arxiv_id":"2211.05190","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-differences-between-end-to-end","title":"Generalization Differences between End-to-End and Neuro-Symbolic Vision-Language Reasoning Systems","date":"2022-10-26","arxiv_id":"2210.15037","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-by-hallucinating-vision-language-pre","title":"Learning by Hallucinating: Vision-Language Pre-training with Weak Supervision","date":"2022-10-24","arxiv_id":"2210.13591","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-semantic-relation-generation","title":"Image Semantic Relation Generation","date":"2022-10-19","arxiv_id":"2210.11253","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligning-magma-by-few-shot-learning-and","title":"Aligning MAGMA by Few-Shot Learning and Finetuning","date":"2022-10-18","arxiv_id":"2210.14161","repositories_listed":0,"syntology":null},{"url":null,"slug":"entity-focused-dense-passage-retrieval-for","title":"Entity-Focused Dense Passage Retrieval for Outside-Knowledge Visual Question Answering","date":"2022-10-18","arxiv_id":"2210.10176","repositories_listed":0,"syntology":null},{"url":null,"slug":"dcvqe-a-hierarchical-transformer-for-video","title":"DCVQE: A Hierarchical Transformer for Video Quality Assessment","date":"2022-10-10","arxiv_id":"2210.04377","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-fusion-transformer-for-visual","title":"Multi-Modal Fusion Transformer for Visual Question Answering in Remote Sensing","date":"2022-10-10","arxiv_id":"2210.04510","repositories_listed":0,"syntology":null},{"url":"/paper/hvs-revisited-a-comprehensive-video-quality","slug":"hvs-revisited-a-comprehensive-video-quality","title":"HVS Revisited: A Comprehensive Video Quality Assessment Framework","date":"2022-10-09","arxiv_id":"2210.04158","repositories_listed":0,"syntology":null},{"url":null,"slug":"mamo-masked-multimodal-modeling-for-fine","title":"MAMO: Masked Multimodal Modeling for Fine-Grained Vision-Language Representation Learning","date":"2022-10-09","arxiv_id":"2210.04183","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-capsule-attention-mask-network-with","title":"Dual Capsule Attention Mask Network with Mutual Learning for Visual Question Answering","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-effects-of-video-grounding-on-language","title":"On the Effects of Video Grounding on Language Models","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"repsnet-combining-vision-with-language-for","title":"RepsNet: Combining Vision with Language for Automated Medical Reports","date":"2022-09-27","arxiv_id":"2209.13171","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-3d-spatial-reasoning-for-human-like","title":"Toward 3D Spatial Reasoning for Human-like Text-based Visual Question Answering","date":"2022-09-21","arxiv_id":"2209.10326","repositories_listed":0,"syntology":null},{"url":"/paper/omnivl-one-foundation-model-for-image","slug":"omnivl-one-foundation-model-for-image","title":"OmniVL:One Foundation Model for Image-Language and Video-Language Tasks","date":"2022-09-15","arxiv_id":"2209.07526","repositories_listed":0,"syntology":null},{"url":null,"slug":"finetuning-pretrained-vision-language-models","title":"Correlation Information Bottleneck: Towards Adapting Pretrained Multimodal Models for Robust Visual Question Answering","date":"2022-09-14","arxiv_id":"2209.06954","repositories_listed":0,"syntology":null},{"url":null,"slug":"must-vqa-multilingual-scene-text-vqa","title":"MUST-VQA: MUltilingual Scene-text VQA","date":"2022-09-14","arxiv_id":"2209.06730","repositories_listed":0,"syntology":null},{"url":null,"slug":"prestu-pre-training-for-scene-text","title":"PreSTU: Pre-Training for Scene-Text Understanding","date":"2022-09-12","arxiv_id":"2209.05534","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-image-language-transformers-for","title":"Pre-training image-language transformers for open-vocabulary tasks","date":"2022-09-09","arxiv_id":"2209.04372","repositories_listed":0,"syntology":null},{"url":null,"slug":"fashionvqa-a-domain-specific-visual-question","title":"FashionVQA: A Domain-Specific Visual Question Answering System","date":"2022-08-24","arxiv_id":"2208.11253","repositories_listed":0,"syntology":null}],"record_sha256":"a459944f45cd39787d27c9f48c5a9a30c9186e8ca33e91ae2b0268f0b14ddaaf","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}