{"url":"/sota/visual-question-answering-on-vqa-v2-test-dev","task":{"name":"Visual Question Answering (VQA)","url":"/task/visual-question-answering","note":null},"dataset":{"name":"VQA v2 test-dev","url":"/dataset/visual-question-answering-v2-0"},"category":"Computer Vision","categories":["Computer Vision","Natural Language Processing"],"category_note":null,"description":"**Visual Question Answering (VQA)** is a task in computer vision that involves answering questions about an image. The goal of VQA is to teach machines to understand the content of an image and answer questions about it in natural language.\r\n\r\nImage Source: [visualqa.org](https://visualqa.org/)","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Accuracy"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Accuracy":"higher"}},"counts":{"rows":56,"rows_with_code":51,"rows_with_paper_page":54,"rows_dated":54,"rows_using_additional_data":3},"rows":[{"rank_in_archive_order":1,"model":"PaLI","metrics":{"Accuracy":"84.3"},"uses_additional_data":false,"paper_date":"2022-09-14","paper":"/paper/pali-a-jointly-scaled-multilingual-language","paper_url":"https://arxiv.org/abs/2209.06794v4","paper_title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","code":"https://github.com/google-research/big_vision","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"BEiT-3","metrics":{"Accuracy":"84.19"},"uses_additional_data":false,"paper_date":"2022-08-22","paper":"/paper/image-as-a-foreign-language-beit-pretraining","paper_url":"https://arxiv.org/abs/2208.10442v2","paper_title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","code":"https://github.com/microsoft/unilm/tree/master/beit","n_code_links":2,"syntology":null},{"rank_in_archive_order":3,"model":"VLMo","metrics":{"Accuracy":"82.78"},"uses_additional_data":false,"paper_date":"2021-11-03","paper":"/paper/vlmo-unified-vision-language-pre-training","paper_url":"https://arxiv.org/abs/2111.02358v2","paper_title":"VLMo: Unified Vision-Language Pre-Training with Mixture-of-Modality-Experts","code":"https://github.com/microsoft/unilm/tree/master/vlmo","n_code_links":2,"syntology":null},{"rank_in_archive_order":4,"model":"ONE-PEACE","metrics":{"Accuracy":"82.6"},"uses_additional_data":false,"paper_date":"2023-05-18","paper":"/paper/one-peace-exploring-one-general","paper_url":"https://arxiv.org/abs/2305.11172v1","paper_title":"ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities","code":"https://github.com/modelscope/modelscope","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"mPLUG (Huge)","metrics":{"Accuracy":"82.43"},"uses_additional_data":false,"paper_date":"2022-05-24","paper":"/paper/mplug-effective-and-efficient-vision-language","paper_url":"https://arxiv.org/abs/2205.12005v2","paper_title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","code":"https://github.com/modelscope/modelscope","n_code_links":3,"syntology":null},{"rank_in_archive_order":6,"model":"CuMo-7B","metrics":{"Accuracy":"82.2"},"uses_additional_data":true,"paper_date":"2024-05-09","paper":"/paper/cumo-scaling-multimodal-llm-with-co-upcycled","paper_url":"https://arxiv.org/abs/2405.05949v1","paper_title":"CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts","code":"https://github.com/shi-labs/cumo","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":2,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"X2-VLM (large)","metrics":{"Accuracy":"81.9"},"uses_additional_data":false,"paper_date":"2022-11-22","paper":"/paper/x-2-vlm-all-in-one-pre-trained-model-for","paper_url":"https://arxiv.org/abs/2211.12402v2","paper_title":"X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks","code":"https://github.com/zengyan-97/x-vlm","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":8,"model":"MMU","metrics":{"Accuracy":"81.26"},"uses_additional_data":false,"paper_date":"2021-11-17","paper":"/paper/achieving-human-parity-on-visual-question","paper_url":"https://arxiv.org/abs/2111.08896v3","paper_title":"Achieving Human Parity on Visual Question Answering","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":9,"model":"Lyrics","metrics":{"Accuracy":"81.2"},"uses_additional_data":false,"paper_date":"2023-12-08","paper":"/paper/lyrics-boosting-fine-grained-language-vision","paper_url":"https://arxiv.org/abs/2312.05278v2","paper_title":"Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":10,"model":"InternVL-C","metrics":{"Accuracy":"81.2"},"uses_additional_data":false,"paper_date":"2023-12-21","paper":"/paper/internvl-scaling-up-vision-foundation-models","paper_url":"https://arxiv.org/abs/2312.14238v3","paper_title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","code":"https://github.com/opengvlab/internvl","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":11,"model":"X2-VLM (base)","metrics":{"Accuracy":"80.4"},"uses_additional_data":false,"paper_date":"2022-11-22","paper":"/paper/x-2-vlm-all-in-one-pre-trained-model-for","paper_url":"https://arxiv.org/abs/2211.12402v2","paper_title":"X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks","code":"https://github.com/zengyan-97/x-vlm","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":12,"model":"XFM (base)","metrics":{"Accuracy":"80.4"},"uses_additional_data":false,"paper_date":"2023-01-12","paper":"/paper/toward-building-general-foundation-models-for","paper_url":"https://arxiv.org/abs/2301.05065v2","paper_title":"Toward Building General Foundation Models for Language, Vision, and Vision-Language Understanding Tasks","code":"https://github.com/zhangxinsong-nlp/XFM","n_code_links":1,"syntology":null},{"rank_in_archive_order":13,"model":"VAST","metrics":{"Accuracy":"80.23"},"uses_additional_data":true,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":14,"model":"SimVLM","metrics":{"Accuracy":"80.03"},"uses_additional_data":false,"paper_date":"2021-08-24","paper":"/paper/simvlm-simple-visual-language-model","paper_url":"https://arxiv.org/abs/2108.10904v3","paper_title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","code":"https://github.com/yulong-XJTU/SimVLM","n_code_links":2,"syntology":{"n_ran":22,"n_unverified":15,"n_samples":37,"n_pointer_only_licence":28}},{"rank_in_archive_order":15,"model":"VALOR","metrics":{"Accuracy":"78.46"},"uses_additional_data":true,"paper_date":"2023-04-17","paper":"/paper/valor-vision-audio-language-omni-perception","paper_url":"https://arxiv.org/abs/2304.08345v2","paper_title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","code":"https://github.com/TXH-mercury/VALOR","n_code_links":1,"syntology":null},{"rank_in_archive_order":16,"model":"Prismer","metrics":{"Accuracy":"78.43"},"uses_additional_data":false,"paper_date":"2023-03-04","paper":"/paper/prismer-a-vision-language-model-with-an","paper_url":"https://arxiv.org/abs/2303.02506v3","paper_title":"Prismer: A Vision-Language Model with Multi-Task Experts","code":"https://github.com/nvlabs/prismer","n_code_links":2,"syntology":null},{"rank_in_archive_order":17,"model":"X-VLM (base)","metrics":{"Accuracy":"78.22"},"uses_additional_data":false,"paper_date":"2021-11-16","paper":"/paper/multi-grained-vision-language-pre-training","paper_url":"https://arxiv.org/abs/2111.08276v3","paper_title":"Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts","code":"https://github.com/zengyan-97/x-vlm","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":18,"model":"VK-OOD","metrics":{"Accuracy":"77.9"},"uses_additional_data":false,"paper_date":"2023-09-21","paper":"/paper/implicit-differentiable-outlier-detection","paper_url":"https://openreview.net/forum?id=jooPcatnVF","paper_title":"Implicit Differentiable Outlier Detection Enable Robust Deep Multimodal Analysis","code":"https://github.com/ellenzhuwang/implicit_vkood","n_code_links":1,"syntology":null},{"rank_in_archive_order":19,"model":"ALBEF (14M)","metrics":{"Accuracy":"75.84"},"uses_additional_data":false,"paper_date":"2021-07-16","paper":"/paper/align-before-fuse-vision-and-language","paper_url":"https://arxiv.org/abs/2107.07651v2","paper_title":"Align before Fuse: Vision and Language Representation Learning with Momentum Distillation","code":"https://github.com/salesforce/lavis","n_code_links":6,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":3}},{"rank_in_archive_order":20,"model":"Oscar","metrics":{"Accuracy":"73.82"},"uses_additional_data":false,"paper_date":"2020-04-13","paper":"/paper/oscar-object-semantics-aligned-pre-training","paper_url":"https://arxiv.org/abs/2004.06165v5","paper_title":"Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks","code":"https://github.com/rmokady/clip_prefix_caption","n_code_links":4,"syntology":{"n_ran":13,"n_unverified":10,"n_samples":23,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"UNITER (Large)","metrics":{"Accuracy":"73.24"},"uses_additional_data":false,"paper_date":"2019-09-25","paper":"/paper/uniter-learning-universal-image-text-1","paper_url":"https://arxiv.org/abs/1909.11740v3","paper_title":"UNITER: UNiversal Image-TExt Representation Learning","code":"https://github.com/ChenRocks/UNITER","n_code_links":7,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":22,"model":"X-101 grid features + MCAN","metrics":{"Accuracy":"72.59"},"uses_additional_data":false,"paper_date":"2020-01-10","paper":"/paper/in-defense-of-grid-features-for-visual","paper_url":"https://arxiv.org/abs/2001.03615v2","paper_title":"In Defense of Grid Features for Visual Question Answering","code":"https://github.com/clip-vil/CLIP-ViL","n_code_links":2,"syntology":null},{"rank_in_archive_order":23,"model":"CFR","metrics":{"Accuracy":"72.5"},"uses_additional_data":false,"paper_date":"2021-10-06","paper":"/paper/coarse-to-fine-reasoning-for-visual-question","paper_url":"https://arxiv.org/abs/2110.02526v2","paper_title":"Coarse-to-Fine Reasoning for Visual Question Answering","code":"https://github.com/aioz-ai/cfr_vqa","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":24,"model":"VL-BERTLARGE","metrics":{"Accuracy":"71.79"},"uses_additional_data":false,"paper_date":"2019-08-22","paper":"/paper/vl-bert-pre-training-of-generic-visual","paper_url":"https://arxiv.org/abs/1908.08530v4","paper_title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","code":"https://github.com/jackroos/VL-BERT","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":25,"model":"ViLT-B/32","metrics":{"Accuracy":"71.26"},"uses_additional_data":false,"paper_date":"2021-02-05","paper":"/paper/vilt-vision-and-language-transformer-without","paper_url":"https://arxiv.org/abs/2102.03334v2","paper_title":"ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision","code":"https://github.com/huggingface/transformers","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":1}},{"rank_in_archive_order":26,"model":"MCAN+VC","metrics":{"Accuracy":"71.21"},"uses_additional_data":false,"paper_date":"2020-02-27","paper":"/paper/visual-commonsense-r-cnn","paper_url":"https://arxiv.org/abs/2002.12204v3","paper_title":"Visual Commonsense R-CNN","code":"https://github.com/Wangt-CN/VC-R-CNN","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":27,"model":"VL-BERTBASE","metrics":{"Accuracy":"71.16"},"uses_additional_data":false,"paper_date":"2019-08-22","paper":"/paper/vl-bert-pre-training-of-generic-visual","paper_url":"https://arxiv.org/abs/1908.08530v4","paper_title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","code":"https://github.com/jackroos/VL-BERT","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":28,"model":"VisualBERT","metrics":{"Accuracy":"70.8"},"uses_additional_data":false,"paper_date":"2019-08-09","paper":"/paper/visualbert-a-simple-and-performant-baseline","paper_url":"https://arxiv.org/abs/1908.03557v1","paper_title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","code":"https://github.com/uclanlp/visualbert","n_code_links":10,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":6}},{"rank_in_archive_order":29,"model":"MCANed-6","metrics":{"Accuracy":"70.63"},"uses_additional_data":false,"paper_date":"2019-06-25","paper":"/paper/deep-modular-co-attention-networks-for-visual-1","paper_url":"https://arxiv.org/abs/1906.10770v1","paper_title":"Deep Modular Co-Attention Networks for Visual Question Answering","code":"https://github.com/MILVLG/mcan-vqa","n_code_links":7,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":30,"model":"ViLBERT","metrics":{"Accuracy":"70.55"},"uses_additional_data":false,"paper_date":"2019-08-06","paper":"/paper/vilbert-pretraining-task-agnostic","paper_url":"https://arxiv.org/abs/1908.02265v1","paper_title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","code":"https://github.com/facebookresearch/vilbert-multi-task","n_code_links":11,"syntology":{"n_ran":10,"n_unverified":24,"n_samples":34,"n_pointer_only_licence":34}},{"rank_in_archive_order":31,"model":"BAN+Glove+Counter","metrics":{"Accuracy":"70.04"},"uses_additional_data":false,"paper_date":"2018-05-21","paper":"/paper/bilinear-attention-networks","paper_url":"http://arxiv.org/abs/1805.07932v2","paper_title":"Bilinear Attention Networks","code":"https://github.com/facebookresearch/mmf","n_code_links":8,"syntology":{"n_ran":4,"n_unverified":9,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":32,"model":"LXMERT (Pre-train + scratch)","metrics":{"Accuracy":"69.9"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/lxmert-learning-cross-modality-encoder","paper_url":"https://arxiv.org/abs/1908.07490v3","paper_title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":4,"n_unverified":11,"n_samples":15,"n_pointer_only_licence":3}},{"rank_in_archive_order":33,"model":"Image features from bottom-up attention (adaptive K, ensemble)","metrics":{"Accuracy":"69.87"},"uses_additional_data":false,"paper_date":"2017-08-09","paper":"/paper/tips-and-tricks-for-visual-question-answering","paper_url":"http://arxiv.org/abs/1708.02711v1","paper_title":"Tips and Tricks for Visual Question Answering: Learnings from the 2017 Challenge","code":"https://github.com/peteanderson80/bottom-up-attention","n_code_links":10,"syntology":null},{"rank_in_archive_order":34,"model":"Pythia v0.3 + LoRRA","metrics":{"Accuracy":"69.21"},"uses_additional_data":false,"paper_date":"2019-04-18","paper":"/paper/towards-vqa-models-that-can-read","paper_url":"https://arxiv.org/abs/1904.08920v2","paper_title":"Towards VQA Models That Can Read","code":"https://github.com/facebookresearch/pythia","n_code_links":7,"syntology":null},{"rank_in_archive_order":35,"model":"DMN","metrics":{"Accuracy":"68.09"},"uses_additional_data":false,"paper_date":"2018-02-15","paper":"/paper/learning-to-count-objects-in-natural-images","paper_url":"http://arxiv.org/abs/1802.05766v1","paper_title":"Learning to Count Objects in Natural Images for Visual Question Answering","code":"https://github.com/Cyanogenoid/vqa-counting","n_code_links":1,"syntology":null},{"rank_in_archive_order":36,"model":"LaKo","metrics":{"Accuracy":"68.07"},"uses_additional_data":false,"paper_date":"2022-07-26","paper":"/paper/lako-knowledge-driven-visual-question","paper_url":"https://arxiv.org/abs/2207.12888v2","paper_title":"LaKo: Knowledge-driven Visual Question Answering via Late Knowledge-to-Text Injection","code":"https://github.com/hackerchenzhuo/LaKo","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":37,"model":"MuRel","metrics":{"Accuracy":"68.03"},"uses_additional_data":false,"paper_date":"2019-02-25","paper":"/paper/murel-multimodal-relational-reasoning-for","paper_url":"http://arxiv.org/abs/1902.09487v1","paper_title":"MUREL: Multimodal Relational Reasoning for Visual Question Answering","code":"https://github.com/Cadene/murel.bootstrap.pytorch","n_code_links":1,"syntology":null},{"rank_in_archive_order":38,"model":"BLOCK","metrics":{"Accuracy":"67.58"},"uses_additional_data":false,"paper_date":"2019-01-31","paper":"/paper/block-bilinear-superdiagonal-fusion-for","paper_url":"http://arxiv.org/abs/1902.00038v2","paper_title":"BLOCK: Bilinear Superdiagonal Fusion for Visual Question Answering and Visual Relationship Detection","code":"https://github.com/Cadene/block.bootstrap.pytorch","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":39,"model":"MUTAN","metrics":{"Accuracy":"67.42"},"uses_additional_data":false,"paper_date":"2017-05-18","paper":"/paper/mutan-multimodal-tucker-fusion-for-visual","paper_url":"http://arxiv.org/abs/1705.06676v1","paper_title":"MUTAN: Multimodal Tucker Fusion for Visual Question Answering","code":"https://github.com/Cadene/vqa.pytorch","n_code_links":6,"syntology":null},{"rank_in_archive_order":40,"model":"BAN2-CTI","metrics":{"Accuracy":"67.4"},"uses_additional_data":false,"paper_date":"2019-09-26","paper":"/paper/compact-trilinear-interaction-for-visual","paper_url":"https://arxiv.org/abs/1909.11874v1","paper_title":"Compact Trilinear Interaction for Visual Question Answering","code":"https://github.com/aioz-ai/ICCV19_VQA-CTI","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":41,"model":"2D continuous softmax","metrics":{"Accuracy":"65.96"},"uses_additional_data":false,"paper_date":"2020-06-12","paper":"/paper/sparse-and-continuous-attention-mechanisms","paper_url":"https://arxiv.org/abs/2006.07214v3","paper_title":"Sparse and Continuous Attention Mechanisms","code":"https://github.com/deep-spin/mcan-vqa-continuous-attention","n_code_links":2,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":2}},{"rank_in_archive_order":42,"model":"BLIP-2 ViT-G FlanT5 XXL (zero-shot)","metrics":{"Accuracy":"65"},"uses_additional_data":false,"paper_date":"2023-01-30","paper":"/paper/blip-2-bootstrapping-language-image-pre","paper_url":"https://arxiv.org/abs/2301.12597v3","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","code":"https://github.com/huggingface/transformers","n_code_links":17,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":1}},{"rank_in_archive_order":43,"model":"N2NMN (ResNet-152, policy search)","metrics":{"Accuracy":"64.9"},"uses_additional_data":false,"paper_date":"2017-04-18","paper":"/paper/learning-to-reason-end-to-end-module-networks","paper_url":"http://arxiv.org/abs/1704.05526v3","paper_title":"Learning to Reason: End-to-End Module Networks for Visual Question Answering","code":"https://github.com/ronghanghu/n2nmn","n_code_links":1,"syntology":null},{"rank_in_archive_order":44,"model":"PNP-VQA","metrics":{"Accuracy":"64.8"},"uses_additional_data":false,"paper_date":"2022-10-17","paper":"/paper/plug-and-play-vqa-zero-shot-vqa-by-conjoining","paper_url":"https://arxiv.org/abs/2210.08773v3","paper_title":"Plug-and-Play VQA: Zero-shot VQA by Conjoining Large Pretrained Models with Zero Training","code":"https://github.com/salesforce/lavis","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":45,"model":"MCB","metrics":{"Accuracy":"64.7"},"uses_additional_data":false,"paper_date":"2016-06-06","paper":"/paper/multimodal-compact-bilinear-pooling-for","paper_url":"http://arxiv.org/abs/1606.01847v3","paper_title":"Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding","code":"https://github.com/Cadene/vqa.pytorch","n_code_links":10,"syntology":null},{"rank_in_archive_order":46,"model":"RUBi","metrics":{"Accuracy":"63.18"},"uses_additional_data":false,"paper_date":"2019-06-24","paper":"/paper/rubi-reducing-unimodal-biases-in-visual","paper_url":"https://arxiv.org/abs/1906.10169v2","paper_title":"RUBi: Reducing Unimodal Biases in Visual Question Answering","code":"https://github.com/cdancette/rubi.bootstrap.pytorch","n_code_links":1,"syntology":null},{"rank_in_archive_order":47,"model":"BLIP-2 ViT-G FlanT5 XL (zero-shot)","metrics":{"Accuracy":"63"},"uses_additional_data":false,"paper_date":"2023-01-30","paper":"/paper/blip-2-bootstrapping-language-image-pre","paper_url":"https://arxiv.org/abs/2301.12597v3","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","code":"https://github.com/huggingface/transformers","n_code_links":17,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":1}},{"rank_in_archive_order":48,"model":"BLIP-2 ViT-L FlanT5 XL (zero-shot)","metrics":{"Accuracy":"62.3"},"uses_additional_data":false,"paper_date":"2023-01-30","paper":"/paper/blip-2-bootstrapping-language-image-pre","paper_url":"https://arxiv.org/abs/2301.12597v3","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","code":"https://github.com/huggingface/transformers","n_code_links":17,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":1}},{"rank_in_archive_order":49,"model":"Flamingo 80B","metrics":{"Accuracy":"56.3"},"uses_additional_data":false,"paper_date":"2022-04-29","paper":"/paper/flamingo-a-visual-language-model-for-few-shot-1","paper_url":"https://arxiv.org/abs/2204.14198v2","paper_title":"Flamingo: a Visual Language Model for Few-Shot Learning","code":"https://github.com/mlfoundations/open_flamingo","n_code_links":5,"syntology":{"n_ran":18,"n_unverified":6,"n_samples":24,"n_pointer_only_licence":7}},{"rank_in_archive_order":50,"model":"BLIP-2 ViT-G OPT 6.7B (zero-shot)","metrics":{"Accuracy":"52.6"},"uses_additional_data":false,"paper_date":"2023-01-30","paper":"/paper/blip-2-bootstrapping-language-image-pre","paper_url":"https://arxiv.org/abs/2301.12597v3","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","code":"https://github.com/huggingface/transformers","n_code_links":17,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":1}},{"rank_in_archive_order":51,"model":"BLIP-2 ViT-G OPT 2.7B (zero-shot)","metrics":{"Accuracy":"52.3"},"uses_additional_data":false,"paper_date":"2023-01-30","paper":"/paper/blip-2-bootstrapping-language-image-pre","paper_url":"https://arxiv.org/abs/2301.12597v3","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","code":"https://github.com/huggingface/transformers","n_code_links":17,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":1}},{"rank_in_archive_order":52,"model":"Flamingo 9B","metrics":{"Accuracy":"51.8"},"uses_additional_data":false,"paper_date":"2022-04-29","paper":"/paper/flamingo-a-visual-language-model-for-few-shot-1","paper_url":"https://arxiv.org/abs/2204.14198v2","paper_title":"Flamingo: a Visual Language Model for Few-Shot Learning","code":"https://github.com/mlfoundations/open_flamingo","n_code_links":5,"syntology":{"n_ran":18,"n_unverified":6,"n_samples":24,"n_pointer_only_licence":7}},{"rank_in_archive_order":53,"model":"KOSMOS-1 1.6B (zero-shot)","metrics":{"Accuracy":"51.0"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":54,"model":"BLIP-2 ViT-L OPT 2.7B (zero-shot)","metrics":{"Accuracy":"49.7"},"uses_additional_data":false,"paper_date":"2023-01-30","paper":"/paper/blip-2-bootstrapping-language-image-pre","paper_url":"https://arxiv.org/abs/2301.12597v3","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","code":"https://github.com/huggingface/transformers","n_code_links":17,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":1}},{"rank_in_archive_order":55,"model":"Flamingo 3B","metrics":{"Accuracy":"49.2"},"uses_additional_data":false,"paper_date":"2022-04-29","paper":"/paper/flamingo-a-visual-language-model-for-few-shot-1","paper_url":"https://arxiv.org/abs/2204.14198v2","paper_title":"Flamingo: a Visual Language Model for Few-Shot Learning","code":"https://github.com/mlfoundations/open_flamingo","n_code_links":5,"syntology":{"n_ran":18,"n_unverified":6,"n_samples":24,"n_pointer_only_licence":7}},{"rank_in_archive_order":56,"model":"VLKD","metrics":{"Accuracy":"44.5"},"uses_additional_data":false,"paper_date":"2021-11-16","paper":"/paper/enabling-multimodal-generation-on-clip-via","paper_url":"https://openreview.net/forum?id=YTGg7kv8qIq","paper_title":"Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation","code":null,"n_code_links":0,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,885 of the 9,623 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9623,"papers_checked":6885,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":2737},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":35,"rows_with_any_sample_ran":31,"distinct_papers_with_graph_line":26,"distinct_papers_with_any_sample_ran":23,"samples_over_distinct_papers":{"n_ran":128,"n_unverified":120,"n_samples":248,"n_pointer_only_licence":99,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":187,"n_unverified":156,"n_samples":343,"n_pointer_only_licence":124,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}