{"url":"/task/visual-question-answering-1","name":"Visual Question Answering","slug":"visual-question-answering-1","description_markdown":"MLLM Leaderboard","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":2177,"papers_with_code":1042,"benchmarks":29,"benchmark_tables_in_archive":29,"benchmark_tables_shown":29,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":32,"subtasks":5,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/visual-question-answering-on-mm-vet","slug":"visual-question-answering-on-mm-vet","dataset":"MM-Vet","dataset_url":"/dataset/mm-vet","rows_in_archive":231,"metrics":["GPT-4 score","Params"],"first_row_in_archive_order":{"model":"gemini-2.0-flash-exp","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-mm-vet-v2","slug":"visual-question-answering-on-mm-vet-v2","dataset":"MM-Vet v2","dataset_url":"/dataset/mm-vet-v2","rows_in_archive":24,"metrics":["GPT-4 score","Params"],"first_row_in_archive_order":{"model":"gemini-2.0-flash-exp","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-vip-bench","slug":"visual-question-answering-on-vip-bench","dataset":"ViP-Bench","dataset_url":"/dataset/vip-bench","rows_in_archive":13,"metrics":["GPT-4 score (bbox)","GPT-4 score (human)"],"first_row_in_archive_order":{"model":"GPT-4V-turbo-detail:high (Visual Prompt)","paper_title":"GPT-4 Technical Report","paper_url":"/paper/gpt-4-technical-report-1","paper_date":"2023-03-15","arxiv_id":"2303.08774","code_links":[{"title":"openai/evals","url":"https://github.com/openai/evals"},{"title":"shmsw25/factscore","url":"https://github.com/shmsw25/factscore"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"gpt4life/alpagasus","url":"https://github.com/gpt4life/alpagasus"},{"title":"emrgnt-cmplxty/zero-shot-replication","url":"https://github.com/emrgnt-cmplxty/zero-shot-replication"},{"title":"ethz-privsec/superhuman-ai-consistency","url":"https://github.com/ethz-privsec/superhuman-ai-consistency"},{"title":"ethz-spylab/superhuman-ai-consistency","url":"https://github.com/ethz-spylab/superhuman-ai-consistency"},{"title":"eternityyw/tram-benchmark","url":"https://github.com/eternityyw/tram-benchmark"},{"title":"AUCOHL/RTL-Repo","url":"https://github.com/AUCOHL/RTL-Repo"},{"title":"zach-zhiling-zheng/reticular_chemist","url":"https://github.com/zach-zhiling-zheng/reticular_chemist"},{"title":"lflage/openfactscore","url":"https://github.com/lflage/openfactscore"}],"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":1}}},{"leaderboard":"/sota/visual-question-answering-on-vqa-v2-test-dev-1","slug":"visual-question-answering-on-vqa-v2-test-dev-1","dataset":"VQA v2 test-dev","dataset_url":"/dataset/visual-question-answering-v2-0","rows_in_archive":11,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"BLIP-2 ViT-G OPT 6.7B (fine-tuned)","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","paper_url":"/paper/blip-2-bootstrapping-language-image-pre","paper_date":"2023-01-30","arxiv_id":"2301.12597","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"salesforce/lavis","url":"https://github.com/salesforce/lavis"},{"title":"thudm/visualglm-6b","url":"https://github.com/thudm/visualglm-6b"},{"title":"baaivision/eva","url":"https://github.com/baaivision/eva"},{"title":"junshutang/Make-It-3D","url":"https://github.com/junshutang/Make-It-3D"},{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"yukw777/videoblip","url":"https://github.com/yukw777/videoblip"},{"title":"alibaba/graphtranslator","url":"https://github.com/alibaba/graphtranslator"},{"title":"gregor-ge/mblip","url":"https://github.com/gregor-ge/mblip"},{"title":"linzhiqiu/clip-flant5","url":"https://github.com/linzhiqiu/clip-flant5"},{"title":"kdr/videorag-mrr2024","url":"https://github.com/kdr/videorag-mrr2024"},{"title":"rabiulcste/vqazero","url":"https://github.com/rabiulcste/vqazero"},{"title":"jiwanchung/vlis","url":"https://github.com/jiwanchung/vlis"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-2/blip_2"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/blip_2"},{"title":"albertotestoni/ndq_visual_objects","url":"https://github.com/albertotestoni/ndq_visual_objects"}],"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}}},{"leaderboard":"/sota/visual-question-answering-on-benchlmm","slug":"visual-question-answering-on-benchlmm","dataset":"BenchLMM","dataset_url":"/dataset/benchlmm","rows_in_archive":10,"metrics":["GPT-3.5 score"],"first_row_in_archive_order":{"model":"GPT-4V","paper_title":"GPT-4 Technical Report","paper_url":"/paper/gpt-4-technical-report-1","paper_date":"2023-03-15","arxiv_id":"2303.08774","code_links":[{"title":"openai/evals","url":"https://github.com/openai/evals"},{"title":"shmsw25/factscore","url":"https://github.com/shmsw25/factscore"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"gpt4life/alpagasus","url":"https://github.com/gpt4life/alpagasus"},{"title":"emrgnt-cmplxty/zero-shot-replication","url":"https://github.com/emrgnt-cmplxty/zero-shot-replication"},{"title":"ethz-privsec/superhuman-ai-consistency","url":"https://github.com/ethz-privsec/superhuman-ai-consistency"},{"title":"ethz-spylab/superhuman-ai-consistency","url":"https://github.com/ethz-spylab/superhuman-ai-consistency"},{"title":"eternityyw/tram-benchmark","url":"https://github.com/eternityyw/tram-benchmark"},{"title":"AUCOHL/RTL-Repo","url":"https://github.com/AUCOHL/RTL-Repo"},{"title":"zach-zhiling-zheng/reticular_chemist","url":"https://github.com/zach-zhiling-zheng/reticular_chemist"},{"title":"lflage/openfactscore","url":"https://github.com/lflage/openfactscore"}],"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":1}}},{"leaderboard":"/sota/visual-question-answering-on-mmbench","slug":"visual-question-answering-on-mmbench","dataset":"MMBench","dataset_url":"/dataset/mmbench","rows_in_archive":5,"metrics":["GPT-3.5 score"],"first_row_in_archive_order":{"model":"LLaVA-InternLM2-ViT + MoSLoRA","paper_title":"Mixture-of-Subspaces in Low-Rank Adaptation","paper_url":"/paper/mixture-of-subspaces-in-low-rank-adaptation","paper_date":"2024-06-16","arxiv_id":"2406.11909","code_links":[{"title":"wutaiqiang/moslora","url":"https://github.com/wutaiqiang/moslora"}],"syntology":{"n":6,"n_ran":4,"n_unverified":2,"n_pointer_only":6}}},{"leaderboard":"/sota/visual-question-answering-on-v-bench","slug":"visual-question-answering-on-v-bench","dataset":"V*bench","dataset_url":null,"rows_in_archive":5,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"LLaVA-OneVision7B w. FOCUS","paper_title":"FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering","paper_url":"/paper/focus-internal-mllm-representations-for","paper_date":"2025-06-25","arxiv_id":"2506.21710","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-msrvtt-qa-2","slug":"visual-question-answering-on-msrvtt-qa-2","dataset":"MSRVTT-QA","dataset_url":"/dataset/msrvtt-qa","rows_in_archive":4,"metrics":["Test Accuracy","Accuracy"],"first_row_in_archive_order":{"model":"Aurora (ours, r=64) Aurora (ours, r=64)","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-vqa-v2-val-1","slug":"visual-question-answering-on-vqa-v2-val-1","dataset":"VQA v2 val","dataset_url":"/dataset/visual-question-answering-v2-0","rows_in_archive":4,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"BLIP-2 ViT-G OPT 6.7B (fine-tuned)","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","paper_url":"/paper/blip-2-bootstrapping-language-image-pre","paper_date":"2023-01-30","arxiv_id":"2301.12597","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"salesforce/lavis","url":"https://github.com/salesforce/lavis"},{"title":"thudm/visualglm-6b","url":"https://github.com/thudm/visualglm-6b"},{"title":"baaivision/eva","url":"https://github.com/baaivision/eva"},{"title":"junshutang/Make-It-3D","url":"https://github.com/junshutang/Make-It-3D"},{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"yukw777/videoblip","url":"https://github.com/yukw777/videoblip"},{"title":"alibaba/graphtranslator","url":"https://github.com/alibaba/graphtranslator"},{"title":"gregor-ge/mblip","url":"https://github.com/gregor-ge/mblip"},{"title":"linzhiqiu/clip-flant5","url":"https://github.com/linzhiqiu/clip-flant5"},{"title":"kdr/videorag-mrr2024","url":"https://github.com/kdr/videorag-mrr2024"},{"title":"rabiulcste/vqazero","url":"https://github.com/rabiulcste/vqazero"},{"title":"jiwanchung/vlis","url":"https://github.com/jiwanchung/vlis"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-2/blip_2"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/blip_2"},{"title":"albertotestoni/ndq_visual_objects","url":"https://github.com/albertotestoni/ndq_visual_objects"}],"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}}},{"leaderboard":"/sota/visual-question-answering-on-vqa-v2-test-std-1","slug":"visual-question-answering-on-vqa-v2-test-std-1","dataset":"VQA v2 test-std","dataset_url":"/dataset/visual-question-answering-v2-0","rows_in_archive":3,"metrics":["Accuracy","number","other","overall","yes/no"],"first_row_in_archive_order":{"model":"LXMERT (low-magnitude pruning)","paper_title":"LXMERT Model Compression for Visual Question Answering","paper_url":"/paper/lxmert-model-compression-for-visual-question","paper_date":"2023-10-23","arxiv_id":"2310.15325","code_links":[{"title":"ghazaleh-mahmoodi/lxmert_compression","url":"https://github.com/ghazaleh-mahmoodi/lxmert_compression"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/lxmert"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-mmhal-bench","slug":"visual-question-answering-on-mmhal-bench","dataset":"MMHal-Bench","dataset_url":null,"rows_in_archive":2,"metrics":["Hallucination Rate","Score"],"first_row_in_archive_order":{"model":"RLAIF-V 12B","paper_title":"RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V Trustworthiness","paper_url":"/paper/rlaif-v-aligning-mllms-through-open-source-ai","paper_date":"2024-05-27","arxiv_id":"2405.17220","code_links":[{"title":"openbmb/minicpm-v","url":"https://github.com/openbmb/minicpm-v"},{"title":"openbmb/omnilmm","url":"https://github.com/openbmb/omnilmm"},{"title":"OpenBMB/MiniCPM-o","url":"https://github.com/OpenBMB/MiniCPM-o"},{"title":"rlhf-v/rlaif-v","url":"https://github.com/rlhf-v/rlaif-v"},{"title":"rlhf-v/rlhf-v","url":"https://github.com/rlhf-v/rlhf-v"}],"syntology":{"n":22,"n_ran":14,"n_unverified":8,"n_pointer_only":8}}},{"leaderboard":"/sota/visual-question-answering-on-msvd-qa-2","slug":"visual-question-answering-on-msvd-qa-2","dataset":"MSVD-QA","dataset_url":"/dataset/msvd-qa","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"FrozenBiLM","paper_title":"Zero-Shot Video Question Answering via Frozen Bidirectional Language Models","paper_url":"/paper/zero-shot-video-question-answering-via-frozen","paper_date":"2022-06-16","arxiv_id":"2206.08155","code_links":[{"title":"antoyang/FrozenBiLM","url":"https://github.com/antoyang/FrozenBiLM"},{"title":"klauscc/dam","url":"https://github.com/klauscc/dam"},{"title":"sts-vlcc/sts-vlcc","url":"https://github.com/sts-vlcc/sts-vlcc"}],"syntology":{"n":34,"n_ran":14,"n_unverified":20,"n_pointer_only":1}}},{"leaderboard":"/sota/visual-question-answering-on-plotqa-d1-1","slug":"visual-question-answering-on-plotqa-d1-1","dataset":"PlotQA-D1","dataset_url":"/dataset/plotqa","rows_in_archive":2,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"MatCha4096 + LaMenDa","paper_title":"Synthesize Step-by-Step: Tools Templates and LLMs as Data Generators for Reasoning-Based Chart VQA","paper_url":"/paper/synthesize-step-by-step-tools-templates-and-1","paper_date":"2024-01-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-plotqa-d2-1","slug":"visual-question-answering-on-plotqa-d2-1","dataset":"PlotQA-D2","dataset_url":"/dataset/plotqa","rows_in_archive":2,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"MatCha4096 + LaMenDa","paper_title":"Synthesize Step-by-Step: Tools Templates and LLMs as Data Generators for Reasoning-Based Chart VQA","paper_url":"/paper/synthesize-step-by-step-tools-templates-and-1","paper_date":"2024-01-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-vqa-v2-1","slug":"visual-question-answering-on-vqa-v2-1","dataset":"VQA v2","dataset_url":"/dataset/visual-question-answering-v2-0","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"RLHF-V","paper_title":"RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback","paper_url":"/paper/rlhf-v-towards-trustworthy-mllms-via-behavior","paper_date":"2023-12-01","arxiv_id":"2312.00849","code_links":[{"title":"openbmb/minicpm-v","url":"https://github.com/openbmb/minicpm-v"},{"title":"rlhf-v/rlhf-v","url":"https://github.com/rlhf-v/rlhf-v"},{"title":"tidedra/vl-rlhf","url":"https://github.com/tidedra/vl-rlhf"},{"title":"exgc/r1v-free","url":"https://github.com/exgc/r1v-free"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-aid-vqa","slug":"visual-question-answering-on-aid-vqa","dataset":"AID-VQA","dataset_url":null,"rows_in_archive":1,"metrics":["Acc. (test)"],"first_row_in_archive_order":{"model":"SkySense-O","paper_title":"SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery","paper_url":"/paper/skysense-a-multi-modal-remote-sensing","paper_date":"2023-12-15","arxiv_id":"2312.10115","code_links":[{"title":"jack-bo1220/awesome-remote-sensing-foundation-models","url":"https://github.com/jack-bo1220/awesome-remote-sensing-foundation-models"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-amber","slug":"visual-question-answering-on-amber","dataset":"AMBER","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy","F1"],"first_row_in_archive_order":{"model":"RLAIF-V 12B","paper_title":"RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V Trustworthiness","paper_url":"/paper/rlaif-v-aligning-mllms-through-open-source-ai","paper_date":"2024-05-27","arxiv_id":"2405.17220","code_links":[{"title":"openbmb/minicpm-v","url":"https://github.com/openbmb/minicpm-v"},{"title":"openbmb/omnilmm","url":"https://github.com/openbmb/omnilmm"},{"title":"OpenBMB/MiniCPM-o","url":"https://github.com/OpenBMB/MiniCPM-o"},{"title":"rlhf-v/rlaif-v","url":"https://github.com/rlhf-v/rlaif-v"},{"title":"rlhf-v/rlhf-v","url":"https://github.com/rlhf-v/rlhf-v"}],"syntology":{"n":22,"n_ran":14,"n_unverified":8,"n_pointer_only":8}}},{"leaderboard":"/sota/visual-question-answering-on-clevr-1","slug":"visual-question-answering-on-clevr-1","dataset":"CLEVR","dataset_url":"/dataset/clevr","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"NeSyCoCo Neuro-Symbolic","paper_title":"NeSyCoCo: A Neuro-Symbolic Concept Composer for Compositional Generalization","paper_url":"/paper/nesycoco-a-neuro-symbolic-concept-composer","paper_date":"2024-12-20","arxiv_id":"2412.15588","code_links":[{"title":"hlr/nesycoco","url":"https://github.com/hlr/nesycoco"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-coco-visual-5","slug":"visual-question-answering-on-coco-visual-5","dataset":"COCO Visual Question Answering (VQA) real images 2.0 open ended","dataset_url":"/dataset/coco","rows_in_archive":1,"metrics":["Percentage correct"],"first_row_in_archive_order":{"model":"MaMMUT (2B)","paper_title":"MaMMUT: A Simple Architecture for Joint Learning for MultiModal Tasks","paper_url":"/paper/mammut-a-simple-architecture-for-joint","paper_date":"2023-03-29","arxiv_id":"2303.16839","code_links":[{"title":"lucidrains/mammut-pytorch","url":"https://github.com/lucidrains/mammut-pytorch"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-earthvqa","slug":"visual-question-answering-on-earthvqa","dataset":"EarthVQA","dataset_url":"/dataset/earthvqa","rows_in_archive":1,"metrics":["Overall Accuracy"],"first_row_in_archive_order":{"model":"SOBA","paper_title":"EarthVQA: Towards Queryable Earth via Relational Reasoning-Based Remote Sensing Visual Question Answering","paper_url":"/paper/earthvqa-towards-queryable-earth-via","paper_date":"2023-12-19","arxiv_id":"2312.12222","code_links":[{"title":"Junjue-Wang/EarthVQA","url":"https://github.com/Junjue-Wang/EarthVQA"}],"syntology":{"n":6,"n_ran":6,"n_unverified":0,"n_pointer_only":6}}},{"leaderboard":"/sota/visual-question-answering-on-gqa-1","slug":"visual-question-answering-on-gqa-1","dataset":"GQA","dataset_url":"/dataset/gqa","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"LocVLM-L","paper_title":"Learning to Localize Objects Improves Spatial Reasoning in Visual-LLMs","paper_url":"/paper/learning-to-localize-objects-improves-spatial","paper_date":"2024-04-11","arxiv_id":"2404.07449","code_links":[{"title":"kahnchana/locvlm","url":"https://github.com/kahnchana/locvlm"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-grit-1","slug":"visual-question-answering-on-grit-1","dataset":"GRIT","dataset_url":"/dataset/grit","rows_in_archive":1,"metrics":["VQA (ablation)"],"first_row_in_archive_order":{"model":"OFA","paper_title":"OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework","paper_url":"/paper/unifying-architectures-tasks-and-modalities","paper_date":"2022-02-07","arxiv_id":"2202.03052","code_links":[{"title":"modelscope/modelscope","url":"https://github.com/modelscope/modelscope"},{"title":"ofa-sys/ofa","url":"https://github.com/ofa-sys/ofa"},{"title":"JHKim-snu/GVCCI","url":"https://github.com/JHKim-snu/GVCCI"},{"title":"JHKim-snu/PGA","url":"https://github.com/JHKim-snu/PGA"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-mapeval-visual","slug":"visual-question-answering-on-mapeval-visual","dataset":"MapEval-Visual","dataset_url":"/dataset/mapeval-visual","rows_in_archive":1,"metrics":["Accuracy (% )"],"first_row_in_archive_order":{"model":"Claude-3.5-Sonnet","paper_title":"MapEval: A Map-Based Evaluation of Geo-Spatial Reasoning in Foundation Models","paper_url":"/paper/mapeval-a-map-based-evaluation-of-geo-spatial","paper_date":"2024-12-31","arxiv_id":"2501.00316","code_links":[{"title":"MapEval/MapEval-Visual","url":"https://github.com/MapEval/MapEval-Visual"},{"title":"MapEval/MapEval-API","url":"https://github.com/MapEval/MapEval-API"},{"title":"MapEval/MapEval-Textual","url":"https://github.com/MapEval/MapEval-Textual"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}}},{"leaderboard":"/sota/visual-question-answering-on-mm-vet-w-o","slug":"visual-question-answering-on-mm-vet-w-o","dataset":"MM-Vet (w/o External Tools)","dataset_url":null,"rows_in_archive":1,"metrics":["GPT-4 score"],"first_row_in_archive_order":{"model":"Emu-14B","paper_title":"Emu: Generative Pretraining in Multimodality","paper_url":"/paper/generative-pretraining-in-multimodality","paper_date":"2023-07-11","arxiv_id":"2307.05222","code_links":[{"title":"baaivision/emu","url":"https://github.com/baaivision/emu"},{"title":"doc-doc/NExT-OE","url":"https://github.com/doc-doc/NExT-OE"}],"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-rsvqa-hr","slug":"visual-question-answering-on-rsvqa-hr","dataset":"RSVQA-HR","dataset_url":null,"rows_in_archive":1,"metrics":["zero-shot Acc"],"first_row_in_archive_order":{"model":"SkySense-O","paper_title":"SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery","paper_url":"/paper/skysense-a-multi-modal-remote-sensing","paper_date":"2023-12-15","arxiv_id":"2312.10115","code_links":[{"title":"jack-bo1220/awesome-remote-sensing-foundation-models","url":"https://github.com/jack-bo1220/awesome-remote-sensing-foundation-models"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-siri-whu","slug":"visual-question-answering-on-siri-whu","dataset":"SIRI-WHU","dataset_url":null,"rows_in_archive":1,"metrics":["Acc. (test)"],"first_row_in_archive_order":{"model":"SkySense-O","paper_title":"SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery","paper_url":"/paper/skysense-a-multi-modal-remote-sensing","paper_date":"2023-12-15","arxiv_id":"2312.10115","code_links":[{"title":"jack-bo1220/awesome-remote-sensing-foundation-models","url":"https://github.com/jack-bo1220/awesome-remote-sensing-foundation-models"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-textvqa-test-2","slug":"visual-question-answering-on-textvqa-test-2","dataset":"TextVQA test-standard","dataset_url":"/dataset/textvqa","rows_in_archive":1,"metrics":["overall"],"first_row_in_archive_order":{"model":"PromptCap","paper_title":"PromptCap: Prompt-Guided Task-Aware Image Captioning","paper_url":"/paper/promptcap-prompt-guided-task-aware-image","paper_date":"2022-11-15","arxiv_id":"2211.09699","code_links":[{"title":"Yushi-Hu/PromptCap","url":"https://github.com/Yushi-Hu/PromptCap"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-visualmrc","slug":"visual-question-answering-on-visualmrc","dataset":"VisualMRC","dataset_url":"/dataset/visualmrc","rows_in_archive":1,"metrics":["CIDEr"],"first_row_in_archive_order":{"model":"LayoutT5 (Large)","paper_title":"VisualMRC: Machine Reading Comprehension on Document Images","paper_url":"/paper/visualmrc-machine-reading-comprehension-on","paper_date":"2021-01-27","arxiv_id":"2101.11272","code_links":[{"title":"nttmdlab-nlp/VisualMRC","url":"https://github.com/nttmdlab-nlp/VisualMRC"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-vizwiz-1","slug":"visual-question-answering-on-vizwiz-1","dataset":"VizWiz","dataset_url":"/dataset/vizwiz","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Emu-I *","paper_title":"Emu: Generative Pretraining in Multimodality","paper_url":"/paper/generative-pretraining-in-multimodality","paper_date":"2023-07-11","arxiv_id":"2307.05222","code_links":[{"title":"baaivision/emu","url":"https://github.com/baaivision/emu"},{"title":"doc-doc/NExT-OE","url":"https://github.com/doc-doc/NExT-OE"}],"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/coco","name":"COCO (Common Objects in Context)","full_name":"Common Objects in Context","num_papers_in_archive":11922},{"url":"/dataset/gqa","name":"GQA","full_name":"GQA","num_papers_in_archive":749},{"url":"/dataset/clevr","name":"CLEVR","full_name":"Compositional Language and Elementary Visual Reasoning","num_papers_in_archive":657},{"url":"/dataset/textvqa","name":"TextVQA","full_name":"","num_papers_in_archive":476},{"url":"/dataset/mmbench","name":"MMBench","full_name":"","num_papers_in_archive":384},{"url":"/dataset/visual-question-answering-v2-0","name":"Visual Question Answering v2.0","full_name":"VQA v2.0","num_papers_in_archive":366},{"url":"/dataset/mm-vet","name":"MM-Vet","full_name":"","num_papers_in_archive":339},{"url":"/dataset/vizwiz","name":"VizWiz","full_name":"VizWiz-VQA","num_papers_in_archive":260},{"url":"/dataset/mathvista","name":"MathVista","full_name":"Mathematical Reasoning of in Visual Contexts","num_papers_in_archive":242},{"url":"/dataset/msrvtt-qa","name":"MSRVTT-QA","full_name":"","num_papers_in_archive":66},{"url":"/dataset/msvd-qa","name":"MSVD-QA","full_name":"","num_papers_in_archive":61},{"url":"/dataset/plotqa","name":"PlotQA","full_name":"","num_papers_in_archive":50},{"url":"/dataset/visualmrc","name":"VisualMRC","full_name":"VisualMRC: Machine Reading Comprehension on Document Images","num_papers_in_archive":36},{"url":"/dataset/mm-vet-v2","name":"MM-Vet v2","full_name":"","num_papers_in_archive":17},{"url":"/dataset/grit","name":"GRIT","full_name":"General Robust Image Task Benchmark","num_papers_in_archive":16},{"url":"/dataset/benchlmm","name":"BenchLMM","full_name":"BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal Models","num_papers_in_archive":12},{"url":"/dataset/vip-bench","name":"ViP-Bench","full_name":"Making Large Multimodal Models Understand Arbitrary Visual Prompts","num_papers_in_archive":10},{"url":"/dataset/scigraphqa","name":"SciGraphQA","full_name":"","num_papers_in_archive":8},{"url":"/dataset/vnhsge","name":"VNHSGE","full_name":"VietNamese High School Graduation Examination Dataset for Large Language Models","num_papers_in_archive":7},{"url":"/dataset/earthvqa","name":"EarthVQA","full_name":"A multi-modal multi-task VQA dataset for remote sensing","num_papers_in_archive":6},{"url":"/dataset/skyeye-968k","name":"SkyEye-968k","full_name":"","num_papers_in_archive":5},{"url":"/dataset/uit-evjvqa","name":"EVJVQA","full_name":"English-Japanese-Vietnamese Visual Question Answering","num_papers_in_archive":4},{"url":"/dataset/openvivqa","name":"OpenViVQA","full_name":"Open-domain Visual Question Answering in Vietnamese","num_papers_in_archive":4},{"url":"/dataset/kvasir-vqa","name":"Kvasir-VQA","full_name":"A Text-Image Pair GI Tract Dataset","num_papers_in_archive":3},{"url":"/dataset/cii-bench","name":"CII-Bench","full_name":"Chinese Image Implication understanding Benchmark","num_papers_in_archive":2},{"url":"/dataset/climateiqa","name":"ClimateIQA","full_name":"","num_papers_in_archive":2},{"url":"/dataset/gqa-ood","name":"GQA-OOD","full_name":"","num_papers_in_archive":2},{"url":"/dataset/mapeval-visual","name":"MapEval-Visual","full_name":"","num_papers_in_archive":1},{"url":"/dataset/mminstruct-gpt4v","name":"MMInstruct-GPT4V","full_name":"MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity","num_papers_in_archive":1},{"url":"/dataset/ubench","name":"uBench","full_name":"MicroBench","num_papers_in_archive":1},{"url":"/dataset/vilco","name":"ViLCo","full_name":"ViLCo-Bench","num_papers_in_archive":1},{"url":"/dataset/worldcuisines","name":"WorldCuisines","full_name":"","num_papers_in_archive":1}],"subtasks":[{"url":"/task/explanatory-visual-question-answering","name":"Explanatory Visual Question Answering"},{"url":"/task/mm-vet-v2","name":"MM-Vet v2"},{"url":"/task/object-hallucination","name":"Object Hallucination"},{"url":"/task/spatial-reasoning","name":"Spatial Reasoning"},{"url":"/task/vietnamese-visual-question-answering","name":"Vietnamese Visual Question Answering"}],"parent_tasks":[{"url":"/task/visual-question-answering","name":"Visual Question Answering (VQA)"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":1042,"tagged_in_all":2177,"items":[{"url":"/paper/grad-cam-visual-explanations-from-deep","title":"Grad-CAM: Visual Explanations from Deep Networks via Gradient-based Localization","date":"2016-10-07","arxiv_id":"1610.02391","repositories_listed":126,"syntology":{"n":141,"n_ran":79,"n_unverified":62,"n_pointer_only":68}},{"url":"/paper/bottom-up-and-top-down-attention-for-image","title":"Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering","date":"2017-07-25","arxiv_id":"1707.07998","repositories_listed":65,"syntology":{"n":9,"n_ran":9,"n_unverified":0,"n_pointer_only":6}},{"url":"/paper/vqa-visual-question-answering","title":"VQA: Visual Question Answering","date":"2015-05-03","arxiv_id":"1505.00468","repositories_listed":21,"syntology":{"n":7,"n_ran":6,"n_unverified":1,"n_pointer_only":6}},{"url":"/paper/a-simple-neural-network-module-for-relational","title":"A simple neural network module for relational reasoning","date":"2017-06-05","arxiv_id":"1706.01427","repositories_listed":20,"syntology":{"n":7,"n_ran":3,"n_unverified":4,"n_pointer_only":1}},{"url":"/paper/blip-2-bootstrapping-language-image-pre","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","date":"2023-01-30","arxiv_id":"2301.12597","repositories_listed":17,"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}},{"url":"/paper/visual-instruction-tuning-1","title":"Visual Instruction Tuning","date":"2023-04-17","arxiv_id":"2304.08485","repositories_listed":13,"syntology":{"n":51,"n_ran":16,"n_unverified":35,"n_pointer_only":0}},{"url":"/paper/show-ask-attend-and-answer-a-strong-baseline","title":"Show, Ask, Attend, and Answer: A Strong Baseline For Visual Question Answering","date":"2017-04-11","arxiv_id":"1704.03162","repositories_listed":13,"syntology":{"n":9,"n_ran":9,"n_unverified":0,"n_pointer_only":9}},{"url":"/paper/gpt-4-technical-report-1","title":"GPT-4 Technical Report","date":"2023-03-15","arxiv_id":"2303.08774","repositories_listed":11,"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":1}},{"url":"/paper/vilbert-pretraining-task-agnostic","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","date":"2019-08-06","arxiv_id":"1908.02265","repositories_listed":11,"syntology":{"n":34,"n_ran":10,"n_unverified":24,"n_pointer_only":34}},{"url":"/paper/hadamard-product-for-low-rank-bilinear","title":"Hadamard Product for Low-rank Bilinear Pooling","date":"2016-10-14","arxiv_id":"1610.04325","repositories_listed":11,"syntology":null},{"url":"/paper/tips-and-tricks-for-visual-question-answering","title":"Tips and Tricks for Visual Question Answering: Learnings from the 2017 Challenge","date":"2017-08-09","arxiv_id":"1708.02711","repositories_listed":10,"syntology":null},{"url":"/paper/multimodal-compact-bilinear-pooling-for","title":"Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding","date":"2016-06-06","arxiv_id":"1606.01847","repositories_listed":10,"syntology":null},{"url":"/paper/dynamic-memory-networks-for-visual-and","title":"Dynamic Memory Networks for Visual and Textual Question Answering","date":"2016-03-04","arxiv_id":"1603.01417","repositories_listed":10,"syntology":{"n":7,"n_ran":7,"n_unverified":0,"n_pointer_only":7}},{"url":"/paper/improved-baselines-with-visual-instruction","title":"Improved Baselines with Visual Instruction Tuning","date":"2023-10-05","arxiv_id":"2310.03744","repositories_listed":9,"syntology":{"n":9,"n_ran":6,"n_unverified":3,"n_pointer_only":8}},{"url":"/paper/layoutlmv2-multi-modal-pre-training-for","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","date":"2020-12-29","arxiv_id":"2012.14740","repositories_listed":9,"syntology":null},{"url":"/paper/lxmert-learning-cross-modality-encoder","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","date":"2019-08-20","arxiv_id":"1908.07490","repositories_listed":9,"syntology":{"n":15,"n_ran":4,"n_unverified":11,"n_pointer_only":3}},{"url":"/paper/hierarchical-question-image-co-attention-for","title":"Hierarchical Question-Image Co-Attention for Visual Question Answering","date":"2016-05-31","arxiv_id":"1606.00061","repositories_listed":9,"syntology":{"n":7,"n_ran":1,"n_unverified":6,"n_pointer_only":1}},{"url":"/paper/qwen2-vl-enhancing-vision-language-model-s","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","date":"2024-09-18","arxiv_id":"2409.12191","repositories_listed":8,"syntology":{"n":12,"n_ran":8,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/bilinear-attention-networks","title":"Bilinear Attention Networks","date":"2018-05-21","arxiv_id":"1805.07932","repositories_listed":8,"syntology":{"n":13,"n_ran":4,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/vision-and-language-navigation-interpreting","title":"Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments","date":"2017-11-20","arxiv_id":"1711.07280","repositories_listed":8,"syntology":null},{"url":"/paper/floodnet-a-high-resolution-aerial-imagery","title":"FloodNet: A High Resolution Aerial Imagery Dataset for Post Flood Scene Understanding","date":"2020-12-05","arxiv_id":"2012.02951","repositories_listed":7,"syntology":null},{"url":"/paper/uniter-learning-universal-image-text-1","title":"UNITER: UNiversal Image-TExt Representation Learning","date":"2019-09-25","arxiv_id":"1909.11740","repositories_listed":7,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/deep-modular-co-attention-networks-for-visual-1","title":"Deep Modular Co-Attention Networks for Visual Question Answering","date":"2019-06-25","arxiv_id":"1906.10770","repositories_listed":7,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/learning-cooperative-visual-dialog-agents","title":"Learning Cooperative Visual Dialog Agents with Deep Reinforcement Learning","date":"2017-03-20","arxiv_id":"1703.06585","repositories_listed":7,"syntology":{"n":4,"n_ran":4,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/making-the-v-in-vqa-matter-elevating-the-role","title":"Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering","date":"2016-12-02","arxiv_id":"1612.00837","repositories_listed":7,"syntology":null},{"url":"/paper/simple-baseline-for-visual-question-answering","title":"Simple Baseline for Visual Question Answering","date":"2015-12-07","arxiv_id":"1512.02167","repositories_listed":7,"syntology":null},{"url":"/paper/knowledge-graphs-meet-multi-modal-learning-a","title":"Knowledge Graphs Meet Multi-Modal Learning: A Comprehensive Survey","date":"2024-02-08","arxiv_id":"2402.05391","repositories_listed":6,"syntology":{"n":18,"n_ran":9,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/video-llava-learning-united-visual-1","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","date":"2023-11-16","arxiv_id":"2311.10122","repositories_listed":6,"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":1}},{"url":"/paper/minigpt-4-enhancing-vision-language","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","date":"2023-04-20","arxiv_id":"2304.10592","repositories_listed":6,"syntology":null},{"url":"/paper/coca-contrastive-captioners-are-image-text","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","date":"2022-05-04","arxiv_id":"2205.01917","repositories_listed":6,"syntology":{"n":17,"n_ran":9,"n_unverified":8,"n_pointer_only":0}}],"syntology_records":21,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}