{"url":"/task/visual-question-answering","name":"Visual Question Answering (VQA)","slug":"visual-question-answering","description_markdown":"**Visual Question Answering (VQA)** is a task in computer vision that involves answering questions about an image. The goal of VQA is to teach machines to understand the content of an image and answer questions about it in natural language.\r\n\r\nImage Source: [visualqa.org](https://visualqa.org/)","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":2167,"papers_with_code":1039,"benchmarks":76,"benchmark_tables_in_archive":76,"benchmark_tables_shown":76,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":144,"subtasks":9,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/visual-question-answering-on-gqa-test2019","slug":"visual-question-answering-on-gqa-test2019","dataset":"GQA Test2019","dataset_url":"/dataset/gqa","rows_in_archive":127,"metrics":["Accuracy","Binary","Open","Consistency","Plausibility","Validity","Distribution"],"first_row_in_archive_order":{"model":"human","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-vqa-v2-test-dev","slug":"visual-question-answering-on-vqa-v2-test-dev","dataset":"VQA v2 test-dev","dataset_url":"/dataset/visual-question-answering-v2-0","rows_in_archive":56,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"PaLI","paper_title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","paper_url":"/paper/pali-a-jointly-scaled-multilingual-language","paper_date":"2022-09-14","arxiv_id":"2209.06794","code_links":[{"title":"google-research/big_vision","url":"https://github.com/google-research/big_vision"}],"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-vqa-v2-test-std","slug":"visual-question-answering-on-vqa-v2-test-std","dataset":"VQA v2 test-std","dataset_url":"/dataset/visual-question-answering-v2-0","rows_in_archive":38,"metrics":["overall","yes/no","number","other"],"first_row_in_archive_order":{"model":"BEiT-3","paper_title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","paper_url":"/paper/image-as-a-foreign-language-beit-pretraining","paper_date":"2022-08-22","arxiv_id":"2208.10442","code_links":[{"title":"microsoft/unilm","url":"https://github.com/microsoft/unilm/tree/master/beit"},{"title":"lyan62/data-curation","url":"https://github.com/lyan62/data-curation"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-ok-vqa","slug":"visual-question-answering-on-ok-vqa","dataset":"OK-VQA","dataset_url":"/dataset/ok-vqa","rows_in_archive":37,"metrics":["Accuracy","Exact Match (EM)","Recall@5"],"first_row_in_archive_order":{"model":"PaLI-X-VPD","paper_title":"Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models","paper_url":"/paper/visual-program-distillation-distilling-tools","paper_date":"2023-12-05","arxiv_id":"2312.03052","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-msvd-qa-1","slug":"visual-question-answering-on-msvd-qa-1","dataset":"MSVD-QA","dataset_url":"/dataset/msvd-qa","rows_in_archive":36,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"VLAB","paper_title":"VLAB: Enhancing Video Language Pre-training by Feature Adapting and Blending","paper_url":"/paper/vlab-enhancing-video-language-pre-training-by","paper_date":"2023-05-22","arxiv_id":"2305.13167","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-msrvtt-qa-1","slug":"visual-question-answering-on-msrvtt-qa-1","dataset":"MSRVTT-QA","dataset_url":"/dataset/msrvtt-qa","rows_in_archive":34,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"VLAB","paper_title":"VLAB: Enhancing Video Language Pre-training by Feature Adapting and Blending","paper_url":"/paper/vlab-enhancing-video-language-pre-training-by","paper_date":"2023-05-22","arxiv_id":"2305.13167","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-docvqa-test","slug":"visual-question-answering-on-docvqa-test","dataset":"DocVQA test","dataset_url":"/dataset/docvqa","rows_in_archive":33,"metrics":["ANLS","Accuracy"],"first_row_in_archive_order":{"model":"Human","paper_title":"DocVQA: A Dataset for VQA on Document Images","paper_url":"/paper/docvqa-a-dataset-for-vqa-on-document-images","paper_date":"2020-07-01","arxiv_id":"2007.00398","code_links":[{"title":"anisha2102/docvqa","url":"https://github.com/anisha2102/docvqa"},{"title":"mineshmathew/DocVQA","url":"https://github.com/mineshmathew/DocVQA/tree/master/BERT_baseline"},{"title":"mineshmathew/DocVQA","url":"https://github.com/mineshmathew/DocVQA"}],"syntology":{"n":6,"n_ran":4,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-vqa-on","slug":"visual-question-answering-vqa-on","dataset":"InfographicVQA","dataset_url":"/dataset/infographicvqa","rows_in_archive":21,"metrics":["ANLS"],"first_row_in_archive_order":{"model":"Gemini Ultra (pixel only)","paper_title":"Gemini: A Family of Highly Capable Multimodal Models","paper_url":"/paper/gemini-a-family-of-highly-capable-multimodal-1","paper_date":"2023-12-19","arxiv_id":"2312.11805","code_links":[{"title":"valdecy/pybibx","url":"https://github.com/valdecy/pybibx"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-gqa-test-dev","slug":"visual-question-answering-on-gqa-test-dev","dataset":"GQA test-dev","dataset_url":"/dataset/gqa","rows_in_archive":17,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"CFR","paper_title":"Coarse-to-Fine Reasoning for Visual Question Answering","paper_url":"/paper/coarse-to-fine-reasoning-for-visual-question","paper_date":"2021-10-06","arxiv_id":"2110.02526","code_links":[{"title":"aioz-ai/cfr_vqa","url":"https://github.com/aioz-ai/cfr_vqa"},{"title":"aioz-ai/crf_vqa","url":"https://github.com/aioz-ai/crf_vqa"}],"syntology":{"n":9,"n_ran":4,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-vizwiz-2020-vqa","slug":"visual-question-answering-on-vizwiz-2020-vqa","dataset":"VizWiz 2020 VQA","dataset_url":"/dataset/vizwiz","rows_in_archive":16,"metrics":["overall","yes/no","number","other","unanswerable"],"first_row_in_archive_order":{"model":"PaLI","paper_title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","paper_url":"/paper/pali-a-jointly-scaled-multilingual-language","paper_date":"2022-09-14","arxiv_id":"2209.06794","code_links":[{"title":"google-research/big_vision","url":"https://github.com/google-research/big_vision"}],"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-a-okvqa","slug":"visual-question-answering-on-a-okvqa","dataset":"A-OKVQA","dataset_url":"/dataset/a-okvqa","rows_in_archive":15,"metrics":["MC Accuracy","DA VQA Score"],"first_row_in_archive_order":{"model":"SMoLA-PaLI-X Specialist Model","paper_title":"Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts","paper_url":"/paper/omni-smola-boosting-generalist-multimodal","paper_date":"2023-12-01","arxiv_id":"2312.00968","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-clevr","slug":"visual-question-answering-on-clevr","dataset":"CLEVR","dataset_url":"/dataset/clevr","rows_in_archive":15,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"NS-VQA (1K programs)","paper_title":"Neural-Symbolic VQA: Disentangling Reasoning from Vision and Language Understanding","paper_url":"/paper/neural-symbolic-vqa-disentangling-reasoning","paper_date":"2018-10-04","arxiv_id":"1810.02338","code_links":[{"title":"kexinyi/ns-vqa","url":"https://github.com/kexinyi/ns-vqa"},{"title":"nerdimite/neuro-symbolic-ai-soc","url":"https://github.com/nerdimite/neuro-symbolic-ai-soc"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}}},{"leaderboard":"/sota/visual-question-answering-on-coco-visual-4","slug":"visual-question-answering-on-coco-visual-4","dataset":"COCO Visual Question Answering (VQA) real images 1.0 open ended","dataset_url":"/dataset/coco","rows_in_archive":14,"metrics":["Percentage correct"],"first_row_in_archive_order":{"model":"MCB 7 att.","paper_title":"Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding","paper_url":"/paper/multimodal-compact-bilinear-pooling-for","paper_date":"2016-06-06","arxiv_id":"1606.01847","code_links":[{"title":"Cadene/vqa.pytorch","url":"https://github.com/Cadene/vqa.pytorch"},{"title":"MarcBS/keras","url":"https://github.com/MarcBS/keras"},{"title":"akirafukui/vqa-mcb","url":"https://github.com/akirafukui/vqa-mcb"},{"title":"yikang-li/iqan","url":"https://github.com/yikang-li/iqan"},{"title":"jnhwkim/cbp","url":"https://github.com/jnhwkim/cbp"},{"title":"gabegrand/adversarial-vqa","url":"https://github.com/gabegrand/adversarial-vqa"},{"title":"Adam1679/mutan-article-net","url":"https://github.com/Adam1679/mutan-article-net"},{"title":"vuhoangminh/vqa_medical","url":"https://github.com/vuhoangminh/vqa_medical"},{"title":"arunmallya/simple-vqa","url":"https://github.com/arunmallya/simple-vqa"},{"title":"JoonSeongPark/vqa","url":"https://github.com/JoonSeongPark/vqa"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-vqa-on-core-mm","slug":"visual-question-answering-vqa-on-core-mm","dataset":"InfiMM-Eval","dataset_url":"/dataset/core-mm","rows_in_archive":14,"metrics":["Overall score","Deductive","Abductive","Analogical","Params"],"first_row_in_archive_order":{"model":"GPT-4V","paper_title":"GPT-4 Technical Report","paper_url":"/paper/gpt-4-technical-report-1","paper_date":"2023-03-15","arxiv_id":"2303.08774","code_links":[{"title":"openai/evals","url":"https://github.com/openai/evals"},{"title":"shmsw25/factscore","url":"https://github.com/shmsw25/factscore"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"gpt4life/alpagasus","url":"https://github.com/gpt4life/alpagasus"},{"title":"emrgnt-cmplxty/zero-shot-replication","url":"https://github.com/emrgnt-cmplxty/zero-shot-replication"},{"title":"ethz-privsec/superhuman-ai-consistency","url":"https://github.com/ethz-privsec/superhuman-ai-consistency"},{"title":"ethz-spylab/superhuman-ai-consistency","url":"https://github.com/ethz-spylab/superhuman-ai-consistency"},{"title":"eternityyw/tram-benchmark","url":"https://github.com/eternityyw/tram-benchmark"},{"title":"AUCOHL/RTL-Repo","url":"https://github.com/AUCOHL/RTL-Repo"},{"title":"zach-zhiling-zheng/reticular_chemist","url":"https://github.com/zach-zhiling-zheng/reticular_chemist"},{"title":"lflage/openfactscore","url":"https://github.com/lflage/openfactscore"}],"syntology":{"n":5,"n_ran":5,"n_unverified":0,"n_pointer_only":1}}},{"leaderboard":"/sota/visual-question-answering-on-iconqa","slug":"visual-question-answering-on-iconqa","dataset":"IconQA","dataset_url":"/dataset/iconqa","rows_in_archive":12,"metrics":["Sub-tasks (Img.)","Sub-tasks (Txt.)","Sub-tasks (Blank)","Reasoning (Geo.)","Reasoning (Cou.)","Reasoning (Com.)","Reasoning (Spa.)","Reasoning (Sce.)","Reasoning (Pat.)","Reasoning (Tim.)","Reasoning (Fra.)","Reasoning (Est.)","Reasoning (Alg.)","Reasoning (Mea.)","Reasoning (Sen.)","Reasoning (Pro.)"],"first_row_in_archive_order":{"model":"Patch-TRM","paper_title":"IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning","paper_url":"/paper/iconqa-a-new-benchmark-for-abstract-diagram","paper_date":"2021-10-25","arxiv_id":"2110.13214","code_links":[{"title":"lupantech/iconqa","url":"https://github.com/lupantech/iconqa"}],"syntology":{"n":10,"n_ran":8,"n_unverified":2,"n_pointer_only":10}}},{"leaderboard":"/sota/visual-question-answering-on-textvqa-test-1","slug":"visual-question-answering-on-textvqa-test-1","dataset":"TextVQA test-standard","dataset_url":"/dataset/textvqa","rows_in_archive":12,"metrics":["overall"],"first_row_in_archive_order":{"model":"PaLI","paper_title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","paper_url":"/paper/pali-a-jointly-scaled-multilingual-language","paper_date":"2022-09-14","arxiv_id":"2209.06794","code_links":[{"title":"google-research/big_vision","url":"https://github.com/google-research/big_vision"}],"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-vcr-q-a-test","slug":"visual-question-answering-on-vcr-q-a-test","dataset":"VCR (Q-A) test","dataset_url":"/dataset/vcr","rows_in_archive":11,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"GPT4RoI","paper_title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","paper_url":"/paper/gpt4roi-instruction-tuning-large-language","paper_date":"2023-07-07","arxiv_id":"2307.03601","code_links":[{"title":"jshilong/gpt4roi","url":"https://github.com/jshilong/gpt4roi"},{"title":"sunsmarterjie/chatterbox","url":"https://github.com/sunsmarterjie/chatterbox"},{"title":"qiujihao19/artemis","url":"https://github.com/qiujihao19/artemis"}],"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":5}}},{"leaderboard":"/sota/visual-question-answering-on-vqa-v2-val","slug":"visual-question-answering-on-vqa-v2-val","dataset":"VQA v2 val","dataset_url":"/dataset/visual-question-answering-v2-0","rows_in_archive":11,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"BLIP-2 ViT-G FlanT5 XXL (zero-shot)","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","paper_url":"/paper/blip-2-bootstrapping-language-image-pre","paper_date":"2023-01-30","arxiv_id":"2301.12597","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"salesforce/lavis","url":"https://github.com/salesforce/lavis"},{"title":"thudm/visualglm-6b","url":"https://github.com/thudm/visualglm-6b"},{"title":"baaivision/eva","url":"https://github.com/baaivision/eva"},{"title":"junshutang/Make-It-3D","url":"https://github.com/junshutang/Make-It-3D"},{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"yukw777/videoblip","url":"https://github.com/yukw777/videoblip"},{"title":"alibaba/graphtranslator","url":"https://github.com/alibaba/graphtranslator"},{"title":"gregor-ge/mblip","url":"https://github.com/gregor-ge/mblip"},{"title":"linzhiqiu/clip-flant5","url":"https://github.com/linzhiqiu/clip-flant5"},{"title":"kdr/videorag-mrr2024","url":"https://github.com/kdr/videorag-mrr2024"},{"title":"rabiulcste/vqazero","url":"https://github.com/rabiulcste/vqazero"},{"title":"jiwanchung/vlis","url":"https://github.com/jiwanchung/vlis"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-2/blip_2"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/blip_2"},{"title":"albertotestoni/ndq_visual_objects","url":"https://github.com/albertotestoni/ndq_visual_objects"}],"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}}},{"leaderboard":"/sota/visual-question-answering-on-coco-visual-1","slug":"visual-question-answering-on-coco-visual-1","dataset":"COCO Visual Question Answering (VQA) real images 1.0 multiple choice","dataset_url":"/dataset/coco","rows_in_archive":10,"metrics":["Percentage correct"],"first_row_in_archive_order":{"model":"MCB 7 att.","paper_title":"Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding","paper_url":"/paper/multimodal-compact-bilinear-pooling-for","paper_date":"2016-06-06","arxiv_id":"1606.01847","code_links":[{"title":"Cadene/vqa.pytorch","url":"https://github.com/Cadene/vqa.pytorch"},{"title":"MarcBS/keras","url":"https://github.com/MarcBS/keras"},{"title":"akirafukui/vqa-mcb","url":"https://github.com/akirafukui/vqa-mcb"},{"title":"yikang-li/iqan","url":"https://github.com/yikang-li/iqan"},{"title":"jnhwkim/cbp","url":"https://github.com/jnhwkim/cbp"},{"title":"gabegrand/adversarial-vqa","url":"https://github.com/gabegrand/adversarial-vqa"},{"title":"Adam1679/mutan-article-net","url":"https://github.com/Adam1679/mutan-article-net"},{"title":"vuhoangminh/vqa_medical","url":"https://github.com/vuhoangminh/vqa_medical"},{"title":"arunmallya/simple-vqa","url":"https://github.com/arunmallya/simple-vqa"},{"title":"JoonSeongPark/vqa","url":"https://github.com/JoonSeongPark/vqa"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-vizwiz-2018-1","slug":"visual-question-answering-on-vizwiz-2018-1","dataset":"VizWiz 2018","dataset_url":"/dataset/vizwiz","rows_in_archive":10,"metrics":["overall","yes/no","number","other","unanswerable"],"first_row_in_archive_order":{"model":"LXR955, No Ensemble","paper_title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","paper_url":"/paper/lxmert-learning-cross-modality-encoder","paper_date":"2019-08-20","arxiv_id":"1908.07490","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"airsplay/lxmert","url":"https://github.com/airsplay/lxmert"},{"title":"zhegan27/VILLA","url":"https://github.com/zhegan27/VILLA"},{"title":"zhegan27/LXMERT-AdvTrain","url":"https://github.com/zhegan27/LXMERT-AdvTrain"},{"title":"social-ai-studio/matk","url":"https://github.com/social-ai-studio/matk"},{"title":"itsShnik/adaptively-finetuning-transformers","url":"https://github.com/itsShnik/adaptively-finetuning-transformers"},{"title":"ghazaleh-mahmoodi/lxmert_compression","url":"https://github.com/ghazaleh-mahmoodi/lxmert_compression"},{"title":"chaitanyadwivedii/3D-Attention-is-All-You-Need","url":"https://github.com/chaitanyadwivedii/3D-Attention-is-All-You-Need"},{"title":"Mind23-2/MindCode-156","url":"https://github.com/Mind23-2/MindCode-156"}],"syntology":{"n":15,"n_ran":4,"n_unverified":11,"n_pointer_only":3}}},{"leaderboard":"/sota/visual-question-answering-on-vqa-cp","slug":"visual-question-answering-on-vqa-cp","dataset":"VQA-CP","dataset_url":"/dataset/vqa-cp","rows_in_archive":10,"metrics":["Score"],"first_row_in_archive_order":{"model":"CSS","paper_title":"Counterfactual Samples Synthesizing for Robust Visual Question Answering","paper_url":"/paper/counterfactual-samples-synthesizing-for","paper_date":"2020-03-14","arxiv_id":"2003.06576","code_links":[{"title":"yanxinzju/CSS-VQA","url":"https://github.com/yanxinzju/CSS-VQA"},{"title":"FengSuSky/CCB-VQA","url":"https://github.com/FengSuSky/CCB-VQA"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}}},{"leaderboard":"/sota/visual-question-answering-on-vqa-ce","slug":"visual-question-answering-on-vqa-ce","dataset":"VQA-CE","dataset_url":"/dataset/vqa-ce","rows_in_archive":9,"metrics":["Accuracy (Counterexamples)"],"first_row_in_archive_order":{"model":"RandImg","paper_title":"Beyond Question-Based Biases: Assessing Multimodal Shortcut Learning in Visual Question Answering","paper_url":"/paper/beyond-question-based-biases-assessing","paper_date":"2021-04-07","arxiv_id":"2104.03149","code_links":[{"title":"cdancette/detect-shortcuts","url":"https://github.com/cdancette/detect-shortcuts"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":2}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-vlm2-bench","slug":"visual-question-answering-vqa-on-vlm2-bench","dataset":"VLM2-Bench","dataset_url":"/dataset/vlm2-bench","rows_in_archive":9,"metrics":["GC-mat","GC-trk","OC-cpr","OC-cnt","OC-grp","PC-cpr","PC-cnt","PC-grp","PC-VID","Average Score on VLM2-bench (9 subtasks)"],"first_row_in_archive_order":{"model":"GPT-4o","paper_title":"GPT-4o System Card","paper_url":"/paper/gpt-4o-system-card","paper_date":"2024-10-25","arxiv_id":"2410.21276","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-vcr-qa-r-test","slug":"visual-question-answering-on-vcr-qa-r-test","dataset":"VCR (QA-R) test","dataset_url":"/dataset/vcr","rows_in_archive":8,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"GPT4RoI","paper_title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","paper_url":"/paper/gpt4roi-instruction-tuning-large-language","paper_date":"2023-07-07","arxiv_id":"2307.03601","code_links":[{"title":"jshilong/gpt4roi","url":"https://github.com/jshilong/gpt4roi"},{"title":"sunsmarterjie/chatterbox","url":"https://github.com/sunsmarterjie/chatterbox"},{"title":"qiujihao19/artemis","url":"https://github.com/qiujihao19/artemis"}],"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":5}}},{"leaderboard":"/sota/visual-question-answering-on-gqa-test-std","slug":"visual-question-answering-on-gqa-test-std","dataset":"GQA test-std","dataset_url":"/dataset/gqa","rows_in_archive":7,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ProTo","paper_title":"ProTo: Program-Guided Transformer for Program-Guided Tasks","paper_url":"/paper/proto-program-guided-transformer-for-program","paper_date":"2021-10-02","arxiv_id":"2110.00804","code_links":[{"title":"sjtuytc/Neurips21-ProTo-Program-guided-Transformers-for-Program-guided-Tasks","url":"https://github.com/sjtuytc/Neurips21-ProTo-Program-guided-Transformers-for-Program-guided-Tasks"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-vcr-q-ar-test","slug":"visual-question-answering-on-vcr-q-ar-test","dataset":"VCR (Q-AR) test","dataset_url":"/dataset/vcr","rows_in_archive":7,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"GPT4RoI","paper_title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","paper_url":"/paper/gpt4roi-instruction-tuning-large-language","paper_date":"2023-07-07","arxiv_id":"2307.03601","code_links":[{"title":"jshilong/gpt4roi","url":"https://github.com/jshilong/gpt4roi"},{"title":"sunsmarterjie/chatterbox","url":"https://github.com/sunsmarterjie/chatterbox"},{"title":"qiujihao19/artemis","url":"https://github.com/qiujihao19/artemis"}],"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":5}}},{"leaderboard":"/sota/visual-question-answering-on-vqa-v1-test-dev","slug":"visual-question-answering-on-vqa-v1-test-dev","dataset":"VQA v1 test-dev","dataset_url":null,"rows_in_archive":7,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"SAAA (ResNet)","paper_title":"Show, Ask, Attend, and Answer: A Strong Baseline For Visual Question Answering","paper_url":"/paper/show-ask-attend-and-answer-a-strong-baseline","paper_date":"2017-04-11","arxiv_id":"1704.03162","code_links":[{"title":"Cyanogenoid/pytorch-vqa","url":"https://github.com/Cyanogenoid/pytorch-vqa"},{"title":"guoyang9/vqa-prior","url":"https://github.com/guoyang9/vqa-prior"},{"title":"deshanadesai/VQA-DataAugmentation","url":"https://github.com/deshanadesai/VQA-DataAugmentation"},{"title":"zixuwang1996/VQA-reading-list","url":"https://github.com/zixuwang1996/VQA-reading-list"},{"title":"pramodkaushik/visual_qa_analysis","url":"https://github.com/pramodkaushik/visual_qa_analysis"},{"title":"Gunnika/Visual-Question-Answering","url":"https://github.com/Gunnika/Visual-Question-Answering"},{"title":"dukelin95/vqa_pytorch","url":"https://github.com/dukelin95/vqa_pytorch"},{"title":"abhijit-buet/VizWiz-Visual-Question-Answering-2021","url":"https://github.com/abhijit-buet/VizWiz-Visual-Question-Answering-2021"},{"title":"mkhalil1998/EC601_Group_Project","url":"https://github.com/mkhalil1998/EC601_Group_Project"},{"title":"abhijit-buet/VizWiz-Visua-Question-Answering-2021","url":"https://github.com/abhijit-buet/VizWiz-Visua-Question-Answering-2021"},{"title":"abhigoyal1997/CS-763-Project","url":"https://github.com/abhigoyal1997/CS-763-Project"},{"title":"myaoo18/EC601-Visual-Question-Answering","url":"https://github.com/myaoo18/EC601-Visual-Question-Answering"},{"title":"snagiri/ECE285_Jarvis_ProjectA","url":"https://github.com/snagiri/ECE285_Jarvis_ProjectA"}],"syntology":{"n":9,"n_ran":9,"n_unverified":0,"n_pointer_only":9}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-illusionvqa","slug":"visual-question-answering-vqa-on-illusionvqa","dataset":"IllusionVQA","dataset_url":"/dataset/illusionvqa","rows_in_archive":7,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"GPT4-Vision 4-shot","paper_title":"IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models","paper_url":"/paper/illusionvqa-a-challenging-optical-illusion","paper_date":"2024-03-23","arxiv_id":"2403.15952","code_links":[{"title":"csebuetnlp/illusionvqa","url":"https://github.com/csebuetnlp/illusionvqa"}],"syntology":{"n":5,"n_ran":5,"n_unverified":0,"n_pointer_only":5}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-infoseek","slug":"visual-question-answering-vqa-on-infoseek","dataset":"InfoSeek","dataset_url":"/dataset/infoseek","rows_in_archive":7,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"RA-VQAv2 w/ PreFLMR","paper_title":"PreFLMR: Scaling Up Fine-Grained Late-Interaction Multi-modal Retrievers","paper_url":"/paper/preflmr-scaling-up-fine-grained-late","paper_date":"2024-02-13","arxiv_id":"2402.08327","code_links":[{"title":"linweizhedragon/retrieval-augmented-visual-question-answering","url":"https://github.com/linweizhedragon/retrieval-augmented-visual-question-answering"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-vizwiz-2020","slug":"visual-question-answering-on-vizwiz-2020","dataset":"VizWiz 2020 Answerability","dataset_url":"/dataset/vizwiz","rows_in_archive":6,"metrics":["average_precision","f1_score"],"first_row_in_archive_order":{"model":"CLIP-Ensemble","paper_title":"Less Is More: Linear Layers on CLIP Features as Powerful VizWiz Model","paper_url":"/paper/less-is-more-linear-layers-on-clip-features","paper_date":"2022-06-10","arxiv_id":"2206.05281","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-vqa-v1-test-std","slug":"visual-question-answering-on-vqa-v1-test-std","dataset":"VQA v1 test-std","dataset_url":null,"rows_in_archive":6,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"SAAA (ResNet)","paper_title":"Show, Ask, Attend, and Answer: A Strong Baseline For Visual Question Answering","paper_url":"/paper/show-ask-attend-and-answer-a-strong-baseline","paper_date":"2017-04-11","arxiv_id":"1704.03162","code_links":[{"title":"Cyanogenoid/pytorch-vqa","url":"https://github.com/Cyanogenoid/pytorch-vqa"},{"title":"guoyang9/vqa-prior","url":"https://github.com/guoyang9/vqa-prior"},{"title":"deshanadesai/VQA-DataAugmentation","url":"https://github.com/deshanadesai/VQA-DataAugmentation"},{"title":"zixuwang1996/VQA-reading-list","url":"https://github.com/zixuwang1996/VQA-reading-list"},{"title":"pramodkaushik/visual_qa_analysis","url":"https://github.com/pramodkaushik/visual_qa_analysis"},{"title":"Gunnika/Visual-Question-Answering","url":"https://github.com/Gunnika/Visual-Question-Answering"},{"title":"dukelin95/vqa_pytorch","url":"https://github.com/dukelin95/vqa_pytorch"},{"title":"abhijit-buet/VizWiz-Visual-Question-Answering-2021","url":"https://github.com/abhijit-buet/VizWiz-Visual-Question-Answering-2021"},{"title":"mkhalil1998/EC601_Group_Project","url":"https://github.com/mkhalil1998/EC601_Group_Project"},{"title":"abhijit-buet/VizWiz-Visua-Question-Answering-2021","url":"https://github.com/abhijit-buet/VizWiz-Visua-Question-Answering-2021"},{"title":"abhigoyal1997/CS-763-Project","url":"https://github.com/abhigoyal1997/CS-763-Project"},{"title":"myaoo18/EC601-Visual-Question-Answering","url":"https://github.com/myaoo18/EC601-Visual-Question-Answering"},{"title":"snagiri/ECE285_Jarvis_ProjectA","url":"https://github.com/snagiri/ECE285_Jarvis_ProjectA"}],"syntology":{"n":9,"n_ran":9,"n_unverified":0,"n_pointer_only":9}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-whoops","slug":"visual-question-answering-vqa-on-whoops","dataset":"WHOOPS!","dataset_url":"/dataset/whoops","rows_in_archive":6,"metrics":["Exact Match","BEM"],"first_row_in_archive_order":{"model":"BLIP2 FlanT5-XXL (Fine-tuned)","paper_title":"Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images","paper_url":"/paper/breaking-common-sense-whoops-a-vision-and","paper_date":"2023-03-13","arxiv_id":"2303.07274","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-clevr-humans","slug":"visual-question-answering-on-clevr-humans","dataset":"CLEVR-Humans","dataset_url":"/dataset/clevr-humans","rows_in_archive":5,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"MDETR","paper_title":"MDETR -- Modulated Detection for End-to-End Multi-Modal Understanding","paper_url":"/paper/mdetr-modulated-detection-for-end-to-end","paper_date":"2021-04-26","arxiv_id":"2104.12763","code_links":[{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"ashkamath/mdetr","url":"https://github.com/ashkamath/mdetr"},{"title":"thunlp/pevl","url":"https://github.com/thunlp/pevl"},{"title":"b-faye/lightmdetr","url":"https://github.com/b-faye/lightmdetr"},{"title":"AleDella/mdter_eval","url":"https://github.com/AleDella/mdter_eval"}],"syntology":{"n":11,"n_ran":7,"n_unverified":4,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-qlevr","slug":"visual-question-answering-on-qlevr","dataset":"QLEVR","dataset_url":"/dataset/qlevr","rows_in_archive":5,"metrics":["Overall Accuracy"],"first_row_in_archive_order":{"model":"MAC","paper_title":"QLEVR: A Diagnostic Dataset for Quantificational Language and Elementary Visual Reasoning","paper_url":"/paper/qlevr-a-diagnostic-dataset-for","paper_date":"2022-05-06","arxiv_id":"2205.03075","code_links":[{"title":"zechenli03/qlevr","url":"https://github.com/zechenli03/qlevr"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-vqa-on-5","slug":"visual-question-answering-vqa-on-5","dataset":"AutoHallusion","dataset_url":"/dataset/autohallusion","rows_in_archive":5,"metrics":["Overall Accuracy"],"first_row_in_archive_order":{"model":"GPT-4V","paper_title":"AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models","paper_url":"/paper/autohallusion-automatic-generation-of","paper_date":"2024-06-16","arxiv_id":"2406.10900","code_links":[{"title":"tianyi-lab/hallusionbench","url":"https://github.com/tianyi-lab/hallusionbench"},{"title":"wuxiyang1996/AutoHallusion","url":"https://github.com/wuxiyang1996/AutoHallusion"},{"title":"zli12321/videohallu","url":"https://github.com/zli12321/videohallu"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}}},{"leaderboard":"/sota/visual-question-answering-on-coco-visual","slug":"visual-question-answering-on-coco-visual","dataset":"COCO Visual Question Answering (VQA) real images 2.0 open ended","dataset_url":"/dataset/coco","rows_in_archive":4,"metrics":["Percentage correct"],"first_row_in_archive_order":{"model":"HDU-USYD-UNCC","paper_title":"VQA: Visual Question Answering","paper_url":"/paper/vqa-visual-question-answering","paper_date":"2015-05-03","arxiv_id":"1505.00468","code_links":[{"title":"ramprs/grad-cam","url":"https://github.com/ramprs/grad-cam"},{"title":"abhshkdz/neural-vqa-attention","url":"https://github.com/abhshkdz/neural-vqa-attention"},{"title":"tbmoon/basic_vqa","url":"https://github.com/tbmoon/basic_vqa"},{"title":"Shivanshu-Gupta/Visual-Question-Answering","url":"https://github.com/Shivanshu-Gupta/Visual-Question-Answering"},{"title":"vipulgupta1011/swapmix","url":"https://github.com/vipulgupta1011/swapmix"},{"title":"ntusteeian/VQA_CNN-LSTM","url":"https://github.com/ntusteeian/VQA_CNN-LSTM"},{"title":"SatyamGaba/visual_question_answering","url":"https://github.com/SatyamGaba/visual_question_answering"},{"title":"SatyamGaba/vqa","url":"https://github.com/SatyamGaba/vqa"},{"title":"Shivmohith/Visual-Assistance-for-the-Blind","url":"https://github.com/Shivmohith/Visual-Assistance-for-the-Blind"},{"title":"mokhalid-dev/Attention-based-VQA-model","url":"https://github.com/mokhalid-dev/Attention-based-VQA-model"},{"title":"SDaydreamer/VisualQA_Project","url":"https://github.com/SDaydreamer/VisualQA_Project"},{"title":"abhijit-buet/VizWiz-Visual-Question-Answering-2021","url":"https://github.com/abhijit-buet/VizWiz-Visual-Question-Answering-2021"},{"title":"mkhalil1998/EC601_Group_Project","url":"https://github.com/mkhalil1998/EC601_Group_Project"},{"title":"abhijit-buet/VizWiz-Visua-Question-Answering-2021","url":"https://github.com/abhijit-buet/VizWiz-Visua-Question-Answering-2021"},{"title":"chirag26495/DAN_VQA","url":"https://github.com/chirag26495/DAN_VQA"},{"title":"yanxinyan1/yxy","url":"https://github.com/yanxinyan1/yxy"},{"title":"moh833/VQA","url":"https://github.com/moh833/VQA"},{"title":"mishajw/vocab_pie","url":"https://github.com/mishajw/vocab_pie"},{"title":"SuchismitaSahu1993/VQA-System","url":"https://github.com/SuchismitaSahu1993/VQA-System"},{"title":"ruxuan666/VQA_program","url":"https://github.com/ruxuan666/VQA_program"},{"title":"luomancs/alternative_answer_set","url":"https://github.com/luomancs/alternative_answer_set"}],"syntology":{"n":7,"n_ran":6,"n_unverified":1,"n_pointer_only":6}}},{"leaderboard":"/sota/visual-question-answering-on-coco-visual-2","slug":"visual-question-answering-on-coco-visual-2","dataset":"COCO Visual Question Answering (VQA) abstract images 1.0 open ended","dataset_url":"/dataset/coco","rows_in_archive":4,"metrics":["Percentage correct"],"first_row_in_archive_order":{"model":"Graph VQA","paper_title":"Graph-Structured Representations for Visual Question Answering","paper_url":"/paper/graph-structured-representations-for-visual","paper_date":"2016-09-19","arxiv_id":"1609.05600","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-coco-visual-3","slug":"visual-question-answering-on-coco-visual-3","dataset":"COCO Visual Question Answering (VQA) abstract 1.0 multiple choice","dataset_url":"/dataset/coco","rows_in_archive":4,"metrics":["Percentage correct"],"first_row_in_archive_order":{"model":"Graph VQA","paper_title":"Graph-Structured Representations for Visual Question Answering","paper_url":"/paper/graph-structured-representations-for-visual","paper_date":"2016-09-19","arxiv_id":"1609.05600","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-plotqa-d1","slug":"visual-question-answering-on-plotqa-d1","dataset":"PlotQA-D1","dataset_url":"/dataset/plotqa","rows_in_archive":4,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"MatCha4096 + LaMenDa","paper_title":"Synthesize Step-by-Step: Tools Templates and LLMs as Data Generators for Reasoning-Based Chart VQA","paper_url":"/paper/synthesize-step-by-step-tools-templates-and-1","paper_date":"2024-01-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-plotqa-d2","slug":"visual-question-answering-on-plotqa-d2","dataset":"PlotQA-D2","dataset_url":"/dataset/plotqa","rows_in_archive":4,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"MatCha4096 + LaMenDa","paper_title":"Synthesize Step-by-Step: Tools Templates and LLMs as Data Generators for Reasoning-Based Chart VQA","paper_url":"/paper/synthesize-step-by-step-tools-templates-and-1","paper_date":"2024-01-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-visual7w","slug":"visual-question-answering-on-visual7w","dataset":"Visual7W","dataset_url":"/dataset/visual7w","rows_in_archive":4,"metrics":["Percentage correct"],"first_row_in_archive_order":{"model":"CMN","paper_title":"Modeling Relationships in Referential Expressions with Compositional Modular Networks","paper_url":"/paper/modeling-relationships-in-referential","paper_date":"2016-11-30","arxiv_id":"1611.09978","code_links":[{"title":"hengyuan-hu/bottom-up-attention-vqa","url":"https://github.com/hengyuan-hu/bottom-up-attention-vqa"},{"title":"thilinicooray/Bottom-up-vqa","url":"https://github.com/thilinicooray/Bottom-up-vqa"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-vqa-on-3","slug":"visual-question-answering-vqa-on-3","dataset":"HallusionBench","dataset_url":"/dataset/hallusionbench","rows_in_archive":4,"metrics":["Question Pair Acc\t","Question Pair Acc"],"first_row_in_archive_order":{"model":"GPT-4V","paper_title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","paper_url":"/paper/hallusionbench-you-see-what-you-think-or-you","paper_date":"2023-10-23","arxiv_id":"2310.14566","code_links":[{"title":"codelion/adaptive-classifier","url":"https://github.com/codelion/adaptive-classifier"},{"title":"tianyi-lab/hallusionbench","url":"https://github.com/tianyi-lab/hallusionbench"},{"title":"FuxiaoLiu/LRV-Instruction","url":"https://github.com/FuxiaoLiu/LRV-Instruction"},{"title":"fuxiaoliu/mmc","url":"https://github.com/fuxiaoliu/mmc"},{"title":"FuxiaoLiu/VisualNews-Repository","url":"https://github.com/FuxiaoLiu/VisualNews-Repository"},{"title":"dongping-chen/mllm-as-a-judge","url":"https://github.com/dongping-chen/mllm-as-a-judge"},{"title":"zli12321/qa_metrics","url":"https://github.com/zli12321/qa_metrics"},{"title":"wuxiyang1996/AutoHallusion","url":"https://github.com/wuxiyang1996/AutoHallusion"},{"title":"zli12321/videohallu","url":"https://github.com/zli12321/videohallu"}],"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-ai2d","slug":"visual-question-answering-vqa-on-ai2d","dataset":"AI2D","dataset_url":"/dataset/ai2d","rows_in_archive":4,"metrics":["EM"],"first_row_in_archive_order":{"model":"SMoLA-PaLI-X Specialist Model","paper_title":"Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts","paper_url":"/paper/omni-smola-boosting-generalist-multimodal","paper_date":"2023-12-01","arxiv_id":"2312.00968","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-vqa-on-pmc-vqa","slug":"visual-question-answering-vqa-on-pmc-vqa","dataset":"PMC-VQA","dataset_url":"/dataset/pmc-vqa","rows_in_archive":4,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"MedVInT","paper_title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","paper_url":"/paper/pmc-vqa-visual-instruction-tuning-for-medical","paper_date":"2023-05-17","arxiv_id":"2305.10415","code_links":[{"title":"xiaoman-zhang/PMC-VQA","url":"https://github.com/xiaoman-zhang/PMC-VQA"},{"title":"zihanzhaosjtu/librisqa","url":"https://github.com/zihanzhaosjtu/librisqa"}],"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-f-vqa","slug":"visual-question-answering-on-f-vqa","dataset":"F-VQA","dataset_url":null,"rows_in_archive":3,"metrics":["Top-1 Accuracy","Top-3 Accuracy","Accuracy","MR","MRR"],"first_row_in_archive_order":{"model":"ZS-F-VQA","paper_title":"Zero-shot Visual Question Answering using Knowledge Graph","paper_url":"/paper/zero-shot-visual-question-answering-using","paper_date":"2021-07-12","arxiv_id":"2107.05348","code_links":[{"title":"Fangyin1994/KCL","url":"https://github.com/Fangyin1994/KCL"},{"title":"China-UK-ZSL/ZS-F-VQA","url":"https://github.com/China-UK-ZSL/ZS-F-VQA"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-figureqa-test-1","slug":"visual-question-answering-on-figureqa-test-1","dataset":"FigureQA - test 1","dataset_url":"/dataset/figureqa","rows_in_archive":3,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"PReFIL","paper_title":"Answering Questions about Data Visualizations using Efficient Bimodal Fusion","paper_url":"/paper/answering-questions-about-data-visualizations","paper_date":"2019-08-05","arxiv_id":"1908.01801","code_links":[{"title":"kushalkafle/PREFIL","url":"https://github.com/kushalkafle/PREFIL"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-vcr-q-a-dev","slug":"visual-question-answering-on-vcr-q-a-dev","dataset":"VCR (Q-A) dev","dataset_url":"/dataset/vcr","rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"VL-BERTLARGE","paper_title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","paper_url":"/paper/vl-bert-pre-training-of-generic-visual","paper_date":"2019-08-22","arxiv_id":"1908.08530","code_links":[{"title":"jackroos/VL-BERT","url":"https://github.com/jackroos/VL-BERT"},{"title":"ImperialNLP/BertGen","url":"https://github.com/ImperialNLP/BertGen"},{"title":"jules-samaran/vl-bert","url":"https://github.com/jules-samaran/vl-bert"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-vcr-q-ar-dev","slug":"visual-question-answering-on-vcr-q-ar-dev","dataset":"VCR (Q-AR) dev","dataset_url":"/dataset/vcr","rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"VL-BERTLARGE","paper_title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","paper_url":"/paper/vl-bert-pre-training-of-generic-visual","paper_date":"2019-08-22","arxiv_id":"1908.08530","code_links":[{"title":"jackroos/VL-BERT","url":"https://github.com/jackroos/VL-BERT"},{"title":"ImperialNLP/BertGen","url":"https://github.com/ImperialNLP/BertGen"},{"title":"jules-samaran/vl-bert","url":"https://github.com/jules-samaran/vl-bert"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-vcr-qa-r-dev","slug":"visual-question-answering-on-vcr-qa-r-dev","dataset":"VCR (QA-R) dev","dataset_url":"/dataset/vcr","rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"VL-BERTLARGE","paper_title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","paper_url":"/paper/vl-bert-pre-training-of-generic-visual","paper_date":"2019-08-22","arxiv_id":"1908.08530","code_links":[{"title":"jackroos/VL-BERT","url":"https://github.com/jackroos/VL-BERT"},{"title":"ImperialNLP/BertGen","url":"https://github.com/ImperialNLP/BertGen"},{"title":"jules-samaran/vl-bert","url":"https://github.com/jules-samaran/vl-bert"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-docvqa-val","slug":"visual-question-answering-on-docvqa-val","dataset":"DocVQA val","dataset_url":"/dataset/docvqa","rows_in_archive":2,"metrics":["Accuracy","bk lôn"],"first_row_in_archive_order":{"model":"BERT LARGE Baseline","paper_title":"DocVQA: A Dataset for VQA on Document Images","paper_url":"/paper/docvqa-a-dataset-for-vqa-on-document-images","paper_date":"2020-07-01","arxiv_id":"2007.00398","code_links":[{"title":"anisha2102/docvqa","url":"https://github.com/anisha2102/docvqa"},{"title":"mineshmathew/DocVQA","url":"https://github.com/mineshmathew/DocVQA/tree/master/BERT_baseline"},{"title":"mineshmathew/DocVQA","url":"https://github.com/mineshmathew/DocVQA"}],"syntology":{"n":6,"n_ran":4,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-gqa","slug":"visual-question-answering-on-gqa","dataset":"GQA","dataset_url":"/dataset/gqa","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"PEVL+","paper_title":"PEVL: Position-enhanced Pre-training and Prompt Tuning for Vision-language Models","paper_url":"/paper/pevl-position-enhanced-pre-training-and","paper_date":"2022-05-23","arxiv_id":"2205.11169","code_links":[{"title":"thunlp/pevl","url":"https://github.com/thunlp/pevl"}],"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-grit","slug":"visual-question-answering-on-grit","dataset":"GRIT","dataset_url":"/dataset/grit","rows_in_archive":2,"metrics":["VQA (ablation)","VQA (test)"],"first_row_in_archive_order":{"model":"Unified-IOXL","paper_title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","paper_url":"/paper/unified-io-a-unified-model-for-vision","paper_date":"2022-06-17","arxiv_id":"2206.08916","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-tdiuc","slug":"visual-question-answering-on-tdiuc","dataset":"TDIUC","dataset_url":"/dataset/tdiuc","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Accuracy","paper_title":"MUREL: Multimodal Relational Reasoning for Visual Question Answering","paper_url":"/paper/murel-multimodal-relational-reasoning-for","paper_date":"2019-02-25","arxiv_id":"1902.09487","code_links":[{"title":"Cadene/murel.bootstrap.pytorch","url":"https://github.com/Cadene/murel.bootstrap.pytorch"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-tgif-qa","slug":"visual-question-answering-on-tgif-qa","dataset":"TGIF-QA","dataset_url":"/dataset/tgif-qa","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"HiTeA","paper_title":"HiTeA: Hierarchical Temporal-Aware Video-Language Pre-training","paper_url":"/paper/hitea-hierarchical-temporal-aware-video","paper_date":"2022-12-30","arxiv_id":"2212.14546","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-vqa-x","slug":"visual-question-answering-on-vqa-x","dataset":"VQA-X","dataset_url":null,"rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"OFA-X-MT","paper_title":"Harnessing the Power of Multi-Task Pretraining for Ground-Truth Level Natural Language Explanations","paper_url":"/paper/harnessing-the-power-of-multi-task","paper_date":"2022-12-08","arxiv_id":"2212.04231","code_links":[{"title":"ofa-x/ofa-x","url":"https://github.com/ofa-x/ofa-x"}],"syntology":{"n":8,"n_ran":2,"n_unverified":6,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-on-visual-genome","slug":"visual-question-answering-on-visual-genome","dataset":"Visual Genome (subjects)","dataset_url":"/dataset/visual-genome","rows_in_archive":1,"metrics":["Percentage correct"],"first_row_in_archive_order":{"model":"CMN","paper_title":"Modeling Relationships in Referential Expressions with Compositional Modular Networks","paper_url":"/paper/modeling-relationships-in-referential","paper_date":"2016-11-30","arxiv_id":"1611.09978","code_links":[{"title":"hengyuan-hu/bottom-up-attention-vqa","url":"https://github.com/hengyuan-hu/bottom-up-attention-vqa"},{"title":"thilinicooray/Bottom-up-vqa","url":"https://github.com/thilinicooray/Bottom-up-vqa"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-visual-genome-1","slug":"visual-question-answering-on-visual-genome-1","dataset":"Visual Genome (pairs)","dataset_url":"/dataset/visual-genome","rows_in_archive":1,"metrics":["Percentage correct"],"first_row_in_archive_order":{"model":"CMN","paper_title":"Modeling Relationships in Referential Expressions with Compositional Modular Networks","paper_url":"/paper/modeling-relationships-in-referential","paper_date":"2016-11-30","arxiv_id":"1611.09978","code_links":[{"title":"hengyuan-hu/bottom-up-attention-vqa","url":"https://github.com/hengyuan-hu/bottom-up-attention-vqa"},{"title":"thilinicooray/Bottom-up-vqa","url":"https://github.com/thilinicooray/Bottom-up-vqa"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-vizwiz-2018","slug":"visual-question-answering-on-vizwiz-2018","dataset":"VizWiz 2018 Answerability","dataset_url":"/dataset/vizwiz","rows_in_archive":1,"metrics":["average_precision","f1_score"],"first_row_in_archive_order":{"model":"ensemble_two_best","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-on-zs-f-vqa","slug":"visual-question-answering-on-zs-f-vqa","dataset":"ZS-F-VQA","dataset_url":"/dataset/zs-f-vqa","rows_in_archive":1,"metrics":["Top-1 Accuracy"],"first_row_in_archive_order":{"model":"SAN † - hard mask","paper_title":"Zero-shot Visual Question Answering using Knowledge Graph","paper_url":"/paper/zero-shot-visual-question-answering-using","paper_date":"2021-07-12","arxiv_id":"2107.05348","code_links":[{"title":"Fangyin1994/KCL","url":"https://github.com/Fangyin1994/KCL"},{"title":"China-UK-ZSL/ZS-F-VQA","url":"https://github.com/China-UK-ZSL/ZS-F-VQA"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-vqa-on-activitynet-1","slug":"visual-question-answering-vqa-on-activitynet-1","dataset":"ActivityNet","dataset_url":"/dataset/activitynet","rows_in_archive":1,"metrics":["ClipMatch@1","ClipMatch@5","Contains","ExactMatch","Follow-up ClipMatch@1","Follow-up ClipMatch@5","Follow-up Contains","Follow-up ExactMatch"],"first_row_in_archive_order":{"model":"BLIP-2 T5","paper_title":"Open-ended VQA benchmarking of Vision-Language models by exploiting Classification datasets and their semantic hierarchy","paper_url":"/paper/open-ended-vqa-benchmarking-of-vision","paper_date":"2024-02-11","arxiv_id":"2402.07270","code_links":[{"title":"lmb-freiburg/ovqa","url":"https://github.com/lmb-freiburg/ovqa"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-artquest","slug":"visual-question-answering-vqa-on-artquest","dataset":"ArtQuest","dataset_url":"/dataset/artquest","rows_in_archive":1,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"PrefixLM with CLIP and T5","paper_title":"ArtQuest: Countering Hidden Language Biases in ArtVQA","paper_url":"/paper/artquest-countering-hidden-language-biases-in","paper_date":"2024-01-04","arxiv_id":null,"code_links":[{"title":"bletib/artquest","url":"https://github.com/bletib/artquest"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-vqa-on-coco","slug":"visual-question-answering-vqa-on-coco","dataset":"COCO","dataset_url":null,"rows_in_archive":1,"metrics":["ClipMatch@1","ClipMatch@5","Contains","ExactMatch"],"first_row_in_archive_order":{"model":"InstructBLIP Vicuna","paper_title":"Open-ended VQA benchmarking of Vision-Language models by exploiting Classification datasets and their semantic hierarchy","paper_url":"/paper/open-ended-vqa-benchmarking-of-vision","paper_date":"2024-02-11","arxiv_id":"2402.07270","code_links":[{"title":"lmb-freiburg/ovqa","url":"https://github.com/lmb-freiburg/ovqa"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-core-mm-1","slug":"visual-question-answering-vqa-on-core-mm-1","dataset":"CORE-MM","dataset_url":"/dataset/core-mm-1","rows_in_archive":1,"metrics":["Abductive","Analogical","Deductive","Overall score","Params"],"first_row_in_archive_order":{"model":"GPT-4V","paper_title":"GPT-4 Technical Report","paper_url":"/paper/gpt-4-technical-report-1","paper_date":"2023-03-15","arxiv_id":"2303.08774","code_links":[{"title":"openai/evals","url":"https://github.com/openai/evals"},{"title":"shmsw25/factscore","url":"https://github.com/shmsw25/factscore"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"gpt4life/alpagasus","url":"https://github.com/gpt4life/alpagasus"},{"title":"emrgnt-cmplxty/zero-shot-replication","url":"https://github.com/emrgnt-cmplxty/zero-shot-replication"},{"title":"ethz-privsec/superhuman-ai-consistency","url":"https://github.com/ethz-privsec/superhuman-ai-consistency"},{"title":"ethz-spylab/superhuman-ai-consistency","url":"https://github.com/ethz-spylab/superhuman-ai-consistency"},{"title":"eternityyw/tram-benchmark","url":"https://github.com/eternityyw/tram-benchmark"},{"title":"AUCOHL/RTL-Repo","url":"https://github.com/AUCOHL/RTL-Repo"},{"title":"zach-zhiling-zheng/reticular_chemist","url":"https://github.com/zach-zhiling-zheng/reticular_chemist"},{"title":"lflage/openfactscore","url":"https://github.com/lflage/openfactscore"}],"syntology":{"n":5,"n_ran":5,"n_unverified":0,"n_pointer_only":1}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-deepform","slug":"visual-question-answering-vqa-on-deepform","dataset":"DeepForm","dataset_url":null,"rows_in_archive":1,"metrics":["F1"],"first_row_in_archive_order":{"model":"DUBLIN","paper_title":"DUBLIN -- Document Understanding By Language-Image Network","paper_url":"/paper/dublin-document-understanding-by-language","paper_date":"2023-05-23","arxiv_id":"2305.14218","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-vqa-on-docvqa","slug":"visual-question-answering-vqa-on-docvqa","dataset":"DocVQA","dataset_url":"/dataset/docvqa","rows_in_archive":1,"metrics":["ANLS"],"first_row_in_archive_order":{"model":"ChatGPT 3.5 with LAPDoc Prompt (SpatialFormat)","paper_title":"LAPDoc: Layout-Aware Prompting for Documents","paper_url":"/paper/lapdoc-layout-aware-prompting-for-documents","paper_date":"2024-02-15","arxiv_id":"2402.09841","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-vqa-on-dvqa-test","slug":"visual-question-answering-vqa-on-dvqa-test","dataset":"DVQA test-familiar","dataset_url":"/dataset/dvqa","rows_in_archive":1,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"PReFIL (Oracle OCR)","paper_title":"Answering Questions about Data Visualizations using Efficient Bimodal Fusion","paper_url":"/paper/answering-questions-about-data-visualizations","paper_date":"2019-08-05","arxiv_id":"1908.01801","code_links":[{"title":"kushalkafle/PREFIL","url":"https://github.com/kushalkafle/PREFIL"}],"syntology":null}},{"leaderboard":"/sota/visual-question-answering-vqa-on-egoschema","slug":"visual-question-answering-vqa-on-egoschema","dataset":"EgoSchema","dataset_url":"/dataset/egoschema","rows_in_archive":1,"metrics":["Acc"],"first_row_in_archive_order":{"model":"Lyra-Pro","paper_title":"Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition","paper_url":"/paper/lyra-an-efficient-and-speech-centric","paper_date":"2024-12-12","arxiv_id":"2412.09501","code_links":[{"title":"dvlab-research/Lyra","url":"https://github.com/dvlab-research/Lyra"}],"syntology":{"n":19,"n_ran":3,"n_unverified":16,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-imagenet","slug":"visual-question-answering-vqa-on-imagenet","dataset":"ImageNet","dataset_url":"/dataset/imagenet","rows_in_archive":1,"metrics":["ClipMatch@1","ClipMatch@5","Contains","ExactMatch","Follow-up ClipMatch@1","Follow-up ClipMatch@5","Follow-up Contains","Follow-up ExactMatch"],"first_row_in_archive_order":{"model":"BLIP-2 OPT","paper_title":"Open-ended VQA benchmarking of Vision-Language models by exploiting Classification datasets and their semantic hierarchy","paper_url":"/paper/open-ended-vqa-benchmarking-of-vision","paper_date":"2024-02-11","arxiv_id":"2402.07270","code_links":[{"title":"lmb-freiburg/ovqa","url":"https://github.com/lmb-freiburg/ovqa"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-mm-vet","slug":"visual-question-answering-vqa-on-mm-vet","dataset":"MM-Vet","dataset_url":"/dataset/mm-vet","rows_in_archive":1,"metrics":["Acc"],"first_row_in_archive_order":{"model":"Lyra-Pro","paper_title":"Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition","paper_url":"/paper/lyra-an-efficient-and-speech-centric","paper_date":"2024-12-12","arxiv_id":"2412.09501","code_links":[{"title":"dvlab-research/Lyra","url":"https://github.com/dvlab-research/Lyra"}],"syntology":{"n":19,"n_ran":3,"n_unverified":16,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-mme","slug":"visual-question-answering-vqa-on-mme","dataset":"MME","dataset_url":null,"rows_in_archive":1,"metrics":["Acc"],"first_row_in_archive_order":{"model":"Lyra-Pro","paper_title":"Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition","paper_url":"/paper/lyra-an-efficient-and-speech-centric","paper_date":"2024-12-12","arxiv_id":"2412.09501","code_links":[{"title":"dvlab-research/Lyra","url":"https://github.com/dvlab-research/Lyra"}],"syntology":{"n":19,"n_ran":3,"n_unverified":16,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-mvbench","slug":"visual-question-answering-vqa-on-mvbench","dataset":"MVBench","dataset_url":"/dataset/mvbench","rows_in_archive":1,"metrics":["Acc"],"first_row_in_archive_order":{"model":"Lyra-Pro","paper_title":"Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition","paper_url":"/paper/lyra-an-efficient-and-speech-centric","paper_date":"2024-12-12","arxiv_id":"2412.09501","code_links":[{"title":"dvlab-research/Lyra","url":"https://github.com/dvlab-research/Lyra"}],"syntology":{"n":19,"n_ran":3,"n_unverified":16,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-ovad","slug":"visual-question-answering-vqa-on-ovad","dataset":"OVAD benchmark","dataset_url":"/dataset/ovad-benchmark","rows_in_archive":1,"metrics":["Contains w. Synonyms","ExactMatch w. Synonyms"],"first_row_in_archive_order":{"model":"BLIP","paper_title":"Open-ended VQA benchmarking of Vision-Language models by exploiting Classification datasets and their semantic hierarchy","paper_url":"/paper/open-ended-vqa-benchmarking-of-vision","paper_date":"2024-02-11","arxiv_id":"2402.07270","code_links":[{"title":"lmb-freiburg/ovqa","url":"https://github.com/lmb-freiburg/ovqa"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-retvqa","slug":"visual-question-answering-vqa-on-retvqa","dataset":"RetVQA","dataset_url":"/dataset/retvqa","rows_in_archive":1,"metrics":["Accuarcy","Accuracy * Fluency"],"first_row_in_archive_order":{"model":"MI-BART","paper_title":"Answer Mining from a Pool of Images: Towards Retrieval-Based Visual Question Answering","paper_url":"/paper/answer-mining-from-a-pool-of-images-towards","paper_date":"2023-06-29","arxiv_id":"2306.16713","code_links":[{"title":"Abhiram4572/mi_bart","url":"https://github.com/Abhiram4572/mi_bart"}],"syntology":{"n":7,"n_ran":6,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-textvqa","slug":"visual-question-answering-vqa-on-textvqa","dataset":"TextVQA","dataset_url":"/dataset/textvqa","rows_in_archive":1,"metrics":["Acc"],"first_row_in_archive_order":{"model":"Lyra-Pro","paper_title":"Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition","paper_url":"/paper/lyra-an-efficient-and-speech-centric","paper_date":"2024-12-12","arxiv_id":"2412.09501","code_links":[{"title":"dvlab-research/Lyra","url":"https://github.com/dvlab-research/Lyra"}],"syntology":{"n":19,"n_ran":3,"n_unverified":16,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-video-mme","slug":"visual-question-answering-vqa-on-video-mme","dataset":"Video MME","dataset_url":null,"rows_in_archive":1,"metrics":["Acc"],"first_row_in_archive_order":{"model":"Lyra-Pro","paper_title":"Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition","paper_url":"/paper/lyra-an-efficient-and-speech-centric","paper_date":"2024-12-12","arxiv_id":"2412.09501","code_links":[{"title":"dvlab-research/Lyra","url":"https://github.com/dvlab-research/Lyra"}],"syntology":{"n":19,"n_ran":3,"n_unverified":16,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-question-answering-vqa-on-websrc","slug":"visual-question-answering-vqa-on-websrc","dataset":"WebSRC","dataset_url":"/dataset/websrc","rows_in_archive":1,"metrics":["EM"],"first_row_in_archive_order":{"model":"DUBLIN","paper_title":"DUBLIN -- Document Understanding By Language-Image Network","paper_url":"/paper/dublin-document-understanding-by-language","paper_date":"2023-05-23","arxiv_id":"2305.14218","code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/imagenet","name":"ImageNet","full_name":"","num_papers_in_archive":15430},{"url":"/dataset/coco","name":"COCO (Common Objects in Context)","full_name":"Common Objects in Context","num_papers_in_archive":11922},{"url":"/dataset/visual-genome","name":"Visual Genome","full_name":"","num_papers_in_archive":1256},{"url":"/dataset/activitynet","name":"ActivityNet","full_name":"","num_papers_in_archive":807},{"url":"/dataset/gqa","name":"GQA","full_name":"GQA","num_papers_in_archive":749},{"url":"/dataset/clevr","name":"CLEVR","full_name":"Compositional Language and Elementary Visual Reasoning","num_papers_in_archive":657},{"url":"/dataset/textvqa","name":"TextVQA","full_name":"","num_papers_in_archive":476},{"url":"/dataset/ok-vqa","name":"OK-VQA","full_name":"Outside Knowledge Visual Question Answering","num_papers_in_archive":368},{"url":"/dataset/visual-question-answering-v2-0","name":"Visual Question Answering v2.0","full_name":"VQA v2.0","num_papers_in_archive":366},{"url":"/dataset/conceptual-captions","name":"Conceptual Captions","full_name":"Conceptual Captions","num_papers_in_archive":352},{"url":"/dataset/mm-vet","name":"MM-Vet","full_name":"","num_papers_in_archive":339},{"url":"/dataset/scienceqa","name":"ScienceQA","full_name":"Science Question Answering","num_papers_in_archive":339},{"url":"/dataset/docvqa","name":"DocVQA","full_name":"","num_papers_in_archive":290},{"url":"/dataset/vizwiz","name":"VizWiz","full_name":"VizWiz-VQA","num_papers_in_archive":260},{"url":"/dataset/mathvista","name":"MathVista","full_name":"Mathematical Reasoning of in Visual Contexts","num_papers_in_archive":242},{"url":"/dataset/ai2d","name":"AI2D","full_name":"AI2 Diagrams","num_papers_in_archive":207},{"url":"/dataset/vcr","name":"VCR","full_name":"Visual Commonsense Reasoning","num_papers_in_archive":179},{"url":"/dataset/visdial","name":"VisDial","full_name":"Visual Dialog","num_papers_in_archive":159},{"url":"/dataset/a-okvqa","name":"A-OKVQA","full_name":"","num_papers_in_archive":154},{"url":"/dataset/activitynet-qa","name":"ActivityNet-QA","full_name":"","num_papers_in_archive":146},{"url":"/dataset/mvbench","name":"MVBench","full_name":"","num_papers_in_archive":139},{"url":"/dataset/shapes-1","name":"SHAPES","full_name":"Swarm Heuristics based Adaptive and Penalized Estimation of Splines","num_papers_in_archive":120},{"url":"/dataset/snli-ve","name":"SNLI-VE","full_name":null,"num_papers_in_archive":117},{"url":"/dataset/egoschema","name":"EgoSchema","full_name":"","num_papers_in_archive":112},{"url":"/dataset/visual7w","name":"Visual7W","full_name":"","num_papers_in_archive":112},{"url":"/dataset/tgif-qa","name":"TGIF-QA","full_name":"TGIF-QA","num_papers_in_archive":92},{"url":"/dataset/st-vqa","name":"ST-VQA","full_name":"Scene Text Visual Question Answering","num_papers_in_archive":90},{"url":"/dataset/pathvqa","name":"PathVQA","full_name":"","num_papers_in_archive":89},{"url":"/dataset/referitgame","name":"ReferItGame","full_name":"ReferItGame","num_papers_in_archive":80},{"url":"/dataset/vqg","name":"VQG","full_name":"Visual Question Generation","num_papers_in_archive":80},{"url":"/dataset/msrvtt-qa","name":"MSRVTT-QA","full_name":"","num_papers_in_archive":66},{"url":"/dataset/coco-qa","name":"COCO-QA","full_name":"","num_papers_in_archive":62},{"url":"/dataset/figureqa","name":"FigureQA","full_name":"","num_papers_in_archive":61},{"url":"/dataset/msvd-qa","name":"MSVD-QA","full_name":"","num_papers_in_archive":61},{"url":"/dataset/tvqa-1","name":"TVQA+","full_name":"","num_papers_in_archive":60},{"url":"/dataset/pmc-vqa","name":"PMC-VQA","full_name":"","num_papers_in_archive":55},{"url":"/dataset/daquar","name":"DAQUAR","full_name":"","num_papers_in_archive":54},{"url":"/dataset/hallusionbench","name":"HallusionBench","full_name":"","num_papers_in_archive":53},{"url":"/dataset/infographicvqa","name":"InfographicVQA","full_name":"","num_papers_in_archive":52},{"url":"/dataset/music-avqa","name":"MUSIC-AVQA","full_name":"","num_papers_in_archive":51},{"url":"/dataset/plotqa","name":"PlotQA","full_name":"","num_papers_in_archive":50},{"url":"/dataset/dvqa","name":"DVQA","full_name":"Data Visualizations via Question Answering","num_papers_in_archive":49},{"url":"/dataset/tqa","name":"TQA","full_name":"Textbook Question Answering","num_papers_in_archive":48},{"url":"/dataset/webqa","name":"WebQA","full_name":"","num_papers_in_archive":43},{"url":"/dataset/iconqa","name":"IconQA","full_name":"Icon Question Answering","num_papers_in_archive":42},{"url":"/dataset/tdiuc","name":"TDIUC","full_name":"Task Directed Image Understanding Challenge","num_papers_in_archive":39},{"url":"/dataset/cv-bench","name":"CV-Bench","full_name":"Cambrian Vision-Centric Benchmark","num_papers_in_archive":37},{"url":"/dataset/infoseek","name":"InfoSeek","full_name":"Visual Information Seeking","num_papers_in_archive":36},{"url":"/dataset/kvqa","name":"KVQA","full_name":"Knowledge-aware VQA","num_papers_in_archive":31},{"url":"/dataset/vqa-hat","name":"VQA-HAT","full_name":"VQA Human Attention","num_papers_in_archive":27},{"url":"/dataset/rsvgd","name":"DIOR-RSVG","full_name":"","num_papers_in_archive":25},{"url":"/dataset/social-iq","name":"Social-IQ","full_name":"","num_papers_in_archive":23},{"url":"/dataset/ivqa","name":"iVQA","full_name":"Instructional Video Question Answering","num_papers_in_archive":22},{"url":"/dataset/tvbench","name":"TVBench","full_name":"","num_papers_in_archive":22},{"url":"/dataset/websrc","name":"WebSRC","full_name":"WebSRC: A Dataset for Web-Based Structural Reading Comprehension","num_papers_in_archive":22},{"url":"/dataset/core-mm","name":"InfiMM-Eval","full_name":"Complex Open-ended Reasoning Evaluation for Multi-Modal Language Models","num_papers_in_archive":19},{"url":"/dataset/trafficqa","name":"SUTD-TrafficQA","full_name":"","num_papers_in_archive":19},{"url":"/dataset/clevr-humans","name":"CLEVR-Humans","full_name":"","num_papers_in_archive":18},{"url":"/dataset/clevr-ref","name":"CLEVR-Ref+","full_name":"","num_papers_in_archive":17},{"url":"/dataset/grit","name":"GRIT","full_name":"General Robust Image Task Benchmark","num_papers_in_archive":16},{"url":"/dataset/live-yt-hfr","name":"LIVE-YT-HFR","full_name":"LIVE YouTube High Frame Rate","num_papers_in_archive":14},{"url":"/dataset/ovad-benchmark","name":"OVAD benchmark","full_name":"Open-Vocabulary Attribute Detection","num_papers_in_archive":14},{"url":"/dataset/whoops","name":"WHOOPS!","full_name":"","num_papers_in_archive":14},{"url":"/dataset/super-clevr","name":"Super-CLEVR","full_name":"","num_papers_in_archive":13},{"url":"/dataset/viquae","name":"ViQuAE","full_name":"","num_papers_in_archive":13},{"url":"/dataset/visual-madlibs","name":"Visual Madlibs","full_name":"","num_papers_in_archive":13},{"url":"/dataset/vqa-cp","name":"VQA-CP","full_name":null,"num_papers_in_archive":13},{"url":"/dataset/benchlmm","name":"BenchLMM","full_name":"BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal Models","num_papers_in_archive":12},{"url":"/dataset/fm-iqa","name":"FM-IQA","full_name":"Freestyle Multilingual Image Question Answering","num_papers_in_archive":10},{"url":"/dataset/mp-docvqa","name":"MP-DocVQA","full_name":"Multipage Document Visual Question Answering","num_papers_in_archive":10},{"url":"/dataset/pointqa","name":"PointQA","full_name":"","num_papers_in_archive":10},{"url":"/dataset/aqua","name":"AQUA","full_name":"","num_papers_in_archive":9},{"url":"/dataset/knowit-vqa","name":"KnowIT VQA","full_name":"","num_papers_in_archive":9},{"url":"/dataset/leaf-qa","name":"LEAF-QA","full_name":"","num_papers_in_archive":9},{"url":"/dataset/vlm2-bench","name":"VLM2-Bench","full_name":"VLM²-Bench","num_papers_in_archive":9},{"url":"/dataset/clevr-math","name":"CLEVR-Math","full_name":"","num_papers_in_archive":8},{"url":"/dataset/scigraphqa","name":"SciGraphQA","full_name":"","num_papers_in_archive":8},{"url":"/dataset/cog","name":"COG","full_name":"","num_papers_in_archive":7},{"url":"/dataset/iquad","name":"IQUAD","full_name":"Interactive Question Answering Dataset","num_papers_in_archive":7},{"url":"/dataset/vqa-ce","name":"VQA-CE","full_name":"VQA Counterexamples","num_papers_in_archive":7},{"url":"/dataset/doccvqa","name":"DocCVQA","full_name":"Document Collection Visual Question Answering","num_papers_in_archive":6},{"url":"/dataset/rad-restruct","name":"Rad-ReStruct","full_name":"","num_papers_in_archive":6},{"url":"/dataset/zs-f-vqa","name":"ZS-F-VQA","full_name":"","num_papers_in_archive":6},{"url":"/dataset/ai2d-rst","name":"AI2D-RST","full_name":"","num_papers_in_archive":5},{"url":"/dataset/autohallusion","name":"AutoHallusion","full_name":"","num_papers_in_archive":5},{"url":"/dataset/sqa69m","name":"HowToVQA69M","full_name":"HowToVQA69M","num_papers_in_archive":5},{"url":"/dataset/infinity-mm","name":"Infinity-MM","full_name":"","num_papers_in_archive":5},{"url":"/dataset/tutorialvqa","name":"TutorialVQA","full_name":"TutorialVQA","num_papers_in_archive":5},{"url":"/dataset/vqa-vs","name":"VQA-VS","full_name":"a new VQA benchmark considering Varying Shortcuts","num_papers_in_archive":5},{"url":"/dataset/retvqa","name":"RetVQA","full_name":"Retrieval-Based Visual Question Answering","num_papers_in_archive":4},{"url":"/dataset/roadtextvqa","name":"RoadTextVQA","full_name":"","num_papers_in_archive":4},{"url":"/dataset/videonavqa","name":"VideoNavQA","full_name":"","num_papers_in_archive":4},{"url":"/dataset/vizwiz-vqa-grounding","name":"VizWiz-VQA-Grounding","full_name":"","num_papers_in_archive":4},{"url":"/dataset/funqa","name":"FunQA","full_name":"","num_papers_in_archive":3},{"url":"/dataset/illusionvqa","name":"IllusionVQA","full_name":"","num_papers_in_archive":3},{"url":"/dataset/mcvqa","name":"MCVQA","full_name":"Multilingual and Code-mixed Visual Question Answering","num_papers_in_archive":3},{"url":"/dataset/mmed","name":"MMED","full_name":"","num_papers_in_archive":3},{"url":"/dataset/p2gb","name":"P2GB","full_name":"","num_papers_in_archive":3},{"url":"/dataset/pdfvqa","name":"PDFVQA","full_name":"","num_papers_in_archive":3},{"url":"/dataset/cii-bench","name":"CII-Bench","full_name":"Chinese Image Implication understanding Benchmark","num_papers_in_archive":2},{"url":"/dataset/gqa-ood","name":"GQA-OOD","full_name":"","num_papers_in_archive":2},{"url":"/dataset/instaorder","name":"InstaOrder","full_name":"","num_papers_in_archive":2},{"url":"/dataset/posescript","name":"PoseScript","full_name":"","num_papers_in_archive":2},{"url":"/dataset/visual-beliefs","name":"Visual Beliefs","full_name":"","num_papers_in_archive":2},{"url":"/dataset/vizwiz-priv","name":"VizWiz-Priv","full_name":"Visual Privacy dataset","num_papers_in_archive":2},{"url":"/dataset/vizwiz-qualityissues","name":"VizWiz-QualityIssues","full_name":"","num_papers_in_archive":2},{"url":"/dataset/vqa-360deg","name":"VQA 360°","full_name":"","num_papers_in_archive":2},{"url":"/dataset/3u-vqa","name":"3U-VQA","full_name":"Usual, Unusual and Unknown object scenarios for LVQA with difficulty scoring dataset","num_papers_in_archive":1},{"url":"/dataset/aesvqa","name":"AesVQA","full_name":"","num_papers_in_archive":1},{"url":"/dataset/algopuzzlevqa","name":"AlgoPuzzleVQA","full_name":"","num_papers_in_archive":1},{"url":"/dataset/artquest","name":"ArtQuest","full_name":"","num_papers_in_archive":1},{"url":"/dataset/causalchaos","name":"CausalChaos!","full_name":"CausalChaos!QA","num_papers_in_archive":1},{"url":"/dataset/chiqa","name":"ChiQA","full_name":"Chinese VQA","num_papers_in_archive":1},{"url":"/dataset/clevr-mrt","name":"CLEVR-MRT","full_name":"CLEVR: Mental Rotation Tests","num_papers_in_archive":1},{"url":"/dataset/core-mm-1","name":"CORE-MM","full_name":"","num_papers_in_archive":1},{"url":"/dataset/dme-vqa-dataset","name":"DME VQA dataset","full_name":"Diabetic Macular Edema VQA dataset","num_papers_in_archive":1},{"url":"/dataset/emmoe-100","name":"EMMOE-100","full_name":"","num_papers_in_archive":1},{"url":"/dataset/illusionanimals-test","name":"IllusionAnimals_test","full_name":"","num_papers_in_archive":1},{"url":"/dataset/illusionchar-test","name":"IllusionChar_test","full_name":"","num_papers_in_archive":1},{"url":"/dataset/illusionfashionmnist-test","name":"IllusionFashionMNIST_test","full_name":"","num_papers_in_archive":1},{"url":"/dataset/illusionmnist-test","name":"IllusionMNIST_test","full_name":"","num_papers_in_archive":1},{"url":"/dataset/maverics","name":"MAVERICS","full_name":"","num_papers_in_archive":1},{"url":"/dataset/mediconfusion","name":"MediConfusion","full_name":"","num_papers_in_archive":1},{"url":"/dataset/medpromptx-vqa","name":"MedPromptX-VQA","full_name":"","num_papers_in_archive":1},{"url":"/dataset/newskvqa","name":"NEWSKVQA","full_name":"","num_papers_in_archive":1},{"url":"/dataset/parsvqa-caps","name":"ParsVQA-Caps","full_name":"","num_papers_in_archive":1},{"url":"/dataset/qlevr","name":"QLEVR","full_name":"","num_papers_in_archive":1},{"url":"/dataset/simply-clevr","name":"simply-CLEVR","full_name":null,"num_papers_in_archive":1},{"url":"/dataset/super-clevr-3d","name":"Super-CLEVR-3D","full_name":"Super-CLEVR-3D","num_papers_in_archive":1},{"url":"/dataset/t2-guiding","name":"T2 Guiding","full_name":"","num_papers_in_archive":1},{"url":"/dataset/textkvqa","name":"TextKVQA","full_name":"","num_papers_in_archive":1},{"url":"/dataset/tinysocial","name":"TinySocial","full_name":"","num_papers_in_archive":1},{"url":"/dataset/ubench","name":"uBench","full_name":"MicroBench","num_papers_in_archive":1},{"url":"/dataset/vdqg","name":"VDQG","full_name":"Visual Discriminative Question Generation","num_papers_in_archive":1},{"url":"/dataset/viscon-100k","name":"VisCon-100K","full_name":"","num_papers_in_archive":1},{"url":"/dataset/viscon-1m","name":"VisCon-1M","full_name":"","num_papers_in_archive":1},{"url":"/dataset/visual-choice-of-plausible-alternatives","name":"Visual Choice of Plausible Alternatives","full_name":"VCOPA","num_papers_in_archive":1},{"url":"/dataset/visual-haystacks-vhs","name":"Visual Haystacks (VHs)","full_name":"","num_papers_in_archive":1},{"url":"/dataset/vqa-mhug","name":"VQA-MHUG","full_name":"","num_papers_in_archive":1},{"url":"/dataset/vqa-ov","name":"VQA-OV","full_name":"Visual Quality Assessment of Omnidirectional Video","num_papers_in_archive":1},{"url":"/dataset/webli","name":"WebLI","full_name":"Web Language Image","num_papers_in_archive":1},{"url":"/dataset/webvidvqa3m","name":"WebVidVQA3M","full_name":"WebVidVQA3M","num_papers_in_archive":1},{"url":"/dataset/worldcuisines","name":"WorldCuisines","full_name":"","num_papers_in_archive":1},{"url":"/dataset/x-transferbench","name":"X-TransferBench","full_name":"X-TransferBench","num_papers_in_archive":1}],"subtasks":[{"url":"/task/3d-question-answering-3d-qa","name":"3D Question Answering (3D-QA)"},{"url":"/task/chart-question-answering","name":"Chart Question Answering"},{"url":"/task/chart-understanding","name":"Chart Understanding"},{"url":"/task/embodied-question-answering","name":"Embodied Question Answering"},{"url":"/task/factual-visual-question-answering","name":"Factual Visual Question Answering"},{"url":"/task/generative-visual-question-answering","name":"Generative Visual Question Answering"},{"url":"/task/machine-reading-comprehension","name":"Machine Reading Comprehension"},{"url":"/task/multimodal-colonoscopy","name":"Multimodal Colonoscopy"},{"url":"/task/visual-question-answering-1","name":"Visual Question Answering"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":1039,"tagged_in_all":2167,"items":[{"url":"/paper/grad-cam-visual-explanations-from-deep","title":"Grad-CAM: Visual Explanations from Deep Networks via Gradient-based Localization","date":"2016-10-07","arxiv_id":"1610.02391","repositories_listed":126,"syntology":{"n":141,"n_ran":82,"n_unverified":59,"n_pointer_only":68}},{"url":"/paper/bottom-up-and-top-down-attention-for-image","title":"Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering","date":"2017-07-25","arxiv_id":"1707.07998","repositories_listed":65,"syntology":{"n":9,"n_ran":9,"n_unverified":0,"n_pointer_only":6}},{"url":"/paper/parlai-a-dialog-research-software-platform","title":"ParlAI: A Dialog Research Software Platform","date":"2017-05-18","arxiv_id":"1705.06476","repositories_listed":23,"syntology":null},{"url":"/paper/vqa-visual-question-answering","title":"VQA: Visual Question Answering","date":"2015-05-03","arxiv_id":"1505.00468","repositories_listed":21,"syntology":{"n":7,"n_ran":6,"n_unverified":1,"n_pointer_only":6}},{"url":"/paper/a-simple-neural-network-module-for-relational","title":"A simple neural network module for relational reasoning","date":"2017-06-05","arxiv_id":"1706.01427","repositories_listed":20,"syntology":{"n":7,"n_ran":3,"n_unverified":4,"n_pointer_only":1}},{"url":"/paper/blip-2-bootstrapping-language-image-pre","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","date":"2023-01-30","arxiv_id":"2301.12597","repositories_listed":17,"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}},{"url":"/paper/stacked-attention-networks-for-image-question","title":"Stacked Attention Networks for Image Question Answering","date":"2015-11-07","arxiv_id":"1511.02274","repositories_listed":16,"syntology":{"n":4,"n_ran":4,"n_unverified":0,"n_pointer_only":4}},{"url":"/paper/ecg-heartbeat-classification-a-deep","title":"ECG Heartbeat Classification: A Deep Transferable Representation","date":"2018-04-19","arxiv_id":"1805.00794","repositories_listed":13,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/show-ask-attend-and-answer-a-strong-baseline","title":"Show, Ask, Attend, and Answer: A Strong Baseline For Visual Question Answering","date":"2017-04-11","arxiv_id":"1704.03162","repositories_listed":13,"syntology":{"n":9,"n_ran":9,"n_unverified":0,"n_pointer_only":9}},{"url":"/paper/gpt-4-technical-report-1","title":"GPT-4 Technical Report","date":"2023-03-15","arxiv_id":"2303.08774","repositories_listed":11,"syntology":{"n":5,"n_ran":5,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/vilbert-pretraining-task-agnostic","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","date":"2019-08-06","arxiv_id":"1908.02265","repositories_listed":11,"syntology":{"n":34,"n_ran":10,"n_unverified":24,"n_pointer_only":34}},{"url":"/paper/hadamard-product-for-low-rank-bilinear","title":"Hadamard Product for Low-rank Bilinear Pooling","date":"2016-10-14","arxiv_id":"1610.04325","repositories_listed":11,"syntology":null},{"url":"/paper/visualbert-a-simple-and-performant-baseline","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","date":"2019-08-09","arxiv_id":"1908.03557","repositories_listed":10,"syntology":{"n":9,"n_ran":4,"n_unverified":5,"n_pointer_only":6}},{"url":"/paper/compositional-attention-networks-for-machine","title":"Compositional Attention Networks for Machine Reasoning","date":"2018-03-08","arxiv_id":"1803.03067","repositories_listed":10,"syntology":{"n":7,"n_ran":1,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/tips-and-tricks-for-visual-question-answering","title":"Tips and Tricks for Visual Question Answering: Learnings from the 2017 Challenge","date":"2017-08-09","arxiv_id":"1708.02711","repositories_listed":10,"syntology":null},{"url":"/paper/multimodal-compact-bilinear-pooling-for","title":"Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding","date":"2016-06-06","arxiv_id":"1606.01847","repositories_listed":10,"syntology":null},{"url":"/paper/dynamic-memory-networks-for-visual-and","title":"Dynamic Memory Networks for Visual and Textual Question Answering","date":"2016-03-04","arxiv_id":"1603.01417","repositories_listed":10,"syntology":{"n":7,"n_ran":7,"n_unverified":0,"n_pointer_only":7}},{"url":"/paper/hallusionbench-you-see-what-you-think-or-you","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","date":"2023-10-23","arxiv_id":"2310.14566","repositories_listed":9,"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}},{"url":"/paper/improved-baselines-with-visual-instruction","title":"Improved Baselines with Visual Instruction Tuning","date":"2023-10-05","arxiv_id":"2310.03744","repositories_listed":9,"syntology":{"n":9,"n_ran":6,"n_unverified":3,"n_pointer_only":8}},{"url":"/paper/blip-bootstrapping-language-image-pre","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","date":"2022-01-28","arxiv_id":"2201.12086","repositories_listed":9,"syntology":null},{"url":"/paper/layoutlmv2-multi-modal-pre-training-for","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","date":"2020-12-29","arxiv_id":"2012.14740","repositories_listed":9,"syntology":null},{"url":"/paper/lxmert-learning-cross-modality-encoder","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","date":"2019-08-20","arxiv_id":"1908.07490","repositories_listed":9,"syntology":{"n":15,"n_ran":4,"n_unverified":11,"n_pointer_only":3}},{"url":"/paper/pythia-v01-the-winning-entry-to-the-vqa","title":"Pythia v0.1: the Winning Entry to the VQA Challenge 2018","date":"2018-07-26","arxiv_id":"1807.09956","repositories_listed":9,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/hierarchical-question-image-co-attention-for","title":"Hierarchical Question-Image Co-Attention for Visual Question Answering","date":"2016-05-31","arxiv_id":"1606.00061","repositories_listed":9,"syntology":{"n":7,"n_ran":1,"n_unverified":6,"n_pointer_only":1}},{"url":"/paper/qwen2-vl-enhancing-vision-language-model-s","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","date":"2024-09-18","arxiv_id":"2409.12191","repositories_listed":8,"syntology":{"n":12,"n_ran":12,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/bilinear-attention-networks","title":"Bilinear Attention Networks","date":"2018-05-21","arxiv_id":"1805.07932","repositories_listed":8,"syntology":{"n":13,"n_ran":4,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/vision-and-language-navigation-interpreting","title":"Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments","date":"2017-11-20","arxiv_id":"1711.07280","repositories_listed":8,"syntology":null},{"url":"/paper/llama-adapter-efficient-fine-tuning-of","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","date":"2023-03-28","arxiv_id":"2303.16199","repositories_listed":7,"syntology":null},{"url":"/paper/floodnet-a-high-resolution-aerial-imagery","title":"FloodNet: A High Resolution Aerial Imagery Dataset for Post Flood Scene Understanding","date":"2020-12-05","arxiv_id":"2012.02951","repositories_listed":7,"syntology":null},{"url":"/paper/uniter-learning-universal-image-text-1","title":"UNITER: UNiversal Image-TExt Representation Learning","date":"2019-09-25","arxiv_id":"1909.11740","repositories_listed":7,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":2}}],"syntology_records":21,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}