{"url":"/sota/visual-question-answering-on-docvqa-test","task":{"name":"Visual Question Answering (VQA)","url":"/task/visual-question-answering","note":null},"dataset":{"name":"DocVQA test","url":"/dataset/docvqa"},"category":"Computer Vision","categories":["Computer Vision","Natural Language Processing"],"category_note":null,"description":"**Visual Question Answering (VQA)** is a task in computer vision that involves answering questions about an image. The goal of VQA is to teach machines to understand the content of an image and answer questions about it in natural language.\r\n\r\nImage Source: [visualqa.org](https://visualqa.org/)","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["ANLS","Accuracy"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"ANLS":null,"Accuracy":"higher"}},"counts":{"rows":33,"rows_with_code":29,"rows_with_paper_page":33,"rows_dated":33,"rows_using_additional_data":18},"rows":[{"rank_in_archive_order":1,"model":"Human","metrics":{"ANLS":"0.9436"},"uses_additional_data":true,"paper_date":"2020-07-01","paper":"/paper/docvqa-a-dataset-for-vqa-on-document-images","paper_url":"https://arxiv.org/abs/2007.00398v3","paper_title":"DocVQA: A Dataset for VQA on Document Images","code":"https://github.com/anisha2102/docvqa","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"MLCD-Embodied-7B","metrics":{"ANLS":"0.916"},"uses_additional_data":true,"paper_date":"2024-07-24","paper":"/paper/multi-label-cluster-discrimination-for-visual","paper_url":"https://arxiv.org/abs/2407.17331v2","paper_title":"Multi-label Cluster Discrimination for Visual Representation Learning","code":"https://github.com/deepglint/unicom","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":4,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"SMoLA-PaLI-X Specialist","metrics":{"ANLS":"0.908"},"uses_additional_data":true,"paper_date":"2023-12-01","paper":"/paper/omni-smola-boosting-generalist-multimodal","paper_url":"https://arxiv.org/abs/2312.00968v2","paper_title":"Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":4,"model":"SMoLA-PaLI-X Generalist","metrics":{"ANLS":"0.906"},"uses_additional_data":true,"paper_date":"2023-12-01","paper":"/paper/omni-smola-boosting-generalist-multimodal","paper_url":"https://arxiv.org/abs/2312.00968v2","paper_title":"Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":5,"model":"Qwen-VL-Plus","metrics":{"ANLS":"0.9024"},"uses_additional_data":true,"paper_date":"2023-08-24","paper":"/paper/qwen-vl-a-frontier-large-vision-language","paper_url":"https://arxiv.org/abs/2308.12966v3","paper_title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","code":"https://github.com/qwenlm/qwen-vl","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":6,"model":"ScreenAI 5B (4.62 B params, w/OCR)","metrics":{"ANLS":"0.8988"},"uses_additional_data":true,"paper_date":"2024-02-07","paper":"/paper/screenai-a-vision-language-model-for-ui-and","paper_url":"https://arxiv.org/abs/2402.04615v3","paper_title":"ScreenAI: A Vision-Language Model for UI and Infographics Understanding","code":"https://github.com/google-research-datasets/screen_qa","n_code_links":2,"syntology":null},{"rank_in_archive_order":7,"model":"PaLI-3 (w/ OCR)","metrics":{"ANLS":"0.886"},"uses_additional_data":false,"paper_date":"2023-10-13","paper":"/paper/pali-3-vision-language-models-smaller-faster","paper_url":"https://arxiv.org/abs/2310.09199v2","paper_title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","code":"https://github.com/kyegomez/PALI3","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"ERNIE-Layout large (ensemble)","metrics":{"ANLS":"0.8841"},"uses_additional_data":false,"paper_date":"2022-10-12","paper":"/paper/ernie-layout-layout-knowledge-enhanced-pre","paper_url":"https://arxiv.org/abs/2210.06155v2","paper_title":"ERNIE-Layout: Layout Knowledge Enhanced Pre-training for Visually-rich Document Understanding","code":"https://github.com/PaddlePaddle/PaddleNLP/tree/develop/model_zoo/ernie-layout","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"GPT-4","metrics":{"ANLS":"0.884"},"uses_additional_data":false,"paper_date":"2023-06-01","paper":"/paper/layout-and-task-aware-instruction-prompt-for","paper_url":"https://arxiv.org/abs/2306.00526v4","paper_title":"Layout and Task Aware Instruction Prompt for Zero-shot Document Image Question Answering","code":"https://github.com/wenjinw/latin-prompt","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":9,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"DocFormerv2-large","metrics":{"ANLS":"0.8784"},"uses_additional_data":true,"paper_date":"2023-06-02","paper":"/paper/docformerv2-local-features-for-document","paper_url":"https://arxiv.org/abs/2306.01733v1","paper_title":"DocFormerv2: Local Features for Document Understanding","code":"https://github.com/uakarsh/docformerv2","n_code_links":1,"syntology":null},{"rank_in_archive_order":11,"model":"UDOP (aux)","metrics":{"ANLS":"0.878"},"uses_additional_data":true,"paper_date":"2022-12-05","paper":"/paper/unifying-vision-text-and-layout-for-universal","paper_url":"https://arxiv.org/abs/2212.02623v3","paper_title":"Unifying Vision, Text, and Layout for Universal Document Processing","code":"https://github.com/microsoft/i-code","n_code_links":5,"syntology":{"n_ran":4,"n_unverified":13,"n_samples":17,"n_pointer_only_licence":3}},{"rank_in_archive_order":12,"model":"PaLI-3","metrics":{"ANLS":"0.876"},"uses_additional_data":false,"paper_date":"2023-10-13","paper":"/paper/pali-3-vision-language-models-smaller-faster","paper_url":"https://arxiv.org/abs/2310.09199v2","paper_title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","code":"https://github.com/kyegomez/PALI3","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":13,"model":"TILT-Large","metrics":{"ANLS":"0.8705"},"uses_additional_data":true,"paper_date":"2021-02-18","paper":"/paper/going-full-tilt-boogie-on-document","paper_url":"https://arxiv.org/abs/2102.09550v3","paper_title":"Going Full-TILT Boogie on Document Understanding with Text-Image-Layout Transformer","code":"https://github.com/uakarsh/TiLT-Implementation","n_code_links":1,"syntology":null},{"rank_in_archive_order":14,"model":"PaLI-X (Single-task FT w/ OCR)","metrics":{"ANLS":"0.868"},"uses_additional_data":true,"paper_date":"2023-05-29","paper":"/paper/pali-x-on-scaling-up-a-multilingual-vision","paper_url":"https://arxiv.org/abs/2305.18565v1","paper_title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","code":"https://github.com/kyegomez/PALI","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":15,"model":"LayoutLMv2LARGE","metrics":{"ANLS":"0.8672"},"uses_additional_data":false,"paper_date":"2020-12-29","paper":"/paper/layoutlmv2-multi-modal-pre-training-for","paper_url":"https://arxiv.org/abs/2012.14740v4","paper_title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":null},{"rank_in_archive_order":16,"model":"ERNIE-Layout large","metrics":{"ANLS":"0.8486"},"uses_additional_data":false,"paper_date":"2022-10-12","paper":"/paper/ernie-layout-layout-knowledge-enhanced-pre","paper_url":"https://arxiv.org/abs/2210.06155v2","paper_title":"ERNIE-Layout: Layout Knowledge Enhanced Pre-training for Visually-rich Document Understanding","code":"https://github.com/PaddlePaddle/PaddleNLP/tree/develop/model_zoo/ernie-layout","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":17,"model":"UDOP","metrics":{"ANLS":"0.847"},"uses_additional_data":false,"paper_date":"2022-12-05","paper":"/paper/unifying-vision-text-and-layout-for-universal","paper_url":"https://arxiv.org/abs/2212.02623v3","paper_title":"Unifying Vision, Text, and Layout for Universal Document Processing","code":"https://github.com/microsoft/i-code","n_code_links":5,"syntology":{"n_ran":4,"n_unverified":13,"n_samples":17,"n_pointer_only_licence":3}},{"rank_in_archive_order":18,"model":"TILT-Base","metrics":{"ANLS":"0.8392"},"uses_additional_data":true,"paper_date":"2021-02-18","paper":"/paper/going-full-tilt-boogie-on-document","paper_url":"https://arxiv.org/abs/2102.09550v3","paper_title":"Going Full-TILT Boogie on Document Understanding with Text-Image-Layout Transformer","code":"https://github.com/uakarsh/TiLT-Implementation","n_code_links":1,"syntology":null},{"rank_in_archive_order":19,"model":"Claude + LATIN-Prompt","metrics":{"ANLS":"0.8336"},"uses_additional_data":false,"paper_date":"2023-06-01","paper":"/paper/layout-and-task-aware-instruction-prompt-for","paper_url":"https://arxiv.org/abs/2306.00526v4","paper_title":"Layout and Task Aware Instruction Prompt for Zero-shot Document Image Question Answering","code":"https://github.com/wenjinw/latin-prompt","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":9,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":20,"model":"GPT-3.5 + LATIN-Prompt","metrics":{"ANLS":"0.8255"},"uses_additional_data":false,"paper_date":"2023-06-01","paper":"/paper/layout-and-task-aware-instruction-prompt-for","paper_url":"https://arxiv.org/abs/2306.00526v4","paper_title":"Layout and Task Aware Instruction Prompt for Zero-shot Document Image Question Answering","code":"https://github.com/wenjinw/latin-prompt","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":9,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"PaLI-X (Multi-task FT)","metrics":{"ANLS":"0.809"},"uses_additional_data":true,"paper_date":"2023-05-29","paper":"/paper/pali-x-on-scaling-up-a-multilingual-vision","paper_url":"https://arxiv.org/abs/2305.18565v1","paper_title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","code":"https://github.com/kyegomez/PALI","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":22,"model":"DUBLIN (variable resolution)","metrics":{"ANLS":"0.803"},"uses_additional_data":true,"paper_date":"2023-05-23","paper":"/paper/dublin-document-understanding-by-language","paper_url":"https://arxiv.org/abs/2305.14218v4","paper_title":"DUBLIN -- Document Understanding By Language-Image Network","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":23,"model":"PaLI-X (Single-task FT)","metrics":{"ANLS":"0.80"},"uses_additional_data":true,"paper_date":"2023-05-29","paper":"/paper/pali-x-on-scaling-up-a-multilingual-vision","paper_url":"https://arxiv.org/abs/2305.18565v1","paper_title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","code":"https://github.com/kyegomez/PALI","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":24,"model":"DUBLIN","metrics":{"ANLS":"0.782"},"uses_additional_data":true,"paper_date":"2023-05-23","paper":"/paper/dublin-document-understanding-by-language","paper_url":"https://arxiv.org/abs/2305.14218v4","paper_title":"DUBLIN -- Document Understanding By Language-Image Network","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":25,"model":"LayoutLMv2BASE","metrics":{"ANLS":"0.7808"},"uses_additional_data":false,"paper_date":"2020-12-29","paper":"/paper/layoutlmv2-multi-modal-pre-training-for","paper_url":"https://arxiv.org/abs/2012.14740v4","paper_title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":null},{"rank_in_archive_order":26,"model":"Pix2Struct-large","metrics":{"ANLS":"0.766"},"uses_additional_data":false,"paper_date":"2022-10-07","paper":"/paper/pix2struct-screenshot-parsing-as-pretraining","paper_url":"https://arxiv.org/abs/2210.03347v2","paper_title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","code":"https://github.com/huggingface/transformers","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":27,"model":"MatCha","metrics":{"ANLS":"0.742"},"uses_additional_data":false,"paper_date":"2022-12-19","paper":"/paper/matcha-enhancing-visual-language-pretraining","paper_url":"https://arxiv.org/abs/2212.09662v2","paper_title":"MatCha: Enhancing Visual Language Pretraining with Math Reasoning and Chart Derendering","code":"https://github.com/huggingface/transformers","n_code_links":1,"syntology":null},{"rank_in_archive_order":28,"model":"Pix2Struct-base","metrics":{"ANLS":"0.721"},"uses_additional_data":false,"paper_date":"2022-10-07","paper":"/paper/pix2struct-screenshot-parsing-as-pretraining","paper_url":"https://arxiv.org/abs/2210.03347v2","paper_title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","code":"https://github.com/huggingface/transformers","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":29,"model":"Donut","metrics":{"ANLS":"0.675"},"uses_additional_data":false,"paper_date":"2021-11-30","paper":"/paper/donut-document-understanding-transformer","paper_url":"https://arxiv.org/abs/2111.15664v5","paper_title":"OCR-free Document Understanding Transformer","code":"https://github.com/clovaai/donut","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":9,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":30,"model":"BERT_LARGE_SQUAD_DOCVQA_FINETUNED_Baseline","metrics":{"ANLS":"0.665","Accuracy":"55.77"},"uses_additional_data":true,"paper_date":"2020-07-01","paper":"/paper/docvqa-a-dataset-for-vqa-on-document-images","paper_url":"https://arxiv.org/abs/2007.00398v3","paper_title":"DocVQA: A Dataset for VQA on Document Images","code":"https://github.com/anisha2102/docvqa","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":31,"model":"Qwen-VL","metrics":{"ANLS":"0.651"},"uses_additional_data":true,"paper_date":"2023-08-24","paper":"/paper/qwen-vl-a-frontier-large-vision-language","paper_url":"https://arxiv.org/abs/2308.12966v3","paper_title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","code":"https://github.com/qwenlm/qwen-vl","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":32,"model":"Dessurt","metrics":{"ANLS":"0.632"},"uses_additional_data":false,"paper_date":"2022-03-30","paper":"/paper/end-to-end-document-recognition-and","paper_url":"https://arxiv.org/abs/2203.16618v3","paper_title":"End-to-end Document Recognition and Understanding with Dessurt","code":"https://github.com/herobd/dessurt","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":11,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":33,"model":"Qwen-VL-Chat","metrics":{"ANLS":"0.626"},"uses_additional_data":true,"paper_date":"2023-08-24","paper":"/paper/qwen-vl-a-frontier-large-vision-language","paper_url":"https://arxiv.org/abs/2308.12966v3","paper_title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","code":"https://github.com/qwenlm/qwen-vl","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":22,"rows_with_any_sample_ran":15,"distinct_papers_with_graph_line":11,"distinct_papers_with_any_sample_ran":7,"samples_over_distinct_papers":{"n_ran":25,"n_unverified":63,"n_samples":88,"n_pointer_only_licence":5,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":50,"n_unverified":114,"n_samples":164,"n_pointer_only_licence":12,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}