{"url":"/task/visual-reasoning","name":"Visual Reasoning","slug":"visual-reasoning","description_markdown":"Ability to understand  actions and reasoning  associated with any  visual images","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Reasoning","url":"/area/reasoning"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":698,"papers_with_code":356,"benchmarks":12,"benchmark_tables_in_archive":12,"benchmark_tables_shown":12,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":44,"subtasks":1,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/visual-reasoning-on-winoground","slug":"visual-reasoning-on-winoground","dataset":"Winoground","dataset_url":"/dataset/winoground","rows_in_archive":114,"metrics":["Text Score","Image Score","Group Score"],"first_row_in_archive_order":{"model":"GPT-4o + CA","paper_title":"A Cognitive Paradigm Approach to Probe the Perception-Reasoning Interface in VLMs","paper_url":"/paper/cognitive-paradigms-for-evaluating-vlms-on","paper_date":"2025-01-23","arxiv_id":"2501.13620","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-reasoning-on-nlvr2-dev","slug":"visual-reasoning-on-nlvr2-dev","dataset":"NLVR2 Dev","dataset_url":"/dataset/nlvr","rows_in_archive":15,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"BEiT-3","paper_title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","paper_url":"/paper/image-as-a-foreign-language-beit-pretraining","paper_date":"2022-08-22","arxiv_id":"2208.10442","code_links":[{"title":"microsoft/unilm","url":"https://github.com/microsoft/unilm/tree/master/beit"},{"title":"lyan62/data-curation","url":"https://github.com/lyan62/data-curation"}],"syntology":null}},{"leaderboard":"/sota/visual-reasoning-on-nlvr2-test","slug":"visual-reasoning-on-nlvr2-test","dataset":"NLVR2 Test","dataset_url":"/dataset/nlvr","rows_in_archive":14,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"BEiT-3","paper_title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","paper_url":"/paper/image-as-a-foreign-language-beit-pretraining","paper_date":"2022-08-22","arxiv_id":"2208.10442","code_links":[{"title":"microsoft/unilm","url":"https://github.com/microsoft/unilm/tree/master/beit"},{"title":"lyan62/data-curation","url":"https://github.com/lyan62/data-curation"}],"syntology":null}},{"leaderboard":"/sota/visual-reasoning-on-clevrer","slug":"visual-reasoning-on-clevrer","dataset":"CLEVRER","dataset_url":null,"rows_in_archive":13,"metrics":["Average-per ques.","Descriptive","Explanatory-per opt.","Explanatory-per ques.","Predictive-per opt.","Predictive-per ques.","Counterfactual-per opt.","Counterfactual-per ques."],"first_row_in_archive_order":{"model":"AI Core","paper_title":"Think before You Simulate: Symbolic Reasoning to Orchestrate Neural Computation for Counterfactual Question Answering","paper_url":"/paper/think-before-you-simulate-symbolic-reasoning-1","paper_date":"2025-06-12","arxiv_id":"2506.10753","code_links":[{"title":"azreasoners/CRCG","url":"https://github.com/azreasoners/CRCG"}],"syntology":null}},{"leaderboard":"/sota/visual-reasoning-on-bongard-openworld","slug":"visual-reasoning-on-bongard-openworld","dataset":"Bongard-OpenWorld","dataset_url":"/dataset/bongard-openworld","rows_in_archive":9,"metrics":["2-Class Accuracy"],"first_row_in_archive_order":{"model":"Gemini-2.0 + CA","paper_title":"A Cognitive Paradigm Approach to Probe the Perception-Reasoning Interface in VLMs","paper_url":"/paper/cognitive-paradigms-for-evaluating-vlms-on","paper_date":"2025-01-23","arxiv_id":"2501.13620","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-reasoning-on-winogavil","slug":"visual-reasoning-on-winogavil","dataset":"WinoGAViL","dataset_url":"/dataset/winogavil","rows_in_archive":8,"metrics":["Jaccard Index"],"first_row_in_archive_order":{"model":"Humans","paper_title":"WinoGAViL: Gamified Association Benchmark to Challenge Vision-and-Language Models","paper_url":"/paper/winogavil-gamified-association-benchmark-to","paper_date":"2022-07-25","arxiv_id":"2207.12576","code_links":[{"title":"winogavil/winogavil-experiments","url":"https://github.com/winogavil/winogavil-experiments"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-reasoning-on-vsr","slug":"visual-reasoning-on-vsr","dataset":"VSR","dataset_url":"/dataset/vsr","rows_in_archive":5,"metrics":["accuracy"],"first_row_in_archive_order":{"model":"LXMERT","paper_title":"Visual Spatial Reasoning","paper_url":"/paper/visual-spatial-reasoning","paper_date":"2022-04-30","arxiv_id":"2205.00363","code_links":[{"title":"cambridgeltl/visual-spatial-reasoning","url":"https://github.com/cambridgeltl/visual-spatial-reasoning"},{"title":"ziyan-xiaoyu/spatialmqa","url":"https://github.com/ziyan-xiaoyu/spatialmqa"},{"title":"sohojoe/clip_visual-spatial-reasoning","url":"https://github.com/sohojoe/clip_visual-spatial-reasoning"},{"title":"MindCode-4/code-1","url":"https://github.com/MindCode-4/code-1/tree/main/vilt"}],"syntology":{"n":10,"n_ran":5,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-reasoning-on-phyre-1b-cross","slug":"visual-reasoning-on-phyre-1b-cross","dataset":"PHYRE-1B-Cross","dataset_url":"/dataset/phyre","rows_in_archive":4,"metrics":["AUCCESS"],"first_row_in_archive_order":{"model":"RPIN","paper_title":"Learning Long-term Visual Dynamics with Region Proposal Interaction Networks","paper_url":"/paper/learning-long-term-visual-dynamics-with","paper_date":"2020-08-05","arxiv_id":"2008.02265","code_links":[{"title":"HaozhiQi/RPIN","url":"https://github.com/HaozhiQi/RPIN"}],"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":3}}},{"leaderboard":"/sota/visual-reasoning-on-phyre-1b-within","slug":"visual-reasoning-on-phyre-1b-within","dataset":"PHYRE-1B-Within","dataset_url":"/dataset/phyre","rows_in_archive":4,"metrics":["AUCCESS"],"first_row_in_archive_order":{"model":"RPIN","paper_title":"Learning Long-term Visual Dynamics with Region Proposal Interaction Networks","paper_url":"/paper/learning-long-term-visual-dynamics-with","paper_date":"2020-08-05","arxiv_id":"2008.02265","code_links":[{"title":"HaozhiQi/RPIN","url":"https://github.com/HaozhiQi/RPIN"}],"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":3}}},{"leaderboard":"/sota/visual-reasoning-on-vasr","slug":"visual-reasoning-on-vasr","dataset":"VASR","dataset_url":"/dataset/vasr","rows_in_archive":4,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"Swin","paper_title":"VASR: Visual Analogies of Situation Recognition","paper_url":"/paper/vasr-visual-analogies-of-situation","paper_date":"2022-12-08","arxiv_id":"2212.04542","code_links":[{"title":"vasr-dataset/vasr","url":"https://github.com/vasr-dataset/vasr"}],"syntology":{"n":8,"n_ran":0,"n_unverified":8,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-reasoning-on-irfl-image-recognition-of","slug":"visual-reasoning-on-irfl-image-recognition-of","dataset":"IRFL: Image Recognition of Figurative Language","dataset_url":"/dataset/irfl-image-recognition-of-figurative-language","rows_in_archive":1,"metrics":["1-of-100 Accuracy"],"first_row_in_archive_order":{"model":"Humans","paper_title":"IRFL: Image Recognition of Figurative Language","paper_url":"/paper/irfl-image-recognition-of-figurative-language","paper_date":"2023-03-27","arxiv_id":"2303.15445","code_links":[{"title":"irfl-dataset/irfl","url":"https://github.com/irfl-dataset/irfl"}],"syntology":null}},{"leaderboard":"/sota/visual-reasoning-on-nlvr","slug":"visual-reasoning-on-nlvr","dataset":"NLVR","dataset_url":"/dataset/nlvr","rows_in_archive":1,"metrics":["Accuracy (Dev)","Accuracy (Test-P)","Accuracy (Test-U)"],"first_row_in_archive_order":{"model":"VisualBERT","paper_title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","paper_url":"/paper/visualbert-a-simple-and-performant-baseline","paper_date":"2019-08-09","arxiv_id":"1908.03557","code_links":[{"title":"uclanlp/visualbert","url":"https://github.com/uclanlp/visualbert"},{"title":"YIKUAN8/Transformers-VQA","url":"https://github.com/YIKUAN8/Transformers-VQA"},{"title":"lalithjets/surgical_vqa","url":"https://github.com/lalithjets/surgical_vqa"},{"title":"gchhablani/multilingual-vqa","url":"https://github.com/gchhablani/multilingual-vqa"},{"title":"longbai1006/surgical-vqla","url":"https://github.com/longbai1006/surgical-vqla"},{"title":"social-ai-studio/matk","url":"https://github.com/social-ai-studio/matk"},{"title":"chenkangyang/paddle_visual_bert","url":"https://github.com/chenkangyang/paddle_visual_bert"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/5/visual_bert"},{"title":"MindCode-4/code-5","url":"https://github.com/MindCode-4/code-5/tree/main/visual_bert"},{"title":"MindCode-4/code-1","url":"https://github.com/MindCode-4/code-1/tree/main/visual_bert"}],"syntology":{"n":9,"n_ran":4,"n_unverified":5,"n_pointer_only":6}}}],"datasets":[{"url":"/dataset/refcoco","name":"RefCOCO","full_name":"","num_papers_in_archive":439},{"url":"/dataset/mathvista","name":"MathVista","full_name":"Mathematical Reasoning of in Visual Contexts","num_papers_in_archive":242},{"url":"/dataset/shapes-1","name":"SHAPES","full_name":"Swarm Heuristics based Adaptive and Penalized Estimation of Splines","num_papers_in_archive":120},{"url":"/dataset/snli-ve","name":"SNLI-VE","full_name":null,"num_papers_in_archive":117},{"url":"/dataset/textcaps","name":"TextCaps","full_name":"","num_papers_in_archive":98},{"url":"/dataset/raven","name":"RAVEN","full_name":"","num_papers_in_archive":96},{"url":"/dataset/winoground","name":"Winoground","full_name":"","num_papers_in_archive":90},{"url":"/dataset/abstractreasoning","name":"AbstractReasoning","full_name":"AbstractReasoning","num_papers_in_archive":86},{"url":"/dataset/nlvr","name":"NLVR","full_name":"Natural Language Visual Reasoningnatural language for visual reasoning","num_papers_in_archive":83},{"url":"/dataset/vsr","name":"VSR","full_name":"Visual Spatial Reasoning","num_papers_in_archive":69},{"url":"/dataset/figureqa","name":"FigureQA","full_name":"","num_papers_in_archive":61},{"url":"/dataset/pgm","name":"PGM","full_name":"Procedurally Generated Matrices (PGM)","num_papers_in_archive":57},{"url":"/dataset/cater","name":"CATER","full_name":"","num_papers_in_archive":51},{"url":"/dataset/iconqa","name":"IconQA","full_name":"Icon Question Answering","num_papers_in_archive":42},{"url":"/dataset/phyre","name":"PHYRE","full_name":"PHYsical REasoning","num_papers_in_archive":35},{"url":"/dataset/iglue","name":"IGLUE","full_name":"Image-Grounded Language Understanding Evaluation","num_papers_in_archive":31},{"url":"/dataset/marvl","name":"MaRVL","full_name":"Multicultural Reasoning over Vision and Language","num_papers_in_archive":29},{"url":"/dataset/social-iq","name":"Social-IQ","full_name":"","num_papers_in_archive":23},{"url":"/dataset/core-mm","name":"InfiMM-Eval","full_name":"Complex Open-ended Reasoning Evaluation for Multi-Modal Language Models","num_papers_in_archive":19},{"url":"/dataset/clevr-ref","name":"CLEVR-Ref+","full_name":"","num_papers_in_archive":17},{"url":"/dataset/super-clevr","name":"Super-CLEVR","full_name":"","num_papers_in_archive":13},{"url":"/dataset/cops-ref","name":"Cops-Ref","full_name":"","num_papers_in_archive":8},{"url":"/dataset/cog","name":"COG","full_name":"","num_papers_in_archive":7},{"url":"/dataset/relative-size","name":"Relative Size","full_name":"","num_papers_in_archive":6},{"url":"/dataset/smart-101","name":"SMART-101","full_name":"Simple Multimodal Algorithmic Reasoning Task Dataset","num_papers_in_archive":6},{"url":"/dataset/comphy","name":"ComPhy","full_name":"Compositional Physical Reasoning Dataset","num_papers_in_archive":5},{"url":"/dataset/kilogram","name":"KiloGram","full_name":"","num_papers_in_archive":5},{"url":"/dataset/pgdp5k","name":"PGDP5K","full_name":"Plane Geometry Diagram Parsing Dataset","num_papers_in_archive":5},{"url":"/dataset/trance","name":"TRANCE","full_name":"Transformation Driven Visual Reasoning","num_papers_in_archive":5},{"url":"/dataset/winogavil","name":"WinoGAViL","full_name":"","num_papers_in_archive":5},{"url":"/dataset/vasr","name":"VASR","full_name":"Visual Analogies of Situation Recognition","num_papers_in_archive":4},{"url":"/dataset/ade-affordance","name":"ADE-Affordance","full_name":"","num_papers_in_archive":3},{"url":"/dataset/bongard-openworld","name":"Bongard-OpenWorld","full_name":"","num_papers_in_archive":3},{"url":"/dataset/p2gb","name":"P2GB","full_name":"","num_papers_in_archive":3},{"url":"/dataset/g-vue","name":"G-VUE","full_name":"General-purpose Visual Understanding Evaluation","num_papers_in_archive":2},{"url":"/dataset/irfl-image-recognition-of-figurative-language","name":"IRFL: Image Recognition of Figurative Language","full_name":"","num_papers_in_archive":2},{"url":"/dataset/machine-number-sense","name":"Machine Number Sense","full_name":"","num_papers_in_archive":2},{"url":"/dataset/emma","name":"EMMA","full_name":"An Enhanced MultiModal ReAsoning Benchmark","num_papers_in_archive":1},{"url":"/dataset/lilgym","name":"lilGym","full_name":"","num_papers_in_archive":1},{"url":"/dataset/polymath","name":"PolyMATH","full_name":"","num_papers_in_archive":1},{"url":"/dataset/sequence-consistency-evaluation-sce-tests","name":"Sequence Consistency Evaluation (SCE) tests","full_name":"","num_papers_in_archive":1},{"url":"/dataset/svrt","name":"SVRT","full_name":"Synthetic Visual Reasoning Task","num_papers_in_archive":1},{"url":"/dataset/visual-choice-of-plausible-alternatives","name":"Visual Choice of Plausible Alternatives","full_name":"VCOPA","num_papers_in_archive":1},{"url":"/dataset/cvr-tasks","name":"Compositional Visual Reasoning (CVR)","full_name":"","num_papers_in_archive":0}],"subtasks":[{"url":"/task/visual-commonsense-reasoning","name":"Visual Commonsense Reasoning"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":356,"tagged_in_all":698,"items":[{"url":"/paper/learning-transferable-visual-models-from","title":"Learning Transferable Visual Models From Natural Language Supervision","date":"2021-02-26","arxiv_id":"2103.00020","repositories_listed":82,"syntology":{"n":20,"n_ran":16,"n_unverified":4,"n_pointer_only":16}},{"url":"/paper/blip-2-bootstrapping-language-image-pre","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","date":"2023-01-30","arxiv_id":"2301.12597","repositories_listed":17,"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}},{"url":"/paper/visual-instruction-tuning-1","title":"Visual Instruction Tuning","date":"2023-04-17","arxiv_id":"2304.08485","repositories_listed":13,"syntology":{"n":51,"n_ran":16,"n_unverified":35,"n_pointer_only":0}},{"url":"/paper/vilbert-pretraining-task-agnostic","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","date":"2019-08-06","arxiv_id":"1908.02265","repositories_listed":11,"syntology":{"n":34,"n_ran":10,"n_unverified":24,"n_pointer_only":34}},{"url":"/paper/visualbert-a-simple-and-performant-baseline","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","date":"2019-08-09","arxiv_id":"1908.03557","repositories_listed":10,"syntology":{"n":9,"n_ran":4,"n_unverified":5,"n_pointer_only":6}},{"url":"/paper/compositional-attention-networks-for-machine","title":"Compositional Attention Networks for Machine Reasoning","date":"2018-03-08","arxiv_id":"1803.03067","repositories_listed":10,"syntology":{"n":7,"n_ran":1,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/vse-improving-visual-semantic-embeddings-with","title":"VSE++: Improving Visual-Semantic Embeddings with Hard Negatives","date":"2017-07-18","arxiv_id":"1707.05612","repositories_listed":10,"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":4}},{"url":"/paper/blip-bootstrapping-language-image-pre","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","date":"2022-01-28","arxiv_id":"2201.12086","repositories_listed":9,"syntology":null},{"url":"/paper/lxmert-learning-cross-modality-encoder","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","date":"2019-08-20","arxiv_id":"1908.07490","repositories_listed":9,"syntology":{"n":15,"n_ran":4,"n_unverified":11,"n_pointer_only":3}},{"url":"/paper/vinvl-making-visual-representations-matter-in","title":"VinVL: Revisiting Visual Representations in Vision-Language Models","date":"2021-01-02","arxiv_id":"2101.00529","repositories_listed":7,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/uniter-learning-universal-image-text-1","title":"UNITER: UNiversal Image-TExt Representation Learning","date":"2019-09-25","arxiv_id":"1909.11740","repositories_listed":7,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/film-visual-reasoning-with-a-general","title":"FiLM: Visual Reasoning with a General Conditioning Layer","date":"2017-09-22","arxiv_id":"1709.07871","repositories_listed":7,"syntology":{"n":10,"n_ran":9,"n_unverified":1,"n_pointer_only":7}},{"url":"/paper/minigpt-4-enhancing-vision-language","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","date":"2023-04-20","arxiv_id":"2304.10592","repositories_listed":6,"syntology":null},{"url":"/paper/coca-contrastive-captioners-are-image-text","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","date":"2022-05-04","arxiv_id":"2205.01917","repositories_listed":6,"syntology":{"n":17,"n_ran":9,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/align-before-fuse-vision-and-language","title":"Align before Fuse: Vision and Language Representation Learning with Momentum Distillation","date":"2021-07-16","arxiv_id":"2107.07651","repositories_listed":6,"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":3}},{"url":"/paper/vilt-vision-and-language-transformer-without","title":"ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision","date":"2021-02-05","arxiv_id":"2102.03334","repositories_listed":6,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":1}},{"url":"/paper/learning-to-compose-dynamic-tree-structures","title":"Learning to Compose Dynamic Tree Structures for Visual Contexts","date":"2018-12-05","arxiv_id":"1812.01880","repositories_listed":6,"syntology":{"n":14,"n_ran":4,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/mmmu-a-massive-multi-discipline-multimodal","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","date":"2023-11-27","arxiv_id":"2311.16502","repositories_listed":5,"syntology":{"n":14,"n_ran":6,"n_unverified":8,"n_pointer_only":1}},{"url":"/paper/gqa-a-new-dataset-for-compositional-question","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","date":"2019-02-25","arxiv_id":"1902.09506","repositories_listed":5,"syntology":null},{"url":"/paper/inferring-and-executing-programs-for-visual","title":"Inferring and Executing Programs for Visual Reasoning","date":"2017-05-10","arxiv_id":"1705.03633","repositories_listed":5,"syntology":{"n":6,"n_ran":4,"n_unverified":2,"n_pointer_only":6}},{"url":"/paper/clevr-a-diagnostic-dataset-for-compositional","title":"CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning","date":"2016-12-20","arxiv_id":"1612.06890","repositories_listed":5,"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":4}},{"url":"/paper/how-is-chatgpt-s-behavior-changing-over-time","title":"How is ChatGPT's behavior changing over time?","date":"2023-07-18","arxiv_id":"2307.09009","repositories_listed":4,"syntology":{"n":6,"n_ran":2,"n_unverified":4,"n_pointer_only":5}},{"url":"/paper/your-diffusion-model-is-secretly-a-zero-shot","title":"Your Diffusion Model is Secretly a Zero-Shot Classifier","date":"2023-03-28","arxiv_id":"2303.16203","repositories_listed":4,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/visual-spatial-reasoning","title":"Visual Spatial Reasoning","date":"2022-04-30","arxiv_id":"2205.00363","repositories_listed":4,"syntology":{"n":10,"n_ran":5,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/unifying-architectures-tasks-and-modalities","title":"OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework","date":"2022-02-07","arxiv_id":"2202.03052","repositories_listed":4,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/distilled-dual-encoder-model-for-vision","title":"Distilled Dual-Encoder Model for Vision-Language Understanding","date":"2021-12-16","arxiv_id":"2112.08723","repositories_listed":4,"syntology":null},{"url":"/paper/flava-a-foundational-language-and-vision","title":"FLAVA: A Foundational Language And Vision Alignment Model","date":"2021-12-08","arxiv_id":"2112.04482","repositories_listed":4,"syntology":null},{"url":"/paper/learning-by-abstraction-the-neural-state","title":"Learning by Abstraction: The Neural State Machine","date":"2019-07-09","arxiv_id":"1907.03950","repositories_listed":4,"syntology":{"n":21,"n_ran":3,"n_unverified":18,"n_pointer_only":2}},{"url":"/paper/mmcode-evaluating-multi-modal-code-large","title":"MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems","date":"2024-04-15","arxiv_id":"2404.09486","repositories_listed":3,"syntology":{"n":16,"n_ran":13,"n_unverified":3,"n_pointer_only":16}},{"url":"/paper/collaborative-transformers-for-grounded","title":"Collaborative Transformers for Grounded Situation Recognition","date":"2022-03-30","arxiv_id":"2203.16518","repositories_listed":3,"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":0}}],"syntology_records":25,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}