{"url":"/dataset/mm-vet","name":"MM-Vet","full_name":null,"description_markdown":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","description_withheld":null,"homepage":"https://github.com/yuweihao/MM-Vet","introduced_date":"2023-08-04","introduced_date_note":null,"introduced_by":{"paper":"/paper/mm-vet-evaluating-large-multimodal-models-for","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","first_author":"Weihao Yu","url":null},"license":{"name":"CC BY-NC 4.0","url":"https://creativecommons.org/licenses/by-nc/4.0/"},"modalities":[{"name":"Images","url":"/datasets/modality/images"},{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Visual Question Answering (VQA)","url":"/task/visual-question-answering","datasets_with_task":"/datasets/task/visual-question-answering"},{"name":"Visual Question Answering","url":"/task/visual-question-answering-1","datasets_with_task":"/datasets/task/visual-question-answering-1"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["MM-Vet"],"data_loaders":[],"num_papers_in_archive":339,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/visual-question-answering-on-mm-vet","task":"Visual Question Answering","dataset_variant":"MM-Vet","rows":231,"metrics":["GPT-4 score","Params"],"first_row_in_archive_order":{"model":"gemini-2.0-flash-exp","paper":null,"metrics":{"GPT-4 score":"81.2±0.4"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/visual-question-answering-vqa-on-mm-vet","task":"Visual Question Answering (VQA)","dataset_variant":"MM-Vet","rows":1,"metrics":["Acc"],"first_row_in_archive_order":{"model":"Lyra-Pro","paper":"/paper/lyra-an-efficient-and-speech-centric","metrics":{"Acc":"71.4"},"code_links":[{"title":"dvlab-research/Lyra","url":"https://github.com/dvlab-research/Lyra"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/janus-pro-unified-multimodal-understanding","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","date":"2025-01-29","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/parameter-inverted-image-pyramid-networks-for","title":"Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding","date":"2025-01-14","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/lyra-an-efficient-and-speech-centric","title":"Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition","date":"2024-12-12","rows_on_this_dataset":4,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":19,"samples_ran":3,"samples_unverified":16,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/provision-programmatically-scaling-vision","title":"ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models","date":"2024-12-09","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":15,"samples_ran":0,"samples_unverified":15,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/illume-illuminating-your-llms-to-see-draw-and","title":"ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance","date":"2024-12-09","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/taco-learning-multi-modal-action-models-with","title":"TACO: Learning Multi-modal Action Models with Synthetic Chains-of-Thought-and-Action","date":"2024-12-07","rows_on_this_dataset":3,"code_links":1,"syntology":null},{"paper":"/paper/mammoth-vl-eliciting-multimodal-reasoning","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","date":"2024-12-06","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/linvt-empower-your-image-level-large-language","title":"LinVT: Empower Your Image-level Large Language Model to Understand Videos","date":"2024-12-06","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":4,"samples_unverified":8,"pointer_only_for_licence":12,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/expanding-performance-boundaries-of-open","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","date":"2024-12-06","rows_on_this_dataset":7,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":9,"samples_ran":1,"samples_unverified":8,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/visionzip-longer-is-better-but-not-necessary","title":"VisionZip: Longer is Better but Not Necessary in Vision Language Models","date":"2024-12-05","rows_on_this_dataset":6,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":11,"samples_ran":1,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/flashsloth-lightning-multimodal-large","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","date":"2024-12-05","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":7,"samples_unverified":0,"pointer_only_for_licence":7,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/a-stitch-in-time-saves-nine-small-vlm-is-a","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","date":"2024-12-04","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":4,"samples_unverified":1,"pointer_only_for_licence":5,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/dynamic-llava-efficient-multimodal-large","title":"Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification","date":"2024-12-01","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":18,"samples_ran":13,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/looking-beyond-text-reducing-language-bias-in","title":"Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance","date":"2024-11-21","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/focusllava-a-coarse-to-fine-approach-for","title":"FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression","date":"2024-11-21","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/janusflow-harmonizing-autoregression-and","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","date":"2024-11-12","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/aligned-vector-quantization-for-edge-cloud","title":"Aligned Vector Quantization for Edge-Cloud Collabrative Vision-Language Models","date":"2024-11-08","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/janus-decoupling-visual-encoding-for-unified","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","date":"2024-10-17","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/improving-multi-modal-large-language-model","title":"Improving Multi-modal Large Language Model through Boosting Vision Capabilities","date":"2024-10-17","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/h2ovl-mississippi-vision-language-models","title":"H2OVL-Mississippi Vision Language Models Technical Report","date":"2024-10-17","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/g-mod-exploring-mixture-of-depth-adaptation","title":"$γ-$MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models","date":"2024-10-17","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/cross-modal-safety-mechanism-transfer-in","title":"Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models","date":"2024-10-16","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/mmfuser-multimodal-multi-layer-feature-fuser","title":"MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding","date":"2024-10-15","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/mmar-towards-lossless-multi-modal-auto","title":"MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling","date":"2024-10-14","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/vlfeedback-a-large-scale-ai-feedback-dataset","title":"VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment","date":"2024-10-12","rows_on_this_dataset":4,"code_links":0,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":5,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/baichuan-omni-technical-report","title":"Baichuan-Omni Technical Report","date":"2024-10-11","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/mono-internvl-pushing-the-boundaries-of","title":"Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training","date":"2024-10-10","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/deciphering-cross-modal-alignment-in-large","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","date":"2024-10-09","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":12,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/gamified-crowd-sourcing-of-high-quality-data","title":"Gamified crowd-sourcing of high-quality data for visual fine-tuning","date":"2024-10-05","rows_on_this_dataset":3,"code_links":0,"syntology":null},{"paper":"/paper/mm1-5-methods-analysis-insights-from","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","date":"2024-09-30","rows_on_this_dataset":6,"code_links":0,"syntology":null},{"paper":"/paper/emu3-next-token-prediction-is-all-you-need","title":"Emu3: Next-Token Prediction is All You Need","date":"2024-09-27","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":3,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/phantom-of-latent-for-large-language-and","title":"Phantom of Latent for Large Language and Vision Models","date":"2024-09-23","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":1,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/qwen2-vl-enhancing-vision-language-model-s","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","date":"2024-09-18","rows_on_this_dataset":3,"code_links":8,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":8,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/points-improving-your-vision-language-model","title":"POINTS: Improving Your Vision-language Model with Affordable Strategies","date":"2024-09-07","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/cogvlm2-visual-language-models-for-image-and","title":"CogVLM2: Visual Language Models for Image and Video Understanding","date":"2024-08-29","rows_on_this_dataset":2,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":17,"samples_ran":12,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/maven-an-effective-multi-granularity-hybrid","title":"MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model","date":"2024-08-22","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/sea-supervised-embedding-alignment-for-token","title":"SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMs","date":"2024-08-21","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/teamlora-boosting-low-rank-adaptation-with","title":"TeamLoRA: Boosting Low-Rank Adaptation with Expert Collaboration and Competition","date":"2024-08-19","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/visual-agents-as-fast-and-slow-thinkers","title":"Visual Agents as Fast and Slow Thinkers","date":"2024-08-16","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/crome-cross-modal-adapters-for-efficient","title":"CROME: Cross-Modal Adapters for Efficient Multimodal LLM","date":"2024-08-13","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/mplug-owl3-towards-long-image-sequence","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","date":"2024-08-09","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/img-diff-contrastive-data-synthesis-for","title":"Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models","date":"2024-08-08","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/llava-onevision-easy-visual-task-transfer","title":"LLaVA-OneVision: Easy Visual Task Transfer","date":"2024-08-06","rows_on_this_dataset":3,"code_links":2,"syntology":null},{"paper":"/paper/vila-2-vila-augmented-vila","title":"VILA$^2$: VILA Augmented VILA","date":"2024-07-24","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/inf-llava-dual-perspective-perception-for","title":"INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model","date":"2024-07-23","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":4,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mminstruct-a-high-quality-multi-modal","title":"MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity","date":"2024-07-22","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/densefusion-1m-merging-vision-experts-for","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","date":"2024-07-11","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":2,"samples_unverified":2,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/rethinking-visual-prompting-for-multimodal","title":"Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge","date":"2024-07-05","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/internlm-xcomposer-2-5-a-versatile-large","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","date":"2024-07-03","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/tokenpacker-efficient-visual-projector-for","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","date":"2024-07-02","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mm-instruct-generated-visual-instructions-for","title":"MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment","date":"2024-06-28","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/llavolta-efficient-multi-modal-models-via","title":"Efficient Large Multi-modal Models via Visual Context Compression","date":"2024-06-28","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":9,"samples_ran":7,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mg-llava-towards-multi-granularity-visual","title":"MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning","date":"2024-06-25","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/claude-3-5-sonnet-model-card-addendum","title":"Claude 3.5 Sonnet Model Card Addendum","date":"2024-06-24","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/trol-traversal-of-layers-for-large-language","title":"TroL: Traversal of Layers for Large Language and Vision Models","date":"2024-06-18","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":30,"samples_ran":22,"samples_unverified":8,"pointer_only_for_licence":30,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mmdu-a-multi-turn-multi-image-dialog","title":"MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs","date":"2024-06-17","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":7,"samples_unverified":6,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mixture-of-subspaces-in-low-rank-adaptation","title":"Mixture-of-Subspaces in Low-Rank Adaptation","date":"2024-06-16","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":4,"samples_unverified":2,"pointer_only_for_licence":6,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/explore-the-limits-of-omni-modal-pretraining","title":"Explore the Limits of Omni-modal Pretraining at Scale","date":"2024-06-13","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/what-if-we-recaption-billions-of-web-images","title":"What If We Recaption Billions of Web Images with LLaMA-3?","date":"2024-06-12","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/towards-semantic-equivalence-of-tokenization","title":"Towards Semantic Equivalence of Tokenization in Multimodal LLM","date":"2024-06-07","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/robomamba-multimodal-state-space-model-for","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","date":"2024-06-06","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/deepstack-deeply-stacking-visual-tokens-is","title":"DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs","date":"2024-06-06","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/dragonfly-multi-resolution-zoom-supercharges","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","date":"2024-06-03","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/enhancing-large-vision-language-models-with","title":"Enhancing Large Vision Language Models with Self-Training on Image Comprehension","date":"2024-05-30","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":3,"samples_unverified":1,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mmctagent-multi-modal-critical-thinking-agent","title":"MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning","date":"2024-05-28","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/meteor-mamba-based-traversal-of-rationale-for","title":"Meteor: Mamba-based Traversal of Rationale for Large Language and Vision Models","date":"2024-05-24","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":3,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/enhancing-visual-language-modality-alignment","title":"Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement","date":"2024-05-24","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":5,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/convllava-hierarchical-backbones-as-visual","title":"ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models","date":"2024-05-24","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":7,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/lova3-learning-to-visual-question-answering","title":"LOVA3: Learning to Visual Question Answering, Asking and Assessment","date":"2024-05-23","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":7,"samples_unverified":3,"pointer_only_for_licence":10,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/dynamic-mixture-of-experts-an-auto-tuning","title":"Dynamic Mixture of Experts: An Auto-Tuning Approach for Efficient Transformer Models","date":"2024-05-23","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/calibrated-self-rewarding-vision-language","title":"Calibrated Self-Rewarding Vision Language Models","date":"2024-05-23","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/aligngpt-multi-modal-large-language-models","title":"AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability","date":"2024-05-23","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/image-of-thought-prompting-for-visual","title":"Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models","date":"2024-05-22","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/imp-highly-capable-large-multimodal-models","title":"Imp: Highly Capable Large Multimodal Models for Mobile Devices","date":"2024-05-20","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":6,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/uni-moe-scaling-unified-multimodal-llms-with","title":"Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts","date":"2024-05-18","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":6,"samples_unverified":2,"pointer_only_for_licence":8,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/xmodel-vlm-a-simple-baseline-for-multimodal","title":"Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model","date":"2024-05-15","rows_on_this_dataset":1,"code_links":4,"syntology":null},{"paper":"/paper/cumo-scaling-multimodal-llm-with-co-upcycled","title":"CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts","date":"2024-05-09","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":10,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/list-items-one-by-one-a-new-data-source-and","title":"List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs","date":"2024-04-25","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/how-far-are-we-to-gpt-4v-closing-the-gap-to","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","date":"2024-04-25","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/self-supervised-visual-preference-alignment","title":"Self-Supervised Visual Preference Alignment","date":"2024-04-16","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":11,"samples_ran":9,"samples_unverified":2,"pointer_only_for_licence":11,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/ferret-v2-an-improved-baseline-for-referring","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","date":"2024-04-11","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":4,"samples_unverified":1,"pointer_only_for_licence":5,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/omnifusion-technical-report","title":"OmniFusion Technical Report","date":"2024-04-09","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/internlm-xcomposer2-4khd-a-pioneering-large","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","date":"2024-04-09","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/mini-gemini-mining-the-potential-of-multi","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","date":"2024-03-27","rows_on_this_dataset":3,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":7,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/beyond-embeddings-the-promise-of-visual-table","title":"Beyond Embeddings: The Promise of Visual Table in Visual Reasoning","date":"2024-03-27","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":8,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/vl-mamba-exploring-state-space-models-for","title":"VL-Mamba: Exploring State Space Models for Multimodal Learning","date":"2024-03-20","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/hyperllava-dynamic-visual-and-language-expert","title":"HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models","date":"2024-03-20","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/chain-of-spot-interactive-reasoning-improves","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","date":"2024-03-19","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/sq-llava-self-questioning-for-large-vision","title":"SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant","date":"2024-03-17","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":4,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mm1-methods-analysis-insights-from-multimodal","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","date":"2024-03-14","rows_on_this_dataset":3,"code_links":0,"syntology":null},{"paper":"/paper/strengthening-multimodal-large-language-model","title":"Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization","date":"2024-03-13","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/multi-modal-auto-regressive-modeling-via","title":"Multi-modal Auto-regressive Modeling via Visual Words","date":"2024-03-12","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/moai-mixture-of-all-intelligence-for-large","title":"MoAI: Mixture of All Intelligence for Large Language and Vision Models","date":"2024-03-12","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":6,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/a-comprehensive-overhaul-of-multimodal","title":"Mipha: A Comprehensive Overhaul of Multimodal Assistant with Small Language Models","date":"2024-03-10","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/gemini-1-5-unlocking-multimodal-understanding","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","date":"2024-03-08","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/deepseek-vl-towards-real-world-vision","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","date":"2024-03-08","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":11,"samples_ran":7,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/feast-your-eyes-mixture-of-resolution","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","date":"2024-03-05","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":5,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/infimm-hd-a-leap-forward-in-high-resolution","title":"InfiMM-HD: A Leap Forward in High-Resolution Multimodal Understanding","date":"2024-03-03","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/the-all-seeing-project-v2-towards-general","title":"The All-Seeing Project V2: Towards General Relation Comprehension of the Open World","date":"2024-02-29","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":7,"samples_unverified":1,"pointer_only_for_licence":8,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/robocodex-multimodal-code-generation-for","title":"RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis","date":"2024-02-25","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/tinyllava-a-framework-of-small-scale-large","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","date":"2024-02-22","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":5,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/collavo-crayon-large-language-and-vision","title":"CoLLaVO: Crayon Large Language and Vision mOdel","date":"2024-02-17","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":5,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/sphinx-x-scaling-data-and-parameters-for-a","title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","date":"2024-02-08","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/video-lavit-unified-video-language-pre","title":"Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization","date":"2024-02-05","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":3,"samples_unverified":2,"pointer_only_for_licence":5,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/enhancing-multimodal-large-language-models","title":"From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information","date":"2024-01-31","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/mousi-poly-visual-expert-vision-language","title":"MouSi: Poly-Visual-Expert Vision-Language Models","date":"2024-01-30","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/moe-llava-mixture-of-experts-for-large-vision","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","date":"2024-01-29","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":0,"samples_unverified":2,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/internlm-xcomposer2-mastering-free-form-text","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","date":"2024-01-29","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/small-language-model-meets-with-reinforced","title":"Small Language Model Meets with Reinforced Vision Vocabulary","date":"2024-01-23","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/coco-is-all-you-need-for-visual-instruction","title":"COCO is \"ALL'' You Need for Visual Instruction Fine-tuning","date":"2024-01-17","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/camml-context-aware-multimodal-learner-for","title":"CaMML: Context-Aware Multimodal Learner for Large Models","date":"2024-01-06","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/llava-ph-efficient-multi-modal-assistant-with","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","date":"2024-01-04","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":9,"samples_ran":5,"samples_unverified":4,"pointer_only_for_licence":9,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/textit-v-guided-visual-search-as-a-core","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","date":"2023-12-21","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":5,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/generative-multimodal-models-are-in-context","title":"Generative Multimodal Models are In-Context Learners","date":"2023-12-20","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":3,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/gemini-a-family-of-highly-capable-multimodal-1","title":"Gemini: A Family of Highly Capable Multimodal Models","date":"2023-12-19","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/silkie-preference-distillation-for-large","title":"Silkie: Preference Distillation for Large Visual Language Models","date":"2023-12-17","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/cogagent-a-visual-language-model-for-gui","title":"CogAgent: A Visual Language Model for GUI Agents","date":"2023-12-14","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":18,"samples_ran":12,"samples_unverified":6,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/vila-on-pre-training-for-visual-language","title":"VILA: On Pre-training for Visual Language Models","date":"2023-12-12","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/hallucination-augmented-contrastive-learning","title":"Hallucination Augmented Contrastive Learning for Multimodal Large Language Model","date":"2023-12-12","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":3,"samples_unverified":3,"pointer_only_for_licence":5,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/vary-scaling-up-the-vision-vocabulary-for","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","date":"2023-12-11","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/onellm-one-framework-to-align-all-modalities","title":"OneLLM: One Framework to Align All Modalities with Language","date":"2023-12-06","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":4,"samples_unverified":0,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/merlin-empowering-multimodal-llms-with","title":"Merlin:Empowering Multimodal LLMs with Foresight Minds","date":"2023-11-30","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/sharegpt4v-improving-large-multi-modal-models","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","date":"2023-11-21","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/video-llava-learning-united-visual-1","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","date":"2023-11-16","rows_on_this_dataset":1,"code_links":6,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":4,"samples_unverified":3,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/volcano-mitigating-multimodal-hallucination","title":"Volcano: Mitigating Multimodal Hallucination through Self-Feedback Guided Revision","date":"2023-11-13","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":9,"samples_unverified":1,"pointer_only_for_licence":10,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/to-see-is-to-believe-prompting-gpt-4v-for","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","date":"2023-11-13","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/sphinx-the-joint-mixing-of-weights-tasks-and","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","date":"2023-11-13","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/infmllm-a-unified-framework-for-visual","title":"InfMLLM: A Unified Framework for Visual-Language Tasks","date":"2023-11-12","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/llava-plus-learning-to-use-tools-for-creating","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","date":"2023-11-09","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/otterhd-a-high-resolution-multi-modality","title":"OtterHD: A High-Resolution Multi-modality Model","date":"2023-11-07","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":14,"samples_ran":11,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mplug-owl2-revolutionizing-multi-modal-large","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","date":"2023-11-07","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":1,"samples_unverified":2,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/cogvlm-visual-expert-for-pretrained-language","title":"CogVLM: Visual Expert for Pretrained Language Models","date":"2023-11-06","rows_on_this_dataset":2,"code_links":4,"syntology":null},{"paper":"/paper/improved-baselines-with-visual-instruction","title":"Improved Baselines with Visual Instruction Tuning","date":"2023-10-05","rows_on_this_dataset":2,"code_links":9,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":9,"samples_ran":6,"samples_unverified":3,"pointer_only_for_licence":8,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/dreamllm-synergistic-multimodal-comprehension","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","date":"2023-09-20","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/an-empirical-study-of-scaling-instruct-tuned","title":"An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models","date":"2023-09-18","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/textbind-multi-turn-interleaved-multimodal","title":"TextBind: Multi-turn Interleaved Multimodal Instruction-following in the Wild","date":"2023-09-14","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/qwen-vl-a-frontier-large-vision-language","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","date":"2023-08-24","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":0,"samples_unverified":2,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/stablellava-enhanced-visual-instruction","title":"StableLLaVA: Enhanced Visual Instruction Tuning with Synthesized Image-Dialogue Data","date":"2023-08-20","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":6,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/openflamingo-an-open-source-framework-for","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","date":"2023-08-02","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/generative-pretraining-in-multimodality","title":"Emu: Generative Pretraining in Multimodality","date":"2023-07-11","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":0,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/aligning-large-multi-modal-model-with-robust","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","date":"2023-06-26","rows_on_this_dataset":1,"code_links":4,"syntology":null},{"paper":"/paper/mimic-it-multi-modal-in-context-instruction","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","date":"2023-06-08","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/llama-adapter-v2-parameter-efficient-visual","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","date":"2023-04-28","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/minigpt-4-enhancing-vision-language","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","date":"2023-04-20","rows_on_this_dataset":2,"code_links":6,"syntology":null},{"paper":"/paper/mm-react-prompting-chatgpt-for-multimodal","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","date":"2023-03-20","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":0,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/gpt-4-technical-report-1","title":"GPT-4 Technical Report","date":"2023-03-15","rows_on_this_dataset":5,"code_links":11,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":2,"samples_unverified":3,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/blip-2-bootstrapping-language-image-pre","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","date":"2023-01-30","rows_on_this_dataset":1,"code_links":17,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":4,"samples_unverified":4,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":73,"samples_harvested":525,"samples_ran":341,"samples_unverified":184,"pointer_only_for_licence":180,"papers_with_no_sample_that_ran":6,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}