{"url":"/sota/visual-question-answering-on-mm-vet","task":{"name":"Visual Question Answering","url":"/task/visual-question-answering-1","note":null},"dataset":{"name":"MM-Vet","url":"/dataset/mm-vet"},"category":"Computer Vision","categories":["Computer Vision","Natural Language Processing"],"category_note":null,"description":"MLLM Leaderboard","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["GPT-4 score","Params"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"GPT-4 score":"higher","Params":"lower"}},"counts":{"rows":231,"rows_with_code":167,"rows_with_paper_page":223,"rows_dated":223,"rows_using_additional_data":0},"rows":[{"rank_in_archive_order":1,"model":"gemini-2.0-flash-exp","metrics":{"GPT-4 score":"81.2±0.4"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":2,"model":"gemini-exp-1206","metrics":{"GPT-4 score":"78.1±0.2"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":3,"model":"Gemini 1.5 Pro (gemini-1.5-pro-002)","metrics":{"GPT-4 score":"76.9±0.1"},"uses_additional_data":false,"paper_date":"2024-03-08","paper":"/paper/gemini-1-5-unlocking-multimodal-understanding","paper_url":"https://arxiv.org/abs/2403.05530v5","paper_title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","code":"https://github.com/dlvuldet/primevul","n_code_links":1,"syntology":null},{"rank_in_archive_order":4,"model":"MMCTAgent (GPT-4 + GPT-4V)","metrics":{"GPT-4 score":"74.24"},"uses_additional_data":false,"paper_date":"2024-05-28","paper":"/paper/mmctagent-multi-modal-critical-thinking-agent","paper_url":"https://arxiv.org/abs/2405.18358v1","paper_title":"MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":5,"model":"Claude 3.5 Sonnet (claude-3-5-sonnet-20240620)","metrics":{"GPT-4 score":"74.2±0.2"},"uses_additional_data":false,"paper_date":"2024-06-24","paper":"/paper/claude-3-5-sonnet-model-card-addendum","paper_url":"https://www-cdn.anthropic.com/fed9cc193a14b84131812372d8d5857f8f304c52/Model_Card_Claude_3_Addendum.pdf","paper_title":"Claude 3.5 Sonnet Model Card Addendum","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":6,"model":"Qwen2-VL-72B","metrics":{"GPT-4 score":"74.0"},"uses_additional_data":false,"paper_date":"2024-09-18","paper":"/paper/qwen2-vl-enhancing-vision-language-model-s","paper_url":"https://arxiv.org/abs/2409.12191v2","paper_title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","code":"https://github.com/qwenlm/qwen2-vl","n_code_links":8,"syntology":{"n_ran":8,"n_unverified":4,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"InternVL2.5-78B","metrics":{"GPT-4 score":"72.3","Params":"78B"},"uses_additional_data":false,"paper_date":"2024-12-06","paper":"/paper/expanding-performance-boundaries-of-open","paper_url":"https://arxiv.org/abs/2412.05271v4","paper_title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","code":"https://github.com/opengvlab/internvl","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":8,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"GPT-4o +text rationale +IoT","metrics":{"GPT-4 score":"72.2"},"uses_additional_data":false,"paper_date":"2024-05-22","paper":"/paper/image-of-thought-prompting-for-visual","paper_url":"https://arxiv.org/abs/2405.13872v2","paper_title":"Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":9,"model":"Lyra-Pro","metrics":{"GPT-4 score":"71.4","Params":"74B"},"uses_additional_data":false,"paper_date":"2024-12-12","paper":"/paper/lyra-an-efficient-and-speech-centric","paper_url":"https://arxiv.org/abs/2412.09501v1","paper_title":"Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition","code":"https://github.com/dvlab-research/Lyra","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":16,"n_samples":19,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"GLM-4V-Plus","metrics":{"GPT-4 score":"71.1"},"uses_additional_data":false,"paper_date":"2024-08-29","paper":"/paper/cogvlm2-visual-language-models-for-image-and","paper_url":"https://arxiv.org/abs/2408.16500v1","paper_title":"CogVLM2: Visual Language Models for Image and Video Understanding","code":"https://github.com/thudm/glm-4","n_code_links":3,"syntology":{"n_ran":12,"n_unverified":5,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"Phantom-7B","metrics":{"GPT-4 score":"70.8"},"uses_additional_data":false,"paper_date":"2024-09-23","paper":"/paper/phantom-of-latent-for-large-language-and","paper_url":"https://arxiv.org/abs/2409.14713v1","paper_title":"Phantom of Latent for Large Language and Vision Models","code":"https://github.com/byungkwanlee/phantom","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":12,"model":"GPT-4o (gpt-4o-2024-05-13)","metrics":{"GPT-4 score":"69.3±0.1"},"uses_additional_data":false,"paper_date":"2023-03-15","paper":"/paper/gpt-4-technical-report-1","paper_url":"https://arxiv.org/abs/2303.08774v5","paper_title":"GPT-4 Technical Report","code":"https://github.com/openai/evals","n_code_links":11,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":13,"model":"InternVL2.5-38B","metrics":{"GPT-4 score":"68.8","Params":"38B"},"uses_additional_data":false,"paper_date":"2024-12-06","paper":"/paper/expanding-performance-boundaries-of-open","paper_url":"https://arxiv.org/abs/2412.05271v4","paper_title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","code":"https://github.com/opengvlab/internvl","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":8,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":14,"model":"gpt-4o-mini-2024-07-18","metrics":{"GPT-4 score":"68.6±0.1"},"uses_additional_data":false,"paper_date":"2023-03-15","paper":"/paper/gpt-4-technical-report-1","paper_url":"https://arxiv.org/abs/2303.08774v5","paper_title":"GPT-4 Technical Report","code":"https://github.com/openai/evals","n_code_links":11,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":15,"model":"GPT-4V","metrics":{"GPT-4 score":"67.7±0.3"},"uses_additional_data":false,"paper_date":"2023-03-15","paper":"/paper/gpt-4-technical-report-1","paper_url":"https://arxiv.org/abs/2303.08774v5","paper_title":"GPT-4 Technical Report","code":"https://github.com/openai/evals","n_code_links":11,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":16,"model":"GPT-4V-Turbo-detail:high","metrics":{"GPT-4 score":"67.6±0.1"},"uses_additional_data":false,"paper_date":"2023-03-15","paper":"/paper/gpt-4-technical-report-1","paper_url":"https://arxiv.org/abs/2303.08774v5","paper_title":"GPT-4 Technical Report","code":"https://github.com/openai/evals","n_code_links":11,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":17,"model":"Qwen-VL-Max","metrics":{"GPT-4 score":"66.6±0.5"},"uses_additional_data":false,"paper_date":"2023-08-24","paper":"/paper/qwen-vl-a-frontier-large-vision-language","paper_url":"https://arxiv.org/abs/2308.12966v3","paper_title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","code":"https://github.com/qwenlm/qwen-vl","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":18,"model":"Gemini 1.5 Pro (gemini-1.5-pro)","metrics":{"GPT-4 score":"65.8±0.1"},"uses_additional_data":false,"paper_date":"2024-03-08","paper":"/paper/gemini-1-5-unlocking-multimodal-understanding","paper_url":"https://arxiv.org/abs/2403.05530v5","paper_title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","code":"https://github.com/dlvuldet/primevul","n_code_links":1,"syntology":null},{"rank_in_archive_order":19,"model":"InternVL2-26B (SGP, token ratio 64%)","metrics":{"GPT-4 score":"65.60","Params":"26B"},"uses_additional_data":false,"paper_date":"2024-12-04","paper":"/paper/a-stitch-in-time-saves-nine-small-vlm-is-a","paper_url":"https://arxiv.org/abs/2412.03324v2","paper_title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","code":"https://github.com/NUS-HPC-AI-Lab/SGL","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":20,"model":"Baichuan-Omni (7B)","metrics":{"GPT-4 score":"65.4"},"uses_additional_data":false,"paper_date":"2024-10-11","paper":"/paper/baichuan-omni-technical-report","paper_url":"https://arxiv.org/abs/2410.08565v4","paper_title":"Baichuan-Omni Technical Report","code":"https://github.com/westlake-baichuan-mllm/ocean-omni","n_code_links":2,"syntology":null},{"rank_in_archive_order":21,"model":"InternVL2.5-26B","metrics":{"GPT-4 score":"65.0","Params":"26B"},"uses_additional_data":false,"paper_date":"2024-12-06","paper":"/paper/expanding-performance-boundaries-of-open","paper_url":"https://arxiv.org/abs/2412.05271v4","paper_title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","code":"https://github.com/opengvlab/internvl","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":8,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":22,"model":"Qwen2-VL-7B (finetuned on GAP-VQA train)","metrics":{"GPT-4 score":"64.954"},"uses_additional_data":false,"paper_date":"2024-10-05","paper":"/paper/gamified-crowd-sourcing-of-high-quality-data","paper_url":"https://arxiv.org/abs/2410.04038v2","paper_title":"Gamified crowd-sourcing of high-quality data for visual fine-tuning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":23,"model":"InternVL2-Llama3-76B","metrics":{"GPT-4 score":"64.4"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":24,"model":"Gemini 1.0 Pro Vision (gemini-pro-vision)","metrics":{"GPT-4 score":"64.3±0.4"},"uses_additional_data":false,"paper_date":"2023-12-19","paper":"/paper/gemini-a-family-of-highly-capable-multimodal-1","paper_url":"https://arxiv.org/abs/2312.11805v5","paper_title":"Gemini: A Family of Highly Capable Multimodal Models","code":"https://github.com/valdecy/pybibx","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"GLM4 Vision","metrics":{"GPT-4 score":"63.9"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/cogvlm-visual-expert-for-pretrained-language","paper_url":"https://arxiv.org/abs/2311.03079v2","paper_title":"CogVLM: Visual Expert for Pretrained Language Models","code":"https://github.com/thudm/cogvlm","n_code_links":4,"syntology":null},{"rank_in_archive_order":26,"model":"LLaVA-OneVision-72B","metrics":{"GPT-4 score":"63.7"},"uses_additional_data":false,"paper_date":"2024-08-06","paper":"/paper/llava-onevision-easy-visual-task-transfer","paper_url":"https://arxiv.org/abs/2408.03326v3","paper_title":"LLaVA-OneVision: Easy Visual Task Transfer","code":"https://github.com/evolvinglmms-lab/lmms-eval","n_code_links":2,"syntology":null},{"rank_in_archive_order":27,"model":"Lyra-Base","metrics":{"GPT-4 score":"63.5","Params":"9B"},"uses_additional_data":false,"paper_date":"2024-12-12","paper":"/paper/lyra-an-efficient-and-speech-centric","paper_url":"https://arxiv.org/abs/2412.09501v1","paper_title":"Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition","code":"https://github.com/dvlab-research/Lyra","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":16,"n_samples":19,"n_pointer_only_licence":0}},{"rank_in_archive_order":28,"model":"InternVL2-26B (SGP, token ratio 35%)","metrics":{"GPT-4 score":"63.20","Params":"26B"},"uses_additional_data":false,"paper_date":"2024-12-04","paper":"/paper/a-stitch-in-time-saves-nine-small-vlm-is-a","paper_url":"https://arxiv.org/abs/2412.03324v2","paper_title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","code":"https://github.com/NUS-HPC-AI-Lab/SGL","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":29,"model":"InternVL 1.5","metrics":{"GPT-4 score":"62.8","Params":"26B"},"uses_additional_data":false,"paper_date":"2024-04-25","paper":"/paper/how-far-are-we-to-gpt-4v-closing-the-gap-to","paper_url":"https://arxiv.org/abs/2404.16821v2","paper_title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","code":"https://github.com/opengvlab/internvl","n_code_links":1,"syntology":null},{"rank_in_archive_order":30,"model":"InternVL2.5-8B","metrics":{"GPT-4 score":"62.8","Params":"8B"},"uses_additional_data":false,"paper_date":"2024-12-06","paper":"/paper/expanding-performance-boundaries-of-open","paper_url":"https://arxiv.org/abs/2412.05271v4","paper_title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","code":"https://github.com/opengvlab/internvl","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":8,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":31,"model":"MAmmoTH-VL-8B","metrics":{"GPT-4 score":"62.3"},"uses_additional_data":false,"paper_date":"2024-12-06","paper":"/paper/mammoth-vl-eliciting-multimodal-reasoning","paper_url":"https://arxiv.org/abs/2412.05237v1","paper_title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","code":"https://github.com/mammoth-vl/mammoth-vl","n_code_links":1,"syntology":null},{"rank_in_archive_order":32,"model":"Qwen2-VL-7B","metrics":{"GPT-4 score":"62.0"},"uses_additional_data":false,"paper_date":"2024-09-18","paper":"/paper/qwen2-vl-enhancing-vision-language-model-s","paper_url":"https://arxiv.org/abs/2409.12191v2","paper_title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","code":"https://github.com/qwenlm/qwen2-vl","n_code_links":8,"syntology":{"n_ran":8,"n_unverified":4,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":33,"model":"InternVL2-40B","metrics":{"GPT-4 score":"61.8"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":34,"model":"Qwen-VL-Plus","metrics":{"GPT-4 score":"61.1±0.2"},"uses_additional_data":false,"paper_date":"2023-08-24","paper":"/paper/qwen-vl-a-frontier-large-vision-language","paper_url":"https://arxiv.org/abs/2308.12966v3","paper_title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","code":"https://github.com/qwenlm/qwen-vl","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":35,"model":"Mini-Gemini-HD-BS","metrics":{"GPT-4 score":"60.8"},"uses_additional_data":false,"paper_date":"2024-03-27","paper":"/paper/mini-gemini-mining-the-potential-of-multi","paper_url":"https://arxiv.org/abs/2403.18814v1","paper_title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","code":"https://github.com/dvlab-research/MGM","n_code_links":2,"syntology":{"n_ran":7,"n_unverified":1,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":36,"model":"InternVL2.5-2B","metrics":{"GPT-4 score":"60.8","Params":"2B"},"uses_additional_data":false,"paper_date":"2024-12-06","paper":"/paper/expanding-performance-boundaries-of-open","paper_url":"https://arxiv.org/abs/2412.05271v4","paper_title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","code":"https://github.com/opengvlab/internvl","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":8,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":37,"model":"MAmmoTH-VL-8B (SI)","metrics":{"GPT-4 score":"60.6"},"uses_additional_data":false,"paper_date":"2024-12-06","paper":"/paper/mammoth-vl-eliciting-multimodal-reasoning","paper_url":"https://arxiv.org/abs/2412.05237v1","paper_title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","code":"https://github.com/mammoth-vl/mammoth-vl","n_code_links":1,"syntology":null},{"rank_in_archive_order":38,"model":"InternVL2.5-4B","metrics":{"GPT-4 score":"60.6","Params":"4B"},"uses_additional_data":false,"paper_date":"2024-12-06","paper":"/paper/expanding-performance-boundaries-of-open","paper_url":"https://arxiv.org/abs/2412.05271v4","paper_title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","code":"https://github.com/opengvlab/internvl","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":8,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":39,"model":"GPT-4V-Turbo-detail:low","metrics":{"GPT-4 score":"60.2±0.3"},"uses_additional_data":false,"paper_date":"2023-03-15","paper":"/paper/gpt-4-technical-report-1","paper_url":"https://arxiv.org/abs/2303.08774v5","paper_title":"GPT-4 Technical Report","code":"https://github.com/openai/evals","n_code_links":11,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":40,"model":"Mini-Gemini-HD","metrics":{"GPT-4 score":"59.3"},"uses_additional_data":false,"paper_date":"2024-03-27","paper":"/paper/mini-gemini-mining-the-potential-of-multi","paper_url":"https://arxiv.org/abs/2403.18814v1","paper_title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","code":"https://github.com/dvlab-research/MGM","n_code_links":2,"syntology":{"n_ran":7,"n_unverified":1,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":41,"model":"Claude 3 Opus (claude-3-opus-20240229)","metrics":{"GPT-4 score":"58.1±0.1"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":42,"model":"GLM-4V-9B","metrics":{"GPT-4 score":"58.0"},"uses_additional_data":false,"paper_date":"2024-08-29","paper":"/paper/cogvlm2-visual-language-models-for-image-and","paper_url":"https://arxiv.org/abs/2408.16500v1","paper_title":"CogVLM2: Visual Language Models for Image and Video Understanding","code":"https://github.com/thudm/glm-4","n_code_links":3,"syntology":{"n_ran":12,"n_unverified":5,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":43,"model":"LLaVA-OneVision-7B","metrics":{"GPT-4 score":"57.5"},"uses_additional_data":false,"paper_date":"2024-08-06","paper":"/paper/llava-onevision-easy-visual-task-transfer","paper_url":"https://arxiv.org/abs/2408.03326v3","paper_title":"LLaVA-OneVision: Easy Visual Task Transfer","code":"https://github.com/evolvinglmms-lab/lmms-eval","n_code_links":2,"syntology":null},{"rank_in_archive_order":44,"model":"LLaVA-NeXT-34B","metrics":{"GPT-4 score":"57.4","Params":"34B"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":45,"model":"Meteor","metrics":{"GPT-4 score":"57.3","Params":"7B"},"uses_additional_data":false,"paper_date":"2024-05-24","paper":"/paper/meteor-mamba-based-traversal-of-rationale-for","paper_url":"https://arxiv.org/abs/2405.15574v4","paper_title":"Meteor: Mamba-based Traversal of Rationale for Large Language and Vision Models","code":"https://github.com/byungkwanlee/meteor","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":5,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":46,"model":"CROME (Vicuna-13B)","metrics":{"GPT-4 score":"55.1"},"uses_additional_data":false,"paper_date":"2024-08-13","paper":"/paper/crome-cross-modal-adapters-for-efficient","paper_url":"https://arxiv.org/abs/2408.06610v1","paper_title":"CROME: Cross-Modal Adapters for Efficient Multimodal LLM","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":47,"model":"IXC2-4KHD","metrics":{"GPT-4 score":"54.9"},"uses_additional_data":false,"paper_date":"2024-04-09","paper":"/paper/internlm-xcomposer2-4khd-a-pioneering-large","paper_url":"https://arxiv.org/abs/2404.06512v1","paper_title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","code":"https://github.com/internlm/internlm-xcomposer","n_code_links":2,"syntology":null},{"rank_in_archive_order":48,"model":"Weitu-VL-1.0","metrics":{"GPT-4 score":"54.7","Params":"15B"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":49,"model":"TroL-7B","metrics":{"GPT-4 score":"54.7","Params":"7B"},"uses_additional_data":false,"paper_date":"2024-06-18","paper":"/paper/trol-traversal-of-layers-for-large-language","paper_url":"https://arxiv.org/abs/2406.12246v3","paper_title":"TroL: Traversal of Layers for Large Language and Vision Models","code":"https://github.com/byungkwanlee/trol","n_code_links":1,"syntology":{"n_ran":22,"n_unverified":8,"n_samples":30,"n_pointer_only_licence":30}},{"rank_in_archive_order":50,"model":"Mini-Gemini","metrics":{"GPT-4 score":"53.0"},"uses_additional_data":false,"paper_date":"2024-03-27","paper":"/paper/mini-gemini-mining-the-potential-of-multi","paper_url":"https://arxiv.org/abs/2403.18814v1","paper_title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","code":"https://github.com/dvlab-research/MGM","n_code_links":2,"syntology":{"n_ran":7,"n_unverified":1,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":51,"model":"CogVLM(Vicuna-7B)","metrics":{"GPT-4 score":"52.8","Params":"17B"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/cogvlm-visual-expert-for-pretrained-language","paper_url":"https://arxiv.org/abs/2311.03079v2","paper_title":"CogVLM: Visual Expert for Pretrained Language Models","code":"https://github.com/thudm/cogvlm","n_code_links":4,"syntology":null},{"rank_in_archive_order":52,"model":"CogAgent","metrics":{"GPT-4 score":"52.8","Params":"18B"},"uses_additional_data":false,"paper_date":"2023-12-14","paper":"/paper/cogagent-a-visual-language-model-for-gui","paper_url":"https://arxiv.org/abs/2312.08914v3","paper_title":"CogAgent: A Visual Language Model for GUI Agents","code":"https://github.com/thudm/cogvlm","n_code_links":3,"syntology":{"n_ran":12,"n_unverified":6,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":53,"model":"Qwen2-VL-2B (finetuned on GAP-VQA train)","metrics":{"GPT-4 score":"52.43"},"uses_additional_data":false,"paper_date":"2024-10-05","paper":"/paper/gamified-crowd-sourcing-of-high-quality-data","paper_url":"https://arxiv.org/abs/2410.04038v2","paper_title":"Gamified crowd-sourcing of high-quality data for visual fine-tuning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":54,"model":"InternVL2-26B (SGP, token ratio 9%)","metrics":{"GPT-4 score":"52.10","Params":"26B"},"uses_additional_data":false,"paper_date":"2024-12-04","paper":"/paper/a-stitch-in-time-saves-nine-small-vlm-is-a","paper_url":"https://arxiv.org/abs/2412.03324v2","paper_title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","code":"https://github.com/NUS-HPC-AI-Lab/SGL","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":55,"model":"MM1.5-30B","metrics":{"GPT-4 score":"52.0"},"uses_additional_data":false,"paper_date":"2024-09-30","paper":"/paper/mm1-5-methods-analysis-insights-from","paper_url":"https://arxiv.org/abs/2409.20566v1","paper_title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":56,"model":"MiniCPM-Llama3-V-2.5-8B (finetuned on GAP-VQA train)","metrics":{"GPT-4 score":"51.789"},"uses_additional_data":false,"paper_date":"2024-10-05","paper":"/paper/gamified-crowd-sourcing-of-high-quality-data","paper_url":"https://arxiv.org/abs/2410.04038v2","paper_title":"Gamified crowd-sourcing of high-quality data for visual fine-tuning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":57,"model":"IXC-2.5-7B","metrics":{"GPT-4 score":"51.7"},"uses_additional_data":false,"paper_date":"2024-07-03","paper":"/paper/internlm-xcomposer-2-5-a-versatile-large","paper_url":"https://arxiv.org/abs/2407.03320v1","paper_title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","code":"https://github.com/internlm/internlm-xcomposer","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":58,"model":"InternLM-XComposer2","metrics":{"GPT-4 score":"51.2"},"uses_additional_data":false,"paper_date":"2024-01-29","paper":"/paper/internlm-xcomposer2-mastering-free-form-text","paper_url":"https://arxiv.org/abs/2401.16420v1","paper_title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","code":"https://github.com/internlm/internlm-xcomposer","n_code_links":1,"syntology":null},{"rank_in_archive_order":59,"model":"Lyra-Mini","metrics":{"GPT-4 score":"51.2","Params":"3B"},"uses_additional_data":false,"paper_date":"2024-12-12","paper":"/paper/lyra-an-efficient-and-speech-centric","paper_url":"https://arxiv.org/abs/2412.09501v1","paper_title":"Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition","code":"https://github.com/dvlab-research/Lyra","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":16,"n_samples":19,"n_pointer_only_licence":0}},{"rank_in_archive_order":60,"model":"CuMo-7B","metrics":{"GPT-4 score":"51.0","Params":"7B"},"uses_additional_data":false,"paper_date":"2024-05-09","paper":"/paper/cumo-scaling-multimodal-llm-with-co-upcycled","paper_url":"https://arxiv.org/abs/2405.05949v1","paper_title":"CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts","code":"https://github.com/shi-labs/cumo","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":2,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":61,"model":"TACO (Qwen2-7B / SigLIP)","metrics":{"GPT-4 score":"50.9"},"uses_additional_data":false,"paper_date":"2024-12-07","paper":"/paper/taco-learning-multi-modal-action-models-with","paper_url":"https://arxiv.org/abs/2412.05479v2","paper_title":"TACO: Learning Multi-modal Action Models with Synthetic Chains-of-Thought-and-Action","code":"https://github.com/salesforceairesearch/taco","n_code_links":1,"syntology":null},{"rank_in_archive_order":62,"model":"Qwen-VL-Chat (+ SFT (GPT-4V in VLFeedback))","metrics":{"GPT-4 score":"50.7"},"uses_additional_data":false,"paper_date":"2024-10-12","paper":"/paper/vlfeedback-a-large-scale-ai-feedback-dataset","paper_url":"https://arxiv.org/abs/2410.09421v2","paper_title":"VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment","code":null,"n_code_links":0,"syntology":{"n_ran":5,"n_unverified":2,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":63,"model":"POINTS-9B","metrics":{"GPT-4 score":"50.0"},"uses_additional_data":false,"paper_date":"2024-09-07","paper":"/paper/points-improving-your-vision-language-model","paper_url":"https://arxiv.org/abs/2409.04828v3","paper_title":"POINTS: Improving Your Vision-language Model with Affordable Strategies","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":64,"model":"VILA^2-8B","metrics":{"GPT-4 score":"50.0"},"uses_additional_data":false,"paper_date":"2024-07-24","paper":"/paper/vila-2-vila-augmented-vila","paper_url":"https://arxiv.org/abs/2407.17453v2","paper_title":"VILA$^2$: VILA Augmented VILA","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":65,"model":"Janus-Pro-7B","metrics":{"GPT-4 score":"50.0"},"uses_additional_data":false,"paper_date":"2025-01-29","paper":"/paper/janus-pro-unified-multimodal-understanding","paper_url":"https://arxiv.org/abs/2501.17811v1","paper_title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","code":"https://github.com/deepseek-ai/janus","n_code_links":1,"syntology":null},{"rank_in_archive_order":66,"model":"Silkie","metrics":{"GPT-4 score":"49.9","Params":"7B"},"uses_additional_data":false,"paper_date":"2023-12-17","paper":"/paper/silkie-preference-distillation-for-large","paper_url":"https://arxiv.org/abs/2312.10665v1","paper_title":"Silkie: Preference Distillation for Large Visual Language Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":67,"model":"Silkie (Qwen-VL-Chat + DPO w/ VLFeedback)","metrics":{"GPT-4 score":"49.9"},"uses_additional_data":false,"paper_date":"2024-10-12","paper":"/paper/vlfeedback-a-large-scale-ai-feedback-dataset","paper_url":"https://arxiv.org/abs/2410.09421v2","paper_title":"VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment","code":null,"n_code_links":0,"syntology":{"n_ran":5,"n_unverified":2,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":68,"model":"Qwen2-VL-2B","metrics":{"GPT-4 score":"49.5"},"uses_additional_data":false,"paper_date":"2024-09-18","paper":"/paper/qwen2-vl-enhancing-vision-language-model-s","paper_url":"https://arxiv.org/abs/2409.12191v2","paper_title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","code":"https://github.com/qwenlm/qwen2-vl","n_code_links":8,"syntology":{"n_ran":8,"n_unverified":4,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":69,"model":"FlashSloth-HD","metrics":{"GPT-4 score":"49.0","Params":"3.2B"},"uses_additional_data":false,"paper_date":"2024-12-05","paper":"/paper/flashsloth-lightning-multimodal-large","paper_url":"https://arxiv.org/abs/2412.04317v1","paper_title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","code":"https://github.com/codefanw/flashsloth","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":0,"n_samples":7,"n_pointer_only_licence":7}},{"rank_in_archive_order":70,"model":"InternVL 1.2","metrics":{"GPT-4 score":"48.9","Params":"40B"},"uses_additional_data":false,"paper_date":"2024-04-25","paper":"/paper/how-far-are-we-to-gpt-4v-closing-the-gap-to","paper_url":"https://arxiv.org/abs/2404.16821v2","paper_title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","code":"https://github.com/opengvlab/internvl","n_code_links":1,"syntology":null},{"rank_in_archive_order":71,"model":"SEA-PRIME (Vicuna-13B)","metrics":{"GPT-4 score":"48.8"},"uses_additional_data":false,"paper_date":"2024-08-21","paper":"/paper/sea-supervised-embedding-alignment-for-token","paper_url":"https://arxiv.org/abs/2408.11813v1","paper_title":"SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMs","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":72,"model":"InternVL2.5-1B","metrics":{"GPT-4 score":"48.8","Params":"1B"},"uses_additional_data":false,"paper_date":"2024-12-06","paper":"/paper/expanding-performance-boundaries-of-open","paper_url":"https://arxiv.org/abs/2412.05271v4","paper_title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","code":"https://github.com/opengvlab/internvl","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":8,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":73,"model":"MM1-30B-Chat","metrics":{"GPT-4 score":"48.7"},"uses_additional_data":false,"paper_date":"2024-03-14","paper":"/paper/mm1-methods-analysis-insights-from-multimodal","paper_url":"https://arxiv.org/abs/2403.09611v4","paper_title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":74,"model":"SETOKIM (13B)","metrics":{"GPT-4 score":"48.7","Params":"13B"},"uses_additional_data":false,"paper_date":"2024-06-07","paper":"/paper/towards-semantic-equivalence-of-tokenization","paper_url":"https://arxiv.org/abs/2406.05127v3","paper_title":"Towards Semantic Equivalence of Tokenization in Multimodal LLM","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":75,"model":"Emu2-Chat","metrics":{"GPT-4 score":"48.5","Params":"37B"},"uses_additional_data":false,"paper_date":"2023-12-20","paper":"/paper/generative-multimodal-models-are-in-context","paper_url":"https://arxiv.org/abs/2312.13286v2","paper_title":"Generative Multimodal Models are In-Context Learners","code":"https://github.com/baaivision/emu","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":76,"model":"MG-LLaVA(34B)","metrics":{"GPT-4 score":"48.5"},"uses_additional_data":false,"paper_date":"2024-06-25","paper":"/paper/mg-llava-towards-multi-granularity-visual","paper_url":"https://arxiv.org/abs/2406.17770v2","paper_title":"MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning","code":"https://github.com/phoenixz810/mg-llava","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":77,"model":"SPHINX-Plus","metrics":{"GPT-4 score":"47.9"},"uses_additional_data":false,"paper_date":"2024-02-08","paper":"/paper/sphinx-x-scaling-data-and-parameters-for-a","paper_url":"https://arxiv.org/abs/2402.05935v2","paper_title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","code":"https://github.com/alpha-vllm/llama2-accessory","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":78,"model":"ConvLLaVA","metrics":{"GPT-4 score":"45.9","Params":"7B"},"uses_additional_data":false,"paper_date":"2024-05-24","paper":"/paper/convllava-hierarchical-backbones-as-visual","paper_url":"https://arxiv.org/abs/2405.15738v1","paper_title":"ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models","code":"https://github.com/alibaba/conv-llava","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":3,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":79,"model":"VILA-13B","metrics":{"GPT-4 score":"45.7"},"uses_additional_data":false,"paper_date":"2023-12-12","paper":"/paper/vila-on-pre-training-for-visual-language","paper_url":"https://arxiv.org/abs/2312.07533v4","paper_title":"VILA: On Pre-training for Visual Language Models","code":"https://github.com/efficient-large-model/vila","n_code_links":3,"syntology":null},{"rank_in_archive_order":80,"model":"TACO (LLaMA3-8B / SigLIP)","metrics":{"GPT-4 score":"45.7"},"uses_additional_data":false,"paper_date":"2024-12-07","paper":"/paper/taco-learning-multi-modal-action-models-with","paper_url":"https://arxiv.org/abs/2412.05479v2","paper_title":"TACO: Learning Multi-modal Action Models with Synthetic Chains-of-Thought-and-Action","code":"https://github.com/salesforceairesearch/taco","n_code_links":1,"syntology":null},{"rank_in_archive_order":81,"model":"HPT 1.5 Edge","metrics":{"GPT-4 score":"45.3"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":82,"model":"TACO (LLaMA3-8B / CLIP)","metrics":{"GPT-4 score":"45.2"},"uses_additional_data":false,"paper_date":"2024-12-07","paper":"/paper/taco-learning-multi-modal-action-models-with","paper_url":"https://arxiv.org/abs/2412.05479v2","paper_title":"TACO: Learning Multi-modal Action Models with Synthetic Chains-of-Thought-and-Action","code":"https://github.com/salesforceairesearch/taco","n_code_links":1,"syntology":null},{"rank_in_archive_order":83,"model":"LLaVA-v1.6 (7B, w/ STIC)","metrics":{"GPT-4 score":"45.0","Params":"7B"},"uses_additional_data":false,"paper_date":"2024-05-30","paper":"/paper/enhancing-large-vision-language-models-with","paper_url":"https://arxiv.org/abs/2405.19716v2","paper_title":"Enhancing Large Vision Language Models with Self-Training on Image Comprehension","code":"https://github.com/yihedeng9/stic","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":1}},{"rank_in_archive_order":84,"model":"H2OVL-Mississippi-2B","metrics":{"GPT-4 score":"44.7"},"uses_additional_data":false,"paper_date":"2024-10-17","paper":"/paper/h2ovl-mississippi-vision-language-models","paper_url":"https://arxiv.org/abs/2410.13611v1","paper_title":"H2OVL-Mississippi Vision Language Models Technical Report","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":85,"model":"PIIP-LLaVA (Vicuna-7B, ConvNeXt-L, CLIP-L )","metrics":{"GPT-4 score":"44.7","Params":"7B"},"uses_additional_data":false,"paper_date":"2025-01-14","paper":"/paper/parameter-inverted-image-pyramid-networks-for","paper_url":"https://arxiv.org/abs/2501.07783v1","paper_title":"Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding","code":"https://github.com/opengvlab/piip","n_code_links":1,"syntology":null},{"rank_in_archive_order":86,"model":"MM-ReAct-GPT-4","metrics":{"GPT-4 score":"44.6±0.2"},"uses_additional_data":false,"paper_date":"2023-03-20","paper":"/paper/mm-react-prompting-chatgpt-for-multimodal","paper_url":"https://arxiv.org/abs/2303.11381v1","paper_title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","code":"https://github.com/microsoft/MM-REACT","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":87,"model":"Imp-4B","metrics":{"GPT-4 score":"44.6","Params":"4B"},"uses_additional_data":false,"paper_date":"2024-05-20","paper":"/paper/imp-highly-capable-large-multimodal-models","paper_url":"https://arxiv.org/abs/2405.12107v2","paper_title":"Imp: Highly Capable Large Multimodal Models for Mobile Devices","code":"https://github.com/milvlg/imp","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":88,"model":"LLaVA-Next-Mistral-7b (+ DPO w/ VLFeedback)","metrics":{"GPT-4 score":"44.2"},"uses_additional_data":false,"paper_date":"2024-10-12","paper":"/paper/vlfeedback-a-large-scale-ai-feedback-dataset","paper_url":"https://arxiv.org/abs/2410.09421v2","paper_title":"VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment","code":null,"n_code_links":0,"syntology":{"n_ran":5,"n_unverified":2,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":89,"model":"MGM-7B+RP","metrics":{"GPT-4 score":"44.1"},"uses_additional_data":false,"paper_date":"2024-08-08","paper":"/paper/img-diff-contrastive-data-synthesis-for","paper_url":"https://arxiv.org/abs/2408.04594v3","paper_title":"Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":90,"model":"LLaVA-Next-Vicuna-7b (+ DPO w/ VLFeedback)","metrics":{"GPT-4 score":"44.1"},"uses_additional_data":false,"paper_date":"2024-10-12","paper":"/paper/vlfeedback-a-large-scale-ai-feedback-dataset","paper_url":"https://arxiv.org/abs/2410.09421v2","paper_title":"VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment","code":null,"n_code_links":0,"syntology":{"n_ran":5,"n_unverified":2,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":91,"model":"VW-LMM","metrics":{"GPT-4 score":"44.0"},"uses_additional_data":false,"paper_date":"2024-03-12","paper":"/paper/multi-modal-auto-regressive-modeling-via","paper_url":"https://arxiv.org/abs/2403.07720v2","paper_title":"Multi-modal Auto-regressive Modeling via Visual Words","code":"https://github.com/pengts/vw-lmm","n_code_links":1,"syntology":null},{"rank_in_archive_order":92,"model":"MoAI","metrics":{"GPT-4 score":"43.7","Params":"7B"},"uses_additional_data":false,"paper_date":"2024-03-12","paper":"/paper/moai-mixture-of-all-intelligence-for-large","paper_url":"https://arxiv.org/abs/2403.07508v3","paper_title":"MoAI: Mixture of All Intelligence for Large Language and Vision Models","code":"https://github.com/ByungKwanLee/MoAI","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":93,"model":"MM1-3B-Chat","metrics":{"GPT-4 score":"43.7"},"uses_additional_data":false,"paper_date":"2024-03-14","paper":"/paper/mm1-methods-analysis-insights-from-multimodal","paper_url":"https://arxiv.org/abs/2403.09611v4","paper_title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":94,"model":"MM1.5-3B-MoE","metrics":{"GPT-4 score":"43.7"},"uses_additional_data":false,"paper_date":"2024-09-30","paper":"/paper/mm1-5-methods-analysis-insights-from","paper_url":"https://arxiv.org/abs/2409.20566v1","paper_title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":95,"model":"Imp-3B","metrics":{"GPT-4 score":"43.3","Params":"3B"},"uses_additional_data":false,"paper_date":"2024-05-20","paper":"/paper/imp-highly-capable-large-multimodal-models","paper_url":"https://arxiv.org/abs/2405.12107v2","paper_title":"Imp: Highly Capable Large Multimodal Models for Mobile Devices","code":"https://github.com/milvlg/imp","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":96,"model":"ShareGPT4V-13B","metrics":{"GPT-4 score":"43.1","Params":"13B"},"uses_additional_data":false,"paper_date":"2023-11-21","paper":"/paper/sharegpt4v-improving-large-multi-modal-models","paper_url":"https://arxiv.org/abs/2311.12793v2","paper_title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","code":"https://github.com/InternLM/InternLM-XComposer/tree/main/projects/ShareGPT4V","n_code_links":1,"syntology":null},{"rank_in_archive_order":97,"model":"Mini-Gemini (+MoCa)","metrics":{"GPT-4 score":"42.9"},"uses_additional_data":false,"paper_date":"2024-10-09","paper":"/paper/deciphering-cross-modal-alignment-in-large","paper_url":"https://arxiv.org/abs/2410.07167v2","paper_title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","code":"https://github.com/shikiw/modality-integration-rate","n_code_links":1,"syntology":{"n_ran":12,"n_unverified":0,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":98,"model":"MM1.5-7B","metrics":{"GPT-4 score":"42.2"},"uses_additional_data":false,"paper_date":"2024-09-30","paper":"/paper/mm1-5-methods-analysis-insights-from","paper_url":"https://arxiv.org/abs/2409.20566v1","paper_title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":99,"model":"MM1-7B-Chat","metrics":{"GPT-4 score":"42.1"},"uses_additional_data":false,"paper_date":"2024-03-14","paper":"/paper/mm1-methods-analysis-insights-from-multimodal","paper_url":"https://arxiv.org/abs/2403.09611v4","paper_title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":100,"model":"FlashSloth","metrics":{"GPT-4 score":"41.9","Params":"3.2B"},"uses_additional_data":false,"paper_date":"2024-12-05","paper":"/paper/flashsloth-lightning-multimodal-large","paper_url":"https://arxiv.org/abs/2412.04317v1","paper_title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","code":"https://github.com/codefanw/flashsloth","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":0,"n_samples":7,"n_pointer_only_licence":7}},{"rank_in_archive_order":101,"model":"DeepSeek-VL","metrics":{"GPT-4 score":"41.5"},"uses_additional_data":false,"paper_date":"2024-03-08","paper":"/paper/deepseek-vl-towards-real-world-vision","paper_url":"https://arxiv.org/abs/2403.05525v2","paper_title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","code":"https://github.com/deepseek-ai/deepseek-vl","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":4,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":102,"model":"LaVA1.5-13B-BPO","metrics":{"GPT-4 score":"41.4","Params":"13B"},"uses_additional_data":false,"paper_date":"2024-03-13","paper":"/paper/strengthening-multimodal-large-language-model","paper_url":"https://arxiv.org/abs/2403.08730v2","paper_title":"Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":103,"model":"ASMv2","metrics":{"GPT-4 score":"41.3"},"uses_additional_data":false,"paper_date":"2024-02-29","paper":"/paper/the-all-seeing-project-v2-towards-general","paper_url":"https://arxiv.org/abs/2402.19474v4","paper_title":"The All-Seeing Project V2: Towards General Relation Comprehension of the Open World","code":"https://github.com/opengvlab/all-seeing","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":1,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":104,"model":"FocusLLaVA","metrics":{"GPT-4 score":"41.3"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/focusllava-a-coarse-to-fine-approach-for","paper_url":"https://arxiv.org/abs/2411.14228v1","paper_title":"FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":105,"model":"SeVa-13B","metrics":{"GPT-4 score":"41.0"},"uses_additional_data":false,"paper_date":"2024-04-16","paper":"/paper/self-supervised-visual-preference-alignment","paper_url":"https://arxiv.org/abs/2404.10501v2","paper_title":"Self-Supervised Visual Preference Alignment","code":"https://github.com/Kevinz-code/SeVa","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":11}},{"rank_in_archive_order":106,"model":"MM1.5-3B","metrics":{"GPT-4 score":"41.0"},"uses_additional_data":false,"paper_date":"2024-09-30","paper":"/paper/mm1-5-methods-analysis-insights-from","paper_url":"https://arxiv.org/abs/2409.20566v1","paper_title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":107,"model":"LLaVA-1.5-7B (VG-S)","metrics":{"GPT-4 score":"40.4"},"uses_additional_data":false,"paper_date":"2024-12-09","paper":"/paper/provision-programmatically-scaling-vision","paper_url":"https://arxiv.org/abs/2412.07012v3","paper_title":"ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models","code":"https://github.com/jieyuz2/provision","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":15,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":108,"model":"CoLLaVO","metrics":{"GPT-4 score":"40.3","Params":"7B"},"uses_additional_data":false,"paper_date":"2024-02-17","paper":"/paper/collavo-crayon-large-language-and-vision","paper_url":"https://arxiv.org/abs/2402.11248v4","paper_title":"CoLLaVO: Crayon Large Language and Vision mOdel","code":"https://github.com/ByungKwanLee/CoLLaVO","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":1,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":109,"model":"SPHINX-2k","metrics":{"GPT-4 score":"40.2"},"uses_additional_data":false,"paper_date":"2023-11-13","paper":"/paper/sphinx-the-joint-mixing-of-weights-tasks-and","paper_url":"https://arxiv.org/abs/2311.07575v1","paper_title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","code":"https://github.com/alpha-vllm/llama2-accessory","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":110,"model":"LLaVA-1.5 (LVIS-Instrcut4V)","metrics":{"GPT-4 score":"40.2","Params":"13B"},"uses_additional_data":false,"paper_date":"2023-11-13","paper":"/paper/to-see-is-to-believe-prompting-gpt-4v-for","paper_url":"https://arxiv.org/abs/2311.07574v2","paper_title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","code":"https://github.com/h-zhao1997/cobra","n_code_links":2,"syntology":null},{"rank_in_archive_order":111,"model":"mPLUG-Owl3","metrics":{"GPT-4 score":"40.1"},"uses_additional_data":false,"paper_date":"2024-08-09","paper":"/paper/mplug-owl3-towards-long-image-sequence","paper_url":"https://arxiv.org/abs/2408.04840v2","paper_title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","code":"https://github.com/x-plug/mplug-owl","n_code_links":1,"syntology":null},{"rank_in_archive_order":112,"model":"Mono-InternVL-2B","metrics":{"GPT-4 score":"40.1","Params":"2B"},"uses_additional_data":false,"paper_date":"2024-10-10","paper":"/paper/mono-internvl-pushing-the-boundaries-of","paper_url":"https://arxiv.org/abs/2410.08202v2","paper_title":"Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":113,"model":"LLaVA1.5-13B-MDA","metrics":{"GPT-4 score":"39.90","Params":"13B"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/looking-beyond-text-reducing-language-bias-in","paper_url":"https://arxiv.org/abs/2411.14279v1","paper_title":"Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":114,"model":"LLaVA-VT (Vicuna-13B)","metrics":{"GPT-4 score":"39.8"},"uses_additional_data":false,"paper_date":"2024-03-27","paper":"/paper/beyond-embeddings-the-promise-of-visual-table","paper_url":"https://arxiv.org/abs/2403.18252v2","paper_title":"Beyond Embeddings: The Promise of Visual Table in Visual Reasoning","code":"https://github.com/lavi-lab/visual-table","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":0,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":115,"model":"MM1.5-1B-MoE","metrics":{"GPT-4 score":"39.8"},"uses_additional_data":false,"paper_date":"2024-09-30","paper":"/paper/mm1-5-methods-analysis-insights-from","paper_url":"https://arxiv.org/abs/2409.20566v1","paper_title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":116,"model":"Janus-Pro-1B","metrics":{"GPT-4 score":"39.8"},"uses_additional_data":false,"paper_date":"2025-01-29","paper":"/paper/janus-pro-unified-multimodal-understanding","paper_url":"https://arxiv.org/abs/2501.17811v1","paper_title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","code":"https://github.com/deepseek-ai/janus","n_code_links":1,"syntology":null},{"rank_in_archive_order":117,"model":"SQ-LLaVA∗","metrics":{"GPT-4 score":"39.7"},"uses_additional_data":false,"paper_date":"2024-03-17","paper":"/paper/sq-llava-self-questioning-for-large-vision","paper_url":"https://arxiv.org/abs/2403.11299v2","paper_title":"SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant","code":"https://github.com/heliossun/sq-llava","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":118,"model":"OmniFusion (grid split + ruDocVQA)","metrics":{"GPT-4 score":"39.40"},"uses_additional_data":false,"paper_date":"2024-04-09","paper":"/paper/omnifusion-technical-report","paper_url":"https://arxiv.org/abs/2404.06212v1","paper_title":"OmniFusion Technical Report","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":119,"model":"DeepStack-L-HD (Vicuna-13B)","metrics":{"GPT-4 score":"39.3"},"uses_additional_data":false,"paper_date":"2024-06-06","paper":"/paper/deepstack-deeply-stacking-visual-tokens-is","paper_url":"https://arxiv.org/abs/2406.04334v1","paper_title":"DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":120,"model":"LAF-13B","metrics":{"GPT-4 score":"38.9"},"uses_additional_data":false,"paper_date":"2024-01-31","paper":"/paper/enhancing-multimodal-large-language-models","paper_url":"https://arxiv.org/abs/2401.17981v3","paper_title":"From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":121,"model":"InfiMM-HD","metrics":{"GPT-4 score":"38.9"},"uses_additional_data":false,"paper_date":"2024-03-03","paper":"/paper/infimm-hd-a-leap-forward-in-high-resolution","paper_url":"https://arxiv.org/abs/2403.01487v1","paper_title":"InfiMM-HD: A Leap Forward in High-Resolution Multimodal Understanding","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":122,"model":"InternLM-XC2 + MMDU-45k","metrics":{"GPT-4 score":"38.8"},"uses_additional_data":false,"paper_date":"2024-06-17","paper":"/paper/mmdu-a-multi-turn-multi-image-dialog","paper_url":"https://arxiv.org/abs/2406.11833v2","paper_title":"MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs","code":"https://github.com/liuziyu77/mmdu","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":6,"n_samples":13,"n_pointer_only_licence":4}},{"rank_in_archive_order":123,"model":"LLaVA-1.5-7B (DC-S)","metrics":{"GPT-4 score":"38.5"},"uses_additional_data":false,"paper_date":"2024-12-09","paper":"/paper/provision-programmatically-scaling-vision","paper_url":"https://arxiv.org/abs/2412.07012v3","paper_title":"ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models","code":"https://github.com/jieyuz2/provision","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":15,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":124,"model":"LayoutLMv3+ConvNeXt+CLIP","metrics":{"GPT-4 score":"38.4","Params":"7.9B"},"uses_additional_data":false,"paper_date":"2024-01-30","paper":"/paper/mousi-poly-visual-expert-vision-language","paper_url":"https://arxiv.org/abs/2401.17221v1","paper_title":"MouSi: Poly-Visual-Expert Vision-Language Models","code":"https://github.com/fudannlplab/mousi","n_code_links":1,"syntology":null},{"rank_in_archive_order":125,"model":"VOLCANO 13B","metrics":{"GPT-4 score":"38.0","Params":"13B"},"uses_additional_data":false,"paper_date":"2023-11-13","paper":"/paper/volcano-mitigating-multimodal-hallucination","paper_url":"https://arxiv.org/abs/2311.07362v4","paper_title":"Volcano: Mitigating Multimodal Hallucination through Self-Feedback Guided Revision","code":"https://github.com/kaistai/volcano","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":1,"n_samples":10,"n_pointer_only_licence":10}},{"rank_in_archive_order":126,"model":"LLaVA-1.5+MMInstruct (Vicuna-13B)","metrics":{"GPT-4 score":"37.9"},"uses_additional_data":false,"paper_date":"2024-07-22","paper":"/paper/mminstruct-a-high-quality-multi-modal","paper_url":"https://arxiv.org/abs/2407.15838v2","paper_title":"MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity","code":"https://github.com/yuecao0119/mminstruct","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":127,"model":"LLaVA-1.5-13B (+CSR)","metrics":{"GPT-4 score":"37.8","Params":"13B"},"uses_additional_data":false,"paper_date":"2024-05-23","paper":"/paper/calibrated-self-rewarding-vision-language","paper_url":"https://arxiv.org/abs/2405.14622v4","paper_title":"Calibrated Self-Rewarding Vision Language Models","code":"https://github.com/yiyangzhou/csr","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":128,"model":"LLaVA-1.5-LLaMA3-8B","metrics":{"GPT-4 score":"37.8"},"uses_additional_data":false,"paper_date":"2024-06-12","paper":"/paper/what-if-we-recaption-billions-of-web-images","paper_url":"https://arxiv.org/abs/2406.08478v2","paper_title":"What If We Recaption Billions of Web Images with LLaMA-3?","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":129,"model":"LLaVA-1.5 + DenseFusion-1M (Vicuna-7B)","metrics":{"GPT-4 score":"37.8"},"uses_additional_data":false,"paper_date":"2024-07-11","paper":"/paper/densefusion-1m-merging-vision-experts-for","paper_url":"https://arxiv.org/abs/2407.08303v2","paper_title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","code":"https://github.com/baaivision/densefusion","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":130,"model":"ShareGPT4V-7B","metrics":{"GPT-4 score":"37.6","Params":"7B"},"uses_additional_data":false,"paper_date":"2023-11-21","paper":"/paper/sharegpt4v-improving-large-multi-modal-models","paper_url":"https://arxiv.org/abs/2311.12793v2","paper_title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","code":"https://github.com/InternLM/InternLM-XComposer/tree/main/projects/ShareGPT4V","n_code_links":1,"syntology":null},{"rank_in_archive_order":131,"model":"LLaVA-1.5+CoS","metrics":{"GPT-4 score":"37.6"},"uses_additional_data":false,"paper_date":"2024-03-19","paper":"/paper/chain-of-spot-interactive-reasoning-improves","paper_url":"https://arxiv.org/abs/2403.12966v2","paper_title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","code":"https://github.com/dongyh20/chain-of-spot","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":132,"model":"LLaVA-COCO-13B","metrics":{"GPT-4 score":"37.5"},"uses_additional_data":false,"paper_date":"2024-01-17","paper":"/paper/coco-is-all-you-need-for-visual-instruction","paper_url":"https://arxiv.org/abs/2401.08968v1","paper_title":"COCO is \"ALL'' You Need for Visual Instruction Fine-tuning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":133,"model":"LLaVA-S^2 + DenseFusion-1M (Vicuna-7B)","metrics":{"GPT-4 score":"37.5"},"uses_additional_data":false,"paper_date":"2024-07-11","paper":"/paper/densefusion-1m-merging-vision-experts-for","paper_url":"https://arxiv.org/abs/2407.08303v2","paper_title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","code":"https://github.com/baaivision/densefusion","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":134,"model":"MM1.5-1B","metrics":{"GPT-4 score":"37.4"},"uses_additional_data":false,"paper_date":"2024-09-30","paper":"/paper/mm1-5-methods-analysis-insights-from","paper_url":"https://arxiv.org/abs/2409.20566v1","paper_title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":135,"model":"Dynamic-LLaVA-13B","metrics":{"GPT-4 score":"37.3"},"uses_additional_data":false,"paper_date":"2024-12-01","paper":"/paper/dynamic-llava-efficient-multimodal-large","paper_url":"https://arxiv.org/abs/2412.00876v3","paper_title":"Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification","code":"https://github.com/osilly/dynamic_llava","n_code_links":1,"syntology":{"n_ran":13,"n_unverified":5,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":136,"model":"SeVa-7B","metrics":{"GPT-4 score":"37.2"},"uses_additional_data":false,"paper_date":"2024-04-16","paper":"/paper/self-supervised-visual-preference-alignment","paper_url":"https://arxiv.org/abs/2404.10501v2","paper_title":"Self-Supervised Visual Preference Alignment","code":"https://github.com/Kevinz-code/SeVa","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":11}},{"rank_in_archive_order":137,"model":"SoM-LLaVA-1.5-T","metrics":{"GPT-4 score":"37.2"},"uses_additional_data":false,"paper_date":"2024-04-25","paper":"/paper/list-items-one-by-one-a-new-data-source-and","paper_url":"https://arxiv.org/abs/2404.16375v2","paper_title":"List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs","code":"https://github.com/zzxslp/som-llava","n_code_links":1,"syntology":null},{"rank_in_archive_order":138,"model":"Emu3","metrics":{"GPT-4 score":"37.2"},"uses_additional_data":false,"paper_date":"2024-09-27","paper":"/paper/emu3-next-token-prediction-is-all-you-need","paper_url":"https://arxiv.org/abs/2409.18869v1","paper_title":"Emu3: Next-Token Prediction is All You Need","code":"https://github.com/baaivision/emu3","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":139,"model":"LLaVA-Instruct (Vicuna-1.5-13B)","metrics":{"GPT-4 score":"37.1"},"uses_additional_data":false,"paper_date":"2024-06-28","paper":"/paper/mm-instruct-generated-visual-instructions-for","paper_url":"https://arxiv.org/abs/2406.19736v1","paper_title":"MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment","code":"https://github.com/jihaonew/mm-instruct","n_code_links":2,"syntology":null},{"rank_in_archive_order":140,"model":"ILLUME","metrics":{"GPT-4 score":"37.0"},"uses_additional_data":false,"paper_date":"2024-12-09","paper":"/paper/illume-illuminating-your-llms-to-see-draw-and","paper_url":"https://arxiv.org/abs/2412.06673v1","paper_title":"ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":141,"model":"LLaVA1.5-7B-BPO","metrics":{"GPT-4 score":"36.8","Params":"7B"},"uses_additional_data":false,"paper_date":"2024-03-13","paper":"/paper/strengthening-multimodal-large-language-model","paper_url":"https://arxiv.org/abs/2403.08730v2","paper_title":"Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":142,"model":"LLaVA-1.5-13B (+ MMFuser)","metrics":{"GPT-4 score":"36.6"},"uses_additional_data":false,"paper_date":"2024-10-15","paper":"/paper/mmfuser-multimodal-multi-layer-feature-fuser","paper_url":"https://arxiv.org/abs/2410.11829v1","paper_title":"MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding","code":"https://github.com/yuecao0119/MMFuser","n_code_links":1,"syntology":null},{"rank_in_archive_order":143,"model":"CaMML-13B","metrics":{"GPT-4 score":"36.4"},"uses_additional_data":false,"paper_date":"2024-01-06","paper":"/paper/camml-context-aware-multimodal-learner-for","paper_url":"https://arxiv.org/abs/2401.03149v3","paper_title":"CaMML: Context-Aware Multimodal Learner for Large Models","code":"https://github.com/amazon-science/camml","n_code_links":1,"syntology":null},{"rank_in_archive_order":144,"model":"LLaVA-65B (Data Mixing)","metrics":{"GPT-4 score":"36.4"},"uses_additional_data":false,"paper_date":"2023-09-18","paper":"/paper/an-empirical-study-of-scaling-instruct-tuned","paper_url":"https://arxiv.org/abs/2309.09958v1","paper_title":"An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models","code":"https://github.com/haotian-liu/LLaVA","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":145,"model":"LLaVA-1.5-13B","metrics":{"GPT-4 score":"36.3±0.2","Params":"13B"},"uses_additional_data":false,"paper_date":"2023-10-05","paper":"/paper/improved-baselines-with-visual-instruction","paper_url":"https://arxiv.org/abs/2310.03744v2","paper_title":"Improved Baselines with Visual Instruction Tuning","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":6,"n_unverified":3,"n_samples":9,"n_pointer_only_licence":8}},{"rank_in_archive_order":146,"model":"Emu-14B","metrics":{"GPT-4 score":"36.3±0.3","Params":"14B"},"uses_additional_data":false,"paper_date":"2023-07-11","paper":"/paper/generative-pretraining-in-multimodality","paper_url":"https://arxiv.org/abs/2307.05222v2","paper_title":"Emu: Generative Pretraining in Multimodality","code":"https://github.com/baaivision/emu","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":147,"model":"mPLUG-Owl2","metrics":{"GPT-4 score":"36.3±0.1","Params":"7B"},"uses_additional_data":false,"paper_date":"2023-11-07","paper":"/paper/mplug-owl2-revolutionizing-multi-modal-large","paper_url":"https://arxiv.org/abs/2311.04257v2","paper_title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","code":"https://github.com/x-plug/mplug-owl","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":148,"model":"Vary-base","metrics":{"GPT-4 score":"36.2"},"uses_additional_data":false,"paper_date":"2023-12-11","paper":"/paper/vary-scaling-up-the-vision-vocabulary-for","paper_url":"https://arxiv.org/abs/2312.06109v1","paper_title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","code":"https://github.com/Ucas-HaoranWei/Vary","n_code_links":1,"syntology":null},{"rank_in_archive_order":149,"model":"StableLLaVA","metrics":{"GPT-4 score":"36.1"},"uses_additional_data":false,"paper_date":"2023-08-20","paper":"/paper/stablellava-enhanced-visual-instruction","paper_url":"https://arxiv.org/abs/2308.10253v2","paper_title":"StableLLaVA: Enhanced Visual Instruction Tuning with Synthesized Image-Dialogue Data","code":"https://github.com/icoz69/stablellava","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":150,"model":"DreamLLM-7B","metrics":{"GPT-4 score":"35.9","Params":"7B"},"uses_additional_data":false,"paper_date":"2023-09-20","paper":"/paper/dreamllm-synergistic-multimodal-comprehension","paper_url":"https://arxiv.org/abs/2309.11499v2","paper_title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","code":"https://github.com/RunpeiDong/DreamLLM","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":151,"model":"MoE-LLaVA-2.7B×4-Top2","metrics":{"GPT-4 score":"35.9"},"uses_additional_data":false,"paper_date":"2024-01-29","paper":"/paper/moe-llava-mixture-of-experts-for-large-vision","paper_url":"https://arxiv.org/abs/2401.15947v5","paper_title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","code":"https://github.com/PKU-YuanGroup/Video-LLaVA","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":152,"model":"SoM-LLaVA-1.5","metrics":{"GPT-4 score":"35.9"},"uses_additional_data":false,"paper_date":"2024-04-25","paper":"/paper/list-items-one-by-one-a-new-data-source-and","paper_url":"https://arxiv.org/abs/2404.16375v2","paper_title":"List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs","code":"https://github.com/zzxslp/som-llava","n_code_links":1,"syntology":null},{"rank_in_archive_order":153,"model":"Dragonfly (Llama3-8B)","metrics":{"GPT-4 score":"35.9"},"uses_additional_data":false,"paper_date":"2024-06-03","paper":"/paper/dragonfly-multi-resolution-zoom-supercharges","paper_url":"https://arxiv.org/abs/2406.00977v2","paper_title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","code":"https://github.com/togethercomputer/dragonfly","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":154,"model":"Ferret-v2-13B","metrics":{"GPT-4 score":"35.7"},"uses_additional_data":false,"paper_date":"2024-04-11","paper":"/paper/ferret-v2-an-improved-baseline-for-referring","paper_url":"https://arxiv.org/abs/2404.07973v1","paper_title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","code":"https://github.com/apple/ml-ferret","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":155,"model":"AlignGPT (Vicuna-13B)","metrics":{"GPT-4 score":"35.6"},"uses_additional_data":false,"paper_date":"2024-05-23","paper":"/paper/aligngpt-multi-modal-large-language-models","paper_url":"https://arxiv.org/abs/2405.14129v2","paper_title":"AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":156,"model":"LLaVA-HR-X","metrics":{"GPT-4 score":"35.5"},"uses_additional_data":false,"paper_date":"2024-03-05","paper":"/paper/feast-your-eyes-mixture-of-resolution","paper_url":"https://arxiv.org/abs/2403.03003v1","paper_title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","code":"https://github.com/luogen1996/llava-hr","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":2,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":157,"model":"SQ-LLaVA","metrics":{"GPT-4 score":"35.5"},"uses_additional_data":false,"paper_date":"2024-03-17","paper":"/paper/sq-llava-self-questioning-for-large-vision","paper_url":"https://arxiv.org/abs/2403.11299v2","paper_title":"SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant","code":"https://github.com/heliossun/sq-llava","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":158,"model":"LOVA$^3$","metrics":{"GPT-4 score":"35.2","Params":"7B"},"uses_additional_data":false,"paper_date":"2024-05-23","paper":"/paper/lova3-learning-to-visual-question-answering","paper_url":"https://arxiv.org/abs/2405.14974v2","paper_title":"LOVA3: Learning to Visual Question Answering, Asking and Assessment","code":"https://github.com/showlab/lova3","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":3,"n_samples":10,"n_pointer_only_licence":10}},{"rank_in_archive_order":159,"model":"LLaVA-InternLM2-7B-ViT + MoSLoRA","metrics":{"GPT-4 score":"35.2"},"uses_additional_data":false,"paper_date":"2024-06-16","paper":"/paper/mixture-of-subspaces-in-low-rank-adaptation","paper_url":"https://arxiv.org/abs/2406.11909v3","paper_title":"Mixture-of-Subspaces in Low-Rank Adaptation","code":"https://github.com/wutaiqiang/moslora","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":160,"model":"InternLM2+ViT (QMoSLoRA)","metrics":{"GPT-4 score":"35.2"},"uses_additional_data":false,"paper_date":"2024-06-16","paper":"/paper/mixture-of-subspaces-in-low-rank-adaptation","paper_url":"https://arxiv.org/abs/2406.11909v3","paper_title":"Mixture-of-Subspaces in Low-Rank Adaptation","code":"https://github.com/wutaiqiang/moslora","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":161,"model":"LLaVA1.5-7B-MDA","metrics":{"GPT-4 score":"35.20","Params":"7B"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/looking-beyond-text-reducing-language-bias-in","paper_url":"https://arxiv.org/abs/2411.14279v1","paper_title":"Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":162,"model":"Mipha-3B+","metrics":{"GPT-4 score":"35.1"},"uses_additional_data":false,"paper_date":"2024-07-05","paper":"/paper/rethinking-visual-prompting-for-multimodal","paper_url":"https://arxiv.org/abs/2407.04681v1","paper_title":"Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":163,"model":"LLaVA-Plus-13B (All Tools, V1.3, 336px)","metrics":{"GPT-4 score":"35.0±0.0","Params":"13B"},"uses_additional_data":false,"paper_date":"2023-11-09","paper":"/paper/llava-plus-learning-to-use-tools-for-creating","paper_url":"https://arxiv.org/abs/2311.05437v1","paper_title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","code":"https://github.com/LLaVA-VL/LLaVA-Plus-Codebase","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":164,"model":"Merlin","metrics":{"GPT-4 score":"34.9"},"uses_additional_data":false,"paper_date":"2023-11-30","paper":"/paper/merlin-empowering-multimodal-llms-with","paper_url":"https://arxiv.org/abs/2312.00589v2","paper_title":"Merlin:Empowering Multimodal LLMs with Foresight Minds","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":165,"model":"Arcana","metrics":{"GPT-4 score":"34.8"},"uses_additional_data":false,"paper_date":"2024-10-17","paper":"/paper/improving-multi-modal-large-language-model","paper_url":"https://arxiv.org/abs/2410.13733v1","paper_title":"Improving Multi-modal Large Language Model through Boosting Vision Capabilities","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":166,"model":"INF-LLaVA","metrics":{"GPT-4 score":"34.5"},"uses_additional_data":false,"paper_date":"2024-07-23","paper":"/paper/inf-llava-dual-perspective-perception-for","paper_url":"https://arxiv.org/abs/2407.16198v1","paper_title":"INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model","code":"https://github.com/weihuanglin/inf-llava","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":1}},{"rank_in_archive_order":167,"model":"LLaVA-1.5+MMInstruct (Vicuna-7B)","metrics":{"GPT-4 score":"34.4"},"uses_additional_data":false,"paper_date":"2024-07-22","paper":"/paper/mminstruct-a-high-quality-multi-modal","paper_url":"https://arxiv.org/abs/2407.15838v2","paper_title":"MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity","code":"https://github.com/yuecao0119/mminstruct","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":168,"model":"Janus","metrics":{"GPT-4 score":"34.3"},"uses_additional_data":false,"paper_date":"2024-10-17","paper":"/paper/janus-decoupling-visual-encoding-for-unified","paper_url":"https://arxiv.org/abs/2410.13848v1","paper_title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","code":"https://github.com/deepseek-ai/janus","n_code_links":1,"syntology":null},{"rank_in_archive_order":169,"model":"LLaVA-TokenPacker (Vicuna-13B)","metrics":{"GPT-4 score":"34.1"},"uses_additional_data":false,"paper_date":"2024-07-02","paper":"/paper/tokenpacker-efficient-visual-projector-for","paper_url":"https://arxiv.org/abs/2407.02392v4","paper_title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","code":"https://github.com/circleradon/tokenpacker","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":170,"model":"γ-MoD-LLaVA-HR","metrics":{"GPT-4 score":"34.0"},"uses_additional_data":false,"paper_date":"2024-10-17","paper":"/paper/g-mod-exploring-mixture-of-depth-adaptation","paper_url":"https://arxiv.org/abs/2410.13859v1","paper_title":"$γ-$MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":171,"model":"LLaVA-1.5-7B (CSR)","metrics":{"GPT-4 score":"33.9","Params":"7B"},"uses_additional_data":false,"paper_date":"2024-05-23","paper":"/paper/calibrated-self-rewarding-vision-language","paper_url":"https://arxiv.org/abs/2405.14622v4","paper_title":"Calibrated Self-Rewarding Vision Language Models","code":"https://github.com/yiyangzhou/csr","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":172,"model":"DynMOE-LLaVA","metrics":{"GPT-4 score":"33.6"},"uses_additional_data":false,"paper_date":"2024-05-23","paper":"/paper/dynamic-mixture-of-experts-an-auto-tuning","paper_url":"https://arxiv.org/abs/2405.14297v3","paper_title":"Dynamic Mixture of Experts: An Auto-Tuning Approach for Efficient Transformer Models","code":"https://github.com/lins-lab/dynmoe","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":173,"model":"Imp-2B","metrics":{"GPT-4 score":"33.5","Params":"2B"},"uses_additional_data":false,"paper_date":"2024-05-20","paper":"/paper/imp-highly-capable-large-multimodal-models","paper_url":"https://arxiv.org/abs/2405.12107v2","paper_title":"Imp: Highly Capable Large Multimodal Models for Mobile Devices","code":"https://github.com/milvlg/imp","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":174,"model":"InfMLLM-7B-Chat","metrics":{"GPT-4 score":"33.4"},"uses_additional_data":false,"paper_date":"2023-11-12","paper":"/paper/infmllm-a-unified-framework-for-visual","paper_url":"https://arxiv.org/abs/2311.06791v2","paper_title":"InfMLLM: A Unified Framework for Visual-Language Tasks","code":"https://github.com/infly-ai/inf-mllm","n_code_links":2,"syntology":null},{"rank_in_archive_order":175,"model":"Video-LaVIT","metrics":{"GPT-4 score":"33.2","Params":"7B"},"uses_additional_data":false,"paper_date":"2024-02-05","paper":"/paper/video-lavit-unified-video-language-pre","paper_url":"https://arxiv.org/abs/2402.03161v3","paper_title":"Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization","code":"https://github.com/jy0205/lavit","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":176,"model":"LLaVA-Instruct (Vicuna-1.5-7B)","metrics":{"GPT-4 score":"32.9"},"uses_additional_data":false,"paper_date":"2024-06-28","paper":"/paper/mm-instruct-generated-visual-instructions-for","paper_url":"https://arxiv.org/abs/2406.19736v1","paper_title":"MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment","code":"https://github.com/jihaonew/mm-instruct","n_code_links":2,"syntology":null},{"rank_in_archive_order":177,"model":"VisionZip (Retain 128 Tokens, fine-tuning)","metrics":{"GPT-4 score":"32.9"},"uses_additional_data":false,"paper_date":"2024-12-05","paper":"/paper/visionzip-longer-is-better-but-not-necessary","paper_url":"https://arxiv.org/abs/2412.04467v1","paper_title":"VisionZip: Longer is Better but Not Necessary in Vision Language Models","code":"https://github.com/dvlab-research/visionzip","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":178,"model":"Uni-MoE","metrics":{"GPT-4 score":"32.8"},"uses_additional_data":false,"paper_date":"2024-05-18","paper":"/paper/uni-moe-scaling-unified-multimodal-llms-with","paper_url":"https://arxiv.org/abs/2405.11273v1","paper_title":"Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts","code":"https://github.com/hitsz-tmg/umoe-scaling-unified-multimodal-llms","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":2,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":179,"model":"VL-Mamba (Mamba LLM-2.8B)","metrics":{"GPT-4 score":"32.6"},"uses_additional_data":false,"paper_date":"2024-03-20","paper":"/paper/vl-mamba-exploring-state-space-models-for","paper_url":"https://arxiv.org/abs/2403.13600v1","paper_title":"VL-Mamba: Exploring State Space Models for Multimodal Learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":180,"model":"LLaVA-v1.5 (7B, w/ STIC)","metrics":{"GPT-4 score":"32.6","Params":"7B"},"uses_additional_data":false,"paper_date":"2024-05-30","paper":"/paper/enhancing-large-vision-language-models-with","paper_url":"https://arxiv.org/abs/2405.19716v2","paper_title":"Enhancing Large Vision Language Models with Self-Training on Image Comprehension","code":"https://github.com/yihedeng9/stic","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":1}},{"rank_in_archive_order":181,"model":"VisionZip (Retain 192 Tokens, fine-tuning)","metrics":{"GPT-4 score":"32.6"},"uses_additional_data":false,"paper_date":"2024-12-05","paper":"/paper/visionzip-longer-is-better-but-not-necessary","paper_url":"https://arxiv.org/abs/2412.04467v1","paper_title":"VisionZip: Longer is Better but Not Necessary in Vision Language Models","code":"https://github.com/dvlab-research/visionzip","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":182,"model":"VisionZip (Retain 128 Tokens)","metrics":{"GPT-4 score":"32.6"},"uses_additional_data":false,"paper_date":"2024-12-05","paper":"/paper/visionzip-longer-is-better-but-not-necessary","paper_url":"https://arxiv.org/abs/2412.04467v1","paper_title":"VisionZip: Longer is Better but Not Necessary in Vision Language Models","code":"https://github.com/dvlab-research/visionzip","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":183,"model":"LLaVA-v1.5 (+MoCa)","metrics":{"GPT-4 score":"32.2"},"uses_additional_data":false,"paper_date":"2024-10-09","paper":"/paper/deciphering-cross-modal-alignment-in-large","paper_url":"https://arxiv.org/abs/2410.07167v2","paper_title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","code":"https://github.com/shikiw/modality-integration-rate","n_code_links":1,"syntology":{"n_ran":12,"n_unverified":0,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":184,"model":"Dynamic-LLaVA-7B","metrics":{"GPT-4 score":"32.2"},"uses_additional_data":false,"paper_date":"2024-12-01","paper":"/paper/dynamic-llava-efficient-multimodal-large","paper_url":"https://arxiv.org/abs/2412.00876v3","paper_title":"Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification","code":"https://github.com/osilly/dynamic_llava","n_code_links":1,"syntology":{"n_ran":13,"n_unverified":5,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":185,"model":"Mipha-3B","metrics":{"GPT-4 score":"32.1","Params":"3B"},"uses_additional_data":false,"paper_date":"2024-03-10","paper":"/paper/a-comprehensive-overhaul-of-multimodal","paper_url":"https://arxiv.org/abs/2403.06199v4","paper_title":"Mipha: A Comprehensive Overhaul of Multimodal Assistant with Small Language Models","code":"https://github.com/zhuyiche/llava-phi","n_code_links":1,"syntology":null},{"rank_in_archive_order":186,"model":"VOLCANO 7B","metrics":{"GPT-4 score":"32.0","Params":"7B"},"uses_additional_data":false,"paper_date":"2023-11-13","paper":"/paper/volcano-mitigating-multimodal-hallucination","paper_url":"https://arxiv.org/abs/2311.07362v4","paper_title":"Volcano: Mitigating Multimodal Hallucination through Self-Feedback Guided Revision","code":"https://github.com/kaistai/volcano","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":1,"n_samples":10,"n_pointer_only_licence":10}},{"rank_in_archive_order":187,"model":"Video-LLaVA","metrics":{"GPT-4 score":"32.0"},"uses_additional_data":false,"paper_date":"2023-11-16","paper":"/paper/video-llava-learning-united-visual-1","paper_url":"https://arxiv.org/abs/2311.10122v3","paper_title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","code":"https://github.com/PKU-YuanGroup/Video-LLaVA","n_code_links":6,"syntology":{"n_ran":4,"n_unverified":3,"n_samples":7,"n_pointer_only_licence":1}},{"rank_in_archive_order":188,"model":"TinyLLaVA-share-Sig-Ph","metrics":{"GPT-4 score":"32.0","Params":"3.1B"},"uses_additional_data":false,"paper_date":"2024-02-22","paper":"/paper/tinyllava-a-framework-of-small-scale-large","paper_url":"https://arxiv.org/abs/2402.14289v1","paper_title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","code":"https://github.com/dlcv-buaa/tinyllavabench","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":5,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":189,"model":"LLaVA-VT (Vicuna-7B)","metrics":{"GPT-4 score":"31.8"},"uses_additional_data":false,"paper_date":"2024-03-27","paper":"/paper/beyond-embeddings-the-promise-of-visual-table","paper_url":"https://arxiv.org/abs/2403.18252v2","paper_title":"Beyond Embeddings: The Promise of Visual Table in Visual Reasoning","code":"https://github.com/lavi-lab/visual-table","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":0,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":190,"model":"LRV-Instruction-7B","metrics":{"GPT-4 score":"31.7±0.1","Params":"7B"},"uses_additional_data":false,"paper_date":"2023-06-26","paper":"/paper/aligning-large-multi-modal-model-with-robust","paper_url":"https://arxiv.org/abs/2306.14565v4","paper_title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","code":"https://github.com/h-zhao1997/cobra","n_code_links":4,"syntology":null},{"rank_in_archive_order":191,"model":"VisionZip (Retain 192 Tokens)","metrics":{"GPT-4 score":"31.7"},"uses_additional_data":false,"paper_date":"2024-12-05","paper":"/paper/visionzip-longer-is-better-but-not-necessary","paper_url":"https://arxiv.org/abs/2412.04467v1","paper_title":"VisionZip: Longer is Better but Not Necessary in Vision Language Models","code":"https://github.com/dvlab-research/visionzip","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":192,"model":"VisionZip (Retain 64 Tokens)","metrics":{"GPT-4 score":"31.7"},"uses_additional_data":false,"paper_date":"2024-12-05","paper":"/paper/visionzip-longer-is-better-but-not-necessary","paper_url":"https://arxiv.org/abs/2412.04467v1","paper_title":"VisionZip: Longer is Better but Not Necessary in Vision Language Models","code":"https://github.com/dvlab-research/visionzip","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":193,"model":"LLaVA-1.5-7B (+ SIMA)","metrics":{"GPT-4 score":"31.6","Params":"7B"},"uses_additional_data":false,"paper_date":"2024-05-24","paper":"/paper/enhancing-visual-language-modality-alignment","paper_url":"https://arxiv.org/abs/2405.15973v3","paper_title":"Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement","code":"https://github.com/yiyangzhou/csr","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":194,"model":"LLaMA-Adapter v2-7B","metrics":{"GPT-4 score":"31.4±0.1","Params":"7B"},"uses_additional_data":false,"paper_date":"2023-04-28","paper":"/paper/llama-adapter-v2-parameter-efficient-visual","paper_url":"https://arxiv.org/abs/2304.15010v1","paper_title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","code":"https://github.com/opengvlab/llama-adapter","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":195,"model":"MiCo-Chat-7B","metrics":{"GPT-4 score":"31.4"},"uses_additional_data":false,"paper_date":"2024-06-13","paper":"/paper/explore-the-limits-of-omni-modal-pretraining","paper_url":"https://arxiv.org/abs/2406.09412v1","paper_title":"Explore the Limits of Omni-modal Pretraining at Scale","code":"https://github.com/invictus717/MiCo","n_code_links":1,"syntology":null},{"rank_in_archive_order":196,"model":"LLaVA-1.5-7B + TeamLoRA","metrics":{"GPT-4 score":"31.2"},"uses_additional_data":false,"paper_date":"2024-08-19","paper":"/paper/teamlora-boosting-low-rank-adaptation-with","paper_url":"https://arxiv.org/abs/2408.09856v1","paper_title":"TeamLoRA: Boosting Low-Rank Adaptation with Expert Collaboration and Competition","code":"https://github.com/lin-tianwei/teamlora","n_code_links":1,"syntology":null},{"rank_in_archive_order":197,"model":"LLaVA-1.5-7B","metrics":{"GPT-4 score":"31.1±0.2","Params":"7B"},"uses_additional_data":false,"paper_date":"2023-10-05","paper":"/paper/improved-baselines-with-visual-instruction","paper_url":"https://arxiv.org/abs/2310.03744v2","paper_title":"Improved Baselines with Visual Instruction Tuning","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":6,"n_unverified":3,"n_samples":9,"n_pointer_only_licence":8}},{"rank_in_archive_order":198,"model":"RoboCodeX-13B","metrics":{"GPT-4 score":"31.0"},"uses_additional_data":false,"paper_date":"2024-02-25","paper":"/paper/robocodex-multimodal-code-generation-for","paper_url":"https://arxiv.org/abs/2402.16117v1","paper_title":"RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":199,"model":"HyperLLaVA","metrics":{"GPT-4 score":"31.0"},"uses_additional_data":false,"paper_date":"2024-03-20","paper":"/paper/hyperllava-dynamic-visual-and-language-expert","paper_url":"https://arxiv.org/abs/2403.13447v1","paper_title":"HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models","code":"https://github.com/dcdmllm/hyperllava","n_code_links":1,"syntology":null},{"rank_in_archive_order":200,"model":"FAST (Vicuna-7B)","metrics":{"GPT-4 score":"31.0"},"uses_additional_data":false,"paper_date":"2024-08-16","paper":"/paper/visual-agents-as-fast-and-slow-thinkers","paper_url":"https://arxiv.org/abs/2408.08862v3","paper_title":"Visual Agents as Fast and Slow Thinkers","code":"https://github.com/guangyans/sys2-llava","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":201,"model":"JanusFlow","metrics":{"GPT-4 score":"30.9"},"uses_additional_data":false,"paper_date":"2024-11-12","paper":"/paper/janusflow-harmonizing-autoregression-and","paper_url":"https://arxiv.org/abs/2411.07975v2","paper_title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","code":"https://github.com/deepseek-ai/janus","n_code_links":1,"syntology":null},{"rank_in_archive_order":202,"model":"AlignGPT (Vicuna-7B)","metrics":{"GPT-4 score":"30.8"},"uses_additional_data":false,"paper_date":"2024-05-23","paper":"/paper/aligngpt-multi-modal-large-language-models","paper_url":"https://arxiv.org/abs/2405.14129v2","paper_title":"AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":203,"model":"LLaVolta","metrics":{"GPT-4 score":"30.7"},"uses_additional_data":false,"paper_date":"2024-06-28","paper":"/paper/llavolta-efficient-multi-modal-models-via","paper_url":"https://arxiv.org/abs/2406.20092v2","paper_title":"Efficient Large Multi-modal Models via Visual Context Compression","code":"https://github.com/beckschen/llavolta","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":204,"model":"LLaVA-AlignedVQ","metrics":{"GPT-4 score":"30.7"},"uses_additional_data":false,"paper_date":"2024-11-08","paper":"/paper/aligned-vector-quantization-for-edge-cloud","paper_url":"https://arxiv.org/abs/2411.05961v1","paper_title":"Aligned Vector Quantization for Edge-Cloud Collabrative Vision-Language Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":205,"model":"LLaVA-1.5-HACL","metrics":{"GPT-4 score":"30.4","Params":"7.3B"},"uses_additional_data":false,"paper_date":"2023-12-12","paper":"/paper/hallucination-augmented-contrastive-learning","paper_url":"https://arxiv.org/abs/2312.06968v4","paper_title":"Hallucination Augmented Contrastive Learning for Multimodal Large Language Model","code":"https://github.com/x-plug/mplug-halowl","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":5}},{"rank_in_archive_order":206,"model":"MaVEn","metrics":{"GPT-4 score":"30.4","Params":"7.2B"},"uses_additional_data":false,"paper_date":"2024-08-22","paper":"/paper/maven-an-effective-multi-granularity-hybrid","paper_url":"https://arxiv.org/abs/2408.12321v2","paper_title":"MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":207,"model":"VisionZip (Retain 64 Tokens, fine-tuning)","metrics":{"GPT-4 score":"30.2"},"uses_additional_data":false,"paper_date":"2024-12-05","paper":"/paper/visionzip-longer-is-better-but-not-necessary","paper_url":"https://arxiv.org/abs/2412.04467v1","paper_title":"VisionZip: Longer is Better but Not Necessary in Vision Language Models","code":"https://github.com/dvlab-research/visionzip","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":208,"model":"H2OVL-Mississippi-0.8B","metrics":{"GPT-4 score":"30.0"},"uses_additional_data":false,"paper_date":"2024-10-17","paper":"/paper/h2ovl-mississippi-vision-language-models","paper_url":"https://arxiv.org/abs/2410.13611v1","paper_title":"H2OVL-Mississippi Vision Language Models Technical Report","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":209,"model":"RoboMamba","metrics":{"GPT-4 score":"29.7"},"uses_additional_data":false,"paper_date":"2024-06-06","paper":"/paper/robomamba-multimodal-state-space-model-for","paper_url":"https://arxiv.org/abs/2406.04339v2","paper_title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":210,"model":"LLaVA-TokenPacker (Vicuna-7B)","metrics":{"GPT-4 score":"29.6"},"uses_additional_data":false,"paper_date":"2024-07-02","paper":"/paper/tokenpacker-efficient-visual-projector-for","paper_url":"https://arxiv.org/abs/2407.02392v4","paper_title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","code":"https://github.com/circleradon/tokenpacker","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":211,"model":"OneLLM-7B","metrics":{"GPT-4 score":"29.1","Params":"7B"},"uses_additional_data":false,"paper_date":"2023-12-06","paper":"/paper/onellm-one-framework-to-align-all-modalities","paper_url":"https://arxiv.org/abs/2312.03700v2","paper_title":"OneLLM: One Framework to Align All Modalities with Language","code":"https://github.com/csuhan/onellm","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":212,"model":"LLaVA-OneVision-0.5B","metrics":{"GPT-4 score":"29.1"},"uses_additional_data":false,"paper_date":"2024-08-06","paper":"/paper/llava-onevision-easy-visual-task-transfer","paper_url":"https://arxiv.org/abs/2408.03326v3","paper_title":"LLaVA-OneVision: Easy Visual Task Transfer","code":"https://github.com/evolvinglmms-lab/lmms-eval","n_code_links":2,"syntology":null},{"rank_in_archive_order":213,"model":"Vary-toy","metrics":{"GPT-4 score":"29.0","Params":"1.8B"},"uses_additional_data":false,"paper_date":"2024-01-23","paper":"/paper/small-language-model-meets-with-reinforced","paper_url":"https://arxiv.org/abs/2401.12503v1","paper_title":"Small Language Model Meets with Reinforced Vision Vocabulary","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":214,"model":"LLaVA-Phi","metrics":{"GPT-4 score":"28.9"},"uses_additional_data":false,"paper_date":"2024-01-04","paper":"/paper/llava-ph-efficient-multi-modal-assistant-with","paper_url":"https://arxiv.org/abs/2401.02330v4","paper_title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","code":"https://github.com/zhuyiche/llava-phi","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":4,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":215,"model":"MM-ReAct-GPT-3.5","metrics":{"GPT-4 score":"27.9±0.1"},"uses_additional_data":false,"paper_date":"2023-03-20","paper":"/paper/mm-react-prompting-chatgpt-for-multimodal","paper_url":"https://arxiv.org/abs/2303.11381v1","paper_title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","code":"https://github.com/microsoft/MM-REACT","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":216,"model":"MMAR-7B","metrics":{"GPT-4 score":"27.80"},"uses_additional_data":false,"paper_date":"2024-10-14","paper":"/paper/mmar-towards-lossless-multi-modal-auto","paper_url":"https://arxiv.org/abs/2410.10798v2","paper_title":"MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":217,"model":"SEAL (7B)","metrics":{"GPT-4 score":"27.7","Params":"7B"},"uses_additional_data":false,"paper_date":"2023-12-21","paper":"/paper/textit-v-guided-visual-search-as-a-core","paper_url":"https://arxiv.org/abs/2312.14135v2","paper_title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","code":"https://github.com/penghao-wu/vstar","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":218,"model":"LLaVA-Plus-7B (All Tools)","metrics":{"GPT-4 score":"27.5±0.3","Params":"7B"},"uses_additional_data":false,"paper_date":"2023-11-09","paper":"/paper/llava-plus-learning-to-use-tools-for-creating","paper_url":"https://arxiv.org/abs/2311.05437v1","paper_title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","code":"https://github.com/LLaVA-VL/LLaVA-Plus-Codebase","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":219,"model":"OtterHD-8B","metrics":{"GPT-4 score":"26.3","Params":"8B"},"uses_additional_data":false,"paper_date":"2023-11-07","paper":"/paper/otterhd-a-high-resolution-multi-modality","paper_url":"https://arxiv.org/abs/2311.04219v1","paper_title":"OtterHD: A High-Resolution Multi-modality Model","code":"https://github.com/luodian/otter","n_code_links":1,"syntology":{"n_ran":11,"n_unverified":3,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":220,"model":"TGA-7B","metrics":{"GPT-4 score":"25.6"},"uses_additional_data":false,"paper_date":"2024-10-16","paper":"/paper/cross-modal-safety-mechanism-transfer-in","paper_url":"https://arxiv.org/abs/2410.12662v1","paper_title":"Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":221,"model":"OpenFlamingo-9B (MPT-7B)","metrics":{"GPT-4 score":"24.8±0.2","Params":"9B"},"uses_additional_data":false,"paper_date":"2023-08-02","paper":"/paper/openflamingo-an-open-source-framework-for","paper_url":"https://arxiv.org/abs/2308.01390v2","paper_title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","code":"https://github.com/mlfoundations/open_flamingo","n_code_links":2,"syntology":null},{"rank_in_archive_order":222,"model":"Otter-9B (MPT-7B)","metrics":{"GPT-4 score":"24.7±0.3","Params":"9B"},"uses_additional_data":false,"paper_date":"2023-06-08","paper":"/paper/mimic-it-multi-modal-in-context-instruction","paper_url":"https://arxiv.org/abs/2306.05425v1","paper_title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","code":"https://github.com/luodian/otter","n_code_links":2,"syntology":null},{"rank_in_archive_order":223,"model":"Otter-9B (LLaMA)","metrics":{"GPT-4 score":"24.6±0.2","Params":"9B"},"uses_additional_data":false,"paper_date":"2023-06-08","paper":"/paper/mimic-it-multi-modal-in-context-instruction","paper_url":"https://arxiv.org/abs/2306.05425v1","paper_title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","code":"https://github.com/luodian/otter","n_code_links":2,"syntology":null},{"rank_in_archive_order":224,"model":"MiniGPT-4-14B","metrics":{"GPT-4 score":"24.4±0.4","Params":"14B"},"uses_additional_data":false,"paper_date":"2023-04-20","paper":"/paper/minigpt-4-enhancing-vision-language","paper_url":"https://arxiv.org/abs/2304.10592v2","paper_title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","code":"https://github.com/vision-cair/minigpt-4","n_code_links":6,"syntology":null},{"rank_in_archive_order":225,"model":"LinVT","metrics":{"GPT-4 score":"23.5"},"uses_additional_data":false,"paper_date":"2024-12-06","paper":"/paper/linvt-empower-your-image-level-large-language","paper_url":"https://arxiv.org/abs/2412.05185v2","paper_title":"LinVT: Empower Your Image-level Large Language Model to Understand Videos","code":"https://github.com/gls0425/linvt","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":8,"n_samples":12,"n_pointer_only_licence":12}},{"rank_in_archive_order":226,"model":"BLIP-2-12B","metrics":{"GPT-4 score":"22.4±0.2","Params":"12B"},"uses_additional_data":false,"paper_date":"2023-01-30","paper":"/paper/blip-2-bootstrapping-language-image-pre","paper_url":"https://arxiv.org/abs/2301.12597v3","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","code":"https://github.com/huggingface/transformers","n_code_links":17,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":1}},{"rank_in_archive_order":227,"model":"MiniGPT-4-8B","metrics":{"GPT-4 score":"22.1±0.1","Params":"8B"},"uses_additional_data":false,"paper_date":"2023-04-20","paper":"/paper/minigpt-4-enhancing-vision-language","paper_url":"https://arxiv.org/abs/2304.10592v2","paper_title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","code":"https://github.com/vision-cair/minigpt-4","n_code_links":6,"syntology":null},{"rank_in_archive_order":228,"model":"OpenFlamingo-9B (LLaMA-7B)","metrics":{"GPT-4 score":"21.8±0.1","Params":"9B"},"uses_additional_data":false,"paper_date":"2023-08-02","paper":"/paper/openflamingo-an-open-source-framework-for","paper_url":"https://arxiv.org/abs/2308.01390v2","paper_title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","code":"https://github.com/mlfoundations/open_flamingo","n_code_links":2,"syntology":null},{"rank_in_archive_order":229,"model":"Xmodel-VLM (Xmodel-LM 1.1B)","metrics":{"GPT-4 score":"21.8"},"uses_additional_data":false,"paper_date":"2024-05-15","paper":"/paper/xmodel-vlm-a-simple-baseline-for-multimodal","paper_url":"https://arxiv.org/abs/2405.09215v3","paper_title":"Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model","code":"https://github.com/xiaoduoailab/xmodelvlm","n_code_links":4,"syntology":null},{"rank_in_archive_order":230,"model":"TextBind","metrics":{"GPT-4 score":"19.4"},"uses_additional_data":false,"paper_date":"2023-09-14","paper":"/paper/textbind-multi-turn-interleaved-multimodal","paper_url":"https://arxiv.org/abs/2309.08637v5","paper_title":"TextBind: Multi-turn Interleaved Multimodal Instruction-following in the Wild","code":"https://github.com/sihengli99/textbind","n_code_links":1,"syntology":null},{"rank_in_archive_order":231,"model":"MMAR-0.5B","metrics":{"GPT-4 score":"18.49"},"uses_additional_data":false,"paper_date":"2024-10-14","paper":"/paper/mmar-towards-lossless-multi-modal-auto","paper_url":"https://arxiv.org/abs/2410.10798v2","paper_title":"MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling","code":null,"n_code_links":0,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,264 of the 9,581 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9581,"papers_checked":6264,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":3316},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":120,"rows_with_any_sample_ran":111,"distinct_papers_with_graph_line":73,"distinct_papers_with_any_sample_ran":67,"samples_over_distinct_papers":{"n_ran":341,"n_unverified":184,"n_samples":525,"n_pointer_only_licence":180,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":526,"n_unverified":390,"n_samples":916,"n_pointer_only_licence":246,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}