{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/build-vision-tower","entry":"build_vision_tower","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":35,"n_papers_ran":3,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":32,"n_samples_ran":3,"n_samples_fingerprinted":0,"n_places":37,"n_places_pointer_only":16,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":2,"ran":1,"unverified":29},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2603.26008","paper":"/paper/arxiv-2603-26008","title":"FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"bhosalems/FairLLaVA","path":"llava/model/language_model/llava_llama.py","file_url":"https://github.com/bhosalems/FairLLaVA/blob/HEAD/llava/model/language_model/llava_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"29b09ab62f286cf5","mcp_get_code":{"code_sha256":"29b09ab62f286cf5"}},{"arxiv_id":"2603.21426","paper":"/paper/arxiv-2603-21426","title":"Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"Jingchensun/beta-kd","path":"mobilevlm/model/vision_encoder.py","file_url":"https://github.com/Jingchensun/beta-kd/blob/HEAD/mobilevlm/model/vision_encoder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cd281e119911f887","mcp_get_code":{"code_sha256":"cd281e119911f887"}},{"arxiv_id":"2603.12930","paper":"/paper/arxiv-2603-12930","title":"Rethinking VLMs for Image Forgery Detection and Localization","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"sha0fengGuo/IFDL-VLM","path":"stage2/llava/model/language_model/llava_llama.py","file_url":"https://github.com/sha0fengGuo/IFDL-VLM/blob/HEAD/stage2/llava/model/language_model/llava_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b89f520c5cbc92b1","mcp_get_code":{"code_sha256":"b89f520c5cbc92b1"}},{"arxiv_id":"2505.19474","paper":"/paper/causal-llava-causal-disentanglement-for","title":"Causal-LLaVA: Causal Disentanglement for Mitigating Hallucination in Multimodal Large Language Models","date":"2025-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ignisavium/causal-llava","path":"confounders/get_projector_confounders.py","file_url":"https://github.com/ignisavium/causal-llava/blob/HEAD/confounders/get_projector_confounders.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"50280faddf30baf6","mcp_get_code":{"code_sha256":"50280faddf30baf6"}},{"arxiv_id":"2503.24164","paper":null,"title":"arXiv:2503.24164","date":null,"month_inferred_from_arxiv_id":"2025-03","title_source":null,"repo":"vlm-svla/svla","path":"llava/model/language_model/llava_qwen.py","file_url":"https://github.com/vlm-svla/svla/blob/HEAD/llava/model/language_model/llava_qwen.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2154f3edc3a28ede","mcp_get_code":{"code_sha256":"2154f3edc3a28ede"}},{"arxiv_id":"2503.04006","paper":null,"title":"arXiv:2503.04006","date":null,"month_inferred_from_arxiv_id":"2025-03","title_source":null,"repo":"aminpdik/DSV-LFS","path":"model/DSVLFS.py","file_url":"https://github.com/aminpdik/DSV-LFS/blob/HEAD/model/DSVLFS.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f553b519cf8e68ba","mcp_get_code":{"code_sha256":"f553b519cf8e68ba"}},{"arxiv_id":"2503.03803","paper":"/paper/egolife-towards-egocentric-life-assistant","title":"EgoLife: Towards Egocentric Life Assistant","date":"2025-03-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"evolvinglmms-lab/egolife","path":"EgoGPT/egogpt/model/language_model/egogpt_llama.py","file_url":"https://github.com/evolvinglmms-lab/egolife/blob/HEAD/EgoGPT/egogpt/model/language_model/egogpt_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"700100fc2116c32c","mcp_get_code":{"code_sha256":"700100fc2116c32c"}},{"arxiv_id":"2502.04328","paper":"/paper/ola-pushing-the-frontiers-of-omni-modal","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","date":"2025-02-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ola-omni/ola","path":"ola/model/multimodal_encoder/builder.py","file_url":"https://github.com/ola-omni/ola/blob/HEAD/ola/model/multimodal_encoder/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3b3e8a53bce0fb0f","mcp_get_code":{"code_sha256":"3b3e8a53bce0fb0f"}},{"arxiv_id":"2501.08282","paper":"/paper/llava-st-a-multimodal-large-language-model","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","date":"2025-01-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"appletea233/LLaVA-ST","path":"llava/model/llava_arch.py","file_url":"https://github.com/appletea233/LLaVA-ST/blob/HEAD/llava/model/llava_arch.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e081f77558b6872a","mcp_get_code":{"code_sha256":"e081f77558b6872a"}},{"arxiv_id":"2412.13303","paper":"/paper/fastvlm-efficient-vision-encoding-for-vision","title":"FastVLM: Efficient Vision Encoding for Vision Language Models","date":"2024-12-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"apple/ml-fastvlm","path":"llava/model/multimodal_encoder/builder.py","file_url":"https://github.com/apple/ml-fastvlm/blob/HEAD/llava/model/multimodal_encoder/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"73da1736ca7c15c3","mcp_get_code":{"code_sha256":"73da1736ca7c15c3"}},{"arxiv_id":"2412.09951","paper":"/paper/wisead-knowledge-augmented-end-to-end","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","date":"2024-12-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wyddmw/WiseAD","path":"mobilevlm/model/vision_encoder.py","file_url":"https://github.com/wyddmw/WiseAD/blob/HEAD/mobilevlm/model/vision_encoder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cd281e119911f887","mcp_get_code":{"code_sha256":"cd281e119911f887"}},{"arxiv_id":"2410.17241","paper":"/paper/frontiers-in-intelligent-colonoscopy","title":"Frontiers in Intelligent Colonoscopy","date":"2024-10-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ai4colonoscopy/intelliscope","path":"colongpt/model/multimodal_encoder/builder.py","file_url":"https://github.com/ai4colonoscopy/intelliscope/blob/HEAD/colongpt/model/multimodal_encoder/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"6c1039e6346f9d13","mcp_get_code":{"code_sha256":"6c1039e6346f9d13"}},{"arxiv_id":"2409.15657","paper":"/paper/mmpt-multimodal-prompt-tuning-for-zero-shot","title":"M$^2$PT: Multimodal Prompt Tuning for Zero-shot Instruction Learning","date":"2024-09-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"william-wang618/m2pt","path":"M2PT/model/llava_archPT.py","file_url":"https://github.com/william-wang618/m2pt/blob/HEAD/M2PT/model/llava_archPT.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a11dbce7f6abb48d","mcp_get_code":{"code_sha256":"a11dbce7f6abb48d"}},{"arxiv_id":"2409.12961","paper":"/paper/oryx-mllm-on-demand-spatial-temporal","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","date":"2024-09-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Oryx-mllm/Oryx","path":"oryx/model/multimodal_encoder/builder.py","file_url":"https://github.com/Oryx-mllm/Oryx/blob/HEAD/oryx/model/multimodal_encoder/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"94ad19a04ab198ad","mcp_get_code":{"code_sha256":"94ad19a04ab198ad"}},{"arxiv_id":"2409.04429","paper":"/paper/vila-u-a-unified-foundation-model-integrating","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","date":"2024-09-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mit-han-lab/vila-u","path":"vila_u/model/multimodal_encoder/builder.py","file_url":"https://github.com/mit-han-lab/vila-u/blob/HEAD/vila_u/model/multimodal_encoder/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6ef3dc934bf9933a","mcp_get_code":{"code_sha256":"6ef3dc934bf9933a"}},{"arxiv_id":"2408.16986","paper":"/paper/adaptvision-dynamic-input-scaling-in-mllms","title":"AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding","date":"2024-08-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"harrytea/adaptvision","path":"llava/model/multimodal_encoder/builder.py","file_url":"https://github.com/harrytea/adaptvision/blob/HEAD/llava/model/multimodal_encoder/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b79ef6a64904cf94","mcp_get_code":{"code_sha256":"b79ef6a64904cf94"}},{"arxiv_id":"2407.08303","paper":"/paper/densefusion-1m-merging-vision-experts-for","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","date":"2024-07-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baaivision/DenseFusion","path":"densefusion/model/multimodal_encoder/builder.py","file_url":"https://github.com/baaivision/DenseFusion/blob/HEAD/densefusion/model/multimodal_encoder/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"38541ff6af9d1575","mcp_get_code":{"code_sha256":"38541ff6af9d1575"}},{"arxiv_id":"2406.19973","paper":"/paper/stllava-med-self-training-large-language-and","title":"STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering","date":"2024-06-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"heliossun/STLLaVA-Med","path":"llava/model/language_model/llava_llama.py","file_url":"https://github.com/heliossun/STLLaVA-Med/blob/HEAD/llava/model/language_model/llava_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b95671438fbf50fa","mcp_get_code":{"code_sha256":"b95671438fbf50fa"}},{"arxiv_id":"2406.12246","paper":"/paper/trol-traversal-of-layers-for-large-language","title":"TroL: Traversal of Layers for Large Language and Vision Models","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ByungKwanLee/TroL","path":"trol/arch_internlm2/modeling_trol.py","file_url":"https://github.com/ByungKwanLee/TroL/blob/HEAD/trol/arch_internlm2/modeling_trol.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"53e08d7b0496620d","mcp_get_code":{"code_sha256":"53e08d7b0496620d"}},{"arxiv_id":"2406.11823","paper":"/paper/on-efficient-language-and-vision-assistants","title":"On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"naver-ai/elva","path":"Elva/encoder_builder.py","file_url":"https://github.com/naver-ai/elva/blob/HEAD/Elva/encoder_builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"d2f4c2f963c75be2","mcp_get_code":{"code_sha256":"d2f4c2f963c75be2"}},{"arxiv_id":"2406.02539","paper":"/paper/parrot-multilingual-visual-instruction-tuning","title":"Parrot: Multilingual Visual Instruction Tuning","date":"2024-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"AIDC-AI/Parrot","path":"parrot/model/multimodal_encoder/builder.py","file_url":"https://github.com/AIDC-AI/Parrot/blob/HEAD/parrot/model/multimodal_encoder/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"aeaec2cd790d9027","mcp_get_code":{"code_sha256":"aeaec2cd790d9027"}},{"arxiv_id":"2405.15738","paper":"/paper/convllava-hierarchical-backbones-as-visual","title":"ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models","date":"2024-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alibaba/conv-llava","path":"llava/model/multimodal_encoder/builder.py","file_url":"https://github.com/alibaba/conv-llava/blob/HEAD/llava/model/multimodal_encoder/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"4562e971e895928a","mcp_get_code":{"code_sha256":"4562e971e895928a"}},{"arxiv_id":"2405.11273","paper":"/paper/uni-moe-scaling-unified-multimodal-llms-with","title":"Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts","date":"2024-05-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hitsz-tmg/umoe-scaling-unified-multimodal-llms","path":"Uni_MoE/Uni_MoE_audio/model/multimodal_encoder/builder.py","file_url":"https://github.com/hitsz-tmg/umoe-scaling-unified-multimodal-llms/blob/HEAD/Uni_MoE/Uni_MoE_audio/model/multimodal_encoder/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9d8ae430eef240b0","mcp_get_code":{"code_sha256":"9d8ae430eef240b0"}},{"arxiv_id":"2404.05673","paper":"/paper/cores-orchestrating-the-dance-of-reasoning","title":"CoReS: Orchestrating the Dance of Reasoning and Segmentation","date":"2024-04-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baoxiaoyi/cores","path":"model/CORES2seg2mask.py","file_url":"https://github.com/baoxiaoyi/cores/blob/HEAD/model/CORES2seg2mask.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f603e54c961dd1f4","mcp_get_code":{"code_sha256":"f603e54c961dd1f4"}},{"arxiv_id":"2404.01331","paper":"/paper/llava-gemma-accelerating-multimodal","title":"LLaVA-Gemma: Accelerating Multimodal Foundation Models with a Compact Language Model","date":"2024-03-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"intellabs/multimodal_cognitive_ai","path":"LLaVA-Gemma/llava/model/multimodal_encoder/builder.py","file_url":"https://github.com/intellabs/multimodal_cognitive_ai/blob/HEAD/LLaVA-Gemma/llava/model/multimodal_encoder/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4a5d89f6478c0361","mcp_get_code":{"code_sha256":"4a5d89f6478c0361"}},{"arxiv_id":"2403.20213","paper":"/paper/h2rsvlm-towards-helpful-and-honest-remote","title":"VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis","date":"2024-03-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opendatalab/h2rsvlm","path":"vhm/model/multimodal_encoder/builder.py","file_url":"https://github.com/opendatalab/h2rsvlm/blob/HEAD/vhm/model/multimodal_encoder/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"bd1ffaf8ecffb66a","mcp_get_code":{"code_sha256":"bd1ffaf8ecffb66a"}},{"arxiv_id":"2403.04652","paper":"/paper/yi-open-foundation-models-by-01-ai","title":"Yi: Open Foundation Models by 01.AI","date":"2024-03-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"01-ai/yi","path":"VL/llava/model/llava_llama.py","file_url":"https://github.com/01-ai/yi/blob/HEAD/VL/llava/model/llava_llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e016ec919cd88d1e","mcp_get_code":{"code_sha256":"e016ec919cd88d1e"}},{"arxiv_id":"2402.18695","paper":"/paper/grounding-language-models-for-visual-entity","title":"Grounding Language Models for Visual Entity Recognition","date":"2024-02-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MrZilinXiao/AutoVER","path":"LLaVA/llava/model/language_model/llava_llama.py","file_url":"https://github.com/MrZilinXiao/AutoVER/blob/HEAD/LLaVA/llava/model/language_model/llava_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"01a59cbdcf1329ec","mcp_get_code":{"code_sha256":"01a59cbdcf1329ec"}},{"arxiv_id":"2402.11684","paper":"/paper/allava-harnessing-gpt4v-synthesized-data-for","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","date":"2024-02-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"freedomintelligence/allava","path":"allava/model/multimodal_encoder/builder.py","file_url":"https://github.com/freedomintelligence/allava/blob/HEAD/allava/model/multimodal_encoder/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9d8ae430eef240b0","mcp_get_code":{"code_sha256":"9d8ae430eef240b0"}},{"arxiv_id":"2402.03766","paper":"/paper/2402-03766","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","date":"2024-02-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"meituan-automl/mobilevlm","path":"mobilevlm/model/vision_encoder.py","file_url":"https://github.com/meituan-automl/mobilevlm/blob/HEAD/mobilevlm/model/vision_encoder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cd281e119911f887","mcp_get_code":{"code_sha256":"cd281e119911f887"}},{"arxiv_id":"2311.13194","paper":"/paper/towards-improving-document-understanding-an","title":"Towards Improving Document Understanding: An Exploration on Text-Grounding via MLLMs","date":"2023-11-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"harrytea/tgdoc","path":"tgdoc/model/multimodal_encoder/builder.py","file_url":"https://github.com/harrytea/tgdoc/blob/HEAD/tgdoc/model/multimodal_encoder/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e1613d78436f15d0","mcp_get_code":{"code_sha256":"e1613d78436f15d0"}},{"arxiv_id":"2306.02858","paper":"/paper/video-llama-an-instruction-tuned-audio-visual","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","date":"2023-06-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"damo-nlp-sg/videollama2","path":"videollama2/model/videollama2_arch.py","file_url":"https://github.com/damo-nlp-sg/videollama2/blob/HEAD/videollama2/model/videollama2_arch.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f61dd94ea06b9f92","mcp_get_code":{"code_sha256":"f61dd94ea06b9f92"}},{"arxiv_id":"2304.08485","paper":"/paper/visual-instruction-tuning-1","title":"Visual Instruction Tuning","date":"2023-04-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dinhvietcuong1996/icme25-inova","path":"llava/model/language_model/llava_llama.py","file_url":"https://github.com/dinhvietcuong1996/icme25-inova/blob/HEAD/llava/model/language_model/llava_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"875ebbe8f3a0c711","mcp_get_code":{"code_sha256":"875ebbe8f3a0c711"}},{"arxiv_id":"2304.08485","paper":"/paper/visual-instruction-tuning-1","title":"Visual Instruction Tuning","date":"2023-04-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ZhangYiqun018/StickerConv","path":"sticker_process/llava/model/language_model/llava_llama.py","file_url":"https://github.com/ZhangYiqun018/StickerConv/blob/HEAD/sticker_process/llava/model/language_model/llava_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"014050859277825c","mcp_get_code":{"code_sha256":"014050859277825c"}},{"arxiv_id":"2304.08485","paper":"/paper/visual-instruction-tuning-1","title":"Visual Instruction Tuning","date":"2023-04-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haotian-liu/LLaVA","path":"llava/model/language_model/llava_llama.py","file_url":"https://github.com/haotian-liu/LLaVA/blob/HEAD/llava/model/language_model/llava_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3ee345b55cc88a11","mcp_get_code":{"code_sha256":"3ee345b55cc88a11"}},{"arxiv_id":"2025.naacl-long.579","paper":null,"title":"arXiv:2025.naacl-long.579","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"DAMO-NLP-SG/VideoLLaMA2","path":"videollama2/model/encoder.py","file_url":"https://github.com/DAMO-NLP-SG/VideoLLaMA2/blob/HEAD/videollama2/model/encoder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f61dd94ea06b9f92","mcp_get_code":{"code_sha256":"f61dd94ea06b9f92"}},{"arxiv_id":"2025.emnlp-main.609","paper":null,"title":"arXiv:2025.emnlp-main.609","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"AuroraZengfh/ModalPrompt","path":"llava/model/language_model/ModalPrompt.py","file_url":"https://github.com/AuroraZengfh/ModalPrompt/blob/HEAD/llava/model/language_model/ModalPrompt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9d8ae430eef240b0","mcp_get_code":{"code_sha256":"9d8ae430eef240b0"}}]}