{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/build-vision-projector","entry":"build_vision_projector","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":23,"n_papers_ran":15,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":19,"n_samples_ran":13,"n_samples_fingerprinted":0,"n_places":25,"n_places_pointer_only":11,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":9,"ran_fixture":0,"ran":4,"unverified":6},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2607.09126","paper":"/paper/arxiv-2607-09126","title":"VTaMo: Video-Text Alignment Model for Sign Language Translation","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"junyi2005/vtamo","path":"vtamo/mm_projector.py","file_url":"https://github.com/junyi2005/vtamo/blob/HEAD/vtamo/mm_projector.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"f7a5fc1ab99ecd55","mcp_get_code":{"code_sha256":"f7a5fc1ab99ecd55"}},{"arxiv_id":"2603.21426","paper":"/paper/arxiv-2603-21426","title":"Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"Jingchensun/beta-kd","path":"mobilevlm/model/vision_projector.py","file_url":"https://github.com/Jingchensun/beta-kd/blob/HEAD/mobilevlm/model/vision_projector.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0100980e0d43fee3","mcp_get_code":{"code_sha256":"0100980e0d43fee3"}},{"arxiv_id":"2506.17202","paper":"/paper/unifork-exploring-modality-alignment-for","title":"UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation","date":"2025-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tliby/unifork","path":"unifork/model/projector.py","file_url":"https://github.com/tliby/unifork/blob/HEAD/unifork/model/projector.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d9010a83f7ea789c","mcp_get_code":{"code_sha256":"d9010a83f7ea789c"}},{"arxiv_id":"2505.19474","paper":"/paper/causal-llava-causal-disentanglement-for","title":"Causal-LLaVA: Causal Disentanglement for Mitigating Hallucination in Multimodal Large Language Models","date":"2025-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ignisavium/causal-llava","path":"llava/model/multimodal_projector/builder.py","file_url":"https://github.com/ignisavium/causal-llava/blob/HEAD/llava/model/multimodal_projector/builder.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"544bc3a3805f703a","mcp_get_code":{"code_sha256":"544bc3a3805f703a"}},{"arxiv_id":"2505.19474","paper":"/paper/causal-llava-causal-disentanglement-for","title":"Causal-LLaVA: Causal Disentanglement for Mitigating Hallucination in Multimodal Large Language Models","date":"2025-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ignisavium/causal-llava","path":"confounders/get_projector_confounders.py","file_url":"https://github.com/ignisavium/causal-llava/blob/HEAD/confounders/get_projector_confounders.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9d0bc30615da7d73","mcp_get_code":{"code_sha256":"9d0bc30615da7d73"}},{"arxiv_id":"2505.00275","paper":"/paper/adcare-vlm-leveraging-large-vision-language","title":"AdCare-VLM: Leveraging Large Vision Language Model (LVLM) to Monitor Long-Term Medication Adherence and Care","date":"2025-05-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"asad14053/AdCare-VLM","path":"videollava/model/language_model/llava_llama.py","file_url":"https://github.com/asad14053/AdCare-VLM/blob/HEAD/videollava/model/language_model/llava_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ef4db0da176c674c","mcp_get_code":{"code_sha256":"ef4db0da176c674c"}},{"arxiv_id":"2503.03803","paper":"/paper/egolife-towards-egocentric-life-assistant","title":"EgoLife: Towards Egocentric Life Assistant","date":"2025-03-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"evolvinglmms-lab/egolife","path":"EgoGPT/egogpt/model/language_model/egogpt_llama.py","file_url":"https://github.com/evolvinglmms-lab/egolife/blob/HEAD/EgoGPT/egogpt/model/language_model/egogpt_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"6ac637835afcffbf","mcp_get_code":{"code_sha256":"6ac637835afcffbf"}},{"arxiv_id":"2501.13106","paper":"/paper/videollama-3-frontier-multimodal-foundation","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","date":"2025-01-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"damo-nlp-sg/videollama3","path":"inference/transformers_api/modeling_videollama3.py","file_url":"https://github.com/damo-nlp-sg/videollama3/blob/HEAD/inference/transformers_api/modeling_videollama3.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"8409d5a94c95a154","mcp_get_code":{"code_sha256":"8409d5a94c95a154"}},{"arxiv_id":"2501.03218","paper":"/paper/dispider-enabling-video-llms-with-active-real","title":"Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction","date":"2025-01-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Mark12Ding/Dispider","path":"dispider/model/projectors.py","file_url":"https://github.com/Mark12Ding/Dispider/blob/HEAD/dispider/model/projectors.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"58a4a0132d489ed1","mcp_get_code":{"code_sha256":"58a4a0132d489ed1"}},{"arxiv_id":"2412.11863","paper":"/paper/geox-geometric-problem-solving-through","title":"GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-training","date":"2024-12-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alpha-innovator/geox","path":"models/builder.py","file_url":"https://github.com/alpha-innovator/geox/blob/HEAD/models/builder.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ef4db0da176c674c","mcp_get_code":{"code_sha256":"ef4db0da176c674c"}},{"arxiv_id":"2412.09951","paper":"/paper/wisead-knowledge-augmented-end-to-end","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","date":"2024-12-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wyddmw/WiseAD","path":"mobilevlm/model/vision_projector.py","file_url":"https://github.com/wyddmw/WiseAD/blob/HEAD/mobilevlm/model/vision_projector.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0100980e0d43fee3","mcp_get_code":{"code_sha256":"0100980e0d43fee3"}},{"arxiv_id":"2410.17241","paper":"/paper/frontiers-in-intelligent-colonoscopy","title":"Frontiers in Intelligent Colonoscopy","date":"2024-10-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ai4colonoscopy/intelliscope","path":"colongpt/model/multimodal_projector/builder.py","file_url":"https://github.com/ai4colonoscopy/intelliscope/blob/HEAD/colongpt/model/multimodal_projector/builder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9f86dd0b9bd9a73e","mcp_get_code":{"code_sha256":"9f86dd0b9bd9a73e"}},{"arxiv_id":"2407.02392","paper":"/paper/tokenpacker-efficient-visual-projector-for","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","date":"2024-07-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"circleradon/tokenpacker","path":"llava/model/multimodal_projector/builder.py","file_url":"https://github.com/circleradon/tokenpacker/blob/HEAD/llava/model/multimodal_projector/builder.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"65b5e7ce2771cc06","mcp_get_code":{"code_sha256":"65b5e7ce2771cc06"}},{"arxiv_id":"2406.19973","paper":"/paper/stllava-med-self-training-large-language-and","title":"STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering","date":"2024-06-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"heliossun/STLLaVA-Med","path":"llava/model/language_model/llava_llama.py","file_url":"https://github.com/heliossun/STLLaVA-Med/blob/HEAD/llava/model/language_model/llava_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fba2ee2fd7519dce","mcp_get_code":{"code_sha256":"fba2ee2fd7519dce"}},{"arxiv_id":"2406.12246","paper":"/paper/trol-traversal-of-layers-for-large-language","title":"TroL: Traversal of Layers for Large Language and Vision Models","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ByungKwanLee/TroL","path":"trol/arch_internlm2/modeling_trol.py","file_url":"https://github.com/ByungKwanLee/TroL/blob/HEAD/trol/arch_internlm2/modeling_trol.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4836c910f4ac2e06","mcp_get_code":{"code_sha256":"4836c910f4ac2e06"}},{"arxiv_id":"2406.12246","paper":"/paper/trol-traversal-of-layers-for-large-language","title":"TroL: Traversal of Layers for Large Language and Vision Models","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"byungkwanlee/trol","path":"trol/arch_internlm2/build_module.py","file_url":"https://github.com/byungkwanlee/trol/blob/HEAD/trol/arch_internlm2/build_module.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ec01154f26b3b92e","mcp_get_code":{"code_sha256":"ec01154f26b3b92e"}},{"arxiv_id":"2406.11839","paper":"/paper/mdpo-conditional-preference-optimization-for","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"luka-group/mDPO","path":"bunny/modeling_bunny_phi.py","file_url":"https://github.com/luka-group/mDPO/blob/HEAD/bunny/modeling_bunny_phi.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a42bf90646a3347f","mcp_get_code":{"code_sha256":"a42bf90646a3347f"}},{"arxiv_id":"2406.02539","paper":"/paper/parrot-multilingual-visual-instruction-tuning","title":"Parrot: Multilingual Visual Instruction Tuning","date":"2024-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"AIDC-AI/Parrot","path":"parrot/model/multimodal_projector/builder.py","file_url":"https://github.com/AIDC-AI/Parrot/blob/HEAD/parrot/model/multimodal_projector/builder.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"ef4db0da176c674c","mcp_get_code":{"code_sha256":"ef4db0da176c674c"}},{"arxiv_id":"2405.11273","paper":"/paper/uni-moe-scaling-unified-multimodal-llms-with","title":"Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts","date":"2024-05-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hitsz-tmg/umoe-scaling-unified-multimodal-llms","path":"Uni_MoE/Uni_MoE_audio/model/multimodal_projector/builder.py","file_url":"https://github.com/hitsz-tmg/umoe-scaling-unified-multimodal-llms/blob/HEAD/Uni_MoE/Uni_MoE_audio/model/multimodal_projector/builder.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ef4db0da176c674c","mcp_get_code":{"code_sha256":"ef4db0da176c674c"}},{"arxiv_id":"2404.01331","paper":"/paper/llava-gemma-accelerating-multimodal","title":"LLaVA-Gemma: Accelerating Multimodal Foundation Models with a Compact Language Model","date":"2024-03-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"intellabs/multimodal_cognitive_ai","path":"LLaVA-Gemma/llava/model/multimodal_projector/builder.py","file_url":"https://github.com/intellabs/multimodal_cognitive_ai/blob/HEAD/LLaVA-Gemma/llava/model/multimodal_projector/builder.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ef4db0da176c674c","mcp_get_code":{"code_sha256":"ef4db0da176c674c"}},{"arxiv_id":"2403.04652","paper":"/paper/yi-open-foundation-models-by-01-ai","title":"Yi: Open Foundation Models by 01.AI","date":"2024-03-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"01-ai/yi","path":"VL/llava/model/llava_llama.py","file_url":"https://github.com/01-ai/yi/blob/HEAD/VL/llava/model/llava_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9fa178e6891384f1","mcp_get_code":{"code_sha256":"9fa178e6891384f1"}},{"arxiv_id":"2402.03766","paper":"/paper/2402-03766","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","date":"2024-02-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"meituan-automl/mobilevlm","path":"mobilevlm/model/vision_projector.py","file_url":"https://github.com/meituan-automl/mobilevlm/blob/HEAD/mobilevlm/model/vision_projector.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0100980e0d43fee3","mcp_get_code":{"code_sha256":"0100980e0d43fee3"}},{"arxiv_id":"2306.02858","paper":"/paper/video-llama-an-instruction-tuned-audio-visual","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","date":"2023-06-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"damo-nlp-sg/videollama2","path":"videollama2/model/videollama2_arch.py","file_url":"https://github.com/damo-nlp-sg/videollama2/blob/HEAD/videollama2/model/videollama2_arch.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7aa936fbe4f3d6fe","mcp_get_code":{"code_sha256":"7aa936fbe4f3d6fe"}},{"arxiv_id":"2304.08485","paper":"/paper/visual-instruction-tuning-1","title":"Visual Instruction Tuning","date":"2023-04-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dinhvietcuong1996/icme25-inova","path":"llava/model/language_model/llava_llama.py","file_url":"https://github.com/dinhvietcuong1996/icme25-inova/blob/HEAD/llava/model/language_model/llava_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"ea7ba84c548c5a33","mcp_get_code":{"code_sha256":"ea7ba84c548c5a33"}},{"arxiv_id":"2025.naacl-long.579","paper":null,"title":"arXiv:2025.naacl-long.579","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"DAMO-NLP-SG/VideoLLaMA2","path":"videollama2/model/projector.py","file_url":"https://github.com/DAMO-NLP-SG/VideoLLaMA2/blob/HEAD/videollama2/model/projector.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b52010a2b2ad8f78","mcp_get_code":{"code_sha256":"b52010a2b2ad8f78"}}]}