{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/divide-to-patches","entry":"divide_to_patches","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":65,"n_papers_ran":65,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":1,"n_samples_ran":1,"n_samples_fingerprinted":0,"n_places":65,"n_places_pointer_only":18,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":0,"ran":1,"unverified":0},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2609.00231","paper":"/paper/arxiv-2609-00231","title":"Beyond Language Priors: Diagnosing and Fixing Visual-Origin Hallucinations in Multimodal LLM","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"zxp555/ACFT_MM26","path":"ACFT/llava/mm_utils.py","file_url":"https://github.com/zxp555/ACFT_MM26/blob/HEAD/ACFT/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2607.15299","paper":"/paper/arxiv-2607-15299","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"opendatalab/MLLM-DataEngine","path":"LLaVA/llava/mm_utils.py","file_url":"https://github.com/opendatalab/MLLM-DataEngine/blob/HEAD/LLaVA/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2606.00477","paper":"/paper/arxiv-2606-00477","title":"Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"gxx27/UniKE","path":"BLIP3o/mm_utils.py","file_url":"https://github.com/gxx27/UniKE/blob/HEAD/BLIP3o/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2602.23699","paper":"/paper/arxiv-2602-23699","title":"HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"EIT-NLP/HiDrop","path":"llava/mm_utils.py","file_url":"https://github.com/EIT-NLP/HiDrop/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2602.04184","paper":"/paper/arxiv-2602-04184","title":"Natural Language Instructions for Scene-Responsive Human-in-the-Loop Motion Planning in Autonomous Driving using Vision-Language-Action Models","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"Mi3-Lab/doScenes-VLM-Planning","path":"src/llava/mm_utils.py","file_url":"https://github.com/Mi3-Lab/doScenes-VLM-Planning/blob/HEAD/src/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"AGPL-3.0","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2507.12455","paper":"/paper/mitigating-object-hallucinations-via-sentence","title":"Mitigating Object Hallucinations via Sentence-Level Early Intervention","date":"2025-07-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pspdada/SENTINEL","path":"llava/mm_utils.py","file_url":"https://github.com/pspdada/SENTINEL/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2507.00505","paper":"/paper/llava-sp-enhancing-visual-representation-with","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","date":"2025-07-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"CnFaker/LLaVA-SP","path":"llava/mm_utils.py","file_url":"https://github.com/CnFaker/LLaVA-SP/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2506.17202","paper":"/paper/unifork-exploring-modality-alignment-for","title":"UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation","date":"2025-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tliby/unifork","path":"unifork/mm_utils.py","file_url":"https://github.com/tliby/unifork/blob/HEAD/unifork/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2506.10967","paper":"/paper/beyond-attention-or-similarity-maximizing","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","date":"2025-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"theia-4869/cdpruner","path":"llava/mm_utils.py","file_url":"https://github.com/theia-4869/cdpruner/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2504.01934","paper":"/paper/illume-illuminating-unified-mllm-with-dual","title":"ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement","date":"2025-04-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"illume-unified-mllm/ILLUME_plus","path":"ILLUME/illume/mm_utils.py","file_url":"https://github.com/illume-unified-mllm/ILLUME_plus/blob/HEAD/ILLUME/illume/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2504.00502","paper":null,"title":"arXiv:2504.00502","date":null,"month_inferred_from_arxiv_id":"2025-04","title_source":null,"repo":"icip-cas/ShortV","path":"llava/mm_utils.py","file_url":"https://github.com/icip-cas/ShortV/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2503.16013","paper":"/paper/graspcot-integrating-physical-property","title":"GraspCoT: Integrating Physical Property Reasoning for 6-DoF Grasping under Flexible Language Instructions","date":"2025-03-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cxmomo/GraspCoT","path":"llava/mm_utils.py","file_url":"https://github.com/cxmomo/GraspCoT/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2503.15621","paper":"/paper/llava-more-a-comparative-study-of-llms-and","title":"LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning","date":"2025-03-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aimagelab/LLaVA-MORE","path":"src/llava/mm_utils.py","file_url":"https://github.com/aimagelab/LLaVA-MORE/blob/HEAD/src/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2503.11832","paper":"/paper/safety-mirage-how-spurious-correlations","title":"Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-tuning","date":"2025-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"optml-group/vlm-safety-mu","path":"llava/mm_utils.py","file_url":"https://github.com/optml-group/vlm-safety-mu/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2412.05819","paper":"/paper/cls-token-tells-everything-needed-for","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","date":"2024-12-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thu-mig/vtc-cls","path":"llava/mm_utils.py","file_url":"https://github.com/thu-mig/vtc-cls/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2412.05255","paper":"/paper/teamcraft-a-benchmark-for-multi-modal-multi","title":"TeamCraft: A Benchmark for Multi-Modal Multi-Agent Systems in Minecraft","date":"2024-12-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"teamcraft-bench/teamcraft","path":"llava_teamcraft/llava/mm_utils.py","file_url":"https://github.com/teamcraft-bench/teamcraft/blob/HEAD/llava_teamcraft/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2412.04449","paper":"/paper/p-mod-building-mixture-of-depths-mllms-via","title":"p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay","date":"2024-12-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mcg-nju/p-mod","path":"llava/mm_utils.py","file_url":"https://github.com/mcg-nju/p-mod/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2412.02158","paper":"/paper/agri-llava-knowledge-infused-large-multimodal","title":"Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases","date":"2024-12-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kki2eve/agri-llava","path":"agri_llava/mm_utils.py","file_url":"https://github.com/kki2eve/agri-llava/blob/HEAD/agri_llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2412.01818","paper":"/paper/cls-attention-is-all-you-need-for-training","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","date":"2024-12-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"theia-4869/fastervlm","path":"llava/mm_utils.py","file_url":"https://github.com/theia-4869/fastervlm/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2411.16863","paper":"/paper/augmenting-multimodal-llms-with-self","title":"Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering","date":"2024-11-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aimagelab/reflectiva","path":"llava/mm_utils.py","file_url":"https://github.com/aimagelab/reflectiva/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2411.11066","paper":"/paper/ts-llava-constructing-visual-tokens-through","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","date":"2024-11-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tingyu215/ts-llava","path":"llava/mm_utils.py","file_url":"https://github.com/tingyu215/ts-llava/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2411.10803","paper":"/paper/multi-stage-vision-token-dropping-towards","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","date":"2024-11-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"liuting20/mustdrop","path":"llava/mm_utils.py","file_url":"https://github.com/liuting20/mustdrop/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2410.17434","paper":"/paper/longvu-spatiotemporal-adaptive-compression","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","date":"2024-10-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Vision-CAIR/LongVU","path":"longvu/mm_utils.py","file_url":"https://github.com/Vision-CAIR/LongVU/blob/HEAD/longvu/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2410.17247","paper":"/paper/pyramiddrop-accelerating-your-large-vision","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","date":"2024-10-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cooperx521/pyramiddrop","path":"llava/mm_utils.py","file_url":"https://github.com/cooperx521/pyramiddrop/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2410.16198","paper":"/paper/improve-vision-language-model-chain-of","title":"Improve Vision Language Model Chain-of-thought Reasoning","date":"2024-10-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"riflezhang/llava-reasoner-dpo","path":"llava_reasoner/llava/mm_utils.py","file_url":"https://github.com/riflezhang/llava-reasoner-dpo/blob/HEAD/llava_reasoner/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2410.13360","paper":"/paper/remember-retrieve-and-generate-understanding","title":"RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models","date":"2024-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hoar012/rap-mllm","path":"llava/mm_utils.py","file_url":"https://github.com/hoar012/rap-mllm/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2410.09575","paper":"/paper/reconstructive-visual-instruction-tuning","title":"Reconstructive Visual Instruction Tuning","date":"2024-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haochen-wang409/ross","path":"ross/mm_utils.py","file_url":"https://github.com/haochen-wang409/ross/blob/HEAD/ross/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2410.08119","paper":"/paper/q-vlm-post-training-quantization-for-large","title":"Q-VLM: Post-training Quantization for Large Vision-Language Models","date":"2024-10-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"changyuanwang17/qvlm","path":"llava/mm_utils.py","file_url":"https://github.com/changyuanwang17/qvlm/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2410.07167","paper":"/paper/deciphering-cross-modal-alignment-in-large","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","date":"2024-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shikiw/modality-integration-rate","path":"llava/mm_utils.py","file_url":"https://github.com/shikiw/modality-integration-rate/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2410.07113","paper":"/paper/personalized-visual-instruction-tuning","title":"Personalized Visual Instruction Tuning","date":"2024-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sterzhang/pvit","path":"personalize-llava/llava/mm_utils.py","file_url":"https://github.com/sterzhang/pvit/blob/HEAD/personalize-llava/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2410.04417","paper":"/paper/sparsevlm-visual-token-sparsification-for","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","date":"2024-10-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Gumpest/SparseVLMs","path":"llava/mm_utils.py","file_url":"https://github.com/Gumpest/SparseVLMs/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2410.02080","paper":"/paper/emma-efficient-visual-alignment-in-multi","title":"EMMA: Efficient Visual Alignment in Multi-Modal LLMs","date":"2024-10-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"saraghazanfari/emma","path":"llava/mm_utils.py","file_url":"https://github.com/saraghazanfari/emma/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2410.02745","paper":"/paper/avg-llava-a-large-multimodal-model-with","title":"AVG-LLaVA: A Large Multimodal Model with Adaptive Visual Granularity","date":"2024-09-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"deeplearnxmu/avg-llava","path":"llava/mm_utils.py","file_url":"https://github.com/deeplearnxmu/avg-llava/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2409.19603","paper":"/paper/one-token-to-seg-them-all-language-instructed","title":"One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos","date":"2024-09-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"showlab/videolisa","path":"model/llava/mm_utils.py","file_url":"https://github.com/showlab/videolisa/blob/HEAD/model/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2409.17663","paper":"/paper/explanation-bottleneck-models","title":"Explanation Bottleneck Models","date":"2024-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yshinya6/xbm","path":"xbm-llava/llava/mm_utils.py","file_url":"https://github.com/yshinya6/xbm/blob/HEAD/xbm-llava/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2409.14083","paper":"/paper/surf-teaching-large-vision-language-models-to","title":"SURf: Teaching Large Vision-Language Models to Selectively Utilize Retrieved Information","date":"2024-09-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"GasolSun36/SURf","path":"llava/mm_utils.py","file_url":"https://github.com/GasolSun36/SURf/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2409.10994","paper":"/paper/less-is-more-a-simple-yet-effective-token","title":"Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs","date":"2024-09-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"freedomintelligence/trim","path":"llava/mm_utils.py","file_url":"https://github.com/freedomintelligence/trim/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2409.10683","paper":"/paper/motif-motion-instruction-fine-tuning","title":"MotIF: Motion Instruction Fine-tuning","date":"2024-09-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Minyoung1005/motif","path":"LLaVA/llava/mm_utils.py","file_url":"https://github.com/Minyoung1005/motif/blob/HEAD/LLaVA/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2408.03735","paper":"/paper/advancing-multimodal-large-language-models","title":"Advancing Multimodal Large Language Models with Quantization-Aware Scale Learning for Efficient Adaptation","date":"2024-08-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xjjxmu/qslaw","path":"llava/mm_utils.py","file_url":"https://github.com/xjjxmu/qslaw/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2408.02900","paper":"/paper/2408-02900","title":"MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine","date":"2024-08-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"UCSC-VLAA/MedTrinity-25M","path":"llava/mm_utils.py","file_url":"https://github.com/UCSC-VLAA/MedTrinity-25M/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2408.00491","paper":"/paper/2408-00491","title":"GalleryGPT: Analyzing Paintings with Large Multimodal Models","date":"2024-08-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"steven640pixel/gallerygpt","path":"llava/mm_utils.py","file_url":"https://github.com/steven640pixel/gallerygpt/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2407.15841","paper":"/paper/slowfast-llava-a-strong-training-free","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","date":"2024-07-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"apple/ml-slowfast-llava","path":"slowfast_llava/llava/mm_utils.py","file_url":"https://github.com/apple/ml-slowfast-llava/blob/HEAD/slowfast_llava/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2406.20092","paper":"/paper/llavolta-efficient-multi-modal-models-via","title":"Efficient Large Multi-modal Models via Visual Context Compression","date":"2024-06-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Beckschen/LLaVolta","path":"llava/mm_utils.py","file_url":"https://github.com/Beckschen/LLaVolta/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2406.16562","paper":"/paper/evalalign-evaluating-text-to-image-models","title":"EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models","date":"2024-06-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sais-fuxi/evalalign","path":"evalalign/mm_utils.py","file_url":"https://github.com/sais-fuxi/evalalign/blob/HEAD/evalalign/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2406.12275","paper":"/paper/voco-llama-towards-vision-compression-with","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Yxxxb/VoCo-LLaMA","path":"llava/mm_utils.py","file_url":"https://github.com/Yxxxb/VoCo-LLaMA/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2406.11823","paper":"/paper/on-efficient-language-and-vision-assistants","title":"On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"naver-ai/elva","path":"Elva/mm_utils.py","file_url":"https://github.com/naver-ai/elva/blob/HEAD/Elva/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2406.11327","paper":"/paper/clawmachine-fetching-visual-tokens-as-an","title":"ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"martian422/ClawMachine","path":"ClawMachine/mm_utils.py","file_url":"https://github.com/martian422/ClawMachine/blob/HEAD/ClawMachine/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2406.10995","paper":"/paper/concept-skill-transferability-based-data","title":"Concept-skill Transferability-based Data Selection for Large Vision-Language Models","date":"2024-06-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"g-jwlee/coincide_code","path":"COINCIDE_cluster/tinyllava/mm_utils.py","file_url":"https://github.com/g-jwlee/coincide_code/blob/HEAD/COINCIDE_cluster/tinyllava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2405.19315","paper":"/paper/matryoshka-query-transformer-for-large-vision","title":"Matryoshka Query Transformer for Large Vision-Language Models","date":"2024-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gordonhu608/mqt-llava","path":"llava/mm_utils.py","file_url":"https://github.com/gordonhu608/mqt-llava/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2405.15738","paper":"/paper/convllava-hierarchical-backbones-as-visual","title":"ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models","date":"2024-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alibaba/conv-llava","path":"llava/mm_utils.py","file_url":"https://github.com/alibaba/conv-llava/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2405.07798","paper":"/paper/freeva-offline-mllm-as-training-free-video","title":"FreeVA: Offline MLLM as Training-Free Video Assistant","date":"2024-05-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"whwu95/freeva","path":"llava/mm_utils.py","file_url":"https://github.com/whwu95/freeva/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2405.05949","paper":"/paper/cumo-scaling-multimodal-llm-with-co-upcycled","title":"CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts","date":"2024-05-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shi-labs/cumo","path":"cumo/mm_utils.py","file_url":"https://github.com/shi-labs/cumo/blob/HEAD/cumo/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2405.05803","paper":"/paper/boosting-multimodal-large-language-models","title":"Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference","date":"2024-05-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lzhxmu/vtw","path":"llava/mm_utils.py","file_url":"https://github.com/lzhxmu/vtw/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2404.13046","paper":"/paper/mova-adapting-mixture-of-vision-experts-to","title":"MoVA: Adapting Mixture of Vision Experts to Multimodal Context","date":"2024-04-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"templex98/mova","path":"mova/mm_utils.py","file_url":"https://github.com/templex98/mova/blob/HEAD/mova/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2402.14545","paper":"/paper/less-is-more-mitigating-multimodal","title":"Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective","date":"2024-02-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yuezih/less-is-more","path":"LLaVA/llava/mm_utils.py","file_url":"https://github.com/yuezih/less-is-more/blob/HEAD/LLaVA/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2402.11411","paper":"/paper/aligning-modalities-in-vision-large-language","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","date":"2024-02-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yiyangzhou/povid","path":"llava/mm_utils.py","file_url":"https://github.com/yiyangzhou/povid/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2312.17243","paper":"/paper/unsupervised-universal-image-segmentation","title":"Unsupervised Universal Image Segmentation","date":"2023-12-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dantong88/llarva","path":"llava/mm_utils.py","file_url":"https://github.com/dantong88/llarva/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2311.07362","paper":"/paper/volcano-mitigating-multimodal-hallucination","title":"Volcano: Mitigating Multimodal Hallucination through Self-Feedback Guided Revision","date":"2023-11-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kaistai/volcano","path":"llava/mm_utils.py","file_url":"https://github.com/kaistai/volcano/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2310.08588","paper":"/paper/octopus-embodied-vision-language-programmer","title":"Octopus: Embodied Vision-Language Programmer from Environmental Feedback","date":"2023-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dongyh20/octopus","path":"octopus/LLaVA/llava/mm_utils.py","file_url":"https://github.com/dongyh20/octopus/blob/HEAD/octopus/LLaVA/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2308.13566","paper":"/paper/mllm-dataengine-an-iterative-refinement","title":"MLLM-DataEngine: An Iterative Refinement Approach for MLLM","date":"2023-08-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opendatalab/mllm-dataengine","path":"LLaVA/llava/mm_utils.py","file_url":"https://github.com/opendatalab/mllm-dataengine/blob/HEAD/LLaVA/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2106.06909","paper":"/paper/gigaspeech-an-evolving-multi-domain-asr","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","date":"2021-06-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"maikezuefle/contr-pretraining","path":"llava/mm_utils.py","file_url":"https://github.com/maikezuefle/contr-pretraining/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"Zhang_Beyond_Training_Dynamic_Token_Merging_for_Zero-Shot_Video_Understanding_ICCV_2025_paper","paper":null,"title":"arXiv:Zhang_Beyond_Training_Dynamic_Token_Merging_for_Zero-Shot_Video_Understanding_ICCV_2025_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"Jam1ezhang/DYTO","path":"dyto/llava/mm_utils.py","file_url":"https://github.com/Jam1ezhang/DYTO/blob/HEAD/dyto/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"Xing_Conical_Visual_Concentration_for_Efficient_Large_Vision-Language_Models_CVPR_2025_paper","paper":null,"title":"arXiv:Xing_Conical_Visual_Concentration_for_Efficient_Large_Vision-Language_Models_CVPR_2025_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"Cooperx521/PyramidDrop","path":"llava/mm_utils.py","file_url":"https://github.com/Cooperx521/PyramidDrop/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2025.findings-acl.865","paper":null,"title":"arXiv:2025.findings-acl.865","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"DeepLearnXMU/AVG-LLaVA","path":"llava/mm_utils.py","file_url":"https://github.com/DeepLearnXMU/AVG-LLaVA/blob/HEAD/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}},{"arxiv_id":"2025.findings-acl.458","paper":null,"title":"arXiv:2025.findings-acl.458","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"DCDmllm/Align2LLaVA","path":"reward_model/llava/mm_utils.py","file_url":"https://github.com/DCDmllm/Align2LLaVA/blob/HEAD/reward_model/llava/mm_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e03b180fa317c9a","mcp_get_code":{"code_sha256":"7e03b180fa317c9a"}}]}