{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/image-parser","entry":"image_parser","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":19,"n_papers_ran":17,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":3,"n_samples_ran":1,"n_samples_fingerprinted":0,"n_places":19,"n_places_pointer_only":8,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":1,"ran_fixture":0,"ran":0,"unverified":2},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2507.15504","paper":null,"title":"arXiv:2507.15504","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"PKU-YuanGroup/Video-LLaVA","path":"videollava/eval/run_llava.py","file_url":"https://github.com/PKU-YuanGroup/Video-LLaVA/blob/HEAD/videollava/eval/run_llava.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2507.06908","paper":"/paper/mind-a-multi-agent-framework-for-zero-shot","title":"MIND: A Multi-agent Framework for Zero-shot Harmful Meme Detection","date":"2025-07-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"destroy-lonely/MIND","path":"utils/run_llava.py","file_url":"https://github.com/destroy-lonely/MIND/blob/HEAD/utils/run_llava.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"449f2614cedc594b","mcp_get_code":{"code_sha256":"449f2614cedc594b"}},{"arxiv_id":"2501.03895","paper":"/paper/llava-mini-efficient-image-and-video-large","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","date":"2025-01-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2412.12359","paper":"/paper/visual-instruction-tuning-with-500x-fewer","title":"LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering","date":"2024-12-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bibisbar/LLaVA-Steering","path":"tinyllava/eval/run_tiny_llava.py","file_url":"https://github.com/bibisbar/LLaVA-Steering/blob/HEAD/tinyllava/eval/run_tiny_llava.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2411.05383","paper":"/paper/towards-low-resource-harmful-meme-detection","title":"Towards Low-Resource Harmful Meme Detection with LMM Agents","date":"2024-11-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jianzhao-huang/lorehm","path":"utils/run_llava.py","file_url":"https://github.com/jianzhao-huang/lorehm/blob/HEAD/utils/run_llava.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2410.22313","paper":"/paper/senna-bridging-large-vision-language-models","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","date":"2024-10-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hustvl/senna","path":"data_tools/senna_qa_utils.py","file_url":"https://github.com/hustvl/senna/blob/HEAD/data_tools/senna_qa_utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2410.16236","paper":"/paper/llava-kd-a-framework-of-distilling-multimodal","title":"LLaVA-KD: A Framework of Distilling Multimodal Large Language Models","date":"2024-10-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Fantasyele/LLaVA-KD","path":"llavakd/eval/run_tiny_llava.py","file_url":"https://github.com/Fantasyele/LLaVA-KD/blob/HEAD/llavakd/eval/run_tiny_llava.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2409.17143","paper":"/paper/attention-prompting-on-image-for-large-vision","title":"Attention Prompting on Image for Large Vision-Language Models","date":"2024-09-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2409.13682","paper":"/paper/remembr-building-and-reasoning-over-long","title":"ReMEmbR: Building and Reasoning Over Long-Horizon Spatio-Temporal Memory for Robot Navigation","date":"2024-09-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"NVIDIA-AI-IOT/remembr","path":"remembr/captioners/vila_captioner.py","file_url":"https://github.com/NVIDIA-AI-IOT/remembr/blob/HEAD/remembr/captioners/vila_captioner.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2408.15881","paper":"/paper/llava-mod-making-llava-tiny-via-moe-knowledge","title":"LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation","date":"2024-08-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shufangxun/llava-mod","path":"llavamod/eval/run_llava.py","file_url":"https://github.com/shufangxun/llava-mod/blob/HEAD/llavamod/eval/run_llava.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2408.00491","paper":"/paper/2408-00491","title":"GalleryGPT: Analyzing Paintings with Large Multimodal Models","date":"2024-08-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"steven640pixel/gallerygpt","path":"llava/eval/run_llava.py","file_url":"https://github.com/steven640pixel/gallerygpt/blob/HEAD/llava/eval/run_llava.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2406.16562","paper":"/paper/evalalign-evaluating-text-to-image-models","title":"EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models","date":"2024-06-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2405.19716","paper":"/paper/enhancing-large-vision-language-models-with","title":"Enhancing Large Vision Language Models with Self-Training on Image Comprehension","date":"2024-05-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2405.19315","paper":"/paper/matryoshka-query-transformer-for-large-vision","title":"Matryoshka Query Transformer for Large Vision-Language Models","date":"2024-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2404.10618","paper":"/paper/private-attribute-inference-from-images-with","title":"Private Attribute Inference from Images with Vision-Language Models","date":"2024-04-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"eth-sri/privacy-inference-multimodal","path":"Experimentation/LLaVa-NeXT/run_llava.py","file_url":"https://github.com/eth-sri/privacy-inference-multimodal/blob/HEAD/Experimentation/LLaVa-NeXT/run_llava.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2311.05437","paper":"/paper/llava-plus-learning-to-use-tools-for-creating","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","date":"2023-11-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2304.08485","paper":"/paper/visual-instruction-tuning-1","title":"Visual Instruction Tuning","date":"2023-04-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ictnlp/LLaVA-Mini","path":"llavamini/eval/run_llava_mini.py","file_url":"https://github.com/ictnlp/LLaVA-Mini/blob/HEAD/llavamini/eval/run_llava_mini.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}},{"arxiv_id":"2025.findings-acl.979","paper":null,"title":"arXiv:2025.findings-acl.979","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"Mrshenshen/FRUIT","path":"models/caption.py","file_url":"https://github.com/Mrshenshen/FRUIT/blob/HEAD/models/caption.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"87e7eefadf4a0f7c","mcp_get_code":{"code_sha256":"87e7eefadf4a0f7c"}},{"arxiv_id":"2024.findings-emnlp.268","paper":null,"title":"arXiv:2024.findings-emnlp.268","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"HZQ950419/Math-LLaVA","path":"llava/eval/run_llava.py","file_url":"https://github.com/HZQ950419/Math-LLaVA/blob/HEAD/llava/eval/run_llava.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a7bee88c1c7fd6a3","mcp_get_code":{"code_sha256":"a7bee88c1c7fd6a3"}}]}