{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/maybe-zero-3","entry":"maybe_zero_3","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":74,"n_papers_ran":1,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":9,"n_samples_ran":1,"n_samples_fingerprinted":1,"n_places":83,"n_places_pointer_only":53,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":1,"ran_fixture":0,"ran":0,"unverified":8},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.04405","paper":"/paper/arxiv-2608-04405","title":"Training-Free Hashing-Based Attention via Binary Principal Components","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2605.20247","paper":"/paper/arxiv-2605-20247","title":"CP-MoE: Consistency-Preserving Mixture-of-Experts for Continual Learning","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"YangLiu-Lewis/CP-MoE","path":"llava/train/train_MOE.py","file_url":"https://github.com/YangLiu-Lewis/CP-MoE/blob/HEAD/llava/train/train_MOE.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2605.18903","paper":"/paper/arxiv-2605-18903","title":"Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"lluosi/RDB-CL","path":"ETrain/Train/Base_trainer.py","file_url":"https://github.com/lluosi/RDB-CL/blob/HEAD/ETrain/Train/Base_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2602.02108","paper":"/paper/arxiv-2602-02108","title":"Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"wenhaoli-xmu/OOMB","path":"chunkoptim/modifier.py","file_url":"https://github.com/wenhaoli-xmu/OOMB/blob/HEAD/chunkoptim/modifier.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2601.02443","paper":"/paper/arxiv-2601-02443","title":"Evaluating the Diagnostic Classification Ability of Multimodal Large Language Models: Insights from the Osteoarthritis Initiative","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"wanglihx/LLaVA-OA","path":"llava_trainer_weighted.py","file_url":"https://github.com/wanglihx/LLaVA-OA/blob/HEAD/llava_trainer_weighted.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2601.02443","paper":"/paper/arxiv-2601-02443","title":"Evaluating the Diagnostic Classification Ability of Multimodal Large Language Models: Insights from the Osteoarthritis Initiative","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"wanglihx/LLaVA-OA","path":"train_weighted.py","file_url":"https://github.com/wanglihx/LLaVA-OA/blob/HEAD/train_weighted.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2510.17847","paper":"/paper/arxiv-2510-17847","title":"COIDO: Efficient Data Selection for Visual Instruction Tuning via Coupled Importance-Diversity Optimization","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"SuDIS-ZJU/CoIDO","path":"coido_scorer/coido_trainer.py","file_url":"https://github.com/SuDIS-ZJU/CoIDO/blob/HEAD/coido_scorer/coido_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"AGPL-3.0","inline_ok":false,"code_sha256_prefix":"64c18975ebd3ed40","mcp_get_code":{"code_sha256":"64c18975ebd3ed40"}},{"arxiv_id":"2510.17847","paper":"/paper/arxiv-2510-17847","title":"COIDO: Efficient Data Selection for Visual Instruction Tuning via Coupled Importance-Diversity Optimization","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"SuDIS-ZJU/CoIDO","path":"coido_scorer/stage1.py","file_url":"https://github.com/SuDIS-ZJU/CoIDO/blob/HEAD/coido_scorer/stage1.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"AGPL-3.0","inline_ok":false,"code_sha256_prefix":"46e09ebb15e4afb6","mcp_get_code":{"code_sha256":"46e09ebb15e4afb6"}},{"arxiv_id":"2507.15504","paper":null,"title":"arXiv:2507.15504","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"PKU-YuanGroup/Video-LLaVA","path":"videollava/train/llava_trainer.py","file_url":"https://github.com/PKU-YuanGroup/Video-LLaVA/blob/HEAD/videollava/train/llava_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2506.08391","paper":"/paper/second-mitigating-perceptual-hallucination-in","title":"SECOND: Mitigating Perceptual Hallucination in Vision-Language Models via Selective and Contrastive Decoding","date":"2025-06-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2505.21906","paper":"/paper/vision-language-action-model-with-open-world","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","date":"2025-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tutujingyugang1/ChatVLA_public","path":"qwen2_vla/model_load_utils.py","file_url":"https://github.com/tutujingyugang1/ChatVLA_public/blob/HEAD/qwen2_vla/model_load_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2505.17862","paper":"/paper/daily-omni-towards-audio-visual-reasoning","title":"Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities","date":"2025-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2505.09568","paper":"/paper/blip3-o-a-family-of-fully-open-unified","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","date":"2025-05-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2505.00703","paper":"/paper/t2i-r1-reinforcing-image-generation-with","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","date":"2025-05-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2503.20047","paper":"/paper/med3dvlm-an-efficient-vision-language-model","title":"Med3DVLM: An Efficient Vision-Language Model for 3D Medical Image Analysis","date":"2025-03-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mirthai/med3dvlm","path":"src/train/train_vlm.py","file_url":"https://github.com/mirthai/med3dvlm/blob/HEAD/src/train/train_vlm.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2503.11832","paper":"/paper/safety-mirage-how-spurious-correlations","title":"Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-tuning","date":"2025-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"OPTML-Group/VLM-Safety-Unlearn","path":"llava/train/llava_unlearn_full_trainer.py","file_url":"https://github.com/OPTML-Group/VLM-Safety-Unlearn/blob/HEAD/llava/train/llava_unlearn_full_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2503.11832","paper":"/paper/safety-mirage-how-spurious-correlations","title":"Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-tuning","date":"2025-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"OPTML-Group/VLM-Safety-Unlearn","path":"llava/train/train_unlearn.py","file_url":"https://github.com/OPTML-Group/VLM-Safety-Unlearn/blob/HEAD/llava/train/train_unlearn.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2503.05379","paper":"/paper/r1-omni-explainable-omni-multimodal-emotion","title":"R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning","date":"2025-03-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2503.00723","paper":"/paper/re-imagining-multimodal-instruction-tuning-a","title":"Re-Imagining Multimodal Instruction Tuning: A Representation View","date":"2025-03-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2502.13130","paper":"/paper/magma-a-foundation-model-for-multimodal-ai","title":"Magma: A Foundation Model for Multimodal AI Agents","date":"2025-02-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"microsoft/Magma","path":"trainer/trainer.py","file_url":"https://github.com/microsoft/Magma/blob/HEAD/trainer/trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2502.09990","paper":"/paper/x-boundary-establishing-exact-safety-boundary","title":"X-Boundary: Establishing Exact Safety Boundary to Shield LLMs from Multi-Turn Jailbreaks without Compromising Usability","date":"2025-02-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ai45lab/x-boundary","path":"src/lorra_x_boundary.py","file_url":"https://github.com/ai45lab/x-boundary/blob/HEAD/src/lorra_x_boundary.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"16f29eca39ef4fff","mcp_get_code":{"code_sha256":"16f29eca39ef4fff"}},{"arxiv_id":"2502.04328","paper":"/paper/ola-pushing-the-frontiers-of-omni-modal","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","date":"2025-02-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ola-omni/ola","path":"ola/utils.py","file_url":"https://github.com/ola-omni/ola/blob/HEAD/ola/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"720e6dbf9d7eb553","mcp_get_code":{"code_sha256":"720e6dbf9d7eb553"}},{"arxiv_id":"2501.13106","paper":"/paper/videollama-3-frontier-multimodal-foundation","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","date":"2025-01-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"damo-nlp-sg/videollama3","path":"videollama3/videollama3_trainer.py","file_url":"https://github.com/damo-nlp-sg/videollama3/blob/HEAD/videollama3/videollama3_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2501.09695","paper":"/paper/mitigating-hallucinations-in-large-vision-3","title":"Mitigating Hallucinations in Large Vision-Language Models via DPO: On-Policy Data Hold the Key","date":"2025-01-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhyang2226/opa-dpo","path":"opadpo/opa_models/opa_trainer.py","file_url":"https://github.com/zhyang2226/opa-dpo/blob/HEAD/opadpo/opa_models/opa_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2501.09695","paper":"/paper/mitigating-hallucinations-in-large-vision-3","title":"Mitigating Hallucinations in Large Vision-Language Models via DPO: On-Policy Data Hold the Key","date":"2025-01-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhyang2226/opa-dpo","path":"opadpo/opa_train.py","file_url":"https://github.com/zhyang2226/opa-dpo/blob/HEAD/opadpo/opa_train.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2412.16117","paper":"/paper/prunevid-visual-token-pruning-for-efficient","title":"PruneVid: Visual Token Pruning for Efficient Video Large Language Models","date":"2024-12-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2412.06141","paper":"/paper/mmedpo-aligning-medical-vision-language","title":"MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization","date":"2024-12-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aiming-lab/mmedpo","path":"train/dpo/llava_trainer_weighted.py","file_url":"https://github.com/aiming-lab/mmedpo/blob/HEAD/train/dpo/llava_trainer_weighted.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2411.14432","paper":"/paper/insight-v-exploring-long-chain-visual","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","date":"2024-11-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2411.02327","paper":"/paper/ppllava-varied-video-sequence-understanding","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","date":"2024-11-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2410.22313","paper":"/paper/senna-bridging-large-vision-language-models","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","date":"2024-10-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hustvl/senna","path":"llava/senna/senna_llava_trainer.py","file_url":"https://github.com/hustvl/senna/blob/HEAD/llava/senna/senna_llava_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2410.22313","paper":"/paper/senna-bridging-large-vision-language-models","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","date":"2024-10-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hustvl/senna","path":"llava/senna/train_senna_llava_laion_pretrain.py","file_url":"https://github.com/hustvl/senna/blob/HEAD/llava/senna/train_senna_llava_laion_pretrain.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2410.17434","paper":"/paper/longvu-spatiotemporal-adaptive-compression","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","date":"2024-10-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Vision-CAIR/LongVU","path":"longvu/mm_datautils.py","file_url":"https://github.com/Vision-CAIR/LongVU/blob/HEAD/longvu/mm_datautils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"25aaa1a93cc25f4d","mcp_get_code":{"code_sha256":"25aaa1a93cc25f4d"}},{"arxiv_id":"2410.16198","paper":"/paper/improve-vision-language-model-chain-of","title":"Improve Vision Language Model Chain-of-thought Reasoning","date":"2024-10-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"riflezhang/llava-hound-dpo","path":"llava_hound_dpo/dpo_scripts/run_dpo.py","file_url":"https://github.com/riflezhang/llava-hound-dpo/blob/HEAD/llava_hound_dpo/dpo_scripts/run_dpo.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2410.13360","paper":"/paper/remember-retrieve-and-generate-understanding","title":"RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models","date":"2024-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hoar012/rap-mllm","path":"llava/train/rap_train.py","file_url":"https://github.com/hoar012/rap-mllm/blob/HEAD/llava/train/rap_train.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2410.13085","paper":"/paper/mmed-rag-versatile-multimodal-rag-system-for","title":"MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models","date":"2024-10-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"richard-peng-xia/MMed-RAG","path":"train/dpo/llava_trainer_2stages.py","file_url":"https://github.com/richard-peng-xia/MMed-RAG/blob/HEAD/train/dpo/llava_trainer_2stages.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2410.09575","paper":"/paper/reconstructive-visual-instruction-tuning","title":"Reconstructive Visual Instruction Tuning","date":"2024-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haochen-wang409/ross","path":"ross/ross_trainer.py","file_url":"https://github.com/haochen-wang409/ross/blob/HEAD/ross/ross_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2410.05643","paper":"/paper/trace-temporal-grounding-video-llm-via-causal","title":"TRACE: Temporal Grounding Video LLM via Causal Event Modeling","date":"2024-10-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gyxxyg/TRACE","path":"trace/trace_trainer.py","file_url":"https://github.com/gyxxyg/TRACE/blob/HEAD/trace/trace_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2410.05643","paper":"/paper/trace-temporal-grounding-video-llm-via-causal","title":"TRACE: Temporal Grounding Video LLM via Causal Event Modeling","date":"2024-10-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gyxxyg/trace","path":"trace/train_mt.py","file_url":"https://github.com/gyxxyg/trace/blob/HEAD/trace/train_mt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2410.02761","paper":"/paper/fakeshield-explainable-image-forgery","title":"FakeShield: Explainable Image Forgery Detection and Localization via Multi-modal Large Language Models","date":"2024-10-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2409.06277","paper":"/paper/ferret-federated-full-parameter-tuning-at","title":"Ferret: Federated Full-Parameter Tuning at Scale for Large Language Models","date":"2024-09-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2409.01179","paper":"/paper/recoverable-compression-a-multimodal-vision","title":"Recoverable Compression: A Multimodal Vision Token Recovery Mechanism Guided by Text Information","date":"2024-09-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2408.11305","paper":"/paper/unifashion-a-unified-vision-language-model","title":"UniFashion: A Unified Vision-Language Model for Multimodal Fashion Retrieval and Generation","date":"2024-08-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xiangyu-mm/UniFashion","path":"src/blip_fine_tune_2.py","file_url":"https://github.com/xiangyu-mm/UniFashion/blob/HEAD/src/blip_fine_tune_2.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7890d7ff378dc2fc","mcp_get_code":{"code_sha256":"7890d7ff378dc2fc"}},{"arxiv_id":"2407.07895","paper":"/paper/llava-next-interleave-tackling-multi-image","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","date":"2024-07-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2406.19973","paper":"/paper/stllava-med-self-training-large-language-and","title":"STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering","date":"2024-06-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"heliossun/stllava-med","path":"llava_dpo_trainer.py","file_url":"https://github.com/heliossun/stllava-med/blob/HEAD/llava_dpo_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2406.19973","paper":"/paper/stllava-med-self-training-large-language-and","title":"STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering","date":"2024-06-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"heliossun/stllava-med","path":"train_dpo.py","file_url":"https://github.com/heliossun/stllava-med/blob/HEAD/train_dpo.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2406.13193","paper":"/paper/presto-progressive-pretraining-enhances","title":"PRESTO: Progressive Pretraining Enhances Synthetic Chemistry Outcomes","date":"2024-06-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"idea-xl/presto","path":"presto/model_utils.py","file_url":"https://github.com/idea-xl/presto/blob/HEAD/presto/model_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2406.12275","paper":"/paper/voco-llama-towards-vision-compression-with","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2406.11839","paper":"/paper/mdpo-conditional-preference-optimization-for","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"luka-group/mDPO","path":"bunny/run_mdpo_bunny.py","file_url":"https://github.com/luka-group/mDPO/blob/HEAD/bunny/run_mdpo_bunny.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2406.11833","paper":"/paper/mmdu-a-multi-turn-multi-image-dialog","title":"MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2406.11832","paper":"/paper/unveiling-encoder-free-vision-language-models","title":"Unveiling Encoder-Free Vision-Language Models","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2406.11280","paper":"/paper/i-srt-aligning-large-multimodal-models-for","title":"ISR-DPO: Aligning Large Multimodal Models for Videos by Iterative Self-Retrospective DPO","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yonseivnl/vlm-rlaif","path":"RLAIF/finetune_policy_init.py","file_url":"https://github.com/yonseivnl/vlm-rlaif/blob/HEAD/RLAIF/finetune_policy_init.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2406.06040","paper":"/paper/vript-a-video-is-worth-thousands-of-words","title":"Vript: A Video Is Worth Thousands of Words","date":"2024-06-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mutonix/Vript","path":"vriptor/train_hf.py","file_url":"https://github.com/mutonix/Vript/blob/HEAD/vriptor/train_hf.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2406.02539","paper":"/paper/parrot-multilingual-visual-instruction-tuning","title":"Parrot: Multilingual Visual Instruction Tuning","date":"2024-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"AIDC-AI/Parrot","path":"parrot/train/parrot_trainer.py","file_url":"https://github.com/AIDC-AI/Parrot/blob/HEAD/parrot/train/parrot_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2405.21075","paper":"/paper/video-mme-the-first-ever-comprehensive","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","date":"2024-05-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"PhysGame/PhysGame","path":"train_dpo.py","file_url":"https://github.com/PhysGame/PhysGame/blob/HEAD/train_dpo.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2405.18654","paper":"/paper/mitigating-object-hallucination-via-data","title":"Data-augmented phrase-level alignment for mitigating object hallucination","date":"2024-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pritamqu/HALVA","path":"llava/train/halva_trainer.py","file_url":"https://github.com/pritamqu/HALVA/blob/HEAD/llava/train/halva_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2405.18654","paper":"/paper/mitigating-object-hallucination-via-data","title":"Data-augmented phrase-level alignment for mitigating object hallucination","date":"2024-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pritamqu/HALVA","path":"llava/train/train_halva.py","file_url":"https://github.com/pritamqu/HALVA/blob/HEAD/llava/train/train_halva.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2405.16919","paper":"/paper/vocot-unleashing-visually-grounded-multi-step","title":"VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models","date":"2024-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rupertluo/vocot","path":"train_volcano.py","file_url":"https://github.com/rupertluo/vocot/blob/HEAD/train_volcano.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d10512f432705d71","mcp_get_code":{"code_sha256":"d10512f432705d71"}},{"arxiv_id":"2404.16994","paper":"/paper/pllava-parameter-free-llava-extension-from-1","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","date":"2024-04-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"magic-research/PLLaVA","path":"tasks/train/train_pllava_nframe_accel.py","file_url":"https://github.com/magic-research/PLLaVA/blob/HEAD/tasks/train/train_pllava_nframe_accel.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2404.14233","paper":"/paper/detecting-and-mitigating-hallucination-in","title":"Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback","date":"2024-04-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Mr-Loevan/HSA-DPO","path":"hsa_dpo/models/llava-v1_5/train_dpo.py","file_url":"https://github.com/Mr-Loevan/HSA-DPO/blob/HEAD/hsa_dpo/models/llava-v1_5/train_dpo.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2404.13046","paper":"/paper/mova-adapting-mixture-of-vision-experts-to","title":"MoVA: Adapting Mixture of Vision Experts to Multimodal Context","date":"2024-04-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2404.10501","paper":"/paper/self-supervised-visual-preference-alignment","title":"Self-Supervised Visual Preference Alignment","date":"2024-04-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Kevinz-code/SeVa","path":"seva/train_dpo_ours.py","file_url":"https://github.com/Kevinz-code/SeVa/blob/HEAD/seva/train_dpo_ours.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2404.00308","paper":"/paper/st-llm-large-language-models-are-effective-1","title":"ST-LLM: Large Language Models Are Effective Temporal Learners","date":"2024-03-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2403.11299","paper":"/paper/sq-llava-self-questioning-for-large-vision","title":"SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant","date":"2024-03-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"heliossun/sq-llava","path":"llava_trainer.py","file_url":"https://github.com/heliossun/sq-llava/blob/HEAD/llava_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2403.09792","paper":"/paper/images-are-achilles-heel-of-alignment","title":"Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models","date":"2024-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2403.04640","paper":"/paper/cat-enhancing-multimodal-large-language-model","title":"CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios","date":"2024-03-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rikeilong/bay-cat","path":"ADPO_CAT/train_dpo.py","file_url":"https://github.com/rikeilong/bay-cat/blob/HEAD/ADPO_CAT/train_dpo.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2402.18695","paper":"/paper/grounding-language-models-for-visual-entity","title":"Grounding Language Models for Visual Entity Recognition","date":"2024-02-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mrzilinxiao/autover","path":"train_oven.py","file_url":"https://github.com/mrzilinxiao/autover/blob/HEAD/train_oven.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2402.12501","paper":"/paper/your-vision-language-model-itself-is-a-strong","title":"Your Vision-Language Model Itself Is a Strong Filter: Towards High-Quality Instruction Tuning with Data Selection","date":"2024-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rayruibochen/self-filter","path":"self_filter/self_filter_trainer.py","file_url":"https://github.com/rayruibochen/self-filter/blob/HEAD/self_filter/self_filter_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"AGPL-3.0","inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2402.12501","paper":"/paper/your-vision-language-model-itself-is-a-strong","title":"Your Vision-Language Model Itself Is a Strong Filter: Towards High-Quality Instruction Tuning with Data Selection","date":"2024-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rayruibochen/self-filter","path":"self_filter/stage1.py","file_url":"https://github.com/rayruibochen/self-filter/blob/HEAD/self_filter/stage1.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"AGPL-3.0","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2402.09353","paper":"/paper/dora-weight-decomposed-low-rank-adaptation","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","date":"2024-02-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"NVlabs/DoRA","path":"visual_instruction_tuning/llava/train/train_dora.py","file_url":"https://github.com/NVlabs/DoRA/blob/HEAD/visual_instruction_tuning/llava/train/train_dora.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2402.08170","paper":"/paper/llaga-large-language-and-graph-assistant","title":"LLaGA: Large Language and Graph Assistant","date":"2024-02-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chenrunjin/llaga","path":"train/llaga_trainer.py","file_url":"https://github.com/chenrunjin/llaga/blob/HEAD/train/llaga_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2401.02330","paper":"/paper/llava-ph-efficient-multi-modal-assistant-with","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","date":"2024-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhuyiche/llava-phi","path":"llava_phi/train/convert_model2base_llava_phi.py","file_url":"https://github.com/zhuyiche/llava-phi/blob/HEAD/llava_phi/train/convert_model2base_llava_phi.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2312.11370","paper":"/paper/g-llava-solving-geometric-problem-with-multi","title":"G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model","date":"2023-12-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pipilurj/g-llava","path":"gllava/train/llava_trainer.py","file_url":"https://github.com/pipilurj/g-llava/blob/HEAD/gllava/train/llava_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2312.10032","paper":"/paper/osprey-pixel-understanding-with-visual","title":"Osprey: Pixel Understanding with Visual Instruction Tuning","date":"2023-12-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2312.06968","paper":"/paper/hallucination-augmented-contrastive-learning","title":"Hallucination Augmented Contrastive Learning for Multimodal Large Language Model","date":"2023-12-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2312.02949","paper":"/paper/llava-grounding-grounded-visual-chat-with","title":"LLaVA-Grounding: Grounded Visual Chat with Large Multimodal Models","date":"2023-12-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ux-decoder/llava-grounding","path":"llava/train/train_grounding_1st.py","file_url":"https://github.com/ux-decoder/llava-grounding/blob/HEAD/llava/train/train_grounding_1st.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2311.16839","paper":"/paper/beyond-hallucinations-enhancing-lvlms-through","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","date":"2023-11-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2311.15826","paper":"/paper/geochat-grounded-large-vision-language-model","title":"GeoChat: Grounded Large Vision-Language Model for Remote Sensing","date":"2023-11-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2311.04257","paper":"/paper/mplug-owl2-revolutionizing-multi-modal-large","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","date":"2023-11-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2310.03744","paper":"/paper/improved-baselines-with-visual-instruction","title":"Improved Baselines with Visual Instruction Tuning","date":"2023-10-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2310.01779","paper":"/paper/halle-switch-rethinking-and-controlling","title":"HallE-Control: Controlling Object Hallucination in Large Multimodal Models","date":"2023-10-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bronyayang/HallE_Switch","path":"llava/train/train_switch.py","file_url":"https://github.com/bronyayang/HallE_Switch/blob/HEAD/llava/train/train_switch.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}},{"arxiv_id":"2304.08485","paper":"/paper/visual-instruction-tuning-1","title":"Visual Instruction Tuning","date":"2023-04-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haotian-liu/LLaVA","path":"llava/train/llava_trainer.py","file_url":"https://github.com/haotian-liu/LLaVA/blob/HEAD/llava/train/llava_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"2304.05884","paper":"/paper/unicom-universal-and-compact-representation","title":"Unicom: Universal and Compact Representation Learning for Image Retrieval","date":"2023-04-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"735025744c1ab0cf","mcp_get_code":{"code_sha256":"735025744c1ab0cf"}},{"arxiv_id":"Wang_SMoLoRA_Exploring_and_Defying_Dual_Catastrophic_Forgetting_in_Continual_Visual_ICCV_2025_paper","paper":null,"title":"arXiv:Wang_SMoLoRA_Exploring_and_Defying_Dual_Catastrophic_Forgetting_in_Continual_Visual_ICCV_2025_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"Minato-Zackie/SMoLoRA","path":"llava/train/train_SMoLoRA.py","file_url":"https://github.com/Minato-Zackie/SMoLoRA/blob/HEAD/llava/train/train_SMoLoRA.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"616ffbdc154ed2d8","mcp_get_code":{"code_sha256":"616ffbdc154ed2d8"}}]}