{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/main-process","entry":"main_process","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":45,"n_papers_ran":41,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":6,"n_samples_ran":3,"n_samples_fingerprinted":0,"n_places":45,"n_places_pointer_only":13,"by_status":{"ran_honours":0,"ran_violates":2,"ran_draft_wrong":0,"ran_fixture":0,"ran":1,"unverified":3},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.20382","paper":"/paper/arxiv-2608-20382","title":"Decoupled Vision-Language System for Multimodal Understanding and Generation","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"YifanXu74/Libra","path":"libra/common/dist_utils.py","file_url":"https://github.com/YifanXu74/Libra/blob/HEAD/libra/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2601.03728","paper":"/paper/arxiv-2601-03728","title":"CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"qzp2018/CSMCIR","path":"src/lavis/common/dist_utils.py","file_url":"https://github.com/qzp2018/CSMCIR/blob/HEAD/src/lavis/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2507.12001","paper":null,"title":"arXiv:2507.12001","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"wslh852/AUBlendNet","path":"base/utilities.py","file_url":"https://github.com/wslh852/AUBlendNet/blob/HEAD/base/utilities.py","status":"ran_violates","verification_level":1,"contract_check":"VIOLATES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"06fca4c705811abe","mcp_get_code":{"code_sha256":"06fca4c705811abe"}},{"arxiv_id":"2504.17343","paper":"/paper/timechat-online-80-visual-tokens-are","title":"TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos","date":"2025-04-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"renshuhuai-andy/timechat","path":"timechat/common/dist_utils.py","file_url":"https://github.com/renshuhuai-andy/timechat/blob/HEAD/timechat/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2502.09507","paper":"/paper/when-and-how-does-clip-enable-domain-and","title":"When and How Does CLIP Enable Domain and Compositional Generalization?","date":"2025-02-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"salesforce/LAVIS","path":"lavis/common/dist_utils.py","file_url":"https://github.com/salesforce/LAVIS/blob/HEAD/lavis/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2409.03643","paper":"/paper/cdm-a-reliable-metric-for-fair-and-accurate","title":"Image Over Text: Transforming Formula Recognition Evaluation with Character Detection Matching","date":"2024-09-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opendatalab/unimernet","path":"unimernet/common/dist_utils.py","file_url":"https://github.com/opendatalab/unimernet/blob/HEAD/unimernet/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2408.17443","paper":"/paper/bridging-episodes-and-semantics-a-novel","title":"HERMES: temporal-coHERent long-forM understanding with Episodes and Semantics","date":"2024-08-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"joslefaure/HERMES","path":"lavis/common/dist_utils.py","file_url":"https://github.com/joslefaure/HERMES/blob/HEAD/lavis/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2408.10500","paper":"/paper/sztu-cmu-at-mer2024-improving-emotion-llama","title":"SZTU-CMU at MER2024: Improving Emotion-LLaMA with Conv-Attention for Multimodal Emotion Recognition","date":"2024-08-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zebangcheng/emotion-llama","path":"minigpt4/common/dist_utils.py","file_url":"https://github.com/zebangcheng/emotion-llama/blob/HEAD/minigpt4/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2407.21659","paper":"/paper/2407-21659","title":"Cross-modality Information Check for Detecting Jailbreaking in Multimodal Large Language Models","date":"2024-07-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pandragonxiii/cider","path":"code/models/minigpt4/common/dist_utils.py","file_url":"https://github.com/pandragonxiii/cider/blob/HEAD/code/models/minigpt4/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2406.12384","paper":"/paper/vrsbench-a-versatile-vision-language","title":"VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lavender105/rsgpt","path":"rsgpt/common/dist_utils.py","file_url":"https://github.com/lavender105/rsgpt/blob/HEAD/rsgpt/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2405.16886","paper":"/paper/hawk-learning-to-understand-open-world-video","title":"Hawk: Learning to Understand Open-World Video Anomalies","date":"2024-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jqtangust/hawk","path":"hawk/common/dist_utils.py","file_url":"https://github.com/jqtangust/hawk/blob/HEAD/hawk/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2405.10140","paper":"/paper/libra-building-decoupled-vision-system-on","title":"Libra: Building Decoupled Vision System on Large Language Models","date":"2024-05-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yifanxu74/libra","path":"libra/common/dist_utils.py","file_url":"https://github.com/yifanxu74/libra/blob/HEAD/libra/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2404.13947","paper":"/paper/boter-bootstrapping-knowledge-selection-and","title":"Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering","date":"2024-04-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haodongze/self-ksel-qans","path":"lavis/common/dist_utils.py","file_url":"https://github.com/haodongze/self-ksel-qans/blob/HEAD/lavis/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2403.13430","paper":"/paper/mtp-advancing-remote-sensing-foundation-model","title":"MTP: Advancing Remote Sensing Foundation Model via Multi-Task Pretraining","date":"2024-03-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vitae-transformer/mtp","path":"Multi-Task_Pretrain/main_pretrain.py","file_url":"https://github.com/vitae-transformer/mtp/blob/HEAD/Multi-Task_Pretrain/main_pretrain.py","status":"ran_violates","verification_level":1,"contract_check":"VIOLATES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e26853276bb3dd32","mcp_get_code":{"code_sha256":"e26853276bb3dd32"}},{"arxiv_id":"2403.04593","paper":"/paper/embodied-understanding-of-driving-scenarios","title":"Embodied Understanding of Driving Scenarios","date":"2024-03-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opendrivelab/elm","path":"lavis/common/dist_utils.py","file_url":"https://github.com/opendrivelab/elm/blob/HEAD/lavis/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2402.07398","paper":"/paper/vislinginstruct-elevating-zero-shot-learning","title":"VisLingInstruct: Elevating Zero-Shot Learning in Multi-Modal Language Models with Autonomous Instruction Optimization","date":"2024-02-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhudongsheng75/vislinginstruct","path":"vislinginstruct/common/dist_utils.py","file_url":"https://github.com/zhudongsheng75/vislinginstruct/blob/HEAD/vislinginstruct/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2402.07197","paper":"/paper/graphtranslator-aligning-graph-model-to-large","title":"GraphTranslator: Aligning Graph Model to Large Language Model for Open-ended Tasks","date":"2024-02-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alibaba/graphtranslator","path":"Translator/common/dist_utils.py","file_url":"https://github.com/alibaba/graphtranslator/blob/HEAD/Translator/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2402.05889","paper":"/paper/crema-multimodal-compositional-video","title":"CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion","date":"2024-02-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Yui010206/CREMA","path":"lavis/common/dist_utils.py","file_url":"https://github.com/Yui010206/CREMA/blob/HEAD/lavis/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2401.11170","paper":"/paper/inducing-high-energy-latency-of-large-vision","title":"Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images","date":"2024-01-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"KuofengGao/Verbose_Images","path":"lavis/common/dist_utils.py","file_url":"https://github.com/KuofengGao/Verbose_Images/blob/HEAD/lavis/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2401.01827","paper":"/paper/moonshot-towards-controllable-video","title":"Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions","date":"2024-01-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"salesforce/lavis","path":"lavis/common/dist_utils.py","file_url":"https://github.com/salesforce/lavis/blob/HEAD/lavis/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2312.12458","paper":"/paper/when-parameter-efficient-tuning-meets-general","title":"When Parameter-efficient Tuning Meets General-purpose Vision-language Models","date":"2023-12-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"melonking32/petal","path":"lavis/common/dist_utils.py","file_url":"https://github.com/melonking32/petal/blob/HEAD/lavis/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2312.06722","paper":"/paper/egoplan-bench-benchmarking-egocentric","title":"EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning","date":"2023-12-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chenyi99/egoplan","path":"src/video_llama/video_llama/common/dist_utils.py","file_url":"https://github.com/chenyi99/egoplan/blob/HEAD/src/video_llama/video_llama/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2312.02153","paper":"/paper/aligning-and-prompting-everything-all-at-once","title":"Aligning and Prompting Everything All at Once for Universal Visual Perception","date":"2023-12-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"earth-insights/ClassTrans","path":"src/utils.py","file_url":"https://github.com/earth-insights/ClassTrans/blob/HEAD/src/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3baca7953e57a8e0","mcp_get_code":{"code_sha256":"3baca7953e57a8e0"}},{"arxiv_id":"2311.18799","paper":"/paper/x-instructblip-a-framework-for-aligning-x","title":"X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning","date":"2023-11-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"artemisp/lavis-xinstructblip","path":"lavis/common/dist_utils.py","file_url":"https://github.com/artemisp/lavis-xinstructblip/blob/HEAD/lavis/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2310.13596","paper":"/paper/marinegpt-unlocking-secrets-of-ocean-to-the","title":"MarineGPT: Unlocking Secrets of Ocean to the Public","date":"2023-10-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hkust-vgd/marinegpt","path":"marinegpt/common/dist_utils.py","file_url":"https://github.com/hkust-vgd/marinegpt/blob/HEAD/marinegpt/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2310.05863","paper":"/paper/fine-grained-audio-visual-joint","title":"Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models","date":"2023-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"the-anonymous-bs/favor","path":"video_llama/common/dist_utils.py","file_url":"https://github.com/the-anonymous-bs/favor/blob/HEAD/video_llama/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2310.05473","paper":"/paper/sentence-level-prompts-benefit-composed-image","title":"Sentence-level Prompts Benefit Composed Image Retrieval","date":"2023-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chunmeifeng/sprc","path":"src/lavis/common/dist_utils.py","file_url":"https://github.com/chunmeifeng/sprc/blob/HEAD/src/lavis/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2310.03291","paper":"/paper/simvlg-simple-and-efficient-pretraining-of","title":"Expedited Training of Visual Conditioned Language Generation via Redundancy Reduction","date":"2023-10-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yiren-jian/evlgen","path":"lavis/common/dist_utils.py","file_url":"https://github.com/yiren-jian/evlgen/blob/HEAD/lavis/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2310.01218","paper":"/paper/making-llama-see-and-draw-with-seed-tokenizer","title":"Making LLaMA SEE and Draw with SEED Tokenizer","date":"2023-10-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ailab-cvc/seed","path":"models/seed_qformer/utils.py","file_url":"https://github.com/ailab-cvc/seed/blob/HEAD/models/seed_qformer/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2308.16463","paper":"/paper/sparkles-unlocking-chats-across-multiple","title":"Sparkles: Unlocking Chats Across Multiple Images for Multimodal Instruction-Following Models","date":"2023-08-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HYPJUDY/Sparkles","path":"sparkles/common/dist_utils.py","file_url":"https://github.com/HYPJUDY/Sparkles/blob/HEAD/sparkles/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2308.12714","paper":"/paper/vigc-visual-instruction-generation-and","title":"VIGC: Visual Instruction Generation and Correction","date":"2023-08-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opendatalab/vigc","path":"vigc/common/dist_utils.py","file_url":"https://github.com/opendatalab/vigc/blob/HEAD/vigc/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2308.04152","paper":"/paper/empowering-vision-language-models-to-follow","title":"Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions","date":"2023-08-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DCDmllm/Cheetah","path":"Cheetah/cheetah/common/dist_utils.py","file_url":"https://github.com/DCDmllm/Cheetah/blob/HEAD/Cheetah/cheetah/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2307.08581","paper":"/paper/bubogpt-enabling-visual-grounding-in-multi","title":"BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs","date":"2023-07-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"magic-research/bubogpt","path":"bubogpt/common/dist_utils.py","file_url":"https://github.com/magic-research/bubogpt/blob/HEAD/bubogpt/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2306.02858","paper":"/paper/video-llama-an-instruction-tuned-audio-visual","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","date":"2023-06-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"damo-nlp-sg/video-llama","path":"video_llama/common/dist_utils.py","file_url":"https://github.com/damo-nlp-sg/video-llama/blob/HEAD/video_llama/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":false,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2305.16103","paper":"/paper/chatbridge-bridging-modalities-with-large","title":"ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst","date":"2023-05-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"joez17/chatbridge","path":"chatbridge/common/dist_utils.py","file_url":"https://github.com/joez17/chatbridge/blob/HEAD/chatbridge/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2305.14167","paper":"/paper/detgpt-detect-what-you-need-via-reasoning","title":"DetGPT: Detect What You Need via Reasoning","date":"2023-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"optimalscale/detgpt","path":"detgpt/common/dist_utils.py","file_url":"https://github.com/optimalscale/detgpt/blob/HEAD/detgpt/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2305.04160","paper":"/paper/x-llm-bootstrapping-advanced-large-language","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","date":"2023-05-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"phellonchen/x-llm","path":"xllm/common/dist_utils.py","file_url":"https://github.com/phellonchen/x-llm/blob/HEAD/xllm/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2301.02379","paper":"/paper/codetalker-speech-driven-3d-facial-animation","title":"CodeTalker: Speech-Driven 3D Facial Animation with Discrete Motion Prior","date":"2023-01-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Doubiiu/CodeTalker","path":"base/utilities.py","file_url":"https://github.com/Doubiiu/CodeTalker/blob/HEAD/base/utilities.py","status":"ran_violates","verification_level":1,"contract_check":"VIOLATES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"06fca4c705811abe","mcp_get_code":{"code_sha256":"06fca4c705811abe"}},{"arxiv_id":"2008.04838","paper":"/paper/transnet-v2-an-effective-deep-network","title":"TransNet V2: An effective deep network architecture for fast shot transition detection","date":"2020-08-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shallwe999/TransNetV2-SBD-Visualize","path":"transnetv2.py","file_url":"https://github.com/shallwe999/TransNetV2-SBD-Visualize/blob/HEAD/transnetv2.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e6c126c38a88b3c8","mcp_get_code":{"code_sha256":"e6c126c38a88b3c8"}},{"arxiv_id":"2007.12140","paper":"/paper/hitnet-hierarchical-iterative-tile-refinement","title":"HITNet: Hierarchical Iterative Tile Refinement Network for Real-time Stereo Matching","date":"2020-07-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"meteorshowers/X-StereoLab","path":"tools/train_net_disp.py","file_url":"https://github.com/meteorshowers/X-StereoLab/blob/HEAD/tools/train_net_disp.py","status":"ran_violates","verification_level":1,"contract_check":"VIOLATES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"06fca4c705811abe","mcp_get_code":{"code_sha256":"06fca4c705811abe"}},{"arxiv_id":"Xu_Adaptive_Multi-Modal_Cross-Entropy_Loss_for_Stereo_Matching_CVPR_2024_paper","paper":null,"title":"arXiv:Xu_Adaptive_Multi-Modal_Cross-Entropy_Loss_for_Stereo_Matching_CVPR_2024_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"xxxupeng/ADL","path":"train_DDP.py","file_url":"https://github.com/xxxupeng/ADL/blob/HEAD/train_DDP.py","status":"ran_violates","verification_level":1,"contract_check":"VIOLATES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"06fca4c705811abe","mcp_get_code":{"code_sha256":"06fca4c705811abe"}},{"arxiv_id":"Hajimiri_A_Strong_Baseline_for_Generalized_Few-Shot_Semantic_Segmentation_CVPR_2023_paper","paper":null,"title":"arXiv:Hajimiri_A_Strong_Baseline_for_Generalized_Few-Shot_Semantic_Segmentation_CVPR_2023_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"sinahmr/DIaM","path":"src/util.py","file_url":"https://github.com/sinahmr/DIaM/blob/HEAD/src/util.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3baca7953e57a8e0","mcp_get_code":{"code_sha256":"3baca7953e57a8e0"}},{"arxiv_id":"Chen_DViN_Dynamic_Visual_Routing_Network_for_Weakly_Supervised_Referring_Expression_CVPR_2025_paper","paper":null,"title":"arXiv:Chen_DViN_Dynamic_Visual_Routing_Network_for_Weakly_Supervised_Referring_Expression_CVPR_2025_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"XxFChen/DViN","path":"utils/distributed.py","file_url":"https://github.com/XxFChen/DViN/blob/HEAD/utils/distributed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5a7f17ee3741438b","mcp_get_code":{"code_sha256":"5a7f17ee3741438b"}},{"arxiv_id":"2024.findings-emnlp.803","paper":null,"title":"arXiv:2024.findings-emnlp.803","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"PandragonXIII/CIDER","path":"code/models/minigpt4/common/dist_utils.py","file_url":"https://github.com/PandragonXIII/CIDER/blob/HEAD/code/models/minigpt4/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}},{"arxiv_id":"2024.acl-long.19","paper":null,"title":"arXiv:2024.acl-long.19","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"yiren-jian/EVLGen","path":"lavis/common/dist_utils.py","file_url":"https://github.com/yiren-jian/EVLGen/blob/HEAD/lavis/common/dist_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":false,"code_sha256_prefix":"98589643273920ba","mcp_get_code":{"code_sha256":"98589643273920ba"}}]}