{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/interpolate-pos-embed","entry":"interpolate_pos_embed","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":59,"n_papers_ran":55,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":6,"n_samples_ran":3,"n_samples_fingerprinted":1,"n_places":59,"n_places_pointer_only":29,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":1,"ran_fixture":0,"ran":2,"unverified":3},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2609.12965","paper":"/paper/arxiv-2609-12965","title":"Generative Retrieval for Unsupervised Text-Based Person Search","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"Flame-Chasers/GTR","path":"models/vit.py","file_url":"https://github.com/Flame-Chasers/GTR/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2509.19674","paper":"/paper/arxiv-2509-19674","title":"C²Prompt: Class-aware Client Knowledge Interaction for Federated Continual Learning","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"zhoujiahuan1991/NeurIPS2025-C2Prompt","path":"models_Cprompt/vision_transformer.py","file_url":"https://github.com/zhoujiahuan1991/NeurIPS2025-C2Prompt/blob/HEAD/models_Cprompt/vision_transformer.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2509.16635","paper":"/paper/arxiv-2509-16635","title":"Towards Anytime Retrieval: A Benchmark for Anytime Person Re-Identification","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"kw66/AT-ReID","path":"AT-ReID-fast/model/moae.py","file_url":"https://github.com/kw66/AT-ReID/blob/HEAD/AT-ReID-fast/model/moae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fb7b918bdc68a83c","mcp_get_code":{"code_sha256":"fb7b918bdc68a83c"}},{"arxiv_id":"2509.02123","paper":"/paper/arxiv-2509-02123","title":"CMRAG: Co-modality-based visual document retrieval and question answering","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"ChenWangHKU/CMRAG","path":"retriever/model/encoder.py","file_url":"https://github.com/ChenWangHKU/CMRAG/blob/HEAD/retriever/model/encoder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e136986f60c19028","mcp_get_code":{"code_sha256":"e136986f60c19028"}},{"arxiv_id":"2508.14039","paper":"/paper/arxiv-2508-14039","title":"Beyond Simple Edits: Composed Video Retrieval with Dense Modifications","date":null,"month_inferred_from_arxiv_id":"2025-08","title_source":"syntology","repo":"OmkarThawakar/BSE-CoVR","path":"src/model/vit.py","file_url":"https://github.com/OmkarThawakar/BSE-CoVR/blob/HEAD/src/model/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2503.07703","paper":"/paper/seedream-2-0-a-native-chinese-english","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","date":"2025-03-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DYEvaLab/EvalMuse","path":"lavis/models/vit.py","file_url":"https://github.com/DYEvaLab/EvalMuse/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2502.09507","paper":"/paper/when-and-how-does-clip-enable-domain-and","title":"When and How Does CLIP Enable Domain and Compositional Generalization?","date":"2025-02-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"salesforce/LAVIS","path":"lavis/models/vit.py","file_url":"https://github.com/salesforce/LAVIS/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2411.02669","paper":"/paper/semantic-aligned-adversarial-evolution","title":"Semantic-Aligned Adversarial Evolution Triangle for High-Transferability Vision-Language Attack","date":"2024-11-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jiaxiaojunqaq/sa-aet","path":"models/vit.py","file_url":"https://github.com/jiaxiaojunqaq/sa-aet/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2410.20444","paper":"/paper/vector-quantization-prompting-for-continual","title":"Vector Quantization Prompting for Continual Learning","date":"2024-10-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jiaolifengmi/vq-prompt","path":"models/vit.py","file_url":"https://github.com/jiaolifengmi/vq-prompt/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2409.19961","paper":"/paper/multimodal-llm-enhanced-cross-lingual-cross","title":"Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval","date":"2024-09-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lijiabei-7/leccr","path":"LECCR/clip/model.py","file_url":"https://github.com/lijiabei-7/leccr/blob/HEAD/LECCR/clip/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"076d66604810aa98","mcp_get_code":{"code_sha256":"076d66604810aa98"}},{"arxiv_id":"2408.17443","paper":"/paper/bridging-episodes-and-semantics-a-novel","title":"HERMES: temporal-coHERent long-forM understanding with Episodes and Semantics","date":"2024-08-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"joslefaure/HERMES","path":"lavis/models/vit.py","file_url":"https://github.com/joslefaure/HERMES/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2407.16658","paper":"/paper/egocvr-an-egocentric-benchmark-for-fine","title":"EgoCVR: An Egocentric Benchmark for Fine-Grained Composed Video Retrieval","date":"2024-07-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"explainableml/egocvr","path":"model/blip/vit.py","file_url":"https://github.com/explainableml/egocvr/blob/HEAD/model/blip/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2406.12718","paper":"/paper/agla-mitigating-object-hallucinations-in","title":"AGLA: Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lackel/agla","path":"lavis/models/vit.py","file_url":"https://github.com/lackel/agla/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2406.05491","paper":"/paper/one-perturbation-is-enough-on-generating","title":"One Perturbation is Enough: On Generating Universal Adversarial Perturbations against Vision-Language Pre-training Models","date":"2024-06-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ffhibnese/cpgc_vlp_universal_attacks","path":"models/vit.py","file_url":"https://github.com/ffhibnese/cpgc_vlp_universal_attacks/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2404.16790","paper":"/paper/seed-bench-2-plus-benchmarking-multimodal","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","date":"2024-04-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ailab-cvc/seed-bench","path":"lavis/models/vit.py","file_url":"https://github.com/ailab-cvc/seed-bench/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2404.13947","paper":"/paper/boter-bootstrapping-knowledge-selection-and","title":"Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering","date":"2024-04-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haodongze/self-ksel-qans","path":"lavis/models/vit.py","file_url":"https://github.com/haodongze/self-ksel-qans/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2404.02117","paper":"/paper/pre-trained-vision-and-language-transformers","title":"Pre-trained Vision and Language Transformers Are Few-Shot Incremental Learners","date":"2024-04-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"KHU-AGI/PriViLege","path":"models/vision_transformer.py","file_url":"https://github.com/KHU-AGI/PriViLege/blob/HEAD/models/vision_transformer.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2403.16997","paper":"/paper/composed-video-retrieval-via-enriched-context","title":"Composed Video Retrieval via Enriched Context and Discriminative Embeddings","date":"2024-03-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"omkarthawakar/composed-video-retrieval","path":"src/model/vit.py","file_url":"https://github.com/omkarthawakar/composed-video-retrieval/blob/HEAD/src/model/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2403.11956","paper":"/paper/subjective-aligned-dateset-and-metric-for","title":"Subjective-Aligned Dataset and Metric for Text-to-Video Quality Assessment","date":"2024-03-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"qmme/t2vqa","path":"model/vit.py","file_url":"https://github.com/qmme/t2vqa/blob/HEAD/model/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2403.06407","paper":"/paper/can-llms-tuning-methods-work-in-medical","title":"Can LLMs' Tuning Methods Work in Medical Multimodal Domain?","date":"2024-03-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"timmy-chan/miss","path":"models/vit.py","file_url":"https://github.com/timmy-chan/miss/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2403.04593","paper":"/paper/embodied-understanding-of-driving-scenarios","title":"Embodied Understanding of Driving Scenarios","date":"2024-03-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opendrivelab/elm","path":"lavis/models/vit.py","file_url":"https://github.com/opendrivelab/elm/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2402.07398","paper":"/paper/vislinginstruct-elevating-zero-shot-learning","title":"VisLingInstruct: Elevating Zero-Shot Learning in Multi-Modal Language Models with Autonomous Instruction Optimization","date":"2024-02-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhudongsheng75/vislinginstruct","path":"vislinginstruct/models/vit.py","file_url":"https://github.com/zhudongsheng75/vislinginstruct/blob/HEAD/vislinginstruct/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2402.05889","paper":"/paper/crema-multimodal-compositional-video","title":"CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion","date":"2024-02-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Yui010206/CREMA","path":"lavis/models/vit.py","file_url":"https://github.com/Yui010206/CREMA/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2401.11170","paper":"/paper/inducing-high-energy-latency-of-large-vision","title":"Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images","date":"2024-01-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"KuofengGao/Verbose_Images","path":"lavis/models/vit.py","file_url":"https://github.com/KuofengGao/Verbose_Images/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2401.01827","paper":"/paper/moonshot-towards-controllable-video","title":"Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions","date":"2024-01-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"salesforce/lavis","path":"lavis/models/vit.py","file_url":"https://github.com/salesforce/lavis/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2312.12458","paper":"/paper/when-parameter-efficient-tuning-meets-general","title":"When Parameter-efficient Tuning Meets General-purpose Vision-language Models","date":"2023-12-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"melonking32/petal","path":"lavis/models/vit.py","file_url":"https://github.com/melonking32/petal/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2312.11523","paper":"/paper/tovilag-your-visual-language-generative-model","title":"ToViLaG: Your Visual-Language Generative Model is Also An Evildoer","date":"2023-12-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"victorup/ToViLaG","path":"method/BLIP/models/vit.py","file_url":"https://github.com/victorup/ToViLaG/blob/HEAD/method/BLIP/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2312.07132","paper":"/paper/image-content-generation-with-causal","title":"Image Content Generation with Causal Reasoning","date":"2023-12-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ieit-agi/mix-shannon","path":"lavis/models/vit.py","file_url":"https://github.com/ieit-agi/mix-shannon/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2312.02249","paper":"/paper/recursive-visual-programming","title":"Recursive Visual Programming","date":"2023-12-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"para-lost/rvp","path":"base_models/tcl/tcl_vit.py","file_url":"https://github.com/para-lost/rvp/blob/HEAD/base_models/tcl/tcl_vit.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"4262ed39e3ce5c97","mcp_get_code":{"code_sha256":"4262ed39e3ce5c97"}},{"arxiv_id":"2312.00081","paper":"/paper/synthesize-diagnose-and-optimize-towards-fine","title":"Synthesize, Diagnose, and Optimize: Towards Fine-Grained Vision-Language Understanding","date":"2023-11-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wjpoom/spec","path":"spec/models/blip_utils/vit.py","file_url":"https://github.com/wjpoom/spec/blob/HEAD/spec/models/blip_utils/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2311.18799","paper":"/paper/x-instructblip-a-framework-for-aligning-x","title":"X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning","date":"2023-11-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"artemisp/lavis-xinstructblip","path":"lavis/models/vit.py","file_url":"https://github.com/artemisp/lavis-xinstructblip/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2311.12047","paper":"/paper/multimodal-machine-unlearning","title":"MultiDelete for Multimodal Machine Unlearning","date":"2023-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chengjiali/Multimodal-Machine-Unlearning","path":"lavis/models/vit.py","file_url":"https://github.com/chengjiali/Multimodal-Machine-Unlearning/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2310.05861","paper":"/paper/rephrase-augment-reason-visual-grounding-of","title":"Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models","date":"2023-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"archiki/repare","path":"Lavis/lavis/models/vit.py","file_url":"https://github.com/archiki/repare/blob/HEAD/Lavis/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2310.03291","paper":"/paper/simvlg-simple-and-efficient-pretraining-of","title":"Expedited Training of Visual Conditioned Language Generation via Redundancy Reduction","date":"2023-10-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yiren-jian/evlgen","path":"lavis/models/vit.py","file_url":"https://github.com/yiren-jian/evlgen/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2310.01218","paper":"/paper/making-llama-see-and-draw-with-seed-tokenizer","title":"Making LLaMA SEE and Draw with SEED Tokenizer","date":"2023-10-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ailab-cvc/seed","path":"models/seed_qformer/vit.py","file_url":"https://github.com/ailab-cvc/seed/blob/HEAD/models/seed_qformer/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2309.14203","paper":"/paper/detecting-and-grounding-multi-modal-media-1","title":"Detecting and Grounding Multi-Modal Media Manipulation and Beyond","date":"2023-09-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rshaojimmy/multimodal-deepfake","path":"models/vit.py","file_url":"https://github.com/rshaojimmy/multimodal-deepfake/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2308.12714","paper":"/paper/vigc-visual-instruction-generation-and","title":"VIGC: Visual Instruction Generation and Correction","date":"2023-08-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opendatalab/vigc","path":"vigc/models/vit.py","file_url":"https://github.com/opendatalab/vigc/blob/HEAD/vigc/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2308.10402","paper":"/paper/simple-baselines-for-interactive-video","title":"Simple Baselines for Interactive Video Retrieval with Questions and Answers","date":"2023-08-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kevinliang888/IVR-QA-baselines","path":"models/vit.py","file_url":"https://github.com/kevinliang888/IVR-QA-baselines/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2308.07146","paper":"/paper/ctp-towards-vision-language-continual","title":"CTP: Towards Vision-Language Continual Pretraining via Compatible Momentum Contrast and Topology Preservation","date":"2023-08-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kevinlight831/ctp","path":"models/vit.py","file_url":"https://github.com/kevinlight831/ctp/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2307.14061","paper":"/paper/set-level-guidance-attack-boosting","title":"Set-level Guidance Attack: Boosting Adversarial Transferability of Vision-Language Pre-training Models","date":"2023-07-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Zoky-2020/Set-level_Guidance_Attack","path":"models/vit.py","file_url":"https://github.com/Zoky-2020/Set-level_Guidance_Attack/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2307.12981","paper":"/paper/3d-llm-injecting-the-3d-world-into-large","title":"3D-LLM: Injecting the 3D World into Large Language Models","date":"2023-07-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"umass-foundation-model/3d-llm","path":"3DLLM_BLIP2-base/lavis/models/vit.py","file_url":"https://github.com/umass-foundation-model/3d-llm/blob/HEAD/3DLLM_BLIP2-base/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2307.10867","paper":"/paper/figcaps-hf-a-figure-to-caption-generative","title":"FigCaps-HF: A Figure-to-Caption Generative Framework and Benchmark with Human Feedback","date":"2023-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"figcapshf/figcapshf","path":"models/vit.py","file_url":"https://github.com/figcapshf/figcapshf/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2305.13653","paper":"/paper/rasa-relation-and-sensitivity-aware","title":"RaSa: Relation and Sensitivity Aware Representation Learning for Text-based Person Search","date":"2023-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Flame-Chasers/RaSa","path":"models/vit.py","file_url":"https://github.com/Flame-Chasers/RaSa/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2304.14933","paper":"/paper/an-empirical-study-of-multimodal-model","title":"An Empirical Study of Multimodal Model Merging","date":"2023-04-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2303.16058","paper":"/paper/unmasked-teacher-towards-training-efficient","title":"Unmasked Teacher: Towards Training-Efficient Video Foundation Models","date":"2023-03-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opengvlab/unmasked_teacher","path":"multi_modality/models/utils.py","file_url":"https://github.com/opengvlab/unmasked_teacher/blob/HEAD/multi_modality/models/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"dbd049b02a63c3a1","mcp_get_code":{"code_sha256":"dbd049b02a63c3a1"}},{"arxiv_id":"2303.10323","paper":"/paper/dynamic-graph-enhanced-contrastive-learning","title":"Dynamic Graph Enhanced Contrastive Learning for Chest X-ray Report Generation","date":"2023-03-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mlii0117/dcl","path":"models/vit.py","file_url":"https://github.com/mlii0117/dcl/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2302.06605","paper":"/paper/uniadapter-unified-parameter-efficient","title":"UniAdapter: Unified Parameter-Efficient Transfer Learning for Cross-modal Modeling","date":"2023-02-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rerv/uniadapter","path":"models/vit.py","file_url":"https://github.com/rerv/uniadapter/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2302.00402","paper":"/paper/mplug-2-a-modularized-multi-modal-foundation","title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","date":"2023-02-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"X-PLUG/mPLUG-2","path":"models/vit.py","file_url":"https://github.com/X-PLUG/mPLUG-2/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2211.13594","paper":"/paper/self-supervised-vision-language-pretraining","title":"Self-supervised vision-language pretraining for Medical visual question answering","date":"2022-11-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pengfeiliheu/m2i2","path":"models/mae.py","file_url":"https://github.com/pengfeiliheu/m2i2/blob/HEAD/models/mae.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2211.09790","paper":"/paper/construct-vl-data-free-continual-structured","title":"ConStruct-VL: Data-Free Continual Structured VL Concepts Learning","date":"2022-11-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jamessealesmith/construct-vl","path":"models/vit.py","file_url":"https://github.com/jamessealesmith/construct-vl/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2210.08773","paper":"/paper/plug-and-play-vqa-zero-shot-vqa-by-conjoining","title":"Plug-and-Play VQA: Zero-shot VQA by Conjoining Large Pretrained Models with Zero Training","date":"2022-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Tzoulio/Large_Models_Dialogue_for_Active_Perception","path":"llm-vqa_dialogue/lavis/models/vit.py","file_url":"https://github.com/Tzoulio/Large_Models_Dialogue_for_Active_Perception/blob/HEAD/llm-vqa_dialogue/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2207.05333","paper":"/paper/idea-increasing-text-diversity-via-online","title":"IDEA: Increasing Text Diversity via Online Multi-Label Recognition for Vision-Language Pre-training","date":"2022-07-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xinyu1205/idea-pytorch","path":"models/vit.py","file_url":"https://github.com/xinyu1205/idea-pytorch/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2205.11169","paper":"/paper/pevl-position-enhanced-pre-training-and","title":"PEVL: Position-enhanced Pre-training and Prompt Tuning for Vision-language Models","date":"2022-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thunlp/PEVL","path":"models/vit.py","file_url":"https://github.com/thunlp/PEVL/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"2111.09452","paper":"/paper/towards-open-vocabulary-object-detection","title":"Open Vocabulary Object Detection with Pseudo Bounding-Box Labels","date":"2021-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"salesforce/pb-ovd","path":"ALBEF/models/vit.py","file_url":"https://github.com/salesforce/pb-ovd/blob/HEAD/ALBEF/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"1905.12794","paper":"/paper/the-fashion-iq-dataset-retrieving-images-by","title":"Fashion IQ: A New Dataset Towards Retrieving Images by Natural Language Feedback","date":"2019-05-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hssip/fashionsap","path":"models/vit.py","file_url":"https://github.com/hssip/fashionsap/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"aaai_35495","paper":null,"title":"arXiv:aaai_35495","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"salesforce/BLIP","path":"models/vit.py","file_url":"https://github.com/salesforce/BLIP/blob/HEAD/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"aaai_28415","paper":null,"title":"arXiv:aaai_28415","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"wuhy68/p-Adapter","path":"eff_blip/vit.py","file_url":"https://github.com/wuhy68/p-Adapter/blob/HEAD/eff_blip/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}},{"arxiv_id":"Cheng_VindLU_A_Recipe_for_Effective_Video-and-Language_Pretraining_CVPR_2023_paper","paper":null,"title":"arXiv:Cheng_VindLU_A_Recipe_for_Effective_Video-and-Language_Pretraining_CVPR_2023_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"klauscc/VindLU","path":"models/utils.py","file_url":"https://github.com/klauscc/VindLU/blob/HEAD/models/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"dbd049b02a63c3a1","mcp_get_code":{"code_sha256":"dbd049b02a63c3a1"}},{"arxiv_id":"2024.acl-long.19","paper":null,"title":"arXiv:2024.acl-long.19","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"yiren-jian/EVLGen","path":"lavis/models/vit.py","file_url":"https://github.com/yiren-jian/EVLGen/blob/HEAD/lavis/models/vit.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":false,"code_sha256_prefix":"c6ec173f19f5c34d","mcp_get_code":{"code_sha256":"c6ec173f19f5c34d"}}]}