| Decoupled Vision-Language System for Multimodal Understanding and Generation added by Syntology |
2026-08 (from id) |
YifanXu74/Libra/libra/models/clip/modeling_clip.py f2ca34eca05d40cd |
unverified |
Apache-2.0 (permissive) |
| VTaMo: Video-Text Alignment Model for Sign Language Translation added by Syntology |
2026-07 (from id) |
junyi2005/vtamo/vtamo/clip_loss.py 8892fce2748859a1 |
ran
fingerprinted |
licence not identified · pointer only |
| Generating Statistical Charts with Validation-Driven LLM Workflows added by Syntology |
2026-05 (from id) |
pavlin-policar/llm-chart-generation/generation_pipeline/model_scripts/0_train_vit_clip.py 89367cb0848f8519 |
ran
|
BSD-3-Clause (permissive) |
| DEXTER: Diffusion-Guided EXplanations with TExtual Reasoning for Vision Models added by Syntology |
2025-10 (from id) |
perceivelab/dexter/dexter/models/modeling_clip.py f2ca34eca05d40cd |
unverified |
no licence file found · pointer only |
| SPECS: Specificity-Enhanced CLIPScore for Long Image Caption Evaluation added by Syntology |
2025-09 (from id) |
mbzuai-nlp/SPECS/model/model_spec.py 11ea502213a91170 |
ran · our draft was wrong
fingerprinted |
Apache-2.0 (permissive) |
| CultureCLIP: Empowering CLIP with Cultural Awareness through Synthetic Images and Contextualized Captions |
8 Jul 2025 |
lukahhcm/cultureclip/model_finetune/loss.py 1d31de1c8207e447 |
unverified |
no licence file found · pointer only |
| FG-CLIP: Fine-Grained Visual and Textual Alignment |
8 May 2025 |
360CVGroup/FG-CLIP/fgclip2/model/strcs/fgclip2.py e8c40917a9682d02 |
ran · our draft was wrong
fingerprinted |
Apache-2.0 (permissive) |
| GOAL: Global-local Object Alignment Learning |
22 Mar 2025 |
PerceptualAI-Lab/GOAL/goal.py 1591524e14c110fe |
ran · our draft was wrong
fingerprinted |
no licence file found · pointer only |
| Cornstarch: Distributed Multimodal Training Must Be Multimodality-Aware |
2025-03 (from id) |
cornstarch-org/Cornstarch/cornstarch/models/evaclip/modeling_evaclip.py f2ca34eca05d40cd |
unverified |
Apache-2.0 (permissive) |
| Any Information Is Just Worth One Single Screenshot: Unifying Search With Visualized Information Retrieval |
17 Feb 2025 |
VectorSpaceLab/MegaPairs/modeling_MMRet_CLIP.py 198ed04eaf39466a |
ran · our draft was wrong
fingerprinted |
MIT (permissive) |
| TaxaBind: A Unified Embedding Space for Ecological Applications |
1 Nov 2024 |
mvrl/taxabind/TaxaBind/EnvBind/model.py 29a311684e27a509 |
ran · fixture could not drive it
fingerprinted |
Apache-2.0 (permissive) |
| Capacity Control is an Effective Memorization Mitigation Mechanism in Text-Conditional Diffusion Models |
29 Oct 2024 |
raman1121/diffusion_memorization_hpo/difffit/modeling_clip.py f2ca34eca05d40cd |
unverified |
no licence file found · pointer only |
| InstructG2I: Synthesizing Images from Multimodal Attributed Graphs |
9 Oct 2024 |
PeterGriffinJin/InstructG2I/instructg2i/GraphQFormer.py f2ca34eca05d40cd |
unverified |
no licence file found · pointer only |
| Investigating and Mitigating Object Hallucinations in Pretrained Vision-Language (CLIP) Models |
4 Oct 2024 |
Yufang-Liu/clip_hallucination/finetune_clip/modeling_clip.py f2ca34eca05d40cd |
unverified |
no licence file found · pointer only |
| Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval |
30 Sep 2024 |
lijiabei-7/leccr/LECCR/models/clip_vit.py e5b89b1f72c319ed |
ran · our draft was wrong
fingerprinted |
no licence file found · pointer only |
| TokenBinder: Text-Video Retrieval with One-to-Many Alignment Paradigm |
30 Sep 2024 |
bingqingzhang/TokenBinder/src/modeling/CLIP.py e5b89b1f72c319ed |
ran · our draft was wrong
fingerprinted |
MIT (permissive) |
| M$^2$PT: Multimodal Prompt Tuning for Zero-shot Instruction Learning |
24 Sep 2024 |
william-wang618/m2pt/M2PT/model/llava_archPT.py 017dd63ed48e15f1 |
ran · our draft was wrong
fingerprinted |
no licence file found · pointer only |
| Maven: A Multimodal Foundation Model for Supernova Science |
29 Aug 2024 |
thomashelfer/multimodal-supernovae/src/loss.py ca4c88ac11df70b3 |
ran
|
MIT (permissive) |
| Libra: Building Decoupled Vision System on Large Language Models |
16 May 2024 |
yifanxu74/libra/libra/models/clip/modeling_clip.py f2ca34eca05d40cd |
unverified |
Apache-2.0 (permissive) |
| Zero-Shot ECG Classification with Multimodal Learning and Test-time Clinical Knowledge Enhancement |
11 Mar 2024 |
cheliu-computation/merl/utils/utils_loss.py 19c632192cb40d5c |
unverified |
MIT (permissive) |
| Explaining generative diffusion models via visual analysis for interpretable decision-making process |
16 Feb 2024 |
ian-jihoonpark/X-Diffusion/models/clip_encoder.py f2ca34eca05d40cd |
unverified |
no licence file found · pointer only |
| Lite-Mind: Towards Efficient and Robust Brain Representation Network |
6 Dec 2023 |
gongzix/lite-mind/src/engine.py 507ba10a0f424439 |
ran
fingerprinted |
no licence file found · pointer only |
| G2D: From Global to Dense Radiography Representation Learning via Vision-Language Pre-training |
3 Dec 2023 |
cheliu-computation/g2d-neurips24/PRETRAIN/utils/loss.py 19c632192cb40d5c |
unverified |
no licence file found · pointer only |
| Diverse and Aligned Audio-to-Video Generation via Text-to-Video Model Adaptation |
28 Sep 2023 |
guyyariv/TempoTokens/modules/text_encoder/modeling_clip_tempotokens.py f2ca34eca05d40cd |
unverified |
MIT (permissive) |
| ZeroForge: Feedforward Text-to-Shape Without 3D Supervision |
14 Jun 2023 |
km3888/zeroforge/zf_training.py cc8b8865eb2b1f91 |
ran · our draft was wrong
|
no licence file found · pointer only |
| Stable Diffusion is Unstable |
5 Jun 2023 |
duchengbin8/Stable_Diffusion_is_Unstable/m_clip.py f2ca34eca05d40cd |
unverified |
Apache-2.0 (permissive) |
| AudioToken: Adaptation of Text-Conditioned Diffusion Models for Audio-to-Image Generation |
22 May 2023 |
guyyariv/AudioToken/modules/clip_text_model/modeling_clip.py f2ca34eca05d40cd |
unverified |
MIT (permissive) |
| EfficientVLM: Fast and Accurate Vision-Language Models via Knowledge Distillation and Modal-adaptive Pruning |
14 Oct 2022 |
swaggy-tn/efficientvlm/efficient_models/eff_vit.py e5b89b1f72c319ed |
ran · our draft was wrong
fingerprinted |
BSD-3-Clause recorded; this copy not marked cleared · pointer only |
| Multimodal Analogical Reasoning over Knowledge Graphs |
1 Oct 2022 |
zjunlp/MKGformer/MKG/models/modeling_clip.py e5b89b1f72c319ed |
ran · our draft was wrong
fingerprinted |
MIT (permissive) |
| Multimodal Analogical Reasoning over Knowledge Graphs |
1 Oct 2022 |
zjunlp/MKG_Analogy/MarT/models/modeling_clip.py 1aa7f7b75b2418fa |
ran · violated contract
fingerprinted |
MIT (permissive) |
| CLIP-ViP: Adapting Pre-trained Image-Text Model to Video-Language Representation Alignment |
14 Sep 2022 |
microsoft/xpretrain/CLIP-ViP/src/modeling/CLIP_ViP.py e5b89b1f72c319ed |
ran · our draft was wrong
fingerprinted |
licence not identified · pointer only |
| Cross-View Language Modeling: Towards Unified Cross-Lingual Cross-Modal Pre-training |
1 Jun 2022 |
zengyan-97/cclm/models/clip_vit.py e5b89b1f72c319ed |
ran · our draft was wrong
fingerprinted |
BSD-3-Clause recorded; this copy not marked cleared · pointer only |
| Geodesic Multi-Modal Mixup for Robust Fine-Tuning |
8 Mar 2022 |
changdaeoh/multimodal-mixup/loss.py cb73c26e3ce88785 |
unverified |
no licence file found · pointer only |
| Augmenting Policy Learning with Routines Discovered from a Single Demonstration |
23 Dec 2020 |
sjtuytc/AAAI21-RoutineAugmentedPolicyLearning/torchrl_with_routines/algo/a2c.py 7c89cc9faf6bdbd1 |
ran · honoured contract
fingerprinted |
MIT (permissive) |
| arXiv:aaai_28565 |
|
zhangxulu1996/Compositional-Inversion/model/modeling_clip.py f2ca34eca05d40cd |
unverified |
MIT (permissive) |
| arXiv:2024.findings-emnlp.965 |
|
Chauncey-Jheng/PCRL-MRG/llama_recipes/models/PCRL_llama/modeling_PCRL_llama.py 9cebce9bbb39f3de |
unverified |
Apache-2.0 (permissive) |