{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/method/clip/papers/9","list_of":"/method/clip","method":"CLIP","archive":{"snapshot":"2025-07-28"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"date (newest first), then slug","page":9,"pages_in_order":31,"rows_per_page":100,"rows":[801,900],"of":3094,"counts":{"archive_papers_tagged":3094,"with_a_code_link":1617,"where_syntology_ran_a_sample":649,"not_listed_spam_title":0,"listed":3094,"listed_where_code_ran":649,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":554,"every_run_a_failure_of_syntologys_instrument":95,"listed_with_a_run_with_no_instrument_failure":554,"listed_every_run_a_failure_of_syntologys_instrument":95,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/method/clip","prev":"/method/clip/papers/8","next":"/method/clip/papers/10","papers":[{"paper":null,"slug":"a-hybrid-defense-strategy-for-boosting","title":"A Hybrid Defense Strategy for Boosting Adversarial Robustness in Vision-Language Models","date":"2024-10-18","arxiv_id":"2410.14911","n_code_links":0,"syntology":null},{"paper":null,"slug":"clip-vad-exploiting-vision-language-models","title":"CLIP-VAD: Exploiting Vision-Language Models for Voice Activity Detection","date":"2024-10-18","arxiv_id":"2410.14509","n_code_links":0,"syntology":null},{"paper":null,"slug":"ludvig-learning-free-uplifting-of-2d-visual","title":"LUDVIG: Learning-free Uplifting of 2D Visual features to Gaussian Splatting scenes","date":"2024-10-18","arxiv_id":"2410.14462","n_code_links":0,"syntology":null},{"paper":null,"slug":"naturalbench-evaluating-vision-language","title":"NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples","date":"2024-10-18","arxiv_id":"2410.14669","n_code_links":0,"syntology":null},{"paper":null,"slug":"consissr-delving-deep-into-consistency-in","title":"ConsisSR: Delving Deep into Consistency in Diffusion-based Image Super-Resolution","date":"2024-10-17","arxiv_id":"2410.13807","n_code_links":0,"syntology":null},{"paper":"/paper/improving-multi-modal-large-language-model","slug":"improving-multi-modal-large-language-model","title":"Improving Multi-modal Large Language Model through Boosting Vision Capabilities","date":"2024-10-17","arxiv_id":"2410.13733","n_code_links":0,"syntology":null},{"paper":null,"slug":"learning-multimodal-cues-of-children-s","title":"Learning Multimodal Cues of Children's Uncertainty","date":"2024-10-17","arxiv_id":"2410.14050","n_code_links":0,"syntology":null},{"paper":null,"slug":"let-me-finish-my-sentence-video-temporal","title":"Let Me Finish My Sentence: Video Temporal Grounding with Holistic Text Understanding","date":"2024-10-17","arxiv_id":"2410.13598","n_code_links":0,"syntology":null},{"paper":"/paper/mapping-bias-in-vision-language-models","slug":"mapping-bias-in-vision-language-models","title":"debiaSAE: Benchmarking and Mitigating Vision-Language Model Bias","date":"2024-10-17","arxiv_id":"2410.13146","n_code_links":1,"syntology":null},{"paper":"/paper/performance-of-gaussian-mixture-model","slug":"performance-of-gaussian-mixture-model","title":"Performance of Gaussian Mixture Model Classifiers on Embedded Feature Spaces","date":"2024-10-17","arxiv_id":"2410.13421","n_code_links":1,"syntology":null},{"paper":null,"slug":"dh-vton-deep-text-driven-virtual-try-on-via","title":"DH-VTON: Deep Text-Driven Virtual Try-On via Hybrid Attention Learning","date":"2024-10-16","arxiv_id":"2410.12501","n_code_links":0,"syntology":null},{"paper":"/paper/ftii-bench-a-comprehensive-multimodal","slug":"ftii-bench-a-comprehensive-multimodal","title":"FTII-Bench: A Comprehensive Multimodal Benchmark for Flow Text with Image Insertion","date":"2024-10-16","arxiv_id":"2410.12564","n_code_links":1,"syntology":null},{"paper":null,"slug":"hiding-in-plain-sight-hips-attack-on-clip-for","title":"Hiding-in-Plain-Sight (HiPS) Attack on CLIP for Targetted Object Removal from Images","date":"2024-10-16","arxiv_id":"2410.13010","n_code_links":0,"syntology":null},{"paper":"/paper/interpreting-and-analyzing-clip-s-zero-shot","slug":"interpreting-and-analyzing-clip-s-zero-shot","title":"Interpreting and Analysing CLIP's Zero-Shot Image Classification via Mutual Knowledge","date":"2024-10-16","arxiv_id":"2410.13016","n_code_links":1,"syntology":{"ran":2,"of":2,"n_ran_checked":0,"n_instrument":2,"unverified":0,"pointer_only":2,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","official":{"repos":["fawazsammani/clip-interpret-mutual-knowledge"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/mind-the-gap-between-prototypes-and-images-in","slug":"mind-the-gap-between-prototypes-and-images-in","title":"Mind the Gap Between Prototypes and Images in Cross-domain Finetuning","date":"2024-10-16","arxiv_id":"2410.12474","n_code_links":1,"syntology":null},{"paper":"/paper/tokens-on-demand-token-condensation-as","slug":"tokens-on-demand-token-condensation-as","title":"Is Less More? Exploring Token Condensation as Training-free Adaptation for CLIP","date":"2024-10-16","arxiv_id":"2410.14729","n_code_links":1,"syntology":null},{"paper":"/paper/transagent-transfer-vision-language","slug":"transagent-transfer-vision-language","title":"TransAgent: Transfer Vision-Language Foundation Models with Heterogeneous Agent Collaboration","date":"2024-10-16","arxiv_id":"2410.12183","n_code_links":1,"syntology":{"ran":6,"of":8,"n_ran_checked":3,"n_instrument":3,"unverified":2,"pointer_only":2,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 3 where Syntology's instrument failed) · 2 unverified","official":{"repos":["markywg/transagent"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":2,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"augmentation-driven-metric-for-balancing","title":"Preserve or Modify? Context-Aware Evaluation for Balancing Preservation and Modification in Text-Guided Image Editing","date":"2024-10-15","arxiv_id":"2410.11374","n_code_links":0,"syntology":null},{"paper":null,"slug":"clip-dfgs-a-hard-sample-mining-method-for","title":"CLIP-DFGS: A Hard Sample Mining Method for CLIP in Generalizable Person Re-Identification","date":"2024-10-15","arxiv_id":"2410.11255","n_code_links":0,"syntology":null},{"paper":null,"slug":"ctrlsynth-controllable-image-text-synthesis","title":"CtrlSynth: Controllable Image Text Synthesis for Data-Efficient Multimodal Learning","date":"2024-10-15","arxiv_id":"2410.11963","n_code_links":0,"syntology":null},{"paper":"/paper/improving-long-text-alignment-for-text-to","slug":"improving-long-text-alignment-for-text-to","title":"Improving Long-Text Alignment for Text-to-Image Diffusion Models","date":"2024-10-15","arxiv_id":"2410.11817","n_code_links":1,"syntology":{"ran":4,"of":10,"n_ran_checked":3,"n_instrument":1,"unverified":6,"pointer_only":1,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 1 where Syntology's instrument failed) · 6 unverified","official":{"repos":["luping-liu/longalign"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":6,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"it-s-just-another-day-unique-video-captioning","title":"It's Just Another Day: Unique Video Captioning by Discriminative Prompting","date":"2024-10-15","arxiv_id":"2410.11702","n_code_links":0,"syntology":null},{"paper":null,"slug":"animate-x-universal-character-image-animation","title":"Animate-X: Universal Character Image Animation with Enhanced Motion Representation","date":"2024-10-14","arxiv_id":"2410.10306","n_code_links":0,"syntology":null},{"paper":"/paper/hart-efficient-visual-generation-with-hybrid","slug":"hart-efficient-visual-generation-with-hybrid","title":"HART: Efficient Visual Generation with Hybrid Autoregressive Transformer","date":"2024-10-14","arxiv_id":"2410.10812","n_code_links":2,"syntology":{"ran":23,"of":27,"n_ran_checked":15,"n_instrument":8,"unverified":4,"pointer_only":4,"phrase":"23 ran (of which 0 constructed an object rather than computing a result; 15 with no instrument failure: 2 honoured, 0 violated, 13 with no contract checked; 8 where Syntology's instrument failed) · 4 unverified","official":{"repos":["mit-han-lab/hart","FoundationVision/VAR"],"state":"official (archive's flag): 23 ran","n_ran":23,"n_constructed":0,"n_ran_no_instrument_failure":15,"n_unverified":4,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"learning-to-customize-text-to-image-diffusion","title":"Learning to Customize Text-to-Image Diffusion In Diverse Context","date":"2024-10-14","arxiv_id":"2410.10058","n_code_links":0,"syntology":null},{"paper":null,"slug":"lobg-less-overfitting-for-better","title":"LOBG:Less Overfitting for Better Generalization in Vision-Language Model","date":"2024-10-14","arxiv_id":"2410.10247","n_code_links":0,"syntology":null},{"paper":"/paper/locality-alignment-improves-vision-language","slug":"locality-alignment-improves-vision-language","title":"Locality Alignment Improves Vision-Language Models","date":"2024-10-14","arxiv_id":"2410.11087","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":1,"n_instrument":0,"unverified":0,"pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":null}},{"paper":"/paper/mixture-of-experts-made-personalized","slug":"mixture-of-experts-made-personalized","title":"Mixture of Experts Made Personalized: Federated Prompt Learning for Vision-Language Models","date":"2024-10-14","arxiv_id":"2410.10114","n_code_links":1,"syntology":{"ran":3,"of":4,"n_ran_checked":0,"n_instrument":3,"unverified":1,"pointer_only":2,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 1 unverified","official":{"repos":["ljaiverson/pfedmoap"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/mmar-towards-lossless-multi-modal-auto","slug":"mmar-towards-lossless-multi-modal-auto","title":"MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling","date":"2024-10-14","arxiv_id":"2410.10798","n_code_links":0,"syntology":null},{"paper":"/paper/intermediate-representations-for-enhanced","slug":"intermediate-representations-for-enhanced","title":"Generating Intermediate Representations for Compositional Text-To-Image Generation","date":"2024-10-13","arxiv_id":"2410.09792","n_code_links":1,"syntology":{"ran":2,"of":2,"n_ran_checked":1,"n_instrument":1,"unverified":0,"pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["rang1991/public-intermediate-semantics-for-generation"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/tulip-token-length-upgraded-clip","slug":"tulip-token-length-upgraded-clip","title":"TULIP: Token-length Upgraded CLIP","date":"2024-10-13","arxiv_id":"2410.10034","n_code_links":1,"syntology":{"ran":13,"of":20,"n_ran_checked":9,"n_instrument":4,"unverified":7,"pointer_only":7,"phrase":"13 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 0 honoured, 1 violated, 8 with no contract checked; 4 where Syntology's instrument failed) · 7 unverified","official":{"repos":["ivonajdenkoska/tulip"],"state":"official (archive's flag): 13 ran","n_ran":13,"n_constructed":0,"n_ran_no_instrument_failure":9,"n_unverified":7,"ran_from_kinds":["official"]}}},{"paper":"/paper/clip-scgi-synthesized-caption-guided","slug":"clip-scgi-synthesized-caption-guided","title":"CLIP-SCGI: Synthesized Caption-Guided Inversion for Person Re-Identification","date":"2024-10-12","arxiv_id":"2410.09382","n_code_links":0,"syntology":null},{"paper":null,"slug":"debiasing-vison-language-models-with-text","title":"Debiasing Vison-Language Models with Text-Only Training","date":"2024-10-12","arxiv_id":"2410.09365","n_code_links":0,"syntology":null},{"paper":null,"slug":"boosting-open-vocabulary-object-detection-by","title":"Boosting Open-Vocabulary Object Detection by Handling Background Samples","date":"2024-10-11","arxiv_id":"2410.08645","n_code_links":0,"syntology":null},{"paper":null,"slug":"calibrated-cache-model-for-few-shot-vision","title":"Calibrated Cache Model for Few-Shot Vision-Language Model Adaptation","date":"2024-10-11","arxiv_id":"2410.08895","n_code_links":0,"syntology":null},{"paper":null,"slug":"more-than-memes-a-multimodal-topic-modeling","title":"More than Memes: A Multimodal Topic Modeling Approach to Conspiracy Theories on Telegram","date":"2024-10-11","arxiv_id":"2410.08642","n_code_links":0,"syntology":null},{"paper":"/paper/natural-language-induced-adversarial-images","slug":"natural-language-induced-adversarial-images","title":"Natural Language Induced Adversarial Images","date":"2024-10-11","arxiv_id":"2410.08620","n_code_links":1,"syntology":null},{"paper":null,"slug":"semantic-token-reweighting-for-interpretable","title":"Semantic Token Reweighting for Interpretable and Controllable Text Embeddings in CLIP","date":"2024-10-11","arxiv_id":"2410.08469","n_code_links":0,"syntology":null},{"paper":null,"slug":"clip-multi-modal-hashing-for-multimedia","title":"CLIP Multi-modal Hashing for Multimedia Retrieval","date":"2024-10-10","arxiv_id":"2410.07783","n_code_links":0,"syntology":null},{"paper":null,"slug":"csa-data-efficient-mapping-of-unimodal","title":"CSA: Data-efficient Mapping of Unimodal Features to Multimodal Features","date":"2024-10-10","arxiv_id":"2410.07610","n_code_links":0,"syntology":null},{"paper":null,"slug":"emerging-pixel-grounding-in-large-multimodal","title":"Emerging Pixel Grounding in Large Multimodal Models Without Grounding Supervision","date":"2024-10-10","arxiv_id":"2410.08209","n_code_links":0,"syntology":null},{"paper":null,"slug":"flier-few-shot-language-image-models-embedded","title":"FLIER: Few-shot Language Image Models Embedded with Latent Representations","date":"2024-10-10","arxiv_id":"2410.07648","n_code_links":0,"syntology":null},{"paper":null,"slug":"hegraphadapter-tuning-multi-modal-vision","title":"HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter","date":"2024-10-10","arxiv_id":"2410.07854","n_code_links":0,"syntology":null},{"paper":null,"slug":"in-search-of-forgotten-domain-generalization","title":"In Search of Forgotten Domain Generalization","date":"2024-10-10","arxiv_id":"2410.08258","n_code_links":0,"syntology":null},{"paper":null,"slug":"latteclip-unsupervised-clip-fine-tuning-via","title":"LatteCLIP: Unsupervised CLIP Fine-Tuning via LMM-Synthetic Texts","date":"2024-10-10","arxiv_id":"2410.08211","n_code_links":0,"syntology":null},{"paper":"/paper/progressive-autoregressive-video-diffusion","slug":"progressive-autoregressive-video-diffusion","title":"Progressive Autoregressive Video Diffusion Models","date":"2024-10-10","arxiv_id":"2410.08151","n_code_links":1,"syntology":{"ran":7,"of":7,"n_ran_checked":7,"n_instrument":0,"unverified":0,"pointer_only":2,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 0 violated, 7 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["desaixie/pa_vdm"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":0,"n_ran_no_instrument_failure":7,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"boosting-few-shot-detection-with-large","title":"Boosting Few-Shot Detection with Large Language Models and Layout-to-Image Synthesis","date":"2024-10-09","arxiv_id":"2410.06841","n_code_links":0,"syntology":null},{"paper":"/paper/compositional-entailment-learning-for","slug":"compositional-entailment-learning-for","title":"Compositional Entailment Learning for Hyperbolic Vision-Language Models","date":"2024-10-09","arxiv_id":"2410.06912","n_code_links":1,"syntology":{"ran":7,"of":13,"n_ran_checked":2,"n_instrument":5,"unverified":6,"pointer_only":13,"phrase":"7 ran (of which 2 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 5 where Syntology's instrument failed) · 6 unverified","official":{"repos":["PalAvik/hycoclip"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":2,"n_ran_no_instrument_failure":2,"n_unverified":6,"ran_from_kinds":["official"]}}},{"paper":"/paper/enhancing-vision-language-model-pre-training","slug":"enhancing-vision-language-model-pre-training","title":"Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency","date":"2024-10-09","arxiv_id":"2410.10879","n_code_links":1,"syntology":null},{"paper":null,"slug":"exploiting-distribution-constraints-for","title":"Exploiting Distribution Constraints for Scalable and Efficient Image Retrieval","date":"2024-10-09","arxiv_id":"2410.07022","n_code_links":0,"syntology":null},{"paper":null,"slug":"fostering-intrinsic-motivation-in","title":"Fostering Intrinsic Motivation in Reinforcement Learning with Pretrained Foundation Models","date":"2024-10-09","arxiv_id":"2410.07404","n_code_links":0,"syntology":null},{"paper":null,"slug":"lamp-language-motion-pretraining-for-motion","title":"LaMP: Language-Motion Pretraining for Motion Generation, Retrieval, and Captioning","date":"2024-10-09","arxiv_id":"2410.07093","n_code_links":0,"syntology":null},{"paper":null,"slug":"open-rgbt-open-vocabulary-rgb-t-zero-shot","title":"Open-RGBT: Open-vocabulary RGB-T Zero-shot Semantic Segmentation in Open-world Environments","date":"2024-10-09","arxiv_id":"2410.06626","n_code_links":0,"syntology":null},{"paper":"/paper/positive-augmented-contrastive-learning-for","slug":"positive-augmented-contrastive-learning-for","title":"Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training","date":"2024-10-09","arxiv_id":"2410.07336","n_code_links":1,"syntology":null},{"paper":null,"slug":"casa-class-agnostic-shared-attributes-in","title":"CASA: Class-Agnostic Shared Attributes in Vision-Language Models for Efficient Incremental Object Detection","date":"2024-10-08","arxiv_id":"2410.05804","n_code_links":0,"syntology":null},{"paper":"/paper/facmic-federated-adaptative-clip-model-for","slug":"facmic-federated-adaptative-clip-model-for","title":"FACMIC: Federated Adaptative CLIP Model for Medical Image Classification","date":"2024-10-08","arxiv_id":"2410.14707","n_code_links":1,"syntology":null},{"paper":"/paper/pixlens-a-novel-framework-for-disentangled","slug":"pixlens-a-novel-framework-for-disentangled","title":"PixLens: A Novel Framework for Disentangled Evaluation in Diffusion-Based Image Editing with Object Detection + SAM","date":"2024-10-08","arxiv_id":"2410.05710","n_code_links":1,"syntology":null},{"paper":"/paper/sia-ovd-shape-invariant-adapter-for-bridging","slug":"sia-ovd-shape-invariant-adapter-for-bridging","title":"SIA-OVD: Shape-Invariant Adapter for Bridging the Image-Region Gap in Open-Vocabulary Detection","date":"2024-10-08","arxiv_id":"2410.05650","n_code_links":1,"syntology":null},{"paper":"/paper/fine-tuning-clip-s-last-visual-projector-a","slug":"fine-tuning-clip-s-last-visual-projector-a","title":"Fine-Tuning CLIP's Last Visual Projector: A Few-Shot Cornucopia","date":"2024-10-07","arxiv_id":"2410.05270","n_code_links":1,"syntology":null},{"paper":"/paper/preserving-multi-modal-capabilities-of-pre","slug":"preserving-multi-modal-capabilities-of-pre","title":"Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality","date":"2024-10-07","arxiv_id":"2410.05210","n_code_links":1,"syntology":{"ran":10,"of":13,"n_ran_checked":3,"n_instrument":7,"unverified":3,"pointer_only":13,"phrase":"10 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 1 honoured, 1 violated, 1 with no contract checked; 7 where Syntology's instrument failed) · 3 unverified","official":{"repos":["ytaek-oh/fsc-clip"],"state":"official (archive's flag): 10 ran","n_ran":10,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":"/paper/select-a-large-scale-benchmark-of-data","slug":"select-a-large-scale-benchmark-of-data","title":"SELECT: A Large-Scale Benchmark of Data Curation Strategies for Image Classification","date":"2024-10-07","arxiv_id":"2410.05057","n_code_links":1,"syntology":{"ran":10,"of":13,"n_ran_checked":10,"n_instrument":0,"unverified":3,"pointer_only":0,"phrase":"10 ran (of which 0 constructed an object rather than computing a result; 10 with no instrument failure: 0 honoured, 0 violated, 10 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","official":{"repos":["jimmyxu123/select"],"state":"official (archive's flag): 10 ran","n_ran":10,"n_constructed":0,"n_ran_no_instrument_failure":10,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"vlm2vec-training-vision-language-models-for","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","date":"2024-10-07","arxiv_id":"2410.05160","n_code_links":0,"syntology":null},{"paper":null,"slug":"zero-shot-vision-and-language-navigation-with","title":"Zero-Shot Vision-and-Language Navigation with Collision Mitigation in Continuous Environment","date":"2024-10-07","arxiv_id":"2410.17267","n_code_links":0,"syntology":null},{"paper":"/paper/multimodal-3d-fusion-and-in-situ-learning-for","slug":"multimodal-3d-fusion-and-in-situ-learning-for","title":"Multimodal 3D Fusion and In-Situ Learning for Spatially Aware AI","date":"2024-10-06","arxiv_id":"2410.04652","n_code_links":1,"syntology":null},{"paper":null,"slug":"learning-on-loras-gl-equivariant-processing","title":"Learning on LoRAs: GL-Equivariant Processing of Low-Rank Weight Spaces for Large Finetuned Models","date":"2024-10-05","arxiv_id":"2410.04207","n_code_links":0,"syntology":null},{"paper":null,"slug":"combing-text-based-and-drag-based-editing-for","title":"Combing Text-based and Drag-based Editing for Precise and Flexible Image Editing","date":"2024-10-04","arxiv_id":"2410.03097","n_code_links":0,"syntology":null},{"paper":null,"slug":"disk-differentially-private-optimizer-with","title":"DiSK: Differentially Private Optimizer with Simplified Kalman Filter for Noise Reduction","date":"2024-10-04","arxiv_id":"2410.03883","n_code_links":0,"syntology":null},{"paper":null,"slug":"generalizable-prompt-tuning-for-vision","title":"Generalizable Prompt Tuning for Vision-Language Models","date":"2024-10-04","arxiv_id":"2410.03189","n_code_links":0,"syntology":null},{"paper":"/paper/investigating-and-mitigating-object","slug":"investigating-and-mitigating-object","title":"Investigating and Mitigating Object Hallucinations in Pretrained Vision-Language (CLIP) Models","date":"2024-10-04","arxiv_id":"2410.03176","n_code_links":1,"syntology":{"ran":2,"of":3,"n_ran_checked":1,"n_instrument":1,"unverified":1,"pointer_only":3,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","official":{"repos":["yufang-liu/clip_hallucination"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":"/paper/model-developmental-safety-a-safety-centric","slug":"model-developmental-safety-a-safety-centric","title":"A Retention-Centric Framework for Continual Learning with Guaranteed Model Developmental Safety","date":"2024-10-04","arxiv_id":"2410.03955","n_code_links":1,"syntology":{"ran":5,"of":9,"n_ran_checked":1,"n_instrument":4,"unverified":4,"pointer_only":9,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 4 where Syntology's instrument failed) · 4 unverified","official":{"repos":["ganglii/devsafety"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":4,"ran_from_kinds":["official"]}}},{"paper":"/paper/redefining-temporal-modeling-in-video","slug":"redefining-temporal-modeling-in-video","title":"Redefining Temporal Modeling in Video Diffusion: The Vectorized Timestep Approach","date":"2024-10-04","arxiv_id":"2410.03160","n_code_links":1,"syntology":{"ran":9,"of":10,"n_ran_checked":7,"n_instrument":2,"unverified":1,"pointer_only":0,"phrase":"9 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 1 honoured, 0 violated, 6 with no contract checked; 2 where Syntology's instrument failed) · 1 unverified","official":{"repos":["yaofang-liu/fvdm"],"state":"official (archive's flag): 9 ran","n_ran":9,"n_constructed":0,"n_ran_no_instrument_failure":7,"n_unverified":1,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"shielddiff-suppressing-sexual-content","title":"ShieldDiff: Suppressing Sexual Content Generation from Diffusion Models through Reinforcement Learning","date":"2024-10-04","arxiv_id":"2410.05309","n_code_links":0,"syntology":null},{"paper":null,"slug":"the-wallpaper-is-ugly-indoor-localization","title":"The Wallpaper is Ugly: Indoor Localization using Vision and Language","date":"2024-10-04","arxiv_id":"2410.03900","n_code_links":0,"syntology":null},{"paper":null,"slug":"vedit-latent-prediction-architecture-for","title":"VEDIT: Latent Prediction Architecture For Procedural Video Representation Learning","date":"2024-10-04","arxiv_id":"2410.03478","n_code_links":0,"syntology":null},{"paper":null,"slug":"contrastive-localized-language-image-pre","title":"Contrastive Localized Language-Image Pre-Training","date":"2024-10-03","arxiv_id":"2410.02746","n_code_links":0,"syntology":null},{"paper":"/paper/revisit-large-scale-image-caption-data-in-pre","slug":"revisit-large-scale-image-caption-data-in-pre","title":"Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models","date":"2024-10-03","arxiv_id":"2410.02740","n_code_links":1,"syntology":null},{"paper":"/paper/understanding-and-mitigating-miscalibration","slug":"understanding-and-mitigating-miscalibration","title":"Understanding and Mitigating Miscalibration in Prompt Tuning for Vision-Language Models","date":"2024-10-03","arxiv_id":"2410.02681","n_code_links":1,"syntology":{"ran":4,"of":9,"n_ran_checked":1,"n_instrument":3,"unverified":5,"pointer_only":6,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 3 where Syntology's instrument failed) · 5 unverified","official":null}},{"paper":"/paper/agriclip-adapting-clip-for-agriculture-and","slug":"agriclip-adapting-clip-for-agriculture-and","title":"AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment","date":"2024-10-02","arxiv_id":"2410.01407","n_code_links":1,"syntology":null},{"paper":"/paper/edge-preserving-noise-for-diffusion-models","slug":"edge-preserving-noise-for-diffusion-models","title":"Edge-preserving noise for diffusion models","date":"2024-10-02","arxiv_id":"2410.01540","n_code_links":1,"syntology":{"ran":3,"of":3,"n_ran_checked":0,"n_instrument":3,"unverified":0,"pointer_only":3,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 0 unverified","official":null}},{"paper":"/paper/integrating-visual-and-textual-inputs-for","slug":"integrating-visual-and-textual-inputs-for","title":"Integrating Visual and Textual Inputs for Searching Large-Scale Map Collections with CLIP","date":"2024-10-02","arxiv_id":"2410.01190","n_code_links":1,"syntology":null},{"paper":"/paper/segearth-ov-towards-traning-free-open","slug":"segearth-ov-towards-traning-free-open","title":"SegEarth-OV: Towards Training-Free Open-Vocabulary Segmentation for Remote Sensing Images","date":"2024-10-02","arxiv_id":"2410.01768","n_code_links":2,"syntology":{"ran":6,"of":9,"n_ran_checked":4,"n_instrument":2,"unverified":3,"pointer_only":9,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 1 violated, 3 with no contract checked; 2 where Syntology's instrument failed) · 3 unverified","official":{"repos":["likyoo/SegEarth-OV"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"toward-a-holistic-evaluation-of-robustness-in","title":"Toward a Holistic Evaluation of Robustness in CLIP Models","date":"2024-10-02","arxiv_id":"2410.01534","n_code_links":0,"syntology":null},{"paper":"/paper/pointad-comprehending-3d-anomalies-from","slug":"pointad-comprehending-3d-anomalies-from","title":"PointAD: Comprehending 3D Anomalies from Points and Pixels for Zero-shot 3D Anomaly Detection","date":"2024-10-01","arxiv_id":"2410.00320","n_code_links":1,"syntology":{"ran":17,"of":26,"n_ran_checked":11,"n_instrument":6,"unverified":9,"pointer_only":23,"phrase":"17 ran (of which 2 constructed an object rather than computing a result; 11 with no instrument failure: 1 honoured, 0 violated, 10 with no contract checked; 6 where Syntology's instrument failed) · 9 unverified","official":{"repos":["zqhang/pointad"],"state":"official (archive's flag): 15 ran","n_ran":15,"n_constructed":2,"n_ran_no_instrument_failure":11,"n_unverified":8,"ran_from_kinds":["community","official"]}}},{"paper":null,"slug":"rethinking-misalignment-in-vision-language","title":"Rethinking Misalignment in Vision-Language Model Adaptation from a Causal Perspective","date":"2024-10-01","arxiv_id":"2410.12816","n_code_links":0,"syntology":null},{"paper":null,"slug":"videoclip-xl-advancing-long-description","title":"VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models","date":"2024-10-01","arxiv_id":"2410.00741","n_code_links":0,"syntology":null},{"paper":"/paper/magnet-we-never-know-how-text-to-image","slug":"magnet-we-never-know-how-text-to-image","title":"Magnet: We Never Know How Text-to-Image Diffusion Models Work, Until We Learn How Vision-Language Models Function","date":"2024-09-30","arxiv_id":"2409.19967","n_code_links":1,"syntology":{"ran":11,"of":17,"n_ran_checked":10,"n_instrument":1,"unverified":6,"pointer_only":17,"phrase":"11 ran (of which 0 constructed an object rather than computing a result; 10 with no instrument failure: 1 honoured, 0 violated, 9 with no contract checked; 1 where Syntology's instrument failed) · 6 unverified","official":{"repos":["i2-multimedia-lab/magnet"],"state":"official (archive's flag): 11 ran","n_ran":11,"n_constructed":0,"n_ran_no_instrument_failure":10,"n_unverified":6,"ran_from_kinds":["official"]}}},{"paper":"/paper/profd-prompt-guided-feature-disentangling-for","slug":"profd-prompt-guided-feature-disentangling-for","title":"ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification","date":"2024-09-30","arxiv_id":"2409.20081","n_code_links":1,"syntology":null},{"paper":null,"slug":"the-age-of-spiritual-machines-language","title":"The age of spiritual machines: Language quietus induces synthetic altered states of consciousness in artificial intelligence","date":"2024-09-30","arxiv_id":"2410.00257","n_code_links":0,"syntology":null},{"paper":null,"slug":"towards-open-vocabulary-semantic-segmentation","title":"Towards Open-Vocabulary Semantic Segmentation Without Semantic Labels","date":"2024-09-30","arxiv_id":"2409.19846","n_code_links":0,"syntology":null},{"paper":"/paper/trope-training-free-object-part-enhancement","slug":"trope-training-free-object-part-enhancement","title":"TROPE: TRaining-Free Object-Part Enhancement for Seamlessly Improving Fine-Grained Zero-Shot Image Captioning","date":"2024-09-30","arxiv_id":"2409.19960","n_code_links":1,"syntology":null},{"paper":"/paper/clip-based-camera-agnostic-feature-learning","slug":"clip-based-camera-agnostic-feature-learning","title":"CLIP-based Camera-Agnostic Feature Learning for Intra-camera Person Re-Identification","date":"2024-09-29","arxiv_id":"2409.19563","n_code_links":1,"syntology":null},{"paper":null,"slug":"efficient-backdoor-defense-in-multimodal","title":"Efficient Backdoor Defense in Multimodal Contrastive Learning: A Token-Level Unlearning Method for Mitigating Threats","date":"2024-09-29","arxiv_id":"2409.19526","n_code_links":0,"syntology":null},{"paper":"/paper/federated-learning-from-vision-language","slug":"federated-learning-from-vision-language","title":"Federated Learning from Vision-Language Foundation Models: Theoretical Analysis and Method","date":"2024-09-29","arxiv_id":"2409.19610","n_code_links":1,"syntology":{"ran":7,"of":10,"n_ran_checked":3,"n_instrument":4,"unverified":3,"pointer_only":10,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 4 where Syntology's instrument failed) · 3 unverified","official":{"repos":["PanBikang/PromptFolio"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":"/paper/clip-moe-towards-building-mixture-of-experts","slug":"clip-moe-towards-building-mixture-of-experts","title":"CLIP-MoE: Towards Building Mixture of Experts for CLIP with Diversified Multiplet Upcycling","date":"2024-09-28","arxiv_id":"2409.19291","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":1,"n_instrument":0,"unverified":0,"pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["OpenSparseLLMs/CLIP-MoE"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"dota-distributional-test-time-adaptation-of","title":"DOTA: Distributional Test-Time Adaptation of Vision-Language Models","date":"2024-09-28","arxiv_id":"2409.19375","n_code_links":0,"syntology":null},{"paper":"/paper/fairpivara-reducing-and-assessing-biases-in","slug":"fairpivara-reducing-and-assessing-biases-in","title":"FairPIVARA: Reducing and Assessing Biases in CLIP-Based Multimodal Models","date":"2024-09-28","arxiv_id":"2409.19474","n_code_links":1,"syntology":null},{"paper":"/paper/from-unimodal-to-multimodal-scaling-up","slug":"from-unimodal-to-multimodal-scaling-up","title":"From Unimodal to Multimodal: Scaling up Projectors to Align Modalities","date":"2024-09-28","arxiv_id":"2409.19425","n_code_links":1,"syntology":null},{"paper":"/paper/medclip-samv2-towards-universal-text-driven","slug":"medclip-samv2-towards-universal-text-driven","title":"MedCLIP-SAMv2: Towards Universal Text-Driven Medical Image Segmentation","date":"2024-09-28","arxiv_id":"2409.19483","n_code_links":2,"syntology":null},{"paper":"/paper/emu3-next-token-prediction-is-all-you-need","slug":"emu3-next-token-prediction-is-all-you-need","title":"Emu3: Next-Token Prediction is All You Need","date":"2024-09-27","arxiv_id":"2409.18869","n_code_links":2,"syntology":{"ran":6,"of":6,"n_ran_checked":3,"n_instrument":3,"unverified":0,"pointer_only":0,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 3 where Syntology's instrument failed) · 0 unverified","official":null}},{"paper":"/paper/improving-visual-object-tracking-through","slug":"improving-visual-object-tracking-through","title":"Improving Visual Object Tracking through Visual Prompting","date":"2024-09-27","arxiv_id":"2409.18901","n_code_links":1,"syntology":null}],"record_sha256":"6d451ff7e05ef74b1924354ae7137edadb2032ec6dfc1aaad864bdab005ca2a9","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}