{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-text-retrieval/papers/2","list_of":"/task/image-text-retrieval","task":"Image-text Retrieval","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":3,"rows_per_page":100,"rows":[101,200],"of":248,"counts":{"archive_papers_tagged":248,"with_a_code_link":131,"where_syntology_ran_a_sample":49,"not_listed_spam_title":0,"listed":248,"listed_where_code_ran":49,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":44,"every_run_a_failure_of_syntologys_instrument":5,"listed_with_a_run_with_no_instrument_failure":44,"listed_every_run_a_failure_of_syntologys_instrument":5,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-text-retrieval","prev":"/task/image-text-retrieval","next":"/task/image-text-retrieval/papers/3","papers":[{"url":"/paper/map-modality-agnostic-uncertainty-aware","slug":"map-modality-agnostic-uncertainty-aware","title":"MAP: Multimodal Uncertainty-Aware Vision-Language Pre-training Model","date":"2022-10-11","arxiv_id":"2210.05335","repositories_listed":1,"syntology":null},{"url":"/paper/mr-right-multimodal-retrieval-on","slug":"mr-right-multimodal-retrieval-on","title":"Mr. Right: Multimodal Retrieval on Representation of ImaGe witH Text","date":"2022-09-28","arxiv_id":"2209.13764","repositories_listed":1,"syntology":null},{"url":"/paper/vl-taboo-an-analysis-of-attribute-based-zero","slug":"vl-taboo-an-analysis-of-attribute-based-zero","title":"VL-Taboo: An Analysis of Attribute-based Zero-shot Capabilities of Vision-Language Models","date":"2022-09-12","arxiv_id":"2209.06103","repositories_listed":1,"syntology":null},{"url":"/paper/feta-towards-specializing-foundation-models","slug":"feta-towards-specializing-foundation-models","title":"FETA: Towards Specializing Foundation Models for Expert Task Applications","date":"2022-09-08","arxiv_id":"2209.03648","repositories_listed":1,"syntology":null},{"url":"/paper/efficient-vision-language-pretraining-with","slug":"efficient-vision-language-pretraining-with","title":"Efficient Vision-Language Pretraining with Visual Concepts and Hierarchical Alignment","date":"2022-08-29","arxiv_id":"2208.13628","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/efficient-vision-language-pretraining-with#ran","syntology_url":"https://syntology.ai/paper/2208.13628","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2208.13628"}},"official":{"repos":["mshukor/vicha"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/intra-modal-constraint-loss-for-image-text","slug":"intra-modal-constraint-loss-for-image-text","title":"Intra-Modal Constraint Loss For Image-Text Retrieval","date":"2022-07-11","arxiv_id":"2207.05024","repositories_listed":1,"syntology":null},{"url":"/paper/mixgen-a-new-multi-modal-data-augmentation","slug":"mixgen-a-new-multi-modal-data-augmentation","title":"MixGen: A New Multi-Modal Data Augmentation","date":"2022-06-16","arxiv_id":"2206.08358","repositories_listed":1,"syntology":{"n":2,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"0 ran · 2 unverified","sample_list":"/paper/mixgen-a-new-multi-modal-data-augmentation#ran","syntology_url":"https://syntology.ai/paper/2206.08358","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2206.08358"}},"official":{"repos":["amazon-research/mix-generation"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":2,"ran_from_kinds":[]}}},{"url":"/paper/coarse-to-fine-vision-language-pre-training","slug":"coarse-to-fine-vision-language-pre-training","title":"Coarse-to-Fine Vision-Language Pre-training with Fusion in the Backbone","date":"2022-06-15","arxiv_id":"2206.07643","repositories_listed":1,"syntology":{"n":3,"n_ran":2,"n_constructed":0,"n_ran_checked":1,"n_instrument":1,"n_unverified":1,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":2,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/coarse-to-fine-vision-language-pre-training#ran","syntology_url":"https://syntology.ai/paper/2206.07643","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2206.07643"}},"official":{"repos":["microsoft/fiber"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["unlocated"]}}},{"url":"/paper/cross-lingual-and-multilingual-clip","slug":"cross-lingual-and-multilingual-clip","title":"Cross-lingual and Multilingual CLIP","date":"2022-06-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/cross-view-language-modeling-towards-unified","slug":"cross-view-language-modeling-towards-unified","title":"Cross-View Language Modeling: Towards Unified Cross-Lingual Cross-Modal Pre-training","date":"2022-06-01","arxiv_id":"2206.00621","repositories_listed":1,"syntology":{"n":8,"n_ran":6,"n_constructed":0,"n_ran_checked":3,"n_instrument":3,"n_unverified":2,"n_honours":3,"n_violates":0,"n_no_contract":0,"n_pointer_only":8,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 3 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/cross-view-language-modeling-towards-unified#ran","syntology_url":"https://syntology.ai/paper/2206.00621","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2206.00621"}},"official":{"repos":["zengyan-97/cclm"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/zero-and-r2d2-a-large-scale-chinese-cross","slug":"zero-and-r2d2-a-large-scale-chinese-cross","title":"CCMB: A Large-scale Chinese Cross-modal Benchmark","date":"2022-05-08","arxiv_id":"2205.03860","repositories_listed":1,"syntology":{"n":9,"n_ran":8,"n_constructed":0,"n_ran_checked":8,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":8,"n_pointer_only":0,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 8 with no instrument failure: 0 honoured, 0 violated, 8 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/zero-and-r2d2-a-large-scale-chinese-cross#ran","syntology_url":"https://syntology.ai/paper/2205.03860","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2205.03860"}},"official":{"repos":["yuxie11/R2D2"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":0,"n_ran_no_instrument_failure":8,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/single-stream-multi-level-alignment-for","slug":"single-stream-multi-level-alignment-for","title":"Single-Stream Multi-Level Alignment for Vision-Language Pretraining","date":"2022-03-27","arxiv_id":"2203.14395","repositories_listed":1,"syntology":null},{"url":"/paper/where-does-the-performance-improvement-come","slug":"where-does-the-performance-improvement-come","title":"Where Does the Performance Improvement Come From? -- A Reproducibility Concern about Image-Text Retrieval","date":"2022-03-08","arxiv_id":"2203.03853","repositories_listed":1,"syntology":null},{"url":"/paper/an-unsupervised-cross-modal-hashing-method","slug":"an-unsupervised-cross-modal-hashing-method","title":"An Unsupervised Cross-Modal Hashing Method Robust to Noisy Training Image-Text Correspondences in Remote Sensing","date":"2022-02-26","arxiv_id":"2202.13117","repositories_listed":1,"syntology":null},{"url":"/paper/vision-language-pre-training-with-triple","slug":"vision-language-pre-training-with-triple","title":"Vision-Language Pre-Training with Triple Contrastive Learning","date":"2022-02-21","arxiv_id":"2202.10401","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/vision-language-pre-training-with-triple#ran","syntology_url":"https://syntology.ai/paper/2202.10401","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2202.10401"}},"official":{"repos":["uta-smile/TCL"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/wukong-100-million-large-scale-chinese-cross","slug":"wukong-100-million-large-scale-chinese-cross","title":"Wukong: A 100 Million Large-scale Chinese Cross-modal Pre-training Benchmark","date":"2022-02-14","arxiv_id":"2202.06767","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/wukong-100-million-large-scale-chinese-cross#ran","syntology_url":"https://syntology.ai/paper/2202.06767","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2202.06767"}},"official":null}},{"url":"/paper/filip-fine-grained-interactive-language-image-1","slug":"filip-fine-grained-interactive-language-image-1","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","date":"2021-11-09","arxiv_id":"2111.07783","repositories_listed":1,"syntology":null},{"url":"/paper/negative-sample-is-negative-in-its-own-way","slug":"negative-sample-is-negative-in-its-own-way","title":"Negative Sample is Negative in Its Own Way: Tailoring Negative Sentences for Image-Text Retrieval","date":"2021-11-05","arxiv_id":"2111.03349","repositories_listed":1,"syntology":null},{"url":"/paper/multi-stage-pre-training-over-simplified","slug":"multi-stage-pre-training-over-simplified","title":"Multi-stage Pre-training over Simplified Multimodal Pre-training Models","date":"2021-07-22","arxiv_id":"2107.14596","repositories_listed":1,"syntology":{"n":9,"n_ran":3,"n_constructed":3,"n_ran_checked":3,"n_instrument":0,"n_unverified":6,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":9,"phrase":"3 ran (of which 3 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 6 unverified; every one of the 3 samples that ran constructed an object rather than computing a result","sample_list":"/paper/multi-stage-pre-training-over-simplified#ran","syntology_url":"https://syntology.ai/paper/2107.14596","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2107.14596"}},"official":{"repos":["lttsmn/LXMERT-S"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":3,"n_ran_no_instrument_failure":3,"n_unverified":6,"ran_from_kinds":["official"]}}},{"url":"/paper/dynamic-modality-interaction-modeling-for","slug":"dynamic-modality-interaction-modeling-for","title":"Dynamic Modality Interaction Modeling for Image-Text Retrieval","date":"2021-07-11","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/cosmo-content-style-modulation-for-image","slug":"cosmo-content-style-modulation-for-image","title":"CoSMo: Content-Style Modulation for Image Retrieval With Text Feedback","date":"2021-06-19","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/a-deep-local-and-global-scene-graph-matching","slug":"a-deep-local-and-global-scene-graph-matching","title":"A Deep Local and Global Scene-Graph Matching for Image-Text Retrieval","date":"2021-06-04","arxiv_id":"2106.02400","repositories_listed":1,"syntology":null},{"url":"/paper/learning-relation-alignment-for-calibrated","slug":"learning-relation-alignment-for-calibrated","title":"Learning Relation Alignment for Calibrated Cross-modal Retrieval","date":"2021-05-28","arxiv_id":"2105.13868","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/learning-relation-alignment-for-calibrated#ran","syntology_url":"https://syntology.ai/paper/2105.13868","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2105.13868"}},"official":{"repos":["lancopku/IAIS"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/learning-the-best-pooling-strategy-for-visual","slug":"learning-the-best-pooling-strategy-for-visual","title":"Learning the Best Pooling Strategy for Visual Semantic Embedding","date":"2020-11-09","arxiv_id":"2011.04305","repositories_listed":1,"syntology":null},{"url":"/paper/a-comparison-of-pre-trained-vision-and","slug":"a-comparison-of-pre-trained-vision-and","title":"A Comparison of Pre-trained Vision-and-Language Models for Multimodal Representation Learning across Medical Images and Reports","date":"2020-09-03","arxiv_id":"2009.01523","repositories_listed":1,"syntology":null},{"url":"/paper/graph-optimal-transport-for-cross-domain","slug":"graph-optimal-transport-for-cross-domain","title":"Graph Optimal Transport for Cross-Domain Alignment","date":"2020-06-26","arxiv_id":"2006.14744","repositories_listed":1,"syntology":{"n":10,"n_ran":9,"n_constructed":0,"n_ran_checked":9,"n_instrument":0,"n_unverified":1,"n_honours":1,"n_violates":2,"n_no_contract":6,"n_pointer_only":3,"phrase":"9 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 1 honoured, 2 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/graph-optimal-transport-for-cross-domain#ran","syntology_url":"https://syntology.ai/paper/2006.14744","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2006.14744"}},"official":{"repos":["LiqunChen0606/Graph-Optimal-Transport"],"state":"official (archive's flag): 9 ran","n_ran":9,"n_constructed":0,"n_ran_no_instrument_failure":9,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/pixel-bert-aligning-image-pixels-with-text-by","slug":"pixel-bert-aligning-image-pixels-with-text-by","title":"Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers","date":"2020-04-02","arxiv_id":"2004.00849","repositories_listed":1,"syntology":null},{"url":"/paper/imram-iterative-matching-with-recurrent","slug":"imram-iterative-matching-with-recurrent","title":"IMRAM: Iterative Matching with Recurrent Attention Memory for Cross-Modal Image-Text Retrieval","date":"2020-03-08","arxiv_id":"2003.03772","repositories_listed":1,"syntology":{"n":3,"n_ran":2,"n_constructed":0,"n_ran_checked":0,"n_instrument":2,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":3,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/imram-iterative-matching-with-recurrent#ran","syntology_url":"https://syntology.ai/paper/2003.03772","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2003.03772"}},"official":{"repos":["HuiChen24/IMRAM"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/mhsan-multi-head-self-attention-network-for","slug":"mhsan-multi-head-self-attention-network-for","title":"MHSAN: Multi-Head Self-Attention Network for Visual Semantic Embedding","date":"2020-01-11","arxiv_id":"2001.03712","repositories_listed":1,"syntology":null},{"url":"/paper/cross-modal-scene-graph-matching-for","slug":"cross-modal-scene-graph-matching-for","title":"Cross-modal Scene Graph Matching for Relationship-aware Image-Text Retrieval","date":"2019-10-11","arxiv_id":"1910.05134","repositories_listed":1,"syntology":{"n":3,"n_ran":2,"n_constructed":0,"n_ran_checked":1,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":3,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/cross-modal-scene-graph-matching-for#ran","syntology_url":"https://syntology.ai/paper/1910.05134","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1910.05134"}},"official":null}},{"url":"/paper/learning-joint-embedding-with-multimodal-cues","slug":"learning-joint-embedding-with-multimodal-cues","title":"Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text Retrieval","date":"2018-06-11","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":null,"slug":"maximal-matching-matters-preventing","title":"Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal Retrieval","date":"2025-06-26","arxiv_id":"2506.21538","repositories_listed":0,"syntology":null},{"url":null,"slug":"distill-clip-dclip-enhancing-image-text","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","date":"2025-05-25","arxiv_id":"2505.21549","repositories_listed":0,"syntology":null},{"url":null,"slug":"evdclip-improving-vision-language-retrieval","title":"EvdCLIP: Improving Vision-Language Retrieval with Entity Visual Descriptions from Large Language Models","date":"2025-05-24","arxiv_id":"2505.18594","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-discrepancy-bridging-method","title":"Representation Discrepancy Bridging Method for Remote Sensing Image-Text Retrieval","date":"2025-05-22","arxiv_id":"2505.16756","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-language-barriers-or-reinforcing","title":"Breaking Language Barriers or Reinforcing Bias? A Study of Gender and Racial Disparities in Multilingual Contrastive Vision Language Models","date":"2025-05-20","arxiv_id":"2505.14160","repositories_listed":0,"syntology":null},{"url":null,"slug":"agate-stealthy-black-box-watermarking-for","title":"AGATE: Stealthy Black-box Watermarking for Multimodal Model Copyright Protection","date":"2025-04-28","arxiv_id":"2504.21044","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-the-modality-barrier-universal","title":"Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs","date":"2025-04-24","arxiv_id":"2504.17432","repositories_listed":0,"syntology":null},{"url":null,"slug":"focallens-instruction-tuning-enables-zero","title":"FocalLens: Instruction Tuning Enables Zero-Shot Conditional Image Representations","date":"2025-04-11","arxiv_id":"2504.08368","repositories_listed":0,"syntology":null},{"url":null,"slug":"selip-similarity-enhanced-contrastive","title":"SeLIP: Similarity Enhanced Contrastive Language Image Pretraining for Multi-modal Head MRI","date":"2025-03-25","arxiv_id":"2503.19801","repositories_listed":0,"syntology":null},{"url":null,"slug":"anatomy-aware-conditional-image-text","title":"Anatomy-Aware Conditional Image-Text Retrieval","date":"2025-03-10","arxiv_id":"2503.07456","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-aware-loss-scheduling-for-multimodal","title":"Variance-Aware Loss Scheduling for Multimodal Alignment in Low-Data Settings","date":"2025-03-05","arxiv_id":"2503.03202","repositories_listed":0,"syntology":null},{"url":null,"slug":"llave-large-language-and-vision-embedding","title":"LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning","date":"2025-03-04","arxiv_id":"2503.04812","repositories_listed":0,"syntology":null},{"url":null,"slug":"2503-01019","title":"MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations","date":"2025-03-02","arxiv_id":"2503.01019","repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-local-alignment-for-medical","title":"Progressive Local Alignment for Medical Multimodal Pre-training","date":"2025-02-25","arxiv_id":"2502.18047","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-multimodal-transformers-on-edge-a","title":"Fine-tuning Multimodal Transformers on Edge: A Parallel Split Learning Approach","date":"2025-02-10","arxiv_id":"2502.06355","repositories_listed":0,"syntology":null},{"url":null,"slug":"dcformer-efficient-3d-vision-language","title":"DCFormer: Efficient 3D Vision-Language Modeling with Decomposed Convolutions","date":"2025-02-07","arxiv_id":"2502.05091","repositories_listed":0,"syntology":null},{"url":null,"slug":"mass-overcoming-language-bias-in-image-text","title":"MASS: Overcoming Language Bias in Image-Text Matching","date":"2025-01-20","arxiv_id":"2501.11469","repositories_listed":0,"syntology":null},{"url":null,"slug":"tsvc-tripartite-learning-with-semantic","title":"TSVC:Tripartite Learning with Semantic Variation Consistency for Robust Image-Text Retrieval","date":"2025-01-19","arxiv_id":"2501.10935","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-myopia-to-holism-fully-contrastive","title":"Advancing Myopia To Holism: Fully Contrastive Language-Image Pre-training","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"barking-up-the-syntactic-tree-enhancing-vlm","title":"Barking Up The Syntactic Tree: Enhancing VLM Training with Syntactic Losses","date":"2024-12-11","arxiv_id":"2412.08110","repositories_listed":0,"syntology":null},{"url":null,"slug":"explaining-and-mitigating-the-modality-gap-in","title":"Explaining and Mitigating the Modality Gap in Contrastive Multimodal Learning","date":"2024-12-10","arxiv_id":"2412.07909","repositories_listed":0,"syntology":null},{"url":null,"slug":"discriminative-fine-tuning-of-lvlms","title":"VladVA: Discriminative Fine-tuning of LVLMs","date":"2024-12-05","arxiv_id":"2412.04378","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-fiber-product-a-preliminary","title":"Approximate Fiber Product: A Preliminary Algebraic-Geometric Perspective on Multimodal Embedding Alignment","date":"2024-11-30","arxiv_id":"2412.00373","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-transfer-across-modalities-with","title":"Knowledge Transfer Across Modalities with Natural Language Supervision","date":"2024-11-23","arxiv_id":"2411.15611","repositories_listed":0,"syntology":null},{"url":null,"slug":"uni-mlip-unified-self-supervision-for-medical","title":"Uni-Mlip: Unified Self-supervision for Medical Vision Language Pre-training","date":"2024-11-20","arxiv_id":"2411.15207","repositories_listed":0,"syntology":null},{"url":null,"slug":"ctrlsynth-controllable-image-text-synthesis","title":"CtrlSynth: Controllable Image Text Synthesis for Data-Efficient Multimodal Learning","date":"2024-10-15","arxiv_id":"2410.11963","repositories_listed":0,"syntology":null},{"url":null,"slug":"anyattack-towards-large-scale-self-supervised","title":"AnyAttack: Towards Large-scale Self-supervised Adversarial Attacks on Vision-language Models","date":"2024-10-07","arxiv_id":"2410.05346","repositories_listed":0,"syntology":null},{"url":null,"slug":"nevlp-noise-robust-framework-for-efficient","title":"NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training","date":"2024-09-15","arxiv_id":"2409.09582","repositories_listed":0,"syntology":null},{"url":null,"slug":"pushing-the-limits-of-vision-language-models","title":"Pushing the Limits of Vision-Language Models in Remote Sensing without Human Annotations","date":"2024-09-11","arxiv_id":"2409.07048","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01363","title":"Toward Automatic Relevance Judgment using Vision--Language Models for Image--Text Retrieval Evaluation","date":"2024-08-02","arxiv_id":"2408.01363","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-brittleness-of-image-text-retrieval","title":"Assessing Brittleness of Image-Text Retrieval Benchmarks from Vision-Language Models Perspective","date":"2024-07-21","arxiv_id":"2407.15239","repositories_listed":0,"syntology":null},{"url":null,"slug":"cosmoclip-generalizing-large-vision-language","title":"CosmoCLIP: Generalizing Large Vision-Language Models for Astronomical Imaging","date":"2024-07-10","arxiv_id":"2407.07315","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-make-cross-encoder-a-good-teacher-for-1","title":"How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?","date":"2024-07-10","arxiv_id":"2407.07479","repositories_listed":0,"syntology":null},{"url":null,"slug":"beat-bi-directional-one-to-many-embedding","title":"Beat: Bi-directional One-to-Many Embedding Alignment for Text-based Person Retrieval","date":"2024-06-09","arxiv_id":"2406.05620","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-grounded-adaptation-strategy-for","title":"Knowledge-grounded Adaptation Strategy for Vision-language Models: Building Unique Case-set for Screening Mammograms for Residents Training","date":"2024-05-30","arxiv_id":"2405.19675","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-many-to-many-relationships-for","title":"Multimodal Adversarial Defense for Vision-Language Models by Leveraging One-To-Many Relationships","date":"2024-05-29","arxiv_id":"2405.18770","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-learning-for-finely-categorized-image","title":"Active Learning for Finely-Categorized Image-Text Retrieval by Selecting Hard Negative Unpaired Samples","date":"2024-05-25","arxiv_id":"2405.16301","repositories_listed":0,"syntology":null},{"url":"/paper/global-local-information-soft-alignment-for","slug":"global-local-information-soft-alignment-for","title":"Global–Local Information Soft-Alignment for Cross-Modal Remote-Sensing Image–Text Retrieval","date":"2024-05-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"urbancross-enhancing-satellite-image-text","title":"UrbanCross: Enhancing Satellite Image-Text Retrieval with Cross-Domain Adaptation","date":"2024-04-22","arxiv_id":"2404.14241","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-training-large-language-models-for","title":"Self-Training Large Language Models for Improved Visual Program Synthesis With Visual Reinforcement","date":"2024-04-06","arxiv_id":"2404.04627","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-adversarial-transferability-of","title":"Improving Adversarial Transferability of Vision-Language Pre-training Models through Collaborative Multimodal Interaction","date":"2024-03-16","arxiv_id":"2403.10883","repositories_listed":0,"syntology":null},{"url":null,"slug":"luojiahog-a-hierarchy-oriented-geo-aware","title":"LuoJiaHOG: A Hierarchy Oriented Geo-aware Image Caption Dataset for Remote Sensing Image-Text Retrival","date":"2024-03-16","arxiv_id":"2403.10887","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-conceptual-understanding-in","title":"Enhancing Conceptual Understanding in Multimodal Contrastive Learning through Hard Negative Samples","date":"2024-03-05","arxiv_id":"2403.02875","repositories_listed":0,"syntology":null},{"url":"/paper/sycoca-symmetrizing-contrastive-captioners","slug":"sycoca-symmetrizing-contrastive-captioners","title":"SyCoCa: Symmetrizing Contrastive Captioners with Attentive Masking for Multimodal Alignment","date":"2024-01-04","arxiv_id":"2401.02137","repositories_listed":0,"syntology":null},{"url":null,"slug":"compress-align-curating-image-text-data-with","title":"Filter & Align: Leveraging Human Knowledge to Curate Image-Text Data","date":"2023-12-11","arxiv_id":"2312.06726","repositories_listed":0,"syntology":null},{"url":null,"slug":"lightclip-learning-multi-level-interaction","title":"LightCLIP: Learning Multi-Level Interaction for Lightweight Vision-Language Models","date":"2023-12-01","arxiv_id":"2312.00674","repositories_listed":0,"syntology":null},{"url":null,"slug":"ig-captioner-information-gain-captioners-are","title":"IG Captioner: Information Gain Captioners are Strong Zero-shot Classifiers","date":"2023-11-27","arxiv_id":"2311.17072","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-prominent-fragments-enhancement","title":"A New Fine-grained Alignment Method for Image-text Matching","date":"2023-11-03","arxiv_id":"2311.02183","repositories_listed":0,"syntology":null},{"url":null,"slug":"mcad-multi-teacher-cross-modal-alignment","title":"MCAD: Multi-teacher Cross-modal Alignment Distillation for efficient image-text retrieval","date":"2023-10-30","arxiv_id":"2310.19654","repositories_listed":0,"syntology":null},{"url":"/paper/direction-oriented-visual-semantic-embedding","slug":"direction-oriented-visual-semantic-embedding","title":"Direction-Oriented Visual-semantic Embedding Model for Remote Sensing Image-text Retrieval","date":"2023-10-12","arxiv_id":"2310.08276","repositories_listed":0,"syntology":null},{"url":null,"slug":"ziya-vl-bilingual-large-vision-language-model","title":"Ziya-Visual: Bilingual Large Vision-Language Model via Multi-Task Instruction Tuning","date":"2023-10-12","arxiv_id":"2310.08166","repositories_listed":0,"syntology":null},{"url":null,"slug":"constructing-image-text-pair-dataset-from","title":"Constructing Image-Text Pair Dataset from Books","date":"2023-10-03","arxiv_id":"2310.01936","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-relation-alignment-for-composed-image","title":"Dual Relation Alignment for Composed Image Retrieval","date":"2023-09-05","arxiv_id":"2309.02169","repositories_listed":0,"syntology":null},{"url":"/paper/contrastive-feature-masking-open-vocabulary","slug":"contrastive-feature-masking-open-vocabulary","title":"Contrastive Feature Masking Open-Vocabulary Vision Transformer","date":"2023-09-02","arxiv_id":"2309.00775","repositories_listed":0,"syntology":null},{"url":null,"slug":"dlip-distilling-language-image-pre-training","title":"DLIP: Distilling Language-Image Pre-training","date":"2023-08-24","arxiv_id":"2308.12956","repositories_listed":0,"syntology":null},{"url":null,"slug":"eve-efficient-vision-language-pre-training","title":"EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE","date":"2023-08-23","arxiv_id":"2308.11971","repositories_listed":0,"syntology":null},{"url":null,"slug":"free-atm-exploring-unsupervised-learning-on","title":"Free-ATM: Exploring Unsupervised Learning on Diffusion-Generated Images with Free Attention Masks","date":"2023-08-13","arxiv_id":"2308.06739","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmenting-clip-with-improved-visio","title":"Distilling Knowledge from Text-to-Image Generative Models Improves Visio-Linguistic Reasoning in CLIP","date":"2023-07-18","arxiv_id":"2307.09233","repositories_listed":0,"syntology":null},{"url":null,"slug":"switch-bert-learning-to-model-multimodal","title":"Switch-BERT: Learning to Model Multimodal Interactions by Switching Attention and Input","date":"2023-06-25","arxiv_id":"2306.14182","repositories_listed":0,"syntology":null},{"url":null,"slug":"hypernymization-of-named-entity-rich-captions","title":"Hypernymization of named entity-rich captions for grounding-based multi-modal pretraining","date":"2023-04-25","arxiv_id":"2304.13130","repositories_listed":0,"syntology":null},{"url":null,"slug":"reclip-resource-efficient-clip-by-training","title":"RECLIP: Resource-efficient CLIP by Training with Small Images","date":"2023-04-12","arxiv_id":"2304.06028","repositories_listed":0,"syntology":null},{"url":null,"slug":"exposing-and-mitigating-spurious-correlations","title":"Exposing and Mitigating Spurious Correlations for Cross-Modal Retrieval","date":"2023-04-06","arxiv_id":"2304.03391","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-graph-based-fusion-network-for-image","title":"Scene Graph Based Fusion Network For Image-Text Retrieval","date":"2023-03-20","arxiv_id":"2303.11090","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-image-text-retrieval-via-keyword","title":"Efficient Image-Text Retrieval via Keyword-Guided Pre-Screening","date":"2023-03-14","arxiv_id":"2303.07740","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-and-constructing-latent","title":"Understanding and Constructing Latent Modality Structures in Multi-modal Representation Learning","date":"2023-03-10","arxiv_id":"2303.05952","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-style-transformer-with-common-knowledge","title":"The style transformer with common knowledge optimization for image-text retrieval","date":"2023-03-01","arxiv_id":"2303.00448","repositories_listed":0,"syntology":null},{"url":null,"slug":"gafnet-a-global-fourier-self-attention-based","title":"GAFNet: A Global Fourier Self Attention Based Novel Network for multi-modal downstream tasks","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multilateral-semantic-relations-modeling-for","title":"Multilateral Semantic Relations Modeling for Image Text Retrieval","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/vilem-visual-language-error-modeling-for","slug":"vilem-visual-language-error-modeling-for","title":"ViLEM: Visual-Language Error Modeling for Image-Text Retrieval","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"64a11f49673c61b1582fc4f65f53d50e34ef2ef8c0c972300625e7dbcb074175","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}