Browse State-of-the-Art › Cross-Modal Retrieval › Papers, page 4
Cross-Modal Retrieval
Papers archive 2025-07-28
archive papers tagged: 522 · with a code link: 244 · where Syntology ran a sample: 70 (56 with a run with no instrument failure, 14 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (70 of 522 tagged: 56 with a run with no instrument failure, 14 where every run was a failure of Syntology's instrument)
Page 4 of 6: papers 301 to 400 of 522, in archive order: by repositories listed in the archive (most first), then newest first, not by stars (the archive holds no stars, so PwC's “Social” and “Latest” sorts cannot be reproduced). Papers that list no repository come after every paper that lists one.
Papers without a page here are shown as plain text. A Syntology line reads “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the figure “where Syntology's instrument failed” counts failures of Syntology's instrument, not of the code. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code); hover it for the repositories the samples that ran came from. Abstracts are on each paper's page.
-
Efficient and Versatile Robust Fine-Tuning of Zero-shot Models11 Aug 2024 0 repositories listed
-
Disentangled Noisy Correspondence Learning10 Aug 2024 0 repositories listed
-
Start from Video-Music Retrieval: An Inter-Intra Modal Loss for Cross Modal Retrieval28 Jul 2024 0 repositories listed
-
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation24 Jul 2024 0 repositories listed
-
Second Place Solution of WSDM2023 Toloka Visual Question Answering Challenge5 Jul 2024 0 repositories listed
-
Semantic Compositions Enhance Vision-Language Contrastive Learning1 Jul 2024 0 repositories listed
-
MATE: Meet At The Embedding -- Connecting Images with Long Texts26 Jun 2024 0 repositories listed
-
ACE: A Generative Cross-Modal Retrieval Framework with Coarse-To-Fine Semantic Modeling25 Jun 2024 0 repositories listed
-
12 Jun 2024 0 repositories listed
-
No Captions, No Problem: Captionless 3D-CLIP Alignment with Hard Negatives via CLIP Knowledge and LLMs4 Jun 2024 0 repositories listed
-
Multi-Modal Generative Embedding Model29 May 2024 0 repositories listed
-
RREH: Reconstruction Relations Embedded Hashing for Semi-Paired Cross-Modal Retrieval28 May 2024 0 repositories listed
-
Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval23 May 2024 0 repositories listed
-
Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models23 May 2024 0 repositories listed
-
MVBIND: Self-Supervised Music Recommendation For Videos Via Embedding Space Binding15 May 2024 0 repositories listed
-
14 May 2024 0 repositories listed
-
All in One Framework for Multimodal Re-identification in the Wild8 May 2024 0 repositories listed
-
COM3D: Leveraging Cross-View Correspondence and Cross-Modal Mining for 3D Retrieval7 May 2024 0 repositories listed
-
Understanding Retrieval-Augmented Task Adaptation for Vision-Language Models2 May 2024 0 repositories listed
-
Anchor-aware Deep Metric Learning for Audio-visual Retrieval21 Apr 2024 0 repositories listed
-
Wills Aligner: Multi-Subject Collaborative Brain Visual Decoding20 Apr 2024 0 repositories listed
-
13 Apr 2024 0 repositories listed
-
A Unified Optimal Transport Framework for Cross-Modal Retrieval with Noisy Labels20 Mar 2024 0 repositories listed
-
Tri-Modal Motion Retrieval by Learning a Joint Embedding Space1 Mar 2024 0 repositories listed
-
16 Feb 2024 0 repositories listed Syntology 3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 9 unverified (of 12 harvested samples) · 12 pointer-only (licence)
-
Mind the Modality Gap: Towards a Remote Sensing Vision-Language Model via Cross-modal Alignment15 Feb 2024 0 repositories listed
-
Large Language Models for Captioning and Retrieving Remote Sensing Images9 Feb 2024 0 repositories listed
-
Cross-Modal Coordination Across a Diverse Set of Input Modalities29 Jan 2024 0 repositories listed
-
Enhancing medical vision-language contrastive learning via inter-matching relation modelling19 Jan 2024 0 repositories listed
-
Developing ChatGPT for Biology and Medicine: A Complete Review of Biomedical Question Answering15 Jan 2024 0 repositories listed
-
Fine-grained Prototypical Voting with Heterogeneous Mixup for Semi-supervised 2D-3D Cross-modal Retrieval1 Jan 2024 0 repositories listed
-
27 Dec 2023 0 repositories listed
-
Masked Contrastive Reconstruction for Cross-modal Medical Image-Report Retrieval26 Dec 2023 0 repositories listed
-
CL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual Knowledge Transfer14 Dec 2023 0 repositories listed
-
WikiMuTe: A web-sourced dataset of semantic descriptions for music audio14 Dec 2023 0 repositories listed
-
Uni3DL: Unified Model for 3D and Language Understanding5 Dec 2023 0 repositories listed
-
T3D: Advancing 3D Medical Vision-Language Pre-training by Learning Multi-View Visual Consistency3 Dec 2023 0 repositories listed
-
Two-Stage Triplet Loss Training with Curriculum Augmentation for Audio-Visual Retrieval20 Oct 2023 0 repositories listed
-
12 Oct 2023 0 repositories listed
-
Sound Source Localization is All about Cross-Modal Alignment19 Sep 2023 0 repositories listed
-
Dual-view Curricular Optimal Transport for Cross-lingual Cross-modal Retrieval11 Sep 2023 0 repositories listed
-
Cross-Modal Retrieval Meets Inference:Improving Zero-Shot Classification with Cross-Modal Retrieval29 Aug 2023 0 repositories listed
-
Extending Cross-Modal Retrieval with Interactive Learning to Improve Image Retrieval Performance in Forensics28 Aug 2023 0 repositories listed
-
Video and Audio are Images: A Cross-Modal Mixer for Original Data on Video-Audio Retrieval26 Aug 2023 0 repositories listed
-
A scoping review on multimodal deep learning in biomedical images and texts14 Jul 2023 0 repositories listed
-
PiTL: Cross-modal Retrieval with Weakly-supervised Vision-language Pre-training via Prompting14 Jul 2023 0 repositories listed
-
Multimodal Relation Extraction with Cross-Modal Retrieval and Synthesis25 May 2023 0 repositories listed
-
Continual Vision-Language Representation Learning with Off-Diagonal Information11 May 2023 0 repositories listed
-
Instance-Variant Loss with Gaussian RBF Kernel for 3D Cross-modal Retriveal7 May 2023 0 repositories listed
-
Category-Oriented Representation Learning for Image to Multi-Modal Retrieval6 May 2023 0 repositories listed
-
Deep Lifelong Cross-modal Hashing26 Apr 2023 0 repositories listed
-
Sample-Specific Debiasing for Better Image-Text Models25 Apr 2023 0 repositories listed
-
CoVLR: Coordinating Cross-Modal Consistency and Intra-Modal Structure for Vision-Language Retrieval15 Apr 2023 0 repositories listed
-
Exposing and Mitigating Spurious Correlations for Cross-Modal Retrieval6 Apr 2023 0 repositories listed
-
Hindi as a Second Language: Improving Visually Grounded Speech with Semantically Similar Samples30 Mar 2023 0 repositories listed
-
MXM-CLR: A Unified Framework for Contrastive Learning of Multifold Cross-Modal Representations20 Mar 2023 0 repositories listed
-
Cross-modal Retrieval with Improved Graph Convolution7 Mar 2023 0 repositories listed
-
Data leakage in cross-modal retrieval training: A case study23 Feb 2023 0 repositories listed
-
X-TRA: Improving Chest X-ray Tasks with Cross-Modal Retrieval Augmentation22 Feb 2023 0 repositories listed
-
VITR: Augmenting Vision Transformers with Relation-Focused Learning for Cross-Modal Information Retrieval13 Feb 2023 0 repositories listed
-
Distribution Aligned Feature Clustering for Zero-Shot Sketch-Based Image Retrieval17 Jan 2023 0 repositories listed
-
Pix2Map: Cross-modal Retrieval for Inferring Street Maps from Images10 Jan 2023 0 repositories listed
-
Image as a Foreign Language: BEiT Pretraining for Vision and Vision-Language Tasks1 Jan 2023 0 repositories listed
-
Learning Concordant Attention via Target-aware Alignment for Visible-Infrared Person Re-identification1 Jan 2023 0 repositories listed
-
BagFormer: Better Cross-Modal Retrieval via bag-wise interaction29 Dec 2022 0 repositories listed
-
Retrieval-based Disentangled Representation Learning with Natural Language Supervision15 Dec 2022 0 repositories listed
-
Scale-Semantic Joint Decoupling Network for Image-text Retrieval in Remote Sensing12 Dec 2022 0 repositories listed
-
Using Multiple Instance Learning to Build Multimodal Representations11 Dec 2022 0 repositories listed
-
TimbreCLIP: Connecting Timbre to Text and Images21 Nov 2022 0 repositories listed
-
Complete Cross-triplet Loss in Label Space for Audio-visual Cross-modal Retrieval7 Nov 2022 0 repositories listed
-
3D Shape Knowledge Graph for Cross-domain 3D Shape Retrieval27 Oct 2022 0 repositories listed
-
FaD-VLP: Fashion Vision-and-Language Pre-training towards Unified Retrieval and Captioning26 Oct 2022 0 repositories listed
-
Learning by Hallucinating: Vision-Language Pre-training with Weak Supervision24 Oct 2022 0 repositories listed
-
Cross-modal Search Method of Technology Video based on Adversarial Learning and Feature Fusion11 Oct 2022 0 repositories listed
-
Text-Adaptive Multiple Visual Prototype Matching for Video-Text Retrieval27 Sep 2022 0 repositories listed
-
Deep Manifold Hashing: A Divide-and-Conquer Approach for Semi-Paired Unsupervised Cross-Modal Retrieval26 Sep 2022 0 repositories listed
-
Information-Theoretic Hashing for Zero-Shot Cross-Modal Retrieval26 Sep 2022 0 repositories listed
-
15 Sep 2022 0 repositories listed
-
See What You See: Self-supervised Cross-modal Retrieval of Visual Stimuli from Brain Activity7 Aug 2022 0 repositories listed
-
Paired Cross-Modal Data Augmentation for Fine-Grained Image-to-Text Retrieval29 Jul 2022 0 repositories listed
-
Adaptive Asymmetric Label-guided Hashing for Multimedia Search26 Jul 2022 0 repositories listed
-
Contrastive Cross-Modal Knowledge Sharing Pre-training for Vision-Language Representation Learning and Retrieval2 Jul 2022 0 repositories listed
-
Exploiting Transformation Invariance and Equivariance for Self-supervised Sound Localisation26 Jun 2022 0 repositories listed
-
Emphasizing Complementary Samples for Non-literal Cross-modal Retrieval25 Jun 2022 0 repositories listed
-
HiVLP: Hierarchical Vision-Language Pre-Training for Fast Image-Text Retrieval24 May 2022 0 repositories listed
-
Deep Supervised Information Bottleneck Hashing for Cross-modal Retrieval based Computer-aided Diagnosis6 May 2022 0 repositories listed
-
Uncertainty-based Cross-Modal Retrieval with Probabilistic Representations20 Apr 2022 0 repositories listed
-
Unsupervised Contrastive Hashing for Cross-Modal Retrieval in Remote Sensing19 Apr 2022 0 repositories listed
-
Learning Similarity Preserving Binary Codes for Recommender Systems18 Apr 2022 0 repositories listed
-
15 Apr 2022 0 repositories listed
-
31 Mar 2022 0 repositories listed
-
Learning Program Representations for Food Images and Cooking Recipes30 Mar 2022 0 repositories listed
-
Cross-Media Scientific Research Achievements Retrieval Based on Deep Language Model29 Mar 2022 0 repositories listed
-
2 Mar 2022 0 repositories listed
-
Discriminative Supervised Subspace Learning for Cross-modal Retrieval26 Jan 2022 0 repositories listed
-
Deep Unsupervised Contrastive Hashing for Large-Scale Cross-Modal Text-Image Retrieval in Remote Sensing20 Jan 2022 0 repositories listed
-
A Text-Image Pair Is not Enough: Language-Vision Relation Inference with Auxiliary Modality Translation16 Jan 2022 0 repositories listed
-
EI-CLIP: Entity-Aware Interventional Contrastive Learning for E-Commerce Cross-Modal Retrieval1 Jan 2022 0 repositories listed
-
CoCo-BERT: Improving Video-Language Pre-training with Contrastive Cross-modal Matching and Denoising14 Dec 2021 0 repositories listed
-
Multi-Modal Mutual Information Maximization: A Novel Approach for Unsupervised Deep Cross-Modal Hashing13 Dec 2021 0 repositories listed
Syntology lines on 1 of the papers shown; no Syntology record for the others (a paper without an arXiv id cannot be joined to the graph, and absence from the graph layer is not a recorded non-run). “Ran” means the sample executed on a synthesized fixture, not that the paper's result was reproduced; each line links to that paper's sample list. Syntology's record for this page has not changed since , the first build that kept a record date for it; when this build read Syntology's graph is in the build record. For agents: get_harvested_code_for_paper(arxiv_id) lists each paper's samples; how to connect.