Browse State-of-the-Art › Image-text matching › Papers, page 2
Image-text matching
Papers archive 2025-07-28
archive papers tagged: 188 · with a code link: 102 · where Syntology ran a sample: 37 (30 with a run with no instrument failure, 7 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (37 of 188 tagged: 30 with a run with no instrument failure, 7 where every run was a failure of Syntology's instrument)
Page 2 of 2: papers 101 to 188 of 188, in archive order: by repositories listed in the archive (most first), then newest first, not by stars (the archive holds no stars, so PwC's “Social” and “Latest” sorts cannot be reproduced). Papers that list no repository come after every paper that lists one.
Papers without a page here are shown as plain text. A Syntology line reads “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the figure “where Syntology's instrument failed” counts failures of Syntology's instrument, not of the code. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code); hover it for the repositories the samples that ran came from. Abstracts are on each paper's page.
-
1 Sep 2018 1 repository listed
-
11 Apr 2017 1 repository listed
-
TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP24 May 2025 0 repositories listed
-
Descriptive Image-Text Matching with Graded Contextual Similarity15 May 2025 0 repositories listed
-
Compositional Image-Text Matching and Retrieval by Grounding Entities4 May 2025 0 repositories listed
-
Instruction-augmented Multimodal Alignment for Image-Text and Element Matching16 Apr 2025 0 repositories listed
-
Dependency Structure Augmented Contextual Scoping Framework for Multimodal Aspect-Based Sentiment Analysis15 Apr 2025 0 repositories listed
-
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations2 Mar 2025 0 repositories listed
-
Object-centric Binding in Contrastive Language-Image Pretraining19 Feb 2025 0 repositories listed
-
MASS: Overcoming Language Bias in Image-Text Matching20 Jan 2025 0 repositories listed
-
Learning Textual Prompts for Open-World Semi-Supervised Learning1 Jan 2025 0 repositories listed
-
Multi-Head Attention Driven Dynamic Visual-Semantic Embedding for Enhanced Image-Text Matching26 Dec 2024 0 repositories listed
-
A Concept-Centric Approach to Multi-Modality Learning18 Dec 2024 0 repositories listed
-
ViUniT: Visual Unit Tests for More Robust Visual Programming12 Dec 2024 0 repositories listed
-
Automatic Prompt Generation and Grounding Object Detection for Zero-Shot Image Anomaly Detection28 Nov 2024 0 repositories listed
-
VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis27 Nov 2024 0 repositories listed
-
EntityCLIP: Entity-Centric Image-Text Matching via Multimodal Attentive Contrastive Learning23 Oct 2024 0 repositories listed
-
Bridging the Modality Gap: Dimension Information Alignment and Sparse Spatial Constraint for Image-Text Matching22 Oct 2024 0 repositories listed
-
DARE: Diverse Visual Question Answering with Robustness Evaluation26 Sep 2024 0 repositories listed
-
NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training15 Sep 2024 0 repositories listed
-
Towards Deconfounded Image-Text Matching with Causal Inference22 Aug 2024 0 repositories listed
-
Dynamic and Compressive Adaptation of Transformers From Images to Videos13 Aug 2024 0 repositories listed
-
Advanced Multimodal Deep Learning Architecture for Image-Text Matching13 Jun 2024 0 repositories listed
-
Hire: Hybrid-modal Interaction with Multiple Relational Enhancements for Image-Text Matching5 Jun 2024 0 repositories listed
-
DEMO: A Statistical Perspective for Efficient Image-Text Matching19 May 2024 0 repositories listed
-
CLIP-Powered TASS: Target-Aware Single-Stream Network for Audio-Visual Question Answering13 May 2024 0 repositories listed
-
RETTA: Retrieval-Enhanced Test-Time Adaptation for Zero-Shot Video Captioning11 May 2024 0 repositories listed
-
Breaking Through the Noisy Correspondence: A Robust Model for Image-Text Matching29 Apr 2024 0 repositories listed
-
SyncMask: Synchronized Attentional Masking for Fashion-centric Vision-Language Pretraining1 Apr 2024 0 repositories listed
-
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models29 Mar 2024 0 repositories listed
-
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues29 Mar 2024 0 repositories listed
-
Image-Text Matching with Multi-View Attention27 Feb 2024 0 repositories listed
-
OT-Attack: Enhancing Adversarial Transferability of Vision-Language Models via Optimal Transport Optimization7 Dec 2023 0 repositories listed
-
CILF-CIAE: CLIP-driven Image-Language Fusion for Correcting Inverse Age Estimation4 Dec 2023 0 repositories listed
-
Active Mining Sample Pair Semantics for Image-text Matching9 Nov 2023 0 repositories listed
-
A New Fine-grained Alignment Method for Image-text Matching3 Nov 2023 0 repositories listed
-
Learning Comprehensive Representations with Richer Self for Text-to-Image Person Re-Identification17 Oct 2023 0 repositories listed
-
Dynamic Visual Semantic Sub-Embeddings and Fast Re-Ranking15 Sep 2023 0 repositories listed
-
ViLTA: Enhancing Vision-Language Pre-training through Textual Augmentation31 Aug 2023 0 repositories listed
-
Uniformly Distributed Category Prototype-Guided Vision-Language Framework for Long-Tail Recognition24 Aug 2023 0 repositories listed
-
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE23 Aug 2023 0 repositories listed
-
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models18 Aug 2023 0 repositories listed
-
Grounded Image Text Matching with Mismatched Relation Reasoning2 Aug 2023 0 repositories listed
-
Probing the Role of Positional Information in Vision-Language Models17 May 2023 0 repositories listed
-
Scene Text Recognition with Image-Text Matching-guided Dictionary8 May 2023 0 repositories listed
-
Multi-Modal Representation Learning with Text-Driven Soft Masks3 Apr 2023 0 repositories listed
-
Refined Vision-Language Modeling for Fine-grained Multi-modal Pre-training9 Mar 2023 0 repositories listed
-
Selectively Hard Negative Mining for Alleviating Gradient Vanishing in Image-Text Matching1 Mar 2023 0 repositories listed
-
VL-Match: Enhancing Vision-Language Pretraining with Token-Level and Instance-Level Matching1 Jan 2023 0 repositories listed
-
Weakly Supervised Referring Image Segmentation with Intra-Chunk and Inter-Chunk Consistency1 Jan 2023 0 repositories listed
-
Multimodal Matching-aware Co-attention Networks with Mutual Knowledge Distillation for Fake News Detection12 Dec 2022 0 repositories listed
-
Uniform Masking Prevails in Vision-Language Pretraining10 Dec 2022 0 repositories listed
-
UPainting: Unified Text-to-Image Diffusion Generation with Cross-modal Guidance28 Oct 2022 0 repositories listed
-
10 Oct 2022 0 repositories listed
-
Don't Stop Learning: Towards Continual Learning for the CLIP Model19 Jul 2022 0 repositories listed
-
Uncertainty-based Cross-Modal Retrieval with Probabilistic Representations20 Apr 2022 0 repositories listed
-
DT2I: Dense Text-to-Image Generation from Region Descriptions5 Apr 2022 0 repositories listed
-
Two-stream Hierarchical Similarity Reasoning for Image-text Matching10 Mar 2022 0 repositories listed
-
Dual Embodied-Symbolic Concept Representations for Deep Learning1 Mar 2022 0 repositories listed
-
Unpaired Referring Expression Grounding via Bidirectional Cross-Modal Matching18 Jan 2022 0 repositories listed
-
Probing the Role of Positional Information in Vision-Language Models16 Jan 2022 0 repositories listed
-
Unified Multimodal Pre-training and Prompt-based Tuning for Vision-Language Understanding and Generation10 Dec 2021 0 repositories listed
-
Embedding Arithmetic of Multimodal Queries for Image Retrieval6 Dec 2021 0 repositories listed
-
UFO: A UniFied TransfOrmer for Vision-Language Representation Learning19 Nov 2021 0 repositories listed
-
More Than Just Attention: Improving Cross-Modal Attentions with Contrastive Constraints for Image-Text Matching16 Nov 2021 0 repositories listed
-
MURAL: Multimodal, Multitask Representations Across Languages1 Nov 2021 0 repositories listed
-
Is An Image Worth Five Sentences? A New Look into Semantics for Image-Text Matching6 Oct 2021 0 repositories listed
-
10 Sep 2021 0 repositories listed
-
Hashing based Efficient Inference for Image-Text Matching1 Aug 2021 0 repositories listed
-
A Self-Boosting Framework for Automated Radiographic Report Generation19 Jun 2021 0 repositories listed
-
Step-Wise Hierarchical Alignment Network for Image-Text Matching11 Jun 2021 0 repositories listed
-
Towards Efficient Cross-Modal Visual Textual Retrieval using Transformer-Encoder Deep Features1 Jun 2021 0 repositories listed
-
More Than Just Attention: Improving Cross-Modal Attentions with Contrastive Constraints for Image-Text Matching20 May 2021 0 repositories listed
-
VL-NMS: Breaking Proposal Bottlenecks in Two-Stage Visual-Language Matching12 May 2021 0 repositories listed
-
Discrete-continuous Action Space Policy Gradient-based Attention for Image-Text Matching21 Apr 2021 0 repositories listed
-
UC2: Universal Cross-lingual Cross-modal Vision-and-Language Pre-training1 Apr 2021 0 repositories listed
-
Macroscopic Control of Text Generation for Image Captioning20 Jan 2021 0 repositories listed
-
Contrastive Cross-Modal Pre-Training: A General Strategy for Small Sample Medical Imaging6 Oct 2020 0 repositories listed
-
A Novel Attention-based Aggregation Function to Combine Vision and Language27 Apr 2020 0 repositories listed
-
30 Mar 2020 0 repositories listed
-
Expressing Objects just like Words: Recurrent Visual Embedding for Image-Text Matching20 Feb 2020 0 repositories listed
-
22 Jan 2020 0 repositories listed
-
UNITER: Learning UNiversal Image-TExt Representations25 Sep 2019 0 repositories listed
-
Learning Visual Relation Priors for Image-Text Matching and Image Captioning with Neural Scene Graph Generators22 Sep 2019 0 repositories listed
-
16 Aug 2019 0 repositories listed
-
Knowledge Aware Semantic Concept Expansion for Image-Text Matching10 Aug 2019 0 repositories listed
-
ParNet: Position-aware Aggregated Relation Network for Image-Text matching17 Jun 2019 0 repositories listed
-
28 May 2017 0 repositories listed