{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-text-matching/papers/2","list_of":"/task/image-text-matching","task":"Image-text matching","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":2,"rows_per_page":100,"rows":[101,188],"of":188,"counts":{"archive_papers_tagged":188,"with_a_code_link":102,"where_syntology_ran_a_sample":37,"not_listed_spam_title":0,"listed":188,"listed_where_code_ran":37,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":30,"every_run_a_failure_of_syntologys_instrument":7,"listed_with_a_run_with_no_instrument_failure":30,"listed_every_run_a_failure_of_syntologys_instrument":7,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-text-matching","prev":"/task/image-text-matching","next":null,"papers":[{"url":"/paper/deep-cross-modal-projection-learning-for","slug":"deep-cross-modal-projection-learning-for","title":"Deep Cross-Modal Projection Learning for Image-Text Matching","date":"2018-09-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/learning-two-branch-neural-networks-for-image","slug":"learning-two-branch-neural-networks-for-image","title":"Learning Two-Branch Neural Networks for Image-Text Matching Tasks","date":"2017-04-11","arxiv_id":"1704.03470","repositories_listed":1,"syntology":null},{"url":null,"slug":"tng-clip-training-time-negation-data","title":"TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP","date":"2025-05-24","arxiv_id":"2505.18434","repositories_listed":0,"syntology":null},{"url":null,"slug":"descriptive-image-text-matching-with-graded","title":"Descriptive Image-Text Matching with Graded Contextual Similarity","date":"2025-05-15","arxiv_id":"2505.09997","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-image-text-matching-and","title":"Compositional Image-Text Matching and Retrieval by Grounding Entities","date":"2025-05-04","arxiv_id":"2505.02278","repositories_listed":0,"syntology":null},{"url":null,"slug":"instruction-augmented-multimodal-alignment","title":"Instruction-augmented Multimodal Alignment for Image-Text and Element Matching","date":"2025-04-16","arxiv_id":"2504.12018","repositories_listed":0,"syntology":null},{"url":null,"slug":"dependency-structure-augmented-contextual","title":"Dependency Structure Augmented Contextual Scoping Framework for Multimodal Aspect-Based Sentiment Analysis","date":"2025-04-15","arxiv_id":"2504.11331","repositories_listed":0,"syntology":null},{"url":null,"slug":"2503-01019","title":"MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations","date":"2025-03-02","arxiv_id":"2503.01019","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-centric-binding-in-contrastive","title":"Object-centric Binding in Contrastive Language-Image Pretraining","date":"2025-02-19","arxiv_id":"2502.14113","repositories_listed":0,"syntology":null},{"url":null,"slug":"mass-overcoming-language-bias-in-image-text","title":"MASS: Overcoming Language Bias in Image-Text Matching","date":"2025-01-20","arxiv_id":"2501.11469","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-textual-prompts-for-open-world-semi","title":"Learning Textual Prompts for Open-World Semi-Supervised Learning","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-head-attention-driven-dynamic-visual","title":"Multi-Head Attention Driven Dynamic Visual-Semantic Embedding for Enhanced Image-Text Matching","date":"2024-12-26","arxiv_id":"2412.19184","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-concept-centric-approach-to-multi-modality","title":"A Concept-Centric Approach to Multi-Modality Learning","date":"2024-12-18","arxiv_id":"2412.13847","repositories_listed":0,"syntology":null},{"url":null,"slug":"viunit-visual-unit-tests-for-more-robust","title":"ViUniT: Visual Unit Tests for More Robust Visual Programming","date":"2024-12-12","arxiv_id":"2412.08859","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-prompt-generation-and-grounding","title":"Automatic Prompt Generation and Grounding Object Detection for Zero-Shot Image Anomaly Detection","date":"2024-11-28","arxiv_id":"2411.19220","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlm-hoi-vision-language-models-for","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","date":"2024-11-27","arxiv_id":"2411.18038","repositories_listed":0,"syntology":null},{"url":null,"slug":"entityclip-entity-centric-image-text-matching","title":"EntityCLIP: Entity-Centric Image-Text Matching via Multimodal Attentive Contrastive Learning","date":"2024-10-23","arxiv_id":"2410.17810","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-the-modality-gap-dimension","title":"Bridging the Modality Gap: Dimension Information Alignment and Sparse Spatial Constraint for Image-Text Matching","date":"2024-10-22","arxiv_id":"2410.16853","repositories_listed":0,"syntology":null},{"url":null,"slug":"dare-diverse-visual-question-answering-with","title":"DARE: Diverse Visual Question Answering with Robustness Evaluation","date":"2024-09-26","arxiv_id":"2409.18023","repositories_listed":0,"syntology":null},{"url":null,"slug":"nevlp-noise-robust-framework-for-efficient","title":"NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training","date":"2024-09-15","arxiv_id":"2409.09582","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-deconfounded-image-text-matching-with","title":"Towards Deconfounded Image-Text Matching with Causal Inference","date":"2024-08-22","arxiv_id":"2408.12292","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-and-compressive-adaptation-of","title":"Dynamic and Compressive Adaptation of Transformers From Images to Videos","date":"2024-08-13","arxiv_id":"2408.06840","repositories_listed":0,"syntology":null},{"url":null,"slug":"advanced-multimodal-deep-learning","title":"Advanced Multimodal Deep Learning Architecture for Image-Text Matching","date":"2024-06-13","arxiv_id":"2406.15306","repositories_listed":0,"syntology":null},{"url":null,"slug":"hire-hybrid-modal-interaction-with-multiple","title":"Hire: Hybrid-modal Interaction with Multiple Relational Enhancements for Image-Text Matching","date":"2024-06-05","arxiv_id":"2406.18579","repositories_listed":0,"syntology":null},{"url":null,"slug":"demo-a-statistical-perspective-for-efficient","title":"DEMO: A Statistical Perspective for Efficient Image-Text Matching","date":"2024-05-19","arxiv_id":"2405.11496","repositories_listed":0,"syntology":null},{"url":null,"slug":"clip-powered-tass-target-aware-single-stream","title":"CLIP-Powered TASS: Target-Aware Single-Stream Network for Audio-Visual Question Answering","date":"2024-05-13","arxiv_id":"2405.07451","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-enhanced-zero-shot-video-captioning","title":"RETTA: Retrieval-Enhanced Test-Time Adaptation for Zero-Shot Video Captioning","date":"2024-05-11","arxiv_id":"2405.07046","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-through-the-noisy-correspondence-a","title":"Breaking Through the Noisy Correspondence: A Robust Model for Image-Text Matching","date":"2024-04-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"syncmask-synchronized-attentional-masking-for","title":"SyncMask: Synchronized Attentional Masking for Fashion-centric Vision-Language Pretraining","date":"2024-04-01","arxiv_id":"2404.01156","repositories_listed":0,"syntology":null},{"url":null,"slug":"constructing-multilingual-visual-text","title":"Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models","date":"2024-03-29","arxiv_id":"2406.15359","repositories_listed":0,"syntology":null},{"url":null,"slug":"fsmr-a-feature-swapping-multi-modal-reasoning","title":"FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues","date":"2024-03-29","arxiv_id":"2403.20026","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-text-matching-with-multi-view-attention","title":"Image-Text Matching with Multi-View Attention","date":"2024-02-27","arxiv_id":"2402.17237","repositories_listed":0,"syntology":null},{"url":null,"slug":"ot-attack-enhancing-adversarial","title":"OT-Attack: Enhancing Adversarial Transferability of Vision-Language Models via Optimal Transport Optimization","date":"2023-12-07","arxiv_id":"2312.04403","repositories_listed":0,"syntology":null},{"url":null,"slug":"czl-ciae-clip-driven-zero-shot-learning-for","title":"CILF-CIAE: CLIP-driven Image-Language Fusion for Correcting Inverse Age Estimation","date":"2023-12-04","arxiv_id":"2312.01758","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-mining-sample-pair-semantics-for-image","title":"Active Mining Sample Pair Semantics for Image-text Matching","date":"2023-11-09","arxiv_id":"2311.05425","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-prominent-fragments-enhancement","title":"A New Fine-grained Alignment Method for Image-text Matching","date":"2023-11-03","arxiv_id":"2311.02183","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-comprehensive-representations-with","title":"Learning Comprehensive Representations with Richer Self for Text-to-Image Person Re-Identification","date":"2023-10-17","arxiv_id":"2310.11210","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-multi-view-visual-semantic","title":"Dynamic Visual Semantic Sub-Embeddings and Fast Re-Ranking","date":"2023-09-15","arxiv_id":"2309.08154","repositories_listed":0,"syntology":null},{"url":null,"slug":"vilta-enhancing-vision-language-pre-training","title":"ViLTA: Enhancing Vision-Language Pre-training through Textual Augmentation","date":"2023-08-31","arxiv_id":"2308.16689","repositories_listed":0,"syntology":null},{"url":null,"slug":"uniformly-distributed-category-prototype","title":"Uniformly Distributed Category Prototype-Guided Vision-Language Framework for Long-Tail Recognition","date":"2023-08-24","arxiv_id":"2308.12522","repositories_listed":0,"syntology":null},{"url":null,"slug":"eve-efficient-vision-language-pre-training","title":"EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE","date":"2023-08-23","arxiv_id":"2308.11971","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-grounded-visual-spatial-reasoning-in","title":"Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models","date":"2023-08-18","arxiv_id":"2308.09778","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounded-image-text-matching-with-mismatched","title":"Grounded Image Text Matching with Mismatched Relation Reasoning","date":"2023-08-02","arxiv_id":"2308.01236","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-the-role-of-positional-information-in-2","title":"Probing the Role of Positional Information in Vision-Language Models","date":"2023-05-17","arxiv_id":"2305.10046","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-text-recognition-with-image-text","title":"Scene Text Recognition with Image-Text Matching-guided Dictionary","date":"2023-05-08","arxiv_id":"2305.04524","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-representation-learning-with-text","title":"Multi-Modal Representation Learning with Text-Driven Soft Masks","date":"2023-04-03","arxiv_id":"2304.00719","repositories_listed":0,"syntology":null},{"url":null,"slug":"replacement-as-a-self-supervision-for-fine","title":"Refined Vision-Language Modeling for Fine-grained Multi-modal Pre-training","date":"2023-03-09","arxiv_id":"2303.05313","repositories_listed":0,"syntology":null},{"url":null,"slug":"selectively-hard-negative-mining-for","title":"Selectively Hard Negative Mining for Alleviating Gradient Vanishing in Image-Text Matching","date":"2023-03-01","arxiv_id":"2303.00181","repositories_listed":0,"syntology":null},{"url":null,"slug":"vl-match-enhancing-vision-language","title":"VL-Match: Enhancing Vision-Language Pretraining with Token-Level and Instance-Level Matching","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-referring-image","title":"Weakly Supervised Referring Image Segmentation with Intra-Chunk and Inter-Chunk Consistency","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mmnet-multi-modal-fusion-with-mutual-learning","title":"Multimodal Matching-aware Co-attention Networks with Mutual Knowledge Distillation for Fake News Detection","date":"2022-12-12","arxiv_id":"2212.05699","repositories_listed":0,"syntology":null},{"url":null,"slug":"uniform-masking-prevails-in-vision-language","title":"Uniform Masking Prevails in Vision-Language Pretraining","date":"2022-12-10","arxiv_id":"2212.05195","repositories_listed":0,"syntology":null},{"url":null,"slug":"upainting-unified-text-to-image-diffusion","title":"UPainting: Unified Text-to-Image Diffusion Generation with Cross-modal Guidance","date":"2022-10-28","arxiv_id":"2210.16031","repositories_listed":0,"syntology":null},{"url":"/paper/adscvlr-commercial-visual-linguistic","slug":"adscvlr-commercial-visual-linguistic","title":"AdsCVLR: Commercial Visual-Linguistic Representation Modeling in Sponsored Search","date":"2022-10-10","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"don-t-stop-learning-towards-continual","title":"Don't Stop Learning: Towards Continual Learning for the CLIP Model","date":"2022-07-19","arxiv_id":"2207.09248","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-based-cross-modal-retrieval-with","title":"Uncertainty-based Cross-Modal Retrieval with Probabilistic Representations","date":"2022-04-20","arxiv_id":"2204.09268","repositories_listed":0,"syntology":null},{"url":null,"slug":"dt2i-dense-text-to-image-generation-from","title":"DT2I: Dense Text-to-Image Generation from Region Descriptions","date":"2022-04-05","arxiv_id":"2204.02035","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-stream-hierarchical-similarity-reasoning","title":"Two-stream Hierarchical Similarity Reasoning for Image-text Matching","date":"2022-03-10","arxiv_id":"2203.05349","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-embodied-symbolic-concept","title":"Dual Embodied-Symbolic Concept Representations for Deep Learning","date":"2022-03-01","arxiv_id":"2203.00600","repositories_listed":0,"syntology":null},{"url":null,"slug":"unpaired-referring-expression-grounding-via","title":"Unpaired Referring Expression Grounding via Bidirectional Cross-Modal Matching","date":"2022-01-18","arxiv_id":"2201.06686","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-the-role-of-positional-information-in","title":"Probing the Role of Positional Information in Vision-Language Models","date":"2022-01-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-multimodal-pre-training-and-prompt","title":"Unified Multimodal Pre-training and Prompt-based Tuning for Vision-Language Understanding and Generation","date":"2021-12-10","arxiv_id":"2112.05587","repositories_listed":0,"syntology":null},{"url":null,"slug":"embedding-arithmetic-for-text-driven-image","title":"Embedding Arithmetic of Multimodal Queries for Image Retrieval","date":"2021-12-06","arxiv_id":"2112.03162","repositories_listed":0,"syntology":null},{"url":null,"slug":"ufo-a-unified-transformer-for-vision-language","title":"UFO: A UniFied TransfOrmer for Vision-Language Representation Learning","date":"2021-11-19","arxiv_id":"2111.10023","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-than-just-attention-improving-cross","title":"More Than Just Attention: Improving Cross-Modal Attentions with Contrastive Constraints for Image-Text Matching","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mural-multimodal-multitask-representations","title":"MURAL: Multimodal, Multitask Representations Across Languages","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"is-an-image-worth-five-sentences-a-new-look","title":"Is An Image Worth Five Sentences? A New Look into Semantics for Image-Text Matching","date":"2021-10-06","arxiv_id":"2110.02623","repositories_listed":0,"syntology":null},{"url":"/paper/mural-multimodal-multitask-retrieval-across","slug":"mural-multimodal-multitask-retrieval-across","title":"MURAL: Multimodal, Multitask Retrieval Across Languages","date":"2021-09-10","arxiv_id":"2109.05125","repositories_listed":0,"syntology":null},{"url":null,"slug":"hashing-based-efficient-inference-for-image","title":"Hashing based Efficient Inference for Image-Text Matching","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-self-boosting-framework-for-automated","title":"A Self-Boosting Framework for Automated Radiographic Report Generation","date":"2021-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"step-wise-hierarchical-alignment-network-for","title":"Step-Wise Hierarchical Alignment Network for Image-Text Matching","date":"2021-06-11","arxiv_id":"2106.06509","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-efficient-cross-modal-visual-textual","title":"Towards Efficient Cross-Modal Visual Textual Retrieval using Transformer-Encoder Deep Features","date":"2021-06-01","arxiv_id":"2106.00358","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-than-just-attention-learning-cross-modal","title":"More Than Just Attention: Improving Cross-Modal Attentions with Contrastive Constraints for Image-Text Matching","date":"2021-05-20","arxiv_id":"2105.09597","repositories_listed":0,"syntology":null},{"url":null,"slug":"vl-nms-breaking-proposal-bottlenecks-in-two","title":"VL-NMS: Breaking Proposal Bottlenecks in Two-Stage Visual-Language Matching","date":"2021-05-12","arxiv_id":"2105.05636","repositories_listed":0,"syntology":null},{"url":null,"slug":"discrete-continuous-action-space-policy","title":"Discrete-continuous Action Space Policy Gradient-based Attention for Image-Text Matching","date":"2021-04-21","arxiv_id":"2104.10406","repositories_listed":0,"syntology":null},{"url":null,"slug":"uc2-universal-cross-lingual-cross-modal","title":"UC2: Universal Cross-lingual Cross-modal Vision-and-Language Pre-training","date":"2021-04-01","arxiv_id":"2104.00332","repositories_listed":0,"syntology":null},{"url":null,"slug":"macroscopic-control-of-text-generation-for","title":"Macroscopic Control of Text Generation for Image Captioning","date":"2021-01-20","arxiv_id":"2101.08000","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-feature-learning-via-text","title":"Contrastive Cross-Modal Pre-Training: A General Strategy for Small Sample Medical Imaging","date":"2020-10-06","arxiv_id":"2010.03060","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-attention-based-aggregation-function","title":"A Novel Attention-based Aggregation Function to Combine Vision and Language","date":"2020-04-27","arxiv_id":"2004.13073","repositories_listed":0,"syntology":null},{"url":"/paper/interbert-vision-and-language-interaction-for","slug":"interbert-vision-and-language-interaction-for","title":"InterBERT: Vision-and-Language Interaction for Multi-modal Pretraining","date":"2020-03-30","arxiv_id":"2003.13198","repositories_listed":0,"syntology":null},{"url":null,"slug":"expressing-objects-just-like-words-recurrent","title":"Expressing Objects just like Words: Recurrent Visual Embedding for Image-Text Matching","date":"2020-02-20","arxiv_id":"2002.08510","repositories_listed":0,"syntology":null},{"url":"/paper/imagebert-cross-modal-pre-training-with-large","slug":"imagebert-cross-modal-pre-training-with-large","title":"ImageBERT: Cross-modal Pre-training with Large-scale Weak-supervised Image-Text Data","date":"2020-01-22","arxiv_id":"2001.07966","repositories_listed":0,"syntology":null},{"url":null,"slug":"uniter-learning-universal-image-text","title":"UNITER: Learning UNiversal Image-TExt Representations","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"190909953","title":"Learning Visual Relation Priors for Image-Text Matching and Image Captioning with Neural Scene Graph Generators","date":"2019-09-22","arxiv_id":"1909.09953","repositories_listed":0,"syntology":null},{"url":"/paper/unicoder-vl-a-universal-encoder-for-vision","slug":"unicoder-vl-a-universal-encoder-for-vision","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","date":"2019-08-16","arxiv_id":"1908.06066","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-aware-semantic-concept-expansion","title":"Knowledge Aware Semantic Concept Expansion for Image-Text Matching","date":"2019-08-10","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"parnet-position-aware-aggregated-relation","title":"ParNet: Position-aware Aggregated Relation Network for Image-Text matching","date":"2019-06-17","arxiv_id":"1906.06892","repositories_listed":0,"syntology":null},{"url":"/paper/cross-modal-subspace-learning-for-fine","slug":"cross-modal-subspace-learning-for-fine","title":"Cross-modal Subspace Learning for Fine-grained Sketch-based Image Retrieval","date":"2017-05-28","arxiv_id":"1705.09888","repositories_listed":0,"syntology":null}],"record_sha256":"395eed003689759687c89d8aac6b30f8638c443036cb1abc5c62ef7068aed48e","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}