{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/text-retrieval/papers/6","list_of":"/task/text-retrieval","task":"Text Retrieval","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":6,"pages_in_order":7,"rows_per_page":100,"rows":[501,600],"of":671,"counts":{"archive_papers_tagged":671,"with_a_code_link":335,"where_syntology_ran_a_sample":117,"not_listed_spam_title":0,"listed":671,"listed_where_code_ran":117,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":99,"every_run_a_failure_of_syntologys_instrument":18,"listed_with_a_run_with_no_instrument_failure":99,"listed_every_run_a_failure_of_syntologys_instrument":18,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/text-retrieval","prev":"/task/text-retrieval/papers/5","next":"/task/text-retrieval/papers/7","papers":[{"url":null,"slug":"augmenting-clip-with-improved-visio","title":"Distilling Knowledge from Text-to-Image Generative Models Improves Visio-Linguistic Reasoning in CLIP","date":"2023-07-18","arxiv_id":"2307.09233","repositories_listed":0,"syntology":null},{"url":null,"slug":"switch-bert-learning-to-model-multimodal","title":"Switch-BERT: Learning to Model Multimodal Interactions by Switching Attention and Input","date":"2023-06-25","arxiv_id":"2306.14182","repositories_listed":0,"syntology":null},{"url":null,"slug":"taca-upgrading-your-visual-foundation-model","title":"TaCA: Upgrading Your Visual Foundation Model with Task-agnostic Compatible Adapter","date":"2023-06-22","arxiv_id":"2306.12642","repositories_listed":0,"syntology":null},{"url":null,"slug":"align-adapt-and-inject-sound-guided-unified","title":"Align, Adapt and Inject: Sound-guided Unified Image Generation","date":"2023-06-20","arxiv_id":"2306.11504","repositories_listed":0,"syntology":null},{"url":null,"slug":"i-code-studio-a-configurable-and-composable","title":"i-Code Studio: A Configurable and Composable Framework for Integrative AI","date":"2023-05-23","arxiv_id":"2305.13738","repositories_listed":0,"syntology":null},{"url":"/paper/vlab-enhancing-video-language-pre-training-by","slug":"vlab-enhancing-video-language-pre-training-by","title":"VLAB: Enhancing Video Language Pre-training by Feature Adapting and Blending","date":"2023-05-22","arxiv_id":"2305.13167","repositories_listed":0,"syntology":null},{"url":null,"slug":"tome-a-two-stage-approach-for-model-based","title":"TOME: A Two-stage Approach for Model-based Retrieval","date":"2023-05-18","arxiv_id":"2305.11161","repositories_listed":0,"syntology":null},{"url":null,"slug":"mask-to-reconstruct-cooperative-semantics","title":"Mask to reconstruct: Cooperative Semantics Completion for Video-text Retrieval","date":"2023-05-13","arxiv_id":"2305.07910","repositories_listed":0,"syntology":null},{"url":"/paper/alternating-gradient-descent-and-mixture-of","slug":"alternating-gradient-descent-and-mixture-of","title":"Alternating Gradient Descent and Mixture-of-Experts for Integrated Multimodal Perception","date":"2023-05-10","arxiv_id":"2305.06324","repositories_listed":0,"syntology":null},{"url":null,"slug":"hypernymization-of-named-entity-rich-captions","title":"Hypernymization of named entity-rich captions for grounding-based multi-modal pretraining","date":"2023-04-25","arxiv_id":"2304.13130","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-cross-modal-information-retrieval-possible","title":"Is Cross-modal Information Retrieval Possible without Training?","date":"2023-04-20","arxiv_id":"2304.11095","repositories_listed":0,"syntology":null},{"url":null,"slug":"converting-ecg-signals-to-images-for","title":"Automated Cardiovascular Record Retrieval by Multimodal Learning between Electrocardiogram and Clinical Report","date":"2023-04-13","arxiv_id":"2304.06286","repositories_listed":0,"syntology":null},{"url":null,"slug":"reclip-resource-efficient-clip-by-training","title":"RECLIP: Resource-efficient CLIP by Training with Small Images","date":"2023-04-12","arxiv_id":"2304.06028","repositories_listed":0,"syntology":null},{"url":null,"slug":"exposing-and-mitigating-spurious-correlations","title":"Exposing and Mitigating Spurious Correlations for Cross-Modal Retrieval","date":"2023-04-06","arxiv_id":"2304.03391","repositories_listed":0,"syntology":null},{"url":null,"slug":"free-form-multi-modal-multimedia-retrieval","title":"Free-Form Multi-Modal Multimedia Retrieval (4MR)","date":"2023-03-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"computationally-efficient-labeling-of-cancer","title":"Computationally Efficient Labeling of Cancer Related Forum Posts by Non-Clinical Text Information Retrieval","date":"2023-03-24","arxiv_id":"2303.16766","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-fly-text-retrieval-for-end-to-end-asr","title":"On-the-fly Text Retrieval for End-to-End ASR Adaptation","date":"2023-03-20","arxiv_id":"2303.10942","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-graph-based-fusion-network-for-image","title":"Scene Graph Based Fusion Network For Image-Text Retrieval","date":"2023-03-20","arxiv_id":"2303.11090","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-image-text-retrieval-via-keyword","title":"Efficient Image-Text Retrieval via Keyword-Guided Pre-Screening","date":"2023-03-14","arxiv_id":"2303.07740","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-and-constructing-latent","title":"Understanding and Constructing Latent Modality Structures in Multi-modal Representation Learning","date":"2023-03-10","arxiv_id":"2303.05952","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-style-transformer-with-common-knowledge","title":"The style transformer with common knowledge optimization for image-text retrieval","date":"2023-03-01","arxiv_id":"2303.00448","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-for-video-text-retrieval-a","title":"Deep Learning for Video-Text Retrieval: a Review","date":"2023-02-24","arxiv_id":"2302.12552","repositories_listed":0,"syntology":null},{"url":null,"slug":"stair-learning-sparse-text-and-image","title":"STAIR: Learning Sparse Text and Image Representation in Grounded Tokens","date":"2023-01-30","arxiv_id":"2301.13081","repositories_listed":0,"syntology":null},{"url":null,"slug":"tagging-before-alignment-integrating-multi","title":"Tagging before Alignment: Integrating Multi-Modal Tags for Video-Text Retrieval","date":"2023-01-30","arxiv_id":"2301.12644","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-alignment-unsupervised-domain-adaptation","title":"Dual Alignment Unsupervised Domain Adaptation for Video-Text Retrieval","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"gafnet-a-global-fourier-self-attention-based","title":"GAFNet: A Global Fourier Self Attention Based Novel Network for multi-modal downstream tasks","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hivlp-hierarchical-interactive-video-language","title":"HiVLP: Hierarchical Interactive Video-Language Pre-Training","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"lecture-presentations-multimodal-dataset","title":"Lecture Presentations Multimodal Dataset: Towards Understanding Multimodality in Educational Videos","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multilateral-semantic-relations-modeling-for","title":"Multilateral Semantic Relations Modeling for Image Text Retrieval","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/vilem-visual-language-error-modeling-for","slug":"vilem-visual-language-error-modeling-for","title":"ViLEM: Visual-Language Error Modeling for Image-Text Retrieval","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"vl-match-enhancing-vision-language","title":"VL-Match: Enhancing Vision-Language Pretraining with Token-Level and Instance-Level Matching","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"when-are-lemons-purple-the-concept","title":"When are Lemons Purple? The Concept Association Bias of Vision-Language Models","date":"2022-12-22","arxiv_id":"2212.12043","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-image-captioning-for-edge-devices","title":"Efficient Image Captioning for Edge Devices","date":"2022-12-18","arxiv_id":"2212.08985","repositories_listed":0,"syntology":null},{"url":null,"slug":"hgan-hierarchical-graph-alignment-network-for","title":"HGAN: Hierarchical Graph Alignment Network for Image-Text Retrieval","date":"2022-12-16","arxiv_id":"2212.08281","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-based-disentanglement-with-distant","title":"Retrieval-based Disentangled Representation Learning with Natural Language Supervision","date":"2022-12-15","arxiv_id":"2212.07699","repositories_listed":0,"syntology":null},{"url":null,"slug":"nlip-noise-robust-language-image-pre-training","title":"NLIP: Noise-robust Language-Image Pre-training","date":"2022-12-14","arxiv_id":"2212.07086","repositories_listed":0,"syntology":null},{"url":null,"slug":"attentive-deep-neural-networks-for-legal","title":"Attentive Deep Neural Networks for Legal Document Retrieval","date":"2022-12-13","arxiv_id":"2212.13899","repositories_listed":0,"syntology":null},{"url":null,"slug":"scale-semantic-joint-decoupling-network-for","title":"Scale-Semantic Joint Decoupling Network for Image-text Retrieval in Remote Sensing","date":"2022-12-12","arxiv_id":"2212.05752","repositories_listed":0,"syntology":null},{"url":"/paper/masked-contrastive-pre-training-for-efficient","slug":"masked-contrastive-pre-training-for-efficient","title":"Masked Contrastive Pre-Training for Efficient Video-Text Retrieval","date":"2022-12-02","arxiv_id":"2212.00986","repositories_listed":0,"syntology":null},{"url":null,"slug":"mslkanet-a-multi-scale-large-kernel-attention","title":"MSLKANet: A Multi-Scale Large Kernel Attention Network for Scene Text Removal","date":"2022-11-12","arxiv_id":"2211.06565","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-negative-sampling-for-contrastive-audio","title":"On Negative Sampling for Contrastive Audio-Text Retrieval","date":"2022-11-08","arxiv_id":"2211.04070","repositories_listed":0,"syntology":null},{"url":null,"slug":"arabic-text-mining","title":"Arabic Text Mining","date":"2022-11-04","arxiv_id":"2211.02772","repositories_listed":0,"syntology":null},{"url":null,"slug":"m-speechclip-leveraging-large-scale-pre","title":"M-SpeechCLIP: Leveraging Large-Scale, Pre-Trained Models for Multilingual Speech to Image Retrieval","date":"2022-11-02","arxiv_id":"2211.01180","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-negative-text-replay-for-continual","title":"Generative Negative Text Replay for Continual Vision-Language Pretraining","date":"2022-10-31","arxiv_id":"2210.17322","repositories_listed":0,"syntology":null},{"url":"/paper/improving-audio-language-learning-with-mixgen","slug":"improving-audio-language-learning-with-mixgen","title":"Exploring Train and Test-Time Augmentations for Audio-Language Learning","date":"2022-10-31","arxiv_id":"2210.17143","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-analysis-of-fusion-functions-for-hybrid","title":"An Analysis of Fusion Functions for Hybrid Retrieval","date":"2022-10-21","arxiv_id":"2210.11934","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-text-retrieval-with-binary-and","title":"Image-Text Retrieval with Binary and Continuous Label Supervision","date":"2022-10-20","arxiv_id":"2210.11319","repositories_listed":0,"syntology":null},{"url":null,"slug":"mamo-masked-multimodal-modeling-for-fine","title":"MAMO: Masked Multimodal Modeling for Fine-Grained Vision-Language Representation Learning","date":"2022-10-09","arxiv_id":"2210.04183","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-embed-semantic-similarity-for","title":"Learning to embed semantic similarity for joint image-text retrieval","date":"2022-10-07","arxiv_id":"2210.03838","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-multilingual-multi-modal-pre","title":"Efficient Multilingual Multi-modal Pre-training through Triple Contrastive Loss","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"label-smoothing-for-text-mining","title":"Label Smoothing for Text Mining","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/re-imagen-retrieval-augmented-text-to-image","slug":"re-imagen-retrieval-augmented-text-to-image","title":"Re-Imagen: Retrieval-Augmented Text-to-Image Generator","date":"2022-09-29","arxiv_id":"2209.14491","repositories_listed":0,"syntology":null},{"url":null,"slug":"tokenflow-rethinking-fine-grained-cross-modal","title":"TokenFlow: Rethinking Fine-grained Cross-modal Alignment in Vision-Language Retrieval","date":"2022-09-28","arxiv_id":"2209.13822","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-loss-of-pair-similarity-optimization","title":"Unified Loss of Pair Similarity Optimization for Vision-Language Retrieval","date":"2022-09-28","arxiv_id":"2209.13869","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-adaptive-multiple-visual-prototype","title":"Text-Adaptive Multiple Visual Prototype Matching for Video-Text Retrieval","date":"2022-09-27","arxiv_id":"2209.13307","repositories_listed":0,"syntology":null},{"url":"/paper/omnivl-one-foundation-model-for-image","slug":"omnivl-one-foundation-model-for-image","title":"OmniVL:One Foundation Model for Image-Language and Video-Language Tasks","date":"2022-09-15","arxiv_id":"2209.07526","repositories_listed":0,"syntology":null},{"url":null,"slug":"hearts-multi-task-fusion-of-dense-retrieval","title":"Unified Generative & Dense Retrieval for Query Rewriting in Sponsored Search","date":"2022-09-13","arxiv_id":"2209.05861","repositories_listed":0,"syntology":null},{"url":null,"slug":"revising-image-text-retrieval-via-multi-modal","title":"Revising Image-Text Retrieval via Multi-Modal Entailment","date":"2022-08-22","arxiv_id":"2208.10126","repositories_listed":0,"syntology":null},{"url":null,"slug":"coder-coupled-diversity-sensitive-momentum","title":"CODER: Coupled Diversity-Sensitive Momentum Contrastive Learning for Image-Text Retrieval","date":"2022-08-21","arxiv_id":"2208.09843","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlmae-vision-language-masked-autoencoder","title":"VLMAE: Vision-Language Masked Autoencoder","date":"2022-08-19","arxiv_id":"2208.09374","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-value-of-behavioral-representations","title":"On the Value of Behavioral Representations for Dense Retrieval","date":"2022-08-11","arxiv_id":"2208.05663","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-video-text-retrieval-with-explicit","title":"Boosting Video-Text Retrieval with Explicit High-Level Semantics","date":"2022-08-08","arxiv_id":"2208.04215","repositories_listed":0,"syntology":null},{"url":null,"slug":"paired-cross-modal-data-augmentation-for-fine","title":"Paired Cross-Modal Data Augmentation for Fine-Grained Image-to-Text Retrieval","date":"2022-07-29","arxiv_id":"2207.14428","repositories_listed":0,"syntology":null},{"url":"/paper/lat-latent-translation-with-cycle-consistency","slug":"lat-latent-translation-with-cycle-consistency","title":"LaT: Latent Translation with Cycle-Consistency for Video-Text Retrieval","date":"2022-07-11","arxiv_id":"2207.04858","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-contrastive-distillation-for-image","title":"Dynamic Contrastive Distillation for Image-Text Retrieval","date":"2022-07-04","arxiv_id":"2207.01426","repositories_listed":0,"syntology":null},{"url":null,"slug":"gazby-gaze-based-bert-model-to-incorporate","title":"GazBy: Gaze-Based BERT Model to Incorporate Human Attention in Neural Information Retrieval","date":"2022-07-04","arxiv_id":"2207.01674","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-robust-ranker-for-text-retrieval","title":"Towards Robust Ranker for Text Retrieval","date":"2022-06-16","arxiv_id":"2206.08063","repositories_listed":0,"syntology":null},{"url":null,"slug":"vl-beit-generative-vision-language","title":"VL-BEiT: Generative Vision-Language Pretraining","date":"2022-06-02","arxiv_id":"2206.01127","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalizing-multimodal-pre-training-into","title":"Generalizing Multimodal Pre-training into Multilingual via Language Acquisition","date":"2022-05-29","arxiv_id":"2206.11091","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-based-learning-for-unpaired-image","title":"Prompt-based Learning for Unpaired Image Captioning","date":"2022-05-26","arxiv_id":"2205.13125","repositories_listed":0,"syntology":null},{"url":null,"slug":"hivlp-hierarchical-vision-language-pre","title":"HiVLP: Hierarchical Vision-Language Pre-Training for Fast Image-Text Retrieval","date":"2022-05-24","arxiv_id":"2205.12105","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-text-aware-image-and-text-retrieval","title":"Scene-Text Aware Image and Text Retrieval with Dual-Encoder","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"trattack-text-rewriting-attack-against-text","title":"TRAttack”:\" Text Rewriting Attack Against Text Retrieval","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-learning-for-image-retrieval-with","title":"Progressive Learning for Image Retrieval with Hybrid-Modality Queries","date":"2022-04-24","arxiv_id":"2204.11212","repositories_listed":0,"syntology":null},{"url":"/paper/cots-collaborative-two-stream-vision-language","slug":"cots-collaborative-two-stream-vision-language","title":"COTS: Collaborative Two-Stream Vision-Language Pre-Training Model for Cross-Modal Retrieval","date":"2022-04-15","arxiv_id":"2204.07441","repositories_listed":0,"syntology":null},{"url":"/paper/robust-cross-modal-representation-learning","slug":"robust-cross-modal-representation-learning","title":"Robust Cross-Modal Representation Learning with Progressive Self-Distillation","date":"2022-04-10","arxiv_id":"2204.04588","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-text-retrieval-a-survey-on-recent","title":"Image-text Retrieval: A Survey on Recent Research and Development","date":"2022-03-28","arxiv_id":"2203.14713","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-text-retrieval-in-context","title":"Audio-text Retrieval in Context","date":"2022-03-25","arxiv_id":"2203.13645","repositories_listed":0,"syntology":null},{"url":"/paper/synopses-of-movie-narratives-a-video-language-1","slug":"synopses-of-movie-narratives-a-video-language-1","title":"Synopses of Movie Narratives: a Video-Language Dataset for Story Understanding","date":"2022-03-11","arxiv_id":"2203.05711","repositories_listed":0,"syntology":null},{"url":null,"slug":"loopitr-combining-dual-and-cross-encoder","title":"LoopITR: Combining Dual and Cross Encoder Architectures for Image-Text Retrieval","date":"2022-03-10","arxiv_id":"2203.05465","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-uncommon-task-participatory-design-in","title":"An Uncommon Task: Participatory Design in Legal AI","date":"2022-03-08","arxiv_id":"2203.06246","repositories_listed":0,"syntology":null},{"url":null,"slug":"commercemm-large-scale-commerce-multimodal","title":"CommerceMM: Large-Scale Commerce MultiModal Representation Learning with Omni Retrieval","date":"2022-02-15","arxiv_id":"2202.07247","repositories_listed":0,"syntology":null},{"url":null,"slug":"synopses-of-movie-narratives-a-video-language","title":"Synopses of Movie Narratives: a Video-Language Dataset for Story Understanding","date":"2022-01-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-contrastive-learning-for-speech","title":"Cross-modal Contrastive Learning for Speech Translation","date":"2021-12-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"negative-sample-is-negative-in-its-own-way-1","title":"Negative Sample is Negative in Its Own Way: Tailoring Negative Sentences for Image-Text Retrieval","date":"2021-12-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-multimodal-pre-training-and-prompt","title":"Unified Multimodal Pre-training and Prompt-based Tuning for Vision-Language Understanding and Generation","date":"2021-12-10","arxiv_id":"2112.05587","repositories_listed":0,"syntology":null},{"url":null,"slug":"ufo-a-unified-transformer-for-vision-language","title":"UFO: A UniFied TransfOrmer for Vision-Language Representation Learning","date":"2021-11-19","arxiv_id":"2111.10023","repositories_listed":0,"syntology":null},{"url":null,"slug":"constructing-phrase-level-semantic-labels-to-1","title":"Constructing Phrase-level Semantic Labels to Form Multi-GrainedSupervision for Image-Text Retrieval","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"viquae-a-dataset-for-knowledge-based-visual","title":"ViQuAE, a Dataset for Knowledge-based Visual Question Answering about Named Entities","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/clip2tv-an-empirical-study-on-transformer","slug":"clip2tv-an-empirical-study-on-transformer","title":"CLIP2TV: Align, Match and Distill for Video-Text Retrieval","date":"2021-11-10","arxiv_id":"2111.05610","repositories_listed":0,"syntology":null},{"url":null,"slug":"swamp-swapped-assignment-of-multi-modal-pairs","title":"SwAMP: Swapped Assignment of Multi-Modal Pairs for Cross-Modal Retrieval","date":"2021-11-10","arxiv_id":"2111.05814","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-keyphrase-completion","title":"Deep Keyphrase Completion","date":"2021-10-29","arxiv_id":"2111.01910","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-dense-retrieval-with-momentum-1","title":"Zero-Shot Dense Retrieval with Momentum Adversarial Domain Invariant Representations","date":"2021-10-14","arxiv_id":"2110.07581","repositories_listed":0,"syntology":null},{"url":null,"slug":"viseret-a-simple-yet-effective-approach-to","title":"ViSeRet: A simple yet effective approach to moment retrieval via fine-grained video segmentation","date":"2021-10-11","arxiv_id":"2110.05146","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-proposed-conceptual-framework-for-a","title":"A Proposed Conceptual Framework for a Representational Approach to Information Retrieval","date":"2021-10-04","arxiv_id":"2110.01529","repositories_listed":0,"syntology":null},{"url":null,"slug":"crossclr-cross-modal-contrastive-learning-for","title":"CrossCLR: Cross-modal Contrastive Learning For Multi-modal Video Representations","date":"2021-09-30","arxiv_id":"2109.14910","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-context-adapted-video-text-retrieval","title":"Learning Context-Adapted Video-Text Retrieval by Attending to User Comments","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-dense-retrieval-with-momentum","title":"Zero-Shot Dense Retrieval with Momentum Adversarial Domain Invariant Representation","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"constructing-phrase-level-semantic-labels-to","title":"Constructing Phrase-level Semantic Labels to Form Multi-Grained Supervision for Image-Text Retrieval","date":"2021-09-12","arxiv_id":"2109.05523","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficientclip-efficient-cross-modal-pre","title":"EfficientCLIP: Efficient Cross-Modal Pre-training by Ensemble Confident Learning and Language Modeling","date":"2021-09-10","arxiv_id":"2109.04699","repositories_listed":0,"syntology":null}],"record_sha256":"975958e1dc00d8605392531d73101a4978132b1291184f48abf2a0e470b80152","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}