{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/text-matching/papers/3","list_of":"/task/text-matching","task":"Text Matching","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":4,"rows_per_page":100,"rows":[201,300],"of":364,"counts":{"archive_papers_tagged":364,"with_a_code_link":161,"where_syntology_ran_a_sample":48,"not_listed_spam_title":0,"listed":364,"listed_where_code_ran":48,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":40,"every_run_a_failure_of_syntologys_instrument":8,"listed_with_a_run_with_no_instrument_failure":40,"listed_every_run_a_failure_of_syntologys_instrument":8,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/text-matching","prev":"/task/text-matching/papers/2","next":"/task/text-matching/papers/4","papers":[{"url":null,"slug":"retrieval-enhanced-zero-shot-video-captioning","title":"RETTA: Retrieval-Enhanced Test-Time Adaptation for Zero-Shot Video Captioning","date":"2024-05-11","arxiv_id":"2405.07046","repositories_listed":0,"syntology":null},{"url":null,"slug":"com3d-leveraging-cross-view-correspondence","title":"COM3D: Leveraging Cross-View Correspondence and Cross-Modal Mining for 3D Retrieval","date":"2024-05-07","arxiv_id":"2405.04103","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-through-the-noisy-correspondence-a","title":"Breaking Through the Noisy Correspondence: A Robust Model for Image-Text Matching","date":"2024-04-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"finematch-aspect-based-fine-grained-image-and","title":"FINEMATCH: Aspect-based Fine-grained Image and Text Mismatch Detection and Correction","date":"2024-04-23","arxiv_id":"2404.14715","repositories_listed":0,"syntology":null},{"url":null,"slug":"transforming-llms-into-cross-modal-and-cross","title":"Transforming LLMs into Cross-modal and Cross-lingual Retrieval Systems","date":"2024-04-02","arxiv_id":"2404.01616","repositories_listed":0,"syntology":null},{"url":null,"slug":"syncmask-synchronized-attentional-masking-for","title":"SyncMask: Synchronized Attentional Masking for Fashion-centric Vision-Language Pretraining","date":"2024-04-01","arxiv_id":"2404.01156","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-llms-effective-backbones-for-fine-tuning","title":"Are LLMs Effective Backbones for Fine-tuning? An Experimental Investigation of Supervised LLMs on Chinese Short Text Matching","date":"2024-03-29","arxiv_id":"2403.19930","repositories_listed":0,"syntology":null},{"url":null,"slug":"constructing-multilingual-visual-text","title":"Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models","date":"2024-03-29","arxiv_id":"2406.15359","repositories_listed":0,"syntology":null},{"url":null,"slug":"fsmr-a-feature-swapping-multi-modal-reasoning","title":"FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues","date":"2024-03-29","arxiv_id":"2403.20026","repositories_listed":0,"syntology":null},{"url":null,"slug":"pointcloud-text-matching-benchmark-datasets","title":"PointCloud-Text Matching: Benchmark Datasets and a Baseline","date":"2024-03-28","arxiv_id":"2403.19386","repositories_listed":0,"syntology":null},{"url":null,"slug":"best-of-both-worlds-a-pliable-and","title":"Best of Both Worlds: A Pliable and Generalizable Neuro-Symbolic Approach for Relation Classification","date":"2024-03-05","arxiv_id":"2403.03305","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-text-matching-with-multi-view-attention","title":"Image-Text Matching with Multi-View Attention","date":"2024-02-27","arxiv_id":"2402.17237","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-intent-attribute-aware-text-matching-in","title":"Multi-Intent Attribute-Aware Text Matching in Searching","date":"2024-02-12","arxiv_id":"2402.07788","repositories_listed":0,"syntology":null},{"url":null,"slug":"gpt4ego-unleashing-the-potential-of-pre","title":"GPT4Ego: Unleashing the Potential of Pre-trained Models for Zero-Shot Egocentric Action Recognition","date":"2024-01-18","arxiv_id":"2401.10039","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-learning-with-audio","title":"Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech","date":"2024-01-12","arxiv_id":"2401.06485","repositories_listed":0,"syntology":null},{"url":null,"slug":"srtube-video-language-pre-training-with","title":"SRTube: Video-Language Pre-Training with Action-Centric Video Tube Features and Semantic Role Labeling","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ot-attack-enhancing-adversarial","title":"OT-Attack: Enhancing Adversarial Transferability of Vision-Language Models via Optimal Transport Optimization","date":"2023-12-07","arxiv_id":"2312.04403","repositories_listed":0,"syntology":null},{"url":null,"slug":"czl-ciae-clip-driven-zero-shot-learning-for","title":"CILF-CIAE: CLIP-driven Image-Language Fusion for Correcting Inverse Age Estimation","date":"2023-12-04","arxiv_id":"2312.01758","repositories_listed":0,"syntology":null},{"url":null,"slug":"tracing-influence-at-scale-a-contrastive","title":"Tracing Influence at Scale: A Contrastive Learning Approach to Linking Public Comments and Regulator Responses","date":"2023-11-24","arxiv_id":"2311.14871","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-mining-sample-pair-semantics-for-image","title":"Active Mining Sample Pair Semantics for Image-text Matching","date":"2023-11-09","arxiv_id":"2311.05425","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-prominent-fragments-enhancement","title":"A New Fine-grained Alignment Method for Image-text Matching","date":"2023-11-03","arxiv_id":"2311.02183","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-augmented-spatial-aware-zero-shot","title":"Text Augmented Spatial-aware Zero-shot Referring Image Segmentation","date":"2023-10-27","arxiv_id":"2310.18049","repositories_listed":0,"syntology":null},{"url":null,"slug":"cpseg-finer-grained-image-semantic","title":"CPSeg: Finer-grained Image Semantic Segmentation via Chain-of-Thought Language Prompting","date":"2023-10-24","arxiv_id":"2310.16069","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-comprehensive-representations-with","title":"Learning Comprehensive Representations with Richer Self for Text-to-Image Person Re-Identification","date":"2023-10-17","arxiv_id":"2310.11210","repositories_listed":0,"syntology":null},{"url":"/paper/learning-from-noisy-correspondence-with-tri","slug":"learning-from-noisy-correspondence-with-tri","title":"Learning From Noisy Correspondence With Tri-Partition for Cross-Modal Matching","date":"2023-09-22","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-multi-view-visual-semantic","title":"Dynamic Visual Semantic Sub-Embeddings and Fast Re-Ranking","date":"2023-09-15","arxiv_id":"2309.08154","repositories_listed":0,"syntology":null},{"url":null,"slug":"gls-csc-a-simple-but-effective-strategy-to","title":"GLS-CSC: A Simple but Effective Strategy to Mitigate Chinese STM Models' Over-Reliance on Superficial Clue","date":"2023-09-08","arxiv_id":"2309.04162","repositories_listed":0,"syntology":null},{"url":null,"slug":"vilta-enhancing-vision-language-pre-training","title":"ViLTA: Enhancing Vision-Language Pre-training through Textual Augmentation","date":"2023-08-31","arxiv_id":"2308.16689","repositories_listed":0,"syntology":null},{"url":null,"slug":"uniformly-distributed-category-prototype","title":"Uniformly Distributed Category Prototype-Guided Vision-Language Framework for Long-Tail Recognition","date":"2023-08-24","arxiv_id":"2308.12522","repositories_listed":0,"syntology":null},{"url":null,"slug":"eve-efficient-vision-language-pre-training","title":"EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE","date":"2023-08-23","arxiv_id":"2308.11971","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-grounded-visual-spatial-reasoning-in","title":"Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models","date":"2023-08-18","arxiv_id":"2308.09778","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-zero-shot-text-matching-for","title":"Improving Zero-Shot Text Matching for Financial Auditing with Large Language Models","date":"2023-08-11","arxiv_id":"2308.06111","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounded-image-text-matching-with-mismatched","title":"Grounded Image Text Matching with Mismatched Relation Reasoning","date":"2023-08-02","arxiv_id":"2308.01236","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-text-matching-in-e-commerce-search","title":"Improving Text Matching in E-Commerce Search with A Rationalizable, Intervenable and Fast Entity-Based Relevance Model","date":"2023-07-01","arxiv_id":"2307.00370","repositories_listed":0,"syntology":null},{"url":null,"slug":"pesco-prompt-enhanced-self-contrastive","title":"PESCO: Prompt-enhanced Self Contrastive Learning for Zero-shot Text Classification","date":"2023-05-24","arxiv_id":"2305.14963","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-the-role-of-positional-information-in-2","title":"Probing the Role of Positional Information in Vision-Language Models","date":"2023-05-17","arxiv_id":"2305.10046","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-text-recognition-with-image-text","title":"Scene Text Recognition with Image-Text Matching-guided Dictionary","date":"2023-05-08","arxiv_id":"2305.04524","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrity-and-junkiness-failure-handling-for","title":"Integrity and Junkiness Failure Handling for Embedding-based Retrieval: A Case Study in Social Network Search","date":"2023-04-18","arxiv_id":"2304.09287","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-short-text-matching-model-enhanced-with","title":"The Short Text Matching Model Enhanced with Knowledge via Contrastive Learning","date":"2023-04-08","arxiv_id":"2304.03898","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-representation-learning-with-text","title":"Multi-Modal Representation Learning with Text-Driven Soft Masks","date":"2023-04-03","arxiv_id":"2304.00719","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-prompt-learning-for-dense","title":"Probabilistic Prompt Learning for Dense Prediction","date":"2023-04-03","arxiv_id":"2304.00779","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-measurement-based-quantum-like-language","title":"A Measurement-Based Quantum-Like Language Model for Text Matching","date":"2023-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"replacement-as-a-self-supervision-for-fine","title":"Refined Vision-Language Modeling for Fine-grained Multi-modal Pre-training","date":"2023-03-09","arxiv_id":"2303.05313","repositories_listed":0,"syntology":null},{"url":null,"slug":"selectively-hard-negative-mining-for","title":"Selectively Hard Negative Mining for Alleviating Gradient Vanishing in Image-Text Matching","date":"2023-03-01","arxiv_id":"2303.00181","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-vision-language-representation","title":"Unified Vision-Language Representation Modeling for E-Commerce Same-Style Products Retrieval","date":"2023-02-10","arxiv_id":"2302.05093","repositories_listed":0,"syntology":null},{"url":null,"slug":"tagging-before-alignment-integrating-multi","title":"Tagging before Alignment: Integrating Multi-Modal Tags for Video-Text Retrieval","date":"2023-01-30","arxiv_id":"2301.12644","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-accuracy-of-zero-shot-action","title":"Improving Zero-Shot Action Recognition using Human Instruction with Text Description","date":"2023-01-21","arxiv_id":"2301.08874","repositories_listed":0,"syntology":null},{"url":null,"slug":"refclip-a-universal-teacher-for-weakly","title":"RefCLIP: A Universal Teacher for Weakly Supervised Referring Expression Comprehension","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"shapescaffolder-structure-aware-3d-shape","title":"ShapeScaffolder: Structure-Aware 3D Shape Generation from Text","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"vl-match-enhancing-vision-language","title":"VL-Match: Enhancing Vision-Language Pretraining with Token-Level and Instance-Level Matching","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-referring-image","title":"Weakly Supervised Referring Image Segmentation with Intra-Chunk and Inter-Chunk Consistency","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mmnet-multi-modal-fusion-with-mutual-learning","title":"Multimodal Matching-aware Co-attention Networks with Mutual Knowledge Distillation for Fake News Detection","date":"2022-12-12","arxiv_id":"2212.05699","repositories_listed":0,"syntology":null},{"url":null,"slug":"uniform-masking-prevails-in-vision-language","title":"Uniform Masking Prevails in Vision-Language Pretraining","date":"2022-12-10","arxiv_id":"2212.05195","repositories_listed":0,"syntology":null},{"url":"/paper/simvtp-simple-video-text-pre-training-with","slug":"simvtp-simple-video-text-pre-training-with","title":"SimVTP: Simple Video Text Pre-training with Masked Autoencoders","date":"2022-12-07","arxiv_id":"2212.03490","repositories_listed":0,"syntology":null},{"url":null,"slug":"upainting-unified-text-to-image-diffusion","title":"UPainting: Unified Text-to-Image Diffusion Generation with Cross-modal Guidance","date":"2022-10-28","arxiv_id":"2210.16031","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-text-matching-for-automated","title":"Zero-Shot Text Matching for Automated Auditing using Sentence Transformers","date":"2022-10-28","arxiv_id":"2211.07716","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-interventions-to-improve-out-of","title":"Using Interventions to Improve Out-of-Distribution Generalization of Text-Matching Recommendation Systems","date":"2022-10-07","arxiv_id":"2210.10636","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-feature-discrimination-and-denoising","title":"Adaptive Feature Discrimination and Denoising for Asymmetric Text Matching","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"one-shot-doc-snippet-detection-powering","title":"One-Shot Doc Snippet Detection: Powering Search in Document Beyond Text","date":"2022-09-12","arxiv_id":"2209.06584","repositories_listed":0,"syntology":null},{"url":null,"slug":"don-t-stop-learning-towards-continual","title":"Don't Stop Learning: Towards Continual Learning for the CLIP Model","date":"2022-07-19","arxiv_id":"2207.09248","repositories_listed":0,"syntology":null},{"url":null,"slug":"summscore-a-comprehensive-evaluation-metric","title":"SummScore: A Comprehensive Evaluation Metric for Summary Quality Based on Cross-Encoder","date":"2022-07-11","arxiv_id":"2207.04660","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-cross-modal-knowledge-sharing-pre","title":"Contrastive Cross-Modal Knowledge Sharing Pre-training for Vision-Language Representation Learning and Retrieval","date":"2022-07-02","arxiv_id":"2207.00733","repositories_listed":0,"syntology":null},{"url":null,"slug":"textmatcher-cross-attentional-neural-network","title":"TextMatcher: Cross-Attentional Neural Network to Compare Image and Text","date":"2022-05-11","arxiv_id":"2205.05507","repositories_listed":0,"syntology":null},{"url":null,"slug":"humanal-calibrating-human-matching-beyond-a","title":"HumanAL: Calibrating Human Matching Beyond a Single Task","date":"2022-05-06","arxiv_id":"2205.03209","repositories_listed":0,"syntology":null},{"url":null,"slug":"clusterformer-neural-clustering-attention-for","title":"ClusterFormer: Neural Clustering Attention for Efficient and Effective Transformer","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptable-text-matching-via-meta-weight","title":"Adaptable Text Matching via Meta-Weight Regulator","date":"2022-04-27","arxiv_id":"2204.12668","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-based-cross-modal-retrieval-with","title":"Uncertainty-based Cross-Modal Retrieval with Probabilistic Representations","date":"2022-04-20","arxiv_id":"2204.09268","repositories_listed":0,"syntology":null},{"url":null,"slug":"modality-balanced-embedding-for-video","title":"Modality-Balanced Embedding for Video Retrieval","date":"2022-04-18","arxiv_id":"2204.08182","repositories_listed":0,"syntology":null},{"url":null,"slug":"dt2i-dense-text-to-image-generation-from","title":"DT2I: Dense Text-to-Image Generation from Region Descriptions","date":"2022-04-05","arxiv_id":"2204.02035","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-search-history-for-improving","title":"Leveraging Search History for Improving Person-Job Fit","date":"2022-03-27","arxiv_id":"2203.14232","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-stream-hierarchical-similarity-reasoning","title":"Two-stream Hierarchical Similarity Reasoning for Image-text Matching","date":"2022-03-10","arxiv_id":"2203.05349","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-building-an-open-domain-dialogue","title":"Towards Building an Open-Domain Dialogue System Incorporated with Internet Memes","date":"2022-03-08","arxiv_id":"2203.03835","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-enhanced-short-text-matching-using","title":"Context Enhanced Short Text Matching using Clickthrough Data","date":"2022-03-03","arxiv_id":"2203.01849","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-embodied-symbolic-concept","title":"Dual Embodied-Symbolic Concept Representations for Deep Learning","date":"2022-03-01","arxiv_id":"2203.00600","repositories_listed":0,"syntology":null},{"url":null,"slug":"unpaired-referring-expression-grounding-via","title":"Unpaired Referring Expression Grounding via Bidirectional Cross-Modal Matching","date":"2022-01-18","arxiv_id":"2201.06686","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-the-role-of-positional-information-in","title":"Probing the Role of Positional Information in Vision-Language Models","date":"2022-01-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-multimodal-pre-training-and-prompt","title":"Unified Multimodal Pre-training and Prompt-based Tuning for Vision-Language Understanding and Generation","date":"2021-12-10","arxiv_id":"2112.05587","repositories_listed":0,"syntology":null},{"url":null,"slug":"virt-improving-representation-based-models","title":"VIRT: Improving Representation-based Models for Text Matching through Virtual Interaction","date":"2021-12-08","arxiv_id":"2112.04195","repositories_listed":0,"syntology":null},{"url":null,"slug":"embedding-arithmetic-for-text-driven-image","title":"Embedding Arithmetic of Multimodal Queries for Image Retrieval","date":"2021-12-06","arxiv_id":"2112.03162","repositories_listed":0,"syntology":null},{"url":null,"slug":"ufo-a-unified-transformer-for-vision-language","title":"UFO: A UniFied TransfOrmer for Vision-Language Representation Learning","date":"2021-11-19","arxiv_id":"2111.10023","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-than-just-attention-improving-cross","title":"More Than Just Attention: Improving Cross-Modal Attentions with Contrastive Constraints for Image-Text Matching","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-matching-from-different-perspectives","title":"Semantic Matching from Different Perspectives","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mural-multimodal-multitask-representations","title":"MURAL: Multimodal, Multitask Representations Across Languages","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"slam-a-unified-encoder-for-speech-and","title":"SLAM: A Unified Encoder for Speech and Language Modeling via Speech-Text Joint Pre-Training","date":"2021-10-20","arxiv_id":"2110.10329","repositories_listed":0,"syntology":null},{"url":null,"slug":"clip4caption-clip-for-video-caption","title":"CLIP4Caption: CLIP for Video Caption","date":"2021-10-13","arxiv_id":"2110.06615","repositories_listed":0,"syntology":null},{"url":null,"slug":"tag-toward-accurate-social-media-content","title":"TAG: Toward Accurate Social Media Content Tagging with a Concept Graph","date":"2021-10-13","arxiv_id":"2110.06892","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-an-image-worth-five-sentences-a-new-look","title":"Is An Image Worth Five Sentences? A New Look into Semantics for Image-Text Matching","date":"2021-10-06","arxiv_id":"2110.02623","repositories_listed":0,"syntology":null},{"url":null,"slug":"protagonists-tagger-in-literary-domain-new","title":"Protagonists' Tagger in Literary Domain -- New Datasets and a Method for Person Entity Linkage","date":"2021-10-04","arxiv_id":"2110.01349","repositories_listed":0,"syntology":null},{"url":null,"slug":"k-aid-enhancing-pre-trained-language-models","title":"K-AID: Enhancing Pre-trained Language Models with Domain Knowledge for Question Answering","date":"2021-09-22","arxiv_id":"2109.10547","repositories_listed":0,"syntology":null},{"url":"/paper/mural-multimodal-multitask-retrieval-across","slug":"mural-multimodal-multitask-retrieval-across","title":"MURAL: Multimodal, Multitask Retrieval Across Languages","date":"2021-09-10","arxiv_id":"2109.05125","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-the-understanding-of-deep-text","title":"Toward the Understanding of Deep Text Matching Models for Information Retrieval","date":"2021-08-16","arxiv_id":"2108.07081","repositories_listed":0,"syntology":null},{"url":null,"slug":"hashing-based-efficient-inference-for-image","title":"Hashing based Efficient Inference for Image-Text Matching","date":"2021-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-self-boosting-framework-for-automated","title":"A Self-Boosting Framework for Automated Radiographic Report Generation","date":"2021-06-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"step-wise-hierarchical-alignment-network-for","title":"Step-Wise Hierarchical Alignment Network for Image-Text Matching","date":"2021-06-11","arxiv_id":"2106.06509","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-emotional-comfort-framework-for-improving","title":"An Emotional Comfort Framework for Improving User Satisfaction in E-Commerce Customer Service Chatbots","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"tita-a-two-stage-interaction-and-topic-aware","title":"TITA: A Two-stage Interaction and Topic-Aware Text Matching Model","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-efficient-cross-modal-visual-textual","title":"Towards Efficient Cross-Modal Visual Textual Retrieval using Transformer-Encoder Deep Features","date":"2021-06-01","arxiv_id":"2106.00358","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-than-just-attention-learning-cross-modal","title":"More Than Just Attention: Improving Cross-Modal Attentions with Contrastive Constraints for Image-Text Matching","date":"2021-05-20","arxiv_id":"2105.09597","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-visual-semantic-embedding-methods","title":"Survey of Visual-Semantic Embedding Methods for Zero-Shot Image Retrieval","date":"2021-05-16","arxiv_id":"2105.07391","repositories_listed":0,"syntology":null},{"url":null,"slug":"vl-nms-breaking-proposal-bottlenecks-in-two","title":"VL-NMS: Breaking Proposal Bottlenecks in Two-Stage Visual-Language Matching","date":"2021-05-12","arxiv_id":"2105.05636","repositories_listed":0,"syntology":null}],"record_sha256":"dddf3de2a2d8609c30877e3d631c3a43f8cf570e7ad696fc2837597050163178","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}