{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/text-retrieval/papers/4","list_of":"/task/text-retrieval","task":"Text Retrieval","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":4,"pages_in_order":7,"rows_per_page":100,"rows":[301,400],"of":671,"counts":{"archive_papers_tagged":671,"with_a_code_link":335,"where_syntology_ran_a_sample":117,"not_listed_spam_title":0,"listed":671,"listed_where_code_ran":117,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":99,"every_run_a_failure_of_syntologys_instrument":18,"listed_with_a_run_with_no_instrument_failure":99,"listed_every_run_a_failure_of_syntologys_instrument":18,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/text-retrieval","prev":"/task/text-retrieval/papers/3","next":"/task/text-retrieval/papers/5","papers":[{"url":"/paper/clip2video-mastering-video-text-retrieval-via","slug":"clip2video-mastering-video-text-retrieval-via","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","date":"2021-06-21","arxiv_id":"2106.11097","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"0 ran · 1 unverified","sample_list":"/paper/clip2video-mastering-video-text-retrieval-via#ran","syntology_url":"https://syntology.ai/paper/2106.11097","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2106.11097"}},"official":{"repos":["CryhanFang/CLIP2Video"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/cosmo-content-style-modulation-for-image","slug":"cosmo-content-style-modulation-for-image","title":"CoSMo: Content-Style Modulation for Image Retrieval With Text Feedback","date":"2021-06-19","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/a-deep-local-and-global-scene-graph-matching","slug":"a-deep-local-and-global-scene-graph-matching","title":"A Deep Local and Global Scene-Graph Matching for Image-Text Retrieval","date":"2021-06-04","arxiv_id":"2106.02400","repositories_listed":1,"syntology":null},{"url":"/paper/learning-relation-alignment-for-calibrated","slug":"learning-relation-alignment-for-calibrated","title":"Learning Relation Alignment for Calibrated Cross-modal Retrieval","date":"2021-05-28","arxiv_id":"2105.13868","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/learning-relation-alignment-for-calibrated#ran","syntology_url":"https://syntology.ai/paper/2105.13868","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2105.13868"}},"official":{"repos":["lancopku/IAIS"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/is-your-language-model-ready-for-dense","slug":"is-your-language-model-ready-for-dense","title":"Condenser: a Pre-training Architecture for Dense Retrieval","date":"2021-04-16","arxiv_id":"2104.08253","repositories_listed":1,"syntology":{"n":3,"n_ran":2,"n_constructed":2,"n_ran_checked":2,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 2 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified; every one of the 2 samples that ran constructed an object rather than computing a result","sample_list":"/paper/is-your-language-model-ready-for-dense#ran","syntology_url":"https://syntology.ai/paper/2104.08253","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2104.08253"}},"official":{"repos":["luyug/Condenser"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":2,"n_ran_no_instrument_failure":2,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/understanding-hard-negatives-in-noise","slug":"understanding-hard-negatives-in-noise","title":"Understanding Hard Negatives in Noise Contrastive Estimation","date":"2021-04-13","arxiv_id":"2104.06245","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":0,"n_instrument":2,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/understanding-hard-negatives-in-noise#ran","syntology_url":"https://syntology.ai/paper/2104.06245","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2104.06245"}},"official":{"repos":["WenzhengZhang/hard-nce-el"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/a-replication-study-of-dense-passage","slug":"a-replication-study-of-dense-passage","title":"A Replication Study of Dense Passage Retriever","date":"2021-04-12","arxiv_id":"2104.05740","repositories_listed":1,"syntology":null},{"url":"/paper/scene-text-retrieval-via-joint-text-detection","slug":"scene-text-retrieval-via-joint-text-detection","title":"Scene Text Retrieval via Joint Text Detection and Similarity Learning","date":"2021-04-04","arxiv_id":"2104.01552","repositories_listed":1,"syntology":null},{"url":"/paper/kaleido-bert-vision-language-pre-training-on","slug":"kaleido-bert-vision-language-pre-training-on","title":"Kaleido-BERT: Vision-Language Pre-training on Fashion Domain","date":"2021-03-30","arxiv_id":"2103.16110","repositories_listed":1,"syntology":{"n":5,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":2,"n_honours":2,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 2 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/kaleido-bert-vision-language-pre-training-on#ran","syntology_url":"https://syntology.ai/paper/2103.16110","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2103.16110"}},"official":{"repos":["mczhuge/Kaleido-BERT"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/bridging-vision-and-language-from-the-video","slug":"bridging-vision-and-language-from-the-video","title":"A Comprehensive Review of the Video-to-Text Problem","date":"2021-03-27","arxiv_id":"2103.14785","repositories_listed":1,"syntology":null},{"url":"/paper/vlgrammar-grounded-grammar-induction-of","slug":"vlgrammar-grounded-grammar-induction-of","title":"VLGrammar: Grounded Grammar Induction of Vision and Language","date":"2021-03-24","arxiv_id":"2103.12975","repositories_listed":1,"syntology":null},{"url":"/paper/rudder-a-cross-lingual-video-and-text","slug":"rudder-a-cross-lingual-video-and-text","title":"Rudder: A Cross Lingual Video and Text Retrieval Dataset","date":"2021-03-09","arxiv_id":"2103.05457","repositories_listed":1,"syntology":null},{"url":"/paper/a-data-centric-framework-for-composable-nlp","slug":"a-data-centric-framework-for-composable-nlp","title":"A Data-Centric Framework for Composable NLP Workflows","date":"2021-03-02","arxiv_id":"2103.01834","repositories_listed":1,"syntology":null},{"url":"/paper/retrieval-augmentation-to-improve-robustness","slug":"retrieval-augmentation-to-improve-robustness","title":"Retrieval Augmentation for Deep Neural Networks","date":"2021-02-25","arxiv_id":"2102.13030","repositories_listed":1,"syntology":null},{"url":"/paper/it-takes-two-to-tango-combining-visual-and","slug":"it-takes-two-to-tango-combining-visual-and","title":"It Takes Two to Tango: Combining Visual and Textual Information for Detecting Duplicate Video-Based Bug Reports","date":"2021-01-22","arxiv_id":"2101.09194","repositories_listed":1,"syntology":null},{"url":"/paper/rethink-training-of-bert-rerankers-in-multi","slug":"rethink-training-of-bert-rerankers-in-multi","title":"Rethink Training of BERT Rerankers in Multi-Stage Retrieval Pipeline","date":"2021-01-21","arxiv_id":"2101.08751","repositories_listed":1,"syntology":null},{"url":"/paper/learning-the-best-pooling-strategy-for-visual","slug":"learning-the-best-pooling-strategy-for-visual","title":"Learning the Best Pooling Strategy for Visual Semantic Embedding","date":"2020-11-09","arxiv_id":"2011.04305","repositories_listed":1,"syntology":null},{"url":"/paper/a-comparison-of-pre-trained-vision-and","slug":"a-comparison-of-pre-trained-vision-and","title":"A Comparison of Pre-trained Vision-and-Language Models for Multimodal Representation Learning across Medical Images and Reports","date":"2020-09-03","arxiv_id":"2009.01523","repositories_listed":1,"syntology":null},{"url":"/paper/consensus-aware-visual-semantic-embedding-for","slug":"consensus-aware-visual-semantic-embedding-for","title":"Consensus-Aware Visual-Semantic Embedding for Image-Text Matching","date":"2020-07-17","arxiv_id":"2007.08883","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"0 ran · 1 unverified","sample_list":"/paper/consensus-aware-visual-semantic-embedding-for#ran","syntology_url":"https://syntology.ai/paper/2007.08883","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2007.08883"}},"official":{"repos":["BruceW91/CVSE"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/graph-optimal-transport-for-cross-domain","slug":"graph-optimal-transport-for-cross-domain","title":"Graph Optimal Transport for Cross-Domain Alignment","date":"2020-06-26","arxiv_id":"2006.14744","repositories_listed":1,"syntology":{"n":10,"n_ran":9,"n_constructed":0,"n_ran_checked":9,"n_instrument":0,"n_unverified":1,"n_honours":1,"n_violates":2,"n_no_contract":6,"n_pointer_only":3,"phrase":"9 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 1 honoured, 2 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/graph-optimal-transport-for-cross-domain#ran","syntology_url":"https://syntology.ai/paper/2006.14744","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2006.14744"}},"official":{"repos":["LiqunChen0606/Graph-Optimal-Transport"],"state":"official (archive's flag): 9 ran","n_ran":9,"n_constructed":0,"n_ran_no_instrument_failure":9,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/sparse-dense-and-attentional-representations","slug":"sparse-dense-and-attentional-representations","title":"Sparse, Dense, and Attentional Representations for Text Retrieval","date":"2020-05-01","arxiv_id":"2005.00181","repositories_listed":1,"syntology":null},{"url":"/paper/pixel-bert-aligning-image-pixels-with-text-by","slug":"pixel-bert-aligning-image-pixels-with-text-by","title":"Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers","date":"2020-04-02","arxiv_id":"2004.00849","repositories_listed":1,"syntology":null},{"url":"/paper/imram-iterative-matching-with-recurrent","slug":"imram-iterative-matching-with-recurrent","title":"IMRAM: Iterative Matching with Recurrent Attention Memory for Cross-Modal Image-Text Retrieval","date":"2020-03-08","arxiv_id":"2003.03772","repositories_listed":1,"syntology":{"n":3,"n_ran":2,"n_constructed":0,"n_ran_checked":0,"n_instrument":2,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":3,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/imram-iterative-matching-with-recurrent#ran","syntology_url":"https://syntology.ai/paper/2003.03772","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2003.03772"}},"official":{"repos":["HuiChen24/IMRAM"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/mhsan-multi-head-self-attention-network-for","slug":"mhsan-multi-head-self-attention-network-for","title":"MHSAN: Multi-Head Self-Attention Network for Visual Semantic Embedding","date":"2020-01-11","arxiv_id":"2001.03712","repositories_listed":1,"syntology":null},{"url":"/paper/corpus-level-end-to-end-exploration-for","slug":"corpus-level-end-to-end-exploration-for","title":"Corpus-Level End-to-End Exploration for Interactive Systems","date":"2019-11-23","arxiv_id":"1912.00753","repositories_listed":1,"syntology":null},{"url":"/paper/a-binary-variational-autoencoder-for-hashing","slug":"a-binary-variational-autoencoder-for-hashing","title":"A Binary Variational Autoencoder for Hashing","date":"2019-10-22","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/cross-modal-scene-graph-matching-for","slug":"cross-modal-scene-graph-matching-for","title":"Cross-modal Scene Graph Matching for Relationship-aware Image-Text Retrieval","date":"2019-10-11","arxiv_id":"1910.05134","repositories_listed":1,"syntology":{"n":3,"n_ran":2,"n_constructed":0,"n_ran_checked":1,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":3,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/cross-modal-scene-graph-matching-for#ran","syntology_url":"https://syntology.ai/paper/1910.05134","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1910.05134"}},"official":null}},{"url":"/paper/aligning-multilingual-word-embeddings-for","slug":"aligning-multilingual-word-embeddings-for","title":"Aligning Multilingual Word Embeddings for Cross-Modal Retrieval Task","date":"2019-10-08","arxiv_id":"1910.03291","repositories_listed":1,"syntology":null},{"url":"/paper/modelling-stopping-criteria-for-search","slug":"modelling-stopping-criteria-for-search","title":"Modelling Stopping Criteria for Search Results using Poisson Processes","date":"2019-09-13","arxiv_id":"1909.06239","repositories_listed":1,"syntology":null},{"url":"/paper/xqa-a-cross-lingual-open-domain-question","slug":"xqa-a-cross-lingual-open-domain-question","title":"XQA: A Cross-lingual Open-domain Question Answering Dataset","date":"2019-07-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/polysemous-visual-semantic-embedding-for-1","slug":"polysemous-visual-semantic-embedding-for-1","title":"Polysemous Visual-Semantic Embedding for Cross-Modal Retrieval","date":"2019-06-11","arxiv_id":"1906.04402","repositories_listed":1,"syntology":{"n":12,"n_ran":12,"n_constructed":0,"n_ran_checked":12,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":12,"n_pointer_only":0,"phrase":"12 ran (of which 0 constructed an object rather than computing a result; 12 with no instrument failure: 0 honoured, 0 violated, 12 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/polysemous-visual-semantic-embedding-for-1#ran","syntology_url":"https://syntology.ai/paper/1906.04402","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1906.04402"}},"official":null}},{"url":"/paper/a-hybrid-retrieval-generation-neural","slug":"a-hybrid-retrieval-generation-neural","title":"A Hybrid Retrieval-Generation Neural Conversation Model","date":"2019-04-19","arxiv_id":"1904.09068","repositories_listed":1,"syntology":null},{"url":"/paper/deeptilebars-visualizing-term-distribution","slug":"deeptilebars-visualizing-term-distribution","title":"DeepTileBars: Visualizing Term Distribution for Neural Information Retrieval","date":"2018-11-01","arxiv_id":"1811.00606","repositories_listed":1,"syntology":null},{"url":"/paper/learning-joint-embedding-with-multimodal-cues","slug":"learning-joint-embedding-with-multimodal-cues","title":"Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text Retrieval","date":"2018-06-11","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/meta-a-unified-toolkit-for-text-retrieval-and","slug":"meta-a-unified-toolkit-for-text-retrieval-and","title":"MeTA: A Unified Toolkit for Text Retrieval and Analysis","date":"2016-08-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":null,"slug":"maximal-matching-matters-preventing","title":"Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal Retrieval","date":"2025-06-26","arxiv_id":"2506.21538","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-medical-visual-representation","title":"Improving Medical Visual Representation Learning with Pathological-level Cross-Modal Alignment and Correlation Exploration","date":"2025-06-12","arxiv_id":"2506.10573","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-cropped-regions-new-benchmark-and","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","date":"2025-06-05","arxiv_id":"2506.04999","repositories_listed":0,"syntology":null},{"url":null,"slug":"mllm-guided-vlm-fine-tuning-with-joint","title":"MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval","date":"2025-05-26","arxiv_id":"2505.19707","repositories_listed":0,"syntology":null},{"url":null,"slug":"distill-clip-dclip-enhancing-image-text","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","date":"2025-05-25","arxiv_id":"2505.21549","repositories_listed":0,"syntology":null},{"url":null,"slug":"evdclip-improving-vision-language-retrieval","title":"EvdCLIP: Improving Vision-Language Retrieval with Entity Visual Descriptions from Large Language Models","date":"2025-05-24","arxiv_id":"2505.18594","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-discrepancy-bridging-method","title":"Representation Discrepancy Bridging Method for Remote Sensing Image-Text Retrieval","date":"2025-05-22","arxiv_id":"2505.16756","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-language-barriers-or-reinforcing","title":"Breaking Language Barriers or Reinforcing Bias? A Study of Gender and Racial Disparities in Multilingual Contrastive Vision Language Models","date":"2025-05-20","arxiv_id":"2505.14160","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-10921","title":"Towards Cross-modal Retrieval in Chinese Cultural Heritage Documents: Dataset and Solution","date":"2025-05-16","arxiv_id":"2505.10921","repositories_listed":0,"syntology":null},{"url":null,"slug":"qbd-rankeddatagen-generating-custom-ranked","title":"QBD-RankedDataGen: Generating Custom Ranked Datasets for Improving Query-By-Document Search Using LLM-Reranking with Reduced Human Effort","date":"2025-05-07","arxiv_id":"2505.04732","repositories_listed":0,"syntology":null},{"url":null,"slug":"agate-stealthy-black-box-watermarking-for","title":"AGATE: Stealthy Black-box Watermarking for Multimodal Model Copyright Protection","date":"2025-04-28","arxiv_id":"2504.21044","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-the-modality-barrier-universal","title":"Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs","date":"2025-04-24","arxiv_id":"2504.17432","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-understanding-camera-motions-in-any","title":"Towards Understanding Camera Motions in Any Video","date":"2025-04-21","arxiv_id":"2504.15376","repositories_listed":0,"syntology":null},{"url":null,"slug":"semcore-a-semantic-enhanced-generative-cross","title":"SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs","date":"2025-04-17","arxiv_id":"2504.13172","repositories_listed":0,"syntology":null},{"url":null,"slug":"dart-disease-aware-image-text-alignment-and","title":"DART: Disease-aware Image-Text Alignment and Self-correcting Re-alignment for Trustworthy Radiology Report Generation","date":"2025-04-16","arxiv_id":"2504.11786","repositories_listed":0,"syntology":null},{"url":null,"slug":"focallens-instruction-tuning-enables-zero","title":"FocalLens: Instruction Tuning Enables Zero-Shot Conditional Image Representations","date":"2025-04-11","arxiv_id":"2504.08368","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-queries-and-tables-through-entities","title":"Bridging Queries and Tables through Entities in Table Retrieval","date":"2025-04-09","arxiv_id":"2504.06551","repositories_listed":0,"syntology":null},{"url":null,"slug":"lv-mae-learning-long-video-representations","title":"LV-MAE: Learning Long Video Representations through Masked-Embedding Autoencoders","date":"2025-04-04","arxiv_id":"2504.03501","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-audio-guided-video-representation","title":"Learning Audio-guided Video Representation with Gated Attention for Video-Text Retrieval","date":"2025-04-03","arxiv_id":"2504.02397","repositories_listed":0,"syntology":null},{"url":null,"slug":"selip-similarity-enhanced-contrastive","title":"SeLIP: Similarity Enhanced Contrastive Language Image Pretraining for Multi-modal Head MRI","date":"2025-03-25","arxiv_id":"2503.19801","repositories_listed":0,"syntology":null},{"url":null,"slug":"anatomy-aware-conditional-image-text","title":"Anatomy-Aware Conditional Image-Text Retrieval","date":"2025-03-10","arxiv_id":"2503.07456","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-classical-and-quantum-string","title":"Bridging Classical and Quantum String Matching: A Computational Reformulation of Bit-Parallelism","date":"2025-03-07","arxiv_id":"2503.05596","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-aware-loss-scheduling-for-multimodal","title":"Variance-Aware Loss Scheduling for Multimodal Alignment in Low-Data Settings","date":"2025-03-05","arxiv_id":"2503.03202","repositories_listed":0,"syntology":null},{"url":null,"slug":"llave-large-language-and-vision-embedding","title":"LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning","date":"2025-03-04","arxiv_id":"2503.04812","repositories_listed":0,"syntology":null},{"url":null,"slug":"tailoring-table-retrieval-from-a-field-aware","title":"Tailoring Table Retrieval from a Field-aware Hybrid Matching Perspective","date":"2025-03-04","arxiv_id":"2503.02251","repositories_listed":0,"syntology":null},{"url":null,"slug":"v-2-dial-unification-of-video-and-visual","title":"V$^2$Dial: Unification of Video and Visual Dialog via Multimodal Experts","date":"2025-03-03","arxiv_id":"2503.02063","repositories_listed":0,"syntology":null},{"url":null,"slug":"2503-01019","title":"MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations","date":"2025-03-02","arxiv_id":"2503.01019","repositories_listed":0,"syntology":null},{"url":null,"slug":"abc-achieving-better-control-of-multimodal","title":"ABC: Achieving Better Control of Multimodal Embeddings using VLMs","date":"2025-03-01","arxiv_id":"2503.00329","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-vital-is-the-jurisprudential-relevance","title":"How Vital is the Jurisprudential Relevance: Law Article Intervened Legal Case Retrieval and Matching","date":"2025-02-25","arxiv_id":"2502.18292","repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-local-alignment-for-medical","title":"Progressive Local Alignment for Medical Multimodal Pre-training","date":"2025-02-25","arxiv_id":"2502.18047","repositories_listed":0,"syntology":null},{"url":null,"slug":"med-gte-hybrid-a-contextual-embedding","title":"Med-gte-hybrid: A contextual embedding transformer model for extracting actionable information from clinical texts","date":"2025-02-21","arxiv_id":"2502.15996","repositories_listed":0,"syntology":null},{"url":null,"slug":"lstm-based-selective-dense-text-retrieval","title":"LSTM-based Selective Dense Text Retrieval Guided by Sparse Lexical Retrieval","date":"2025-02-15","arxiv_id":"2502.10639","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-multimodal-transformers-on-edge-a","title":"Fine-tuning Multimodal Transformers on Edge: A Parallel Split Learning Approach","date":"2025-02-10","arxiv_id":"2502.06355","repositories_listed":0,"syntology":null},{"url":null,"slug":"dcformer-efficient-3d-vision-language","title":"DCFormer: Efficient 3D Vision-Language Modeling with Decomposed Convolutions","date":"2025-02-07","arxiv_id":"2502.05091","repositories_listed":0,"syntology":null},{"url":null,"slug":"scientometric-analysis-of-the-german-ir","title":"Scientometric Analysis of the German IR Community within TREC & CLEF","date":"2025-02-05","arxiv_id":"2502.03065","repositories_listed":0,"syntology":null},{"url":null,"slug":"mass-overcoming-language-bias-in-image-text","title":"MASS: Overcoming Language Bias in Image-Text Matching","date":"2025-01-20","arxiv_id":"2501.11469","repositories_listed":0,"syntology":null},{"url":null,"slug":"tsvc-tripartite-learning-with-semantic","title":"TSVC:Tripartite Learning with Semantic Variation Consistency for Robust Image-Text Retrieval","date":"2025-01-19","arxiv_id":"2501.10935","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-myopia-to-holism-fully-contrastive","title":"Advancing Myopia To Holism: Fully Contrastive Language-Image Pre-training","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"clip-is-almost-all-you-need-towards-parameter","title":"CLIP is Almost All You Need: Towards Parameter-Efficient Scene Text Retrieval without OCR","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"retaining-knowledge-and-enhancing-long-text","title":"Retaining Knowledge and Enhancing Long-Text Representations in CLIP through Dual-Teacher Distillation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-noisy-video-text-retrieval-via","title":"Rethinking Noisy Video-Text Retrieval via Relation-aware Alignment","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"v-2dial-unification-of-video-and-visual","title":"V^2Dial: Unification of Video and Visual Dialog via Multimodal Experts","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-video-text-retrieval-a-new","title":"CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval","date":"2024-12-31","arxiv_id":"2501.00513","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-text-classification-pipeline-starting","title":"The Text Classification Pipeline: Starting Shallow going Deeper","date":"2024-12-30","arxiv_id":"2501.00174","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-head-attention-driven-dynamic-visual","title":"Multi-Head Attention Driven Dynamic Visual-Semantic Embedding for Enhanced Image-Text Matching","date":"2024-12-26","arxiv_id":"2412.19184","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-multi-stage-language-models-for","title":"Optimizing Multi-Stage Language Models for Effective Text Retrieval","date":"2024-12-26","arxiv_id":"2412.19265","repositories_listed":0,"syntology":null},{"url":null,"slug":"polysmart-trecvid-2024-medical-video-question","title":"PolySmart @ TRECVid 2024 Medical Video Question Answering","date":"2024-12-20","arxiv_id":"2412.15514","repositories_listed":0,"syntology":null},{"url":null,"slug":"sketch-structured-knowledge-enhanced-text","title":"SKETCH: Structured Knowledge Enhanced Text Comprehension for Holistic Retrieval","date":"2024-12-19","arxiv_id":"2412.15443","repositories_listed":0,"syntology":null},{"url":null,"slug":"establishing-a-foundation-for-tetun-text-ad","title":"Establishing a Foundation for Tetun Ad-Hoc Text Retrieval: Stemming, Indexing, Retrieval, and Ranking","date":"2024-12-16","arxiv_id":"2412.11758","repositories_listed":0,"syntology":null},{"url":null,"slug":"barking-up-the-syntactic-tree-enhancing-vlm","title":"Barking Up The Syntactic Tree: Enhancing VLM Training with Syntactic Losses","date":"2024-12-11","arxiv_id":"2412.08110","repositories_listed":0,"syntology":null},{"url":null,"slug":"jina-clip-v2-multilingual-multimodal","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","date":"2024-12-11","arxiv_id":"2412.08802","repositories_listed":0,"syntology":null},{"url":null,"slug":"explaining-and-mitigating-the-modality-gap-in","title":"Explaining and Mitigating the Modality Gap in Contrastive Multimodal Learning","date":"2024-12-10","arxiv_id":"2412.07909","repositories_listed":0,"syntology":null},{"url":null,"slug":"discriminative-fine-tuning-of-lvlms","title":"VladVA: Discriminative Fine-tuning of LVLMs","date":"2024-12-05","arxiv_id":"2412.04378","repositories_listed":0,"syntology":null},{"url":null,"slug":"linq-embed-mistral-technical-report","title":"Linq-Embed-Mistral Technical Report","date":"2024-12-04","arxiv_id":"2412.03223","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-two-phase-finetuning-llms-for","title":"Adaptive Two-Phase Finetuning LLMs for Japanese Legal Text Retrieval","date":"2024-12-03","arxiv_id":"2412.13205","repositories_listed":0,"syntology":null},{"url":null,"slug":"dir-retrieval-augmented-image-captioning-with","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","date":"2024-12-02","arxiv_id":"2412.01115","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-fiber-product-a-preliminary","title":"Approximate Fiber Product: A Preliminary Algebraic-Geometric Perspective on Multimodal Embedding Alignment","date":"2024-11-30","arxiv_id":"2412.00373","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-transfer-across-modalities-with","title":"Knowledge Transfer Across Modalities with Natural Language Supervision","date":"2024-11-23","arxiv_id":"2411.15611","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-pre-aligned-method-with-global","title":"Cross-Modal Pre-Aligned Method with Global and Local Information for Remote-Sensing Image and Text Retrieval","date":"2024-11-22","arxiv_id":"2411.14704","repositories_listed":0,"syntology":null},{"url":null,"slug":"uni-mlip-unified-self-supervision-for-medical","title":"Uni-Mlip: Unified Self-supervision for Medical Vision Language Pre-training","date":"2024-11-20","arxiv_id":"2411.15207","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-study-of-text-retrieval-models","title":"A Comparative Study of Text Retrieval Models on DaReCzech","date":"2024-11-19","arxiv_id":"2411.12921","repositories_listed":0,"syntology":null},{"url":null,"slug":"boolquestions-does-dense-retrieval-understand","title":"BoolQuestions: Does Dense Retrieval Understand Boolean Logic in Language?","date":"2024-11-19","arxiv_id":"2411.12235","repositories_listed":0,"syntology":null},{"url":null,"slug":"codexembed-a-generalist-embedding-model","title":"CodeXEmbed: A Generalist Embedding Model Family for Multiligual and Multi-task Code Retrieval","date":"2024-11-19","arxiv_id":"2411.12644","repositories_listed":0,"syntology":null},{"url":null,"slug":"mm-embed-universal-multimodal-retrieval-with","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","date":"2024-11-04","arxiv_id":"2411.02571","repositories_listed":0,"syntology":null},{"url":null,"slug":"spectrum-semantic-processing-and-emotion","title":"SPECTRUM: Semantic Processing and Emotion-informed video-Captioning Through Retrieval and Understanding Modalities","date":"2024-11-04","arxiv_id":"2411.01975","repositories_listed":0,"syntology":null}],"record_sha256":"777c3e8b1a0c2ace88d0921dc4cdb49a7e9ef1efeed36d8a4d6ec9a8fbe32cf8","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}