{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-retrieval/papers/10","list_of":"/task/image-retrieval","task":"Image Retrieval","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":10,"pages_in_order":23,"rows_per_page":100,"rows":[901,1000],"of":2239,"counts":{"archive_papers_tagged":2239,"with_a_code_link":835,"where_syntology_ran_a_sample":218,"not_listed_spam_title":0,"listed":2239,"listed_where_code_ran":218,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":185,"every_run_a_failure_of_syntologys_instrument":33,"listed_with_a_run_with_no_instrument_failure":185,"listed_every_run_a_failure_of_syntologys_instrument":33,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-retrieval","prev":"/task/image-retrieval/papers/9","next":"/task/image-retrieval/papers/11","papers":[{"url":null,"slug":"imagerag-dynamic-image-retrieval-for","title":"ImageRAG: Dynamic Image Retrieval for Reference-Guided Image Generation","date":"2025-02-13","arxiv_id":"2502.09411","repositories_listed":0,"syntology":null},{"url":null,"slug":"captured-by-captions-on-memorization-and-its","title":"Captured by Captions: On Memorization and its Mitigation in CLIP Models","date":"2025-02-11","arxiv_id":"2502.07830","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-ghost-investigating-ranking-bias","title":"Generative Ghost: Investigating Ranking Bias Hidden in AI-Generated Videos","date":"2025-02-11","arxiv_id":"2502.07327","repositories_listed":0,"syntology":null},{"url":null,"slug":"pdv-prompt-directional-vectors-for-zero-shot","title":"PDV: Prompt Directional Vectors for Zero-shot Composed Image Retrieval","date":"2025-02-11","arxiv_id":"2502.07215","repositories_listed":0,"syntology":null},{"url":null,"slug":"astroloc-robust-space-to-ground-image","title":"AstroLoc: Robust Space to Ground Image Localizer","date":"2025-02-10","arxiv_id":"2502.07003","repositories_listed":0,"syntology":null},{"url":null,"slug":"uni-retrieval-a-multi-style-retrieval","title":"Uni-Retrieval: A Multi-Style Retrieval Framework for STEM's Education","date":"2025-02-09","arxiv_id":"2502.05863","repositories_listed":0,"syntology":null},{"url":null,"slug":"circuit-diagram-retrieval-based-on","title":"Circuit Diagram Retrieval Based on Hierarchical Circuit Graph Representation","date":"2025-02-05","arxiv_id":"2503.11658","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-aligned-image-models-improve-visual","title":"Human-Aligned Image Models Improve Visual Decoding from the Brain","date":"2025-02-05","arxiv_id":"2502.03081","repositories_listed":0,"syntology":null},{"url":null,"slug":"freestyle-sketch-in-the-loop-image","title":"Freestyle Sketch-in-the-Loop Image Segmentation","date":"2025-01-27","arxiv_id":"2501.16022","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-interactive-text-to-image-retrieval","title":"Zero-Shot Interactive Text-to-Image Retrieval via Diffusion-Augmented Representations","date":"2025-01-26","arxiv_id":"2501.15379","repositories_listed":0,"syntology":null},{"url":null,"slug":"triplet-synthesis-for-enhancing-composed","title":"Triplet Synthesis For Enhancing Composed Image Retrieval via Counterfactual Image Generation","date":"2025-01-22","arxiv_id":"2501.13968","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-resource-efficient-training-framework-for","title":"A Resource-Efficient Training Framework for Remote Sensing Text--Image Retrieval","date":"2025-01-18","arxiv_id":"2501.10638","repositories_listed":0,"syntology":null},{"url":"/paper/scot-self-supervised-contrastive-pretraining","slug":"scot-self-supervised-contrastive-pretraining","title":"SCOT: Self-Supervised Contrastive Pretraining For Zero-Shot Compositional Retrieval","date":"2025-01-12","arxiv_id":"2501.08347","repositories_listed":0,"syntology":null},{"url":null,"slug":"static-segmentation-by-tracking-a","title":"Static Segmentation by Tracking: A Frustratingly Label-Efficient Approach to Fine-Grained Segmentation","date":"2025-01-12","arxiv_id":"2501.06749","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-language-image-prior-into-eeg","title":"Integrating Language-Image Prior into EEG Decoding for Cross-Task Zero-Calibration RSVP-BCI","date":"2025-01-06","arxiv_id":"2501.02841","repositories_listed":0,"syntology":null},{"url":null,"slug":"icbir-sli-interpretable-content-based-image","title":"iCBIR-Sli: Interpretable Content-Based Image Retrieval with 2D Slice Embeddings","date":"2025-01-03","arxiv_id":"2501.01642","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-invariant-feature-learning-in-brain-mr","title":"Domain-invariant feature learning in brain MR imaging for content-based image retrieval","date":"2025-01-02","arxiv_id":"2501.01326","repositories_listed":0,"syntology":null},{"url":null,"slug":"ccin-compositional-conflict-identification","title":"CCIN: Compositional Conflict Identification and Neutralization for Composed Image Retrieval","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-zero-shot-composed-image-retrieval","title":"Generative Zero-Shot Composed Image Retrieval","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"horus-multimodal-large-language-models","title":"HORUS: Multimodal Large Language Models Framework for Video Retrieval at VBS 2025","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-with-noisy-triplet-correspondence","title":"Learning with Noisy Triplet Correspondence for Composed Image Retrieval","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"patch-matters-training-free-fine-grained","title":"Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"prompthash-affinity-prompted-collaborative-1","title":"PromptHash:Affinity-Prompted Collaborative Cross-Modal Learning for Adaptive Hashing Retrieval","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-natural-language-based-document-image","title":"Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"for-finetuning-for-object-level-open","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","date":"2024-12-25","arxiv_id":"2412.18806","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-method-to-capturing-compositional","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","date":"2024-12-20","arxiv_id":"2412.15632","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-visual-composition-through-improved","title":"Learning Visual Composition through Improved Semantic Guidance","date":"2024-12-19","arxiv_id":"2412.15396","repositories_listed":0,"syntology":null},{"url":null,"slug":"maybe-you-are-looking-for-croqs-cross-modal","title":"Maybe you are looking for CroQS: Cross-modal Query Suggestion for Text-to-Image Retrieval","date":"2024-12-18","arxiv_id":"2412.13834","repositories_listed":0,"syntology":null},{"url":null,"slug":"three-things-to-know-about-deep-metric","title":"Three Things to Know about Deep Metric Learning","date":"2024-12-17","arxiv_id":"2412.12432","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-large-vision-language-model-as","title":"Leveraging Large Vision-Language Model as User Intent-aware Encoder for Composed Image Retrieval","date":"2024-12-15","arxiv_id":"2412.11087","repositories_listed":0,"syntology":null},{"url":"/paper/mvc-vpr-mutual-learning-of-viewpoint","slug":"mvc-vpr-mutual-learning-of-viewpoint","title":"MVC-VPR: Mutual Learning of Viewpoint Classification and Visual Place Recognition","date":"2024-12-12","arxiv_id":"2412.09199","repositories_listed":0,"syntology":{"n":15,"n_ran":8,"n_constructed":0,"n_ran_checked":6,"n_instrument":2,"n_unverified":7,"n_honours":0,"n_violates":0,"n_no_contract":6,"n_pointer_only":15,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 2 where Syntology's instrument failed) · 7 unverified","sample_list":"/paper/mvc-vpr-mutual-learning-of-viewpoint#ran","syntology_url":"https://syntology.ai/paper/2412.09199","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2412.09199"}},"official":null}},{"url":null,"slug":"image-retrieval-methods-in-the-dissimilarity","title":"Image Retrieval Methods in the Dissimilarity Space","date":"2024-12-11","arxiv_id":"2412.08618","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-retrieval-with-intra-sweep","title":"Image Retrieval with Intra-Sweep Representation Learning for Neck Ultrasound Scanning Guidance","date":"2024-12-10","arxiv_id":"2412.07741","repositories_listed":0,"syntology":null},{"url":null,"slug":"daug-diffusion-based-channel-augmentation-for","title":"DAug: Diffusion-based Channel Augmentation for Radiology Image Retrieval and Classification","date":"2024-12-06","arxiv_id":"2412.04828","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuron-abandoning-attention-flow-visual","title":"Neuron Abandoning Attention Flow: Visual Explanation of Dynamics inside CNN Models","date":"2024-12-02","arxiv_id":"2412.01202","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-domain-specific-image-retrieval-a","title":"Optimizing Domain-Specific Image Retrieval: A Benchmark of FAISS and Annoy with Fine-Tuned Features","date":"2024-12-02","arxiv_id":"2412.01555","repositories_listed":0,"syntology":null},{"url":null,"slug":"needle-a-generative-ai-powered-monte-carlo","title":"Needle: A Generative AI-Powered Multi-modal Database for Answering Complex Natural Language Queries","date":"2024-12-01","arxiv_id":"2412.00639","repositories_listed":0,"syntology":null},{"url":null,"slug":"efsa-episodic-few-shot-adaptation-for-text-to","title":"EFSA: Episodic Few-Shot Adaptation for Text-to-Image Retrieval","date":"2024-11-28","arxiv_id":"2412.00139","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-visual-hierarchies-with-hyperbolic","title":"Learning Visual Hierarchies with Hyperbolic Embeddings","date":"2024-11-26","arxiv_id":"2411.17490","repositories_listed":0,"syntology":null},{"url":null,"slug":"anysynth-harnessing-the-power-of-image","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","date":"2024-11-24","arxiv_id":"2411.16749","repositories_listed":0,"syntology":null},{"url":"/paper/imagine-and-seek-improving-composed-image","slug":"imagine-and-seek-improving-composed-image","title":"Imagine and Seek: Improving Composed Image Retrieval with an Imagined Proxy","date":"2024-11-24","arxiv_id":"2411.16752","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-pre-aligned-method-with-global","title":"Cross-Modal Pre-Aligned Method with Global and Local Information for Remote-Sensing Image and Text Retrieval","date":"2024-11-22","arxiv_id":"2411.14704","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-pixels-to-prose-advancing-multi-modal","title":"From Pixels to Prose: Advancing Multi-Modal Language Models for Remote Sensing","date":"2024-11-05","arxiv_id":"2411.05826","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-contextual-uncertainty-of-visual","title":"Exploiting Contextual Uncertainty of Visual Data for Efficient Training of Deep Models","date":"2024-11-04","arxiv_id":"2411.01925","repositories_listed":0,"syntology":null},{"url":null,"slug":"tripletclip-improving-compositional-reasoning","title":"TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives","date":"2024-11-04","arxiv_id":"2411.02545","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-medical-image-retrieval-using","title":"Efficient Medical Image Retrieval Using DenseNet and FAISS for BIRADS Classification","date":"2024-11-03","arxiv_id":"2411.01473","repositories_listed":0,"syntology":null},{"url":null,"slug":"motadual-modality-task-dual-alignment-for","title":"MoTaDual: Modality-Task Dual Alignment for Enhanced Zero-shot Composed Image Retrieval","date":"2024-10-31","arxiv_id":"2410.23736","repositories_listed":0,"syntology":null},{"url":null,"slug":"denoise-i2w-mapping-images-to-denoising-words","title":"Denoise-I2W: Mapping Images to Denoising Words for Accurate Zero-Shot Composed Image Retrieval","date":"2024-10-22","arxiv_id":"2410.17393","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-sub-image-search-for-variable","title":"Accelerated Sub-Image Search For Variable-Size Patches Identification Based On Virtual Time Series Transformation And Segmentation","date":"2024-10-20","arxiv_id":"2410.15425","repositories_listed":0,"syntology":null},{"url":null,"slug":"development-of-image-collection-method-using","title":"Development of Image Collection Method Using YOLO and Siamese Network","date":"2024-10-16","arxiv_id":"2410.12561","repositories_listed":0,"syntology":null},{"url":null,"slug":"logs-visual-localization-via-gaussian","title":"LoGS: Visual Localization via Gaussian Splatting with Fewer Training Images","date":"2024-10-15","arxiv_id":"2410.11505","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-deep-semantic-expansion-framework","title":"A Unified Deep Semantic Expansion Framework for Domain-Generalized Person Re-identification","date":"2024-10-11","arxiv_id":"2410.08456","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-token-reweighting-for-interpretable","title":"Semantic Token Reweighting for Interpretable and Controllable Text Embeddings in CLIP","date":"2024-10-11","arxiv_id":"2410.08469","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-distribution-constraints-for","title":"Exploiting Distribution Constraints for Scalable and Efficient Image Retrieval","date":"2024-10-09","arxiv_id":"2410.07022","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-captioning-task-specific-prompting-for","title":"Beyond Captioning: Task-Specific Prompting for Improved VLM Performance in Mathematical Reasoning","date":"2024-10-08","arxiv_id":"2410.05928","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-image-caption-retrieval-competition","title":"Temporal Image Caption Retrieval Competition -- Description and Results","date":"2024-10-08","arxiv_id":"2410.06314","repositories_listed":0,"syntology":null},{"url":null,"slug":"lotlip-improving-language-image-pre-training","title":"LoTLIP: Improving Language-Image Pre-training for Long Text Understanding","date":"2024-10-07","arxiv_id":"2410.05249","repositories_listed":0,"syntology":null},{"url":null,"slug":"class-agnostic-visio-temporal-scene-sketch","title":"Class-Agnostic Visio-Temporal Scene Sketch Semantic Segmentation","date":"2024-09-30","arxiv_id":"2410.00266","repositories_listed":0,"syntology":null},{"url":null,"slug":"content-based-image-retrieval-using-cosfire","title":"Content-Based Image Retrieval Using COSFIRE Descriptors with application to Radio Astronomy","date":"2024-09-27","arxiv_id":"2410.08227","repositories_listed":0,"syntology":null},{"url":null,"slug":"cbidr-a-novel-method-for-information","title":"CBIDR: A novel method for information retrieval combining image and data by means of TOPSIS applied to medical diagnosis","date":"2024-09-26","arxiv_id":"2410.06180","repositories_listed":0,"syntology":null},{"url":null,"slug":"search-and-detect-training-free-long-tail","title":"Search and Detect: Training-Free Long Tail Object Detection via Web-Image Retrieval","date":"2024-09-26","arxiv_id":"2409.18733","repositories_listed":0,"syntology":null},{"url":null,"slug":"garment-attribute-manipulation-with-multi","title":"Garment Attribute Manipulation with Multi-level Attention","date":"2024-09-16","arxiv_id":"2409.10206","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-cross-font-image-retrieval-network-for","title":"A Cross-Font Image Retrieval Network for Recognizing Undeciphered Oracle Bone Inscriptions","date":"2024-09-10","arxiv_id":"2409.06381","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-world-dynamic-prompt-and-continual","title":"Open-World Dynamic Prompt and Continual Visual Representation Learning","date":"2024-09-09","arxiv_id":"2409.05312","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-whole-slide-image-retrieval-in","title":"Zero-Shot Whole Slide Image Retrieval in Histopathology Using Embeddings of Foundation Models","date":"2024-09-06","arxiv_id":"2409.04631","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-and-evaluation-of-camera-centric","title":"Design and Evaluation of Camera-Centric Mobile Crowdsourcing Applications","date":"2024-09-04","arxiv_id":"2409.03012","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-image-retrieval-techniques-data","title":"A Review of Image Retrieval Techniques: Data Augmentation and Adversarial Learning Approaches","date":"2024-09-02","arxiv_id":"2409.01219","repositories_listed":0,"syntology":null},{"url":null,"slug":"evidential-transformers-for-improved-image","title":"Evidential Transformers for Improved Image Retrieval","date":"2024-09-02","arxiv_id":"2409.01082","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-sparse-lexical-representations-for","title":"Rethinking Sparse Lexical Representations for Image Retrieval in the Age of Rising Multi-Modal Large Language Models","date":"2024-08-29","arxiv_id":"2408.16296","repositories_listed":0,"syntology":null},{"url":null,"slug":"snap-and-diagnose-an-advanced-multimodal","title":"Snap and Diagnose: An Advanced Multimodal Retrieval System for Identifying Plant Diseases in the Wild","date":"2024-08-27","arxiv_id":"2408.14723","repositories_listed":0,"syntology":null},{"url":null,"slug":"lowclip-adapting-the-clip-model-architecture","title":"LowCLIP: Adapting the CLIP Model Architecture for Low-Resource Languages in Multimodal Image Retrieval Task","date":"2024-08-25","arxiv_id":"2408.13909","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-localization-in-3d-maps-comparing","title":"Visual Localization in 3D Maps: Comparing Point Cloud, Mesh, and NeRF Representations","date":"2024-08-21","arxiv_id":"2408.11966","repositories_listed":0,"syntology":null},{"url":null,"slug":"brewclip-a-bifurcated-representation-learning","title":"BrewCLIP: A Bifurcated Representation Learning Framework for Audio-Visual Retrieval","date":"2024-08-19","arxiv_id":"2408.10383","repositories_listed":0,"syntology":null},{"url":null,"slug":"fashion-image-to-image-translation-for","title":"Fashion Image-to-Image Translation for Complementary Item Retrieval","date":"2024-08-19","arxiv_id":"2408.09847","repositories_listed":0,"syntology":null},{"url":null,"slug":"coarse-to-fine-alignment-makes-better-speech","title":"Coarse-to-fine Alignment Makes Better Speech-image Retrieval","date":"2024-08-15","arxiv_id":"2408.13119","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-denoising-a-novel-training","title":"Cross-Modal Denoising: A Novel Training Paradigm for Enhancing Speech-Image Retrieval","date":"2024-08-15","arxiv_id":"2408.13705","repositories_listed":0,"syntology":null},{"url":null,"slug":"dm2rm-dual-mode-multimodal-ranking-for-target","title":"DM2RM: Dual-Mode Multimodal Ranking for Target Objects and Receptacles Based on Open-Vocabulary Instructions","date":"2024-08-15","arxiv_id":"2408.07910","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01570","title":"On Validation of Search & Retrieval of Tissue Images in Digital Pathology","date":"2024-08-02","arxiv_id":"2408.01570","repositories_listed":0,"syntology":null},{"url":null,"slug":"revolutionizing-text-to-image-retrieval-as","title":"Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation","date":"2024-07-24","arxiv_id":"2407.17274","repositories_listed":0,"syntology":null},{"url":null,"slug":"endofinder-online-image-retrieval-for","title":"EndoFinder: Online Image Retrieval for Explainable Colorectal Polyp Diagnosis","date":"2024-07-16","arxiv_id":"2407.11401","repositories_listed":0,"syntology":null},{"url":null,"slug":"addressing-image-hallucination-in-text-to","title":"Addressing Image Hallucination in Text-to-Image Generation through Factual Image Retrieval","date":"2024-07-15","arxiv_id":"2407.10683","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-experimental-evaluation-of-siamese-neural","title":"An experimental evaluation of Siamese Neural Networks for robot localization using omnidirectional imaging in indoor environments","date":"2024-07-15","arxiv_id":"2407.10536","repositories_listed":0,"syntology":null},{"url":null,"slug":"ceia-clip-based-event-image-alignment-for","title":"CEIA: CLIP-Based Event-Image Alignment for Open-World Event-Based Understanding","date":"2024-07-09","arxiv_id":"2407.06611","repositories_listed":0,"syntology":null},{"url":null,"slug":"hycir-boosting-zero-shot-composed-image","title":"HyCIR: Boosting Zero-Shot Composed Image Retrieval with Synthetic Labels","date":"2024-07-08","arxiv_id":"2407.05795","repositories_listed":0,"syntology":null},{"url":null,"slug":"pseudo-triplet-guided-few-shot-composed-image","title":"Pseudo-triplet Guided Few-shot Composed Image Retrieval","date":"2024-07-08","arxiv_id":"2407.06001","repositories_listed":0,"syntology":null},{"url":null,"slug":"celeb-fbi-a-benchmark-dataset-on-human-full","title":"Celeb-FBI: A Benchmark Dataset on Human Full Body Images and Age, Gender, Height and Weight Estimation using Deep Learning Approach","date":"2024-07-03","arxiv_id":"2407.03486","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-attention-alignment-network-with","title":"Cross-Modal Attention Alignment Network with Auxiliary Text Description for zero-shot sketch-based image retrieval","date":"2024-07-01","arxiv_id":"2407.00979","repositories_listed":0,"syntology":null},{"url":null,"slug":"freeview-sketching-view-aware-fine-grained","title":"Freeview Sketching: View-Aware Fine-Grained Sketch-Based Image Retrieval","date":"2024-07-01","arxiv_id":"2407.01810","repositories_listed":0,"syntology":null},{"url":null,"slug":"pathalign-a-vision-language-model-for-whole","title":"PathAlign: A vision-language model for whole slide images in histopathology","date":"2024-06-27","arxiv_id":"2406.19578","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-composed-image-retrieval","title":"Zero-shot Composed Image Retrieval Considering Query-target Relationship Leveraging Masked Image-text Pairs","date":"2024-06-27","arxiv_id":"2406.18836","repositories_listed":0,"syntology":null},{"url":null,"slug":"accurate-and-fast-pixel-retrieval-with","title":"Accurate and Fast Pixel Retrieval with Spatial and Uncertainty Aware Hypergraph Diffusion","date":"2024-06-17","arxiv_id":"2406.11242","repositories_listed":0,"syntology":null},{"url":null,"slug":"they-re-all-doctors-synthesizing-diverse","title":"They're All Doctors: Synthesizing Diverse Counterfactuals to Mitigate Associative Bias","date":"2024-06-17","arxiv_id":"2406.11331","repositories_listed":0,"syntology":null},{"url":null,"slug":"annotation-cost-efficient-active-learning-for-1","title":"Annotation Cost-Efficient Active Learning for Deep Metric Learning Driven Remote Sensing Image Retrieval","date":"2024-06-14","arxiv_id":"2406.10107","repositories_listed":0,"syntology":null},{"url":null,"slug":"fakeinversion-learning-to-detect-images-from-1","title":"FakeInversion: Learning to Detect Images from Unseen Text-to-Image Models by Inverting Stable Diffusion","date":"2024-06-12","arxiv_id":"2406.08603","repositories_listed":0,"syntology":null},{"url":null,"slug":"fetch-a-set-a-large-scale-ocr-free-benchmark","title":"Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval","date":"2024-06-11","arxiv_id":"2406.07315","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-text-to-image-generation-and","title":"TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models","date":"2024-06-09","arxiv_id":"2406.05814","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-clip-help-clip-in-learning-3d","title":"No Captions, No Problem: Captionless 3D-CLIP Alignment with Hard Negatives via CLIP Knowledge and LLMs","date":"2024-06-04","arxiv_id":"2406.02202","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextblip-doubly-contextual-alignment-for","title":"ContextBLIP: Doubly Contextual Alignment for Contrastive Image Retrieval from Linguistically Complex Descriptions","date":"2024-05-29","arxiv_id":"2405.19226","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-generative-embedding-model","title":"Multi-Modal Generative Embedding Model","date":"2024-05-29","arxiv_id":"2405.19333","repositories_listed":0,"syntology":null},{"url":null,"slug":"sketchtriplet-self-supervised-scenarized","title":"SketchTriplet: Self-Supervised Scenarized Sketch-Text-Image Triplet Generation","date":"2024-05-29","arxiv_id":"2405.18801","repositories_listed":0,"syntology":null}],"record_sha256":"bd3f91c5c11b9c84c3278b2d2c65ed203a75c83ae9a885441d78e78f1c9c7c29","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}