Browse State-of-the-Art › Image to text › Papers, page 2
Image to text
Papers archive 2025-07-28
archive papers tagged: 246 · with a code link: 103 · where Syntology ran a sample: 33 (30 with a run with no instrument failure, 3 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (33 of 246 tagged: 30 with a run with no instrument failure, 3 where every run was a failure of Syntology's instrument)
Page 2 of 3: papers 101 to 200 of 246, in archive order: by repositories listed in the archive (most first), then newest first, not by stars (the archive holds no stars, so PwC's “Social” and “Latest” sorts cannot be reproduced). Papers that list no repository come after every paper that lists one.
Papers without a page here are shown as plain text. A Syntology line reads “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the figure “where Syntology's instrument failed” counts failures of Syntology's instrument, not of the code. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code); hover it for the repositories the samples that ran came from. Abstracts are on each paper's page.
-
1 Nov 2018 1 repository listed
-
10 Mar 2018 1 repository listed
-
8 Oct 2016 1 repository listed
-
Improving Medical Visual Representation Learning with Pathological-level Cross-Modal Alignment and Correlation Exploration12 Jun 2025 0 repositories listed
-
ChartReasoner: Code-Driven Modality Bridging for Long-Chain Reasoning in Chart Question Answering11 Jun 2025 0 repositories listed
-
BRIT: Bidirectional Retrieval over Unified Image-Text Graph24 May 2025 0 repositories listed
-
TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP24 May 2025 0 repositories listed
-
Robustifying Vision-Language Models via Dynamic Token Reweighting22 May 2025 0 repositories listed
-
Towards Cross-modal Retrieval in Chinese Cultural Heritage Documents: Dataset and Solution16 May 2025 0 repositories listed
-
X-Fusion: Introducing New Modality to Frozen Large Language Models29 Apr 2025 0 repositories listed
-
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs17 Apr 2025 0 repositories listed
-
DART: Disease-aware Image-Text Alignment and Self-correcting Re-alignment for Trustworthy Radiology Report Generation16 Apr 2025 0 repositories listed
-
15 Apr 2025 0 repositories listed
-
Image-to-Text for Medical Reports Using Adaptive Co-Attention and Triple-LSTM Module24 Mar 2025 0 repositories listed
-
Natural Language Generation20 Mar 2025 0 repositories listed
-
PromptHash: Affinity-Prompted Collaborative Cross-Modal Learning for Adaptive Hashing Retrieval20 Mar 2025 0 repositories listed
-
MFP-CLIP: Exploring the Efficacy of Multi-Form Prompts for Zero-Shot Industrial Anomaly Detection17 Mar 2025 0 repositories listed
-
ABC: Achieving Better Control of Multimodal Embeddings using VLMs1 Mar 2025 0 repositories listed
-
On the Importance of Text Preprocessing for Multimodal Representation Learning and Pathology Report Generation26 Feb 2025 0 repositories listed
-
Natural Language Generation from Visual Sequences: Challenges and Future Directions18 Feb 2025 0 repositories listed
-
UNITE-FND: Reframing Multimodal Fake News Detection through Unimodal Scene Translation16 Feb 2025 0 repositories listed
-
Advancing Myopia To Holism: Fully Contrastive Language-Image Pre-training1 Jan 2025 0 repositories listed
-
PromptHash:Affinity-Prompted Collaborative Cross-Modal Learning for Adaptive Hashing Retrieval1 Jan 2025 0 repositories listed
-
Retaining Knowledge and Enhancing Long-Text Representations in CLIP through Dual-Teacher Distillation1 Jan 2025 0 repositories listed
-
CLIP-FSAC++: Few-Shot Anomaly Classification with Anomaly Descriptor Based on CLIP5 Dec 2024 0 repositories listed
-
DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding2 Dec 2024 0 repositories listed
-
Improving Factuality of 3D Brain MRI Report Generation with Paired Image-domain Retrieval and Text-domain Augmentation23 Nov 2024 0 repositories listed
-
Everything is a Video: Unifying Modalities through Next-Frame Prediction15 Nov 2024 0 repositories listed
-
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models8 Nov 2024 0 repositories listed
-
From Pixels to Prose: Advancing Multi-Modal Language Models for Remote Sensing5 Nov 2024 0 repositories listed
-
Robotic State Recognition with Image-to-Text Retrieval Task of Pre-Trained Vision-Language Model and Black-Box Optimization30 Oct 2024 0 repositories listed
-
Beyond Color and Lines: Zero-Shot Style-Specific Image Variations with Coordinated Semantics24 Oct 2024 0 repositories listed
-
Synergistic Dual Spatial-aware Generation of Image-to-Text and Text-to-Image20 Oct 2024 0 repositories listed
-
An Online Learning Approach to Prompt-based Selection of Generative Models17 Oct 2024 0 repositories listed
-
Patch is Enough: Naturalistic Adversarial Patch against Vision-Language Pre-training Models7 Oct 2024 0 repositories listed
-
Backdooring Vision-Language Models with Out-Of-Distribution Data2 Oct 2024 0 repositories listed
-
See then Tell: Enhancing Key Information Extraction with Vision Grounding29 Sep 2024 0 repositories listed
-
TrojVLM: Backdoor Attack Against Vision Language Models28 Sep 2024 0 repositories listed
-
Robotic Environmental State Recognition with Pre-Trained Vision-Language Models and Black-Box Optimization26 Sep 2024 0 repositories listed
-
Evaluating authenticity and quality of image captions via sentiment and semantic analyses14 Sep 2024 0 repositories listed
-
Ask, Attend, Attack: A Effective Decision-Based Black-Box Targeted Attack for Image-to-Text Models16 Aug 2024 0 repositories listed
-
Instruction Tuning-free Visual Token Complement for Multimodal LLMs9 Aug 2024 0 repositories listed
-
Dallah: A Dialect-Aware Multimodal Large Language Model for Arabic25 Jul 2024 0 repositories listed
-
GPC: Generative and General Pathology Image Classifier12 Jul 2024 0 repositories listed
-
15M Multimodal Facial Image-Text Dataset11 Jul 2024 0 repositories listed
-
HyCIR: Boosting Zero-Shot Composed Image Retrieval with Synthetic Labels8 Jul 2024 0 repositories listed
-
Vision-Braille: An End-to-End Tool for Chinese Braille Image-to-Text Translation8 Jul 2024 0 repositories listed
-
Image-to-Text Logic Jailbreak: Your Imagination can Help You Do Anything1 Jul 2024 0 repositories listed
-
Reminding Multimodal Large Language Models of Object-aware Knowledge with Retrieved Tags16 Jun 2024 0 repositories listed
-
Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval11 Jun 2024 0 repositories listed
-
AICoderEval: Improving AI Domain Code Generation of Large Language Models7 Jun 2024 0 repositories listed
-
Faithful Chart Summarization with ChaTS-Pi29 May 2024 0 repositories listed
-
Understanding the Effect of using Semantically Meaningful Tokens for Visual Representation Learning26 May 2024 0 repositories listed
-
DOCCI: Descriptions of Connected and Contrasting Images30 Apr 2024 0 repositories listed
-
Visual Fact Checker: Enabling High-Fidelity Detailed Caption Generation30 Apr 2024 0 repositories listed
-
Leveraging AI to Generate Audio for User-generated Content in Video Games25 Apr 2024 0 repositories listed
-
VISLA Benchmark: Evaluating Embedding Sensitivity to Semantic and Lexical Alterations25 Apr 2024 0 repositories listed
-
Do LLMs Understand Visual Anomalies? Uncovering LLM's Capabilities in Zero-shot Anomaly Detection15 Apr 2024 0 repositories listed
-
OVFoodSeg: Elevating Open-Vocabulary Food Image Segmentation via Image-Informed Textual Representation1 Apr 2024 0 repositories listed
-
BIMCV-R: A Landmark Dataset for 3D CT Text-Image Retrieval24 Mar 2024 0 repositories listed
-
Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation14 Mar 2024 0 repositories listed
-
CLIP the Bias: How Useful is Balancing Data in Multimodal Learning?7 Mar 2024 0 repositories listed
-
MedM2G: Unifying Medical Multi-Modal Generation via Cross-Guided Diffusion with Visual Invariant7 Mar 2024 0 repositories listed
-
Enhancing Vision-Language Pre-training with Rich Supervisions5 Mar 2024 0 repositories listed
-
Attention Guidance Mechanism for Handwritten Mathematical Expression Recognition4 Mar 2024 0 repositories listed
-
A Unified Framework and Dataset for Assessing Societal Bias in Vision-Language Models21 Feb 2024 0 repositories listed
-
Captions Are Worth a Thousand Words: Enhancing Product Retrieval with Pretrained Image-to-Text Models13 Feb 2024 0 repositories listed
-
Dynamic Traceback Learning for Medical Report Generation24 Jan 2024 0 repositories listed
-
4 Jan 2024 0 repositories listed
-
Accept the Modality Gap: An Exploration in the Hyperbolic Space1 Jan 2024 0 repositories listed
-
RefineNet: Enhancing Text-to-Image Conversion with High-Resolution and Detail Accuracy through Hierarchical Transformers and Progressive Refinement27 Dec 2023 0 repositories listed
-
DiffuVST: Narrating Fictional Scenes with Global-History-Guided Denoising Models12 Dec 2023 0 repositories listed
-
4 Dec 2023 0 repositories listed
-
Learning Pseudo-Labeler beyond Noun Concepts for Open-Vocabulary Object Detection4 Dec 2023 0 repositories listed
-
Beyond Images: An Integrative Multi-modal Approach to Chest X-Ray Report Generation18 Nov 2023 0 repositories listed
-
AI Recommendation System for Enhanced Customer Experience: A Novel Image-to-Text Method16 Nov 2023 0 repositories listed
-
Efficient End-to-End Visual Document Understanding with Rationale Distillation16 Nov 2023 0 repositories listed
-
Semantically Grounded QFormer for Efficient Vision Language Understanding13 Nov 2023 0 repositories listed
-
GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks2 Nov 2023 0 repositories listed
-
SingleInsert: Inserting New Concepts from a Single Image into Text-to-Image Models for Flexible Editing12 Oct 2023 0 repositories listed
-
Ziya-Visual: Bilingual Large Vision-Language Model via Multi-Task Instruction Tuning12 Oct 2023 0 repositories listed
-
Reinforced UI Instruction Grounding: Towards a Generic UI Task Automation API7 Oct 2023 0 repositories listed
-
Leveraging Unpaired Data for Vision-Language Generative Models via Cycle Consistency5 Oct 2023 0 repositories listed
-
SurrogatePrompt: Bypassing the Safety Filter of Text-to-Image Models via Substitution25 Sep 2023 0 repositories listed
-
Offline Detection of Misspelled Handwritten Words by Convolving Recognition Model Features with Text Labels18 Sep 2023 0 repositories listed
-
BiLMa: Bidirectional Local-Matching for Text-based Person Re-identification9 Sep 2023 0 repositories listed
-
Sequential Semantic Generative Communication for Progressive Text-to-Image Generation8 Sep 2023 0 repositories listed
-
GrowCLIP: Data-aware Automatic Model Growing for Large-scale Contrastive Language-Image Pre-training22 Aug 2023 0 repositories listed
-
Multimodal Neurons in Pretrained Text-Only Transformers3 Aug 2023 0 repositories listed
-
Revisiting DETR Pre-training for Object Detection2 Aug 2023 0 repositories listed
-
Towards a Visual-Language Foundation Model for Computational Pathology24 Jul 2023 0 repositories listed
-
PiTL: Cross-modal Retrieval with Weakly-supervised Vision-language Pre-training via Prompting14 Jul 2023 0 repositories listed
-
29 Jun 2023 0 repositories listed
-
I See Dead People: Gray-Box Adversarial Attack on Image-To-Text Models13 Jun 2023 0 repositories listed
-
CapText: Large Language Model-based Caption Generation From Image Context and Description1 Jun 2023 0 repositories listed
-
Category-Oriented Representation Learning for Image to Multi-Modal Retrieval6 May 2023 0 repositories listed
-
Image Captioners Sometimes Tell More Than Images They See4 May 2023 0 repositories listed
-
Interpreting Vision and Language Generative Models with Semantic Visual Priors28 Apr 2023 0 repositories listed
-
Is Cross-modal Information Retrieval Possible without Training?20 Apr 2023 0 repositories listed
-
Task-Oriented Multi-Modal Mutual Leaning for Vision-Language Models30 Mar 2023 0 repositories listed