Browse State-of-the-Art › Image Captioning › Papers, page 9
Image Captioning
Papers archive 2025-07-28
archive papers tagged: 1,878 · with a code link: 774 · where Syntology ran a sample: 243 (201 with a run with no instrument failure, 42 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (243 of 1,878 tagged: 201 with a run with no instrument failure, 42 where every run was a failure of Syntology's instrument)
Page 9 of 19: papers 801 to 900 of 1,878, in archive order: by repositories listed in the archive (most first), then newest first, not by stars (the archive holds no stars, so PwC's “Social” and “Latest” sorts cannot be reproduced). Papers that list no repository come after every paper that lists one.
Papers without a page here are shown as plain text. A Syntology line reads “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the figure “where Syntology's instrument failed” counts failures of Syntology's instrument, not of the code. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code); hover it for the repositories the samples that ran came from. Abstracts are on each paper's page.
-
Transferable Adversarial Attacks on Black-Box Vision-Language Models2 May 2025 0 repositories listed
-
Zoomer: Adaptive Image Focus Optimization for Black-box MLLM30 Apr 2025 0 repositories listed
-
Zero-Shot, But at What Cost? Unveiling the Hidden Overhead of MILS's LLM-CLIP Framework for Image Captioning21 Apr 2025 0 repositories listed
-
Generalized Visual Relation Detection with Diffusion Models16 Apr 2025 0 repositories listed
-
LVLM_CSP: Accelerating Large Vision Language Models via Clustering, Scattering, and Pruning for Reasoning Segmentation15 Apr 2025 0 repositories listed
-
TADACap: Time-series Adaptive Domain-Aware Captioning15 Apr 2025 0 repositories listed
-
Building Trustworthy Multimodal AI: A Review of Fairness, Transparency, and Ethics in Vision-Language Tasks14 Apr 2025 0 repositories listed
-
Foundation Models for Remote Sensing: An Analysis of MLLMs for Object Localization14 Apr 2025 0 repositories listed
-
AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions13 Apr 2025 0 repositories listed
-
Metropolis-Hastings Captioning Game: Knowledge Fusion of Vision Language Models via Decentralized Bayesian Inference13 Apr 2025 0 repositories listed
-
AstroLLaVA: towards the unification of astronomical data and natural language11 Apr 2025 0 repositories listed
-
Embodied Image Captioning: Self-supervised Learning Agents for Spatially Coherent Image Descriptions11 Apr 2025 0 repositories listed
-
How Can Objects Help Video-Language Understanding?10 Apr 2025 0 repositories listed
-
Impact of Language Guidance: A Reproducibility Study10 Apr 2025 0 repositories listed
-
RS-RAG: Bridging Remote Sensing Imagery and Comprehensive Knowledge with a Multi-Modal Dataset and Retrieval-Augmented Generation Model7 Apr 2025 0 repositories listed
-
MORAL: A Multimodal Reinforcement Learning Framework for Decision Making in Autonomous Laboratories4 Apr 2025 0 repositories listed
-
Group-based Distinctive Image Captioning with Memory Difference Encoding and Attention3 Apr 2025 0 repositories listed
-
A Conformal Risk Control Framework for Granular Word Assessment and Uncertainty Calibration of CLIPScore Quality Estimates1 Apr 2025 0 repositories listed
-
Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity31 Mar 2025 0 repositories listed
-
Semantic-Spatial Feature Fusion with Dynamic Graph Refinement for Remote Sensing Image Captioning30 Mar 2025 0 repositories listed
-
JEEM: Vision-Language Understanding in Four Arabic Dialects27 Mar 2025 0 repositories listed
-
Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy26 Mar 2025 0 repositories listed
-
Improved Alignment of Modalities in Large Vision Language Models25 Mar 2025 0 repositories listed
-
Reverse Prompt: Cracking the Recipe Inside Text-to-Image Generation25 Mar 2025 0 repositories listed
-
Natural Language Generation20 Mar 2025 0 repositories listed
-
Unified Autoregressive Visual Generation and Understanding with Continuous Tokens17 Mar 2025 0 repositories listed
-
CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era16 Mar 2025 0 repositories listed
-
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing16 Mar 2025 0 repositories listed
-
Taxonomic Reasoning for Rare Arthropods: Combining Dense Image Captioning and RAG for Interpretable Classification13 Mar 2025 0 repositories listed
-
Astrea: A MOE-based Visual Understanding Model with Progressive Alignment12 Mar 2025 0 repositories listed
-
Florenz: Scaling Laws for Systematic Generalization in Vision-Language Models12 Mar 2025 0 repositories listed
-
ComicsPAP: understanding comic strips by picking the correct panel11 Mar 2025 0 repositories listed
-
Improving cognitive diagnostics in pathology: a deep learning approach for augmenting perceptional understanding of histopathology images10 Mar 2025 0 repositories listed
-
Measuring directional bias amplification in image captions using predictability10 Mar 2025 0 repositories listed
-
PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training9 Mar 2025 0 repositories listed
-
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models8 Mar 2025 0 repositories listed
-
A Benchmark for Multi-Lingual Vision-Language Learning in Remote Sensing Image Captioning6 Mar 2025 0 repositories listed
-
AC-Lite : A Lightweight Image Captioning Model for Low-Resource Assamese Language3 Mar 2025 0 repositories listed
-
Group Relative Policy Optimization for Image Captioning3 Mar 2025 0 repositories listed
-
Are Large Language Models Good Data Preprocessors?24 Feb 2025 0 repositories listed
-
Exploring Causes and Mitigation of Hallucinations in Large Vision Language Models24 Feb 2025 0 repositories listed
-
Fine-Grained Video Captioning through Scene Graph Consolidation23 Feb 2025 0 repositories listed
-
Good Representation, Better Explanation: Role of Convolutional Neural Networks in Transformer-Based Remote Sensing Image Captioning22 Feb 2025 0 repositories listed
-
ReVision: A Dataset and Baseline VLM for Privacy-Preserving Task-Oriented Visual Instruction Rewriting20 Feb 2025 0 repositories listed
-
A Chain-of-Thought Subspace Meta-Learning for Few-shot Image Captioning with Large Vision and Language Models19 Feb 2025 0 repositories listed
-
19 Feb 2025 0 repositories listed
-
InsightVision: A Comprehensive, Multi-Level Chinese-based Benchmark for Evaluating Implicit Visual Semantics in Large Vision Language Models19 Feb 2025 0 repositories listed
-
What Is a Good Caption? A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness19 Feb 2025 0 repositories listed
-
TPCap: Unlocking Zero-Shot Image Captioning with Trigger-Augmented and Multi-Modal Purification Modules16 Feb 2025 0 repositories listed
-
14 Feb 2025 0 repositories listed
-
FE-LWS: Refined Image-Text Representations via Decoder Stacking and Fused Encodings for Remote Sensing Image Captioning13 Feb 2025 0 repositories listed
-
Vision-Language Models for Edge Networks: A Comprehensive Survey11 Feb 2025 0 repositories listed
-
Generative Distribution Prediction: A Unified Approach to Multimodal Learning10 Feb 2025 0 repositories listed
-
Éclair -- Extracting Content and Layout with Integrated Reading Order for Documents6 Feb 2025 0 repositories listed
-
Efficient Few-Shot Continual Learning in Vision-Language Models6 Feb 2025 0 repositories listed
-
COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation4 Feb 2025 0 repositories listed
-
Exploring Spatial Language Grounding Through Referring Expressions4 Feb 2025 0 repositories listed
-
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding30 Jan 2025 0 repositories listed
-
An Ensemble Model with Attention Based Mechanism for Image Captioning22 Jan 2025 0 repositories listed
-
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness16 Jan 2025 0 repositories listed
-
VCRScore: Image captioning metric based on V&L Transformers, CLIP, and precision-recall15 Jan 2025 0 repositories listed
-
GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing12 Jan 2025 0 repositories listed
-
Improving Image Captioning by Mimicking Human Reformulation Feedback at Inference-time8 Jan 2025 0 repositories listed
-
Evaluating Image Caption via Cycle-consistent Text-to-Image Generation7 Jan 2025 0 repositories listed
-
MoColl: Agent-Based Specific and General Model Collaboration for Image Captioning3 Jan 2025 0 repositories listed
-
AdaDARE-gamma: Balancing Stability and Plasticity in Multi-modal LLMs through Efficient Adaptation1 Jan 2025 0 repositories listed
-
Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution1 Jan 2025 0 repositories listed
-
Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception1 Jan 2025 0 repositories listed
-
Semantic and Expressive Variations in Image Captions Across Languages1 Jan 2025 0 repositories listed
-
Variance-Based Membership Inference Attacks Against Large-Scale Image Captioning Models1 Jan 2025 0 repositories listed
-
Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning31 Dec 2024 0 repositories listed
-
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering30 Dec 2024 0 repositories listed
-
ErgoChat: a Visual Query System for the Ergonomic Risk Assessment of Construction Workers27 Dec 2024 0 repositories listed
-
GCS-M3VLT: Guided Context Self-Attention based Multi-modal Medical Vision Language Transformer for Retinal Image Captioning23 Dec 2024 0 repositories listed
-
Survey of Large Multimodal Model Datasets, Application Categories and Taxonomy23 Dec 2024 0 repositories listed
-
Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and Coverage20 Dec 2024 0 repositories listed
-
Dataset Augmentation by Mixing Visual Concepts19 Dec 2024 0 repositories listed
-
Flowing from Words to Pixels: A Framework for Cross-Modality Evolution19 Dec 2024 0 repositories listed
-
Maybe you are looking for CroQS: Cross-modal Query Suggestion for Text-to-Image Retrieval18 Dec 2024 0 repositories listed
-
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension16 Dec 2024 0 repositories listed
-
UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer16 Dec 2024 0 repositories listed
-
Overview of TREC 2024 Medical Video Question Answering (MedVidQA) Track15 Dec 2024 0 repositories listed
-
Optimizing Vision-Language Interactions Through Decoder-Only Models14 Dec 2024 0 repositories listed
-
Vision-Language Models Represent Darker-Skinned Black Individuals as More Homogeneous than Lighter-Skinned Black Individuals12 Dec 2024 0 repositories listed
-
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey11 Dec 2024 0 repositories listed
-
Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models11 Dec 2024 0 repositories listed
-
3D Spatial Understanding in MLLMs: Disambiguation and Evaluation9 Dec 2024 0 repositories listed
-
Exploring Multi-Grained Concept Annotations for Multimodal Large Language Models8 Dec 2024 0 repositories listed
-
HMGIE: Hierarchical and Multi-Grained Inconsistency Evaluation for Vision-Language Data Cleansing7 Dec 2024 0 repositories listed
-
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis4 Dec 2024 0 repositories listed
-
CEGI: Measuring the trade-off between efficiency and carbon emissions for SLMs and VLMs3 Dec 2024 0 repositories listed
-
Progress-Aware Video Frame Captioning3 Dec 2024 0 repositories listed
-
DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding2 Dec 2024 0 repositories listed
-
Improving Multimodal LLMs Ability In Geometry Problem Solving, Reasoning, And Multistep Scoring1 Dec 2024 0 repositories listed
-
Sparse Attention Vectors: Generative Multimodal Model Features Are Discriminative Vision-Language Classifiers28 Nov 2024 0 repositories listed
-
Active Data Curation Effectively Distills Large-Scale Multimodal Models27 Nov 2024 0 repositories listed
-
OPCap:Object-aware Prompting Captioning27 Nov 2024 0 repositories listed
-
Efficient Multi-modal Large Language Models via Visual Token Grouping26 Nov 2024 0 repositories listed
-
Debiasing Classifiers by Amplifying Bias with Latent Diffusion and Large Language Models25 Nov 2024 0 repositories listed
-
Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks24 Nov 2024 0 repositories listed