{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-captioning/papers/9","list_of":"/task/image-captioning","task":"Image Captioning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":9,"pages_in_order":19,"rows_per_page":100,"rows":[801,900],"of":1878,"counts":{"archive_papers_tagged":1878,"with_a_code_link":774,"where_syntology_ran_a_sample":243,"not_listed_spam_title":0,"listed":1878,"listed_where_code_ran":243,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":201,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":201,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-captioning","prev":"/task/image-captioning/papers/8","next":"/task/image-captioning/papers/10","papers":[{"url":null,"slug":"transferable-adversarial-attacks-on-black-box","title":"Transferable Adversarial Attacks on Black-Box Vision-Language Models","date":"2025-05-02","arxiv_id":"2505.01050","repositories_listed":0,"syntology":null},{"url":null,"slug":"zoomer-adaptive-image-focus-optimization-for","title":"Zoomer: Adaptive Image Focus Optimization for Black-box MLLM","date":"2025-04-30","arxiv_id":"2505.00742","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-but-at-what-cost-unveiling-the","title":"Zero-Shot, But at What Cost? Unveiling the Hidden Overhead of MILS's LLM-CLIP Framework for Image Captioning","date":"2025-04-21","arxiv_id":"2504.15199","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-visual-relation-detection-with","title":"Generalized Visual Relation Detection with Diffusion Models","date":"2025-04-16","arxiv_id":"2504.12100","repositories_listed":0,"syntology":null},{"url":null,"slug":"lvlm-csp-accelerating-large-vision-language","title":"LVLM_CSP: Accelerating Large Vision Language Models via Clustering, Scattering, and Pruning for Reasoning Segmentation","date":"2025-04-15","arxiv_id":"2504.10854","repositories_listed":0,"syntology":null},{"url":null,"slug":"tadacap-time-series-adaptive-domain-aware","title":"TADACap: Time-series Adaptive Domain-Aware Captioning","date":"2025-04-15","arxiv_id":"2504.11441","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-trustworthy-multimodal-ai-a-review","title":"Building Trustworthy Multimodal AI: A Review of Fairness, Transparency, and Ethics in Vision-Language Tasks","date":"2025-04-14","arxiv_id":"2504.13199","repositories_listed":0,"syntology":null},{"url":null,"slug":"foundation-models-for-remote-sensing-an","title":"Foundation Models for Remote Sensing: An Analysis of MLLMs for Object Localization","date":"2025-04-14","arxiv_id":"2504.10727","repositories_listed":0,"syntology":null},{"url":null,"slug":"aerolite-tag-guided-lightweight-generation-of","title":"AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions","date":"2025-04-13","arxiv_id":"2504.09528","repositories_listed":0,"syntology":null},{"url":null,"slug":"metropolis-hastings-captioning-game-knowledge","title":"Metropolis-Hastings Captioning Game: Knowledge Fusion of Vision Language Models via Decentralized Bayesian Inference","date":"2025-04-13","arxiv_id":"2504.09620","repositories_listed":0,"syntology":null},{"url":null,"slug":"astrollava-towards-the-unification-of","title":"AstroLLaVA: towards the unification of astronomical data and natural language","date":"2025-04-11","arxiv_id":"2504.08583","repositories_listed":0,"syntology":null},{"url":null,"slug":"embodied-image-captioning-self-supervised","title":"Embodied Image Captioning: Self-supervised Learning Agents for Spatially Coherent Image Descriptions","date":"2025-04-11","arxiv_id":"2504.08531","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-can-objects-help-video-language","title":"How Can Objects Help Video-Language Understanding?","date":"2025-04-10","arxiv_id":"2504.07454","repositories_listed":0,"syntology":null},{"url":null,"slug":"impact-of-language-guidance-a-reproducibility","title":"Impact of Language Guidance: A Reproducibility Study","date":"2025-04-10","arxiv_id":"2504.08140","repositories_listed":0,"syntology":null},{"url":null,"slug":"rs-rag-bridging-remote-sensing-imagery-and","title":"RS-RAG: Bridging Remote Sensing Imagery and Comprehensive Knowledge with a Multi-Modal Dataset and Retrieval-Augmented Generation Model","date":"2025-04-07","arxiv_id":"2504.04988","repositories_listed":0,"syntology":null},{"url":null,"slug":"moral-a-multimodal-reinforcement-learning","title":"MORAL: A Multimodal Reinforcement Learning Framework for Decision Making in Autonomous Laboratories","date":"2025-04-04","arxiv_id":"2504.03153","repositories_listed":0,"syntology":null},{"url":null,"slug":"group-based-distinctive-image-captioning-with-1","title":"Group-based Distinctive Image Captioning with Memory Difference Encoding and Attention","date":"2025-04-03","arxiv_id":"2504.02496","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-conformal-risk-control-framework-for","title":"A Conformal Risk Control Framework for Granular Word Assessment and Uncertainty Calibration of CLIPScore Quality Estimates","date":"2025-04-01","arxiv_id":"2504.01225","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-independent-ocr-with-multimodal-llms","title":"Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity","date":"2025-03-31","arxiv_id":"2503.23667","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-spatial-feature-fusion-with-dynamic","title":"Semantic-Spatial Feature Fusion with Dynamic Graph Refinement for Remote Sensing Image Captioning","date":"2025-03-30","arxiv_id":"2503.23453","repositories_listed":0,"syntology":null},{"url":null,"slug":"jeem-vision-language-understanding-in-four","title":"JEEM: Vision-Language Understanding in Four Arabic Dialects","date":"2025-03-27","arxiv_id":"2503.21910","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-low-level-visual-hallucinations","title":"Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy","date":"2025-03-26","arxiv_id":"2503.20673","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-alignment-of-modalities-in-large","title":"Improved Alignment of Modalities in Large Vision Language Models","date":"2025-03-25","arxiv_id":"2503.19508","repositories_listed":0,"syntology":null},{"url":null,"slug":"reverse-prompt-cracking-the-recipe-inside","title":"Reverse Prompt: Cracking the Recipe Inside Text-to-Image Generation","date":"2025-03-25","arxiv_id":"2503.19937","repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-language-generation-1","title":"Natural Language Generation","date":"2025-03-20","arxiv_id":"2503.16728","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-autoregressive-visual-generation-and","title":"Unified Autoregressive Visual Generation and Understanding with Continuous Tokens","date":"2025-03-17","arxiv_id":"2503.13436","repositories_listed":0,"syntology":null},{"url":null,"slug":"caparena-benchmarking-and-analyzing-detailed","title":"CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era","date":"2025-03-16","arxiv_id":"2503.12329","repositories_listed":0,"syntology":null},{"url":null,"slug":"georsmllm-a-multimodal-large-language-model","title":"GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing","date":"2025-03-16","arxiv_id":"2503.12490","repositories_listed":0,"syntology":null},{"url":null,"slug":"taxonomic-reasoning-for-rare-arthropods","title":"Taxonomic Reasoning for Rare Arthropods: Combining Dense Image Captioning and RAG for Interpretable Classification","date":"2025-03-13","arxiv_id":"2503.10886","repositories_listed":0,"syntology":null},{"url":null,"slug":"astrea-a-moe-based-visual-understanding-model","title":"Astrea: A MOE-based Visual Understanding Model with Progressive Alignment","date":"2025-03-12","arxiv_id":"2503.09445","repositories_listed":0,"syntology":null},{"url":null,"slug":"florenz-scaling-laws-for-systematic","title":"Florenz: Scaling Laws for Systematic Generalization in Vision-Language Models","date":"2025-03-12","arxiv_id":"2503.09443","repositories_listed":0,"syntology":null},{"url":null,"slug":"comicspap-understanding-comic-strips-by","title":"ComicsPAP: understanding comic strips by picking the correct panel","date":"2025-03-11","arxiv_id":"2503.08561","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-cognitive-diagnostics-in-pathology","title":"Improving cognitive diagnostics in pathology: a deep learning approach for augmenting perceptional understanding of histopathology images","date":"2025-03-10","arxiv_id":"2503.06894","repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-directional-bias-amplification-in","title":"Measuring directional bias amplification in image captions using predictability","date":"2025-03-10","arxiv_id":"2503.07878","repositories_listed":0,"syntology":null},{"url":null,"slug":"perturbollava-reducing-multimodal","title":"PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training","date":"2025-03-09","arxiv_id":"2503.06486","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-captions-to-rewards-carevl-leveraging","title":"From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models","date":"2025-03-08","arxiv_id":"2503.06260","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-benchmark-for-multi-lingual-vision-language","title":"A Benchmark for Multi-Lingual Vision-Language Learning in Remote Sensing Image Captioning","date":"2025-03-06","arxiv_id":"2503.04592","repositories_listed":0,"syntology":null},{"url":null,"slug":"2503-01453","title":"AC-Lite : A Lightweight Image Captioning Model for Low-Resource Assamese Language","date":"2025-03-03","arxiv_id":"2503.01453","repositories_listed":0,"syntology":null},{"url":null,"slug":"group-relative-policy-optimization-for-image","title":"Group Relative Policy Optimization for Image Captioning","date":"2025-03-03","arxiv_id":"2503.01333","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-large-language-models-good-data","title":"Are Large Language Models Good Data Preprocessors?","date":"2025-02-24","arxiv_id":"2502.16790","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-causes-and-mitigation-of","title":"Exploring Causes and Mitigation of Hallucinations in Large Vision Language Models","date":"2025-02-24","arxiv_id":"2502.16842","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-video-captioning-through-scene","title":"Fine-Grained Video Captioning through Scene Graph Consolidation","date":"2025-02-23","arxiv_id":"2502.16427","repositories_listed":0,"syntology":null},{"url":null,"slug":"good-representation-better-explanation-role","title":"Good Representation, Better Explanation: Role of Convolutional Neural Networks in Transformer-Based Remote Sensing Image Captioning","date":"2025-02-22","arxiv_id":"2502.16095","repositories_listed":0,"syntology":null},{"url":null,"slug":"revision-a-dataset-and-baseline-vlm-for","title":"ReVision: A Dataset and Baseline VLM for Privacy-Preserving Task-Oriented Visual Instruction Rewriting","date":"2025-02-20","arxiv_id":"2502.14780","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-chain-of-thought-subspace-meta-learning-for","title":"A Chain-of-Thought Subspace Meta-Learning for Few-shot Image Captioning with Large Vision and Language Models","date":"2025-02-19","arxiv_id":"2502.13942","repositories_listed":0,"syntology":null},{"url":"/paper/groundcap-a-visually-grounded-image","slug":"groundcap-a-visually-grounded-image","title":"GroundCap: A Visually Grounded Image Captioning Dataset","date":"2025-02-19","arxiv_id":"2502.13898","repositories_listed":0,"syntology":null},{"url":null,"slug":"insightvision-a-comprehensive-multi-level","title":"InsightVision: A Comprehensive, Multi-Level Chinese-based Benchmark for Evaluating Implicit Visual Semantics in Large Vision Language Models","date":"2025-02-19","arxiv_id":"2502.15812","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-is-a-good-caption-a-comprehensive-visual","title":"What Is a Good Caption? A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness","date":"2025-02-19","arxiv_id":"2502.14914","repositories_listed":0,"syntology":null},{"url":null,"slug":"tpcap-unlocking-zero-shot-image-captioning","title":"TPCap: Unlocking Zero-Shot Image Captioning with Trigger-Augmented and Multi-Modal Purification Modules","date":"2025-02-16","arxiv_id":"2502.11024","repositories_listed":0,"syntology":null},{"url":"/paper/viscon-100k-leveraging-contextual-web-data","slug":"viscon-100k-leveraging-contextual-web-data","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","date":"2025-02-14","arxiv_id":"2502.10250","repositories_listed":0,"syntology":null},{"url":null,"slug":"fe-lws-refined-image-text-representations-via","title":"FE-LWS: Refined Image-Text Representations via Decoder Stacking and Fused Encodings for Remote Sensing Image Captioning","date":"2025-02-13","arxiv_id":"2502.09282","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-models-for-edge-networks-a","title":"Vision-Language Models for Edge Networks: A Comprehensive Survey","date":"2025-02-11","arxiv_id":"2502.07855","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-distribution-prediction-a-unified","title":"Generative Distribution Prediction: A Unified Approach to Multimodal Learning","date":"2025-02-10","arxiv_id":"2502.07090","repositories_listed":0,"syntology":null},{"url":null,"slug":"eclair-extracting-content-and-layout-with","title":"Éclair -- Extracting Content and Layout with Integrated Reading Order for Documents","date":"2025-02-06","arxiv_id":"2502.04223","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-few-shot-continual-learning-in","title":"Efficient Few-Shot Continual Learning in Vision-Language Models","date":"2025-02-06","arxiv_id":"2502.04098","repositories_listed":0,"syntology":null},{"url":null,"slug":"coconut-pancap-joint-panoptic-segmentation","title":"COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation","date":"2025-02-04","arxiv_id":"2502.02589","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-spatial-language-grounding-through","title":"Exploring Spatial Language Grounding Through Referring Expressions","date":"2025-02-04","arxiv_id":"2502.04359","repositories_listed":0,"syntology":null},{"url":null,"slug":"medxpertqa-benchmarking-expert-level-medical","title":"MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding","date":"2025-01-30","arxiv_id":"2501.18362","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-ensemble-model-with-attention-based","title":"An Ensemble Model with Attention Based Mechanism for Image Captioning","date":"2025-01-22","arxiv_id":"2501.14828","repositories_listed":0,"syntology":null},{"url":null,"slug":"double-visual-defense-adversarial-pre","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","date":"2025-01-16","arxiv_id":"2501.09446","repositories_listed":0,"syntology":null},{"url":null,"slug":"vcrscore-image-captioning-metric-based-on-v-l","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","date":"2025-01-15","arxiv_id":"2501.09155","repositories_listed":0,"syntology":null},{"url":null,"slug":"geopix-multi-modal-large-language-model-for","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","date":"2025-01-12","arxiv_id":"2501.06828","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-image-captioning-by-mimicking-human","title":"Improving Image Captioning by Mimicking Human Reformulation Feedback at Inference-time","date":"2025-01-08","arxiv_id":"2501.04513","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-image-caption-via-cycle-consistent","title":"Evaluating Image Caption via Cycle-consistent Text-to-Image Generation","date":"2025-01-07","arxiv_id":"2501.03567","repositories_listed":0,"syntology":null},{"url":null,"slug":"mocoll-agent-based-specific-and-general-model","title":"MoColl: Agent-Based Specific and General Model Collaboration for Image Captioning","date":"2025-01-03","arxiv_id":"2501.01834","repositories_listed":0,"syntology":null},{"url":null,"slug":"adadare-gamma-balancing-stability-and","title":"AdaDARE-gamma: Balancing Stability and Plasticity in Multi-modal LLMs through Efficient Adaptation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"flowing-from-words-to-pixels-a-noise-free","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"patch-matters-training-free-fine-grained","title":"Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-and-expressive-variations-in-image","title":"Semantic and Expressive Variations in Image Captions Across Languages","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-based-membership-inference-attacks","title":"Variance-Based Membership Inference Attacks Against Large-Scale Image Captioning Models","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unleashing-text-to-image-diffusion-prior-for","title":"Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning","date":"2024-12-31","arxiv_id":"2501.00437","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-multimodal-rag-llm-for-accurate","title":"Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering","date":"2024-12-30","arxiv_id":"2412.20927","repositories_listed":0,"syntology":null},{"url":null,"slug":"ergochat-a-visual-query-system-for-the","title":"ErgoChat: a Visual Query System for the Ergonomic Risk Assessment of Construction Workers","date":"2024-12-27","arxiv_id":"2412.19954","repositories_listed":0,"syntology":null},{"url":null,"slug":"gcs-m3vlt-guided-context-self-attention-based","title":"GCS-M3VLT: Guided Context Self-Attention based Multi-modal Medical Vision Language Transformer for Retinal Image Captioning","date":"2024-12-23","arxiv_id":"2412.17251","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-large-multimodal-model-datasets","title":"Survey of Large Multimodal Model Datasets, Application Categories and Taxonomy","date":"2024-12-23","arxiv_id":"2412.17759","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-robust-hyper-detailed-image-captioning","title":"Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and Coverage","date":"2024-12-20","arxiv_id":"2412.15484","repositories_listed":0,"syntology":null},{"url":null,"slug":"dataset-augmentation-by-mixing-visual","title":"Dataset Augmentation by Mixing Visual Concepts","date":"2024-12-19","arxiv_id":"2412.15358","repositories_listed":0,"syntology":null},{"url":null,"slug":"flowing-from-words-to-pixels-a-framework-for","title":"Flowing from Words to Pixels: A Framework for Cross-Modality Evolution","date":"2024-12-19","arxiv_id":"2412.15213","repositories_listed":0,"syntology":null},{"url":null,"slug":"maybe-you-are-looking-for-croqs-cross-modal","title":"Maybe you are looking for CroQS: Cross-modal Query Suggestion for Text-to-Image Retrieval","date":"2024-12-18","arxiv_id":"2412.13834","repositories_listed":0,"syntology":null},{"url":null,"slug":"punchbench-benchmarking-mllms-in-multimodal","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","date":"2024-12-16","arxiv_id":"2412.11906","repositories_listed":0,"syntology":null},{"url":null,"slug":"unma-capsumt-unified-and-multi-head-attention","title":"UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer","date":"2024-12-16","arxiv_id":"2412.11836","repositories_listed":0,"syntology":null},{"url":null,"slug":"overview-of-trec-2024-medical-video-question","title":"Overview of TREC 2024 Medical Video Question Answering (MedVidQA) Track","date":"2024-12-15","arxiv_id":"2412.11056","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-vision-language-interactions","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","date":"2024-12-14","arxiv_id":"2412.10758","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-models-represent-darker","title":"Vision-Language Models Represent Darker-Skinned Black Individuals as More Homogeneous than Lighter-Skinned Black Individuals","date":"2024-12-12","arxiv_id":"2412.09668","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-vision-language-tasks-benefit-from-large","title":"How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey","date":"2024-12-11","arxiv_id":"2412.08158","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-syntax-uncovering-syntactic-learning","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","date":"2024-12-11","arxiv_id":"2412.08111","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-spatial-understanding-in-mllms","title":"3D Spatial Understanding in MLLMs: Disambiguation and Evaluation","date":"2024-12-09","arxiv_id":"2412.06613","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-multi-grained-concept-annotations","title":"Exploring Multi-Grained Concept Annotations for Multimodal Large Language Models","date":"2024-12-08","arxiv_id":"2412.05939","repositories_listed":0,"syntology":null},{"url":null,"slug":"hmgie-hierarchical-and-multi-grained","title":"HMGIE: Hierarchical and Multi-Grained Inconsistency Evaluation for Vision-Language Data Cleansing","date":"2024-12-07","arxiv_id":"2412.05685","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalizing-multimodal-large-language","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","date":"2024-12-04","arxiv_id":"2412.03665","repositories_listed":0,"syntology":null},{"url":null,"slug":"cegi-measuring-the-trade-off-between","title":"CEGI: Measuring the trade-off between efficiency and carbon emissions for SLMs and VLMs","date":"2024-12-03","arxiv_id":"2412.02602","repositories_listed":0,"syntology":null},{"url":null,"slug":"progress-aware-video-frame-captioning","title":"Progress-Aware Video Frame Captioning","date":"2024-12-03","arxiv_id":"2412.02071","repositories_listed":0,"syntology":null},{"url":null,"slug":"dir-retrieval-augmented-image-captioning-with","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","date":"2024-12-02","arxiv_id":"2412.01115","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-multimodal-llms-ability-in-geometry","title":"Improving Multimodal LLMs Ability In Geometry Problem Solving, Reasoning, And Multistep Scoring","date":"2024-12-01","arxiv_id":"2412.00846","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-attention-vectors-generative","title":"Sparse Attention Vectors: Generative Multimodal Model Features Are Discriminative Vision-Language Classifiers","date":"2024-11-28","arxiv_id":"2412.00142","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-data-curation-effectively-distills","title":"Active Data Curation Effectively Distills Large-Scale Multimodal Models","date":"2024-11-27","arxiv_id":"2411.18674","repositories_listed":0,"syntology":null},{"url":null,"slug":"opcap-object-aware-prompting-captioning","title":"OPCap:Object-aware Prompting Captioning","date":"2024-11-27","arxiv_id":"2412.00095","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-multi-modal-large-language-models","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","date":"2024-11-26","arxiv_id":"2411.17773","repositories_listed":0,"syntology":null},{"url":null,"slug":"debiasing-classifiers-by-amplifying-bias-with","title":"Debiasing Classifiers by Amplifying Bias with Latent Diffusion and Large Language Models","date":"2024-11-25","arxiv_id":"2411.16079","repositories_listed":0,"syntology":null},{"url":null,"slug":"chain-of-attack-on-the-robustness-of-vision","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","date":"2024-11-24","arxiv_id":"2411.15720","repositories_listed":0,"syntology":null}],"record_sha256":"7ccf476fd85d66734f542fb33370676c4b412aa2fe8f9bc273709aac3445267d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}