{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-captioning/papers/10","list_of":"/task/image-captioning","task":"Image Captioning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":10,"pages_in_order":19,"rows_per_page":100,"rows":[901,1000],"of":1878,"counts":{"archive_papers_tagged":1878,"with_a_code_link":774,"where_syntology_ran_a_sample":243,"not_listed_spam_title":0,"listed":1878,"listed_where_code_ran":243,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":201,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":201,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-captioning","prev":"/task/image-captioning/papers/9","next":"/task/image-captioning/papers/11","papers":[{"url":null,"slug":"finecaption-compositional-image-captioning","title":"FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any Granularity","date":"2024-11-23","arxiv_id":"2411.15411","repositories_listed":0,"syntology":null},{"url":null,"slug":"uterine-ultrasound-image-captioning-using","title":"Uterine Ultrasound Image Captioning Using Deep Learning Techniques","date":"2024-11-21","arxiv_id":"2411.14039","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-flow-at-the-network-edge","title":"AI Flow at the Network Edge","date":"2024-11-19","arxiv_id":"2411.12469","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-perception-bias-a-training-free","title":"Mitigating Perception Bias: A Training-Free Approach to Enhance LMM for Image Quality Assessment","date":"2024-11-19","arxiv_id":"2411.12791","repositories_listed":0,"syntology":null},{"url":"/paper/molparser-end-to-end-visual-recognition-of","slug":"molparser-end-to-end-visual-recognition-of","title":"MolParser: End-to-end Visual Recognition of Molecule Structures in the Wild","date":"2024-11-17","arxiv_id":"2411.11098","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-modal-consistency-in-multimodal-large","title":"Cross-Modal Consistency in Multimodal Large Language Models","date":"2024-11-14","arxiv_id":"2411.09273","repositories_listed":0,"syntology":null},{"url":null,"slug":"blip3-kale-knowledge-augmented-large-scale","title":"BLIP3-KALE: Knowledge Augmented Large-Scale Dense Captions","date":"2024-11-12","arxiv_id":"2411.07461","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounded-video-caption-generation","title":"Grounded Video Caption Generation","date":"2024-11-12","arxiv_id":"2411.07584","repositories_listed":0,"syntology":null},{"url":null,"slug":"vitoc-vision-transformer-and-object-aware","title":"ViTOC: Vision Transformer and Object-aware Captioner","date":"2024-11-09","arxiv_id":"2411.07265","repositories_listed":0,"syntology":null},{"url":null,"slug":"image2text2image-a-novel-framework-for-label","title":"Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models","date":"2024-11-08","arxiv_id":"2411.05706","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-is-deceiving-exploitation-of-visual","title":"Seeing is Deceiving: Exploitation of Visual Pathways in Multi-Modal Language Models","date":"2024-11-07","arxiv_id":"2411.05056","repositories_listed":0,"syntology":null},{"url":null,"slug":"rs-moe-mixture-of-experts-for-remote-sensing","title":"RS-MoE: Mixture of Experts for Remote Sensing Image Captioning and Visual Question Answering","date":"2024-11-03","arxiv_id":"2411.01595","repositories_listed":0,"syntology":null},{"url":null,"slug":"designing-a-robust-radiology-report","title":"Designing a Robust Radiology Report Generation System","date":"2024-11-02","arxiv_id":"2411.01153","repositories_listed":0,"syntology":null},{"url":null,"slug":"aggregate-and-adapt-natural-language-prompts","title":"Aggregate-and-Adapt Natural Language Prompts for Downstream Generalization of CLIP","date":"2024-10-31","arxiv_id":"2410.23698","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-language-model-benchmarks-in-medical","title":"Large Language Model Benchmarks in Medical Tasks","date":"2024-10-28","arxiv_id":"2410.21348","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-generation-from-image-captioning","title":"Image Generation from Image Captioning -- Invertible Approach","date":"2024-10-26","arxiv_id":"2410.20171","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoding-diffusion-a-scalable-framework-for","title":"Decoding Diffusion: A Scalable Framework for Unsupervised Analysis of Latent Space Biases and Representations Using Natural Language Prompts","date":"2024-10-25","arxiv_id":"2410.21314","repositories_listed":0,"syntology":null},{"url":null,"slug":"backdoor-in-seconds-unlocking-vulnerabilities","title":"Backdoor in Seconds: Unlocking Vulnerabilities in Large Pre-trained Models via Model Editing","date":"2024-10-23","arxiv_id":"2410.18267","repositories_listed":0,"syntology":null},{"url":null,"slug":"mi-visionshot-few-shot-adaptation-of-vision","title":"MI-VisionShot: Few-shot adaptation of vision-language models for slide-level classification of histopathological images","date":"2024-10-21","arxiv_id":"2410.15881","repositories_listed":0,"syntology":null},{"url":null,"slug":"vipact-visual-perception-enhancement-via","title":"VipAct: Visual-Perception Enhancement via Specialized VLM Agent Collaboration and Tool-use","date":"2024-10-21","arxiv_id":"2410.16400","repositories_listed":0,"syntology":null},{"url":null,"slug":"hiding-in-plain-sight-hips-attack-on-clip-for","title":"Hiding-in-Plain-Sight (HiPS) Attack on CLIP for Targetted Object Removal from Images","date":"2024-10-16","arxiv_id":"2410.13010","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmcfnd-multimodal-multilingual-caption-aware","title":"MMCFND: Multimodal Multilingual Caption-aware Fake News Detection for Low-resource Indic Languages","date":"2024-10-14","arxiv_id":"2410.10407","repositories_listed":0,"syntology":null},{"url":"/paper/clip-scgi-synthesized-caption-guided","slug":"clip-scgi-synthesized-caption-guided","title":"CLIP-SCGI: Synthesized Caption-Guided Inversion for Person Re-Identification","date":"2024-10-12","arxiv_id":"2410.09382","repositories_listed":0,"syntology":null},{"url":null,"slug":"anyattack-towards-large-scale-self-supervised","title":"AnyAttack: Towards Large-scale Self-supervised Adversarial Attacks on Vision-language Models","date":"2024-10-07","arxiv_id":"2410.05346","repositories_listed":0,"syntology":null},{"url":null,"slug":"auroracap-efficient-performant-video-detailed","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","date":"2024-10-04","arxiv_id":"2410.03051","repositories_listed":0,"syntology":null},{"url":null,"slug":"backdooring-vision-language-models-with-out","title":"Backdooring Vision-Language Models with Out-Of-Distribution Data","date":"2024-10-02","arxiv_id":"2410.01264","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantifying-the-gaps-between-translation-and","title":"Quantifying the Gaps Between Translation and Native Perception in Training for Multimodal, Multilingual Retrieval","date":"2024-10-02","arxiv_id":"2410.02027","repositories_listed":0,"syntology":null},{"url":null,"slug":"deneb-a-hallucination-robust-automatic","title":"DENEB: A Hallucination-Robust Automatic Evaluation Metric for Image Captioning","date":"2024-09-28","arxiv_id":"2409.19255","repositories_listed":0,"syntology":null},{"url":null,"slug":"trojvlm-backdoor-attack-against-vision","title":"TrojVLM: Backdoor Attack Against Vision Language Models","date":"2024-09-28","arxiv_id":"2409.19232","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-textgcn-based-decoding-approach-for","title":"A TextGCN-Based Decoding Approach for Improving Remote Sensing Image Captioning","date":"2024-09-27","arxiv_id":"2409.18467","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-explainability-in-multimodal-large","title":"Enhancing Explainability in Multimodal Large Language Models Using Ontological Context","date":"2024-09-27","arxiv_id":"2409.18753","repositories_listed":0,"syntology":null},{"url":null,"slug":"brotherhood-at-wmt-2024-leveraging-llm","title":"Brotherhood at WMT 2024: Leveraging LLM-Generated Contextual Conversations for Cross-Lingual Image Captioning","date":"2024-09-23","arxiv_id":"2409.15052","repositories_listed":0,"syntology":null},{"url":null,"slug":"effectively-enhancing-vision-language-large","title":"Effectively Enhancing Vision Language Large Models by Prompt Augmentation and Caption Utilization","date":"2024-09-22","arxiv_id":"2409.14484","repositories_listed":0,"syntology":null},{"url":null,"slug":"bench-benchmarking-vision-language-models-for","title":"@Bench: Benchmarking Vision-Language Models for Human-centered Assistive Technology","date":"2024-09-21","arxiv_id":"2409.14215","repositories_listed":0,"syntology":null},{"url":null,"slug":"fullanno-a-data-engine-for-enhancing-image","title":"FullAnno: A Data Engine for Enhancing Image Comprehension of MLLMs","date":"2024-09-20","arxiv_id":"2409.13540","repositories_listed":0,"syntology":null},{"url":null,"slug":"llms-can-check-their-own-results-to-mitigate","title":"LLMs Can Check Their Own Results to Mitigate Hallucinations in Traffic Understanding Tasks","date":"2024-09-19","arxiv_id":"2409.12580","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-models-can-parse-floor-plan","title":"Vision Language Models Can Parse Floor Plan Maps","date":"2024-09-19","arxiv_id":"2409.12842","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoding-style-efficient-fine-tuning-of-llms","title":"Decoding Style: Efficient Fine-Tuning of LLMs for Image-Guided Outfit Recommendation with Preference","date":"2024-09-18","arxiv_id":"2409.12150","repositories_listed":0,"syntology":null},{"url":null,"slug":"nevlp-noise-robust-framework-for-efficient","title":"NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training","date":"2024-09-15","arxiv_id":"2409.09582","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-authenticity-and-quality-of-image","title":"Evaluating authenticity and quality of image captions via sentiment and semantic analyses","date":"2024-09-14","arxiv_id":"2409.09560","repositories_listed":0,"syntology":null},{"url":null,"slug":"blens-contrastive-captioning-of-binary","title":"BLens: Contrastive Captioning of Binary Functions using Ensemble Embedding","date":"2024-09-12","arxiv_id":"2409.07889","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-paintings-and-music-exploring","title":"Bridging Paintings and Music -- Exploring Emotion based Music Generation through Paintings","date":"2024-09-12","arxiv_id":"2409.07827","repositories_listed":0,"syntology":null},{"url":null,"slug":"securing-vision-language-models-with-a-robust","title":"Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks","date":"2024-09-11","arxiv_id":"2409.07353","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-hallucination-in-visual-language-1","title":"Mitigating Hallucination in Visual-Language Models via Re-Balancing Contrastive Decoding","date":"2024-09-10","arxiv_id":"2409.06485","repositories_listed":0,"syntology":null},{"url":null,"slug":"poseembroider-towards-a-3d-visual-semantic","title":"PoseEmbroider: Towards a 3D, Visual, Semantic-aware Human Pose Representation","date":"2024-09-10","arxiv_id":"2409.06535","repositories_listed":0,"syntology":null},{"url":null,"slug":"mllm-fl-multimodal-large-language-model","title":"MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning","date":"2024-09-09","arxiv_id":"2409.06067","repositories_listed":0,"syntology":null},{"url":null,"slug":"foda-pg-for-enhanced-medical-imaging","title":"FODA-PG for Enhanced Medical Imaging Narrative Generation: Adaptive Differentiation of Normal and Abnormal Attributes","date":"2024-09-06","arxiv_id":"2409.03947","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-detail-left-behind-revisiting-self","title":"No Detail Left Behind: Revisiting Self-Retrieval for Fine-Grained Image Captioning","date":"2024-09-04","arxiv_id":"2409.03025","repositories_listed":0,"syntology":null},{"url":null,"slug":"fluent-and-accurate-image-captioning-with-a","title":"Fluent and Accurate Image Captioning with a Self-Trained Reward Model","date":"2024-08-29","arxiv_id":"2408.16827","repositories_listed":0,"syntology":null},{"url":null,"slug":"hand1000-generating-realistic-hands-from-text","title":"Hand1000: Generating Realistic Hands from Text with Only 1,000 Images","date":"2024-08-28","arxiv_id":"2408.15461","repositories_listed":0,"syntology":null},{"url":null,"slug":"pixels-to-prose-understanding-the-art-of","title":"Pixels to Prose: Understanding the art of Image Captioning","date":"2024-08-28","arxiv_id":"2408.15714","repositories_listed":0,"syntology":null},{"url":null,"slug":"bidirectional-awareness-induction-in","title":"Bidirectional Awareness Induction in Autoregressive Seq2Seq Models","date":"2024-08-25","arxiv_id":"2408.13959","repositories_listed":0,"syntology":null},{"url":null,"slug":"shifted-window-fourier-transform-and","title":"Shifted Window Fourier Transform And Retention For Image Captioning","date":"2024-08-25","arxiv_id":"2408.13963","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-brittleness-of-ai-generated-image","title":"The Brittleness of AI-Generated Image Watermarking Techniques: Examining Their Robustness Against Visual Paraphrasing Attacks","date":"2024-08-19","arxiv_id":"2408.10446","repositories_listed":0,"syntology":null},{"url":null,"slug":"pathinsight-instruction-tuning-of-multimodal","title":"PathInsight: Instruction Tuning of Multimodal Datasets and Models for Intelligence Assisted Diagnosis in Histopathology","date":"2024-08-13","arxiv_id":"2408.07037","repositories_listed":0,"syntology":null},{"url":null,"slug":"surveying-the-landscape-of-image-captioning","title":"Surveying the Landscape of Image Captioning Evaluation: A Comprehensive Taxonomy and Novel Ensemble Method","date":"2024-08-09","arxiv_id":"2408.04909","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-journalism-with-ai-a-study-of","title":"Enhancing Journalism with AI: A Study of Contextualized Image Captioning for News Articles using LLMs and LMMs","date":"2024-08-08","arxiv_id":"2408.04331","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-03001","title":"One Framework to Rule Them All: Unifying Multimodal Tasks with LLM Neural-Tuning","date":"2024-08-06","arxiv_id":"2408.03001","repositories_listed":0,"syntology":null},{"url":null,"slug":"modelling-visual-semantics-via-image","title":"Modelling Visual Semantics via Image Captioning to extract Enhanced Multi-Level Cross-Modal Semantic Incongruity Representation with Attention for Multimodal Sarcasm Detection","date":"2024-08-05","arxiv_id":"2408.02595","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01959","title":"Dataset Scale and Societal Consistency Mediate Facial Impression Bias in Vision-Language AI","date":"2024-08-04","arxiv_id":"2408.01959","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01723","title":"A Novel Evaluation Framework for Image2Text Generation","date":"2024-08-03","arxiv_id":"2408.01723","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01228","title":"The Phantom Menace: Unmasking Privacy Leakages in Vision-Language Models","date":"2024-08-02","arxiv_id":"2408.01228","repositories_listed":0,"syntology":null},{"url":null,"slug":"2407-21174","title":"AI Safety in Practice: Enhancing Adversarial Robustness in Multimodal Image Captioning","date":"2024-07-30","arxiv_id":"2407.21174","repositories_listed":0,"syntology":null},{"url":null,"slug":"voldoger-llm-assisted-datasets-for-domain","title":"VolDoGer: LLM-assisted Datasets for Domain Generalization in Vision-Language Tasks","date":"2024-07-29","arxiv_id":"2407.19795","repositories_listed":0,"syntology":null},{"url":null,"slug":"hicescore-a-hierarchical-metric-for-image","title":"HICEScore: A Hierarchical Metric for Image Captioning Evaluation","date":"2024-07-26","arxiv_id":"2407.18589","repositories_listed":0,"syntology":null},{"url":null,"slug":"imperfect-vision-encoders-efficient-and","title":"Imperfect Vision Encoders: Efficient and Robust Tuning for Vision-Language Models","date":"2024-07-23","arxiv_id":"2407.16526","repositories_listed":0,"syntology":null},{"url":null,"slug":"videogamebunny-towards-vision-assistants-for","title":"VideoGameBunny: Towards vision assistants for video games","date":"2024-07-21","arxiv_id":"2407.15295","repositories_listed":0,"syntology":null},{"url":null,"slug":"downstream-pretext-domain-knowledge-traceback","title":"Downstream-Pretext Domain Knowledge Traceback for Active Learning","date":"2024-07-20","arxiv_id":"2407.14720","repositories_listed":0,"syntology":null},{"url":null,"slug":"evlm-an-efficient-vision-language-model-for","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","date":"2024-07-19","arxiv_id":"2407.14177","repositories_listed":0,"syntology":null},{"url":null,"slug":"lookupvit-compressing-visual-information-to-a","title":"LookupViT: Compressing visual information to a limited number of tokens","date":"2024-07-17","arxiv_id":"2407.12753","repositories_listed":0,"syntology":null},{"url":null,"slug":"resampled-datasets-are-not-enough-mitigating","title":"Resampled Datasets Are Not Enough: Mitigating Societal Bias Beyond Single Attributes","date":"2024-07-04","arxiv_id":"2407.03623","repositories_listed":0,"syntology":null},{"url":null,"slug":"bacon-supercharge-your-vlm-with-bag-of","title":"BACON: Improving Clarity of Image Captions via Bag-of-Concept Graphs","date":"2024-07-03","arxiv_id":"2407.03314","repositories_listed":0,"syntology":null},{"url":null,"slug":"certainly-uncertain-a-benchmark-and-metric","title":"Certainly Uncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness","date":"2024-07-02","arxiv_id":"2407.01942","repositories_listed":0,"syntology":null},{"url":null,"slug":"assistive-image-annotation-systems-with-deep","title":"Assistive Image Annotation Systems with Deep Learning and Natural Language Capabilities: A Review","date":"2024-06-28","arxiv_id":"2407.00252","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-cherry-picker-learning-from-high-quality","title":"Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language","date":"2024-06-28","arxiv_id":"2406.20085","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-image-captioning-using-cnn-cnn","title":"Explainable Image Captioning using CNN- CNN architecture and Hierarchical Attention","date":"2024-06-28","arxiv_id":"2407.09556","repositories_listed":0,"syntology":null},{"url":null,"slug":"raven-multitask-retrieval-augmented-vision","title":"RAVEN: Multitask Retrieval Augmented Vision-Language Learning","date":"2024-06-27","arxiv_id":"2406.19150","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-temporal-change-explanations-from-bi","title":"Towards Temporal Change Explanations from Bi-Temporal Satellite Images","date":"2024-06-27","arxiv_id":"2407.09548","repositories_listed":0,"syntology":null},{"url":null,"slug":"mumu-bootstrapping-multimodal-image","title":"MUMU: Bootstrapping Multimodal Image Generation from Text-to-Image Data","date":"2024-06-26","arxiv_id":"2406.18790","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-scientific-figure-captioning","title":"Enhancing Scientific Figure Captioning Through Cross-modal Learning","date":"2024-06-24","arxiv_id":"2406.17047","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-object-grounding-really-reduce","title":"Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?","date":"2024-06-20","arxiv_id":"2406.14492","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcing-pre-trained-models-using","title":"Reinforcing Pre-trained Models Using Counterfactual Images","date":"2024-06-19","arxiv_id":"2406.13316","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-more-details-always-introduce-more","title":"Do More Details Always Introduce More Hallucinations in LVLM-based Image Captioning?","date":"2024-06-18","arxiv_id":"2406.12663","repositories_listed":0,"syntology":null},{"url":null,"slug":"llarva-vision-action-instruction-tuning","title":"LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning","date":"2024-06-17","arxiv_id":"2406.11815","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-pixels-to-prose-a-large-dataset-of-dense","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","date":"2024-06-14","arxiv_id":"2406.10328","repositories_listed":0,"syntology":null},{"url":null,"slug":"ospc-detecting-harmful-memes-with-large","title":"OSPC: Detecting Harmful Memes with Large Language Model as a Catalyst","date":"2024-06-14","arxiv_id":"2406.09779","repositories_listed":0,"syntology":null},{"url":null,"slug":"ds-biomed-at-imageclefmedical-caption-2024","title":"DS@BioMed at ImageCLEFmedical Caption 2024: Enhanced Attention Mechanisms in Medical Caption Generation through Concept Detection Integration","date":"2024-06-01","arxiv_id":"2406.00391","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-in-different-languages","title":"Image captioning in different languages","date":"2024-05-31","arxiv_id":"2407.09495","repositories_listed":0,"syntology":null},{"url":"/paper/opendas-domain-adaptation-for-open-vocabulary","slug":"opendas-domain-adaptation-for-open-vocabulary","title":"OpenDAS: Open-Vocabulary Domain Adaptation for 2D and 3D Segmentation","date":"2024-05-30","arxiv_id":"2405.20141","repositories_listed":0,"syntology":null},{"url":null,"slug":"metatoken-detecting-hallucination-in-image","title":"MetaToken: Detecting Hallucination in Image Descriptions by Meta Classification","date":"2024-05-29","arxiv_id":"2405.19186","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-generative-embedding-model","title":"Multi-Modal Generative Embedding Model","date":"2024-05-29","arxiv_id":"2405.19333","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-only-synthesis-for-image-captioning","title":"Text-only Synthesis for Image Captioning","date":"2024-05-28","arxiv_id":"2405.18258","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-culturally-aware-are-vision-language","title":"How Culturally Aware are Vision-Language Models?","date":"2024-05-24","arxiv_id":"2405.17475","repositories_listed":0,"syntology":null},{"url":null,"slug":"lg-vq-language-guided-codebook-learning","title":"LG-VQ: Language-Guided Codebook Learning","date":"2024-05-23","arxiv_id":"2405.14206","repositories_listed":0,"syntology":null},{"url":null,"slug":"crosscheckgpt-universal-hallucination-ranking","title":"CrossCheckGPT: Universal Hallucination Ranking for Multimodal Foundation Models","date":"2024-05-22","arxiv_id":"2405.13684","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-retrieval-augmented-architectures-for","title":"Towards Retrieval-Augmented Architectures for Image Captioning","date":"2024-05-21","arxiv_id":"2405.13127","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-emotion-recognition-using-large","title":"Contextual Emotion Recognition using Large Vision Language Models","date":"2024-05-14","arxiv_id":"2405.08992","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-machine-translation-to-augment","title":"Using Machine Translation to Augment Multilingual Classification","date":"2024-05-09","arxiv_id":"2405.05478","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-toolchain-for-comprehensive-audio-video","title":"A Toolchain for Comprehensive Audio/Video Analysis Using Deep Learning Based Multimodal Approach (A use case of riot or violent context detection)","date":"2024-05-02","arxiv_id":"2407.03110","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-human-vision-the-role-of-large-vision","title":"Beyond Human Vision: The Role of Large Vision Language Models in Microscope Image Analysis","date":"2024-05-01","arxiv_id":"2405.00876","repositories_listed":0,"syntology":null}],"record_sha256":"65cf0dcac4447696265e7265980be665e8bc1cb9420381aa3c1d3c0e5c3b7325","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}