{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-captioning/papers/11","list_of":"/task/image-captioning","task":"Image Captioning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":11,"pages_in_order":19,"rows_per_page":100,"rows":[1001,1100],"of":1878,"counts":{"archive_papers_tagged":1878,"with_a_code_link":774,"where_syntology_ran_a_sample":243,"not_listed_spam_title":0,"listed":1878,"listed_where_code_ran":243,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":201,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":201,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-captioning","prev":"/task/image-captioning/papers/10","next":"/task/image-captioning/papers/12","papers":[{"url":null,"slug":"the-pyramid-of-captions","title":"What Makes for Good Image Captions?","date":"2024-05-01","arxiv_id":"2405.00485","repositories_listed":0,"syntology":null},{"url":null,"slug":"compressed-image-captioning-using-cnn-based","title":"Compressed Image Captioning using CNN-based Encoder-Decoder Framework","date":"2024-04-28","arxiv_id":"2404.18062","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-text-based-person-search","title":"Semi-supervised Text-based Person Search","date":"2024-04-28","arxiv_id":"2404.18106","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-text-to-video-retrieval-from-image","title":"Learning text-to-video retrieval from image captioning","date":"2024-04-26","arxiv_id":"2404.17498","repositories_listed":0,"syntology":null},{"url":null,"slug":"mm-phyrlhf-reinforcement-learning-framework","title":"MM-PhyRLHF: Reinforcement Learning Framework for Multimodal Physics Question-Answering","date":"2024-04-19","arxiv_id":"2404.12926","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-solution-for-the-cvpr2024-nice-image","title":"The Solution for the CVPR2024 NICE Image Captioning Challenge","date":"2024-04-19","arxiv_id":"2404.12739","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-speculative-decoding-for-multimodal-large","title":"On Speculative Decoding for Multimodal Large Language Models","date":"2024-04-13","arxiv_id":"2404.08856","repositories_listed":0,"syntology":null},{"url":null,"slug":"panoptic-perception-a-novel-task-and-fine","title":"Panoptic Perception: A Novel Task and Fine-grained Dataset for Universal Remote Sensing Image Interpretation","date":"2024-04-06","arxiv_id":"2404.04608","repositories_listed":0,"syntology":null},{"url":null,"slug":"would-deep-generative-models-amplify-bias-in","title":"Would Deep Generative Models Amplify Bias in Future Models?","date":"2024-04-04","arxiv_id":"2404.03242","repositories_listed":0,"syntology":null},{"url":null,"slug":"jump-self-attention-capturing-high-order","title":"Jump Self-attention: Capturing High-order Statistics in Transformers","date":"2024-04-03","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"vlrm-vision-language-models-act-as-reward","title":"VLRM: Vision-Language Models act as Reward Models for Image Captioning","date":"2024-04-02","arxiv_id":"2404.01911","repositories_listed":0,"syntology":null},{"url":null,"slug":"llama-excitor-general-instruction-tuning-via","title":"LLaMA-Excitor: General Instruction Tuning via Indirect Feature Interaction","date":"2024-04-01","arxiv_id":"2404.00913","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-multi-modal-large-language-and","title":"A Review of Multi-Modal Large Language and Vision Models","date":"2024-03-28","arxiv_id":"2404.01322","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-data-centric-image-captioning-with","title":"Text Data-Centric Image Captioning with Interactive Prompts","date":"2024-03-28","arxiv_id":"2403.19193","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-large-language-models-from","title":"A Survey on Large Language Models from Concept to Implementation","date":"2024-03-27","arxiv_id":"2403.18969","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-report-generation-for-lung","title":"Automated Report Generation for Lung Cytological Images Using a CNN Vision Classifier and Multiple-Transformer Text Decoders: Preliminary Study","date":"2024-03-26","arxiv_id":"2403.18151","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-image-captioning-considering","title":"Semi-Supervised Image Captioning Considering Wasserstein Graph Matching","date":"2024-03-26","arxiv_id":"2403.17995","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-solution-for-the-iccv-2023-1st-scientific","title":"The Solution for the ICCV 2023 1st Scientific Figure Captioning Challenge","date":"2024-03-26","arxiv_id":"2403.17342","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-hallucination-definition","title":"Visual Hallucination: Definition, Quantification, and Prescriptive Remediations","date":"2024-03-26","arxiv_id":"2403.17306","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-in-news-report-scenario","title":"Image Captioning in news report scenario","date":"2024-03-24","arxiv_id":"2403.16209","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multimodal-approach-for-cross-domain-image","title":"A Multimodal Approach for Cross-Domain Image Retrieval","date":"2024-03-22","arxiv_id":"2403.15152","repositories_listed":0,"syntology":null},{"url":null,"slug":"myvlm-personalizing-vlms-for-user-specific","title":"MyVLM: Personalizing VLMs for User-Specific Queries","date":"2024-03-21","arxiv_id":"2403.14599","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-baselines-for-data-efficient","title":"Improved Baselines for Data-efficient Perceptual Augmentation of LLMs","date":"2024-03-20","arxiv_id":"2403.13499","repositories_listed":0,"syntology":null},{"url":null,"slug":"inserting-faces-inside-captions-image","title":"Inserting Faces inside Captions: Image Captioning with Attention Guided Merging","date":"2024-03-20","arxiv_id":"2405.02305","repositories_listed":0,"syntology":null},{"url":null,"slug":"as-firm-as-their-foundations-can-open-sourced","title":"As Firm As Their Foundations: Can open-sourced foundation models be used to create adversarial examples for downstream tasks?","date":"2024-03-19","arxiv_id":"2403.12693","repositories_listed":0,"syntology":null},{"url":null,"slug":"entity6k-a-large-open-domain-evaluation","title":"Entity6K: A Large Open-Domain Evaluation Dataset for Real-World Entity Recognition","date":"2024-03-19","arxiv_id":"2403.12339","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-multimodal-in-context-learning-for","title":"Towards Multimodal In-Context Learning for Vision & Language Models","date":"2024-03-19","arxiv_id":"2403.12736","repositories_listed":0,"syntology":null},{"url":null,"slug":"tarn-vist-topic-aware-reinforcement-network","title":"TARN-VIST: Topic Aware Reinforcement Network for Visual Storytelling","date":"2024-03-18","arxiv_id":"2403.11550","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-vqa-with-frozen-llms-a-tale-of-two","title":"Few-Shot VQA with Frozen LLMs: A Tale of Two Approaches","date":"2024-03-17","arxiv_id":"2403.11317","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comprehensive-survey-of-3d-dense-captioning","title":"A Comprehensive Survey of 3D Dense Captioning: Localizing and Describing Objects in 3D Scenes","date":"2024-03-12","arxiv_id":"2403.07469","repositories_listed":0,"syntology":null},{"url":null,"slug":"synth-2-boosting-visual-language-models-with","title":"Synth$^2$: Boosting Visual-Language Models with Synthetic Captions and Image Embeddings","date":"2024-03-12","arxiv_id":"2403.07750","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-based-multitask-learning-for","title":"Transformer based Multitask Learning for Image Captioning and Object Detection","date":"2024-03-10","arxiv_id":"2403.06292","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-case-for-evaluating-multimodal","title":"The Case for Evaluating Multimodal Translation Models on Text Datasets","date":"2024-03-05","arxiv_id":"2403.03014","repositories_listed":0,"syntology":null},{"url":null,"slug":"entity-aware-multimodal-alignment-framework","title":"EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning","date":"2024-02-29","arxiv_id":"2402.19404","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-model-based-caption","title":"Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction","date":"2024-02-28","arxiv_id":"2402.17969","repositories_listed":0,"syntology":null},{"url":null,"slug":"arcsin-adaptive-ranged-cosine-similarity","title":"ArcSin: Adaptive ranged cosine Similarity injected noise for Language-Driven Visual Tasks","date":"2024-02-27","arxiv_id":"2402.17298","repositories_listed":0,"syntology":null},{"url":"/paper/fine-tuning-clip-text-encoders-with-two-step","slug":"fine-tuning-clip-text-encoders-with-two-step","title":"Fine-tuning CLIP Text Encoders with Two-step Paraphrasing","date":"2024-02-23","arxiv_id":"2402.15120","repositories_listed":0,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":1,"n_instrument":2,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":3,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/fine-tuning-clip-text-encoders-with-two-step#ran","syntology_url":"https://syntology.ai/paper/2402.15120","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2402.15120"}},"official":null}},{"url":null,"slug":"exploring-the-frontier-of-vision-language","title":"Exploring the Frontier of Vision-Language Models: A Survey of Current Methodologies and Future Directions","date":"2024-02-20","arxiv_id":"2404.07214","repositories_listed":0,"syntology":null},{"url":"/paper/evaluating-image-review-ability-of-vision","slug":"evaluating-image-review-ability-of-vision","title":"IRR: Image Review Ranking Framework for Evaluating Vision-Language Models","date":"2024-02-19","arxiv_id":"2402.12121","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-tailor-mitigating-catastrophic","title":"Model Tailor: Mitigating Catastrophic Forgetting in Multi-modal Large Language Models","date":"2024-02-19","arxiv_id":"2402.12048","repositories_listed":0,"syntology":null},{"url":null,"slug":"cobra-effect-in-reference-free-image","title":"Cobra Effect in Reference-Free Image Captioning Metrics","date":"2024-02-18","arxiv_id":"2402.11572","repositories_listed":0,"syntology":null},{"url":null,"slug":"captions-are-worth-a-thousand-words-enhancing","title":"Captions Are Worth a Thousand Words: Enhancing Product Retrieval with Pretrained Image-to-Text Models","date":"2024-02-13","arxiv_id":"2402.08532","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-how-to-ask-cycle-consistency-refines","title":"Learning How To Ask: Cycle-Consistency Refines Prompts in Multimodal Foundation Models","date":"2024-02-13","arxiv_id":"2402.08756","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-learned-sparse-retrieval-for-image","title":"Multimodal Learned Sparse Retrieval for Image Suggestion","date":"2024-02-12","arxiv_id":"2402.07736","repositories_listed":0,"syntology":null},{"url":null,"slug":"consistency-models-improve-diffusion-inverse","title":"Consistency Model is an Effective Posterior Sample Approximation for Diffusion Inverse Solvers","date":"2024-02-09","arxiv_id":"2403.12063","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-language-models-for-captioning-and","title":"Large Language Models for Captioning and Retrieving Remote Sensing Images","date":"2024-02-09","arxiv_id":"2402.06475","repositories_listed":0,"syntology":null},{"url":null,"slug":"cic-a-framework-for-culturally-aware-image","title":"CIC: A Framework for Culturally-Aware Image Captioning","date":"2024-02-08","arxiv_id":"2402.05374","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-visual-culture-awareness-in-gpt-4v","title":"Exploring Visual Culture Awareness in GPT-4V: A Comprehensive Probing","date":"2024-02-08","arxiv_id":"2402.06015","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-for-brazilian-portuguese","title":"Image captioning for Brazilian Portuguese using GRIT model","date":"2024-02-07","arxiv_id":"2402.05106","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-or-image-what-is-more-important-in-cross","title":"Text or Image? What is More Important in Cross-Domain Generalization Capabilities of Hate Meme Detection Models?","date":"2024-02-07","arxiv_id":"2402.04967","repositories_listed":0,"syntology":null},{"url":null,"slug":"pics-pipeline-for-image-captioning-and-search","title":"PICS: Pipeline for Image Captioning and Search","date":"2024-02-01","arxiv_id":"2402.10090","repositories_listed":0,"syntology":null},{"url":null,"slug":"sco-vist-social-interaction-commonsense","title":"SCO-VIST: Social Interaction Commonsense Knowledge-based Visual Storytelling","date":"2024-02-01","arxiv_id":"2402.00319","repositories_listed":0,"syntology":null},{"url":"/paper/coco-is-all-you-need-for-visual-instruction","slug":"coco-is-all-you-need-for-visual-instruction","title":"COCO is \"ALL'' You Need for Visual Instruction Fine-tuning","date":"2024-01-17","arxiv_id":"2401.08968","repositories_listed":0,"syntology":null},{"url":null,"slug":"ktvic-a-vietnamese-image-captioning-dataset","title":"KTVIC: A Vietnamese Image Captioning Dataset on the Life Domain","date":"2024-01-16","arxiv_id":"2401.08100","repositories_listed":0,"syntology":null},{"url":null,"slug":"jewelry-recognition-via-encoder-decoder","title":"Jewelry Recognition via Encoder-Decoder Models","date":"2024-01-15","arxiv_id":"2401.08003","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-else-would-i-like-a-user-simulator-using","title":"What Else Would I Like? A User Simulator using Alternatives for Improved Evaluation of Fashion Conversational Recommendation Systems","date":"2024-01-11","arxiv_id":"2401.05783","repositories_listed":0,"syntology":null},{"url":null,"slug":"let-s-go-shopping-lgs-web-scale-image-text","title":"Let's Go Shopping (LGS) -- Web-Scale Image-Text Dataset for Visual Concept Understanding","date":"2024-01-09","arxiv_id":"2401.04575","repositories_listed":0,"syntology":null},{"url":null,"slug":"mami-multi-attentional-mutual-information-for","title":"MAMI: Multi-Attentional Mutual-Information for Long Sequence Neuron Captioning","date":"2024-01-05","arxiv_id":"2401.02744","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-oriented-backdoor-attack-against-image","title":"Object-oriented backdoor attack against image captioning","date":"2024-01-05","arxiv_id":"2401.02600","repositories_listed":0,"syntology":null},{"url":"/paper/sycoca-symmetrizing-contrastive-captioners","slug":"sycoca-symmetrizing-contrastive-captioners","title":"SyCoCa: Symmetrizing Contrastive Captioners with Attentive Masking for Multimodal Alignment","date":"2024-01-04","arxiv_id":"2401.02137","repositories_listed":0,"syntology":null},{"url":null,"slug":"social-media-ready-caption-generation-for","title":"Social Media Ready Caption Generation for Brands","date":"2024-01-03","arxiv_id":"2401.01637","repositories_listed":0,"syntology":null},{"url":null,"slug":"cycle-consistency-learning-for-captioning-and","title":"Cycle-Consistency Learning for Captioning and Grounding","date":"2023-12-23","arxiv_id":"2312.15162","repositories_listed":0,"syntology":null},{"url":null,"slug":"llm4vg-large-language-models-evaluation-for","title":"LLM4VG: Large Language Models Evaluation for Video Grounding","date":"2023-12-21","arxiv_id":"2312.14206","repositories_listed":0,"syntology":null},{"url":null,"slug":"dietary-assessment-with-multimodal-chatgpt-a","title":"Dietary Assessment with Multimodal ChatGPT: A Systematic Analysis","date":"2023-12-14","arxiv_id":"2312.08592","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-cross-modal-alignment-with","title":"Improving Cross-modal Alignment with Synthetic Pairs for Text-only Image Captioning","date":"2023-12-14","arxiv_id":"2312.08865","repositories_listed":0,"syntology":null},{"url":null,"slug":"synocene-beyond-the-anthropocene-de","title":"Synocene, Beyond the Anthropocene: De-Anthropocentralising Human-Nature-AI Interaction","date":"2023-12-13","arxiv_id":"2312.11525","repositories_listed":0,"syntology":null},{"url":null,"slug":"compress-align-curating-image-text-data-with","title":"Filter & Align: Leveraging Human Knowledge to Curate Image-Text Data","date":"2023-12-11","arxiv_id":"2312.06726","repositories_listed":0,"syntology":null},{"url":"/paper/lyrics-boosting-fine-grained-language-vision","slug":"lyrics-boosting-fine-grained-language-vision","title":"Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects","date":"2023-12-08","arxiv_id":"2312.05278","repositories_listed":0,"syntology":null},{"url":null,"slug":"user-aware-prefix-tuning-is-a-good-learner","title":"User-Aware Prefix-Tuning is a Good Learner for Personalized Image Captioning","date":"2023-12-08","arxiv_id":"2312.04793","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-robustness-of-large-multimodal-models","title":"On the Robustness of Large Multimodal Models Against Image Adversarial Attacks","date":"2023-12-06","arxiv_id":"2312.03777","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-more-unified-in-context-visual","title":"Towards More Unified In-context Visual Understanding","date":"2023-12-05","arxiv_id":"2312.02520","repositories_listed":0,"syntology":null},{"url":null,"slug":"clamp-contrastive-language-model-prompt","title":"CLAMP: Contrastive LAnguage Model Prompt-tuning","date":"2023-12-04","arxiv_id":"2312.01629","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-image-captioning-with-neural-models","title":"Enhancing Image Captioning with Neural Models","date":"2023-12-01","arxiv_id":"2312.00435","repositories_listed":0,"syntology":null},{"url":"/paper/omni-smola-boosting-generalist-multimodal","slug":"omni-smola-boosting-generalist-multimodal","title":"Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts","date":"2023-12-01","arxiv_id":"2312.00968","repositories_listed":0,"syntology":null},{"url":null,"slug":"instructseq-unifying-vision-tasks-with","title":"InstructSeq: Unifying Vision Tasks with Instruction-conditioned Multi-modal Sequence Generation","date":"2023-11-30","arxiv_id":"2311.18835","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-natural-language-processing-based-approach","title":"A natural language processing-based approach: mapping human perception by understanding deep semantic features in street view images","date":"2023-11-29","arxiv_id":"2311.17354","repositories_listed":0,"syntology":null},{"url":null,"slug":"evcap-retrieval-augmented-image-captioning","title":"EVCap: Retrieval-Augmented Image Captioning with External Visual-Name Memory for Open-World Comprehension","date":"2023-11-27","arxiv_id":"2311.15879","repositories_listed":0,"syntology":null},{"url":null,"slug":"decap-towards-generalized-explicit-caption","title":"DECap: Towards Generalized Explicit Caption Editing via Diffusion Mechanism","date":"2023-11-25","arxiv_id":"2311.14920","repositories_listed":0,"syntology":null},{"url":null,"slug":"violet-a-vision-language-model-for-arabic","title":"Violet: A Vision-Language Model for Arabic Image Captioning with Gemini Decoder","date":"2023-11-15","arxiv_id":"2311.08844","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-image-captioning-via-predicting","title":"Improving Image Captioning via Predicting Structured Concepts","date":"2023-11-14","arxiv_id":"2311.08223","repositories_listed":0,"syntology":null},{"url":null,"slug":"holistic-evaluation-of-gpt-4v-for-biomedical","title":"Holistic Evaluation of GPT-4V for Biomedical Imaging","date":"2023-11-10","arxiv_id":"2312.05256","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-bridge-the-gap-between-modalities-a","title":"How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model","date":"2023-11-10","arxiv_id":"2311.07594","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-analytics-for-efficient-image","title":"Visual Analytics for Efficient Image Exploration and User-Guided Image Captioning","date":"2023-11-02","arxiv_id":"2311.01016","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-knowledge-injection-for-radiology","title":"Enhanced Knowledge Injection for Radiology Report Generation","date":"2023-11-01","arxiv_id":"2311.00399","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-a-whole-slide-image-can-tell-subtype","title":"What a Whole Slide Image Can Tell? Subtype-guided Masked Transformer for Pathological Image Captioning","date":"2023-10-31","arxiv_id":"2310.20607","repositories_listed":0,"syntology":null},{"url":null,"slug":"bidirectional-captioning-for-clinically","title":"Improving Medical Visual Representations via Radiology Report Generation","date":"2023-10-30","arxiv_id":"2310.19635","repositories_listed":0,"syntology":null},{"url":null,"slug":"cropcap-embedding-visual-cross-partition","title":"CropCap: Embedding Visual Cross-Partition Dependency for Image Captioning","date":"2023-10-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"impressions-understanding-visual-semiotics","title":"Impressions: Understanding Visual Semiotics and Aesthetic Impact","date":"2023-10-27","arxiv_id":"2310.17887","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-picture-is-worth-a-thousand-words","title":"A Picture is Worth a Thousand Words: Principled Recaptioning Improves Image Generation","date":"2023-10-25","arxiv_id":"2310.16656","repositories_listed":0,"syntology":null},{"url":null,"slug":"cultural-and-linguistic-diversity-improves","title":"Semantic and Expressive Variation in Image Captions Across Languages","date":"2023-10-22","arxiv_id":"2310.14356","repositories_listed":0,"syntology":null},{"url":null,"slug":"clair-evaluating-image-captions-with-large","title":"CLAIR: Evaluating Image Captions with Large Language Models","date":"2023-10-19","arxiv_id":"2310.12971","repositories_listed":0,"syntology":null},{"url":null,"slug":"lost-in-translation-when-gpt-4v-ision-can-t","title":"Lost in Translation: When GPT-4V(ision) Can't See Eye to Eye with Text. A Vision-Language-Consistency Analysis of VLLMs and Beyond","date":"2023-10-19","arxiv_id":"2310.12520","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-automatic-satellite-images-captions","title":"Towards Automatic Satellite Images Captions Generation Using Large Language Models","date":"2023-10-17","arxiv_id":"2310.11392","repositories_listed":0,"syntology":null},{"url":null,"slug":"ziya-vl-bilingual-large-vision-language-model","title":"Ziya-Visual: Bilingual Large Vision-Language Model via Multi-Task Instruction Tuning","date":"2023-10-12","arxiv_id":"2310.08166","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-study-of-pre-trained-cnns-and","title":"A Comparative Study of Pre-trained CNNs and GRU-Based Attention for Image Caption Generation","date":"2023-10-11","arxiv_id":"2310.07252","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-mitosis-detection-on-histopathology","title":"Improving mitosis detection on histopathology images using large vision-language models","date":"2023-10-11","arxiv_id":"2310.07176","repositories_listed":0,"syntology":null},{"url":null,"slug":"langnav-language-as-a-perceptual","title":"LangNav: Language as a Perceptual Representation for Navigation","date":"2023-10-11","arxiv_id":"2310.07889","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-solution-for-the-cvpr2023-nice-image","title":"The Solution for the CVPR2023 NICE Image Captioning Challenge","date":"2023-10-10","arxiv_id":"2310.06879","repositories_listed":0,"syntology":null},{"url":null,"slug":"vicor-bridging-visual-understanding-and","title":"ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models","date":"2023-10-09","arxiv_id":"2310.05872","repositories_listed":0,"syntology":null},{"url":null,"slug":"lightweight-in-context-tuning-for-multimodal","title":"Lightweight In-Context Tuning for Multimodal Unified Models","date":"2023-10-08","arxiv_id":"2310.05109","repositories_listed":0,"syntology":null}],"record_sha256":"d95236e3e2e363f45b972b8184798859fec4ed1d7735c3d34c733d66dcc03b83","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}