{"url":"/sota/image-captioning-on-coco-captions","task":{"name":"Image Captioning","url":"/task/image-captioning","note":null},"dataset":{"name":"COCO Captions","url":"/dataset/coco-captions"},"category":"Computer Vision","categories":["Computer Vision","Natural Language Processing"],"category_note":null,"description":"**Image Captioning** is the task of describing the content of an image in words. This task lies at the intersection of computer vision and natural language processing. Most image captioning systems use an encoder-decoder framework, where an input image is encoded into an intermediate representation of the information in the image, and then decoded into a descriptive text sequence. The most popular benchmarks are nocaps and COCO, and models are typically evaluated according to a BLEU or CIDER metric.\r\n\r\n( Image credit: [Reflective Decoding Network for Image Captioning, ICCV'19](https://openaccess.thecvf.com/content_ICCV_2019/papers/Ke_Reflective_Decoding_Network_for_Image_Captioning_ICCV_2019_paper.pdf))","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["BLEU-4","CIDER","METEOR","SPICE","ROUGE-L","BLEU-1","BLEU-2","BLEU-3","CLIPScore"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"BLEU-4":"higher","CIDER":null,"METEOR":null,"SPICE":null,"ROUGE-L":"higher","BLEU-1":"higher","BLEU-2":"higher","BLEU-3":"higher","CLIPScore":null}},"counts":{"rows":41,"rows_with_code":36,"rows_with_paper_page":40,"rows_dated":40,"rows_using_additional_data":2},"rows":[{"rank_in_archive_order":1,"model":"mPLUG","metrics":{"BLEU-4":"46.5","CIDER":"155.1","METEOR":"32.0","SPICE":"26.0"},"uses_additional_data":false,"paper_date":"2022-05-24","paper":"/paper/mplug-effective-and-efficient-vision-language","paper_url":"https://arxiv.org/abs/2205.12005v2","paper_title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","code":"https://github.com/modelscope/modelscope","n_code_links":3,"syntology":null},{"rank_in_archive_order":2,"model":"OFA","metrics":{"BLEU-4":"44.9","CIDER":"154.9","METEOR":"32.5","SPICE":"26.6"},"uses_additional_data":false,"paper_date":"2022-02-07","paper":"/paper/unifying-architectures-tasks-and-modalities","paper_url":"https://arxiv.org/abs/2202.03052v2","paper_title":"OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework","code":"https://github.com/modelscope/modelscope","n_code_links":4,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"GIT","metrics":{"BLEU-4":"44.1","CIDER":"151.1","METEOR":" 32.2","SPICE":"26.3"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/git-a-generative-image-to-text-transformer","paper_url":"https://arxiv.org/abs/2205.14100v5","paper_title":"GIT: A Generative Image-to-text Transformer for Vision and Language","code":"https://github.com/microsoft/GenerativeImage2Text","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":21,"n_samples":21,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"BLIP-2 ViT-G OPT 2.7B (zero-shot)","metrics":{"BLEU-4":"43.7","CIDER":"145.8"},"uses_additional_data":false,"paper_date":"2023-01-30","paper":"/paper/blip-2-bootstrapping-language-image-pre","paper_url":"https://arxiv.org/abs/2301.12597v3","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","code":"https://github.com/huggingface/transformers","n_code_links":17,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":1}},{"rank_in_archive_order":5,"model":"BLIP-2 ViT-G OPT 6.7B (zero-shot)","metrics":{"BLEU-4":"43.5","CIDER":"145.2"},"uses_additional_data":false,"paper_date":"2023-01-30","paper":"/paper/blip-2-bootstrapping-language-image-pre","paper_url":"https://arxiv.org/abs/2301.12597v3","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","code":"https://github.com/huggingface/transformers","n_code_links":17,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":1}},{"rank_in_archive_order":6,"model":"ExpansionNet v2 (No VL pretraining)","metrics":{"BLEU-1":"83.5","BLEU-4":"42.7","CIDER":"143.7","METEOR":"30.6","ROUGE-L":"61.1","SPICE":"24.7"},"uses_additional_data":false,"paper_date":"2022-08-13","paper":"/paper/expansionnet-v2-block-static-expansion-in","paper_url":"https://arxiv.org/abs/2208.06551v4","paper_title":"Exploiting Multiple Sequence Lengths in Fast End to End Training for Image Captioning","code":"https://github.com/jchenghu/expansionnet_v2","n_code_links":1,"syntology":null},{"rank_in_archive_order":7,"model":"LEMON","metrics":{"BLEU-4":"42.6","CIDER":"145.5","METEOR":"31.4","SPICE":"25.5"},"uses_additional_data":false,"paper_date":"2021-11-24","paper":"/paper/scaling-up-vision-language-pre-training-for","paper_url":"https://arxiv.org/abs/2111.12233v2","paper_title":"Scaling Up Vision-Language Pre-training for Image Captioning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":8,"model":"BLIP-2 ViT-G FlanT5 XL (zero-shot)","metrics":{"BLEU-4":"42.4","CIDER":"144.5"},"uses_additional_data":false,"paper_date":"2023-01-30","paper":"/paper/blip-2-bootstrapping-language-image-pre","paper_url":"https://arxiv.org/abs/2301.12597v3","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","code":"https://github.com/huggingface/transformers","n_code_links":17,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":1}},{"rank_in_archive_order":9,"model":"GRIT (No VL pretraining - base)","metrics":{"BLEU-1":"84.2","BLEU-4":"42.4","CIDER":"144.2","METEOR":"30.6","ROUGE-L":"60.7","SPICE":"24.3"},"uses_additional_data":false,"paper_date":"2022-07-20","paper":"/paper/grit-faster-and-better-image-captioning","paper_url":"https://arxiv.org/abs/2207.09666v1","paper_title":"GRIT: Faster and Better Image captioning Transformer Using Dual Visual Features","code":"https://github.com/davidnvq/grit","n_code_links":2,"syntology":null},{"rank_in_archive_order":10,"model":"Prompt Tuning","metrics":{"BLEU-4":"41.81","CIDER":"141.4","METEOR":"31.51","SPICE":"24.42"},"uses_additional_data":false,"paper_date":"2022-08-04","paper":"/paper/prompt-tuning-for-generative-multimodal","paper_url":"https://arxiv.org/abs/2208.02532v1","paper_title":"Prompt Tuning for Generative Multimodal Pretrained Models","code":"https://github.com/ofa-sys/ofa","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":11,"model":"Oscar","metrics":{"BLEU-4":"41.7","CIDER":"140","METEOR":"30.6","SPICE":"24.5"},"uses_additional_data":false,"paper_date":"2020-04-13","paper":"/paper/oscar-object-semantics-aligned-pre-training","paper_url":"https://arxiv.org/abs/2004.06165v5","paper_title":"Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks","code":"https://github.com/rmokady/clip_prefix_caption","n_code_links":4,"syntology":{"n_ran":11,"n_unverified":12,"n_samples":23,"n_pointer_only_licence":0}},{"rank_in_archive_order":12,"model":"Xmodal-Ctx","metrics":{"BLEU-1":"83.4","BLEU-4":"41.4","CIDER":"139.9","METEOR":"30.4","ROUGE-L":"60.4","SPICE":"24.0"},"uses_additional_data":false,"paper_date":"2022-05-09","paper":"/paper/beyond-a-pre-trained-object-detector-cross","paper_url":"https://arxiv.org/abs/2205.04363v2","paper_title":"Beyond a Pre-Trained Object Detector: Cross-Modal Textual and Visual Context for Image Captioning","code":"https://github.com/GT-RIPL/Xmodal-Ctx","n_code_links":1,"syntology":null},{"rank_in_archive_order":13,"model":"Xmodal-Ctx + OSCAR","metrics":{"BLEU-4":"41.3","CIDER":"142.2","SPICE":"24.9"},"uses_additional_data":false,"paper_date":"2022-05-09","paper":"/paper/beyond-a-pre-trained-object-detector-cross","paper_url":"https://arxiv.org/abs/2205.04363v2","paper_title":"Beyond a Pre-Trained Object Detector: Cross-Modal Textual and Visual Context for Image Captioning","code":"https://github.com/GT-RIPL/Xmodal-Ctx","n_code_links":1,"syntology":null},{"rank_in_archive_order":14,"model":"X-VLM (base)","metrics":{"BLEU-4":"41.3","CIDER":"140.8"},"uses_additional_data":false,"paper_date":"2021-11-16","paper":"/paper/multi-grained-vision-language-pre-training","paper_url":"https://arxiv.org/abs/2111.08276v3","paper_title":"Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts","code":"https://github.com/zengyan-97/x-vlm","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":15,"model":"VinVL","metrics":{"BLEU-4":"41.0","CIDER":"140.9","METEOR":"31.1","SPICE":"25.2"},"uses_additional_data":false,"paper_date":"2021-01-02","paper":"/paper/vinvl-making-visual-representations-matter-in","paper_url":"https://arxiv.org/abs/2101.00529v2","paper_title":"VinVL: Revisiting Visual Representations in Vision-Language Models","code":"https://github.com/microsoft/Oscar","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":16,"model":"CoCa","metrics":{"BLEU-4":"40.9","CIDER":"143.6","METEOR":"33.9","SPICE":"24.7"},"uses_additional_data":false,"paper_date":"2022-05-04","paper":"/paper/coca-contrastive-captioners-are-image-text","paper_url":"https://arxiv.org/abs/2205.01917v2","paper_title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","code":"https://github.com/mlfoundations/open_clip","n_code_links":6,"syntology":{"n_ran":9,"n_unverified":8,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":17,"model":"SimVLM","metrics":{"BLEU-4":"40.6","CIDER":"143.3","METEOR":"33.4","SPICE":"25.4"},"uses_additional_data":false,"paper_date":"2021-08-24","paper":"/paper/simvlm-simple-visual-language-model","paper_url":"https://arxiv.org/abs/2108.10904v3","paper_title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","code":"https://github.com/yulong-XJTU/SimVLM","n_code_links":2,"syntology":{"n_ran":18,"n_unverified":19,"n_samples":37,"n_pointer_only_licence":28}},{"rank_in_archive_order":18,"model":"Prismer","metrics":{"BLEU-4":"40.4","CIDER":"136.5","METEOR":"31.4","SPICE":"24.4"},"uses_additional_data":false,"paper_date":"2023-03-04","paper":"/paper/prismer-a-vision-language-model-with-an","paper_url":"https://arxiv.org/abs/2303.02506v3","paper_title":"Prismer: A Vision-Language Model with Multi-Task Experts","code":"https://github.com/nvlabs/prismer","n_code_links":2,"syntology":null},{"rank_in_archive_order":19,"model":"PTP-BLIP (14M)","metrics":{"BLEU-4":"40.1","CIDER":"135.0","METEOR":"30.4","SPICE":"23.7"},"uses_additional_data":false,"paper_date":"2022-12-19","paper":"/paper/position-guided-text-prompt-for-vision","paper_url":"https://arxiv.org/abs/2212.09737v2","paper_title":"Position-guided Text Prompt for Vision-Language Pre-training","code":"https://github.com/sail-sg/ptp","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":20,"model":"L-Verse","metrics":{"BLEU-4":"39.9","METEOR":"31.4","ROUGE-L":"60.4","SPICE":"23.3"},"uses_additional_data":false,"paper_date":"2021-11-22","paper":"/paper/l-verse-bidirectional-generation-between","paper_url":"https://arxiv.org/abs/2111.11133v10","paper_title":"L-Verse: Bidirectional Generation Between Image and Text","code":"https://github.com/tgisaturday/L-Verse","n_code_links":1,"syntology":null},{"rank_in_archive_order":21,"model":"Xmodal-Ctx","metrics":{"BLEU-1":"81.5","BLEU-4":"39.7","CIDER":"135.9","METEOR":"30.0","ROUGE-L":"59.5","SPICE":"23.7"},"uses_additional_data":false,"paper_date":"2022-05-09","paper":"/paper/beyond-a-pre-trained-object-detector-cross","paper_url":"https://arxiv.org/abs/2205.04363v2","paper_title":"Beyond a Pre-Trained Object Detector: Cross-Modal Textual and Visual Context for Image Captioning","code":"https://github.com/GT-RIPL/Xmodal-Ctx","n_code_links":1,"syntology":null},{"rank_in_archive_order":22,"model":"X-Transformer","metrics":{"BLEU-1":"80.9","BLEU-2":"65.8","BLEU-3":"51.5","BLEU-4":"39.7","CIDER":"132.8","METEOR":"29.5","ROUGE-L":"59.1","SPICE":"23.4"},"uses_additional_data":false,"paper_date":"2020-03-31","paper":"/paper/x-linear-attention-networks-for-image","paper_url":"https://arxiv.org/abs/2003.14080v1","paper_title":"X-Linear Attention Networks for Image Captioning","code":"https://github.com/jdai-cv/image-captioning","n_code_links":2,"syntology":null},{"rank_in_archive_order":23,"model":"AoANet + VC","metrics":{"BLEU-4":"39.5","METEOR":"29.3","ROUGE-L":"59.3"},"uses_additional_data":false,"paper_date":"2020-02-27","paper":"/paper/visual-commonsense-r-cnn","paper_url":"https://arxiv.org/abs/2002.12204v3","paper_title":"Visual Commonsense R-CNN","code":"https://github.com/Wangt-CN/VC-R-CNN","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":24,"model":"Transformer_NSC","metrics":{"BLEU-1":"80.7","BLEU-2":"65.6","BLEU-3":"51.3","BLEU-4":"39.4","CIDER":"129.6","METEOR":"28.9","ROUGE-L":"58.7","SPICE":"22.8"},"uses_additional_data":false,"paper_date":"2020-03-22","paper":"/paper/a-better-variant-of-self-critical-sequence","paper_url":"https://arxiv.org/abs/2003.09971v2","paper_title":"A Better Variant of Self-Critical Sequence Training","code":"https://github.com/ruotianluo/self-critical.pytorch","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"Meshed-Memory Transformer","metrics":{"BLEU-1":"80.8","BLEU-4":"39.1","CIDER":"131.2","METEOR":"29.2","ROUGE-L":"58.6","SPICE":"22.6"},"uses_additional_data":false,"paper_date":"2019-12-17","paper":"/paper/m2-meshed-memory-transformer-for-image","paper_url":"https://arxiv.org/abs/1912.08226v2","paper_title":"Meshed-Memory Transformer for Image Captioning","code":"https://github.com/aimagelab/meshed-memory-transformer","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":26,"model":"CLIP Text Encoder (RL w/ CIDEr-reward)","metrics":{"BLEU-4":"38.2","CIDER":"124.9","METEOR":"28.7","ROUGE-L":"58.5"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/fine-grained-image-captioning-with-clip","paper_url":"https://arxiv.org/abs/2205.13115v2","paper_title":"Fine-grained Image Captioning with CLIP Reward","code":"https://github.com/j-min/clip-caption-reward","n_code_links":1,"syntology":null},{"rank_in_archive_order":27,"model":"RefineCap (w/ REINFORCE)","metrics":{"BLEU-1":"80.2","BLEU-2":"64.5","BLEU-3":"49.9","BLEU-4":"37.8","CIDER":"127.2","METEOR":"28.3","ROUGE-L":"58.0","SPICE":"22.5"},"uses_additional_data":false,"paper_date":"2021-09-08","paper":"/paper/refinecap-concept-aware-refinement-for-image","paper_url":"https://arxiv.org/abs/2109.03529v1","paper_title":"RefineCap: Concept-Aware Refinement for Image Captioning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":28,"model":"RDN","metrics":{"BLEU-1":"80.2","BLEU-4":"37.3","CIDER":"125.2","METEOR":"28.1","ROUGE-L":"57.4"},"uses_additional_data":false,"paper_date":"2019-08-30","paper":"/paper/reflective-decoding-network-for-image","paper_url":"https://arxiv.org/abs/1908.11824v1","paper_title":"Reflective Decoding Network for Image Captioning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":29,"model":"SmallCapd=16, Large","metrics":{"BLEU-4":"37.2","CIDER":"121.8","METEOR":"28.3","SPICE":"21.5"},"uses_additional_data":false,"paper_date":"2022-09-30","paper":"/paper/smallcap-lightweight-image-captioning","paper_url":"https://arxiv.org/abs/2209.15323v2","paper_title":"SmallCap: Lightweight Image Captioning Prompted with Retrieval Augmentation","code":"https://github.com/ritaramo/smallcap","n_code_links":1,"syntology":null},{"rank_in_archive_order":30,"model":"ClipCap (Transformer)","metrics":{"BLEU-4":"33.53","CIDER":"113.08","METEOR":"27.45","SPICE":"21.05"},"uses_additional_data":false,"paper_date":"2021-11-18","paper":"/paper/clipcap-clip-prefix-for-image-captioning","paper_url":"https://arxiv.org/abs/2111.09734v1","paper_title":"ClipCap: CLIP Prefix for Image Captioning","code":"https://github.com/rmokady/clip_prefix_caption","n_code_links":4,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":31,"model":"ClipCap (MLP + GPT2 tuning)","metrics":{"BLEU-4":"32.15","CIDER":"108.35","METEOR":"27.1","SPICE":"20.12"},"uses_additional_data":false,"paper_date":"2021-11-18","paper":"/paper/clipcap-clip-prefix-for-image-captioning","paper_url":"https://arxiv.org/abs/2111.09734v1","paper_title":"ClipCap: CLIP Prefix for Image Captioning","code":"https://github.com/rmokady/clip_prefix_caption","n_code_links":4,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":32,"model":"CapDec","metrics":{"BLEU-4":"26.4","CIDER":"91.8","METEOR":"25.1"},"uses_additional_data":false,"paper_date":"2022-11-01","paper":"/paper/text-only-training-for-image-captioning-using","paper_url":"https://arxiv.org/abs/2211.00575v1","paper_title":"Text-Only Training for Image Captioning using Noise-Injected CLIP","code":"https://github.com/davidhuji/capdec","n_code_links":4,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":33,"model":"From Captions to Visual Concepts and Back","metrics":{"BLEU-4":"25.7","METEOR":"23.6"},"uses_additional_data":false,"paper_date":"2014-11-18","paper":"/paper/from-captions-to-visual-concepts-and-back","paper_url":"http://arxiv.org/abs/1411.4952v3","paper_title":"From Captions to Visual Concepts and Back","code":"https://github.com/s-gupta/visual-concepts","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":34,"model":"VLKD (ViT-B/16)","metrics":{"BLEU-4":"16.7","CIDER":"58.3","METEOR":"19.7","SPICE":"13.4"},"uses_additional_data":false,"paper_date":"2021-11-16","paper":"/paper/enabling-multimodal-generation-on-clip-via","paper_url":"https://openreview.net/forum?id=YTGg7kv8qIq","paper_title":"Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":35,"model":"LaDiC (ours, 30 steps)","metrics":{"BLEU-4":"0.382","CIDER":"126.2","METEOR":"29.5"},"uses_additional_data":false,"paper_date":"2024-04-16","paper":"/paper/ladic-are-diffusion-models-really-inferior-to","paper_url":"https://arxiv.org/abs/2404.10763v1","paper_title":"LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?","code":"https://github.com/wangyuchi369/ladic","n_code_links":1,"syntology":null},{"rank_in_archive_order":36,"model":"VALOR","metrics":{"CIDER":"152.5","SPICE":"25.7"},"uses_additional_data":true,"paper_date":"2023-04-17","paper":"/paper/valor-vision-audio-language-omni-perception","paper_url":"https://arxiv.org/abs/2304.08345v2","paper_title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","code":"https://github.com/TXH-mercury/VALOR","n_code_links":1,"syntology":null},{"rank_in_archive_order":37,"model":"VAST","metrics":{"CIDER":"149.0","SPICE":"27.0"},"uses_additional_data":true,"paper_date":"2023-05-29","paper":"/paper/vast-a-vision-audio-subtitle-text-omni-1","paper_url":"https://arxiv.org/abs/2305.18500v2","paper_title":"VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset","code":"https://github.com/TXH-mercury/VALOR","n_code_links":2,"syntology":{"n_ran":15,"n_unverified":27,"n_samples":42,"n_pointer_only_licence":0}},{"rank_in_archive_order":38,"model":"Virtex (ResNet-101)","metrics":{"CIDER":"94","SPICE":"18.5"},"uses_additional_data":false,"paper_date":"2020-06-11","paper":"/paper/virtex-learning-visual-representations-from","paper_url":"https://arxiv.org/abs/2006.06666v3","paper_title":"VirTex: Learning Visual Representations from Textual Annotations","code":"https://github.com/kdexd/virtex","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":39,"model":"KOSMOS-1 (1.6B) (zero-shot)","metrics":{"CIDER":"84.7","SPICE":"16.8"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":40,"model":"LaDiC","metrics":{"ROUGE-L":"58.7","SPICE":"22.4"},"uses_additional_data":false,"paper_date":"2024-04-16","paper":"/paper/ladic-are-diffusion-models-really-inferior-to","paper_url":"https://arxiv.org/abs/2404.10763v1","paper_title":"LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?","code":"https://github.com/wangyuchi369/ladic","n_code_links":1,"syntology":null},{"rank_in_archive_order":41,"model":"BLIP-FuseCap","metrics":{"CLIPScore":"78.5"},"uses_additional_data":false,"paper_date":"2023-05-28","paper":"/paper/fusecap-leveraging-large-language-models-to","paper_url":"https://arxiv.org/abs/2305.17718v2","paper_title":"FuseCap: Leveraging Large Language Models for Enriched Fused Image Captions","code":"https://github.com/RotsteinNoam/FuseCap","n_code_links":1,"syntology":null}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":20,"rows_with_any_sample_ran":17,"distinct_papers_with_graph_line":17,"distinct_papers_with_any_sample_ran":14,"samples_over_distinct_papers":{"n_ran":77,"n_unverified":111,"n_samples":188,"n_pointer_only_licence":32,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":88,"n_unverified":122,"n_samples":210,"n_pointer_only_licence":34,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}