{"url":"/task/image-captioning","name":"Image Captioning","slug":"image-captioning","description_markdown":"**Image Captioning** is the task of describing the content of an image in words. This task lies at the intersection of computer vision and natural language processing. Most image captioning systems use an encoder-decoder framework, where an input image is encoded into an intermediate representation of the information in the image, and then decoded into a descriptive text sequence. The most popular benchmarks are nocaps and COCO, and models are typically evaluated according to a BLEU or CIDER metric.\r\n\r\n( Image credit: [Reflective Decoding Network for Image Captioning, ICCV'19](https://openaccess.thecvf.com/content_ICCV_2019/papers/Ke_Reflective_Decoding_Network_for_Image_Captioning_ICCV_2019_paper.pdf))","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":1878,"papers_with_code":774,"benchmarks":33,"benchmark_tables_in_archive":34,"benchmark_tables_shown":34,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":79,"subtasks":8,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/image-captioning-on-vizwiz-2020-test-dev","slug":"image-captioning-on-vizwiz-2020-test-dev","dataset":"VizWiz 2020 test-dev","dataset_url":"/dataset/vizwiz","rows_in_archive":50,"metrics":["CIDEr","B1","B2","B3","B4","ROUGE-L","METEOR","SPICE"],"first_row_in_archive_order":{"model":"IBM Research AI","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/image-captioning-on-coco-captions","slug":"image-captioning-on-coco-captions","dataset":"COCO Captions","dataset_url":"/dataset/coco-captions","rows_in_archive":41,"metrics":["BLEU-4","CIDER","METEOR","SPICE","ROUGE-L","BLEU-1","BLEU-2","BLEU-3","CLIPScore"],"first_row_in_archive_order":{"model":"mPLUG","paper_title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","paper_url":"/paper/mplug-effective-and-efficient-vision-language","paper_date":"2022-05-24","arxiv_id":"2205.12005","code_links":[{"title":"modelscope/modelscope","url":"https://github.com/modelscope/modelscope"},{"title":"alibaba/AliceMind","url":"https://github.com/alibaba/AliceMind/tree/main/mPLUG"},{"title":"x-plug/mplug","url":"https://github.com/x-plug/mplug"}],"syntology":null}},{"leaderboard":"/sota/image-captioning-on-nocaps-in-domain","slug":"image-captioning-on-nocaps-in-domain","dataset":"nocaps in-domain","dataset_url":"/dataset/nocaps","rows_in_archive":41,"metrics":["CIDEr","B1","B2","B3","B4","ROUGE-L","METEOR","SPICE"],"first_row_in_archive_order":{"model":"PaLI","paper_title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","paper_url":"/paper/pali-a-jointly-scaled-multilingual-language","paper_date":"2022-09-14","arxiv_id":"2209.06794","code_links":[{"title":"google-research/big_vision","url":"https://github.com/google-research/big_vision"}],"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/image-captioning-on-nocaps-near-domain","slug":"image-captioning-on-nocaps-near-domain","dataset":"nocaps near-domain","dataset_url":"/dataset/nocaps","rows_in_archive":40,"metrics":["CIDEr","B1","B2","B3","B4","ROUGE-L","METEOR","SPICE"],"first_row_in_archive_order":{"model":"GIT2, Single Model","paper_title":"GIT: A Generative Image-to-text Transformer for Vision and Language","paper_url":"/paper/git-a-generative-image-to-text-transformer","paper_date":"2022-05-27","arxiv_id":"2205.14100","code_links":[{"title":"microsoft/GenerativeImage2Text","url":"https://github.com/microsoft/GenerativeImage2Text"}],"syntology":{"n":21,"n_ran":0,"n_unverified":21,"n_pointer_only":0}}},{"leaderboard":"/sota/image-captioning-on-nocaps-out-of-domain","slug":"image-captioning-on-nocaps-out-of-domain","dataset":"nocaps out-of-domain","dataset_url":"/dataset/nocaps","rows_in_archive":40,"metrics":["CIDEr","B1","B2","B3","B4","ROUGE-L","METEOR","SPICE"],"first_row_in_archive_order":{"model":"PaLI","paper_title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","paper_url":"/paper/pali-a-jointly-scaled-multilingual-language","paper_date":"2022-09-14","arxiv_id":"2209.06794","code_links":[{"title":"google-research/big_vision","url":"https://github.com/google-research/big_vision"}],"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/image-captioning-on-nocaps-entire","slug":"image-captioning-on-nocaps-entire","dataset":"nocaps entire","dataset_url":"/dataset/nocaps","rows_in_archive":39,"metrics":["CIDEr","B1","B2","B3","B4","ROUGE-L","METEOR","SPICE"],"first_row_in_archive_order":{"model":"Lyrics","paper_title":"Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects","paper_url":"/paper/lyrics-boosting-fine-grained-language-vision","paper_date":"2023-12-08","arxiv_id":"2312.05278","code_links":[],"syntology":null}},{"leaderboard":"/sota/image-captioning-on-coco","slug":"image-captioning-on-coco","dataset":"COCO (Common Objects in Context)","dataset_url":"/dataset/coco","rows_in_archive":17,"metrics":["CIDEr","BLEU-1","BLEU-2","BLEU-3","BLEU-4","METEOR","ROUGE","ROUGE-L"],"first_row_in_archive_order":{"model":"ExpansionNet v2","paper_title":"Exploiting Multiple Sequence Lengths in Fast End to End Training for Image Captioning","paper_url":"/paper/expansionnet-v2-block-static-expansion-in","paper_date":"2022-08-13","arxiv_id":"2208.06551","code_links":[{"title":"jchenghu/expansionnet_v2","url":"https://github.com/jchenghu/expansionnet_v2"}],"syntology":null}},{"leaderboard":"/sota/image-captioning-on-vizwiz-2020-test","slug":"image-captioning-on-vizwiz-2020-test","dataset":"VizWiz 2020 test","dataset_url":"/dataset/vizwiz","rows_in_archive":13,"metrics":["CIDEr","B1","B2","B3","B4","ROUGE-L","METEOR","SPICE"],"first_row_in_archive_order":{"model":"IBM Research AI","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/image-captioning-on-nocaps-xd-entire","slug":"image-captioning-on-nocaps-xd-entire","dataset":"nocaps-XD entire","dataset_url":"/dataset/nocaps","rows_in_archive":12,"metrics":["CIDEr","B1","B2","B3","B4","ROUGE-L","METEOR","SPICE"],"first_row_in_archive_order":{"model":"GIT2","paper_title":"GIT: A Generative Image-to-text Transformer for Vision and Language","paper_url":"/paper/git-a-generative-image-to-text-transformer","paper_date":"2022-05-27","arxiv_id":"2205.14100","code_links":[{"title":"microsoft/GenerativeImage2Text","url":"https://github.com/microsoft/GenerativeImage2Text"}],"syntology":{"n":21,"n_ran":0,"n_unverified":21,"n_pointer_only":0}}},{"leaderboard":"/sota/image-captioning-on-nocaps-val-in-domain","slug":"image-captioning-on-nocaps-val-in-domain","dataset":"nocaps-val-in-domain","dataset_url":"/dataset/nocaps","rows_in_archive":11,"metrics":["CIDEr","SPICE","Pre-train (#images)"],"first_row_in_archive_order":{"model":"BLIP-2 ViT-G FlanT5 XL (zero-shot)","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","paper_url":"/paper/blip-2-bootstrapping-language-image-pre","paper_date":"2023-01-30","arxiv_id":"2301.12597","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"salesforce/lavis","url":"https://github.com/salesforce/lavis"},{"title":"thudm/visualglm-6b","url":"https://github.com/thudm/visualglm-6b"},{"title":"baaivision/eva","url":"https://github.com/baaivision/eva"},{"title":"junshutang/Make-It-3D","url":"https://github.com/junshutang/Make-It-3D"},{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"yukw777/videoblip","url":"https://github.com/yukw777/videoblip"},{"title":"alibaba/graphtranslator","url":"https://github.com/alibaba/graphtranslator"},{"title":"gregor-ge/mblip","url":"https://github.com/gregor-ge/mblip"},{"title":"linzhiqiu/clip-flant5","url":"https://github.com/linzhiqiu/clip-flant5"},{"title":"kdr/videorag-mrr2024","url":"https://github.com/kdr/videorag-mrr2024"},{"title":"rabiulcste/vqazero","url":"https://github.com/rabiulcste/vqazero"},{"title":"jiwanchung/vlis","url":"https://github.com/jiwanchung/vlis"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-2/blip_2"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/blip_2"},{"title":"albertotestoni/ndq_visual_objects","url":"https://github.com/albertotestoni/ndq_visual_objects"}],"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}}},{"leaderboard":"/sota/image-captioning-on-nocaps-val-overall","slug":"image-captioning-on-nocaps-val-overall","dataset":"nocaps-val-overall","dataset_url":"/dataset/nocaps","rows_in_archive":11,"metrics":["CIDEr","SPICE","Pretrain (#images)"],"first_row_in_archive_order":{"model":"BLIP-2 ViT-G FlanT5 XL (zero-shot)","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","paper_url":"/paper/blip-2-bootstrapping-language-image-pre","paper_date":"2023-01-30","arxiv_id":"2301.12597","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"salesforce/lavis","url":"https://github.com/salesforce/lavis"},{"title":"thudm/visualglm-6b","url":"https://github.com/thudm/visualglm-6b"},{"title":"baaivision/eva","url":"https://github.com/baaivision/eva"},{"title":"junshutang/Make-It-3D","url":"https://github.com/junshutang/Make-It-3D"},{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"yukw777/videoblip","url":"https://github.com/yukw777/videoblip"},{"title":"alibaba/graphtranslator","url":"https://github.com/alibaba/graphtranslator"},{"title":"gregor-ge/mblip","url":"https://github.com/gregor-ge/mblip"},{"title":"linzhiqiu/clip-flant5","url":"https://github.com/linzhiqiu/clip-flant5"},{"title":"kdr/videorag-mrr2024","url":"https://github.com/kdr/videorag-mrr2024"},{"title":"rabiulcste/vqazero","url":"https://github.com/rabiulcste/vqazero"},{"title":"jiwanchung/vlis","url":"https://github.com/jiwanchung/vlis"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-2/blip_2"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/blip_2"},{"title":"albertotestoni/ndq_visual_objects","url":"https://github.com/albertotestoni/ndq_visual_objects"}],"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}}},{"leaderboard":"/sota/image-captioning-on-nocaps-xd-in-domain","slug":"image-captioning-on-nocaps-xd-in-domain","dataset":"nocaps-XD in-domain","dataset_url":"/dataset/nocaps","rows_in_archive":11,"metrics":["CIDEr","B1","B2","B3","B4","ROUGE-L","METEOR","SPICE"],"first_row_in_archive_order":{"model":"GIT2","paper_title":"GIT: A Generative Image-to-text Transformer for Vision and Language","paper_url":"/paper/git-a-generative-image-to-text-transformer","paper_date":"2022-05-27","arxiv_id":"2205.14100","code_links":[{"title":"microsoft/GenerativeImage2Text","url":"https://github.com/microsoft/GenerativeImage2Text"}],"syntology":{"n":21,"n_ran":0,"n_unverified":21,"n_pointer_only":0}}},{"leaderboard":"/sota/image-captioning-on-nocaps-xd-near-domain","slug":"image-captioning-on-nocaps-xd-near-domain","dataset":"nocaps-XD near-domain","dataset_url":"/dataset/nocaps","rows_in_archive":11,"metrics":["CIDEr","B1","B2","B3","B4","ROUGE-L","METEOR","SPICE"],"first_row_in_archive_order":{"model":"GIT2","paper_title":"GIT: A Generative Image-to-text Transformer for Vision and Language","paper_url":"/paper/git-a-generative-image-to-text-transformer","paper_date":"2022-05-27","arxiv_id":"2205.14100","code_links":[{"title":"microsoft/GenerativeImage2Text","url":"https://github.com/microsoft/GenerativeImage2Text"}],"syntology":{"n":21,"n_ran":0,"n_unverified":21,"n_pointer_only":0}}},{"leaderboard":"/sota/image-captioning-on-nocaps-xd-out-of-domain","slug":"image-captioning-on-nocaps-xd-out-of-domain","dataset":"nocaps-XD out-of-domain","dataset_url":"/dataset/nocaps","rows_in_archive":11,"metrics":["CIDEr","B1","B2","B3","B4","ROUGE-L","METEOR","SPICE"],"first_row_in_archive_order":{"model":"GIT2","paper_title":"GIT: A Generative Image-to-text Transformer for Vision and Language","paper_url":"/paper/git-a-generative-image-to-text-transformer","paper_date":"2022-05-27","arxiv_id":"2205.14100","code_links":[{"title":"microsoft/GenerativeImage2Text","url":"https://github.com/microsoft/GenerativeImage2Text"}],"syntology":{"n":21,"n_ran":0,"n_unverified":21,"n_pointer_only":0}}},{"leaderboard":"/sota/image-captioning-on-textcaps-2020","slug":"image-captioning-on-textcaps-2020","dataset":"TextCaps 2020","dataset_url":"/dataset/textcaps","rows_in_archive":11,"metrics":["CIDEr","B4","ROUGE-L","METEOR","SPICE"],"first_row_in_archive_order":{"model":"TAP","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/image-captioning-on-nocaps-val-near-domain","slug":"image-captioning-on-nocaps-val-near-domain","dataset":"nocaps-val-near-domain","dataset_url":"/dataset/nocaps","rows_in_archive":10,"metrics":["CIDEr","SPICE","Pre-train (#images)"],"first_row_in_archive_order":{"model":"BLIP-2 ViT-G FlanT5 XL (zero-shot)","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","paper_url":"/paper/blip-2-bootstrapping-language-image-pre","paper_date":"2023-01-30","arxiv_id":"2301.12597","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"salesforce/lavis","url":"https://github.com/salesforce/lavis"},{"title":"thudm/visualglm-6b","url":"https://github.com/thudm/visualglm-6b"},{"title":"baaivision/eva","url":"https://github.com/baaivision/eva"},{"title":"junshutang/Make-It-3D","url":"https://github.com/junshutang/Make-It-3D"},{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"yukw777/videoblip","url":"https://github.com/yukw777/videoblip"},{"title":"alibaba/graphtranslator","url":"https://github.com/alibaba/graphtranslator"},{"title":"gregor-ge/mblip","url":"https://github.com/gregor-ge/mblip"},{"title":"linzhiqiu/clip-flant5","url":"https://github.com/linzhiqiu/clip-flant5"},{"title":"kdr/videorag-mrr2024","url":"https://github.com/kdr/videorag-mrr2024"},{"title":"rabiulcste/vqazero","url":"https://github.com/rabiulcste/vqazero"},{"title":"jiwanchung/vlis","url":"https://github.com/jiwanchung/vlis"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-2/blip_2"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/blip_2"},{"title":"albertotestoni/ndq_visual_objects","url":"https://github.com/albertotestoni/ndq_visual_objects"}],"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}}},{"leaderboard":"/sota/image-captioning-on-nocaps-val-out-domain","slug":"image-captioning-on-nocaps-val-out-domain","dataset":"nocaps-val-out-domain","dataset_url":"/dataset/nocaps","rows_in_archive":10,"metrics":["CIDEr","SPICE","Pretrain (#images)"],"first_row_in_archive_order":{"model":"BLIP-2 ViT-G FlanT5 XL (zero-shot)","paper_title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","paper_url":"/paper/blip-2-bootstrapping-language-image-pre","paper_date":"2023-01-30","arxiv_id":"2301.12597","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"salesforce/lavis","url":"https://github.com/salesforce/lavis"},{"title":"thudm/visualglm-6b","url":"https://github.com/thudm/visualglm-6b"},{"title":"baaivision/eva","url":"https://github.com/baaivision/eva"},{"title":"junshutang/Make-It-3D","url":"https://github.com/junshutang/Make-It-3D"},{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"yukw777/videoblip","url":"https://github.com/yukw777/videoblip"},{"title":"alibaba/graphtranslator","url":"https://github.com/alibaba/graphtranslator"},{"title":"gregor-ge/mblip","url":"https://github.com/gregor-ge/mblip"},{"title":"linzhiqiu/clip-flant5","url":"https://github.com/linzhiqiu/clip-flant5"},{"title":"kdr/videorag-mrr2024","url":"https://github.com/kdr/videorag-mrr2024"},{"title":"rabiulcste/vqazero","url":"https://github.com/rabiulcste/vqazero"},{"title":"jiwanchung/vlis","url":"https://github.com/jiwanchung/vlis"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-2/blip_2"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/blip_2"},{"title":"albertotestoni/ndq_visual_objects","url":"https://github.com/albertotestoni/ndq_visual_objects"}],"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}}},{"leaderboard":"/sota/image-captioning-on-scicap","slug":"image-captioning-on-scicap","dataset":"SCICAP","dataset_url":"/dataset/scicap","rows_in_archive":9,"metrics":["BLEU-4"],"first_row_in_archive_order":{"model":"CNN+LSTM (Vision only, First sentence)","paper_title":"SciCap: Generating Captions for Scientific Figures","paper_url":"/paper/scicap-generating-captions-for-scientific","paper_date":"2021-10-22","arxiv_id":"2110.11624","code_links":[{"title":"tingyaohsu/scicap","url":"https://github.com/tingyaohsu/scicap"}],"syntology":null}},{"leaderboard":"/sota/image-captioning-on-flickr30k-captions-test","slug":"image-captioning-on-flickr30k-captions-test","dataset":"Flickr30k Captions test","dataset_url":"/dataset/flickr30k","rows_in_archive":7,"metrics":["BLEU-4","CIDEr","METEOR","SPICE"],"first_row_in_archive_order":{"model":"Unified VLP","paper_title":"Unified Vision-Language Pre-Training for Image Captioning and VQA","paper_url":"/paper/unified-vision-language-pre-training-for","paper_date":"2019-09-24","arxiv_id":"1909.11059","code_links":[{"title":"rmokady/clip_prefix_caption","url":"https://github.com/rmokady/clip_prefix_caption"},{"title":"LuoweiZhou/VLP","url":"https://github.com/LuoweiZhou/VLP"},{"title":"WebQnA/WebQA_Baseline","url":"https://github.com/WebQnA/WebQA_Baseline"}],"syntology":{"n":14,"n_ran":5,"n_unverified":9,"n_pointer_only":13}}},{"leaderboard":"/sota/image-captioning-on-whoops","slug":"image-captioning-on-whoops","dataset":"WHOOPS!","dataset_url":"/dataset/whoops","rows_in_archive":6,"metrics":["BLEU-4","CIDEr"],"first_row_in_archive_order":{"model":"BLIP2 FlanT5-XXL (Fine-tuned)","paper_title":"Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images","paper_url":"/paper/breaking-common-sense-whoops-a-vision-and","paper_date":"2023-03-13","arxiv_id":"2303.07274","code_links":[],"syntology":null}},{"leaderboard":"/sota/image-captioning-on-nocaps-val","slug":"image-captioning-on-nocaps-val","dataset":"nocaps val","dataset_url":"/dataset/nocaps","rows_in_archive":3,"metrics":["CIDEr","SPICE"],"first_row_in_archive_order":{"model":"Prismer","paper_title":"Prismer: A Vision-Language Model with Multi-Task Experts","paper_url":"/paper/prismer-a-vision-language-model-with-an","paper_date":"2023-03-04","arxiv_id":"2303.02506","code_links":[{"title":"nvlabs/prismer","url":"https://github.com/nvlabs/prismer"},{"title":"KastanDay/video-pretrained-transformer","url":"https://github.com/KastanDay/video-pretrained-transformer"}],"syntology":null}},{"leaderboard":"/sota/image-captioning-on-object-halbench","slug":"image-captioning-on-object-halbench","dataset":"Object HalBench","dataset_url":"/dataset/object-halbench","rows_in_archive":3,"metrics":["chair_i","chair_s"],"first_row_in_archive_order":{"model":"RLHF-V","paper_title":"RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback","paper_url":"/paper/rlhf-v-towards-trustworthy-mllms-via-behavior","paper_date":"2023-12-01","arxiv_id":"2312.00849","code_links":[{"title":"openbmb/minicpm-v","url":"https://github.com/openbmb/minicpm-v"},{"title":"rlhf-v/rlhf-v","url":"https://github.com/rlhf-v/rlhf-v"},{"title":"tidedra/vl-rlhf","url":"https://github.com/tidedra/vl-rlhf"},{"title":"exgc/r1v-free","url":"https://github.com/exgc/r1v-free"}],"syntology":null}},{"leaderboard":"/sota/image-captioning-on-coco-captions-test","slug":"image-captioning-on-coco-captions-test","dataset":"COCO Captions test","dataset_url":"/dataset/coco-captions","rows_in_archive":2,"metrics":["BLEU-4","CIDEr","METEOR","SPICE"],"first_row_in_archive_order":{"model":"From Captions to Visual Concepts and Back","paper_title":"From Captions to Visual Concepts and Back","paper_url":"/paper/from-captions-to-visual-concepts-and-back","paper_date":"2014-11-18","arxiv_id":"1411.4952","code_links":[{"title":"s-gupta/visual-concepts","url":"https://github.com/s-gupta/visual-concepts"}],"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}}},{"leaderboard":"/sota/image-captioning-on-conceptual-captions","slug":"image-captioning-on-conceptual-captions","dataset":"Conceptual Captions","dataset_url":"/dataset/conceptual-captions","rows_in_archive":2,"metrics":["CIDEr","ROUGE-L","SPICE"],"first_row_in_archive_order":{"model":"ClipCap (MLP + GPT2 tuning)","paper_title":"ClipCap: CLIP Prefix for Image Captioning","paper_url":"/paper/clipcap-clip-prefix-for-image-captioning","paper_date":"2021-11-18","arxiv_id":"2111.09734","code_links":[{"title":"rmokady/clip_prefix_caption","url":"https://github.com/rmokady/clip_prefix_caption"},{"title":"Japanese-Image-Captioning/ClipCap-for-Japanese","url":"https://github.com/Japanese-Image-Captioning/ClipCap-for-Japanese"},{"title":"sithu31296/image-captioning","url":"https://github.com/sithu31296/image-captioning"},{"title":"MS-P3/code7","url":"https://github.com/MS-P3/code7/tree/main/x_clip"}],"syntology":{"n":6,"n_ran":3,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/image-captioning-on-flickrstyle10k","slug":"image-captioning-on-flickrstyle10k","dataset":"FlickrStyle10K","dataset_url":"/dataset/flickrstyle10k","rows_in_archive":2,"metrics":["BLEU-1 (Romantic)"],"first_row_in_archive_order":{"model":"CapDec","paper_title":"Text-Only Training for Image Captioning using Noise-Injected CLIP","paper_url":"/paper/text-only-training-for-image-captioning-using","paper_date":"2022-11-01","arxiv_id":"2211.00575","code_links":[{"title":"davidhuji/capdec","url":"https://github.com/davidhuji/capdec"},{"title":"zelaki/wsac","url":"https://github.com/zelaki/wsac"},{"title":"avitej-iyer/CapDec-Recreation","url":"https://github.com/avitej-iyer/CapDec-Recreation"},{"title":"uriberger/re_cap","url":"https://github.com/uriberger/re_cap"}],"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":1}}},{"leaderboard":"/sota/image-captioning-on-localized-narratives","slug":"image-captioning-on-localized-narratives","dataset":"Localized Narratives","dataset_url":"/dataset/localized-narratives","rows_in_archive":2,"metrics":["CIDEr"],"first_row_in_archive_order":{"model":"LoopCAG","paper_title":"Control Image Captioning Spatially and Temporally","paper_url":"/paper/control-image-captioning-spatially-and","paper_date":"2021-08-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/image-captioning-on-aic-icc","slug":"image-captioning-on-aic-icc","dataset":"AIC-ICC","dataset_url":null,"rows_in_archive":1,"metrics":["BLEU","CIDEr","METEOR","ROUGE-L"],"first_row_in_archive_order":{"model":"CMCL","paper_title":"WenLan: Bridging Vision and Language by Large-Scale Multi-Modal Pre-Training","paper_url":"/paper/wenlan-bridging-vision-and-language-by-large","paper_date":"2021-03-11","arxiv_id":"2103.06561","code_links":[{"title":"BAAI-WuDao/BriVl","url":"https://github.com/BAAI-WuDao/BriVl"},{"title":"Aman-4-Real/MMTG","url":"https://github.com/Aman-4-Real/MMTG"}],"syntology":null}},{"leaderboard":"/sota/image-captioning-on-banglalekhaimagecaptions","slug":"image-captioning-on-banglalekhaimagecaptions","dataset":"BanglaLekhaImageCaptions","dataset_url":"/dataset/banglalekhaimagecaptions","rows_in_archive":1,"metrics":["BLEU-1","BLEU-2","BLEU-3","BLEU-4","CIDEr","METEOR","ROUGE-L","SPICE"],"first_row_in_archive_order":{"model":"CNN + 1D CNN","paper_title":"Improved Bengali Image Captioning via deep convolutional neural network based encoder-decoder model","paper_url":"/paper/improved-bengali-image-captioning-via-deep","paper_date":"2021-02-14","arxiv_id":"2102.07192","code_links":[{"title":"FaiyazKhan11/Improved-Bengali-Image-Captioning-via-deep-convolutional-neural-network-based-encoder-decoder-model","url":"https://github.com/FaiyazKhan11/Improved-Bengali-Image-Captioning-via-deep-convolutional-neural-network-based-encoder-decoder-model"}],"syntology":null}},{"leaderboard":"/sota/image-captioning-on-chebi-20","slug":"image-captioning-on-chebi-20","dataset":"ChEBI-20","dataset_url":"/dataset/chebi-20","rows_in_archive":1,"metrics":["BLEU","Exact","Levenshtein","MACCS FTS","Morgan FTS","RDK FTS","Validity"],"first_row_in_archive_order":{"model":"GIT-Mol","paper_title":"GIT-Mol: A Multi-modal Large Language Model for Molecular Science with Graph, Image, and Text","paper_url":"/paper/git-mol-a-multi-modal-large-language-model","paper_date":"2023-08-14","arxiv_id":"2308.06911","code_links":[{"title":"ai-hpc-research-team/git-mol","url":"https://github.com/ai-hpc-research-team/git-mol"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/image-captioning-on-iu-x-ray","slug":"image-captioning-on-iu-x-ray","dataset":"IU X-Ray","dataset_url":"/dataset/iu-x-ray","rows_in_archive":1,"metrics":["CIDEr"],"first_row_in_archive_order":{"model":"BiomedGPT","paper_title":"BiomedGPT: A Generalist Vision-Language Foundation Model for Diverse Biomedical Tasks","paper_url":"/paper/biomedgpt-a-unified-and-generalist-biomedical","paper_date":"2023-05-26","arxiv_id":"2305.17100","code_links":[{"title":"taokz/biomedgpt","url":"https://github.com/taokz/biomedgpt"}],"syntology":{"n":8,"n_ran":1,"n_unverified":7,"n_pointer_only":7}}},{"leaderboard":"/sota/image-captioning-on-ms-coco","slug":"image-captioning-on-ms-coco","dataset":"MS-COCO","dataset_url":"/dataset/coco","rows_in_archive":1,"metrics":["BLEU-1","BLEU-4","CIDEr","METEOR","SPICE","Test ROGUE-L"],"first_row_in_archive_order":{"model":"NeuSyRE","paper_title":"NeuSyRE: Neuro-Symbolic Visual Understanding and Reasoning Framework based on Scene Graph Enrichment","paper_url":"/paper/neusyre-neuro-symbolic-visual-understanding","paper_date":"2023-11-05","arxiv_id":null,"code_links":[{"title":"jaleedkhan/neusire","url":"https://github.com/jaleedkhan/neusire"}],"syntology":null}},{"leaderboard":"/sota/image-captioning-on-mscoco-1","slug":"image-captioning-on-mscoco-1","dataset":"MSCOCO","dataset_url":"/dataset/mscoco","rows_in_archive":1,"metrics":["BLEU-4"],"first_row_in_archive_order":{"model":"CapDec","paper_title":"Text-Only Training for Image Captioning using Noise-Injected CLIP","paper_url":"/paper/text-only-training-for-image-captioning-using","paper_date":"2022-11-01","arxiv_id":"2211.00575","code_links":[{"title":"davidhuji/capdec","url":"https://github.com/davidhuji/capdec"},{"title":"zelaki/wsac","url":"https://github.com/zelaki/wsac"},{"title":"avitej-iyer/CapDec-Recreation","url":"https://github.com/avitej-iyer/CapDec-Recreation"},{"title":"uriberger/re_cap","url":"https://github.com/uriberger/re_cap"}],"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":1}}},{"leaderboard":"/sota/image-captioning-on-peir-gross","slug":"image-captioning-on-peir-gross","dataset":"Peir Gross","dataset_url":"/dataset/peir-gross","rows_in_archive":1,"metrics":["CIDEr","METEOR","ROUGE-L"],"first_row_in_archive_order":{"model":"BiomedGPT","paper_title":"BiomedGPT: A Generalist Vision-Language Foundation Model for Diverse Biomedical Tasks","paper_url":"/paper/biomedgpt-a-unified-and-generalist-biomedical","paper_date":"2023-05-26","arxiv_id":"2305.17100","code_links":[{"title":"taokz/biomedgpt","url":"https://github.com/taokz/biomedgpt"}],"syntology":{"n":8,"n_ran":1,"n_unverified":7,"n_pointer_only":7}}},{"leaderboard":null,"slug":"image-captioning-on-foundation-multimodal","dataset":"foundation-multimodal-models/DetailCaps-4870","dataset_url":null,"rows_in_archive":0,"metrics":["value"],"first_row_in_archive_order":null}],"datasets":[{"url":"/dataset/coco","name":"COCO (Common Objects in Context)","full_name":"Common Objects in Context","num_papers_in_archive":11922},{"url":"/dataset/flickr30k","name":"Flickr30k","full_name":"Flickr30k","num_papers_in_archive":880},{"url":"/dataset/conceptual-captions","name":"Conceptual Captions","full_name":"Conceptual Captions","num_papers_in_archive":352},{"url":"/dataset/vizwiz","name":"VizWiz","full_name":"VizWiz-VQA","num_papers_in_archive":260},{"url":"/dataset/coco-captions","name":"COCO Captions","full_name":"","num_papers_in_archive":203},{"url":"/dataset/hateful-memes","name":"Hateful Memes","full_name":"Hateful Memes","num_papers_in_archive":177},{"url":"/dataset/nocaps","name":"NoCaps","full_name":"","num_papers_in_archive":175},{"url":"/dataset/textcaps","name":"TextCaps","full_name":"","num_papers_in_archive":98},{"url":"/dataset/mscoco","name":"MSCOCO","full_name":"","num_papers_in_archive":90},{"url":"/dataset/winoground","name":"Winoground","full_name":"","num_papers_in_archive":90},{"url":"/dataset/referitgame","name":"ReferItGame","full_name":"ReferItGame","num_papers_in_archive":80},{"url":"/dataset/rsicd","name":"RSICD","full_name":"Remote Sensing Image Captioning Dataset","num_papers_in_archive":70},{"url":"/dataset/localized-narratives","name":"Localized Narratives","full_name":"","num_papers_in_archive":63},{"url":"/dataset/hateful-memes-challenge","name":"Hateful Memes Challenge","full_name":"","num_papers_in_archive":48},{"url":"/dataset/google-refexp","name":"Google Refexp","full_name":"","num_papers_in_archive":46},{"url":"/dataset/chebi-20","name":"ChEBI-20","full_name":"","num_papers_in_archive":43},{"url":"/dataset/ut-zappos50k","name":"UT Zappos50K","full_name":"","num_papers_in_archive":32},{"url":"/dataset/image-paragraph-captioning","name":"Image Paragraph Captioning","full_name":"","num_papers_in_archive":31},{"url":"/dataset/xm-3600","name":"XM 3600","full_name":"Crossmodal 3600","num_papers_in_archive":28},{"url":"/dataset/senticap","name":"SentiCap","full_name":"","num_papers_in_archive":26},{"url":"/dataset/rsvgd","name":"DIOR-RSVG","full_name":"","num_papers_in_archive":25},{"url":"/dataset/flickrstyle10k","name":"FlickrStyle10K","full_name":"","num_papers_in_archive":24},{"url":"/dataset/wider","name":"WIDER","full_name":"Web Image Dataset for Event Recognition","num_papers_in_archive":22},{"url":"/dataset/coco-cn","name":"COCO-CN","full_name":"","num_papers_in_archive":21},{"url":"/dataset/iu-x-ray","name":"IU X-Ray","full_name":"","num_papers_in_archive":19},{"url":"/dataset/scicap","name":"SCICAP","full_name":"","num_papers_in_archive":18},{"url":"/dataset/whoops","name":"WHOOPS!","full_name":"","num_papers_in_archive":14},{"url":"/dataset/vizwiz-captions","name":"VizWiz-Captions","full_name":"","num_papers_in_archive":12},{"url":"/dataset/object-halbench","name":"Object HalBench","full_name":"","num_papers_in_archive":11},{"url":"/dataset/sbu-captions-dataset","name":"SBU Captions Dataset","full_name":"","num_papers_in_archive":11},{"url":"/dataset/pfn-pic","name":"PFN-PIC","full_name":"PFN Picking Instructions for Commodities Dataset","num_papers_in_archive":7},{"url":"/dataset/cite","name":"CITE","full_name":"","num_papers_in_archive":6},{"url":"/dataset/open-images-v7","name":"Open Images V7","full_name":"","num_papers_in_archive":6},{"url":"/dataset/peir-gross","name":"Peir Gross","full_name":"","num_papers_in_archive":6},{"url":"/dataset/uit-viic","name":"UIT-ViIC","full_name":"","num_papers_in_archive":6},{"url":"/dataset/banglalekhaimagecaptions","name":"BanglaLekhaImageCaptions","full_name":"","num_papers_in_archive":5},{"url":"/dataset/flickr-8k","name":"Flickr-8k","full_name":"","num_papers_in_archive":5},{"url":"/dataset/pomo","name":"PoMo","full_name":"","num_papers_in_archive":5},{"url":"/dataset/skyeye-968k","name":"SkyEye-968k","full_name":"","num_papers_in_archive":5},{"url":"/dataset/tencent-ml-images","name":"Tencent ML-Images","full_name":"","num_papers_in_archive":5},{"url":"/dataset/concadia","name":"Concadia","full_name":"","num_papers_in_archive":4},{"url":"/dataset/image-editing-request-dataset","name":"Image Editing Request Dataset","full_name":"","num_papers_in_archive":4},{"url":"/dataset/polaris","name":"Polaris","full_name":"Polaris dataset","num_papers_in_archive":4},{"url":"/dataset/stair-captions","name":"STAIR Captions","full_name":"STAIR Captions","num_papers_in_archive":4},{"url":"/dataset/hephaestus","name":"Hephaestus","full_name":"Hephaestus: A large scale multitask dataset towards InSAR understanding","num_papers_in_archive":3},{"url":"/dataset/iiw-400","name":"IIW-400","full_name":"ImageInWords: IIW-400","num_papers_in_archive":3},{"url":"/dataset/image-and-video-advertisements","name":"Image and Video Advertisements","full_name":"","num_papers_in_archive":3},{"url":"/dataset/kvasir-vqa","name":"Kvasir-VQA","full_name":"A Text-Image Pair GI Tract Dataset","num_papers_in_archive":3},{"url":"/dataset/laion-coco","name":"LAION COCO","full_name":"","num_papers_in_archive":3},{"url":"/dataset/openchair","name":"OpenCHAIR","full_name":"","num_papers_in_archive":3},{"url":"/dataset/gpscap","name":"SCapRepo","full_name":"Google Play Screenshot Caption","num_papers_in_archive":3},{"url":"/dataset/wikiscenes","name":"WikiScenes","full_name":"","num_papers_in_archive":3},{"url":"/dataset/decoco","name":"DeCOCO","full_name":"","num_papers_in_archive":2},{"url":"/dataset/dpc-captions","name":"DPC-Captions","full_name":null,"num_papers_in_archive":2},{"url":"/dataset/egoshots","name":"EgoShots","full_name":null,"num_papers_in_archive":2},{"url":"/dataset/posescript","name":"PoseScript","full_name":"","num_papers_in_archive":2},{"url":"/dataset/vizwiz-priv","name":"VizWiz-Priv","full_name":"Visual Privacy dataset","num_papers_in_archive":2},{"url":"/dataset/vizwiz-qualityissues","name":"VizWiz-QualityIssues","full_name":"","num_papers_in_archive":2},{"url":"/dataset/3u-vqa","name":"3U-VQA","full_name":"Usual, Unusual and Unknown object scenarios for LVQA with difficulty scoring dataset","num_papers_in_archive":1},{"url":"/dataset/bnature","name":"BNATURE","full_name":"","num_papers_in_archive":1},{"url":"/dataset/capgaze","name":"CapGaze","full_name":"","num_papers_in_archive":1},{"url":"/dataset/esp","name":"ESP","full_name":"Evaluation for Styled Prompt","num_papers_in_archive":1},{"url":"/dataset/groundcap","name":"GroundCap","full_name":"","num_papers_in_archive":1},{"url":"/dataset/image-caption-quality-dataset","name":"Image Caption Quality Dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/infashai","name":"InFashAI","full_name":"Inclusive Fashion AI","num_papers_in_archive":1},{"url":"/dataset/mcic-coco","name":"MCIC-COCO","full_name":"","num_papers_in_archive":1},{"url":"/dataset/mminstruct-gpt4v","name":"MMInstruct-GPT4V","full_name":"MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity","num_papers_in_archive":1},{"url":"/dataset/parsvqa-caps","name":"ParsVQA-Caps","full_name":"","num_papers_in_archive":1},{"url":"/dataset/rpcd","name":"RPCD","full_name":"Reddit Photo Critique Dataset","num_papers_in_archive":1},{"url":"/dataset/smr-iu-x-ray","name":"SMR IU X-Ray","full_name":"Simplified Medical Reports","num_papers_in_archive":1},{"url":"/dataset/t2-guiding","name":"T2 Guiding","full_name":"","num_papers_in_archive":1},{"url":"/dataset/vdqg","name":"VDQG","full_name":"Visual Discriminative Question Generation","num_papers_in_archive":1},{"url":"/dataset/viscon-100k","name":"VisCon-100K","full_name":"","num_papers_in_archive":1},{"url":"/dataset/viscon-1m","name":"VisCon-1M","full_name":"","num_papers_in_archive":1},{"url":"/dataset/webli","name":"WebLI","full_name":"Web Language Image","num_papers_in_archive":1},{"url":"/dataset/wikiweb2m","name":"WikiWeb2M","full_name":"Wikipedia Webpage 2M","num_papers_in_archive":1},{"url":"/dataset/x-transferbench","name":"X-TransferBench","full_name":"X-TransferBench","num_papers_in_archive":1},{"url":"/dataset/balitanlp","name":"BalitaNLP","full_name":"","num_papers_in_archive":0},{"url":"/dataset/esp-dataset","name":"ESP Dataset","full_name":"Evaluation for Styled Prompt datase","num_papers_in_archive":0}],"subtasks":[{"url":"/task/3d-dense-captioning","name":"3D dense captioning"},{"url":"/task/aesthetic-image-captioning","name":"Aesthetic Image Captioning"},{"url":"/task/controllable-image-captioning","name":"controllable image captioning"},{"url":"/task/hindi-image-captioning","name":"Hindi Image Captioning"},{"url":"/task/patent-figure-description-generation","name":"Patent Figure Description Generation"},{"url":"/task/relational-captioning","name":"Relational Captioning"},{"url":"/task/semi-supervised-learning-for-image-captioning","name":"Semi Supervised Learning for Image Captioning"},{"url":"/task/vietnamese-image-captioning","name":"Vietnamese Image Captioning"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":774,"tagged_in_all":1878,"items":[{"url":"/paper/show-attend-and-tell-neural-image-caption","title":"Show, Attend and Tell: Neural Image Caption Generation with Visual Attention","date":"2015-02-10","arxiv_id":"1502.03044","repositories_listed":92,"syntology":{"n":84,"n_ran":15,"n_unverified":69,"n_pointer_only":7}},{"url":"/paper/show-and-tell-a-neural-image-caption","title":"Show and Tell: A Neural Image Caption Generator","date":"2014-11-17","arxiv_id":"1411.4555","repositories_listed":74,"syntology":{"n":34,"n_ran":13,"n_unverified":21,"n_pointer_only":6}},{"url":"/paper/bottom-up-and-top-down-attention-for-image","title":"Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering","date":"2017-07-25","arxiv_id":"1707.07998","repositories_listed":65,"syntology":{"n":9,"n_ran":9,"n_unverified":0,"n_pointer_only":6}},{"url":"/paper/self-critical-sequence-training-for-image","title":"Self-critical Sequence Training for Image Captioning","date":"2016-12-02","arxiv_id":"1612.00563","repositories_listed":31,"syntology":{"n":13,"n_ran":8,"n_unverified":5,"n_pointer_only":3}},{"url":"/paper/cutmix-regularization-strategy-to-train","title":"CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features","date":"2019-05-13","arxiv_id":"1905.04899","repositories_listed":30,"syntology":{"n":24,"n_ran":17,"n_unverified":7,"n_pointer_only":5}},{"url":"/paper/diverse-beam-search-decoding-diverse","title":"Diverse Beam Search: Decoding Diverse Solutions from Neural Sequence Models","date":"2016-10-07","arxiv_id":"1610.02424","repositories_listed":25,"syntology":{"n":14,"n_ran":7,"n_unverified":7,"n_pointer_only":14}},{"url":"/paper/cider-consensus-based-image-description","title":"CIDEr: Consensus-based Image Description Evaluation","date":"2014-11-20","arxiv_id":"1411.5726","repositories_listed":24,"syntology":{"n":32,"n_ran":12,"n_unverified":20,"n_pointer_only":27}},{"url":"/paper/vqa-visual-question-answering","title":"VQA: Visual Question Answering","date":"2015-05-03","arxiv_id":"1505.00468","repositories_listed":21,"syntology":{"n":7,"n_ran":6,"n_unverified":1,"n_pointer_only":6}},{"url":"/paper/recurrent-neural-network-regularization","title":"Recurrent Neural Network Regularization","date":"2014-09-08","arxiv_id":"1409.2329","repositories_listed":21,"syntology":{"n":6,"n_ran":2,"n_unverified":4,"n_pointer_only":6}},{"url":"/paper/bertscore-evaluating-text-generation-with","title":"BERTScore: Evaluating Text Generation with BERT","date":"2019-04-21","arxiv_id":"1904.09675","repositories_listed":20,"syntology":{"n":76,"n_ran":44,"n_unverified":32,"n_pointer_only":33}},{"url":"/paper/show-and-tell-lessons-learned-from-the-2015","title":"Show and Tell: Lessons learned from the 2015 MSCOCO Image Captioning Challenge","date":"2016-09-21","arxiv_id":"1609.06647","repositories_listed":20,"syntology":{"n":15,"n_ran":4,"n_unverified":11,"n_pointer_only":7}},{"url":"/paper/blip-2-bootstrapping-language-image-pre","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","date":"2023-01-30","arxiv_id":"2301.12597","repositories_listed":17,"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":1}},{"url":"/paper/knowing-when-to-look-adaptive-attention-via-a","title":"Knowing When to Look: Adaptive Attention via A Visual Sentinel for Image Captioning","date":"2016-12-06","arxiv_id":"1612.01887","repositories_listed":17,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/rise-randomized-input-sampling-for","title":"RISE: Randomized Input Sampling for Explanation of Black-box Models","date":"2018-06-19","arxiv_id":"1806.07421","repositories_listed":13,"syntology":{"n":34,"n_ran":1,"n_unverified":33,"n_pointer_only":10}},{"url":"/paper/ms-celeb-1m-a-dataset-and-benchmark-for-large","title":"MS-Celeb-1M: A Dataset and Benchmark for Large-Scale Face Recognition","date":"2016-07-27","arxiv_id":"1607.08221","repositories_listed":12,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}},{"url":"/paper/spice-semantic-propositional-image-caption","title":"SPICE: Semantic Propositional Image Caption Evaluation","date":"2016-07-29","arxiv_id":"1607.08822","repositories_listed":11,"syntology":null},{"url":"/paper/coco-stuff-thing-and-stuff-classes-in-context","title":"COCO-Stuff: Thing and Stuff Classes in Context","date":"2016-12-12","arxiv_id":"1612.03716","repositories_listed":10,"syntology":{"n":29,"n_ran":1,"n_unverified":28,"n_pointer_only":0}},{"url":"/paper/blip-bootstrapping-language-image-pre","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","date":"2022-01-28","arxiv_id":"2201.12086","repositories_listed":9,"syntology":null},{"url":"/paper/scheduled-sampling-for-sequence-prediction","title":"Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks","date":"2015-06-09","arxiv_id":"1506.03099","repositories_listed":9,"syntology":{"n":8,"n_ran":0,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/a-neural-attention-model-for-speech-command","title":"A neural attention model for speech command recognition","date":"2018-08-27","arxiv_id":"1808.08929","repositories_listed":8,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":2}},{"url":"/paper/analog-bits-generating-discrete-data-using","title":"Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning","date":"2022-08-08","arxiv_id":"2208.04202","repositories_listed":7,"syntology":{"n":20,"n_ran":13,"n_unverified":7,"n_pointer_only":4}},{"url":"/paper/vinvl-making-visual-representations-matter-in","title":"VinVL: Revisiting Visual Representations in Vision-Language Models","date":"2021-01-02","arxiv_id":"2101.00529","repositories_listed":7,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/coca-contrastive-captioners-are-image-text","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","date":"2022-05-04","arxiv_id":"2205.01917","repositories_listed":6,"syntology":{"n":17,"n_ran":9,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/delete-retrieve-generate-a-simple-approach-to","title":"Delete, Retrieve, Generate: A Simple Approach to Sentiment and Style Transfer","date":"2018-04-17","arxiv_id":"1804.06437","repositories_listed":6,"syntology":{"n":8,"n_ran":0,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/rlaif-v-aligning-mllms-through-open-source-ai","title":"RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V Trustworthiness","date":"2024-05-27","arxiv_id":"2405.17220","repositories_listed":5,"syntology":{"n":22,"n_ran":14,"n_unverified":8,"n_pointer_only":8}},{"url":"/paper/attention-on-attention-for-image-captioning","title":"Attention on Attention for Image Captioning","date":"2019-08-19","arxiv_id":"1908.06954","repositories_listed":5,"syntology":{"n":14,"n_ran":4,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/rlhf-v-towards-trustworthy-mllms-via-behavior","title":"RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback","date":"2023-12-01","arxiv_id":"2312.00849","repositories_listed":4,"syntology":null},{"url":"/paper/text-only-training-for-image-captioning-using","title":"Text-Only Training for Image Captioning using Noise-Injected CLIP","date":"2022-11-01","arxiv_id":"2211.00575","repositories_listed":4,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/pix2struct-screenshot-parsing-as-pretraining","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","date":"2022-10-07","arxiv_id":"2210.03347","repositories_listed":4,"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/unifying-architectures-tasks-and-modalities","title":"OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework","date":"2022-02-07","arxiv_id":"2202.03052","repositories_listed":4,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}],"syntology_records":27,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}