{"url":"/dataset/textcaps","name":"TextCaps","full_name":null,"description_markdown":"Contains 145k captions for 28k images. The dataset challenges a model to recognize text, relate it to its visual context, and decide what part of the text to copy or paraphrase, requiring spatial, semantic, and visual reasoning between multiple text tokens and visual entities, such as objects. \r\n\r\nSource: [TextCaps: a Dataset for Image Captioning with Reading Comprehension](/paper/textcaps-a-dataset-for-image-captioning-with)","description_withheld":null,"homepage":"https://textvqa.org/textcaps","introduced_date":null,"introduced_date_note":null,"introduced_by":{"paper":"/paper/textcaps-a-dataset-for-image-captioning-with","title":"TextCaps: a Dataset for Image Captioning with Reading Comprehension","first_author":"Oleksii Sidorov","url":null},"license":null,"modalities":[{"name":"Images","url":"/datasets/modality/images"},{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Image Captioning","url":"/task/image-captioning","datasets_with_task":"/datasets/task/image-captioning"},{"name":"Optical Character Recognition (OCR)","url":"/task/optical-character-recognition","datasets_with_task":"/datasets/task/optical-character-recognition"},{"name":"Visual Reasoning","url":"/task/visual-reasoning","datasets_with_task":"/datasets/task/visual-reasoning"}],"languages":[],"variants":["TextCaps 2020","TextCaps"],"data_loaders":[],"num_papers_in_archive":98,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/image-captioning-on-textcaps-2020","task":"Image Captioning","dataset_variant":"TextCaps 2020","rows":11,"metrics":["CIDEr","B4","ROUGE-L","METEOR","SPICE"],"first_row_in_archive_order":{"model":"TAP","paper":null,"metrics":{"B4":"21.86","CIDEr":"103.22","METEOR":"21.85","ROUGE-L":"45.65","SPICE":"14.64"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}