{"url":"/dataset/iiit5k","name":"IIIT5k","full_name":null,"description_markdown":"The IIIT5K dataset contains 5,000 text instance images: 2,000 for training and 3,000 for testing. It contains words from street scenes and from originally-digital images. Every image is associated with a 50 -word lexicon and a 1,000 -word lexicon.","description_withheld":null,"homepage":"https://cvit.iiit.ac.in/research/projects/cvit-projects/the-iiit-5k-word-dataset","introduced_date":null,"introduced_date_note":null,"introduced_by":null,"license":null,"modalities":[{"name":"Images","url":"/datasets/modality/images"}],"tasks":[{"name":"Scene Text Recognition","url":"/task/scene-text-recognition","datasets_with_task":"/datasets/task/scene-text-recognition"}],"languages":[],"variants":["IIIT5k"],"data_loaders":[],"num_papers_in_archive":14,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/scene-text-recognition-on-iiit5k","task":"Scene Text Recognition","dataset_variant":"IIIT5k","rows":17,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"CLIP4STR-L (DataComp-1B)","paper":"/paper/clip4str-a-simple-baseline-for-scene-text-1","metrics":{"Accuracy":"99.6"},"code_links":[{"title":"VamosC/CLIP4STR","url":"https://github.com/VamosC/CLIP4STR"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/dtrocr-decoder-only-transformer-for-optical","title":"DTrOCR: Decoder-only Transformer for Optical Character Recognition","date":"2023-08-30","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/context-perception-parallel-decoder-for-scene","title":"Context Perception Parallel Decoder for Scene Text Recognition","date":"2023-07-23","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/diffusionstr-diffusion-model-for-scene-text","title":"DiffusionSTR: Diffusion Model for Scene Text Recognition","date":"2023-06-29","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/clip4str-a-simple-baseline-for-scene-text-1","title":"CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model","date":"2023-05-23","rows_on_this_dataset":4,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":3,"samples_unverified":7,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/self-supervised-character-to-character","title":"Self-supervised Character-to-Character Distillation for Text Recognition","date":"2022-11-01","rows_on_this_dataset":3,"code_links":1,"syntology":null},{"paper":"/paper/multi-granularity-prediction-for-scene-text","title":"Multi-Granularity Prediction for Scene Text Recognition","date":"2022-09-08","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/scene-text-recognition-with-permuted","title":"Scene Text Recognition with Permuted Autoregressive Sequence Models","date":"2022-07-14","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":5,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/a-glyph-driven-topology-enhancement-network","title":"Self-supervised Implicit Glyph Attention for Text Recognition","date":"2022-03-07","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/visual-semantics-allow-for-textual-reasoning-1","title":"Visual Semantics Allow for Textual Reasoning Better in Scene Text Recognition","date":"2021-12-24","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/multi-modal-text-recognition-networks","title":"Multi-modal Text Recognition Networks: Interactive Enhancements between Visual and Semantic Features","date":"2021-11-30","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/cdistnet-perceiving-multi-domain-character","title":"CDistNet: Perceiving Multi-Domain Character Distance for Robust Text Recognition","date":"2021-11-22","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/look-back-again-dual-parallel-attention","title":"Look Back Again: Dual Parallel Attention Network for Accurate and Robust Scene Text Recognition","date":"2021-08-01","rows_on_this_dataset":1,"code_links":2,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":2,"samples_harvested":18,"samples_ran":8,"samples_unverified":10,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}