{"url":"/dataset/svtp","name":"SVTP","full_name":null,"description_markdown":"SVTP dataset stands for Scene Text Recognition Datasets. It is a collection of 4 popular Latin/English scene text recognition datasets, namely IIIT5K, SVT, SVTP, and CUTE-80. These datasets only provide case-insensitive annotations and no punctuation marks.","description_withheld":null,"homepage":"","introduced_date":null,"introduced_date_note":null,"introduced_by":null,"license":null,"modalities":[],"tasks":[{"name":"Scene Text Recognition","url":"/task/scene-text-recognition","datasets_with_task":"/datasets/task/scene-text-recognition"}],"languages":[],"variants":["SVTP"],"data_loaders":[],"num_papers_in_archive":14,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/scene-text-recognition-on-svtp","task":"Scene Text Recognition","dataset_variant":"SVTP","rows":17,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"DTrOCR 105M","paper":"/paper/dtrocr-decoder-only-transformer-for-optical","metrics":{"Accuracy":"98.6"},"code_links":[{"title":"arvindrajan92/DTrOCR","url":"https://github.com/arvindrajan92/DTrOCR"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/an-empirical-study-of-scaling-law-for-ocr","title":"An Empirical Study of Scaling Law for OCR","date":"2023-12-29","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/dtrocr-decoder-only-transformer-for-optical","title":"DTrOCR: Decoder-only Transformer for Optical Character Recognition","date":"2023-08-30","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/context-perception-parallel-decoder-for-scene","title":"Context Perception Parallel Decoder for Scene Text Recognition","date":"2023-07-23","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/diffusionstr-diffusion-model-for-scene-text","title":"DiffusionSTR: Diffusion Model for Scene Text Recognition","date":"2023-06-29","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/clip4str-a-simple-baseline-for-scene-text-1","title":"CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model","date":"2023-05-23","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":3,"samples_unverified":7,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/self-supervised-character-to-character","title":"Self-supervised Character-to-Character Distillation for Text Recognition","date":"2022-11-01","rows_on_this_dataset":3,"code_links":1,"syntology":null},{"paper":"/paper/multi-granularity-prediction-for-scene-text","title":"Multi-Granularity Prediction for Scene Text Recognition","date":"2022-09-08","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/scene-text-recognition-with-permuted","title":"Scene Text Recognition with Permuted Autoregressive Sequence Models","date":"2022-07-14","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":5,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/a-glyph-driven-topology-enhancement-network","title":"Self-supervised Implicit Glyph Attention for Text Recognition","date":"2022-03-07","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/visual-semantics-allow-for-textual-reasoning-1","title":"Visual Semantics Allow for Textual Reasoning Better in Scene Text Recognition","date":"2021-12-24","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/multi-modal-text-recognition-networks","title":"Multi-modal Text Recognition Networks: Interactive Enhancements between Visual and Semantic Features","date":"2021-11-30","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/cdistnet-perceiving-multi-domain-character","title":"CDistNet: Perceiving Multi-Domain Character Distance for Robust Text Recognition","date":"2021-11-22","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/look-back-again-dual-parallel-attention","title":"Look Back Again: Dual Parallel Attention Network for Accurate and Robust Scene Text Recognition","date":"2021-08-01","rows_on_this_dataset":1,"code_links":2,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":2,"samples_harvested":18,"samples_ran":8,"samples_unverified":10,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}