{"url":"/dataset/svt","name":"SVT","full_name":"Street View Text Dataset","description_markdown":"**The Street View Text** (**SVT**) dataset was harvested from Google Street View. Image text in this data exhibits high variability and often has low resolution. In dealing with outdoor street level imagery, we note two characteristics. (1) Image text often comes from business signage and (2) business names are easily available through geographic business searches. These factors make the SVT set uniquely suited for word spotting in the wild: given a street view image, the goal is to identify words from nearby businesses.\r\n\r\nNote: the dataset has undergone revision since the time it was evaluated in this publication. Please consult the [ICCV2011 paper](http://vision.ucsd.edu/~kai/pubs/wang_iccv2011.pdf) for most up-to-date results.\r\n\r\nSource: [Street View Text Dataset](http://vision.ucsd.edu/~kai/svt/)\r\n\r\nImage source: [Street View Text Dataset](http://vision.ucsd.edu/~kai/svt/)","description_withheld":null,"homepage":"http://vision.ucsd.edu/~kai/svt/","introduced_date":null,"introduced_date_note":null,"introduced_by":null,"license":{"name":"Unknown","url":null},"modalities":[{"name":"Images","url":"/datasets/modality/images"}],"tasks":[{"name":"Scene Text Recognition","url":"/task/scene-text-recognition","datasets_with_task":"/datasets/task/scene-text-recognition"}],"languages":[],"variants":["SVT"],"data_loaders":[{"repo":"https://github.com/mindee/doctr","url":"https://mindee.github.io/doctr/latest/datasets.html#doctr.datasets.SVT","frameworks":["tf","pytorch"]},{"repo":"https://github.com/open-mmlab/mmocr","url":"https://github.com/open-mmlab/mmocr/blob/main/docs/datasets.md","frameworks":["pytorch"]}],"num_papers_in_archive":35,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/scene-text-recognition-on-svt","task":"Scene Text Recognition","dataset_variant":"SVT","rows":37,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"CLIP4STR-H (DFN-5B)","paper":"/paper/clip4str-a-simple-baseline-for-scene-text-1","metrics":{"Accuracy":"99.1"},"code_links":[{"title":"VamosC/CLIP4STR","url":"https://github.com/VamosC/CLIP4STR"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/an-empirical-study-of-scaling-law-for-ocr","title":"An Empirical Study of Scaling Law for OCR","date":"2023-12-29","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/dtrocr-decoder-only-transformer-for-optical","title":"DTrOCR: Decoder-only Transformer for Optical Character Recognition","date":"2023-08-30","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/context-perception-parallel-decoder-for-scene","title":"Context Perception Parallel Decoder for Scene Text Recognition","date":"2023-07-23","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/diffusionstr-diffusion-model-for-scene-text","title":"DiffusionSTR: Diffusion Model for Scene Text Recognition","date":"2023-06-29","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/clip4str-a-simple-baseline-for-scene-text-1","title":"CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model","date":"2023-05-23","rows_on_this_dataset":4,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":3,"samples_unverified":7,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/tps-attention-enhanced-thin-plate-spline-for","title":"TPS++: Attention-Enhanced Thin-Plate Spline for Scene Text Recognition","date":"2023-05-09","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/self-supervised-character-to-character","title":"Self-supervised Character-to-Character Distillation for Text Recognition","date":"2022-11-01","rows_on_this_dataset":3,"code_links":1,"syntology":null},{"paper":"/paper/multi-granularity-prediction-for-scene-text","title":"Multi-Granularity Prediction for Scene Text Recognition","date":"2022-09-08","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/scene-text-recognition-with-permuted","title":"Scene Text Recognition with Permuted Autoregressive Sequence Models","date":"2022-07-14","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":5,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/a-glyph-driven-topology-enhancement-network","title":"Self-supervised Implicit Glyph Attention for Text Recognition","date":"2022-03-07","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/safl-a-self-attention-scene-text-recognizer-1","title":"SAFL: A Self-Attention Scene Text Recognizer with Focal Loss","date":"2022-01-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/visual-semantics-allow-for-textual-reasoning-1","title":"Visual Semantics Allow for Textual Reasoning Better in Scene Text Recognition","date":"2021-12-24","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/multi-modal-text-recognition-networks","title":"Multi-modal Text Recognition Networks: Interactive Enhancements between Visual and Semantic Features","date":"2021-11-30","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/cdistnet-perceiving-multi-domain-character","title":"CDistNet: Perceiving Multi-Domain Character Distance for Robust Text Recognition","date":"2021-11-22","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/look-back-again-dual-parallel-attention","title":"Look Back Again: Dual Parallel Attention Network for Accurate and Robust Scene Text Recognition","date":"2021-08-01","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/why-you-should-try-the-real-data-for-the","title":"Why You Should Try the Real Data for the Scene Text Recognition","date":"2021-07-29","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/representation-and-correlation-enhanced","title":"Representation and Correlation Enhanced Encoder-Decoder Framework for Scene Text Recognition","date":"2021-06-13","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/vision-transformer-for-fast-and-efficient","title":"Vision Transformer for Fast and Efficient Scene Text Recognition","date":"2021-05-18","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/cstr-a-classification-perspective-on-scene","title":"Revisiting Classification Perspective on Scene Text Recognition","date":"2021-02-22","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/seed-semantics-enhanced-encoder-decoder","title":"SEED: Semantics Enhanced Encoder-Decoder Framework for Scene Text Recognition","date":"2020-05-22","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/towards-accurate-scene-text-recognition-with","title":"Towards Accurate Scene Text Recognition with Semantic Reasoning Networks","date":"2020-03-27","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/textscanner-reading-characters-in-order-for","title":"TextScanner: Reading Characters in Order for Robust Scene Text Recognition","date":"2019-12-28","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/decoupled-attention-network-for-text","title":"Decoupled Attention Network for Text Recognition","date":"2019-12-21","rows_on_this_dataset":1,"code_links":5,"syntology":null},{"paper":"/paper/on-recognizing-texts-of-arbitrary-shapes-with","title":"On Recognizing Texts of Arbitrary Shapes with 2D Self-Attention","date":"2019-10-10","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/what-is-wrong-with-scene-text-recognition","title":"What Is Wrong With Scene Text Recognition Model Comparisons? Dataset and Model Analysis","date":"2019-04-03","rows_on_this_dataset":1,"code_links":13,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":19,"samples_ran":0,"samples_unverified":19,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/show-attend-and-read-a-simple-and-strong","title":"Show, Attend and Read: A Simple and Strong Baseline for Irregular Text Recognition","date":"2018-11-02","rows_on_this_dataset":1,"code_links":8,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":0,"samples_unverified":8,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/scene-text-recognition-from-two-dimensional","title":"Scene Text Recognition from Two-Dimensional Perspective","date":"2018-09-18","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/aster-an-attentional-scene-text-recognizer","title":"ASTER: An Attentional Scene Text Recognizer with Flexible Rectification","date":"2018-06-25","rows_on_this_dataset":1,"code_links":4,"syntology":null},{"paper":"/paper/star-net-a-spatial-attention-residue-network","title":"Star-net: A spatial attention residue network for scene text recognition.","date":"2016-09-20","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/robust-scene-text-recognition-with-automatic","title":"Robust Scene Text Recognition with Automatic Rectification","date":"2016-03-12","rows_on_this_dataset":1,"code_links":5,"syntology":null},{"paper":"/paper/an-end-to-end-trainable-neural-network-for","title":"An End-to-End Trainable Neural Network for Image-based Sequence Recognition and Its Application to Scene Text Recognition","date":"2015-07-21","rows_on_this_dataset":1,"code_links":85,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":81,"samples_ran":19,"samples_unverified":62,"pointer_only_for_licence":17,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/synthetic-data-and-artificial-neural-networks","title":"Synthetic Data and Artificial Neural Networks for Natural Scene Text Recognition","date":"2014-06-09","rows_on_this_dataset":1,"code_links":1,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":5,"samples_harvested":126,"samples_ran":27,"samples_unverified":99,"pointer_only_for_licence":17,"papers_with_no_sample_that_ran":2,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}