{"url":"/task/scene-text-recognition","name":"Scene Text Recognition","slug":"scene-text-recognition","description_markdown":"See [Scene Text Detection](https://paperswithcode.com/task/scene-text-detection) for leaderboards in this task.","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":269,"papers_with_code":146,"benchmarks":15,"benchmark_tables_in_archive":15,"benchmark_tables_shown":15,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":29,"subtasks":1,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/scene-text-recognition-on-icdar2013","slug":"scene-text-recognition-on-icdar2013","dataset":"ICDAR2013","dataset_url":"/dataset/icdar-2013","rows_in_archive":38,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"CLIP4STR-L*","paper_title":"An Empirical Study of Scaling Law for OCR","paper_url":"/paper/an-empirical-study-of-scaling-law-for-ocr","paper_date":"2023-12-29","arxiv_id":"2401.00028","code_links":[{"title":"large-ocr-model/large-ocr-model.github.io","url":"https://github.com/large-ocr-model/large-ocr-model.github.io"}],"syntology":null}},{"leaderboard":"/sota/scene-text-recognition-on-svt","slug":"scene-text-recognition-on-svt","dataset":"SVT","dataset_url":"/dataset/svt","rows_in_archive":37,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"CLIP4STR-H (DFN-5B)","paper_title":"CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model","paper_url":"/paper/clip4str-a-simple-baseline-for-scene-text-1","paper_date":"2023-05-23","arxiv_id":"2305.14014","code_links":[{"title":"VamosC/CLIP4STR","url":"https://github.com/VamosC/CLIP4STR"}],"syntology":{"n":10,"n_ran":3,"n_unverified":7,"n_pointer_only":0}}},{"leaderboard":"/sota/scene-text-recognition-on-icdar2015","slug":"scene-text-recognition-on-icdar2015","dataset":"ICDAR2015","dataset_url":null,"rows_in_archive":27,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"DTrOCR 105M","paper_title":"DTrOCR: Decoder-only Transformer for Optical Character Recognition","paper_url":"/paper/dtrocr-decoder-only-transformer-for-optical","paper_date":"2023-08-30","arxiv_id":"2308.15996","code_links":[{"title":"arvindrajan92/DTrOCR","url":"https://github.com/arvindrajan92/DTrOCR"}],"syntology":null}},{"leaderboard":"/sota/scene-text-recognition-on-cute80","slug":"scene-text-recognition-on-cute80","dataset":"CUTE80","dataset_url":"/dataset/cute80","rows_in_archive":18,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"CPPD","paper_title":"Context Perception Parallel Decoder for Scene Text Recognition","paper_url":"/paper/context-perception-parallel-decoder-for-scene","paper_date":"2023-07-23","arxiv_id":"2307.12270","code_links":[{"title":"PaddlePaddle/PaddleOCR","url":"https://github.com/PaddlePaddle/PaddleOCR"},{"title":"topdu/openocr","url":"https://github.com/topdu/openocr"}],"syntology":null}},{"leaderboard":"/sota/scene-text-recognition-on-iiit5k","slug":"scene-text-recognition-on-iiit5k","dataset":"IIIT5k","dataset_url":"/dataset/iiit5k","rows_in_archive":17,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"CLIP4STR-L (DataComp-1B)","paper_title":"CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model","paper_url":"/paper/clip4str-a-simple-baseline-for-scene-text-1","paper_date":"2023-05-23","arxiv_id":"2305.14014","code_links":[{"title":"VamosC/CLIP4STR","url":"https://github.com/VamosC/CLIP4STR"}],"syntology":{"n":10,"n_ran":3,"n_unverified":7,"n_pointer_only":0}}},{"leaderboard":"/sota/scene-text-recognition-on-svtp","slug":"scene-text-recognition-on-svtp","dataset":"SVTP","dataset_url":"/dataset/svtp","rows_in_archive":17,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"DTrOCR 105M","paper_title":"DTrOCR: Decoder-only Transformer for Optical Character Recognition","paper_url":"/paper/dtrocr-decoder-only-transformer-for-optical","paper_date":"2023-08-30","arxiv_id":"2308.15996","code_links":[{"title":"arvindrajan92/DTrOCR","url":"https://github.com/arvindrajan92/DTrOCR"}],"syntology":null}},{"leaderboard":"/sota/scene-text-recognition-on-icdar-2003","slug":"scene-text-recognition-on-icdar-2003","dataset":"ICDAR 2003","dataset_url":"/dataset/icdar-2003","rows_in_archive":12,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Yet Another Text Recognizer","paper_title":"Why You Should Try the Real Data for the Scene Text Recognition","paper_url":"/paper/why-you-should-try-the-real-data-for-the","paper_date":"2021-07-29","arxiv_id":"2107.13938","code_links":[{"title":"openvinotoolkit/training_extensions","url":"https://github.com/openvinotoolkit/training_extensions"}],"syntology":null}},{"leaderboard":"/sota/scene-text-recognition-on-ic19-art","slug":"scene-text-recognition-on-ic19-art","dataset":"IC19-Art","dataset_url":null,"rows_in_archive":5,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"CLIP4STR-L (DataComp-1B)","paper_title":"CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model","paper_url":"/paper/clip4str-a-simple-baseline-for-scene-text-1","paper_date":"2023-05-23","arxiv_id":"2305.14014","code_links":[{"title":"VamosC/CLIP4STR","url":"https://github.com/VamosC/CLIP4STR"}],"syntology":{"n":10,"n_ran":3,"n_unverified":7,"n_pointer_only":0}}},{"leaderboard":"/sota/scene-text-recognition-on-wost","slug":"scene-text-recognition-on-wost","dataset":"WOST","dataset_url":"/dataset/wost","rows_in_archive":5,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"CLIP4STR-H (DFN-5B)","paper_title":"CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model","paper_url":"/paper/clip4str-a-simple-baseline-for-scene-text-1","paper_date":"2023-05-23","arxiv_id":"2305.14014","code_links":[{"title":"VamosC/CLIP4STR","url":"https://github.com/VamosC/CLIP4STR"}],"syntology":{"n":10,"n_ran":3,"n_unverified":7,"n_pointer_only":0}}},{"leaderboard":"/sota/scene-text-recognition-on-coco-text","slug":"scene-text-recognition-on-coco-text","dataset":"COCO-Text","dataset_url":"/dataset/coco-text","rows_in_archive":4,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"CLIP4STR-L","paper_title":"CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model","paper_url":"/paper/clip4str-a-simple-baseline-for-scene-text-1","paper_date":"2023-05-23","arxiv_id":"2305.14014","code_links":[{"title":"VamosC/CLIP4STR","url":"https://github.com/VamosC/CLIP4STR"}],"syntology":{"n":10,"n_ran":3,"n_unverified":7,"n_pointer_only":0}}},{"leaderboard":"/sota/scene-text-recognition-on-host","slug":"scene-text-recognition-on-host","dataset":"HOST","dataset_url":"/dataset/host","rows_in_archive":3,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"CLIP4STR-L","paper_title":"CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model","paper_url":"/paper/clip4str-a-simple-baseline-for-scene-text-1","paper_date":"2023-05-23","arxiv_id":"2305.14014","code_links":[{"title":"VamosC/CLIP4STR","url":"https://github.com/VamosC/CLIP4STR"}],"syntology":{"n":10,"n_ran":3,"n_unverified":7,"n_pointer_only":0}}},{"leaderboard":"/sota/scene-text-recognition-on-uber-text","slug":"scene-text-recognition-on-uber-text","dataset":"Uber-Text","dataset_url":null,"rows_in_archive":3,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"CLIP4STR-L (DataComp-1B)","paper_title":"CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model","paper_url":"/paper/clip4str-a-simple-baseline-for-scene-text-1","paper_date":"2023-05-23","arxiv_id":"2305.14014","code_links":[{"title":"VamosC/CLIP4STR","url":"https://github.com/VamosC/CLIP4STR"}],"syntology":{"n":10,"n_ran":3,"n_unverified":7,"n_pointer_only":0}}},{"leaderboard":"/sota/scene-text-recognition-on-msda","slug":"scene-text-recognition-on-msda","dataset":"MSDA","dataset_url":"/dataset/msda","rows_in_archive":2,"metrics":["Average Accuracy"],"first_row_in_archive_order":{"model":"MetaSelf-Learning","paper_title":"Meta Self-Learning for Multi-Source Domain Adaptation: A Benchmark","paper_url":"/paper/meta-self-learning-for-multi-source-domain","paper_date":"2021-08-24","arxiv_id":"2108.10840","code_links":[{"title":"bupt-ai-cz/Meta-SelfLearning","url":"https://github.com/bupt-ai-cz/Meta-SelfLearning"}],"syntology":null}},{"leaderboard":"/sota/scene-text-recognition-on-ic13","slug":"scene-text-recognition-on-ic13","dataset":"IC13","dataset_url":"/dataset/ic13","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ABINet-LV+TPS++","paper_title":"TPS++: Attention-Enhanced Thin-Plate Spline for Scene Text Recognition","paper_url":"/paper/tps-attention-enhanced-thin-plate-spline-for","paper_date":"2023-05-09","arxiv_id":"2305.05322","code_links":[{"title":"simplify23/tps_pp","url":"https://github.com/simplify23/tps_pp"}],"syntology":null}},{"leaderboard":"/sota/scene-text-recognition-on-svt-p","slug":"scene-text-recognition-on-svt-p","dataset":"SVT-P","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ABINet-LV+TPS++","paper_title":"TPS++: Attention-Enhanced Thin-Plate Spline for Scene Text Recognition","paper_url":"/paper/tps-attention-enhanced-thin-plate-spline-for","paper_date":"2023-05-09","arxiv_id":"2305.05322","code_links":[{"title":"simplify23/tps_pp","url":"https://github.com/simplify23/tps_pp"}],"syntology":null}}],"datasets":[{"url":"/dataset/icdar-2013","name":"ICDAR 2013","full_name":"","num_papers_in_archive":246},{"url":"/dataset/coco-text","name":"COCO-Text","full_name":"COCO-Text","num_papers_in_archive":89},{"url":"/dataset/icdar-2003","name":"ICDAR 2003","full_name":"ICDAR 2003","num_papers_in_archive":53},{"url":"/dataset/textocr","name":"TextOCR","full_name":"","num_papers_in_archive":37},{"url":"/dataset/svt","name":"SVT","full_name":"Street View Text Dataset","num_papers_in_archive":35},{"url":"/dataset/rctw-17","name":"RCTW-17","full_name":"Reading Chinese Text in the Wild","num_papers_in_archive":20},{"url":"/dataset/host","name":"HOST","full_name":"","num_papers_in_archive":18},{"url":"/dataset/cute80","name":"CUTE80","full_name":"","num_papers_in_archive":17},{"url":"/dataset/wost","name":"WOST","full_name":"","num_papers_in_archive":17},{"url":"/dataset/ufpr-alpr","name":"UFPR-ALPR","full_name":"","num_papers_in_archive":15},{"url":"/dataset/iiit5k","name":"IIIT5k","full_name":"","num_papers_in_archive":14},{"url":"/dataset/svtp","name":"SVTP","full_name":"","num_papers_in_archive":14},{"url":"/dataset/gsl","name":"GSL","full_name":"Greek Sign Language","num_papers_in_archive":11},{"url":"/dataset/rodosol-alpr","name":"RodoSol-ALPR","full_name":"","num_papers_in_archive":8},{"url":"/dataset/ssig-segplate","name":"SSIG-SegPlate","full_name":"","num_papers_in_archive":8},{"url":"/dataset/iiit-ilst","name":"IIIT-ILST","full_name":"","num_papers_in_archive":6},{"url":"/dataset/mle2e","name":"MLe2e","full_name":"","num_papers_in_archive":6},{"url":"/dataset/chineselp","name":"ChineseLP","full_name":"","num_papers_in_archive":4},{"url":"/dataset/vehicle-rear","name":"Vehicle-Rear","full_name":"","num_papers_in_archive":3},{"url":"/dataset/msda","name":"MSDA","full_name":"Multi-source domain adaptation dataset for text recognition","num_papers_in_archive":2},{"url":"/dataset/mtst","name":"MTST","full_name":"Mobile Turkish Scene Text","num_papers_in_archive":2},{"url":"/dataset/ufpr-amr-dataset","name":"UFPR-AMR","full_name":"","num_papers_in_archive":2},{"url":"/dataset/copel-amr-dataset","name":"Copel-AMR","full_name":"","num_papers_in_archive":1},{"url":"/dataset/ic13","name":"IC13","full_name":"","num_papers_in_archive":1},{"url":"/dataset/utrset-real","name":"UTRSet-Real","full_name":"","num_papers_in_archive":1},{"url":"/dataset/utrset-synth","name":"UTRSet-Synth","full_name":"","num_papers_in_archive":1},{"url":"/dataset/benchmarking-chinese-text-recognition-1","name":"Benchmarking-Chinese-Text-Recognition","full_name":"","num_papers_in_archive":0},{"url":"/dataset/thanh","name":"SignboardText","full_name":"","num_papers_in_archive":0},{"url":"/dataset/ts-tr","name":"TS-TR","full_name":"Turkish Scene Text Recognition Dataset","num_papers_in_archive":0}],"subtasks":[{"url":"/task/jersey-number-recognition","name":"Jersey Number Recognition"}],"parent_tasks":[{"url":"/task/scene-parsing","name":"Scene Parsing"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":146,"tagged_in_all":269,"items":[{"url":"/paper/an-end-to-end-trainable-neural-network-for","title":"An End-to-End Trainable Neural Network for Image-based Sequence Recognition and Its Application to Scene Text Recognition","date":"2015-07-21","arxiv_id":"1507.05717","repositories_listed":85,"syntology":{"n":81,"n_ran":19,"n_unverified":62,"n_pointer_only":17}},{"url":"/paper/what-is-wrong-with-scene-text-recognition","title":"What Is Wrong With Scene Text Recognition Model Comparisons? Dataset and Model Analysis","date":"2019-04-03","arxiv_id":"1904.01906","repositories_listed":13,"syntology":{"n":19,"n_ran":0,"n_unverified":19,"n_pointer_only":0}},{"url":"/paper/trocr-transformer-based-optical-character","title":"TrOCR: Transformer-based Optical Character Recognition with Pre-trained Models","date":"2021-09-21","arxiv_id":"2109.10282","repositories_listed":8,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/show-attend-and-read-a-simple-and-strong","title":"Show, Attend and Read: A Simple and Strong Baseline for Irregular Text Recognition","date":"2018-11-02","arxiv_id":"1811.00751","repositories_listed":8,"syntology":{"n":8,"n_ran":0,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/master-multi-aspect-non-local-network-for","title":"MASTER: Multi-Aspect Non-local Network for Scene Text Recognition","date":"2019-10-07","arxiv_id":"1910.02562","repositories_listed":7,"syntology":{"n":10,"n_ran":4,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/a-multi-object-rectified-attention-network","title":"A Multi-Object Rectified Attention Network for Scene Text Recognition","date":"2019-01-10","arxiv_id":"1901.03003","repositories_listed":7,"syntology":null},{"url":"/paper/fots-fast-oriented-text-spotting-with-a","title":"FOTS: Fast Oriented Text Spotting with a Unified Network","date":"2018-01-05","arxiv_id":"1801.01671","repositories_listed":7,"syntology":null},{"url":"/paper/from-two-to-one-a-new-scene-text-recognizer","title":"From Two to One: A New Scene Text Recognizer with Visual Language Modeling Network","date":"2021-08-22","arxiv_id":"2108.09661","repositories_listed":5,"syntology":null},{"url":"/paper/robustscanner-dynamically-enhancing","title":"RobustScanner: Dynamically Enhancing Positional Clues for Robust Text Recognition","date":"2020-07-15","arxiv_id":"2007.07542","repositories_listed":5,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/decoupled-attention-network-for-text","title":"Decoupled Attention Network for Text Recognition","date":"2019-12-21","arxiv_id":"1912.10205","repositories_listed":5,"syntology":null},{"url":"/paper/robust-scene-text-recognition-with-automatic","title":"Robust Scene Text Recognition with Automatic Rectification","date":"2016-03-12","arxiv_id":"1603.03915","repositories_listed":5,"syntology":null},{"url":"/paper/svtr-scene-text-recognition-with-a-single","title":"SVTR: Scene Text Recognition with a Single Visual Model","date":"2022-04-30","arxiv_id":"2205.00159","repositories_listed":4,"syntology":null},{"url":"/paper/primitive-representation-learning-for-scene","title":"Primitive Representation Learning for Scene Text Recognition","date":"2021-05-10","arxiv_id":"2105.04286","repositories_listed":4,"syntology":null},{"url":"/paper/read-like-humans-autonomous-bidirectional-and","title":"Read Like Humans: Autonomous, Bidirectional and Iterative Language Modeling for Scene Text Recognition","date":"2021-03-11","arxiv_id":"2103.06495","repositories_listed":4,"syntology":{"n":28,"n_ran":18,"n_unverified":10,"n_pointer_only":18}},{"url":"/paper/aster-an-attentional-scene-text-recognizer","title":"ASTER: An Attentional Scene Text Recognizer with Flexible Rectification","date":"2018-06-25","arxiv_id":null,"repositories_listed":4,"syntology":null},{"url":"/paper/nrtr-a-no-recurrence-sequence-to-sequence","title":"NRTR: A No-Recurrence Sequence-to-Sequence Model For Scene Text Recognition","date":"2018-06-04","arxiv_id":"1806.00926","repositories_listed":4,"syntology":null},{"url":"/paper/multi-granularity-prediction-for-scene-text","title":"Multi-Granularity Prediction for Scene Text Recognition","date":"2022-09-08","arxiv_id":"2209.03592","repositories_listed":3,"syntology":null},{"url":"/paper/multi-modal-text-recognition-networks","title":"Multi-modal Text Recognition Networks: Interactive Enhancements between Visual and Semantic Features","date":"2021-11-30","arxiv_id":"2111.15263","repositories_listed":3,"syntology":null},{"url":"/paper/cdistnet-perceiving-multi-domain-character","title":"CDistNet: Perceiving Multi-Domain Character Distance for Robust Text Recognition","date":"2021-11-22","arxiv_id":"2111.11011","repositories_listed":3,"syntology":null},{"url":"/paper/vision-transformer-for-fast-and-efficient","title":"Vision Transformer for Fast and Efficient Scene Text Recognition","date":"2021-05-18","arxiv_id":"2105.08582","repositories_listed":3,"syntology":null},{"url":"/paper/spin-structure-preserving-inner-offset","title":"SPIN: Structure-Preserving Inner Offset Network for Scene Text Recognition","date":"2020-05-27","arxiv_id":"2005.13117","repositories_listed":3,"syntology":null},{"url":"/paper/seed-semantics-enhanced-encoder-decoder","title":"SEED: Semantics Enhanced Encoder-Decoder Framework for Scene Text Recognition","date":"2020-05-22","arxiv_id":"2005.10977","repositories_listed":3,"syntology":null},{"url":"/paper/towards-accurate-scene-text-recognition-with","title":"Towards Accurate Scene Text Recognition with Semantic Reasoning Networks","date":"2020-03-27","arxiv_id":"2003.12294","repositories_listed":3,"syntology":null},{"url":"/paper/unrealtext-synthesizing-realistic-scene-text","title":"UnrealText: Synthesizing Realistic Scene Text Images from the Unreal World","date":"2020-03-24","arxiv_id":"2003.10608","repositories_listed":3,"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/visual-re-ranking-with-natural-language","title":"Visual Re-ranking with Natural Language Understanding for Text Spotting","date":"2018-10-29","arxiv_id":"1810.12738","repositories_listed":3,"syntology":null},{"url":"/paper/textboxes-a-single-shot-oriented-scene-text","title":"TextBoxes++: A Single-Shot Oriented Scene Text Detector","date":"2018-01-09","arxiv_id":"1801.02765","repositories_listed":3,"syntology":null},{"url":"/paper/stn-ocr-a-single-neural-network-for-text","title":"STN-OCR: A single Neural Network for Text Detection and Text Recognition","date":"2017-07-27","arxiv_id":"1707.08831","repositories_listed":3,"syntology":null},{"url":"/paper/class-aware-mask-guided-feature-refinement","title":"Class-Aware Mask-Guided Feature Refinement for Scene Text Recognition","date":"2024-02-21","arxiv_id":"2402.13643","repositories_listed":2,"syntology":null},{"url":"/paper/text-image-inpainting-via-global-structure","title":"Text Image Inpainting via Global Structure-Guided Diffusion Models","date":"2024-01-26","arxiv_id":"2401.14832","repositories_listed":2,"syntology":{"n":11,"n_ran":4,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/multi-granularity-prediction-with-learnable","title":"Multi-Granularity Prediction with Learnable Fusion for Scene Text Recognition","date":"2023-07-25","arxiv_id":"2307.13244","repositories_listed":2,"syntology":null}],"syntology_records":9,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":1,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}