{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/optical-character-recognition/papers/5","list_of":"/task/optical-character-recognition","task":"Optical Character Recognition (OCR)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":5,"pages_in_order":13,"rows_per_page":100,"rows":[401,500],"of":1243,"counts":{"archive_papers_tagged":1243,"with_a_code_link":462,"where_syntology_ran_a_sample":76,"not_listed_spam_title":0,"listed":1243,"listed_where_code_ran":76,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":64,"every_run_a_failure_of_syntologys_instrument":12,"listed_with_a_run_with_no_instrument_failure":64,"listed_every_run_a_failure_of_syntologys_instrument":12,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/optical-character-recognition","prev":"/task/optical-character-recognition/papers/4","next":"/task/optical-character-recognition/papers/6","papers":[{"url":"/paper/large-scale-font-independent-urdu-text","slug":"large-scale-font-independent-urdu-text","title":"Large Scale Font Independent Urdu Text Recognition System","date":"2020-05-14","arxiv_id":"2005.06752","repositories_listed":1,"syntology":null},{"url":"/paper/nat-noise-aware-training-for-robust-neural","slug":"nat-noise-aware-training-for-robust-neural","title":"NAT: Noise-Aware Training for Robust Neural Sequence Labeling","date":"2020-05-14","arxiv_id":"2005.07162","repositories_listed":1,"syntology":null},{"url":"/paper/boosting-on-the-shoulders-of-giants-in","slug":"boosting-on-the-shoulders-of-giants-in","title":"Boosting on the shoulders of giants in quantum device calibration","date":"2020-05-13","arxiv_id":"2005.06194","repositories_listed":1,"syntology":null},{"url":"/paper/a-gaussian-process-upsampling-model-for","slug":"a-gaussian-process-upsampling-model-for","title":"A Gaussian Process Upsampling Model for Improvements in Optical Character Recognition","date":"2020-05-07","arxiv_id":"2005.03780","repositories_listed":1,"syntology":null},{"url":"/paper/time-aware-word-embeddings-for-three-lebanese","slug":"time-aware-word-embeddings-for-three-lebanese","title":"Time-Aware Word Embeddings for Three Lebanese News Archives","date":"2020-05-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/a-skip-connected-multi-column-network-for","slug":"a-skip-connected-multi-column-network-for","title":"A Skip-connected Multi-column Network for Isolated Handwritten Bangla Character and Digit recognition","date":"2020-04-27","arxiv_id":"2004.12769","repositories_listed":1,"syntology":null},{"url":"/paper/a-tool-for-facilitating-ocr-postediting-in","slug":"a-tool-for-facilitating-ocr-postediting-in","title":"A Tool for Facilitating OCR Postediting in Historical Documents","date":"2020-04-23","arxiv_id":"2004.11471","repositories_listed":1,"syntology":null},{"url":"/paper/an-evaluation-of-dnn-architectures-for-page","slug":"an-evaluation-of-dnn-architectures-for-page","title":"An Evaluation of DNN Architectures for Page Segmentation of Historical Newspapers","date":"2020-04-15","arxiv_id":"2004.07317","repositories_listed":1,"syntology":null},{"url":"/paper/chemgrapher-optical-graph-recognition-of","slug":"chemgrapher-optical-graph-recognition-of","title":"ChemGrapher: Optical Graph Recognition of Chemical Compounds by Deep Learning","date":"2020-02-23","arxiv_id":"2002.09914","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/chemgrapher-optical-graph-recognition-of#ran","syntology_url":"https://syntology.ai/paper/2002.09914","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2002.09914"}},"official":null}},{"url":"/paper/lambert-layout-aware-language-modeling-using","slug":"lambert-layout-aware-language-modeling-using","title":"LAMBERT: Layout-Aware (Language) Modeling for information extraction","date":"2020-02-19","arxiv_id":"2002.08087","repositories_listed":1,"syntology":null},{"url":"/paper/indiscapes-instance-segmentation-networks-for","slug":"indiscapes-instance-segmentation-networks-for","title":"Indiscapes: Instance Segmentation Networks for Layout Parsing of Historical Indic Manuscripts","date":"2019-12-15","arxiv_id":"1912.07025","repositories_listed":1,"syntology":null},{"url":"/paper/vehicle-re-identification-exploring-feature","slug":"vehicle-re-identification-exploring-feature","title":"Vehicle-Rear: A New Dataset to Explore Feature Fusion for Vehicle Identification Using Convolutional Neural Networks","date":"2019-11-13","arxiv_id":"1911.05541","repositories_listed":1,"syntology":null},{"url":"/paper/from-the-paft-to-the-fiiture-a-fully-1","slug":"from-the-paft-to-the-fiiture-a-fully-1","title":"From the Paft to the Fiiture: a Fully Automatic NMT and Word Embeddings Method for OCR Post-Correction","date":"2019-10-12","arxiv_id":"1910.05535","repositories_listed":1,"syntology":null},{"url":"/paper/midv-2019-challenges-of-the-modern-mobile","slug":"midv-2019-challenges-of-the-modern-mobile","title":"MIDV-2019: Challenges of the modern mobile-based document OCR","date":"2019-10-09","arxiv_id":"1910.04009","repositories_listed":1,"syntology":null},{"url":"/paper/parallel-iterative-edit-models-for-local","slug":"parallel-iterative-edit-models-for-local","title":"Parallel Iterative Edit Models for Local Sequence Transduction","date":"2019-10-07","arxiv_id":"1910.02893","repositories_listed":1,"syntology":null},{"url":"/paper/dewarpnet-single-image-document-unwarping","slug":"dewarpnet-single-image-document-unwarping","title":"DewarpNet: Single-Image Document Unwarping With Stacked 3D and 2D Regression Networks","date":"2019-10-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/multi-modal-page-stream-segmentation-with","slug":"multi-modal-page-stream-segmentation-with","title":"Multi-modal Page Stream Segmentation with Convolutional Neural Networks","date":"2019-09-27","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/document-rectification-and-illumination","slug":"document-rectification-and-illumination","title":"Document Rectification and Illumination Correction using a Patch-based CNN","date":"2019-09-20","arxiv_id":"1909.09470","repositories_listed":1,"syntology":{"n":4,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/document-rectification-and-illumination#ran","syntology_url":"https://syntology.ai/paper/1909.09470","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1909.09470"}},"official":null}},{"url":"/paper/eaten-entity-aware-attention-for-single-shot","slug":"eaten-entity-aware-attention-for-single-shot","title":"EATEN: Entity-aware Attention for Single Shot Visual Text Extraction","date":"2019-09-20","arxiv_id":"1909.09380","repositories_listed":1,"syntology":null},{"url":"/paper/cord-a-consolidated-receipt-dataset-for-post","slug":"cord-a-consolidated-receipt-dataset-for-post","title":"CORD: A Consolidated Receipt Dataset for Post-OCR Parsing","date":"2019-09-14","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/post-ocr-parsing-building-simple-and-robust","slug":"post-ocr-parsing-building-simple-and-robust","title":"Post-OCR parsing: building simple and robust parser via BIO tagging","date":"2019-09-14","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/an-efficient-and-layout-independent-automatic","slug":"an-efficient-and-layout-independent-automatic","title":"An Efficient and Layout-Independent Automatic License Plate Recognition System Based on the YOLO detector","date":"2019-09-04","arxiv_id":"1909.01754","repositories_listed":1,"syntology":null},{"url":"/paper/popeval-a-character-level-approach-to-end-to","slug":"popeval-a-character-level-approach-to-end-to","title":"PopEval: A Character-Level Approach to End-To-End Evaluation Compatible with Word-Level Benchmark Dataset","date":"2019-08-29","arxiv_id":"1908.11060","repositories_listed":1,"syntology":null},{"url":"/paper/a-single-shot-arbitrarily-shaped-text","slug":"a-single-shot-arbitrarily-shaped-text","title":"A Single-Shot Arbitrarily-Shaped Text Detector based on Context Attended Multi-Task Learning","date":"2019-08-15","arxiv_id":"1908.05498","repositories_listed":1,"syntology":null},{"url":"/paper/answering-questions-about-data-visualizations","slug":"answering-questions-about-data-visualizations","title":"Answering Questions about Data Visualizations using Efficient Bimodal Fusion","date":"2019-08-05","arxiv_id":"1908.01801","repositories_listed":1,"syntology":null},{"url":"/paper/ekush-a-multipurpose-and-multitype","slug":"ekush-a-multipurpose-and-multitype","title":"Ekush: A Multipurpose and Multitype Comprehensive Database for Online Off-Line Bangla Handwritten Characters","date":"2019-07-17","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/brno-mobile-ocr-dataset","slug":"brno-mobile-ocr-dataset","title":"Brno Mobile OCR Dataset","date":"2019-07-02","arxiv_id":"1907.01307","repositories_listed":1,"syntology":null},{"url":"/paper/handwritten-text-segmentation-via-end-to-end","slug":"handwritten-text-segmentation-via-end-to-end","title":"Handwritten Text Segmentation via End-to-End Learning of Convolutional Neural Network","date":"2019-06-12","arxiv_id":"1906.05229","repositories_listed":1,"syntology":null},{"url":"/paper/clustering-based-article-identification-in","slug":"clustering-based-article-identification-in","title":"Clustering-Based Article Identification in Historical Newspapers","date":"2019-06-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/190503333","slug":"190503333","title":"Enhancing Cross-task Transferability of Adversarial Examples with Dispersion Reduction","date":"2019-05-08","arxiv_id":"1905.03333","repositories_listed":1,"syntology":null},{"url":"/paper/object-detection-deep-learning-networks-for","slug":"object-detection-deep-learning-networks-for","title":"Object detection deep learning networks for Optical Character Recognition","date":"2019-05-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/an-ocr-system-for-the-unified-northern","slug":"an-ocr-system-for-the-unified-northern","title":"An OCR system for the Unified Northern Alphabet","date":"2019-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/accurate-data-efficient-unconstrained-text","slug":"accurate-data-efficient-unconstrained-text","title":"Accurate, Data-Efficient, Unconstrained Text Recognition with Convolutional Neural Networks","date":"2018-12-31","arxiv_id":"1812.11894","repositories_listed":1,"syntology":null},{"url":"/paper/binary-document-image-super-resolution-for","slug":"binary-document-image-super-resolution-for","title":"Binary Document Image Super Resolution for Improved Readability and OCR Performance","date":"2018-12-06","arxiv_id":"1812.02475","repositories_listed":1,"syntology":null},{"url":"/paper/from-videos-to-urls-a-multi-browser-guide-to","slug":"from-videos-to-urls-a-multi-browser-guide-to","title":"From Videos to URLs: A Multi-Browser Guide To Extract User's Behavior with Optical Character Recognition","date":"2018-11-15","arxiv_id":"1811.06193","repositories_listed":1,"syntology":null},{"url":"/paper/state-of-the-art-optical-character","slug":"state-of-the-art-optical-character","title":"State of the Art Optical Character Recognition of 19th Century Fraktur Scripts using Open Source Engines","date":"2018-10-08","arxiv_id":"1810.03436","repositories_listed":1,"syntology":null},{"url":"/paper/a-hybrid-approach-to-automatic-corpus","slug":"a-hybrid-approach-to-automatic-corpus","title":"A Hybrid Approach to Automatic Corpus Generation for Chinese Spelling Check","date":"2018-10-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/upcycle-your-ocr-reusing-ocrs-for-post-ocr","slug":"upcycle-your-ocr-reusing-ocrs-for-post-ocr","title":"Upcycle Your OCR: Reusing OCRs for Post-OCR Text Correction in Romanised Sanskrit","date":"2018-09-06","arxiv_id":"1809.02147","repositories_listed":1,"syntology":null},{"url":"/paper/license-plate-detection-and-recognition-in","slug":"license-plate-detection-and-recognition-in","title":"License Plate Detection and Recognition in Unconstrained Scenarios","date":"2018-09-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/finn-l-library-extensions-and-design-trade","slug":"finn-l-library-extensions-and-design-trade","title":"FINN-L: Library Extensions and Design Trade-off Analysis for Variable Precision LSTM Networks on FPGAs","date":"2018-07-11","arxiv_id":"1807.04093","repositories_listed":1,"syntology":null},{"url":"/paper/calamari-a-high-performance-tensorflow-based","slug":"calamari-a-high-performance-tensorflow-based","title":"Calamari - A High-Performance Tensorflow-based Deep Learning Package for Optical Character Recognition","date":"2018-07-05","arxiv_id":"1807.02004","repositories_listed":1,"syntology":null},{"url":"/paper/implicit-language-model-in-lstm-for-ocr","slug":"implicit-language-model-in-lstm-for-ocr","title":"Implicit Language Model in LSTM for OCR","date":"2018-05-23","arxiv_id":"1805.09441","repositories_listed":1,"syntology":null},{"url":"/paper/pdfanno-a-web-based-linguistic-annotation","slug":"pdfanno-a-web-based-linguistic-annotation","title":"PDFAnno: a Web-based Linguistic Annotation Tool for PDF Documents","date":"2018-05-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/tf-lm-tensorflow-based-language-modeling","slug":"tf-lm-tensorflow-based-language-modeling","title":"TF-LM: TensorFlow-based Language Modeling Toolkit","date":"2018-05-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/improving-ocr-accuracy-on-early-printed-books","slug":"improving-ocr-accuracy-on-early-printed-books","title":"Improving OCR Accuracy on Early Printed Books by combining Pretraining, Voting, and Active Learning","date":"2018-02-27","arxiv_id":"1802.10038","repositories_listed":1,"syntology":null},{"url":"/paper/improving-ocr-accuracy-on-early-printed-books-1","slug":"improving-ocr-accuracy-on-early-printed-books-1","title":"Improving OCR Accuracy on Early Printed Books using Deep Convolutional Networks","date":"2018-02-27","arxiv_id":"1802.10033","repositories_listed":1,"syntology":null},{"url":"/paper/teaching-machines-to-code-neural-markup","slug":"teaching-machines-to-code-neural-markup","title":"Teaching Machines to Code: Neural Markup Generation with Visual Attention","date":"2018-02-15","arxiv_id":"1802.05415","repositories_listed":1,"syntology":null},{"url":"/paper/transfer-learning-for-ocropus-model-training","slug":"transfer-learning-for-ocropus-model-training","title":"Transfer Learning for OCRopus Model Training on Early Printed Books","date":"2017-12-15","arxiv_id":"1712.05586","repositories_listed":1,"syntology":null},{"url":"/paper/gated-recurrent-convolution-neural-network","slug":"gated-recurrent-convolution-neural-network","title":"Gated Recurrent Convolution Neural Network for OCR","date":"2017-12-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/improving-ocr-accuracy-on-early-printed-books-2","slug":"improving-ocr-accuracy-on-early-printed-books-2","title":"Improving OCR Accuracy on Early Printed Books by utilizing Cross Fold Training and Voting","date":"2017-11-27","arxiv_id":"1711.09670","repositories_listed":1,"syntology":null},{"url":"/paper/aon-towards-arbitrarily-oriented-text","slug":"aon-towards-arbitrarily-oriented-text","title":"AON: Towards Arbitrarily-Oriented Text Recognition","date":"2017-11-12","arxiv_id":"1711.04226","repositories_listed":1,"syntology":null},{"url":"/paper/single-classifier-based-passive-system-for","slug":"single-classifier-based-passive-system-for","title":"Single Classifier-based Passive System for Source Printer Classification using Local Texture Features","date":"2017-06-22","arxiv_id":"1706.07422","repositories_listed":1,"syntology":null},{"url":"/paper/searnn-training-rnns-with-global-local-losses","slug":"searnn-training-rnns-with-global-local-losses","title":"SEARNN: Training RNNs with Global-Local Losses","date":"2017-06-14","arxiv_id":"1706.04499","repositories_listed":1,"syntology":null},{"url":"/paper/mining-spatio-temporal-data-on","slug":"mining-spatio-temporal-data-on","title":"Mining Spatio-temporal Data on Industrialization from Historical Registries","date":"2016-12-03","arxiv_id":"1612.00992","repositories_listed":1,"syntology":null},{"url":"/paper/latent-tree-language-model-1","slug":"latent-tree-language-model-1","title":"Latent Tree Language Model","date":"2016-11-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/star-net-a-spatial-attention-residue-network","slug":"star-net-a-spatial-attention-residue-network","title":"Star-net: A spatial attention residue network for scene text recognition.","date":"2016-09-20","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/data-driven-spelling-correction-using","slug":"data-driven-spelling-correction-using","title":"Data-Driven Spelling Correction using Weighted Finite-State Methods","date":"2016-08-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/an-efficient-way-for-segmentation-of-bangla","slug":"an-efficient-way-for-segmentation-of-bangla","title":"An efficient way for segmentation of Bangla characters in printed document using curved scanning","date":"2016-05-13","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/improving-patch-based-scene-text-script","slug":"improving-patch-based-scene-text-script","title":"Improving patch-based scene text script identification with ensembles of conjoined networks","date":"2016-02-24","arxiv_id":"1602.07480","repositories_listed":1,"syntology":null},{"url":"/paper/calibrated-structured-prediction","slug":"calibrated-structured-prediction","title":"Calibrated Structured Prediction","date":"2015-12-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/corpus-for-coreference-resolution-on","slug":"corpus-for-coreference-resolution-on","title":"Corpus for Coreference Resolution on Scientific Papers","date":"2014-05-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/adapting-the-tesseract-open-source-ocr-engine","slug":"adapting-the-tesseract-open-source-ocr-engine","title":"Adapting the Tesseract Open Source OCR Engine for Multilingual OCR","date":"2009-07-25","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":null,"slug":"deqa-doc-adapting-deqa-score-to-document","title":"DeQA-Doc: Adapting DeQA-Score to Document Image Quality Assessment","date":"2025-07-17","arxiv_id":"2507.12796","repositories_listed":0,"syntology":null},{"url":null,"slug":"visionthink-smart-and-efficient-vision","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","date":"2025-07-17","arxiv_id":"2507.13348","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-the-signs-a-survey-of-edge-deployable","title":"Seeing the Signs: A Survey of Edge-Deployable OCR Models for Billboard Visibility Analysis","date":"2025-07-15","arxiv_id":"2507.11730","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-mllm-based-visually-rich-document","title":"A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends","date":"2025-07-14","arxiv_id":"2507.09861","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-and-implementation-of-an-ocr-powered","title":"Design and Implementation of an OCR-Powered Pipeline for Table Extraction from Invoices","date":"2025-07-09","arxiv_id":"2507.07029","repositories_listed":0,"syntology":null},{"url":null,"slug":"textpixs-glyph-conditioned-diffusion-with","title":"TextPixs: Glyph-Conditioned Diffusion with Character-Aware Attention and OCR-Guided Supervision","date":"2025-07-08","arxiv_id":"2507.06033","repositories_listed":0,"syntology":null},{"url":null,"slug":"logios-an-open-source-greek-polytonic-optical","title":"Logios : An open source Greek Polytonic Optical Character Recognition system","date":"2025-06-26","arxiv_id":"2506.21474","repositories_listed":0,"syntology":null},{"url":null,"slug":"engineering-rag-systems-for-real-world","title":"Engineering RAG Systems for Real-World Applications: Design, Development, and Evaluation","date":"2025-06-25","arxiv_id":"2506.20869","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-is-believing-mitigating-ocr","title":"Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models","date":"2025-06-25","arxiv_id":"2506.20168","repositories_listed":0,"syntology":null},{"url":null,"slug":"unfolding-the-past-a-comprehensive-deep","title":"Unfolding the Past: A Comprehensive Deep Learning Approach to Analyzing Incunabula Pages","date":"2025-06-22","arxiv_id":"2506.18069","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-accurate-and-revised-version-of-optical","title":"An accurate and revised version of optical character recognition-based speech synthesis using LabVIEW","date":"2025-06-18","arxiv_id":"2506.15029","repositories_listed":0,"syntology":null},{"url":null,"slug":"formgym-doing-paperwork-with-agents","title":"FormGym: Doing Paperwork with Agents","date":"2025-06-17","arxiv_id":"2506.14079","repositories_listed":0,"syntology":null},{"url":null,"slug":"adavideorag-omni-contextual-adaptive","title":"AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding","date":"2025-06-16","arxiv_id":"2506.13589","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-medical-vie-via-reinforcement","title":"Efficient Medical VIE via Reinforcement Learning","date":"2025-06-16","arxiv_id":"2506.13363","repositories_listed":0,"syntology":null},{"url":null,"slug":"multifinben-a-multilingual-multimodal-and","title":"MultiFinBen: A Multilingual, Multimodal, and Difficulty-Aware Benchmark for Financial LLM Evaluation","date":"2025-06-16","arxiv_id":"2506.14028","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-or-hallucination-understanding","title":"Generalization or Hallucination? Understanding Out-of-Context Reasoning in Transformers","date":"2025-06-12","arxiv_id":"2506.10887","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-automation-for-fdi-facilitation","title":"Intelligent Automation for FDI Facilitation: Optimizing Tariff Exemption Processes with OCR And Large Language Models","date":"2025-06-12","arxiv_id":"2506.12093","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-driven-real-world-super-resolution-of","title":"Task-driven real-world super-resolution of document scans","date":"2025-06-08","arxiv_id":"2506.06953","repositories_listed":0,"syntology":null},{"url":null,"slug":"reading-in-the-dark-with-foveated-event","title":"Reading in the Dark with Foveated Event Vision","date":"2025-06-07","arxiv_id":"2506.06918","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-ocr-quest-for-generalization-learning-to","title":"The OCR Quest for Generalization: Learning to recognize low-resource alphabets with model editing","date":"2025-06-07","arxiv_id":"2506.06761","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-vietnamese-document-analysis-and","title":"A Survey on Vietnamese Document Analysis and Recognition: Challenges and Future Directions","date":"2025-06-05","arxiv_id":"2506.05061","repositories_listed":0,"syntology":null},{"url":null,"slug":"sard-a-large-scale-synthetic-arabic-ocr","title":"SARD: A Large-Scale Synthetic Arabic OCR Dataset for Book-Style Text Recognition","date":"2025-05-30","arxiv_id":"2505.24600","repositories_listed":0,"syntology":null},{"url":null,"slug":"chartmind-a-comprehensive-benchmark-for","title":"ChartMind: A Comprehensive Benchmark for Complex Real-world Multimodal Chart Question Answering","date":"2025-05-29","arxiv_id":"2505.23242","repositories_listed":0,"syntology":null},{"url":null,"slug":"textsr-diffusion-super-resolution-with","title":"TextSR: Diffusion Super-Resolution with Multilingual OCR Guidance","date":"2025-05-29","arxiv_id":"2505.23119","repositories_listed":0,"syntology":null},{"url":null,"slug":"e2e-process-automation-leveraging-generative","title":"E2E Process Automation Leveraging Generative AI and IDP-Based Automation Agent: A Case Study on Corporate Expense Processing","date":"2025-05-27","arxiv_id":"2505.20733","repositories_listed":0,"syntology":null},{"url":null,"slug":"mt-3-scaling-mllm-based-text-image-machine","title":"MT$^{3}$: Scaling MLLM-based Text Image Machine Translation via Multi-Task Reinforcement Learning","date":"2025-05-26","arxiv_id":"2505.19714","repositories_listed":0,"syntology":null},{"url":null,"slug":"textdiffuser-rl-efficient-and-robust-text","title":"TextDiffuser-RL: Efficient and Robust Text Layout Optimization for High-Fidelity Text-to-Image Synthesis","date":"2025-05-25","arxiv_id":"2505.19291","repositories_listed":0,"syntology":null},{"url":null,"slug":"words-as-geometric-features-estimating","title":"Words as Geometric Features: Estimating Homography using Optical Character Recognition as Compressed Image Representation","date":"2025-05-25","arxiv_id":"2505.18925","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-rl-to-see-them-all-visual-triple-unified","title":"One RL to See Them All: Visual Triple Unified Reinforcement Learning","date":"2025-05-23","arxiv_id":"2505.18129","repositories_listed":0,"syntology":null},{"url":null,"slug":"textflux-an-ocr-free-dit-model-for-high","title":"TextFlux: An OCR-Free DiT Model for High-Fidelity Multilingual Scene Text Synthesis","date":"2025-05-23","arxiv_id":"2505.17778","repositories_listed":0,"syntology":null},{"url":null,"slug":"tokbench-evaluating-your-visual-tokenizer","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","date":"2025-05-23","arxiv_id":"2505.18142","repositories_listed":0,"syntology":null},{"url":"/paper/ocr-reasoning-benchmark-unveiling-the-true","slug":"ocr-reasoning-benchmark-unveiling-the-true","title":"OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning","date":"2025-05-22","arxiv_id":"2505.17163","repositories_listed":0,"syntology":{"n":10,"n_ran":7,"n_constructed":0,"n_ran_checked":7,"n_instrument":0,"n_unverified":3,"n_honours":0,"n_violates":0,"n_no_contract":7,"n_pointer_only":5,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 0 violated, 7 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/ocr-reasoning-benchmark-unveiling-the-true#ran","syntology_url":"https://syntology.ai/paper/2505.17163","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2505.17163"}},"official":null}},{"url":null,"slug":"what-media-frames-reveal-about-stance-a","title":"What Media Frames Reveal About Stance: A Dataset and Study about Memes in Climate Change Discourse","date":"2025-05-22","arxiv_id":"2505.16592","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-do-large-vision-language-models-see-text","title":"How Do Large Vision-Language Models See Text in Image? Unveiling the Distinctive Role of OCR Heads","date":"2025-05-21","arxiv_id":"2505.15865","repositories_listed":0,"syntology":null},{"url":null,"slug":"every-pixel-tells-a-story-end-to-end-urdu","title":"Every Pixel Tells a Story: End-to-End Urdu Newspaper OCR","date":"2025-05-20","arxiv_id":"2505.13943","repositories_listed":0,"syntology":null},{"url":"/paper/scalable-video-to-dataset-generation-for","slug":"scalable-video-to-dataset-generation-for","title":"Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents","date":"2025-05-19","arxiv_id":"2505.12632","repositories_listed":0,"syntology":{"n":9,"n_ran":8,"n_constructed":0,"n_ran_checked":8,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":8,"n_pointer_only":0,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 8 with no instrument failure: 0 honoured, 0 violated, 8 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/scalable-video-to-dataset-generation-for#ran","syntology_url":"https://syntology.ai/paper/2505.12632","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2505.12632"}},"official":null}},{"url":null,"slug":"the-hidden-structure-improving-legal-document","title":"The Hidden Structure -- Improving Legal Document Understanding Through Explicit Text Formatting","date":"2025-05-19","arxiv_id":"2505.12837","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-11070","title":"Towards Self-Improvement of Diffusion Models via Group Preference Optimization","date":"2025-05-16","arxiv_id":"2505.11070","repositories_listed":0,"syntology":null}],"record_sha256":"2cdb9199c63f622f36daed62a49ebbb6da0d73f76dbd7cdf164989ed9c4985aa","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}