{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/optical-character-recognition/papers/8","list_of":"/task/optical-character-recognition","task":"Optical Character Recognition (OCR)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":8,"pages_in_order":13,"rows_per_page":100,"rows":[701,800],"of":1243,"counts":{"archive_papers_tagged":1243,"with_a_code_link":462,"where_syntology_ran_a_sample":76,"not_listed_spam_title":0,"listed":1243,"listed_where_code_ran":76,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":64,"every_run_a_failure_of_syntologys_instrument":12,"listed_with_a_run_with_no_instrument_failure":64,"listed_every_run_a_failure_of_syntologys_instrument":12,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/optical-character-recognition","prev":"/task/optical-character-recognition/papers/7","next":"/task/optical-character-recognition/papers/9","papers":[{"url":null,"slug":"what-large-language-models-bring-to-text-rich","title":"What Large Language Models Bring to Text-rich VQA?","date":"2023-11-13","arxiv_id":"2311.07306","repositories_listed":0,"syntology":null},{"url":null,"slug":"donut-hole-donut-sparsification-by-harnessing","title":"DONUT-hole: DONUT Sparsification by Harnessing Knowledge and Optimizing Learning Efficiency","date":"2023-11-09","arxiv_id":"2311.05778","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiconer-v2-a-large-multilingual-dataset","title":"MultiCoNER v2: a Large Multilingual dataset for Fine-grained and Noisy Named Entity Recognition","date":"2023-10-20","arxiv_id":"2310.13213","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficientocr-an-extensible-open-source","title":"EfficientOCR: An Extensible, Open-Source Package for Efficiently Digitizing World Knowledge","date":"2023-10-16","arxiv_id":"2310.10050","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-reducing-hallucination-in-extracting","title":"Towards reducing hallucination in extracting information from financial reports using Large Language Models","date":"2023-10-16","arxiv_id":"2310.10760","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-sparse-spatial-relation-in-graph","title":"Exploring Sparse Spatial Relation in Graph Inference for Text-Based VQA","date":"2023-10-13","arxiv_id":"2310.09147","repositories_listed":0,"syntology":null},{"url":null,"slug":"invisible-threats-backdoor-attack-in-ocr","title":"Invisible Threats: Backdoor Attack in OCR Systems","date":"2023-10-12","arxiv_id":"2310.08259","repositories_listed":0,"syntology":null},{"url":null,"slug":"solution-for-smart-101-challenge-of-iccv","title":"Solution for SMART-101 Challenge of ICCV Multi-modal Algorithmic Reasoning Task 2023","date":"2023-10-10","arxiv_id":"2310.06440","repositories_listed":0,"syntology":null},{"url":null,"slug":"constructing-image-text-pair-dataset-from","title":"Constructing Image-Text Pair Dataset from Books","date":"2023-10-03","arxiv_id":"2310.01936","repositories_listed":0,"syntology":null},{"url":null,"slug":"comprehensive-overview-of-named-entity","title":"Comprehensive Overview of Named Entity Recognition: Models, Domain-Specific Applications and Challenges","date":"2023-09-25","arxiv_id":"2309.14084","repositories_listed":0,"syntology":null},{"url":null,"slug":"bengali-document-layout-analysis-a-yolov8","title":"Bengali Document Layout Analysis -- A YOLOV8 Based Ensembling Approach","date":"2023-09-02","arxiv_id":"2309.00848","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-ocr-performance-through-post-ocr","title":"Enhancing OCR Performance through Post-OCR Models: Adopting Glyph Embedding for Improved Correction","date":"2023-08-29","arxiv_id":"2308.15262","repositories_listed":0,"syntology":null},{"url":null,"slug":"bengali-document-layout-analysis-with","title":"Bengali Document Layout Analysis with Detectron2","date":"2023-08-26","arxiv_id":"2308.13769","repositories_listed":0,"syntology":null},{"url":"/paper/handwritten-image-augmentation","slug":"handwritten-image-augmentation","title":"Handwritten image augmentation","date":"2023-08-26","arxiv_id":"2308.13791","repositories_listed":0,"syntology":null},{"url":null,"slug":"disgo-automatic-end-to-end-evaluation-for","title":"DISGO: Automatic End-to-End Evaluation for Scene Text OCR","date":"2023-08-25","arxiv_id":"2308.13173","repositories_listed":0,"syntology":null},{"url":null,"slug":"american-stories-a-large-scale-structured","title":"American Stories: A Large-Scale Structured Text Dataset of Historical U.S. Newspapers","date":"2023-08-24","arxiv_id":"2308.12477","repositories_listed":0,"syntology":null},{"url":null,"slug":"cnn-based-cuneiform-sign-detection-learned","title":"CNN based Cuneiform Sign Detection Learned from Annotated 3D Renderings and Mapped Photographs with Illumination Augmentation","date":"2023-08-22","arxiv_id":"2308.11277","repositories_listed":0,"syntology":null},{"url":null,"slug":"extraction-of-text-from-optic-nerve-optical","title":"Extraction of Text from Optic Nerve Optical Coherence Tomography Reports","date":"2023-08-21","arxiv_id":"2308.10790","repositories_listed":0,"syntology":null},{"url":null,"slug":"ocr-language-models-with-custom-vocabularies","title":"OCR Language Models with Custom Vocabularies","date":"2023-08-18","arxiv_id":"2308.09671","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoding-imagery-unleashing-large-language","title":"Multimodal Analysis Of Google Bard And GPT-Vision: Experiments In Visual Reasoning","date":"2023-08-17","arxiv_id":"2309.16705","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-about-translation-new-coding-system-for","title":"Training BERT Models to Carry Over a Coding System Developed on One Corpus to Another","date":"2023-08-07","arxiv_id":"2308.03742","repositories_listed":0,"syntology":null},{"url":null,"slug":"ctp-net-character-texture-perception-network","title":"CTP-Net: Character Texture Perception Network for Document Image Forgery Localization","date":"2023-08-04","arxiv_id":"2308.02158","repositories_listed":0,"syntology":null},{"url":null,"slug":"making-the-v-in-text-vqa-matter","title":"Making the V in Text-VQA Matter","date":"2023-08-01","arxiv_id":"2308.00295","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-zero-shot-character-recognition-a-gold","title":"Toward Zero-shot Character Recognition: A Gold Standard Dataset with Radical-level Annotations","date":"2023-08-01","arxiv_id":"2308.00655","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-the-neural-network-training-for","title":"Optimizing the Neural Network Training for OCR Error Correction of Historical Hebrew Texts","date":"2023-07-30","arxiv_id":"2307.16220","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-a-period-specific-optimized-neural","title":"Toward a Period-Specific Optimized Neural Network for OCR Error Correction of Historical Hebrew Texts","date":"2023-07-30","arxiv_id":"2307.16213","repositories_listed":0,"syntology":null},{"url":null,"slug":"matadoc-margin-and-text-aware-document","title":"MataDoc: Margin and Text Aware Document Dewarping for Arbitrary Boundary","date":"2023-07-24","arxiv_id":"2307.12571","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-analysis-of-sr-gan-models","title":"A comparative analysis of SRGAN models","date":"2023-07-18","arxiv_id":"2307.09456","repositories_listed":0,"syntology":null},{"url":null,"slug":"handwritten-and-printed-text-segmentation-a","title":"Handwritten and Printed Text Segmentation: A Signature Case Study","date":"2023-07-15","arxiv_id":"2307.07887","repositories_listed":0,"syntology":null},{"url":null,"slug":"handwritten-text-recognition-using","title":"Handwritten Text Recognition Using Convolutional Neural Network","date":"2023-07-11","arxiv_id":"2307.05396","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-pipeline-for-improving-optical","title":"A Novel Pipeline for Improving Optical Character Recognition through Post-processing Using Natural Language Processing","date":"2023-07-09","arxiv_id":"2307.04245","repositories_listed":0,"syntology":null},{"url":null,"slug":"artificial-eye-for-the-blind","title":"Artificial Eye for the Blind","date":"2023-07-07","arxiv_id":"2308.00801","repositories_listed":0,"syntology":null},{"url":null,"slug":"estimating-post-ocr-denoising-complexity-on","title":"Estimating Post-OCR Denoising Complexity on Numerical Texts","date":"2023-07-03","arxiv_id":"2307.01020","repositories_listed":0,"syntology":null},{"url":null,"slug":"fraunhofer-sit-at-checkthat-2023-mixing","title":"Fraunhofer SIT at CheckThat! 2023: Mixing Single-Modal Classifiers to Estimate the Check-Worthiness of Multi-Modal Tweets","date":"2023-07-02","arxiv_id":"2307.00610","repositories_listed":0,"syntology":null},{"url":null,"slug":"resume-information-extraction-via-post-ocr","title":"Resume Information Extraction via Post-OCR Text Processing","date":"2023-06-23","arxiv_id":"2306.13775","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-information-extraction-from","title":"Weakly supervised information extraction from inscrutable handwritten document images","date":"2023-06-12","arxiv_id":"2306.06823","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-based-unet-with-multi-headed","title":"Transformer-Based UNet with Multi-Headed Cross-Attention Skip Connections to Eliminate Artifacts in Scanned Documents","date":"2023-06-05","arxiv_id":"2306.02815","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-handwritten-ocr-with-training","title":"Improving Handwritten OCR with Training Samples Generated by Glyph Conditional Denoising Diffusion Probabilistic Model","date":"2023-05-31","arxiv_id":"2305.19543","repositories_listed":0,"syntology":null},{"url":null,"slug":"people-and-places-of-historical-europe","title":"People and Places of Historical Europe: Bootstrapping Annotation Pipeline and a New Corpus of Named Entities in Late Medieval Texts","date":"2023-05-26","arxiv_id":"2305.16718","repositories_listed":0,"syntology":null},{"url":"/paper/dublin-document-understanding-by-language","slug":"dublin-document-understanding-by-language","title":"DUBLIN -- Document Understanding By Language-Image Network","date":"2023-05-23","arxiv_id":"2305.14218","repositories_listed":0,"syntology":null},{"url":null,"slug":"textdiffuser-diffusion-models-as-text-1","title":"TextDiffuser: Diffusion Models as Text Painters","date":"2023-05-18","arxiv_id":"2305.10855","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequence-to-sequence-pre-training-with","title":"Sequence-to-Sequence Pre-training with Unified Modality Masking for Visual Document Understanding","date":"2023-05-16","arxiv_id":"2305.10448","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-reading-order-in-uncontrolled-conditions","title":"Text Reading Order in Uncontrolled Conditions by Sparse Graph Segmentation","date":"2023-05-04","arxiv_id":"2305.02577","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-bert-based-scientific-relation","title":"Evaluating BERT-based Scientific Relation Classifiers for Scholarly Knowledge Graph Construction on Digital Library Collections","date":"2023-05-03","arxiv_id":"2305.02291","repositories_listed":0,"syntology":null},{"url":null,"slug":"icdar-2023-competition-on-reading-the-seal","title":"ICDAR 2023 Competition on Reading the Seal Title","date":"2023-04-24","arxiv_id":"2304.11966","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-short-video-rumor-detection-system","title":"Multimodal Short Video Rumor Detection System Based on Contrastive Learning","date":"2023-04-17","arxiv_id":"2304.08401","repositories_listed":0,"syntology":null},{"url":null,"slug":"cleansing-jewel-a-neural-spelling-correction","title":"Cleansing Jewel: A Neural Spelling Correction Model Built On Google OCR-ed Tibetan Manuscripts","date":"2023-04-07","arxiv_id":"2304.03427","repositories_listed":0,"syntology":null},{"url":null,"slug":"linking-representations-with-multimodal","title":"Linking Representations with Multimodal Contrastive Learning","date":"2023-04-07","arxiv_id":"2304.03464","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-semi-automatic-method-for-document","title":"A semi-automatic method for document classification in the shipping industry","date":"2023-03-29","arxiv_id":"2305.06148","repositories_listed":0,"syntology":null},{"url":null,"slug":"clip-reident-contrastive-training-for-player","title":"CLIP-ReIdent: Contrastive Training for Player Re-Identification","date":"2023-03-21","arxiv_id":"2303.11855","repositories_listed":0,"syntology":null},{"url":null,"slug":"optical-character-recognition-and","title":"Optical Character Recognition and Transcription of Berber Signs from Images in a Low-Resource Language Amazigh","date":"2023-03-21","arxiv_id":"2303.13549","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-system-description-of-dun-oscar-team-for","title":"The System Description of dun_oscar team for The ICPR MSR Challenge","date":"2023-03-13","arxiv_id":"2303.06878","repositories_listed":0,"syntology":null},{"url":null,"slug":"meme-sentiment-analysis-enhanced-with","title":"Meme Sentiment Analysis Enhanced with Multimodal Spatial Encoding and Facial Embedding","date":"2023-03-03","arxiv_id":"2303.01781","repositories_listed":0,"syntology":null},{"url":null,"slug":"user-centric-evaluation-of-ocr-systems-for","title":"User-Centric Evaluation of OCR Systems for Kwak'wala","date":"2023-02-26","arxiv_id":"2302.13410","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-investigation-into-pre-training-object","title":"An Investigation into Pre-Training Object-Centric Representations for Reinforcement Learning","date":"2023-02-09","arxiv_id":"2302.04419","repositories_listed":0,"syntology":null},{"url":null,"slug":"device-depth-and-visual-concepts-aware","title":"DEVICE: DEpth and VIsual ConcEpts Aware Transformer for TextCaps","date":"2023-02-03","arxiv_id":"2302.01540","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparling-learning-latent-representations-with","title":"SPARLING: Learning Latent Representations with Extremely Sparse Activations","date":"2023-02-03","arxiv_id":"2302.01976","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-feasibility-of-attacking-thai-lpr","title":"On the feasibility of attacking Thai LPR systems with adversarial examples","date":"2023-01-13","arxiv_id":"2301.05506","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-inference-performance-of-machine","title":"Improving Inference Performance of Machine Learning with the Divide-and-Conquer Principle","date":"2023-01-12","arxiv_id":"2301.05099","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-rule-web-based-diagnosis-and","title":"Semantic rule Web-based Diagnosis and Treatment of Vector-Borne Diseases using SWRL rules","date":"2023-01-08","arxiv_id":"2301.03013","repositories_listed":0,"syntology":null},{"url":null,"slug":"bengali-handwritten-digit-recognition-using","title":"Bengali Handwritten Digit Recognition using CNN with Explainable AI","date":"2022-12-23","arxiv_id":"2212.12146","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-robust-handwritten-text-recognition","title":"Towards Robust Handwritten Text Recognition with On-the-fly User Participation","date":"2022-12-17","arxiv_id":"2212.08834","repositories_listed":0,"syntology":null},{"url":null,"slug":"geometric-rectification-of-creased-document","title":"Geometric Rectification of Creased Document Images based on Isometric Mapping","date":"2022-12-16","arxiv_id":"2212.08365","repositories_listed":0,"syntology":null},{"url":null,"slug":"scenegate-scene-graph-based-co-attention","title":"SceneGATE: Scene-Graph based co-Attention networks for TExt visual question answering","date":"2022-12-16","arxiv_id":"2212.08283","repositories_listed":0,"syntology":null},{"url":null,"slug":"extending-trocr-for-text-localization-free","title":"Extending TrOCR for Text Localization-Free OCR of Full-Page Scanned Receipt Images","date":"2022-12-11","arxiv_id":"2212.05525","repositories_listed":0,"syntology":null},{"url":null,"slug":"pacman-a-framework-for-pulse-oximeter-digit","title":"PACMAN: a framework for pulse oximeter digit detection and reading in a low-resource setting","date":"2022-12-09","arxiv_id":"2212.04964","repositories_listed":0,"syntology":null},{"url":null,"slug":"ocr-rtps-an-ocr-based-real-time-positioning","title":"OCR-RTPS: An OCR-based real-time positioning system for the valet parking","date":"2022-12-08","arxiv_id":"2212.04116","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-retrieval-from-the-digitized","title":"Information Retrieval from the Digitized Books","date":"2022-12-02","arxiv_id":"2212.00999","repositories_listed":0,"syntology":null},{"url":null,"slug":"chart-rcnn-efficient-line-chart-data","title":"Chart-RCNN: Efficient Line Chart Data Extraction from Camera Images","date":"2022-11-25","arxiv_id":"2211.14362","repositories_listed":0,"syntology":null},{"url":null,"slug":"look-read-and-ask-learning-to-ask-questions","title":"Look, Read and Ask: Learning to Ask Questions by Reading Text in Images","date":"2022-11-23","arxiv_id":"2211.12950","repositories_listed":0,"syntology":null},{"url":null,"slug":"out-of-candidate-rectification-for-weakly","title":"Out-of-Candidate Rectification for Weakly Supervised Semantic Segmentation","date":"2022-11-22","arxiv_id":"2211.12268","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-aware-dual-routing-network-for-visual","title":"Text-Aware Dual Routing Network for Visual Question Answering","date":"2022-11-17","arxiv_id":"2211.14450","repositories_listed":0,"syntology":null},{"url":null,"slug":"chartparser-automatic-chart-parsing-for-print","title":"ChartParser: Automatic Chart Parsing for Print-Impaired","date":"2022-11-16","arxiv_id":"2211.08863","repositories_listed":0,"syntology":null},{"url":"/paper/efficient-few-shot-learning-for-pixel-precise","slug":"efficient-few-shot-learning-for-pixel-precise","title":"Efficient few-shot learning for pixel-precise handwritten document layout analysis","date":"2022-10-27","arxiv_id":"2210.15570","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-late-multi-modal-fusion-model-for-detecting","title":"A Late Multi-Modal Fusion Model for Detecting Hybrid Spam E-mail","date":"2022-10-26","arxiv_id":"2210.14616","repositories_listed":0,"syntology":null},{"url":"/paper/cordeep-and-the-sacrobosco-dataset-detection","slug":"cordeep-and-the-sacrobosco-dataset-detection","title":"CorDeep and the Sacrobosco Dataset: Detection of Visual Elements in Historical Documents","date":"2022-10-15","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"menuai-restaurant-food-recommendation-system","title":"MenuAI: Restaurant Food Recommendation System via a Transformer-based Deep Learning Model","date":"2022-10-15","arxiv_id":"2210.08266","repositories_listed":0,"syntology":null},{"url":null,"slug":"key-information-extraction-in-purchase","title":"Key Information Extraction in Purchase Documents using Deep Learning and Rule-based Corrections","date":"2022-10-07","arxiv_id":"2210.03453","repositories_listed":0,"syntology":null},{"url":null,"slug":"erasenet-a-recurrent-residual-network-for","title":"EraseNet: A Recurrent Residual Network for Supervised Document Cleaning","date":"2022-10-03","arxiv_id":"2210.00708","repositories_listed":0,"syntology":null},{"url":null,"slug":"synthesizing-annotated-image-and-video-data","title":"Synthesizing Annotated Image and Video Data Using a Rendering-Based Pipeline for Improved License Plate Recognition","date":"2022-09-28","arxiv_id":"2209.14448","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-rendering-framework-for-data-augmentation","title":"3D Rendering Framework for Data Augmentation in Optical Character Recognition","date":"2022-09-27","arxiv_id":"2209.14970","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-3d-spatial-reasoning-for-human-like","title":"Toward 3D Spatial Reasoning for Human-like Text-based Visual Question Answering","date":"2022-09-21","arxiv_id":"2209.10326","repositories_listed":0,"syntology":null},{"url":null,"slug":"out-of-vocabulary-challenge-report","title":"Out-of-Vocabulary Challenge Report","date":"2022-09-14","arxiv_id":"2209.06717","repositories_listed":0,"syntology":null},{"url":null,"slug":"computer-vision-based-vehicle-tracking-as-a","title":"Computer vision based vehicle tracking as a complementary and scalable approach to RFID tagging","date":"2022-09-13","arxiv_id":"2209.05911","repositories_listed":0,"syntology":null},{"url":null,"slug":"document-image-binarization-in-jpeg","title":"Document Image Binarization in JPEG Compressed Domain using Dual Discriminator Generative Adversarial Networks","date":"2022-09-13","arxiv_id":"2209.05921","repositories_listed":0,"syntology":null},{"url":null,"slug":"ocr-for-tiff-compressed-document-images","title":"OCR for TIFF Compressed Document Images Directly in Compressed Domain Using Text segmentation and Hidden Markov Model","date":"2022-09-13","arxiv_id":"2209.09118","repositories_listed":0,"syntology":null},{"url":null,"slug":"prestu-pre-training-for-scene-text","title":"PreSTU: Pre-Training for Scene-Text Understanding","date":"2022-09-12","arxiv_id":"2209.05534","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-masked-bounding-box-selection-based-resnet","title":"A Masked Bounding-Box Selection Based ResNet Predictor for Text Rotation Prediction","date":"2022-09-06","arxiv_id":"2209.09198","repositories_listed":0,"syntology":null},{"url":null,"slug":"youve-translated-it-now-what","title":"You’ve translated it, now what?","date":"2022-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-black-box-attack-on-optical-character","title":"A Black-Box Attack on Optical Character Recognition Systems","date":"2022-08-30","arxiv_id":"2208.14302","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-energy-activity-dataset-for-smart-homes","title":"An Energy Activity Dataset for Smart Homes","date":"2022-08-29","arxiv_id":"2208.13416","repositories_listed":0,"syntology":null},{"url":null,"slug":"effectiveness-of-mining-audio-and-text-pairs","title":"Effectiveness of Mining Audio and Text Pairs from Public Data for Improving ASR Systems for Low-Resource Languages","date":"2022-08-26","arxiv_id":"2208.12666","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-subtitle-feature-enhanced-video","title":"Visual Subtitle Feature Enhanced Video Outline Generation","date":"2022-08-24","arxiv_id":"2208.11307","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-end-to-end-ocr-framework-for-robust-arabic","title":"An End-to-End OCR Framework for Robust Arabic-Handwriting Recognition using a Novel Transformers-based Model and an Innovative 270 Million-Words Multi-Font Corpus of Classical Arabic with Diacritics","date":"2022-08-20","arxiv_id":"2208.11484","repositories_listed":0,"syntology":null},{"url":null,"slug":"to-show-or-not-to-show-redacting-sensitive","title":"To show or not to show: Redacting sensitive text from videos of electronic displays","date":"2022-08-19","arxiv_id":"2208.10270","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-extraction-from-scanned-invoice","title":"Information Extraction from Scanned Invoice Images using Text Analysis and Layout Features","date":"2022-08-08","arxiv_id":"2208.04011","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-boxes-boosting-end-to-end-scene-text","title":"Optimal Boxes: Boosting End-to-End Scene Text Recognition by Adjusting Annotated Bounding Boxes via Reinforcement Learning","date":"2022-07-25","arxiv_id":"2207.11934","repositories_listed":0,"syntology":null},{"url":null,"slug":"dexter-an-end-to-end-system-to-extract-table","title":"DEXTER: An end-to-end system to extract table contents from electronic medical health documents","date":"2022-07-14","arxiv_id":"2207.06823","repositories_listed":0,"syntology":null},{"url":null,"slug":"gmn-generative-multi-modal-network-for-1","title":"GMN: Generative Multi-modal Network for Practical Document Information Extraction","date":"2022-07-11","arxiv_id":"2207.04713","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-multimodal-vision-language-models","title":"Towards Multimodal Vision-Language Models Generating Non-Generic Text","date":"2022-07-09","arxiv_id":"2207.04174","repositories_listed":0,"syntology":null}],"record_sha256":"5c14bf186f8b2fbb39aba16fb8492dc8239927e57ce57fc50910d5ad35e2723c","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}