{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/optical-character-recognition/papers/7","list_of":"/task/optical-character-recognition","task":"Optical Character Recognition (OCR)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":7,"pages_in_order":13,"rows_per_page":100,"rows":[601,700],"of":1243,"counts":{"archive_papers_tagged":1243,"with_a_code_link":462,"where_syntology_ran_a_sample":76,"not_listed_spam_title":0,"listed":1243,"listed_where_code_ran":76,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":64,"every_run_a_failure_of_syntologys_instrument":12,"listed_with_a_run_with_no_instrument_failure":64,"listed_every_run_a_failure_of_syntologys_instrument":12,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/optical-character-recognition","prev":"/task/optical-character-recognition/papers/6","next":"/task/optical-character-recognition/papers/8","papers":[{"url":null,"slug":"joytype-a-robust-design-for-multilingual","title":"JoyType: A Robust Design for Multilingual Visual Text Creation","date":"2024-09-26","arxiv_id":"2409.17524","repositories_listed":0,"syntology":null},{"url":null,"slug":"bench-benchmarking-vision-language-models-for","title":"@Bench: Benchmarking Vision-Language Models for Human-centered Assistive Technology","date":"2024-09-21","arxiv_id":"2409.14215","repositories_listed":0,"syntology":null},{"url":null,"slug":"nvlm-open-frontier-class-multimodal-llms","title":"NVLM: Open Frontier-Class Multimodal LLMs","date":"2024-09-17","arxiv_id":"2409.11402","repositories_listed":0,"syntology":null},{"url":null,"slug":"computer-vision-intelligence-test-modeling","title":"Computer Vision Intelligence Test Modeling and Generation: A Case Study on Smart OCR","date":"2024-09-14","arxiv_id":"2410.03536","repositories_listed":0,"syntology":null},{"url":"/paper/icdar-2024-competition-on-few-shot-and-many","slug":"icdar-2024-competition-on-few-shot-and-many","title":"ICDAR 2024 Competition on Few-Shot and Many-Shot Layout Segmentation of Ancient Manuscripts (SAM)","date":"2024-09-11","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/points-improving-your-vision-language-model","slug":"points-improving-your-vision-language-model","title":"POINTS: Improving Your Vision-language Model with Affordable Strategies","date":"2024-09-07","arxiv_id":"2409.04828","repositories_listed":0,"syntology":null},{"url":null,"slug":"confidence-aware-document-ocr-error-detection","title":"Confidence-Aware Document OCR Error Detection","date":"2024-09-06","arxiv_id":"2409.04117","repositories_listed":0,"syntology":null},{"url":null,"slug":"unit-unifying-image-and-text-recognition-in","title":"UNIT: Unifying Image and Text Recognition in One Vision Encoder","date":"2024-09-06","arxiv_id":"2409.04095","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-visual-language-models-replace-ocr-based","title":"Can Visual Language Models Replace OCR-Based Visual Question Answering Pipelines in Production? A Case Study in Retail","date":"2024-08-28","arxiv_id":"2408.15626","repositories_listed":0,"syntology":null},{"url":null,"slug":"charteye-a-deep-learning-framework-for-chart","title":"ChartEye: A Deep Learning Framework for Chart Information Extraction","date":"2024-08-28","arxiv_id":"2408.16123","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-discovery-in-optical-music","title":"Knowledge Discovery in Optical Music Recognition: Enhancing Information Retrieval with Instance Segmentation","date":"2024-08-27","arxiv_id":"2408.15002","repositories_listed":0,"syntology":null},{"url":null,"slug":"urdu-digital-text-word-optical-character","title":"A Permuted Autoregressive Approach to Word-Level Recognition for Urdu Digital Text","date":"2024-08-27","arxiv_id":"2408.15119","repositories_listed":0,"syntology":null},{"url":"/paper/mmr-evaluating-reading-ability-of-large","slug":"mmr-evaluating-reading-ability-of-large","title":"MMR: Evaluating Reading Ability of Large Multimodal Models","date":"2024-08-26","arxiv_id":"2408.14594","repositories_listed":0,"syntology":null},{"url":null,"slug":"ancient-but-digitized-developing-handwritten","title":"Ancient but Digitized: Developing Handwritten Optical Character Recognition for East Syriac Script Through Creating KHAMIS Dataset","date":"2024-08-24","arxiv_id":"2408.13631","repositories_listed":0,"syntology":null},{"url":null,"slug":"vintern-1b-an-efficient-multimodal-large","title":"Vintern-1B: An Efficient Multimodal Large Language Model for Vietnamese","date":"2024-08-22","arxiv_id":"2408.12480","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-language-models-for-page-stream","title":"Large Language Models for Page Stream Segmentation","date":"2024-08-21","arxiv_id":"2408.11981","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-multi-modal-llm-evaluation","title":"Revisiting Multi-Modal LLM Evaluation","date":"2024-08-09","arxiv_id":"2408.05334","repositories_listed":0,"syntology":null},{"url":null,"slug":"chatschema-a-pipeline-of-extracting","title":"ChatSchema: A pipeline of extracting structured information with Large Multimodal Models based on schema","date":"2024-07-26","arxiv_id":"2407.18716","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-robust-named-entity-recognizers-from","title":"Learning Robust Named Entity Recognizers From Noisy Data With Retrieval Augmentation","date":"2024-07-26","arxiv_id":"2407.18562","repositories_listed":0,"syntology":null},{"url":"/paper/vila-2-vila-augmented-vila","slug":"vila-2-vila-augmented-vila","title":"VILA$^2$: VILA Augmented VILA","date":"2024-07-24","arxiv_id":"2407.17453","repositories_listed":0,"syntology":null},{"url":null,"slug":"playertv-advanced-player-tracking-and","title":"PLayerTV: Advanced Player Tracking and Identification for Automatic Soccer Highlight Clips","date":"2024-07-22","arxiv_id":"2407.16076","repositories_listed":0,"syntology":null},{"url":null,"slug":"refining-corpora-from-a-model-calibration","title":"Refining Corpora from a Model Calibration Perspective for Chinese Spelling Correction","date":"2024-07-22","arxiv_id":"2407.15498","repositories_listed":0,"syntology":null},{"url":null,"slug":"braille-to-speech-generator-audio-generation","title":"Braille-to-Speech Generator: Audio Generation Based on Joint Fine-Tuning of CLIP and Fastspeech2","date":"2024-07-19","arxiv_id":"2407.14212","repositories_listed":0,"syntology":null},{"url":null,"slug":"qalam-a-multimodal-llm-for-arabic-optical","title":"Qalam : A Multimodal LLM for Arabic Optical Character and Handwriting Recognition","date":"2024-07-18","arxiv_id":"2407.13559","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-driven-single-image-super-resolution","title":"Task-driven single-image super-resolution reconstruction of document scans","date":"2024-07-12","arxiv_id":"2407.08993","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-accessible-comics-for-blind-and-low","title":"Toward accessible comics for blind and low vision readers","date":"2024-07-11","arxiv_id":"2407.08248","repositories_listed":0,"syntology":null},{"url":null,"slug":"resolving-sentiment-discrepancy-for","title":"Resolving Sentiment Discrepancy for Multimodal Sentiment Detection via Semantics Completion and Decomposition","date":"2024-07-09","arxiv_id":"2407.07026","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-segmentation-for-real-world-and","title":"Semantic Segmentation for Real-World and Synthetic Vehicle's Forward-Facing Camera Images","date":"2024-07-07","arxiv_id":"2407.05452","repositories_listed":0,"syntology":null},{"url":"/paper/rethinking-visual-prompting-for-multimodal","slug":"rethinking-visual-prompting-for-multimodal","title":"Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge","date":"2024-07-05","arxiv_id":"2407.04681","repositories_listed":0,"syntology":null},{"url":null,"slug":"proposal-report-for-the-2nd-scicap","title":"Proposal Report for the 2nd SciCAP Competition 2024","date":"2024-07-02","arxiv_id":"2407.01897","repositories_listed":0,"syntology":null},{"url":null,"slug":"mind-the-gap-analyzing-lacunae-with","title":"Mind the Gap: Analyzing Lacunae with Transformer-Based Transcription","date":"2024-06-28","arxiv_id":"2407.00250","repositories_listed":0,"syntology":null},{"url":null,"slug":"news-deja-vu-connecting-past-and-present-with","title":"News Deja Vu: Connecting Past and Present with Semantic Search","date":"2024-06-21","arxiv_id":"2406.15593","repositories_listed":0,"syntology":null},{"url":null,"slug":"gui-action-narrator-where-and-when-did-that","title":"GUI Action Narrator: Where and When Did That Action Take Place?","date":"2024-06-19","arxiv_id":"2406.13719","repositories_listed":0,"syntology":null},{"url":null,"slug":"unifying-multimodal-retrieval-via-document","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","date":"2024-06-17","arxiv_id":"2406.11251","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-question-answering-on-charts","title":"Enhancing Question Answering on Charts Through Effective Pre-training Tasks","date":"2024-06-14","arxiv_id":"2406.10085","repositories_listed":0,"syntology":null},{"url":null,"slug":"ospc-detecting-harmful-memes-with-large","title":"OSPC: Detecting Harmful Memes with Large Language Model as a Catalyst","date":"2024-06-14","arxiv_id":"2406.09779","repositories_listed":0,"syntology":null},{"url":null,"slug":"fetch-a-set-a-large-scale-ocr-free-benchmark","title":"Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval","date":"2024-06-11","arxiv_id":"2406.07315","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-automatic-extraction-of-pseudocode","title":"Scaling Automatic Extraction of Pseudocode","date":"2024-06-07","arxiv_id":"2406.04635","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-jersey-number-recognition-using","title":"Generalized Jersey Number Recognition Using Multi-task Learning With Orientation-guided Weight Refinement","date":"2024-06-03","arxiv_id":"2406.01033","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-text-generation-on-images-with","title":"Improving Text Generation on Images with Synthetic Captions","date":"2024-06-01","arxiv_id":"2406.00505","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-unified-multi-granularity-text","title":"Towards Unified Multi-granularity Text Detection with Interactive Attention","date":"2024-05-30","arxiv_id":"2405.19765","repositories_listed":0,"syntology":null},{"url":null,"slug":"notes-on-applicability-of-gpt-4-to-document","title":"Notes on Applicability of GPT-4 to Document Understanding","date":"2024-05-28","arxiv_id":"2405.18433","repositories_listed":0,"syntology":null},{"url":null,"slug":"realitysummary-on-demand-mixed-reality","title":"RealitySummary: Exploring On-Demand Mixed Reality Text Summarization and Question Answering using Large Language Models","date":"2024-05-28","arxiv_id":"2405.18620","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-models-for-spreadsheet","title":"Vision Language Models for Spreadsheet Understanding: Challenges and Opportunities","date":"2024-05-25","arxiv_id":"2405.16234","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-approach-for-railway","title":"Transfer Learning Approach for Railway Technical Map (RTM) Component Identification","date":"2024-05-21","arxiv_id":"2405.13229","repositories_listed":0,"syntology":null},{"url":null,"slug":"callico-a-versatile-open-source-document","title":"Callico: a Versatile Open-Source Document Image Annotation Platform","date":"2024-05-02","arxiv_id":"2405.01071","repositories_listed":0,"syntology":null},{"url":null,"slug":"crepe-coordinate-aware-end-to-end-document","title":"CREPE: Coordinate-Aware End-to-End Document Parser","date":"2024-05-01","arxiv_id":"2405.00260","repositories_listed":0,"syntology":null},{"url":null,"slug":"deline8k-a-synthetic-data-pipeline-for-the","title":"DELINE8K: A Synthetic Data Pipeline for the Semantic Segmentation of Historical Documents","date":"2024-04-30","arxiv_id":"2404.19259","repositories_listed":0,"syntology":null},{"url":null,"slug":"dlora-trocr-mixed-text-mode-optical-character","title":"Mixed Text Recognition with Efficient Parameter Fine-Tuning and Transformer","date":"2024-04-19","arxiv_id":"2404.12734","repositories_listed":0,"syntology":null},{"url":null,"slug":"improvement-in-semantic-address-matching","title":"Improvement in Semantic Address Matching using Natural Language Processing","date":"2024-04-17","arxiv_id":"2404.11691","repositories_listed":0,"syntology":null},{"url":null,"slug":"mathwriting-a-dataset-for-handwritten","title":"MathWriting: A Dataset For Handwritten Mathematical Expression Recognition","date":"2024-04-16","arxiv_id":"2404.10690","repositories_listed":0,"syntology":null},{"url":null,"slug":"tc-ocr-tablecraft-ocr-for-efficient-detection","title":"TC-OCR: TableCraft OCR for Efficient Detection & Recognition of Table Structure & Content","date":"2024-04-16","arxiv_id":"2404.10305","repositories_listed":0,"syntology":null},{"url":null,"slug":"resilience-of-large-language-models-for-noisy","title":"Resilience of Large Language Models for Noisy Instructions","date":"2024-04-15","arxiv_id":"2404.09754","repositories_listed":0,"syntology":null},{"url":null,"slug":"text2taste-a-versatile-egocentric-vision","title":"TEXT2TASTE: A Versatile Egocentric Vision System for Intelligent Reading Assistance Using Large Language Model","date":"2024-04-14","arxiv_id":"2404.09254","repositories_listed":0,"syntology":null},{"url":null,"slug":"making-old-kurdish-publications-processable","title":"Making Old Kurdish Publications Processable by Augmenting Available Optical Character Recognition Engines","date":"2024-04-09","arxiv_id":"2404.06101","repositories_listed":0,"syntology":null},{"url":null,"slug":"hammr-hierarchical-multimodal-react-agents","title":"HAMMR: HierArchical MultiModal React agents for generic VQA","date":"2024-04-08","arxiv_id":"2404.05465","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-and-development-of-a-framework-for","title":"Design and Development of a Framework For Stroke-Based Handwritten Gujarati Font Generation","date":"2024-04-04","arxiv_id":"2404.03277","repositories_listed":0,"syntology":null},{"url":null,"slug":"optical-text-recognition-in-nepali-and","title":"Optical Text Recognition in Nepali and Bengali: A Transformer-based Approach","date":"2024-04-03","arxiv_id":"2404.02375","repositories_listed":0,"syntology":null},{"url":null,"slug":"realkie-five-novel-datasets-for-enterprise","title":"RealKIE: Five Novel Datasets for Enterprise Key Information Extraction","date":"2024-03-29","arxiv_id":"2403.20101","repositories_listed":0,"syntology":null},{"url":null,"slug":"scicapenter-supporting-caption-composition","title":"SciCapenter: Supporting Caption Composition for Scientific Figures with Machine-Generated Captions and Ratings","date":"2024-03-26","arxiv_id":"2403.17784","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-solution-for-the-iccv-2023-1st-scientific","title":"The Solution for the ICCV 2023 1st Scientific Figure Captioning Challenge","date":"2024-03-26","arxiv_id":"2403.17342","repositories_listed":0,"syntology":null},{"url":null,"slug":"grammatical-vs-spelling-error-correction-an","title":"Grammatical vs Spelling Error Correction: An Investigation into the Responsiveness of Transformer-based Language Models using BART and MarianMT","date":"2024-03-25","arxiv_id":"2403.16655","repositories_listed":0,"syntology":null},{"url":null,"slug":"refining-text-to-image-generation-towards","title":"Refining Text-to-Image Generation: Towards Accurate Training-Free Glyph-Enhanced Image Generation","date":"2024-03-25","arxiv_id":"2403.16422","repositories_listed":0,"syntology":null},{"url":"/paper/chart-based-reasoning-transferring","slug":"chart-based-reasoning-transferring","title":"Chart-based Reasoning: Transferring Capabilities from LLMs to VLMs","date":"2024-03-19","arxiv_id":"2403.12596","repositories_listed":0,"syntology":null},{"url":null,"slug":"financial-table-extraction-in-image-documents","title":"Financial Table Extraction in Image Documents","date":"2024-03-18","arxiv_id":"2405.05260","repositories_listed":0,"syntology":null},{"url":null,"slug":"ocr-is-all-you-need-importing-multi-modality","title":"OCR is All you need: Importing Multi-Modality into Image-based Defect Detection System","date":"2024-03-18","arxiv_id":"2403.11536","repositories_listed":0,"syntology":null},{"url":null,"slug":"advanced-knowledge-extraction-of-physical","title":"Advanced Knowledge Extraction of Physical Design Drawings, Translation and conversion to CAD formats using Deep Learning","date":"2024-03-17","arxiv_id":"2403.11291","repositories_listed":0,"syntology":null},{"url":null,"slug":"textblockv2-towards-precise-detection-free","title":"TextBlockV2: Towards Precise-Detection-Free Scene Text Spotting with Pre-trained Language Model","date":"2024-03-15","arxiv_id":"2403.10047","repositories_listed":0,"syntology":null},{"url":null,"slug":"eyes-closed-safety-on-protecting-multimodal","title":"Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation","date":"2024-03-14","arxiv_id":"2403.09572","repositories_listed":0,"syntology":null},{"url":null,"slug":"rich-semantic-knowledge-enhanced-large","title":"Rich Semantic Knowledge Enhanced Large Language Models for Few-shot Chinese Spell Checking","date":"2024-03-13","arxiv_id":"2403.08492","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-vocabulary-scene-text-recognition-via","title":"Open-Vocabulary Scene Text Recognition via Pseudo-Image Labeling and Margin Loss","date":"2024-03-12","arxiv_id":"2403.07518","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-future-of-document-indexing-gpt-and-donut","title":"The future of document indexing: GPT and Donut revolutionize table of content processing","date":"2024-03-12","arxiv_id":"2403.07553","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-transformer-for-comics-text-cloze","title":"Multimodal Transformer for Comics Text-Cloze","date":"2024-03-06","arxiv_id":"2403.03719","repositories_listed":0,"syntology":null},{"url":null,"slug":"locr-location-guided-transformer-for-optical","title":"LOCR: Location-Guided Transformer for Optical Character Recognition","date":"2024-03-04","arxiv_id":"2403.02127","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-language-models-for-simultaneous-named","title":"Large Language Models for Simultaneous Named Entity Extraction and Spelling Correction","date":"2024-03-01","arxiv_id":"2403.00528","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-generative-model-evaluation-a-novel","title":"Advancing Generative Model Evaluation: A Novel Algorithm for Realistic Image Synthesis and Comparison in OCR System","date":"2024-02-27","arxiv_id":"2402.17204","repositories_listed":0,"syntology":null},{"url":null,"slug":"representing-online-handwriting-for","title":"Representing Online Handwriting for Recognition in Large Vision-Language Models","date":"2024-02-23","arxiv_id":"2402.15307","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-the-mud-datasets-and-benchmarks-for","title":"Beyond the Mud: Datasets and Benchmarks for Computer Vision in Off-Road Racing","date":"2024-02-12","arxiv_id":"2402.08025","repositories_listed":0,"syntology":null},{"url":null,"slug":"segmentation-free-connectionist-temporal","title":"Segmentation-free Connectionist Temporal Classification loss based OCR Model for Text Captcha Classification","date":"2024-02-08","arxiv_id":"2402.05417","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancement-of-bengali-ocr-by-specialized","title":"Enhancement of Bengali OCR by Specialized Models and Advanced Techniques for Diverse Document Types","date":"2024-02-07","arxiv_id":"2402.05158","repositories_listed":0,"syntology":null},{"url":null,"slug":"exttnet-a-deep-learning-algorithm-for","title":"ExTTNet: A Deep Learning Algorithm for Extracting Table Texts from Invoice Images","date":"2024-02-03","arxiv_id":"2402.02246","repositories_listed":0,"syntology":null},{"url":"/paper/enhancing-multimodal-large-language-models","slug":"enhancing-multimodal-large-language-models","title":"From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information","date":"2024-01-31","arxiv_id":"2401.17981","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-ocr-quality-in-19th-century","title":"Improving OCR Quality in 19th Century Historical Documents Using a Combined Machine Learning Based Approach","date":"2024-01-15","arxiv_id":"2401.07787","repositories_listed":0,"syntology":null},{"url":null,"slug":"bidirectional-trained-tree-structured-decoder","title":"Bidirectional Trained Tree-Structured Decoder for Handwritten Mathematical Expression Recognition","date":"2023-12-31","arxiv_id":"2401.00435","repositories_listed":0,"syntology":null},{"url":null,"slug":"chaurah-a-smart-raspberry-pi-based-parking","title":"Chaurah: A Smart Raspberry Pi based Parking System","date":"2023-12-28","arxiv_id":"2312.16894","repositories_listed":0,"syntology":null},{"url":null,"slug":"segmenting-messy-text-detecting-boundaries-in","title":"Segmenting Messy Text: Detecting Boundaries in Text Derived from Historical Newspaper Images","date":"2023-12-20","arxiv_id":"2312.12773","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancements-and-challenges-in-arabic-optical","title":"Advancements and Challenges in Arabic Optical Character Recognition: A Comprehensive Survey","date":"2023-12-19","arxiv_id":"2312.11812","repositories_listed":0,"syntology":null},{"url":null,"slug":"tdelta-a-light-weight-and-robust-table","title":"TDeLTA: A Light-weight and Robust Table Detection Method based on Learning Text Arrangement","date":"2023-12-18","arxiv_id":"2312.11043","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-extraction-from-unstructured-data","title":"Information Extraction from Unstructured data using Augmented-AI and Computer Vision","date":"2023-12-15","arxiv_id":"2312.09880","repositories_listed":0,"syntology":null},{"url":null,"slug":"polar-doc-one-stage-document-dewarping-with","title":"Polar-Doc: One-Stage Document Dewarping with Multi-Scope Constraints under Polar Representation","date":"2023-12-13","arxiv_id":"2312.07925","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-sentiment-analysis-perceived-vs","title":"Multimodal Sentiment Analysis: Perceived vs Induced Sentiments","date":"2023-12-12","arxiv_id":"2312.07627","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-vehicle-entrance-and-parking","title":"Enhancing Vehicle Entrance and Parking Management: Deep Learning Solutions for Efficiency and Security","date":"2023-12-05","arxiv_id":"2312.02699","repositories_listed":0,"syntology":null},{"url":null,"slug":"upocr-towards-unified-pixel-level-ocr","title":"UPOCR: Towards Unified Pixel-Level OCR Interface","date":"2023-12-05","arxiv_id":"2312.02694","repositories_listed":0,"syntology":null},{"url":"/paper/pipeline-enabling-zero-shot-classification","slug":"pipeline-enabling-zero-shot-classification","title":"Pipeline Enabling Zero-shot Classification for Bangla Handwritten Grapheme","date":"2023-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"vulnerability-analysis-of-transformer-based","title":"Vulnerability Analysis of Transformer-based Optical Character Recognition to Adversarial Attacks","date":"2023-11-28","arxiv_id":"2311.17128","repositories_listed":0,"syntology":null},{"url":null,"slug":"similar-document-template-matching-algorithm","title":"Similar Document Template Matching Algorithm","date":"2023-11-21","arxiv_id":"2311.12663","repositories_listed":0,"syntology":null},{"url":null,"slug":"docpedia-unleashing-the-power-of-large","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","date":"2023-11-20","arxiv_id":"2311.11810","repositories_listed":0,"syntology":null},{"url":null,"slug":"decdm-document-enhancement-using-cycle","title":"DECDM: Document Enhancement using Cycle-Consistent Diffusion Models","date":"2023-11-16","arxiv_id":"2311.09625","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-end-to-end-visual-document","title":"Efficient End-to-End Visual Document Understanding with Rationale Distillation","date":"2023-11-16","arxiv_id":"2311.09612","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiple-question-multiple-answer-text-vqa","title":"Multiple-Question Multiple-Answer Text-VQA","date":"2023-11-15","arxiv_id":"2311.08622","repositories_listed":0,"syntology":null}],"record_sha256":"c3d54f6bf4717b64cb634364944ac882dd19e430a22eea58d02bbcd7393ce907","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}