{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/optical-character-recognition/papers/6","list_of":"/task/optical-character-recognition","task":"Optical Character Recognition (OCR)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":6,"pages_in_order":13,"rows_per_page":100,"rows":[501,600],"of":1243,"counts":{"archive_papers_tagged":1243,"with_a_code_link":462,"where_syntology_ran_a_sample":76,"not_listed_spam_title":0,"listed":1243,"listed_where_code_ran":76,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":64,"every_run_a_failure_of_syntologys_instrument":12,"listed_with_a_run_with_no_instrument_failure":64,"listed_every_run_a_failure_of_syntologys_instrument":12,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/optical-character-recognition","prev":"/task/optical-character-recognition/papers/5","next":"/task/optical-character-recognition/papers/7","papers":[{"url":null,"slug":"analyzing-patterns-and-influence-of","title":"Analyzing Patterns and Influence of Advertising in Print Newspapers","date":"2025-05-16","arxiv_id":"2505.10791","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-centric-representations-improve-policy","title":"Object-Centric Representations Improve Policy Generalization in Robot Manipulation","date":"2025-05-16","arxiv_id":"2505.11563","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-document-processing-pipeline-for-the","title":"A document processing pipeline for the construction of a dataset for topic modeling based on the judgments of the Italian Supreme Court","date":"2025-05-13","arxiv_id":"2505.08439","repositories_listed":0,"syntology":null},{"url":null,"slug":"gameplay-highlights-generation","title":"Gameplay Highlights Generation","date":"2025-05-12","arxiv_id":"2505.07721","repositories_listed":0,"syntology":null},{"url":null,"slug":"development-of-a-wazobia-named-entity","title":"Development of a WAZOBIA-Named Entity Recognition System","date":"2025-05-10","arxiv_id":"2505.07884","repositories_listed":0,"syntology":null},{"url":null,"slug":"chemrxivquest-a-curated-chemistry-question","title":"ChemRxivQuest: A Curated Chemistry Question-Answer Database Extracted from ChemRxiv Preprints","date":"2025-05-08","arxiv_id":"2505.05232","repositories_listed":0,"syntology":null},{"url":null,"slug":"glyphmastero-a-glyph-encoder-for-high","title":"GlyphMastero: A Glyph Encoder for High-Fidelity Scene Text Editing","date":"2025-05-08","arxiv_id":"2505.04915","repositories_listed":0,"syntology":null},{"url":null,"slug":"lost-in-ocr-translation-vision-based","title":"Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval","date":"2025-05-08","arxiv_id":"2505.05666","repositories_listed":0,"syntology":null},{"url":null,"slug":"dota-deformable-optimized-transformer","title":"DOTA: Deformable Optimized Transformer Architecture for End-to-End Text Recognition with Retrieval-Augmented Generation","date":"2025-05-07","arxiv_id":"2505.04175","repositories_listed":0,"syntology":null},{"url":null,"slug":"symbioticrag-enhancing-document-intelligence","title":"SymbioticRAG: Enhancing Document Intelligence Through Human-LLM Symbiotic Collaboration","date":"2025-05-05","arxiv_id":"2505.02418","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-parsing-of-engineering-drawings-for","title":"Automated Parsing of Engineering Drawings for Structured Information Extraction Using a Fine-tuned Document Understanding Transformer","date":"2025-05-02","arxiv_id":"2505.01530","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropy-heat-mapping-localizing-gpt-based-ocr","title":"Entropy Heat-Mapping: Localizing GPT-Based OCR Errors with Sliding-Window Shannon Analysis","date":"2025-04-30","arxiv_id":"2505.00746","repositories_listed":0,"syntology":null},{"url":null,"slug":"guidelines-for-external-disturbance-factors","title":"Guidelines for External Disturbance Factors in the Use of OCR in Real-World Environments","date":"2025-04-21","arxiv_id":"2504.14913","repositories_listed":0,"syntology":null},{"url":null,"slug":"tiger200k-manually-curated-high-visual","title":"Tiger200K: Manually Curated High Visual Quality Video Dataset from UGC Platform","date":"2025-04-21","arxiv_id":"2504.15182","repositories_listed":0,"syntology":null},{"url":null,"slug":"consensus-entropy-harnessing-multi-vlm","title":"Consensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCR","date":"2025-04-15","arxiv_id":"2504.11101","repositories_listed":0,"syntology":null},{"url":null,"slug":"notes-bank-benchmarking-neural-transcription","title":"NoTeS-Bank: Benchmarking Neural Transcription and Search for Scientific Notes Understanding","date":"2025-04-12","arxiv_id":"2504.09249","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-calibration-enhanced-network-by","title":"Towards Calibration Enhanced Network by Inverse Adversarial Attack","date":"2025-04-08","arxiv_id":"2504.06358","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-visual-text-grounding-of-multimodal","title":"Towards Visual Text Grounding of Multimodal Large Language Model","date":"2025-04-07","arxiv_id":"2504.04974","repositories_listed":0,"syntology":null},{"url":null,"slug":"vista-ocr-towards-generative-and-interactive","title":"VISTA-OCR: Towards generative and interactive end to end OCR models","date":"2025-04-04","arxiv_id":"2504.03621","repositories_listed":0,"syntology":null},{"url":null,"slug":"qid-efficient-query-informed-vits-in-data","title":"QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding","date":"2025-04-03","arxiv_id":"2504.02971","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-independent-ocr-with-multimodal-llms","title":"Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity","date":"2025-03-31","arxiv_id":"2503.23667","repositories_listed":0,"syntology":null},{"url":null,"slug":"tfic-end-to-end-text-focused-image","title":"TFIC: End-to-End Text-Focused Image Compression for Coding for Machines","date":"2025-03-25","arxiv_id":"2503.19495","repositories_listed":0,"syntology":null},{"url":null,"slug":"slide2text-leveraging-llms-for-personalized","title":"Slide2Text: Leveraging LLMs for Personalized Textbook Generation from PowerPoint Presentations","date":"2025-03-22","arxiv_id":"2503.17710","repositories_listed":0,"syntology":null},{"url":"/paper/lvagent-long-video-understanding-by-multi","slug":"lvagent-long-video-understanding-by-multi","title":"LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents","date":"2025-03-13","arxiv_id":"2503.10200","repositories_listed":0,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/lvagent-long-video-understanding-by-multi#ran","syntology_url":"https://syntology.ai/paper/2503.10200","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2503.10200"}},"official":null}},{"url":null,"slug":"revisiting-noise-in-natural-language","title":"Revisiting Noise in Natural Language Processing for Computational Social Science","date":"2025-03-10","arxiv_id":"2503.07395","repositories_listed":0,"syntology":null},{"url":null,"slug":"callireader-contextualizing-chinese","title":"CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model","date":"2025-03-09","arxiv_id":"2503.06472","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-driven-multi-stage-computer-vision-system","title":"AI-Driven Multi-Stage Computer Vision System for Defect Detection in Laser-Engraved Industrial Nameplates","date":"2025-03-05","arxiv_id":"2503.03395","repositories_listed":0,"syntology":null},{"url":null,"slug":"nusaaksara-a-multimodal-and-multilingual","title":"NusaAksara: A Multimodal and Multilingual Benchmark for Preserving Indonesian Indigenous Scripts","date":"2025-02-25","arxiv_id":"2502.18148","repositories_listed":0,"syntology":null},{"url":null,"slug":"shakti-vlms-scalable-vision-language-models","title":"Shakti-VLMs: Scalable Vision-Language Models for Enterprise AI","date":"2025-02-24","arxiv_id":"2502.17092","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-zero-shot-e-commerce-product-attribute","title":"Visual Zero-Shot E-Commerce Product Attribute Value Extraction","date":"2025-02-21","arxiv_id":"2502.15979","repositories_listed":0,"syntology":null},{"url":null,"slug":"harnessing-pdf-data-for-improving-japanese","title":"Harnessing PDF Data for Improving Japanese Large Multimodal Models","date":"2025-02-20","arxiv_id":"2502.14778","repositories_listed":0,"syntology":null},{"url":null,"slug":"kitab-bench-a-comprehensive-multi-domain","title":"KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understanding","date":"2025-02-20","arxiv_id":"2502.14949","repositories_listed":0,"syntology":null},{"url":null,"slug":"corrupted-but-not-broken-understanding-and","title":"Corrupted but Not Broken: Understanding and Mitigating the Negative Impacts of Corrupted Data in Visual Instruction Tuning","date":"2025-02-18","arxiv_id":"2502.12635","repositories_listed":0,"syntology":null},{"url":null,"slug":"southern-newswire-corpus-a-large-scale","title":"Southern Newswire Corpus: A Large-Scale Dataset of Mid-Century Wire Articles Beyond the Front Page","date":"2025-02-17","arxiv_id":"2502.11866","repositories_listed":0,"syntology":null},{"url":null,"slug":"mme-cot-benchmarking-chain-of-thought-in","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","date":"2025-02-13","arxiv_id":"2502.09621","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-graph-question-answering-with-asp-and","title":"Visual Graph Question Answering with ASP and LLMs for Language Parsing","date":"2025-02-13","arxiv_id":"2502.09211","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-multilingual-embedding-models-to","title":"Adapting Multilingual Embedding Models to Historical Luxembourgish","date":"2025-02-11","arxiv_id":"2502.07938","repositories_listed":0,"syntology":null},{"url":null,"slug":"eclair-extracting-content-and-layout-with","title":"Éclair -- Extracting Content and Layout with Integrated Reading Order for Documents","date":"2025-02-06","arxiv_id":"2502.04223","repositories_listed":0,"syntology":null},{"url":null,"slug":"mme-industry-a-cross-industry-multimodal","title":"MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark","date":"2025-01-28","arxiv_id":"2501.16688","repositories_listed":0,"syntology":null},{"url":null,"slug":"locoml-a-framework-for-real-world-ml","title":"LoCoML: A Framework for Real-World ML Inference Pipelines","date":"2025-01-24","arxiv_id":"2501.14165","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-ai-based-system-design-for-pixel","title":"Exploring AI-based System Design for Pixel-level Protected Health Information Detection in Medical Images","date":"2025-01-16","arxiv_id":"2501.09552","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmdocir-benchmarking-multi-modal-retrieval","title":"MMDocIR: Benchmarking Multi-Modal Retrieval for Long Documents","date":"2025-01-15","arxiv_id":"2501.08828","repositories_listed":0,"syntology":null},{"url":null,"slug":"boundingdocs-a-unified-dataset-for-document","title":"BoundingDocs: a Unified Dataset for Document Question Answering with Spatial Annotations","date":"2025-01-06","arxiv_id":"2501.03403","repositories_listed":0,"syntology":null},{"url":null,"slug":"scenevtg-controllable-multilingual-visual","title":"SceneVTG++: Controllable Multilingual Visual Text Generation in the Wild","date":"2025-01-06","arxiv_id":"2501.02962","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-fault-tolerance-strategy-for-abrupt","title":"Emergency-Brake Simplex: Toward A Verifiably Safe Control-CPS Architecture for Abrupt Runtime Reachability Constraint Changes","date":"2025-01-03","arxiv_id":"2501.01831","repositories_listed":0,"syntology":null},{"url":null,"slug":"embedding-similarity-guided-license-plate","title":"Embedding Similarity Guided License Plate Super Resolution","date":"2025-01-02","arxiv_id":"2501.01483","repositories_listed":0,"syntology":null},{"url":null,"slug":"clip-is-almost-all-you-need-towards-parameter","title":"CLIP is Almost All You Need: Towards Parameter-Efficient Scene Text Retrieval without OCR","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-natural-language-based-document-image","title":"Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optical-character-recognition-using","title":"Optical Character Recognition using Convolutional Neural Networks for Ashokan Brahmi Inscriptions","date":"2024-12-29","arxiv_id":"2501.01981","repositories_listed":0,"syntology":null},{"url":null,"slug":"erpa-efficient-rpa-model-integrating-ocr-and","title":"ERPA: Efficient RPA Model Integrating OCR and LLMs for Intelligent Document Processing","date":"2024-12-24","arxiv_id":"2412.19840","repositories_listed":0,"syntology":null},{"url":null,"slug":"haur-human-annotation-understanding-and","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","date":"2024-12-24","arxiv_id":"2412.18327","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-deep-learning-with-multi-head","title":"Leveraging Deep Learning with Multi-Head Attention for Accurate Extraction of Medicine from Handwritten Prescriptions","date":"2024-12-24","arxiv_id":"2412.18199","repositories_listed":0,"syntology":null},{"url":null,"slug":"vortex-a-spatial-computing-framework-for","title":"VORTEX: A Spatial Computing Framework for Optimized Drone Telemetry Extraction from First-Person View Flight Data","date":"2024-12-24","arxiv_id":"2412.18505","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-tampered-text-detection-via","title":"TextSleuth: Towards Explainable Tampered Text Detection","date":"2024-12-19","arxiv_id":"2412.14816","repositories_listed":0,"syntology":null},{"url":"/paper/dopta-improving-document-layout-analysis","slug":"dopta-improving-document-layout-analysis","title":"DoPTA: Improving Document Layout Analysis using Patch-Text Alignment","date":"2024-12-17","arxiv_id":"2412.12902","repositories_listed":0,"syntology":null},{"url":null,"slug":"advanced-ingestion-process-powered-by-llm","title":"Advanced ingestion process powered by LLM parsing for RAG system","date":"2024-12-16","arxiv_id":"2412.15262","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-vehicle-plate-recognition","title":"Advancing Vehicle Plate Recognition: Multitasking Visual Language Models with VehiclePaliGemma","date":"2024-12-14","arxiv_id":"2412.14197","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancement-of-text-recognition-for-hanja","title":"Enhancement of text recognition for hanja handwritten documents of Ancient Korea","date":"2024-12-14","arxiv_id":"2412.10647","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-filter-to-deploy-them-all-robust-safety","title":"One Filter to Deploy Them All: Robust Safety for Quadrupedal Navigation in Unknown Environments","date":"2024-12-13","arxiv_id":"2412.09989","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-adoption-to-combat-financial-crime-study","title":"AI Adoption to Combat Financial Crime: Study on Natural Language Processing in Adverse Media Screening of Financial Services in English and Bangla multilingual interpretation","date":"2024-12-12","arxiv_id":"2412.12171","repositories_listed":0,"syntology":null},{"url":null,"slug":"docsum-domain-adaptive-pre-training-for","title":"DocSum: Domain-Adaptive Pre-training for Document Abstractive Summarization","date":"2024-12-11","arxiv_id":"2412.08196","repositories_listed":0,"syntology":null},{"url":null,"slug":"docvlm-make-your-vlm-an-efficient-reader","title":"DocVLM: Make Your VLM an Efficient Reader","date":"2024-12-11","arxiv_id":"2412.08746","repositories_listed":0,"syntology":null},{"url":null,"slug":"points1-5-building-a-vision-language-model","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","date":"2024-12-11","arxiv_id":"2412.08443","repositories_listed":0,"syntology":null},{"url":null,"slug":"verb-mirage-unveiling-and-assessing-verb","title":"Verb Mirage: Unveiling and Assessing Verb Concept Hallucinations in Multimodal Large Language Models","date":"2024-12-06","arxiv_id":"2412.04939","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-change-detection-in-multilingual","title":"Text Change Detection in Multilingual Documents Using Image Comparison","date":"2024-12-05","arxiv_id":"2412.04137","repositories_listed":0,"syntology":null},{"url":null,"slug":"cc-ocr-a-comprehensive-and-challenging-ocr","title":"CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy","date":"2024-12-03","arxiv_id":"2412.02210","repositories_listed":0,"syntology":null},{"url":null,"slug":"patchfinder-leveraging-visual-language-models","title":"Patchfinder: Leveraging Visual Language Models for Accurate Information Retrieval using Model Uncertainty","date":"2024-12-03","arxiv_id":"2412.02886","repositories_listed":0,"syntology":null},{"url":null,"slug":"arabic-handwritten-document-ocr-solution-with","title":"Arabic Handwritten Document OCR Solution with Binarization and Adaptive Scale Fusion Detection","date":"2024-12-02","arxiv_id":"2412.01601","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-assisted-summary-of-suicide-risk","title":"AI-assisted summary of suicide risk Formulation","date":"2024-11-29","arxiv_id":"2412.10388","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-logit-lens-contextual-embeddings-for","title":"Beyond Logit Lens: Contextual Embeddings for Robust Hallucination Detection & Grounding in VLMs","date":"2024-11-28","arxiv_id":"2411.19187","repositories_listed":0,"syntology":null},{"url":null,"slug":"varco-vision-expanding-frontiers-in-korean","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","date":"2024-11-28","arxiv_id":"2411.19103","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-accessible-learning-deep-learning","title":"Towards Accessible Learning: Deep Learning-Based Potential Dysgraphia Detection and OCR for Potentially Dysgraphic Handwriting","date":"2024-11-18","arxiv_id":"2411.13595","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-cognition-consistent-with-perception","title":"Is Cognition consistent with Perception? Assessing and Mitigating Multimodal Knowledge Conflicts in Document Understanding","date":"2024-11-12","arxiv_id":"2411.07722","repositories_listed":0,"syntology":null},{"url":null,"slug":"veri-car-towards-open-world-vehicle","title":"Veri-Car: Towards Open-world Vehicle Information Retrieval","date":"2024-11-11","arxiv_id":"2411.06864","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-visual-feature-aggregation-for","title":"Hierarchical Visual Feature Aggregation for OCR-Free Document Understanding","date":"2024-11-08","arxiv_id":"2411.05254","repositories_listed":0,"syntology":null},{"url":null,"slug":"neko-toward-post-recognition-generative","title":"NeKo: Toward Post Recognition Generative Correction Large Language Models with Task-Oriented Experts","date":"2024-11-08","arxiv_id":"2411.05945","repositories_listed":0,"syntology":null},{"url":null,"slug":"m3docrag-multi-modal-retrieval-is-what-you","title":"M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding","date":"2024-11-07","arxiv_id":"2411.04952","repositories_listed":0,"syntology":null},{"url":null,"slug":"tap-vl-text-layout-aware-pre-training-for","title":"TAP-VL: Text Layout-Aware Pre-training for Enriched Vision-Language Models","date":"2024-11-07","arxiv_id":"2411.04642","repositories_listed":0,"syntology":null},{"url":null,"slug":"out-of-distribution-recovery-with-object","title":"Out-of-Distribution Recovery with Object-Centric Keypoint Inverse Policy for Visuomotor Imitation Learning","date":"2024-11-05","arxiv_id":"2411.03294","repositories_listed":0,"syntology":null},{"url":null,"slug":"hip-hierarchical-point-modeling-and-pre","title":"HIP: Hierarchical Point Modeling and Pre-training for Visual Information Extraction","date":"2024-11-02","arxiv_id":"2411.01139","repositories_listed":0,"syntology":null},{"url":null,"slug":"handwriting-recognition-in-historical","title":"Handwriting Recognition in Historical Documents with Multimodal LLM","date":"2024-10-31","arxiv_id":"2410.24034","repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-analysis-and-comparison-of","title":"Structured Analysis and Comparison of Alphabets in Historical Handwritten Ciphers","date":"2024-10-29","arxiv_id":"2410.21913","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmdocbench-benchmarking-large-vision-language","title":"MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding","date":"2024-10-25","arxiv_id":"2410.21311","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-visual-text-design-transfer-across","title":"Towards Visual Text Design Transfer Across Languages","date":"2024-10-24","arxiv_id":"2410.18823","repositories_listed":0,"syntology":null},{"url":null,"slug":"harnessing-webpage-uis-for-text-rich-visual","title":"Harnessing Webpage UIs for Text-Rich Visual Understanding","date":"2024-10-17","arxiv_id":"2410.13824","repositories_listed":0,"syntology":null},{"url":null,"slug":"reference-based-post-ocr-processing-with-llm","title":"Reference-Based Post-OCR Processing with LLM for Diacritic Languages","date":"2024-10-17","arxiv_id":"2410.13305","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparison-of-image-preprocessing-techniques","title":"Comparison of Image Preprocessing Techniques for Vehicle License Plate Recognition Using OCR: Performance and Accuracy Evaluation","date":"2024-10-15","arxiv_id":"2410.13622","repositories_listed":0,"syntology":null},{"url":null,"slug":"relayout-towards-real-world-document","title":"ReLayout: Towards Real-World Document Understanding via Layout-enhanced Pre-training","date":"2024-10-14","arxiv_id":"2410.10471","repositories_listed":0,"syntology":null},{"url":null,"slug":"chartkg-a-knowledge-graph-based","title":"ChartKG: A Knowledge-Graph-Based Representation for Chart Images","date":"2024-10-13","arxiv_id":"2410.09761","repositories_listed":0,"syntology":null},{"url":null,"slug":"mirage-multimodal-identification-and","title":"MIRAGE: Multimodal Identification and Recognition of Annotations in Indian General Prescriptions","date":"2024-10-13","arxiv_id":"2410.09729","repositories_listed":0,"syntology":null},{"url":null,"slug":"textmaster-universal-controllable-text-edit","title":"TextMaster: Universal Controllable Text Edit","date":"2024-10-13","arxiv_id":"2410.09879","repositories_listed":0,"syntology":null},{"url":null,"slug":"unraveling-movie-genres-through-cross","title":"Unraveling Movie Genres through Cross-Attention Fusion of Bi-Modal Synergy of Poster","date":"2024-10-12","arxiv_id":"2410.19764","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-quality-control-system-for-canned","title":"Automated Quality Control System for Canned Tuna Production using Artificial Vision","date":"2024-10-08","arxiv_id":"2410.17275","repositories_listed":0,"syntology":null},{"url":null,"slug":"mero-nagarikta-advanced-nepali-citizenship","title":"Mero Nagarikta: Advanced Nepali Citizenship Data Extractor with Deep Learning-Powered Text Detection and OCR","date":"2024-10-08","arxiv_id":"2410.05721","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformers-utilization-in-chart","title":"Transformers Utilization in Chart Understanding: A Review of Recent Advances & Future Trends","date":"2024-10-05","arxiv_id":"2410.13883","repositories_listed":0,"syntology":null},{"url":null,"slug":"khattat-enhancing-readability-and-concept","title":"Khattat: Enhancing Readability and Concept Representation of Semantic Typography","date":"2024-10-01","arxiv_id":"2410.03748","repositories_listed":0,"syntology":null},{"url":null,"slug":"japoc-japanese-post-ocr-correction-benchmark","title":"JaPOC: Japanese Post-OCR Correction Benchmark using Vouchers","date":"2024-09-30","arxiv_id":"2409.19948","repositories_listed":0,"syntology":null},{"url":"/paper/mm1-5-methods-analysis-insights-from","slug":"mm1-5-methods-analysis-insights-from","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","date":"2024-09-30","arxiv_id":"2409.20566","repositories_listed":0,"syntology":null},{"url":null,"slug":"see-then-tell-enhancing-key-information","title":"See then Tell: Enhancing Key Information Extraction with Vision Grounding","date":"2024-09-29","arxiv_id":"2409.19573","repositories_listed":0,"syntology":null},{"url":null,"slug":"codescan-screencast-analysis-for-video","title":"CodeSCAN: ScreenCast ANalysis for Video Programming Tutorials","date":"2024-09-27","arxiv_id":"2409.18556","repositories_listed":0,"syntology":null}],"record_sha256":"71471f2c7eef09383880debcb3c7dc48ad5eef89a8eff8ceb6625bfcfec4a4b3","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}