{"url":"/dataset/high-quality-invoice-images-for-ocr","name":"High-Quality Invoice Images for OCR","full_name":null,"description_markdown":"dataset link : https://www.kaggle.com/datasets/osamahosamabdellatif/high-quality-invoice-images-for-ocr\r\n\r\nOverview\r\nHigh-Quality Invoice Images for OCR is a curated dataset containing professionally scanned and digitally captured invoice documents.\r\nIt is designed for training, fine-tuning, and evaluating OCR models, machine learning pipelines, and data extraction systems.\r\n\r\nThis dataset focuses on clean, structured invoices to simulate real-world scenarios in financial document automation.\r\n\r\nWhat's Inside\r\n📄 Variety of invoice templates from multiple industries (e.g., retail, manufacturing, services)\r\n\r\n🖋️ Different currencies, tax formats, and layouts\r\n\r\n📸 High-resolution scanned and photographed invoices\r\n\r\n🏷️ Optional field annotations (e.g., invoice number, date, total amount, vendor name) for supervised training\r\n\r\nKey Applications\r\nTraining and fine-tuning OCR and Document AI models\r\n\r\nMachine learning for structured and semi-structured data extraction\r\n\r\nIntelligent Document Processing (IDP) and Robotic Process Automation (RPA)\r\n\r\nBenchmarking table detection, key-value extraction, and layout analysis models\r\n\r\nWhy Use This Dataset?\r\n✅ High-quality images optimized for OCR and data extraction tasks\r\n\r\n✅ Real-world invoice variations to improve model robustness\r\n\r\n✅ Ideal for machine learning workflows in finance, ERP, and accounting systems\r\n\r\n✅ Supports rapid prototyping for invoice understanding models\r\n\r\nIdeal For\r\nResearchers working on OCR and document understanding\r\n\r\nDevelopers building invoice processing systems\r\n\r\nMachine learning engineers fine-tuning models for data extraction\r\n\r\nStartups and enterprises automating financial workflows","description_withheld":null,"homepage":"https://www.kaggle.com/datasets/osamahosamabdellatif/high-quality-invoice-images-for-ocr","introduced_date":"2021-03-10","introduced_date_note":null,"introduced_by":{"paper":"/paper/deepcpcfg-deep-learning-and-context-free","title":"DeepCPCFG: Deep Learning and Context Free Grammars for End-to-End Information Extraction","first_author":"Freddy C. Chua","url":null},"license":null,"modalities":[],"tasks":[{"name":"Optical Character Recognition (OCR)","url":"/task/optical-character-recognition","datasets_with_task":"/datasets/task/optical-character-recognition"},{"name":"LLM real-life tasks","url":"/task/llm-real-life-tasks","datasets_with_task":"/datasets/task/llm-real-life-tasks"},{"name":"Hybrid Machine Learning","url":"/task/hybrid-machine-learning","datasets_with_task":"/datasets/task/hybrid-machine-learning"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["High-Quality Invoice Images for OCR"],"data_loaders":[],"num_papers_in_archive":3,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}