{"url":"/task/document-image-classification","name":"Document Image Classification","slug":"document-image-classification","description_markdown":"Document image classification is the task of classifying documents based on images of their contents.\r\n\r\n<span style=\"color:grey; opacity: 0.6\">( Image credit: [Real-Time Document Image Classification using Deep CNN and Extreme Learning Machines](https://arxiv.org/pdf/1711.05862v1.pdf) )</span>","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":50,"papers_with_code":25,"benchmarks":8,"benchmark_tables_in_archive":8,"benchmark_tables_shown":8,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":4,"subtasks":0,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/document-image-classification-on-rvl-cdip","slug":"document-image-classification-on-rvl-cdip","dataset":"RVL-CDIP","dataset_url":"/dataset/rvl-cdip","rows_in_archive":31,"metrics":["Accuracy","Parameters"],"first_row_in_archive_order":{"model":"EAML","paper_title":"EAML: Ensemble Self-Attention-based Mutual Learning Network for Document Image Classification","paper_url":"/paper/eaml-ensemble-self-attention-based-mutual","paper_date":"2023-05-11","arxiv_id":"2305.06923","code_links":[],"syntology":null}},{"leaderboard":"/sota/document-image-classification-on-tobacco-3482","slug":"document-image-classification-on-tobacco-3482","dataset":"Tobacco-3482","dataset_url":"/dataset/tobacco-3482","rows_in_archive":10,"metrics":["Accuracy","Memory"],"first_row_in_archive_order":{"model":"DocXClassifier-L","paper_title":"DocXClassifier: High Performance Explainable Deep Network for Document Image Classification","paper_url":"/paper/docxclassifier-high-performance-explainable","paper_date":"2022-03-17","arxiv_id":null,"code_links":[{"title":"saifullah3396/docxclassifier","url":"https://github.com/saifullah3396/docxclassifier"}],"syntology":null}},{"leaderboard":"/sota/document-image-classification-on-noisy-bangla","slug":"document-image-classification-on-noisy-bangla","dataset":"Noisy Bangla Numeral","dataset_url":null,"rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"PCGAN-CHAR","paper_title":"PCGAN-CHAR: Progressively Trained Classifier Generative Adversarial Networks for Classification of Noisy Handwritten Bangla Characters","paper_url":"/paper/pcgan-char-progressively-trained-classifier","paper_date":"2019-08-11","arxiv_id":"1908.08987","code_links":[],"syntology":null}},{"leaderboard":"/sota/document-image-classification-on-noisy-bangla-1","slug":"document-image-classification-on-noisy-bangla-1","dataset":"Noisy Bangla Characters","dataset_url":null,"rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"PCGAN-CHAR","paper_title":"PCGAN-CHAR: Progressively Trained Classifier Generative Adversarial Networks for Classification of Noisy Handwritten Bangla Characters","paper_url":"/paper/pcgan-char-progressively-trained-classifier","paper_date":"2019-08-11","arxiv_id":"1908.08987","code_links":[],"syntology":null}},{"leaderboard":"/sota/document-image-classification-on-aip","slug":"document-image-classification-on-aip","dataset":"AIP","dataset_url":null,"rows_in_archive":1,"metrics":["Top 1 Accuracy - Verb"],"first_row_in_archive_order":{"model":"ResNet-RS (ResNet-200 + RS training tricks)","paper_title":"Revisiting ResNets: Improved Training and Scaling Strategies","paper_url":"/paper/revisiting-resnets-improved-training-and","paper_date":"2021-03-13","arxiv_id":"2103.07579","code_links":[{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"tensorflow/tpu","url":"https://github.com/tensorflow/tpu/tree/master/models/official/resnet/resnet_rs"},{"title":"nachiket273/pytorch_resnet_rs","url":"https://github.com/nachiket273/pytorch_resnet_rs"}],"syntology":null}},{"leaderboard":"/sota/document-image-classification-on-noisy-mnist","slug":"document-image-classification-on-noisy-mnist","dataset":"n-MNIST","dataset_url":"/dataset/n-mnist","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Pixel-level RC","paper_title":"Pixel-level Reconstruction and Classification for Noisy Handwritten Bangla Characters","paper_url":"/paper/pixel-level-reconstruction-and-classification","paper_date":"2018-06-21","arxiv_id":"1806.08037","code_links":[],"syntology":null}},{"leaderboard":"/sota/document-image-classification-on-noisy-mnist-1","slug":"document-image-classification-on-noisy-mnist-1","dataset":"Noisy MNIST","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"PCGAN-CHAR","paper_title":"PCGAN-CHAR: Progressively Trained Classifier Generative Adversarial Networks for Classification of Noisy Handwritten Bangla Characters","paper_url":"/paper/pcgan-char-progressively-trained-classifier","paper_date":"2019-08-11","arxiv_id":"1908.08987","code_links":[],"syntology":null}},{"leaderboard":"/sota/document-image-classification-on-sut","slug":"document-image-classification-on-sut","dataset":"SUT","dataset_url":"/dataset/sut","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"CNN","paper_title":"SUT: a new multi-purpose synthetic dataset for Farsi document image analysis","paper_url":"/paper/sut-a-new-multi-purpose-synthetic-dataset-for","paper_date":"2023-11-27","arxiv_id":null,"code_links":[{"title":"aliiafkari/SUT_Dataset","url":"https://github.com/aliiafkari/SUT_Dataset"}],"syntology":null}}],"datasets":[{"url":"/dataset/rvl-cdip","name":"RVL-CDIP","full_name":"RVL-CDIP","num_papers_in_archive":107},{"url":"/dataset/tobacco-3482","name":"Tobacco-3482","full_name":"","num_papers_in_archive":5},{"url":"/dataset/s-ved","name":"S-VED","full_name":"Sacrobosco Visual Element Dataset","num_papers_in_archive":3},{"url":"/dataset/sut","name":"SUT","full_name":"SUT: a new multi-purpose synthetic dataset for Farsi document image analysis","num_papers_in_archive":1}],"subtasks":[],"parent_tasks":[{"url":"/task/image-classification","name":"Image Classification"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":25,"tagged_in_all":50,"items":[{"url":"/paper/roberta-a-robustly-optimized-bert-pretraining","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","date":"2019-07-26","arxiv_id":"1907.11692","repositories_listed":67,"syntology":{"n":48,"n_ran":22,"n_unverified":26,"n_pointer_only":23}},{"url":"/paper/training-data-efficient-image-transformers","title":"Training data-efficient image transformers & distillation through attention","date":"2020-12-23","arxiv_id":"2012.12877","repositories_listed":40,"syntology":{"n":19,"n_ran":12,"n_unverified":7,"n_pointer_only":3}},{"url":"/paper/layoutlm-pre-training-of-text-and-layout-for","title":"LayoutLM: Pre-training of Text and Layout for Document Image Understanding","date":"2019-12-31","arxiv_id":"1912.13318","repositories_listed":19,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/layoutlm-pre-training-of-text-and-layout-for","title":"LayoutLM: Pre-training of Text and Layout for Document Image Understanding","date":"2019-12-31","arxiv_id":"1912.13318","repositories_listed":19,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/beit-bert-pre-training-of-image-transformers","title":"BEiT: BERT Pre-Training of Image Transformers","date":"2021-06-15","arxiv_id":"2106.08254","repositories_listed":14,"syntology":{"n":11,"n_ran":6,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/layoutlmv2-multi-modal-pre-training-for","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","date":"2020-12-29","arxiv_id":"2012.14740","repositories_listed":9,"syntology":null},{"url":"/paper/layoutxlm-multimodal-pre-training-for","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","date":"2021-04-18","arxiv_id":"2104.08836","repositories_listed":6,"syntology":null},{"url":"/paper/lilt-a-simple-yet-effective-language","title":"LiLT: A Simple yet Effective Language-Independent Layout Transformer for Structured Document Understanding","date":"2022-02-28","arxiv_id":"2202.13669","repositories_listed":5,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/donut-document-understanding-transformer","title":"OCR-free Document Understanding Transformer","date":"2021-11-30","arxiv_id":"2111.15664","repositories_listed":5,"syntology":{"n":9,"n_ran":0,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/cutting-the-error-by-half-investigation-of","title":"Cutting the Error by Half: Investigation of Very Deep CNN and Advanced Training Strategies for Document Image Classification","date":"2017-04-11","arxiv_id":"1704.03557","repositories_listed":5,"syntology":null},{"url":"/paper/cutting-the-error-by-half-investigation-of","title":"Cutting the Error by Half: Investigation of Very Deep CNN and Advanced Training Strategies for Document Image Classification","date":"2017-04-11","arxiv_id":"1704.03557","repositories_listed":5,"syntology":null},{"url":"/paper/layoutlmv3-pre-training-for-document-ai-with","title":"LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking","date":"2022-04-18","arxiv_id":"2204.08387","repositories_listed":4,"syntology":null},{"url":"/paper/layoutlmv3-pre-training-for-document-ai-with","title":"LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking","date":"2022-04-18","arxiv_id":"2204.08387","repositories_listed":4,"syntology":null},{"url":"/paper/dit-self-supervised-pre-training-for-document","title":"DiT: Self-supervised Pre-training for Document Image Transformer","date":"2022-03-04","arxiv_id":"2203.02378","repositories_listed":4,"syntology":{"n":11,"n_ran":0,"n_unverified":11,"n_pointer_only":0}},{"url":"/paper/dit-self-supervised-pre-training-for-document","title":"DiT: Self-supervised Pre-training for Document Image Transformer","date":"2022-03-04","arxiv_id":"2203.02378","repositories_listed":4,"syntology":{"n":11,"n_ran":0,"n_unverified":11,"n_pointer_only":0}},{"url":"/paper/document-image-classification-with-intra","title":"Document Image Classification with Intra-Domain Transfer Learning and Stacked Generalization of Deep Convolutional Neural Networks","date":"2018-01-29","arxiv_id":"1801.09321","repositories_listed":4,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/document-image-classification-with-intra","title":"Document Image Classification with Intra-Domain Transfer Learning and Stacked Generalization of Deep Convolutional Neural Networks","date":"2018-01-29","arxiv_id":"1801.09321","repositories_listed":4,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/revisiting-resnets-improved-training-and","title":"Revisiting ResNets: Improved Training and Scaling Strategies","date":"2021-03-13","arxiv_id":"2103.07579","repositories_listed":3,"syntology":null},{"url":"/paper/automatic-recognition-of-learning-resource","title":"Automatic Recognition of Learning Resource Category in a Digital Library","date":"2023-11-28","arxiv_id":"2401.12220","repositories_listed":2,"syntology":null},{"url":"/paper/automatic-recognition-of-learning-resource","title":"Automatic Recognition of Learning Resource Category in a Digital Library","date":"2023-11-28","arxiv_id":"2401.12220","repositories_listed":2,"syntology":null},{"url":"/paper/ernie-layout-layout-knowledge-enhanced-pre","title":"ERNIE-Layout: Layout Knowledge Enhanced Pre-training for Visually-rich Document Understanding","date":"2022-10-12","arxiv_id":"2210.06155","repositories_listed":2,"syntology":{"n":7,"n_ran":2,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/ernie-layout-layout-knowledge-enhanced-pre","title":"ERNIE-Layout: Layout Knowledge Enhanced Pre-training for Visually-rich Document Understanding","date":"2022-10-12","arxiv_id":"2210.06155","repositories_listed":2,"syntology":{"n":7,"n_ran":2,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/multimodal-adaptive-inference-for-document","title":"Multimodal Adaptive Inference for Document Image Classification with Anytime Early Exiting","date":"2024-05-21","arxiv_id":"2405.12705","repositories_listed":1,"syntology":null},{"url":"/paper/multimodal-adaptive-inference-for-document","title":"Multimodal Adaptive Inference for Document Image Classification with Anytime Early Exiting","date":"2024-05-21","arxiv_id":"2405.12705","repositories_listed":1,"syntology":null},{"url":"/paper/sut-a-new-multi-purpose-synthetic-dataset-for","title":"SUT: a new multi-purpose synthetic dataset for Farsi document image analysis","date":"2023-11-27","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/sut-a-new-multi-purpose-synthetic-dataset-for","title":"SUT: a new multi-purpose synthetic dataset for Farsi document image analysis","date":"2023-11-27","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/structextv2-masked-visual-textual-prediction","title":"StrucTexTv2: Masked Visual-Textual Prediction for Document Image Pre-training","date":"2023-03-01","arxiv_id":"2303.00289","repositories_listed":1,"syntology":null},{"url":"/paper/multimodal-side-tuning-for-document","title":"Multimodal Side-Tuning for Document Classification","date":"2023-01-16","arxiv_id":"2301.07502","repositories_listed":1,"syntology":null},{"url":"/paper/docxclassifier-high-performance-explainable","title":"DocXClassifier: High Performance Explainable Deep Network for Document Image Classification","date":"2022-03-17","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/docxclassifier-high-performance-explainable","title":"DocXClassifier: High Performance Explainable Deep Network for Document Image Classification","date":"2022-03-17","arxiv_id":null,"repositories_listed":1,"syntology":null}],"syntology_records":13,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}