{"url":"/task/document-layout-analysis","name":"Document Layout Analysis","slug":"document-layout-analysis","description_markdown":"\"**Document Layout Analysis** is performed to determine physical structure of a document, that is, to determine document components. These document components can consist of single connected components-regions [...] of\r\npixels that are adjacent to form single regions [...] , or group\r\nof text lines. A text line is a group of characters, symbols,\r\nand words that are adjacent, “relatively close” to each other\r\nand through which a straight line can be drawn (usually with\r\nhorizontal or vertical orientation).\"  L. O'Gorman, \"The document spectrum for page layout analysis,\" in IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 15, no. 11, pp. 1162-1173, Nov. 1993.\r\n\r\nImage credit: [PubLayNet: largest dataset ever for document layout analysis](https://arxiv.org/pdf/1908.07836v1.pdf)","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":99,"papers_with_code":47,"benchmarks":6,"benchmark_tables_in_archive":6,"benchmark_tables_shown":6,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":13,"subtasks":1,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/document-layout-analysis-on-publaynet-val","slug":"document-layout-analysis-on-publaynet-val","dataset":"PubLayNet val","dataset_url":"/dataset/publaynet","rows_in_archive":15,"metrics":["Overall","Text","Title","List","Table","Figure"],"first_row_in_archive_order":{"model":"VGT","paper_title":"Vision Grid Transformer for Document Layout Analysis","paper_url":"/paper/vision-grid-transformer-for-document-layout","paper_date":"2023-08-29","arxiv_id":"2308.14978","code_links":[{"title":"alibabaresearch/advancedliteratemachinery","url":"https://github.com/alibabaresearch/advancedliteratemachinery"}],"syntology":null}},{"leaderboard":"/sota/document-layout-analysis-on-u-diads-bib","slug":"document-layout-analysis-on-u-diads-bib","dataset":"U-DIADS-Bib","dataset_url":"/dataset/u-diads-bib","rows_in_archive":5,"metrics":["Class Average IoU","Class Average IoU (Few-shot setting)"],"first_row_in_archive_order":{"model":"CV-Group","paper_title":"ICDAR 2024 Competition on Few-Shot and Many-Shot Layout Segmentation of Ancient Manuscripts (SAM)","paper_url":"/paper/icdar-2024-competition-on-few-shot-and-many","paper_date":"2024-09-11","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/document-layout-analysis-on-d4la","slug":"document-layout-analysis-on-d4la","dataset":"D4LA","dataset_url":"/dataset/d4la","rows_in_archive":3,"metrics":[" mAP","Model Parameters"],"first_row_in_archive_order":{"model":"DoPTA","paper_title":"DoPTA: Improving Document Layout Analysis using Patch-Text Alignment","paper_url":"/paper/dopta-improving-document-layout-analysis","paper_date":"2024-12-17","arxiv_id":"2412.12902","code_links":[],"syntology":null}},{"leaderboard":"/sota/document-layout-analysis-on-document-layout","slug":"document-layout-analysis-on-document-layout","dataset":"Document Layout Recognition Challenge test","dataset_url":null,"rows_in_archive":3,"metrics":["Overall","Title","Text","Figure","Table","List"],"first_row_in_archive_order":{"model":"fglihai","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/document-layout-analysis-on-document-layout-1","slug":"document-layout-analysis-on-document-layout-1","dataset":"Document Layout Recognition Challenge mini-dev","dataset_url":null,"rows_in_archive":3,"metrics":["Overall","Title","Text","Figure","Table","List"],"first_row_in_archive_order":{"model":"fglihai","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/document-layout-analysis-on-rvl-cdip","slug":"document-layout-analysis-on-rvl-cdip","dataset":"RVL-CDIP","dataset_url":"/dataset/rvl-cdip","rows_in_archive":1,"metrics":["FAR","WAR"],"first_row_in_archive_order":{"model":"VisualWordGrid","paper_title":"VisualWordGrid: Information Extraction From Scanned Documents Using A Multimodal Approach","paper_url":"/paper/visualwordgrid-information-extraction-from-1","paper_date":"2020-10-05","arxiv_id":"2010.02358","code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/publaynet","name":"PubLayNet","full_name":"","num_papers_in_archive":123},{"url":"/dataset/rvl-cdip","name":"RVL-CDIP","full_name":"RVL-CDIP","num_papers_in_archive":107},{"url":"/dataset/docbank","name":"DocBank","full_name":"","num_papers_in_archive":34},{"url":"/dataset/diva-hisdb","name":"DIVA-HisDB","full_name":"","num_papers_in_archive":15},{"url":"/dataset/dsse-200","name":"DSSE-200","full_name":"","num_papers_in_archive":8},{"url":"/dataset/hjdataset","name":"HJDataset","full_name":"","num_papers_in_archive":5},{"url":"/dataset/vis30k","name":"VIS30K","full_name":"","num_papers_in_archive":5},{"url":"/dataset/d4la","name":"D4LA","full_name":"","num_papers_in_archive":3},{"url":"/dataset/u-diads-bib","name":"U-DIADS-Bib","full_name":"","num_papers_in_archive":2},{"url":"/dataset/icdar-2021-competition-on-historical-map","name":"ICDAR 2021","full_name":"","num_papers_in_archive":1},{"url":"/dataset/pero-layout-dataset","name":"PERO layout dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/urdudoc","name":"UrduDoc","full_name":"","num_papers_in_archive":1},{"url":"/dataset/opendataset","name":"opendataset","full_name":"","num_papers_in_archive":0}],"subtasks":[{"url":"/task/ms-ssim","name":"MS-SSIM"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":47,"tagged_in_all":99,"items":[{"url":"/paper/training-data-efficient-image-transformers","title":"Training data-efficient image transformers & distillation through attention","date":"2020-12-23","arxiv_id":"2012.12877","repositories_listed":40,"syntology":{"n":19,"n_ran":12,"n_unverified":7,"n_pointer_only":3}},{"url":"/paper/layoutlm-pre-training-of-text-and-layout-for","title":"LayoutLM: Pre-training of Text and Layout for Document Image Understanding","date":"2019-12-31","arxiv_id":"1912.13318","repositories_listed":19,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/beit-bert-pre-training-of-image-transformers","title":"BEiT: BERT Pre-Training of Image Transformers","date":"2021-06-15","arxiv_id":"2106.08254","repositories_listed":14,"syntology":{"n":11,"n_ran":6,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/layoutlmv2-multi-modal-pre-training-for","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","date":"2020-12-29","arxiv_id":"2012.14740","repositories_listed":9,"syntology":null},{"url":"/paper/190807836","title":"PubLayNet: largest dataset ever for document layout analysis","date":"2019-08-16","arxiv_id":"1908.07836","repositories_listed":6,"syntology":{"n":13,"n_ran":7,"n_unverified":6,"n_pointer_only":13}},{"url":"/paper/dhsegment-a-generic-deep-learning-approach","title":"dhSegment: A generic deep-learning approach for document segmentation","date":"2018-04-27","arxiv_id":"1804.10371","repositories_listed":5,"syntology":null},{"url":"/paper/doclaynet-a-large-human-annotated-dataset-for","title":"DocLayNet: A Large Human-Annotated Dataset for Document-Layout Analysis","date":"2022-06-02","arxiv_id":"2206.01062","repositories_listed":4,"syntology":null},{"url":"/paper/layoutlmv3-pre-training-for-document-ai-with","title":"LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking","date":"2022-04-18","arxiv_id":"2204.08387","repositories_listed":4,"syntology":null},{"url":"/paper/dit-self-supervised-pre-training-for-document","title":"DiT: Self-supervised Pre-training for Document Image Transformer","date":"2022-03-04","arxiv_id":"2203.02378","repositories_listed":4,"syntology":{"n":11,"n_ran":0,"n_unverified":11,"n_pointer_only":0}},{"url":"/paper/towards-end-to-end-unified-scene-text","title":"Towards End-to-End Unified Scene Text Detection and Layout Analysis","date":"2022-03-28","arxiv_id":"2203.15143","repositories_listed":3,"syntology":{"n":15,"n_ran":8,"n_unverified":7,"n_pointer_only":15}},{"url":"/paper/cdec-net-composite-deformable-cascade-network","title":"CDeC-Net: Composite Deformable Cascade Network for Table Detection in Document Images","date":"2020-08-25","arxiv_id":"2008.10831","repositories_listed":3,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/a-large-dataset-of-historical-japanese","title":"A Large Dataset of Historical Japanese Documents with Complex Layouts","date":"2020-04-18","arxiv_id":"2004.08686","repositories_listed":3,"syntology":null},{"url":"/paper/combining-visual-and-textual-features-for-1","title":"Combining Visual and Textual Features for Semantic Segmentation of Historical Newspapers","date":"2020-02-14","arxiv_id":"2002.06144","repositories_listed":3,"syntology":null},{"url":"/paper/doclayout-yolo-enhancing-document-layout","title":"DocLayout-YOLO: Enhancing Document Layout Analysis through Diverse Synthetic Data and Global-to-Local Adaptive Perception","date":"2024-10-16","arxiv_id":"2410.12628","repositories_listed":2,"syntology":null},{"url":"/paper/text-role-classification-in-scientific-charts","title":"Text Role Classification in Scientific Charts Using Multimodal Transformers","date":"2024-02-08","arxiv_id":"2402.14579","repositories_listed":2,"syntology":null},{"url":"/paper/docbank-a-benchmark-dataset-for-document","title":"DocBank: A Benchmark Dataset for Document Layout Analysis","date":"2020-06-01","arxiv_id":"2006.01038","repositories_listed":2,"syntology":null},{"url":"/paper/class-agnostic-region-of-interest-matching-in","title":"Class-Agnostic Region-of-Interest Matching in Document Images","date":"2025-06-26","arxiv_id":"2506.21055","repositories_listed":1,"syntology":null},{"url":"/paper/sfdla-source-free-document-layout-analysis","title":"SFDLA: Source-Free Document Layout Analysis","date":"2025-03-24","arxiv_id":"2503.18742","repositories_listed":1,"syntology":null},{"url":"/paper/pp-doclayout-a-unified-document-layout","title":"PP-DocLayout: A Unified Document Layout Detection Model to Accelerate Large-Scale Data Construction","date":"2025-03-21","arxiv_id":"2503.17213","repositories_listed":1,"syntology":null},{"url":"/paper/unihdsa-a-unified-relation-prediction","title":"UniHDSA: A Unified Relation Prediction Approach for Hierarchical Document Structure Analysis","date":"2025-03-20","arxiv_id":"2503.15893","repositories_listed":1,"syntology":null},{"url":"/paper/information-extraction-from-visually-rich-1","title":"Information Extraction from Visually Rich Documents Using Directed Weighted Graph Neural Network","date":"2024-09-11","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/pdftable-a-unified-toolkit-for-deep-learning","title":"PdfTable: A Unified Toolkit for Deep Learning-Based Table Extraction","date":"2024-09-08","arxiv_id":"2409.05125","repositories_listed":1,"syntology":null},{"url":"/paper/daniel-a-fast-document-attention-network-for","title":"DANIEL: A fast Document Attention Network for Information Extraction and Labelling of handwritten documents","date":"2024-07-12","arxiv_id":"2407.09103","repositories_listed":1,"syntology":null},{"url":"/paper/rodla-benchmarking-the-robustness-of-document","title":"RoDLA: Benchmarking the Robustness of Document Layout Analysis Models","date":"2024-03-21","arxiv_id":"2403.14442","repositories_listed":1,"syntology":null},{"url":"/paper/detect-order-construct-a-tree-construction","title":"Detect-Order-Construct: A Tree Construction based Approach for Hierarchical Document Structure Analysis","date":"2024-01-22","arxiv_id":"2401.11874","repositories_listed":1,"syntology":null},{"url":"/paper/multimodal-weighted-graph-representation-for","title":"Multimodal weighted graph representation for information extraction from visually rich documents.","date":"2024-01-05","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/dcqa-document-level-chart-question-answering","title":"DCQA: Document-Level Chart Question Answering towards Complex Reasoning and Common-Sense Understanding","date":"2023-10-29","arxiv_id":"2310.18983","repositories_listed":1,"syntology":null},{"url":"/paper/docxchain-a-powerful-open-source-toolchain","title":"DocXChain: A Powerful Open-Source Toolchain for Document Parsing and Beyond","date":"2023-10-19","arxiv_id":"2310.12430","repositories_listed":1,"syntology":null},{"url":"/paper/appjsonify-an-academic-paper-pdf-to-json","title":"appjsonify: An Academic Paper PDF-to-JSON Conversion Toolkit","date":"2023-10-02","arxiv_id":"2310.01206","repositories_listed":1,"syntology":null},{"url":"/paper/vision-grid-transformer-for-document-layout","title":"Vision Grid Transformer for Document Layout Analysis","date":"2023-08-29","arxiv_id":"2308.14978","repositories_listed":1,"syntology":null}],"syntology_records":7,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}