{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/layoutlmv3-pre-training-for-document-ai-with","title":"LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking","arxiv_id":"2204.08387","date":"2022-04-18","proceeding":null,"authors":["Yupan Huang","Tengchao Lv","Lei Cui","Yutong Lu","Furu Wei"],"abstract":"Self-supervised pre-training techniques have achieved remarkable progress in Document AI. Most multimodal pre-trained models use a masked language modeling objective to learn bidirectional representations on the text modality, but they differ in pre-training objectives for the image modality. This discrepancy adds difficulty to multimodal representation learning. In this paper, we propose \\textbf{LayoutLMv3} to pre-train multimodal Transformers for Document AI with unified text and image masking. Additionally, LayoutLMv3 is pre-trained with a word-patch alignment objective to learn cross-modal alignment by predicting whether the corresponding image patch of a text word is masked. The simple unified architecture and training objectives make LayoutLMv3 a general-purpose pre-trained model for both text-centric and image-centric Document AI tasks. Experimental results show that LayoutLMv3 achieves state-of-the-art performance not only in text-centric tasks, including form understanding, receipt understanding, and document visual question answering, but also in image-centric tasks such as document image classification and document layout analysis. The code and models are publicly available at \\url{https://aka.ms/layoutlmv3}.","url_abs":"https://arxiv.org/abs/2204.08387v3","url_pdf":"https://arxiv.org/pdf/2204.08387v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"layoutlmv3-pre-training-for-document-ai-with","repo_url":"https://github.com/microsoft/unilm/tree/master/layoutlmv3","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null},{"paper_slug":"layoutlmv3-pre-training-for-document-ai-with","repo_url":"https://github.com/huggingface/transformers","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"layoutlmv3-pre-training-for-document-ai-with","repo_url":"https://github.com/MindSpore-scientific-2/code-14/tree/main/layoutlmv3","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null},{"paper_slug":"layoutlmv3-pre-training-for-document-ai-with","repo_url":"https://github.com/pwc-1/Paper-9/tree/main/layoutlmv3","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null}],"tasks":[{"task_slug":"document-ai","task_name":"Document AI"},{"task_slug":"document-image-classification","task_name":"Document Image Classification"},{"task_slug":"document-layout-analysis","task_name":"Document Layout Analysis"},{"task_slug":"entity-linking","task_name":"Entity Linking"},{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"key-information-extraction","task_name":"Key Information Extraction"},{"task_slug":"key-value-pair-extraction","task_name":"Key-value Pair Extraction"},{"task_slug":"language-modeling","task_name":"Language Modeling"},{"task_slug":"language-modelling","task_name":"Language Modelling"},{"task_slug":"masked-language-modeling","task_name":"Masked Language Modeling"},{"task_slug":"named-entity-recognition-ner","task_name":"Named Entity Recognition (NER)"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"relation-extraction","task_name":"Relation Extraction"},{"task_slug":"representation-learning","task_name":"Representation Learning"},{"task_slug":"semantic-entity-labeling","task_name":"Semantic entity labeling"},{"task_slug":"visual-question-answering-1","task_name":"Visual Question Answering"},{"task_slug":"visual-question-answering","task_name":"Visual Question Answering (VQA)"},{"task_slug":"cross-modal-alignment","task_name":"cross-modal alignment"},{"task_slug":"document-image-classification","task_name":"document-image-classification"},{"task_slug":"image-classification","task_name":"image-classification"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/document-ai-on-ephoie","task":"Document AI","dataset":"EPHOIE","model":"LayoutLMv3","rank_in_archive_order":1,"of":1,"metrics":{"Average F1":"99.21"},"uses_additional_data":false},{"leaderboard":"/sota/document-image-classification-on-rvl-cdip","task":"Document Image Classification","dataset":"RVL-CDIP","model":"LayoutLMV3Large","rank_in_archive_order":4,"of":31,"metrics":{"Accuracy":"95.93%","Parameters":"368M"},"uses_additional_data":false},{"leaderboard":"/sota/document-image-classification-on-rvl-cdip","task":"Document Image Classification","dataset":"RVL-CDIP","model":"LayoutLMv3BASE","rank_in_archive_order":9,"of":31,"metrics":{"Accuracy":"95.44%","Parameters":"133M"},"uses_additional_data":false},{"leaderboard":"/sota/document-layout-analysis-on-publaynet-val","task":"Document Layout Analysis","dataset":"PubLayNet val","model":"LayoutLMv3-B","rank_in_archive_order":5,"of":15,"metrics":{"Figure":"0.970","List":"0.955","Overall":"0.951","Table":"0.979","Text":"0.945","Title":"0.906"},"uses_additional_data":false},{"leaderboard":"/sota/entity-linking-on-ec-funsd","task":"Entity Linking","dataset":"EC-FUNSD","model":"LayoutLMv3 (large)","rank_in_archive_order":5,"of":8,"metrics":{"F1":"78.14"},"uses_additional_data":false},{"leaderboard":"/sota/entity-linking-on-ec-funsd","task":"Entity Linking","dataset":"EC-FUNSD","model":"LayoutLMv3 (base)","rank_in_archive_order":8,"of":8,"metrics":{"F1":"67.47"},"uses_additional_data":false},{"leaderboard":"/sota/key-information-extraction-on-cord","task":"Key Information Extraction","dataset":"CORD","model":"LayoutLMv3 Large","rank_in_archive_order":3,"of":9,"metrics":{"F1":"97.46"},"uses_additional_data":false},{"leaderboard":"/sota/key-information-extraction-on-ephoie","task":"Key Information Extraction","dataset":"EPHOIE","model":"LayoutLMv3","rank_in_archive_order":1,"of":1,"metrics":{"Average F1":"99.21"},"uses_additional_data":false},{"leaderboard":"/sota/key-value-pair-extraction-on-rfund-en","task":"Key-value Pair Extraction","dataset":"RFUND-EN","model":"LayoutLMv3","rank_in_archive_order":7,"of":13,"metrics":{"key-value pair F1":"57.66"},"uses_additional_data":false},{"leaderboard":"/sota/key-value-pair-extraction-on-sibr","task":"Key-value Pair Extraction","dataset":"SIBR","model":"LayoutLMv3_base_chinese","rank_in_archive_order":4,"of":7,"metrics":{"key-value pair F1":"73.51"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-ner-on-cord-r","task":"Named Entity Recognition (NER)","dataset":"CORD-r","model":"LayoutLMv3","rank_in_archive_order":3,"of":4,"metrics":{"F1":"82.72"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-ner-on-funsd-r","task":"Named Entity Recognition (NER)","dataset":"FUNSD-r","model":"LayoutLMv3","rank_in_archive_order":2,"of":4,"metrics":{"F1":"78.77"},"uses_additional_data":false},{"leaderboard":"/sota/relation-extraction-on-funsd","task":"Relation Extraction","dataset":"FUNSD","model":"LayoutLMv3 large","rank_in_archive_order":4,"of":9,"metrics":{"F1":"80.35"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-entity-labeling-on-ec-funsd","task":"Semantic entity labeling","dataset":"EC-FUNSD","model":"LayoutLMv3 (large)","rank_in_archive_order":4,"of":8,"metrics":{"F1":"83.88"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-entity-labeling-on-ec-funsd","task":"Semantic entity labeling","dataset":"EC-FUNSD","model":"LayoutLMv3 (base)","rank_in_archive_order":8,"of":8,"metrics":{"F1":"82.30"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-entity-labeling-on-funsd","task":"Semantic entity labeling","dataset":"FUNSD","model":"LayoutLMv3 Large","rank_in_archive_order":5,"of":15,"metrics":{"F1":"92.08"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2204.08387","atlas_url":"https://app.syntology.ai/?focus=2204.08387","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}