{"url":"/method/chinese-pre-trained-unbalanced-transformer","slug":"chinese-pre-trained-unbalanced-transformer","name":"Chinese Pre-trained Unbalanced Transformer","full_name":"Chinese Pre-trained Unbalanced Transformer","full_name_withheld":false,"description_markdown":"**CPT**, or **Chinese Pre-trained Unbalanced Transformer**, is a pre-trained unbalanced [Transformer](https://paperswithcode.com/method/transformer) for Chinese natural language understanding (NLU) and natural language generation (NLG) tasks. CPT consists of three parts: a shared encoder, an understanding decoder, and a generation decoder. Two specific decoders with a shared encoder are pre-trained with masked language modeling (MLM) and denoising auto-encoding (DAE) tasks, respectively. With the partially shared architecture and multi-task pre-training, CPT can (1) learn specific knowledge of both NLU or NLG tasks with two decoders and (2) be fine-tuned flexibly that fully exploits the potential of the model. Two specific decoders with a shared encoder are pre-trained with masked language modeling (MLM) and denoising auto-encoding (DAE) tasks, respectively. With the partially shared architecture and multi-task pre-training, CPT can (1) learn specific knowledge of both NLU or NLG tasks with two decoders and (2) be fine-tuned flexibly that fully exploits the potential of the model.","description_state":"present","introduced_year":null,"introduced_by":{"title":"CPT: A Pre-Trained Unbalanced Transformer for Both Chinese Language Understanding and Generation","paper":"/paper/cpt-a-pre-trained-unbalanced-transformerfor","first_author":"Yunfan Shao","n_authors":9,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/cpt-a-pre-trained-unbalanced-transformerfor"},"source":{"url":"https://arxiv.org/abs/2109.05729v4","title":"CPT: A Pre-Trained Unbalanced Transformer for Both Chinese Language Understanding and Generation","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Natural Language Processing","area_id":"natural-language-processing","collection":"Transformers","url":"/methods/category/transformers","pwc_aliases":[]}],"n_papers_tagged":1,"archive_num_papers":1,"papers_newest_first":[{"paper":"/paper/cpt-a-pre-trained-unbalanced-transformerfor","title":"CPT: A Pre-Trained Unbalanced Transformer for Both Chinese Language Understanding and Generation","date":"2021-09-13","arxiv_id":"2109.05729","n_code_links":1,"syntology":null}],"papers_shown":1,"tasks":[{"task":"/task/decoder","name":"Decoder","papers":1},{"task":"/task/denoising","name":"Denoising","papers":1},{"task":"/task/language-modeling","name":"Language Modeling","papers":1},{"task":"/task/language-modelling","name":"Language Modelling","papers":1},{"task":"/task/masked-language-modeling","name":"Masked Language Modeling","papers":1},{"task":"/task/natural-language-understanding","name":"Natural Language Understanding","papers":1},{"task":"/task/text-generation","name":"Text Generation","papers":1}],"tasks_shown":7,"n_tasks":7,"usage_by_year":[{"year":"2021","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/chinese-pre-trained-unbalanced-transformer"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}