{"url":"/method/xgpt","slug":"xgpt","name":"XGPT","full_name":"XGPT","full_name_withheld":false,"description_markdown":"XGPT is a method of cross-modal generative pre-training for image captioning designed to pre-train text-to-image caption generators through three novel generation tasks, including image-conditioned masked language modeling (IMLM), image-conditioned denoising autoencoding (IDA), and text-conditioned image feature generation (TIGF). The pre-trained XGPT can be fine-tuned without any task-specific architecture modifications and build strong image captioning models.","description_state":"present","introduced_year":null,"introduced_by":{"title":"XGPT: Cross-modal Generative Pre-Training for Image Captioning","paper":"/paper/xgpt-cross-modal-generative-pre-training-for","first_author":"Qiaolin Xia","n_authors":10,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/xgpt-cross-modal-generative-pre-training-for"},"source":{"url":"https://arxiv.org/abs/2003.01473v2","title":"XGPT: Cross-modal Generative Pre-Training for Image Captioning","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Vision and Language Pre-Trained Models","url":"/methods/category/vision-and-language-pre-trained-models","pwc_aliases":[]}],"n_papers_tagged":1,"archive_num_papers":1,"papers_newest_first":[{"paper":"/paper/xgpt-cross-modal-generative-pre-training-for","title":"XGPT: Cross-modal Generative Pre-Training for Image Captioning","date":"2020-03-03","arxiv_id":"2003.01473","n_code_links":0,"syntology":null}],"papers_shown":1,"tasks":[{"task":"/task/data-augmentation","name":"Data Augmentation","papers":1},{"task":"/task/denoising","name":"Denoising","papers":1},{"task":"/task/image-captioning","name":"Image Captioning","papers":1},{"task":"/task/image-retrieval","name":"Image Retrieval","papers":1},{"task":"/task/image-text-retrieval","name":"Image-text Retrieval","papers":1},{"task":"/task/language-modeling","name":"Language Modeling","papers":1},{"task":"/task/language-modelling","name":"Language Modelling","papers":1},{"task":"/task/masked-language-modeling","name":"Masked Language Modeling","papers":1},{"task":"/task/retrieval","name":"Retrieval","papers":1},{"task":"/task/text-retrieval","name":"Text Retrieval","papers":1},{"task":"/task/visual-question-answering","name":"Visual Question Answering (VQA)","papers":1}],"tasks_shown":11,"n_tasks":11,"usage_by_year":[{"year":"2020","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/xgpt"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}