{"url":"/method/dall-e-2","slug":"dall-e-2","name":"DALL·E 2","full_name":"DALL·E 2","full_name_withheld":false,"description_markdown":"**DALL·E 2** is a generative text-to-image model made up of two main components: a prior that generates a CLIP image embedding given a text caption, and a decoder that generates an image conditioned on the image embedding.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","paper":"/paper/hierarchical-text-conditional-image","first_author":"Aditya Ramesh","n_authors":5,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/hierarchical-text-conditional-image"},"source":{"url":"https://arxiv.org/abs/2204.06125v1","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Image Generation Models","url":"/methods/category/image-generation-models","pwc_aliases":[]}],"n_papers_tagged":2,"archive_num_papers":2,"papers_newest_first":[{"paper":"/paper/a-comprehensive-survey-of-ai-generated","title":"A Comprehensive Survey of AI-Generated Content (AIGC): A History of Generative AI from GAN to ChatGPT","date":"2023-03-07","arxiv_id":"2303.04226","n_code_links":1,"syntology":null},{"paper":"/paper/hierarchical-text-conditional-image","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","date":"2022-04-13","arxiv_id":"2204.06125","n_code_links":8,"syntology":{"ran":29,"of":38,"unverified":9,"pointer_only":1}}],"papers_shown":2,"tasks":[{"task":"/task/conditional-image-generation","name":"Conditional Image Generation","papers":1},{"task":"/task/decoder","name":"Decoder","papers":1},{"task":"/task/diversity","name":"Diversity","papers":1},{"task":"/task/image-generation","name":"Image Generation","papers":1},{"task":"/task/text-to-image-generation","name":"Text-to-Image Generation","papers":1},{"task":"/task/zero-shot-text-to-image-generation","name":"Zero-Shot Text-to-Image Generation","papers":1},{"task":"/task/multimodal-interaction","name":"multimodal interaction","papers":1}],"tasks_shown":7,"n_tasks":7,"usage_by_year":[{"year":"2022","papers":1},{"year":"2023","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/dall-e-2"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}