{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/vector-quantized-diffusion-model-for-text-to","title":"Vector Quantized Diffusion Model for Text-to-Image Synthesis","arxiv_id":"2111.14822","date":"2021-11-29","proceeding":"CVPR 2022 1","authors":["Shuyang Gu","Dong Chen","Jianmin Bao","Fang Wen","Bo Zhang","Dongdong Chen","Lu Yuan","Baining Guo"],"abstract":"We present the vector quantized diffusion (VQ-Diffusion) model for text-to-image generation. This method is based on a vector quantized variational autoencoder (VQ-VAE) whose latent space is modeled by a conditional variant of the recently developed Denoising Diffusion Probabilistic Model (DDPM). We find that this latent-space method is well-suited for text-to-image generation tasks because it not only eliminates the unidirectional bias with existing methods but also allows us to incorporate a mask-and-replace diffusion strategy to avoid the accumulation of errors, which is a serious problem with existing methods. Our experiments show that the VQ-Diffusion produces significantly better text-to-image generation results when compared with conventional autoregressive (AR) models with similar numbers of parameters. Compared with previous GAN-based text-to-image methods, our VQ-Diffusion can handle more complex scenes and improve the synthesized image quality by a large margin. Finally, we show that the image generation computation in our method can be made highly efficient by reparameterization. With traditional AR methods, the text-to-image generation time increases linearly with the output image resolution and hence is quite time consuming even for normal size images. The VQ-Diffusion allows us to achieve a better trade-off between quality and speed. Our experiments indicate that the VQ-Diffusion model with the reparameterization is fifteen times faster than traditional AR methods while achieving a better image quality.","url_abs":"https://arxiv.org/abs/2111.14822v3","url_pdf":"https://arxiv.org/pdf/2111.14822v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"vector-quantized-diffusion-model-for-text-to","repo_url":"https://github.com/cientgu/vq-diffusion","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"vector-quantized-diffusion-model-for-text-to","repo_url":"https://github.com/microsoft/vq-diffusion","is_official":0,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}}],"tasks":[{"task_slug":"denoising","task_name":"Denoising"},{"task_slug":"image-generation","task_name":"Image Generation"},{"task_slug":"text-to-image-generation-1","task_name":"Text to Image Generation"},{"task_slug":"text-to-image-generation","task_name":"Text-to-Image Generation"}],"methods":[{"method_slug":"diffusion","method_name":"Diffusion"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/text-to-image-generation-on-coco","task":"Text-to-Image Generation","dataset":"COCO (Common Objects in Context)","model":"VQ-Diffusion-F","rank_in_archive_order":37,"of":69,"metrics":{"FID":"13.86"},"uses_additional_data":true},{"leaderboard":"/sota/text-to-image-generation-on-coco","task":"Text-to-Image Generation","dataset":"COCO (Common Objects in Context)","model":"VQ-Diffusion-B","rank_in_archive_order":43,"of":69,"metrics":{"FID":"19.75"},"uses_additional_data":true},{"leaderboard":"/sota/text-to-image-generation-on-cub","task":"Text-to-Image Generation","dataset":"CUB","model":"VQ-Diffusion-F","rank_in_archive_order":6,"of":20,"metrics":{"FID":"10.32"},"uses_additional_data":true},{"leaderboard":"/sota/text-to-image-generation-on-cub","task":"Text-to-Image Generation","dataset":"CUB","model":"VQ-Diffusion-B","rank_in_archive_order":8,"of":20,"metrics":{"FID":"11.94"},"uses_additional_data":true},{"leaderboard":"/sota/text-to-image-generation-on-cub","task":"Text-to-Image Generation","dataset":"CUB","model":"VQ-Diffusion-S","rank_in_archive_order":9,"of":20,"metrics":{"FID":"12.97"},"uses_additional_data":true},{"leaderboard":"/sota/text-to-image-generation-on-oxford-102","task":"Text-to-Image Generation","dataset":"Oxford 102 Flowers","model":"VQ-Diffusion-F","rank_in_archive_order":2,"of":8,"metrics":{"FID":"14.1"},"uses_additional_data":true},{"leaderboard":"/sota/text-to-image-generation-on-oxford-102","task":"Text-to-Image Generation","dataset":"Oxford 102 Flowers","model":"VQ-Diffusion-B","rank_in_archive_order":3,"of":8,"metrics":{"FID":"14.88"},"uses_additional_data":true},{"leaderboard":"/sota/text-to-image-generation-on-oxford-102","task":"Text-to-Image Generation","dataset":"Oxford 102 Flowers","model":"VQ-Diffusion-S","rank_in_archive_order":4,"of":8,"metrics":{"FID":"14.95"},"uses_additional_data":true}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2111.14822","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}