{"url":"/dataset/multi-modal-celeba-hq-1","name":"Multi-Modal CelebA-HQ","full_name":null,"description_markdown":"Multi-Modal-CelebA-HQ is a large-scale face image dataset that has 30,000 high-resolution face images selected from the CelebA dataset by following CelebA-HQ. Each image has high-quality segmentation mask, sketch, descriptive text, and image with transparent background.\r\n\r\nMulti-Modal-CelebA-HQ can be used to train and evaluate algorithms of text-to-image-generation, text-guided image manipulation, sketch-to-image generation, and GANs for face generation and editing.\r\n\r\nSource: [Multi-Modal CelebA-HQ Dataset](https://github.com/weihaox/Multi-Modal-CelebA-HQ-Dataset)\r\nImage Source: [Xia et al](https://arxiv.org/pdf/2012.03308.pdf)","description_withheld":null,"homepage":"https://github.com/weihaox/Multi-Modal-CelebA-HQ-Dataset","introduced_date":"2020-12-06","introduced_date_note":null,"introduced_by":{"paper":"/paper/tedigan-text-guided-diverse-image-generation","title":"TediGAN: Text-Guided Diverse Face Image Generation and Manipulation","first_author":"Weihao Xia","url":null},"license":null,"modalities":[{"name":"Images","url":"/datasets/modality/images"},{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Image Generation","url":"/task/image-generation","datasets_with_task":"/datasets/task/image-generation"},{"name":"Text-to-Image Generation","url":"/task/text-to-image-generation","datasets_with_task":"/datasets/task/text-to-image-generation"},{"name":"Face Sketch Synthesis","url":"/task/face-sketch-synthesis","datasets_with_task":"/datasets/task/face-sketch-synthesis"},{"name":"multimodal generation","url":"/task/multimodal-generation","datasets_with_task":"/datasets/task/multimodal-generation"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["Multi-Modal-CelebA-HQ","Multi-Modal CelebA-HQ"],"data_loaders":[{"repo":"https://github.com/weihaox/Multi-Modal-CelebA-HQ-Dataset","url":"https://github.com/weihaox/Multi-Modal-CelebA-HQ-Dataset","frameworks":[]}],"num_papers_in_archive":27,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/text-to-image-generation-on-multi-modal","task":"Text-to-Image Generation","dataset_variant":"Multi-Modal-CelebA-HQ","rows":10,"metrics":["FID","LPIPS","Acc","Real"],"first_row_in_archive_order":{"model":"Swinv2-Imagen","paper":"/paper/swinv2-imagen-hierarchical-vision-transformer","metrics":{"FID":"10.31"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/face-sketch-synthesis-on-multi-modal-celeba","task":"Face Sketch Synthesis","dataset_variant":"Multi-Modal CelebA-HQ","rows":1,"metrics":["FID"],"first_row_in_archive_order":{"model":"Diffusion","paper":"/paper/unite-and-conquer-cross-dataset-multimodal","metrics":{"FID":"26.09"},"code_links":[{"title":"Nithin-GK/UniteandConquer","url":"https://github.com/Nithin-GK/UniteandConquer"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/multimodal-generation-on-multi-modal-celeba","task":"multimodal generation","dataset_variant":"Multi-Modal CelebA-HQ","rows":1,"metrics":["FID"],"first_row_in_archive_order":{"model":"Diffusion","paper":"/paper/unite-and-conquer-cross-dataset-multimodal","metrics":{"FID":"26.09"},"code_links":[{"title":"Nithin-GK/UniteandConquer","url":"https://github.com/Nithin-GK/UniteandConquer"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/unite-and-conquer-cross-dataset-multimodal","title":"Unite and Conquer: Plug & Play Multi-Modal Synthesis using Diffusion Models","date":"2022-12-01","rows_on_this_dataset":3,"code_links":1,"syntology":null},{"paper":"/paper/shifted-diffusion-for-text-to-image","title":"Shifted Diffusion for Text-to-image Generation","date":"2022-11-24","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":17,"samples_ran":11,"samples_unverified":6,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/swinv2-imagen-hierarchical-vision-transformer","title":"Swinv2-Imagen: Hierarchical Vision Transformer Diffusion Models for Text-to-Image Generation","date":"2022-10-18","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/lafite-towards-language-free-training-for","title":"LAFITE: Towards Language-Free Training for Text-to-Image Generation","date":"2021-11-27","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":18,"samples_ran":12,"samples_unverified":6,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/towards-open-world-text-guided-face-image","title":"Towards Open-World Text-Guided Face Image Generation and Manipulation","date":"2021-04-18","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":5,"samples_ran":2,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/tedigan-text-guided-diverse-image-generation","title":"TediGAN: Text-Guided Diverse Face Image Generation and Manipulation","date":"2020-12-06","rows_on_this_dataset":1,"code_links":5,"syntology":null},{"paper":"/paper/df-gan-deep-fusion-generative-adversarial","title":"DF-GAN: A Simple and Effective Baseline for Text-to-Image Synthesis","date":"2020-08-13","rows_on_this_dataset":1,"code_links":3,"syntology":null},{"paper":"/paper/controllable-text-to-image-generation","title":"Controllable Text-to-Image Generation","date":"2019-09-16","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":10,"samples_ran":7,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/dm-gan-dynamic-memory-generative-adversarial","title":"DM-GAN: Dynamic Memory Generative Adversarial Networks for Text-to-Image Synthesis","date":"2019-04-02","rows_on_this_dataset":1,"code_links":4,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":5,"samples_ran":4,"samples_unverified":1,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/attngan-fine-grained-text-to-image-generation","title":"AttnGAN: Fine-Grained Text to Image Generation with Attentional Generative Adversarial Networks","date":"2017-11-28","rows_on_this_dataset":1,"code_links":20,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}}],"syntology_totals":{"read_at":"2026-09-25T09:33:49+00:00","papers_with_samples":6,"samples_harvested":58,"samples_ran":39,"samples_unverified":19,"pointer_only_for_licence":1,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}