{"url":"/sota/text-to-image-generation-on-coco","task":{"name":"Text-to-Image Generation","url":"/task/text-to-image-generation","note":null},"dataset":{"name":"COCO (Common Objects in Context)","url":"/dataset/coco"},"category":"Computer Vision","categories":["Computer Vision","Natural Language Processing"],"category_note":null,"description":"The development of the brain's blood supply in an embryo involves a complex process with several stages. Initially, there is a network of connections between the carotid and basilar artery systems that usually disappear during development. However, in some cases, these connections remain, leading to variations in the adult cerebral circulation. Around the 24th day of embryonic life (at the 3 mm embryonic stage), the internal carotid arteries (ICA) emerge. They are formed from a combination of the 3rd branchial arch arteries and the distal segments of the paired dorsal aortae. The ICA initially provides all the blood needed by the developing brain. As the brain grows, particularly the occipital region, brainstem, and cerebellum, the blood supply from the ICA becomes insufficient, prompting the development of the posterior circulation. At this stage (4-5 mm embryonic stage), the posterior circulation, specifically the hindbrain, is supplied by two longitudinal neural arteries. These arteries receive blood from several temporary connections (anastomoses) with the ICA, including: Trigeminal artery (TA), Otic artery (OA), Hypoglossal artery (HA), Proatlantal artery (ProA). These carotid-vertebrobasilar anastomoses act as temporary bridges, providing blood flow to the developing posterior circulation until the vertebral arteries (VA) and the basilar artery (BA) are fully formed.6\r\n\r\nThe BA forms between the 5-8 mm stage by the fusion of the longitudinal neural arteries. As the posterior communicating artery develops and connects with the distal BA, the TA, OA, and HA typically regress. Unlike the TA, OA, and HA, the ProA persists until the VA are fully developed. A segment of the ProA becomes incorporated into the V3 segment of the VA and the distal portions of the occipital artery. The VA develop between the 7-12 mm stage from transverse connections between cervical intersegmental arteries, starting with the ProA and progressing downwards to the 6th intersegmental artery. This 6th intersegmental artery eventually forms the origin of the adult VA from the subclavian artery. 7-8\r\n\r\nPersistence of the HA into adulthood, the focus of this discussion, is a rare occurrence. It is the second most common persistent carotid-vertebrobasilar anastomosis, following the persistent trigeminal artery. The failure of the HA to regress during embryological development leads to PPHA. This condition can impact the normal blood flow dynamics in the brain and, in certain cases, can be associated with cerebrovascular issues like aneurysms or ischemic events.","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["FID","Inception score","FID-1","FID-2","FID-4","FID-8","SOA-C","Zero shot FID"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"FID":"lower","Inception score":"higher","FID-1":"lower","FID-2":"lower","FID-4":"lower","FID-8":"lower","SOA-C":null,"Zero shot FID":"lower"}},"counts":{"rows":69,"rows_with_code":59,"rows_with_paper_page":69,"rows_dated":69,"rows_using_additional_data":12},"rows":[{"rank_in_archive_order":1,"model":"RAT-Diffusion","metrics":{"FID":"5.00"},"uses_additional_data":true,"paper_date":"2024-10-02","paper":"/paper/data-extrapolation-for-text-to-image","paper_url":"https://arxiv.org/abs/2410.01638v1","paper_title":"Data Extrapolation for Text-to-image Generation on Small Datasets","code":"https://github.com/senmaoy/RAT-Diffusion","n_code_links":1,"syntology":null},{"rank_in_archive_order":2,"model":"Re-Imagen (Finetuned)","metrics":{"FID":"5.25"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/re-imagen-retrieval-augmented-text-to-image","paper_url":"https://arxiv.org/abs/2209.14491v3","paper_title":"Re-Imagen: Retrieval-Augmented Text-to-Image Generator","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":3,"model":"U-ViT-S/2-Deep","metrics":{"FID":"5.48"},"uses_additional_data":false,"paper_date":"2022-09-25","paper":"/paper/all-are-worth-words-a-vit-backbone-for-score","paper_url":"https://arxiv.org/abs/2209.12152v4","paper_title":"All are Worth Words: A ViT Backbone for Diffusion Models","code":"https://github.com/baofff/U-ViT","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":4,"model":"GLIGEN (fine-tuned, Detection + Caption data)","metrics":{"FID":"5.61"},"uses_additional_data":false,"paper_date":"2023-01-17","paper":"/paper/gligen-open-set-grounded-text-to-image","paper_url":"https://arxiv.org/abs/2301.07093v2","paper_title":"GLIGEN: Open-Set Grounded Text-to-Image Generation","code":"https://github.com/gligen/GLIGEN","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"GLIGEN (fine-tuned, Detection data only)","metrics":{"FID":"5.82"},"uses_additional_data":false,"paper_date":"2023-01-17","paper":"/paper/gligen-open-set-grounded-text-to-image","paper_url":"https://arxiv.org/abs/2301.07093v2","paper_title":"GLIGEN: Open-Set Grounded Text-to-Image Generation","code":"https://github.com/gligen/GLIGEN","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":6,"model":"U-ViT-S/2","metrics":{"FID":"5.95"},"uses_additional_data":false,"paper_date":"2022-09-25","paper":"/paper/all-are-worth-words-a-vit-backbone-for-score","paper_url":"https://arxiv.org/abs/2209.12152v4","paper_title":"All are Worth Words: A ViT Backbone for Diffusion Models","code":"https://github.com/baofff/U-ViT","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":7,"model":"ConPreDiff","metrics":{"FID":"6.21","Zero shot FID":"6.21"},"uses_additional_data":false,"paper_date":"2024-01-04","paper":"/paper/improving-diffusion-based-image-synthesis-1","paper_url":"https://arxiv.org/abs/2401.02015v1","paper_title":"Improving Diffusion-Based Image Synthesis with Context Prediction","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":8,"model":"TLDM","metrics":{"FID":"6.29"},"uses_additional_data":false,"paper_date":"2022-02-19","paper":"/paper/truncated-diffusion-probabilistic-models","paper_url":"https://arxiv.org/abs/2202.09671v4","paper_title":"Truncated Diffusion Probabilistic Models and Diffusion-based Adversarial Auto-Encoders","code":"https://github.com/jegzheng/truncated-diffusion-probabilistic-models","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"GLIGEN (fine-tuned, Grounding data)","metrics":{"FID":"6.38"},"uses_additional_data":false,"paper_date":"2023-01-17","paper":"/paper/gligen-open-set-grounded-text-to-image","paper_url":"https://arxiv.org/abs/2301.07093v2","paper_title":"GLIGEN: Open-Set Grounded Text-to-Image Generation","code":"https://github.com/gligen/GLIGEN","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"RAPHAEL (zero-shot)","metrics":{"FID":"6.61"},"uses_additional_data":false,"paper_date":"2023-05-29","paper":"/paper/raphael-text-to-image-generation-via-large","paper_url":"https://arxiv.org/abs/2305.18295v5","paper_title":"RAPHAEL: Text-to-Image Generation via Large Mixture of Diffusion Paths","code":"https://github.com/lucidrains/soft-moe-pytorch","n_code_links":1,"syntology":null},{"rank_in_archive_order":11,"model":"ERNIE-ViLG 2.0 (zero-shot)","metrics":{"FID":"6.75"},"uses_additional_data":false,"paper_date":"2022-10-27","paper":"/paper/ernie-vilg-2-0-improving-text-to-image","paper_url":"https://arxiv.org/abs/2210.15257v2","paper_title":"ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with Knowledge-Enhanced Mixture-of-Denoising-Experts","code":"https://github.com/PaddlePaddle/PaddleNLP/tree/develop/pipelines/examples/text_to_image","n_code_links":2,"syntology":null},{"rank_in_archive_order":12,"model":"Re-Imagen","metrics":{"FID":"6.88"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/re-imagen-retrieval-augmented-text-to-image","paper_url":"https://arxiv.org/abs/2209.14491v3","paper_title":"Re-Imagen: Retrieval-Augmented Text-to-Image Generator","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":13,"model":"eDiff-I (zero-shot)","metrics":{"FID":"6.95"},"uses_additional_data":false,"paper_date":"2022-11-02","paper":"/paper/ediffi-text-to-image-diffusion-models-with-an","paper_url":"https://arxiv.org/abs/2211.01324v5","paper_title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","code":"https://github.com/cloneofsimo/paint-with-words-sd","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":9,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":14,"model":"Swinv2-Imagen","metrics":{"FID":"7.21","Inception score":"31.46"},"uses_additional_data":true,"paper_date":"2022-10-18","paper":"/paper/swinv2-imagen-hierarchical-vision-transformer","paper_url":"https://arxiv.org/abs/2210.09549v1","paper_title":"Swinv2-Imagen: Hierarchical Vision Transformer Diffusion Models for Text-to-Image Generation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":15,"model":"Imagen (zero-shot)","metrics":{"FID":"7.27"},"uses_additional_data":true,"paper_date":"2022-05-23","paper":"/paper/photorealistic-text-to-image-diffusion-models","paper_url":"https://arxiv.org/abs/2205.11487v1","paper_title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","code":"https://github.com/lucidrains/imagen-pytorch","n_code_links":5,"syntology":{"n_ran":5,"n_unverified":6,"n_samples":11,"n_pointer_only_licence":9}},{"rank_in_archive_order":16,"model":"GigaGAN (Zero-shot, 64x64)","metrics":{"FID":"7.28"},"uses_additional_data":false,"paper_date":"2023-03-09","paper":"/paper/scaling-up-gans-for-text-to-image-synthesis","paper_url":"https://arxiv.org/abs/2303.05511v2","paper_title":"Scaling up GANs for Text-to-Image Synthesis","code":"https://github.com/lucidrains/gigagan-pytorch","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":6,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":17,"model":"StyleGAN-T (Zero-shot, 64x64)","metrics":{"FID":"7.3"},"uses_additional_data":false,"paper_date":"2023-01-23","paper":"/paper/stylegan-t-unlocking-the-power-of-gans-for","paper_url":"https://arxiv.org/abs/2301.09515v1","paper_title":"StyleGAN-T: Unlocking the Power of GANs for Fast Large-Scale Text-to-Image Synthesis","code":"https://github.com/autonomousvision/stylegan-t","n_code_links":1,"syntology":null},{"rank_in_archive_order":18,"model":"Make-a-Scene (unfiltered)","metrics":{"FID":"7.55"},"uses_additional_data":true,"paper_date":"2022-03-24","paper":"/paper/make-a-scene-scene-based-text-to-image","paper_url":"https://arxiv.org/abs/2203.13131v1","paper_title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","code":"https://github.com/CasualGANPapers/Make-A-Scene","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"Kandinsky","metrics":{"FID":"8.03"},"uses_additional_data":false,"paper_date":"2023-10-05","paper":"/paper/kandinsky-an-improved-text-to-image-synthesis","paper_url":"https://arxiv.org/abs/2310.03502v1","paper_title":"Kandinsky: an Improved Text-to-Image Synthesis with Image Prior and Latent Diffusion","code":"https://github.com/ai-forever/Kandinsky-2","n_code_links":1,"syntology":{"n_ran":12,"n_unverified":6,"n_samples":18,"n_pointer_only_licence":10}},{"rank_in_archive_order":20,"model":"Lafite","metrics":{"FID":"8.12","Inception score":"32.34","SOA-C":"61.09"},"uses_additional_data":false,"paper_date":"2021-11-27","paper":"/paper/lafite-towards-language-free-training-for","paper_url":"https://arxiv.org/abs/2111.13792v3","paper_title":"LAFITE: Towards Language-Free Training for Text-to-Image Generation","code":"https://github.com/drboog/Lafite","n_code_links":3,"syntology":{"n_ran":4,"n_unverified":14,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"SiD-LSG (Data-free distillation, zero-shot FID)","metrics":{"FID":"8.15","Zero shot FID":"8.15"},"uses_additional_data":false,"paper_date":"2024-06-03","paper":"/paper/long-and-short-guidance-in-score-identity","paper_url":"https://arxiv.org/abs/2406.01561v3","paper_title":"Long and Short Guidance in Score identity Distillation for One-Step Text-to-Image Generation","code":"https://github.com/mingyuanzhou/sid","n_code_links":2,"syntology":{"n_ran":18,"n_unverified":6,"n_samples":24,"n_pointer_only_licence":2}},{"rank_in_archive_order":22,"model":"simple diffusion (U-ViT)","metrics":{"FID":"8.3"},"uses_additional_data":false,"paper_date":"2023-01-26","paper":"/paper/simple-diffusion-end-to-end-diffusion-for","paper_url":"https://arxiv.org/abs/2301.11093v2","paper_title":"Simple diffusion: End-to-end diffusion for high resolution images","code":"https://github.com/fashn-AI/tryondiffusion","n_code_links":1,"syntology":null},{"rank_in_archive_order":23,"model":"GigaGAN (Zero-shot, 256x256)","metrics":{"FID":"9.09"},"uses_additional_data":false,"paper_date":"2023-03-09","paper":"/paper/scaling-up-gans-for-text-to-image-synthesis","paper_url":"https://arxiv.org/abs/2303.05511v2","paper_title":"Scaling up GANs for Text-to-Image Synthesis","code":"https://github.com/lucidrains/gigagan-pytorch","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":6,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":24,"model":"XMC-GAN (256 x 256)","metrics":{"FID":"9.3","Inception score":"30.5"},"uses_additional_data":false,"paper_date":"2021-11-24","paper":"/paper/nuwa-visual-synthesis-pre-training-for-neural","paper_url":"https://arxiv.org/abs/2111.12417v1","paper_title":"NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion","code":"https://github.com/lucidrains/nuwa-pytorch","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":25,"model":"XMC-GAN","metrics":{"FID":"9.33"},"uses_additional_data":true,"paper_date":"2021-01-12","paper":"/paper/cross-modal-contrastive-learning-for-text-to","paper_url":"https://arxiv.org/abs/2101.04702v5","paper_title":"Cross-Modal Contrastive Learning for Text-to-Image Generation","code":"https://github.com/google-research/xmcgan_image_generation","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":26,"model":"DALL-E 2","metrics":{"FID":"10.39"},"uses_additional_data":true,"paper_date":"2022-04-13","paper":"/paper/hierarchical-text-conditional-image","paper_url":"https://arxiv.org/abs/2204.06125v1","paper_title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","code":"https://github.com/lucidrains/DALLE2-pytorch","n_code_links":8,"syntology":{"n_ran":29,"n_unverified":9,"n_samples":38,"n_pointer_only_licence":1}},{"rank_in_archive_order":27,"model":"Corgi-Semi","metrics":{"FID":"10.6"},"uses_additional_data":false,"paper_date":"2022-11-24","paper":"/paper/shifted-diffusion-for-text-to-image","paper_url":"https://arxiv.org/abs/2211.15388v2","paper_title":"Shifted Diffusion for Text-to-image Generation","code":"https://github.com/drboog/Shifted_Diffusion","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":10,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":28,"model":"Corgi","metrics":{"FID":"10.88"},"uses_additional_data":false,"paper_date":"2022-11-24","paper":"/paper/shifted-diffusion-for-text-to-image","paper_url":"https://arxiv.org/abs/2211.15388v2","paper_title":"Shifted Diffusion for Text-to-image Generation","code":"https://github.com/drboog/Shifted_Diffusion","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":10,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":29,"model":"TR0N (StyleGAN-XL, LAION2BCLIP, BLIP-2, zero-shot)","metrics":{"FID":"10.9"},"uses_additional_data":false,"paper_date":"2023-04-26","paper":"/paper/tr0n-translator-networks-for-0-shot-plug-and","paper_url":"https://arxiv.org/abs/2304.13742v1","paper_title":"TR0N: Translator Networks for 0-Shot Plug-and-Play Conditional Generation","code":"https://github.com/layer6ai-labs/fusemix","n_code_links":2,"syntology":{"n_ran":9,"n_unverified":10,"n_samples":19,"n_pointer_only_licence":1}},{"rank_in_archive_order":30,"model":"Make-a-Scene (unfiltered)","metrics":{"FID":"11.84"},"uses_additional_data":true,"paper_date":"2022-03-24","paper":"/paper/make-a-scene-scene-based-text-to-image","paper_url":"https://arxiv.org/abs/2203.13131v1","paper_title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","code":"https://github.com/CasualGANPapers/Make-A-Scene","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":31,"model":"GLIDE (zero-shot)","metrics":{"FID":"12.24"},"uses_additional_data":true,"paper_date":"2021-12-20","paper":"/paper/glide-towards-photorealistic-image-generation","paper_url":"https://arxiv.org/abs/2112.10741v3","paper_title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","code":"https://github.com/openai/glide-text2im","n_code_links":2,"syntology":{"n_ran":9,"n_unverified":6,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":32,"model":"KNN-Diffusion","metrics":{"FID":"12.5"},"uses_additional_data":false,"paper_date":"2022-04-06","paper":"/paper/knn-diffusion-image-generation-via-large","paper_url":"https://arxiv.org/abs/2204.02849v2","paper_title":"KNN-Diffusion: Image Generation via Large-Scale Retrieval","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":33,"model":"GALIP (CC12m)","metrics":{"FID":"12.54"},"uses_additional_data":false,"paper_date":"2023-01-30","paper":"/paper/galip-generative-adversarial-clips-for-text","paper_url":"https://arxiv.org/abs/2301.12959v1","paper_title":"GALIP: Generative Adversarial CLIPs for Text-to-Image Synthesis","code":"https://github.com/tobran/DF-GAN","n_code_links":2,"syntology":{"n_ran":7,"n_unverified":4,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":34,"model":"Latent Diffusion (LDM-KL-8-G)","metrics":{"FID":"12.63"},"uses_additional_data":true,"paper_date":"2021-12-20","paper":"/paper/high-resolution-image-synthesis-with-latent","paper_url":"https://arxiv.org/abs/2112.10752v2","paper_title":"High-Resolution Image Synthesis with Latent Diffusion Models","code":"https://github.com/compvis/stable-diffusion","n_code_links":41,"syntology":{"n_ran":19,"n_unverified":9,"n_samples":28,"n_pointer_only_licence":5}},{"rank_in_archive_order":35,"model":"Stable Diffusion","metrics":{"FID":"12.63"},"uses_additional_data":false,"paper_date":"2022-11-22","paper":"/paper/retrieval-augmented-multimodal-language","paper_url":"https://arxiv.org/abs/2211.12561v2","paper_title":"Retrieval-Augmented Multimodal Language Modeling","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":36,"model":"NÜWA (256 x 256)","metrics":{"FID":"12.9","Inception score":" 27.2"},"uses_additional_data":false,"paper_date":"2021-11-24","paper":"/paper/nuwa-visual-synthesis-pre-training-for-neural","paper_url":"https://arxiv.org/abs/2111.12417v1","paper_title":"NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion","code":"https://github.com/lucidrains/nuwa-pytorch","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":37,"model":"VQ-Diffusion-F","metrics":{"FID":"13.86"},"uses_additional_data":true,"paper_date":"2021-11-29","paper":"/paper/vector-quantized-diffusion-model-for-text-to","paper_url":"https://arxiv.org/abs/2111.14822v3","paper_title":"Vector Quantized Diffusion Model for Text-to-Image Synthesis","code":"https://github.com/microsoft/vq-diffusion","n_code_links":2,"syntology":null},{"rank_in_archive_order":38,"model":"StyleGAN-T (Zero-shot, 256x256)","metrics":{"FID":"13.9"},"uses_additional_data":false,"paper_date":"2023-01-23","paper":"/paper/stylegan-t-unlocking-the-power-of-gans-for","paper_url":"https://arxiv.org/abs/2301.09515v1","paper_title":"StyleGAN-T: Unlocking the Power of GANs for Fast Large-Scale Text-to-Image Synthesis","code":"https://github.com/autonomousvision/stylegan-t","n_code_links":1,"syntology":null},{"rank_in_archive_order":39,"model":"RAT-GAN","metrics":{"FID":"14.6"},"uses_additional_data":false,"paper_date":"2022-04-22","paper":"/paper/recurrent-affine-transformation-for-text-to","paper_url":"https://arxiv.org/abs/2204.10482v1","paper_title":"Recurrent Affine Transformation for Text-to-image Synthesis","code":"https://github.com/senmaoy/recurrent-affine-transformation-for-text-to-image-synthesis","n_code_links":2,"syntology":null},{"rank_in_archive_order":40,"model":"ERNIE-ViLG","metrics":{"FID":"14.7"},"uses_additional_data":false,"paper_date":"2021-12-31","paper":"/paper/ernie-vilg-unified-generative-pre-training","paper_url":"https://arxiv.org/abs/2112.15283v1","paper_title":"ERNIE-ViLG: Unified Generative Pre-training for Bidirectional Vision-Language Generation","code":"https://github.com/PaddlePaddle/PaddleNLP/tree/develop/pipelines/examples/text_to_image","n_code_links":2,"syntology":null},{"rank_in_archive_order":41,"model":"RA-CM3 (2.7B)","metrics":{"FID":"15.7"},"uses_additional_data":false,"paper_date":"2022-11-22","paper":"/paper/retrieval-augmented-multimodal-language","paper_url":"https://arxiv.org/abs/2211.12561v2","paper_title":"Retrieval-Augmented Multimodal Language Modeling","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":42,"model":"CogView2(6B, Finetuned)","metrics":{"FID":"17.7"},"uses_additional_data":false,"paper_date":"2022-04-28","paper":"/paper/cogview2-faster-and-better-text-to-image","paper_url":"https://arxiv.org/abs/2204.14217v2","paper_title":"CogView2: Faster and Better Text-to-Image Generation via Hierarchical Transformers","code":"https://github.com/thudm/cogview2","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":8,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":43,"model":"VQ-Diffusion-B","metrics":{"FID":"19.75"},"uses_additional_data":true,"paper_date":"2021-11-29","paper":"/paper/vector-quantized-diffusion-model-for-text-to","paper_url":"https://arxiv.org/abs/2111.14822v3","paper_title":"Vector Quantized Diffusion Model for Text-to-Image Synthesis","code":"https://github.com/microsoft/vq-diffusion","n_code_links":2,"syntology":null},{"rank_in_archive_order":44,"model":"DM-GAN+CL","metrics":{"FID":"20.79","Inception score":"33.34"},"uses_additional_data":false,"paper_date":"2021-07-06","paper":"/paper/improving-text-to-image-synthesis-using","paper_url":"https://arxiv.org/abs/2107.02423v2","paper_title":"Improving Text-to-Image Synthesis Using Contrastive Learning","code":"https://github.com/huiyegit/T2I_CL","n_code_links":1,"syntology":null},{"rank_in_archive_order":45,"model":"FuseDream (few-shot, k=5)","metrics":{"FID":"21.16","Inception score":"34.26"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/fusedream-training-free-text-to-image","paper_url":"https://arxiv.org/abs/2112.01573v1","paper_title":"FuseDream: Training-Free Text-to-Image Generation with Improved CLIP+GAN Space Optimization","code":"https://github.com/gnobitab/fusedream","n_code_links":1,"syntology":null},{"rank_in_archive_order":46,"model":"FuseDream (k=5, 256)","metrics":{"FID":"21.16","Inception score":"34.26"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/fusedream-training-free-text-to-image","paper_url":"https://arxiv.org/abs/2112.01573v1","paper_title":"FuseDream: Training-Free Text-to-Image Generation with Improved CLIP+GAN Space Optimization","code":"https://github.com/gnobitab/fusedream","n_code_links":1,"syntology":null},{"rank_in_archive_order":47,"model":"FuseDream (k=10, 256)","metrics":{"FID":"21.89","Inception score":"34.67"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/fusedream-training-free-text-to-image","paper_url":"https://arxiv.org/abs/2112.01573v1","paper_title":"FuseDream: Training-Free Text-to-Image Generation with Improved CLIP+GAN Space Optimization","code":"https://github.com/gnobitab/fusedream","n_code_links":1,"syntology":null},{"rank_in_archive_order":48,"model":"AttnGAN+CL","metrics":{"FID":"23.93","Inception score":"25.70"},"uses_additional_data":false,"paper_date":"2021-07-06","paper":"/paper/improving-text-to-image-synthesis-using","paper_url":"https://arxiv.org/abs/2107.02423v2","paper_title":"Improving Text-to-Image Synthesis Using Contrastive Learning","code":"https://github.com/huiyegit/T2I_CL","n_code_links":1,"syntology":null},{"rank_in_archive_order":49,"model":"CogView2(6B, Finetuned)","metrics":{"FID":"24"},"uses_additional_data":false,"paper_date":"2022-04-28","paper":"/paper/cogview2-faster-and-better-text-to-image","paper_url":"https://arxiv.org/abs/2204.14217v2","paper_title":"CogView2: Faster and Better Text-to-Image Generation via Hierarchical Transformers","code":"https://github.com/thudm/cogview2","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":8,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":50,"model":"OP-GAN","metrics":{"FID":"24.70","Inception score":"27.88","SOA-C":"35.85"},"uses_additional_data":false,"paper_date":"2019-10-29","paper":"/paper/191013321","paper_url":"https://arxiv.org/abs/1910.13321v2","paper_title":"Semantic Object Accuracy for Generative Text-to-Image Synthesis","code":"https://github.com/tohinz/multiple-objects-gan","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":19,"n_samples":23,"n_pointer_only_licence":0}},{"rank_in_archive_order":51,"model":"DM-GAN (256 x 256)","metrics":{"FID":" 26.0","Inception score":"32.2"},"uses_additional_data":false,"paper_date":"2021-11-24","paper":"/paper/nuwa-visual-synthesis-pre-training-for-neural","paper_url":"https://arxiv.org/abs/2111.12417v1","paper_title":"NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion","code":"https://github.com/lucidrains/nuwa-pytorch","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":52,"model":"Lafite (zero-shot)","metrics":{"FID":"26.94","FID-1":"22.97","FID-2":"18.70","FID-4":"15.72","FID-8":"14.79","Inception score":"26.02"},"uses_additional_data":false,"paper_date":"2021-11-27","paper":"/paper/lafite-towards-language-free-training-for","paper_url":"https://arxiv.org/abs/2111.13792v3","paper_title":"LAFITE: Towards Language-Free Training for Text-to-Image Generation","code":"https://github.com/drboog/Lafite","n_code_links":3,"syntology":{"n_ran":4,"n_unverified":14,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":53,"model":"CogView","metrics":{"FID":"27.1","FID-1":"19.4","FID-2":"13.9","FID-4":"19.4","FID-8":"23.6","Inception score":"18.2"},"uses_additional_data":true,"paper_date":"2021-05-26","paper":"/paper/cogview-mastering-text-to-image-generation","paper_url":"https://arxiv.org/abs/2105.13290v3","paper_title":"CogView: Mastering Text-to-Image Generation via Transformers","code":"https://github.com/thudm/visualglm-6b","n_code_links":4,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":54,"model":"CogView (256 x 256)","metrics":{"FID":" 27.1","Inception score":"18.2"},"uses_additional_data":false,"paper_date":"2021-11-24","paper":"/paper/nuwa-visual-synthesis-pre-training-for-neural","paper_url":"https://arxiv.org/abs/2111.12417v1","paper_title":"NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion","code":"https://github.com/lucidrains/nuwa-pytorch","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":55,"model":"DALL-E (256 x 256)","metrics":{"FID":"27.5","Inception score":"17.9"},"uses_additional_data":false,"paper_date":"2021-11-24","paper":"/paper/nuwa-visual-synthesis-pre-training-for-neural","paper_url":"https://arxiv.org/abs/2111.12417v1","paper_title":"NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion","code":"https://github.com/lucidrains/nuwa-pytorch","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":56,"model":"DALL-E (12B)","metrics":{"FID":"28"},"uses_additional_data":false,"paper_date":"2022-11-22","paper":"/paper/retrieval-augmented-multimodal-language","paper_url":"https://arxiv.org/abs/2211.12561v2","paper_title":"Retrieval-Augmented Multimodal Language Modeling","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":57,"model":"AttnGAN + VICTR","metrics":{"FID":"29.26","Inception score":"28.18"},"uses_additional_data":false,"paper_date":"2020-10-07","paper":"/paper/victr-visual-information-captured-text","paper_url":"https://arxiv.org/abs/2010.03182v3","paper_title":"VICTR: Visual Information Captured Text Representation for Text-to-Image Multimodal Tasks","code":"https://github.com/usydnlp/VICTR","n_code_links":1,"syntology":null},{"rank_in_archive_order":58,"model":"Vanilla CM3","metrics":{"FID":"29.5"},"uses_additional_data":false,"paper_date":"2022-11-22","paper":"/paper/retrieval-augmented-multimodal-language","paper_url":"https://arxiv.org/abs/2211.12561v2","paper_title":"Retrieval-Augmented Multimodal Language Modeling","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":59,"model":"DM-GAN + VICTR","metrics":{"FID":"32.37","Inception score":"32.37"},"uses_additional_data":false,"paper_date":"2020-10-07","paper":"/paper/victr-visual-information-captured-text","paper_url":"https://arxiv.org/abs/2010.03182v3","paper_title":"VICTR: Visual Information Captured Text Representation for Text-to-Image Multimodal Tasks","code":"https://github.com/usydnlp/VICTR","n_code_links":1,"syntology":null},{"rank_in_archive_order":60,"model":"DM-GAN","metrics":{"FID":"32.64","Inception score":"30.49","SOA-C":"33.44"},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/dm-gan-dynamic-memory-generative-adversarial","paper_url":"http://arxiv.org/abs/1904.01310v1","paper_title":"DM-GAN: Dynamic Memory Generative Adversarial Networks for Text-to-Image Synthesis","code":"https://github.com/MinfengZhu/DM-GAN","n_code_links":4,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":61,"model":"AttnGAN + OP","metrics":{"FID":"33.35","Inception score":"24.76","SOA-C":"25.46"},"uses_additional_data":false,"paper_date":"2019-01-03","paper":"/paper/generating-multiple-objects-at-spatially","paper_url":"http://arxiv.org/abs/1901.00686v1","paper_title":"Generating Multiple Objects at Spatially Distinct Locations","code":"https://github.com/tohinz/multiple-objects-gan","n_code_links":1,"syntology":null},{"rank_in_archive_order":62,"model":"AttnGAN (256 x 256)","metrics":{"FID":" 35.2","Inception score":"23.3"},"uses_additional_data":false,"paper_date":"2021-11-24","paper":"/paper/nuwa-visual-synthesis-pre-training-for-neural","paper_url":"https://arxiv.org/abs/2111.12417v1","paper_title":"NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion","code":"https://github.com/lucidrains/nuwa-pytorch","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":63,"model":"L-Verse-CC","metrics":{"FID":"37.2","FID-1":"31.6","FID-2":"25.7","FID-4":"21.4","FID-8":"21.1"},"uses_additional_data":false,"paper_date":"2021-11-22","paper":"/paper/l-verse-bidirectional-generation-between","paper_url":"https://arxiv.org/abs/2111.11133v10","paper_title":"L-Verse: Bidirectional Generation Between Image and Text","code":"https://github.com/tgisaturday/L-Verse","n_code_links":1,"syntology":null},{"rank_in_archive_order":64,"model":"L-Verse","metrics":{"FID":"45.8","FID-1":"41.9","FID-2":"35.5","FID-4":"30.2","FID-8":"29.83"},"uses_additional_data":false,"paper_date":"2021-11-22","paper":"/paper/l-verse-bidirectional-generation-between","paper_url":"https://arxiv.org/abs/2111.11133v10","paper_title":"L-Verse: Bidirectional Generation Between Image and Text","code":"https://github.com/tgisaturday/L-Verse","n_code_links":1,"syntology":null},{"rank_in_archive_order":65,"model":"StackGAN + OP","metrics":{"FID":"55.30","Inception score":"12.12"},"uses_additional_data":false,"paper_date":"2019-01-03","paper":"/paper/generating-multiple-objects-at-spatially","paper_url":"http://arxiv.org/abs/1901.00686v1","paper_title":"Generating Multiple Objects at Spatially Distinct Locations","code":"https://github.com/tohinz/multiple-objects-gan","n_code_links":1,"syntology":null},{"rank_in_archive_order":66,"model":"StackGAN-v1","metrics":{"FID":"74.05","Inception score":"8.45"},"uses_additional_data":false,"paper_date":"2017-10-19","paper":"/paper/stackgan-realistic-image-synthesis-with","paper_url":"http://arxiv.org/abs/1710.10916v3","paper_title":"StackGAN++: Realistic Image Synthesis with Stacked Generative Adversarial Networks","code":"https://github.com/hanzhanggit/StackGAN","n_code_links":16,"syntology":{"n_ran":10,"n_unverified":21,"n_samples":31,"n_pointer_only_licence":0}},{"rank_in_archive_order":67,"model":"DF-GAN (256 x 256)","metrics":{"Inception score":"18.7"},"uses_additional_data":false,"paper_date":"2021-11-24","paper":"/paper/nuwa-visual-synthesis-pre-training-for-neural","paper_url":"https://arxiv.org/abs/2111.12417v1","paper_title":"NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion","code":"https://github.com/lucidrains/nuwa-pytorch","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":68,"model":"StackGAN + VICTR","metrics":{"Inception score":"10.38"},"uses_additional_data":false,"paper_date":"2020-10-07","paper":"/paper/victr-visual-information-captured-text","paper_url":"https://arxiv.org/abs/2010.03182v3","paper_title":"VICTR: Visual Information Captured Text Representation for Text-to-Image Multimodal Tasks","code":"https://github.com/usydnlp/VICTR","n_code_links":1,"syntology":null},{"rank_in_archive_order":69,"model":"ChatPainter","metrics":{"Inception score":"9.74"},"uses_additional_data":false,"paper_date":"2018-02-22","paper":"/paper/chatpainter-improving-text-to-image","paper_url":"http://arxiv.org/abs/1802.08216v1","paper_title":"ChatPainter: Improving Text to Image Generation using Dialogue","code":null,"n_code_links":0,"syntology":null}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":37,"rows_with_any_sample_ran":35,"distinct_papers_with_graph_line":23,"distinct_papers_with_any_sample_ran":22,"samples_over_distinct_papers":{"n_ran":172,"n_unverified":148,"n_samples":320,"n_pointer_only_licence":40,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":220,"n_unverified":188,"n_samples":408,"n_pointer_only_licence":55,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}