{"url":"/task/text-to-image-generation","name":"Text-to-Image Generation","slug":"text-to-image-generation","description_markdown":"The development of the brain's blood supply in an embryo involves a complex process with several stages. Initially, there is a network of connections between the carotid and basilar artery systems that usually disappear during development. However, in some cases, these connections remain, leading to variations in the adult cerebral circulation. Around the 24th day of embryonic life (at the 3 mm embryonic stage), the internal carotid arteries (ICA) emerge. They are formed from a combination of the 3rd branchial arch arteries and the distal segments of the paired dorsal aortae. The ICA initially provides all the blood needed by the developing brain. As the brain grows, particularly the occipital region, brainstem, and cerebellum, the blood supply from the ICA becomes insufficient, prompting the development of the posterior circulation. At this stage (4-5 mm embryonic stage), the posterior circulation, specifically the hindbrain, is supplied by two longitudinal neural arteries. These arteries receive blood from several temporary connections (anastomoses) with the ICA, including: Trigeminal artery (TA), Otic artery (OA), Hypoglossal artery (HA), Proatlantal artery (ProA). These carotid-vertebrobasilar anastomoses act as temporary bridges, providing blood flow to the developing posterior circulation until the vertebral arteries (VA) and the basilar artery (BA) are fully formed.6\r\n\r\nThe BA forms between the 5-8 mm stage by the fusion of the longitudinal neural arteries. As the posterior communicating artery develops and connects with the distal BA, the TA, OA, and HA typically regress. Unlike the TA, OA, and HA, the ProA persists until the VA are fully developed. A segment of the ProA becomes incorporated into the V3 segment of the VA and the distal portions of the occipital artery. The VA develop between the 7-12 mm stage from transverse connections between cervical intersegmental arteries, starting with the ProA and progressing downwards to the 6th intersegmental artery. This 6th intersegmental artery eventually forms the origin of the adult VA from the subclavian artery. 7-8\r\n\r\nPersistence of the HA into adulthood, the focus of this discussion, is a rare occurrence. It is the second most common persistent carotid-vertebrobasilar anastomosis, following the persistent trigeminal artery. The failure of the HA to regress during embryological development leads to PPHA. This condition can impact the normal blood flow dynamics in the brain and, in certain cases, can be associated with cerebrovascular issues like aneurysms or ischemic events.","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":1085,"papers_with_code":546,"benchmarks":17,"benchmark_tables_in_archive":17,"benchmark_tables_shown":17,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":25,"subtasks":7,"parent_tasks":3},"benchmarks":[{"leaderboard":"/sota/text-to-image-generation-on-coco","slug":"text-to-image-generation-on-coco","dataset":"COCO (Common Objects in Context)","dataset_url":"/dataset/coco","rows_in_archive":69,"metrics":["FID","Inception score","FID-1","FID-2","FID-4","FID-8","SOA-C","Zero shot FID"],"first_row_in_archive_order":{"model":"RAT-Diffusion","paper_title":"Data Extrapolation for Text-to-image Generation on Small Datasets","paper_url":"/paper/data-extrapolation-for-text-to-image","paper_date":"2024-10-02","arxiv_id":"2410.01638","code_links":[{"title":"senmaoy/RAT-Diffusion","url":"https://github.com/senmaoy/RAT-Diffusion"}],"syntology":null}},{"leaderboard":"/sota/text-to-image-generation-on-cub","slug":"text-to-image-generation-on-cub","dataset":"CUB","dataset_url":"/dataset/cub-200-2011","rows_in_archive":20,"metrics":["FID","Inception score"],"first_row_in_archive_order":{"model":"RAT-Diffusion","paper_title":"Data Extrapolation for Text-to-image Generation on Small Datasets","paper_url":"/paper/data-extrapolation-for-text-to-image","paper_date":"2024-10-02","arxiv_id":"2410.01638","code_links":[{"title":"senmaoy/RAT-Diffusion","url":"https://github.com/senmaoy/RAT-Diffusion"}],"syntology":null}},{"leaderboard":"/sota/text-to-image-generation-on-geneval","slug":"text-to-image-generation-on-geneval","dataset":"GenEval","dataset_url":"/dataset/geneval","rows_in_archive":20,"metrics":["Overall","Single Obj.","Two Obj.","Color Attri.","Colors","Counting","Position"],"first_row_in_archive_order":{"model":"SD3.5-Medium+Flow-GRPO","paper_title":"Flow-GRPO: Training Flow Matching Models via Online RL","paper_url":"/paper/flow-grpo-training-flow-matching-models-via","paper_date":"2025-05-08","arxiv_id":"2505.05470","code_links":[{"title":"yifan123/flow_grpo","url":"https://github.com/yifan123/flow_grpo"}],"syntology":{"n":9,"n_ran":1,"n_unverified":8,"n_pointer_only":0}}},{"leaderboard":"/sota/text-to-image-generation-on-multi-modal","slug":"text-to-image-generation-on-multi-modal","dataset":"Multi-Modal-CelebA-HQ","dataset_url":"/dataset/multi-modal-celeba-hq-1","rows_in_archive":10,"metrics":["FID","LPIPS","Acc","Real"],"first_row_in_archive_order":{"model":"Swinv2-Imagen","paper_title":"Swinv2-Imagen: Hierarchical Vision Transformer Diffusion Models for Text-to-Image Generation","paper_url":"/paper/swinv2-imagen-hierarchical-vision-transformer","paper_date":"2022-10-18","arxiv_id":"2210.09549","code_links":[],"syntology":null}},{"leaderboard":"/sota/text-to-image-generation-on-drawbench","slug":"text-to-image-generation-on-drawbench","dataset":"DrawBench","dataset_url":"/dataset/drawbench","rows_in_archive":8,"metrics":["Aesthetics (Laion Aesthtetics Predictor)","Human Preference Alignement (HPSv2)","Text Alignement (SentenceBERT)"],"first_row_in_archive_order":{"model":"LCM (Curriculum DPO)","paper_title":"Curriculum Direct Preference Optimization for Diffusion and Consistency Models","paper_url":"/paper/curriculum-direct-preference-optimization-for","paper_date":"2024-05-22","arxiv_id":"2405.13637","code_links":[{"title":"croitorualin/curriculum-dpo","url":"https://github.com/croitorualin/curriculum-dpo"}],"syntology":{"n":8,"n_ran":3,"n_unverified":5,"n_pointer_only":8}}},{"leaderboard":"/sota/text-to-image-generation-on-oxford-102","slug":"text-to-image-generation-on-oxford-102","dataset":"Oxford 102 Flowers","dataset_url":"/dataset/oxford-102-flower","rows_in_archive":8,"metrics":["FID","Inception score"],"first_row_in_archive_order":{"model":"RAT-Diffusion","paper_title":"Data Extrapolation for Text-to-image Generation on Small Datasets","paper_url":"/paper/data-extrapolation-for-text-to-image","paper_date":"2024-10-02","arxiv_id":"2410.01638","code_links":[{"title":"senmaoy/RAT-Diffusion","url":"https://github.com/senmaoy/RAT-Diffusion"}],"syntology":null}},{"leaderboard":"/sota/text-to-image-generation-on-conceptual","slug":"text-to-image-generation-on-conceptual","dataset":"Conceptual Captions","dataset_url":"/dataset/conceptual-captions","rows_in_archive":5,"metrics":["FID"],"first_row_in_archive_order":{"model":"Contextual RQ-Transformer","paper_title":"Draft-and-Revise: Effective Image Generation with Contextual RQ-Transformer","paper_url":"/paper/draft-and-revise-effective-image-generation","paper_date":"2022-06-09","arxiv_id":"2206.04452","code_links":[],"syntology":null}},{"leaderboard":"/sota/text-to-image-generation-on-coco-1","slug":"text-to-image-generation-on-coco-1","dataset":"COCO","dataset_url":null,"rows_in_archive":3,"metrics":["FID"],"first_row_in_archive_order":{"model":"Parti Finetuned","paper_title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","paper_url":"/paper/scaling-autoregressive-models-for-content","paper_date":"2022-06-22","arxiv_id":"2206.10789","code_links":[{"title":"lucidrains/parti-pytorch","url":"https://github.com/lucidrains/parti-pytorch"},{"title":"syang-lab/Pathway_Autoregressive_Text2Image_Model","url":"https://github.com/syang-lab/Pathway_Autoregressive_Text2Image_Model"}],"syntology":{"n":9,"n_ran":3,"n_unverified":6,"n_pointer_only":3}}},{"leaderboard":"/sota/text-to-image-generation-on-lhqc","slug":"text-to-image-generation-on-lhqc","dataset":"LHQC","dataset_url":"/dataset/lhq","rows_in_archive":3,"metrics":["Block-FID"],"first_row_in_archive_order":{"model":"NUWA-Infinity","paper_title":"NUWA-Infinity: Autoregressive over Autoregressive Generation for Infinite Visual Synthesis","paper_url":"/paper/nuwa-infinity-autoregressive-over","paper_date":"2022-07-20","arxiv_id":"2207.09814","code_links":[{"title":"microsoft/nuwa","url":"https://github.com/microsoft/nuwa"}],"syntology":null}},{"leaderboard":"/sota/text-to-image-generation-on-dpg","slug":"text-to-image-generation-on-dpg","dataset":"DPG","dataset_url":null,"rows_in_archive":2,"metrics":["Overall"],"first_row_in_archive_order":{"model":"Lumina-Image 2.0","paper_title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","paper_url":"/paper/lumina-image-2-0-a-unified-and-efficient","paper_date":"2025-03-27","arxiv_id":"2503.21758","code_links":[{"title":"alpha-vllm/lumina-image-2.0","url":"https://github.com/alpha-vllm/lumina-image-2.0"}],"syntology":{"n":16,"n_ran":7,"n_unverified":9,"n_pointer_only":0}}},{"leaderboard":"/sota/text-to-image-generation-on-geneva-codraw","slug":"text-to-image-generation-on-geneva-codraw","dataset":"GeNeVA (CoDraw)","dataset_url":null,"rows_in_archive":2,"metrics":["F1-score","rsim"],"first_row_in_archive_order":{"model":"LatteGAN","paper_title":"LatteGAN: Visually Guided Language Attention for Multi-Turn Text-Conditioned Image Manipulation","paper_url":"/paper/lattegan-visually-guided-language-attention","paper_date":"2021-12-28","arxiv_id":"2112.13985","code_links":[{"title":"smatsumori/lattegan","url":"https://github.com/smatsumori/lattegan"}],"syntology":null}},{"leaderboard":"/sota/text-to-image-generation-on-geneva-i-clevr","slug":"text-to-image-generation-on-geneva-i-clevr","dataset":"GeNeVA (i-CLEVR)","dataset_url":null,"rows_in_archive":2,"metrics":["F1-score","rsim"],"first_row_in_archive_order":{"model":"LatteGAN","paper_title":"LatteGAN: Visually Guided Language Attention for Multi-Turn Text-Conditioned Image Manipulation","paper_url":"/paper/lattegan-visually-guided-language-attention","paper_date":"2021-12-28","arxiv_id":"2112.13985","code_links":[{"title":"smatsumori/lattegan","url":"https://github.com/smatsumori/lattegan"}],"syntology":null}},{"leaderboard":"/sota/text-to-image-generation-on-laion-coco","slug":"text-to-image-generation-on-laion-coco","dataset":"LAION COCO","dataset_url":"/dataset/laion-coco","rows_in_archive":2,"metrics":["FID"],"first_row_in_archive_order":{"model":"Parti Finetuned","paper_title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","paper_url":"/paper/scaling-autoregressive-models-for-content","paper_date":"2022-06-22","arxiv_id":"2206.10789","code_links":[{"title":"lucidrains/parti-pytorch","url":"https://github.com/lucidrains/parti-pytorch"},{"title":"syang-lab/Pathway_Autoregressive_Text2Image_Model","url":"https://github.com/syang-lab/Pathway_Autoregressive_Text2Image_Model"}],"syntology":{"n":9,"n_ran":3,"n_unverified":6,"n_pointer_only":3}}},{"leaderboard":"/sota/text-to-image-generation-on-ms-coco","slug":"text-to-image-generation-on-ms-coco","dataset":"MS-COCO","dataset_url":"/dataset/coco","rows_in_archive":2,"metrics":["Inception score","FID","SOA-C"],"first_row_in_archive_order":{"model":"AttnGAN","paper_title":"AttnGAN: Fine-Grained Text to Image Generation with Attentional Generative Adversarial Networks","paper_url":"/paper/attngan-fine-grained-text-to-image-generation","paper_date":"2017-11-28","arxiv_id":"1711.10485","code_links":[{"title":"taoxugit/AttnGAN","url":"https://github.com/taoxugit/AttnGAN"},{"title":"davidstap/AttnGAN","url":"https://github.com/davidstap/AttnGAN"},{"title":"sidward14/Style-AttnGAN","url":"https://github.com/sidward14/Style-AttnGAN"},{"title":"huiyegit/T2I_CL","url":"https://github.com/huiyegit/T2I_CL"},{"title":"Shuvrajit9904/PairedCycleGAN-tf","url":"https://github.com/Shuvrajit9904/PairedCycleGAN-tf"},{"title":"taki0112/AttnGAN-Tensorflow","url":"https://github.com/taki0112/AttnGAN-Tensorflow"},{"title":"komiya-m/MirrorGAN","url":"https://github.com/komiya-m/MirrorGAN"},{"title":"bprabhakar/text-to-image","url":"https://github.com/bprabhakar/text-to-image"},{"title":"oxygenlu/ratlip","url":"https://github.com/oxygenlu/ratlip"},{"title":"pioneerAlpha/BanglaText2ImageGeneration","url":"https://github.com/pioneerAlpha/BanglaText2ImageGeneration"},{"title":"aleksey-egorov/attngan","url":"https://github.com/aleksey-egorov/attngan"},{"title":"priscillalui/StackGAN-Stories","url":"https://github.com/priscillalui/StackGAN-Stories"},{"title":"ChihchengHsieh/AttnGAN_Implementation","url":"https://github.com/ChihchengHsieh/AttnGAN_Implementation"},{"title":"roxanasoto/AttGanESRGAN","url":"https://github.com/roxanasoto/AttGanESRGAN"},{"title":"Maymaher/StackGANv2","url":"https://github.com/Maymaher/StackGANv2"},{"title":"Vigneshthanga/stackGAN-v2","url":"https://github.com/Vigneshthanga/stackGAN-v2"},{"title":"ucsd-ml-arts/ml-art-final-jeffrey","url":"https://github.com/ucsd-ml-arts/ml-art-final-jeffrey"},{"title":"rightlit/cycle-image-gan-rev","url":"https://github.com/rightlit/cycle-image-gan-rev"},{"title":"alexmotogna/generatorapi","url":"https://github.com/alexmotogna/generatorapi"},{"title":"alexmotogna/attngan","url":"https://github.com/alexmotogna/attngan"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/text-to-image-generation-on-t2i-compbench","slug":"text-to-image-generation-on-t2i-compbench","dataset":"T2I-CompBench","dataset_url":"/dataset/t2i-compbench","rows_in_archive":2,"metrics":["Color","Shape","Texture","Complex","Non-Spatial","Spatial"],"first_row_in_archive_order":{"model":"Emu3","paper_title":"Emu3: Next-Token Prediction is All You Need","paper_url":"/paper/emu3-next-token-prediction-is-all-you-need","paper_date":"2024-09-27","arxiv_id":"2409.18869","code_links":[{"title":"baaivision/emu3","url":"https://github.com/baaivision/emu3"},{"title":"flagopen/flagscale","url":"https://github.com/flagopen/flagscale"}],"syntology":{"n":6,"n_ran":3,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/text-to-image-generation-on-colors","slug":"text-to-image-generation-on-colors","dataset":"Colors","dataset_url":"/dataset/colors","rows_in_archive":1,"metrics":["Validation Accuracy"],"first_row_in_archive_order":{"model":"BiLSTMS on color generation","paper_title":"Generation Of Colors using Bidirectional Long Short Term Memory Networks","paper_url":"/paper/generation-of-colors-using-bidirectional-long","paper_date":"2023-11-11","arxiv_id":"2311.06542","code_links":[{"title":"chungimungi/Generation-of-Colors-using-BiLSTMs","url":"https://github.com/chungimungi/Generation-of-Colors-using-BiLSTMs"},{"title":"chungimungi/color-prediction","url":"https://github.com/chungimungi/color-prediction"}],"syntology":null}},{"leaderboard":"/sota/text-to-image-generation-on-flickr-8k","slug":"text-to-image-generation-on-flickr-8k","dataset":"Flickr-8k","dataset_url":"/dataset/flickr-8k","rows_in_archive":1,"metrics":["LPIPS"],"first_row_in_archive_order":{"model":"SSC+SKD","paper_title":"Language-Oriented Communication with Semantic Coding and Knowledge Distillation for Text-to-Image Generation","paper_url":"/paper/language-oriented-communication-with-semantic","paper_date":"2023-09-20","arxiv_id":"2309.11127","code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/coco","name":"COCO (Common Objects in Context)","full_name":"Common Objects in Context","num_papers_in_archive":11922},{"url":"/dataset/cub-200-2011","name":"CUB-200-2011","full_name":"Caltech-UCSD Birds-200-2011","num_papers_in_archive":2235},{"url":"/dataset/oxford-102-flower","name":"Oxford 102 Flower","full_name":"102 Category Flower Dataset","num_papers_in_archive":1307},{"url":"/dataset/conceptual-captions","name":"Conceptual Captions","full_name":"Conceptual Captions","num_papers_in_archive":352},{"url":"/dataset/geneval","name":"GenEval","full_name":"","num_papers_in_archive":100},{"url":"/dataset/drawbench","name":"DrawBench","full_name":"","num_papers_in_archive":82},{"url":"/dataset/t2i-compbench","name":"T2I-CompBench","full_name":"","num_papers_in_archive":67},{"url":"/dataset/pick-a-pic","name":"Pick-a-Pic","full_name":"","num_papers_in_archive":52},{"url":"/dataset/fashion-gen","name":"Fashion-Gen","full_name":"","num_papers_in_archive":36},{"url":"/dataset/lhq","name":"LHQ","full_name":"Landscapes High-Quality","num_papers_in_archive":27},{"url":"/dataset/multi-modal-celeba-hq-1","name":"Multi-Modal CelebA-HQ","full_name":"","num_papers_in_archive":27},{"url":"/dataset/human-art","name":"Human-Art","full_name":"","num_papers_in_archive":7},{"url":"/dataset/hrs-bench","name":"HRS-Bench","full_name":"Holistic, Reliable, and Scalable Benchmark","num_papers_in_archive":6},{"url":"/dataset/flickr-8k","name":"Flickr-8k","full_name":"","num_papers_in_archive":5},{"url":"/dataset/textatlaseval","name":"TextAtlasEval","full_name":"","num_papers_in_archive":5},{"url":"/dataset/laion-coco","name":"LAION COCO","full_name":"","num_papers_in_archive":3},{"url":"/dataset/entigen","name":"ENTIGEN","full_name":"Ethical NaTural Language Interventions in Text-to-Image GENeration","num_papers_in_archive":2},{"url":"/dataset/paper2fig100k","name":"Paper2Fig100k","full_name":"","num_papers_in_archive":2},{"url":"/dataset/richhf-18k","name":"RichHF-18K","full_name":"","num_papers_in_archive":2},{"url":"/dataset/colors","name":"Colors","full_name":"","num_papers_in_archive":1},{"url":"/dataset/glami-1m","name":"GLAMI-1M","full_name":"A Multilingual Image-Text Fashion Dataset","num_papers_in_archive":1},{"url":"/dataset/p4d-prompts","name":"P4D prompts","full_name":"P4D universal jailbreaking prompt for T2I models","num_papers_in_archive":1},{"url":"/dataset/pick-a-filter","name":"Pick-a-Filter","full_name":"","num_papers_in_archive":1},{"url":"/dataset/balitanlp","name":"BalitaNLP","full_name":"","num_papers_in_archive":0},{"url":"/dataset/vript","name":"Vript","full_name":"🎬 Vript: A Video Is Worth Thousands of Words","num_papers_in_archive":0}],"subtasks":[{"url":"/task/concept-alignment","name":"Concept Alignment"},{"url":"/task/conditional-text-to-image-synthesis","name":"Conditional Text-to-Image Synthesis"},{"url":"/task/consistent-character-generation","name":"Consistent Character Generation"},{"url":"/task/dreambooth-personalized-generation","name":"DreamBooth Personalized Generation"},{"url":"/task/text-based-image-editing","name":"Text-based Image Editing"},{"url":"/task/text-guided-image-editing","name":"text-guided-image-editing"},{"url":"/task/zero-shot-text-to-image-generation","name":"Zero-Shot Text-to-Image Generation"}],"parent_tasks":[{"url":"/task/1-image-2-2-stitchi","name":"1 Image, 2*2 Stitchi"},{"url":"/task/10-shot-image-generation","name":"10-shot image generation"},{"url":"/task/image-generation","name":"Image Generation"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":546,"tagged_in_all":1085,"items":[{"url":"/paper/show-and-tell-a-neural-image-caption","title":"Show and Tell: A Neural Image Caption Generator","date":"2014-11-17","arxiv_id":"1411.4555","repositories_listed":74,"syntology":{"n":34,"n_ran":13,"n_unverified":21,"n_pointer_only":6}},{"url":"/paper/high-resolution-image-synthesis-with-latent","title":"High-Resolution Image Synthesis with Latent Diffusion Models","date":"2021-12-20","arxiv_id":"2112.10752","repositories_listed":41,"syntology":{"n":28,"n_ran":19,"n_unverified":9,"n_pointer_only":5}},{"url":"/paper/generative-adversarial-text-to-image","title":"Generative Adversarial Text to Image Synthesis","date":"2016-05-17","arxiv_id":"1605.05396","repositories_listed":39,"syntology":{"n":19,"n_ran":9,"n_unverified":10,"n_pointer_only":6}},{"url":"/paper/stackgan-text-to-photo-realistic-image","title":"StackGAN: Text to Photo-realistic Image Synthesis with Stacked Generative Adversarial Networks","date":"2016-12-10","arxiv_id":"1612.03242","repositories_listed":21,"syntology":{"n":31,"n_ran":11,"n_unverified":20,"n_pointer_only":1}},{"url":"/paper/attngan-fine-grained-text-to-image-generation","title":"AttnGAN: Fine-Grained Text to Image Generation with Attentional Generative Adversarial Networks","date":"2017-11-28","arxiv_id":"1711.10485","repositories_listed":20,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/stackgan-realistic-image-synthesis-with","title":"StackGAN++: Realistic Image Synthesis with Stacked Generative Adversarial Networks","date":"2017-10-19","arxiv_id":"1710.10916","repositories_listed":16,"syntology":{"n":31,"n_ran":10,"n_unverified":21,"n_pointer_only":0}},{"url":"/paper/taming-transformers-for-high-resolution-image","title":"Taming Transformers for High-Resolution Image Synthesis","date":"2020-12-17","arxiv_id":"2012.09841","repositories_listed":13,"syntology":{"n":6,"n_ran":6,"n_unverified":0,"n_pointer_only":4}},{"url":"/paper/zero-shot-text-to-image-generation","title":"Zero-Shot Text-to-Image Generation","date":"2021-02-24","arxiv_id":"2102.12092","repositories_listed":12,"syntology":{"n":7,"n_ran":7,"n_unverified":0,"n_pointer_only":3}},{"url":"/paper/an-image-is-worth-one-word-personalizing-text","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","date":"2022-08-02","arxiv_id":"2208.01618","repositories_listed":9,"syntology":{"n":13,"n_ran":10,"n_unverified":3,"n_pointer_only":1}},{"url":"/paper/maskgit-masked-generative-image-transformer","title":"MaskGIT: Masked Generative Image Transformer","date":"2022-02-08","arxiv_id":"2202.04200","repositories_listed":9,"syntology":{"n":21,"n_ran":14,"n_unverified":7,"n_pointer_only":4}},{"url":"/paper/hierarchical-text-conditional-image","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","date":"2022-04-13","arxiv_id":"2204.06125","repositories_listed":8,"syntology":{"n":38,"n_ran":29,"n_unverified":9,"n_pointer_only":1}},{"url":"/paper/latent-consistency-models-synthesizing-high","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","date":"2023-10-06","arxiv_id":"2310.04378","repositories_listed":5,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/muse-text-to-image-generation-via-masked","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","date":"2023-01-02","arxiv_id":"2301.00704","repositories_listed":5,"syntology":{"n":21,"n_ran":18,"n_unverified":3,"n_pointer_only":9}},{"url":"/paper/tedigan-text-guided-diverse-image-generation","title":"TediGAN: Text-Guided Diverse Face Image Generation and Manipulation","date":"2020-12-06","arxiv_id":"2012.03308","repositories_listed":5,"syntology":null},{"url":"/paper/styledrop-text-to-image-generation-in-any","title":"StyleDrop: Text-to-Image Generation in Any Style","date":"2023-06-01","arxiv_id":"2306.00983","repositories_listed":4,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/masactrl-tuning-free-mutual-self-attention","title":"MasaCtrl: Tuning-Free Mutual Self-Attention Control for Consistent Image Synthesis and Editing","date":"2023-04-17","arxiv_id":"2304.08465","repositories_listed":4,"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":1}},{"url":"/paper/fast-text-conditional-discrete-denoising-on","title":"A Novel Sampling Scheme for Text- and Image-Conditional Image Synthesis in Quantized Latent Spaces","date":"2022-11-14","arxiv_id":"2211.07292","repositories_listed":4,"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/autoregressive-image-generation-using","title":"Autoregressive Image Generation using Residual Quantization","date":"2022-03-03","arxiv_id":"2203.01941","repositories_listed":4,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/unifying-architectures-tasks-and-modalities","title":"OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework","date":"2022-02-07","arxiv_id":"2202.03052","repositories_listed":4,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/cogview-mastering-text-to-image-generation","title":"CogView: Mastering Text-to-Image Generation via Transformers","date":"2021-05-26","arxiv_id":"2105.13290","repositories_listed":4,"syntology":{"n":6,"n_ran":4,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/dm-gan-dynamic-memory-generative-adversarial","title":"DM-GAN: Dynamic Memory Generative Adversarial Networks for Text-to-Image Synthesis","date":"2019-04-02","arxiv_id":"1904.01310","repositories_listed":4,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/navigating-the-synthetic-realm-harnessing","title":"Navigating the Synthetic Realm: Harnessing Diffusion-based Models for Laparoscopic Text-to-Image Generation","date":"2023-12-05","arxiv_id":"2312.03043","repositories_listed":3,"syntology":null},{"url":"/paper/pixart-a-fast-training-of-diffusion","title":"PixArt-$α$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","date":"2023-09-30","arxiv_id":"2310.00426","repositories_listed":3,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":2}},{"url":"/paper/prospect-expanded-conditioning-for-the","title":"ProSpect: Prompt Spectrum for Attribute-Aware Personalization of Diffusion Models","date":"2023-05-25","arxiv_id":"2305.16225","repositories_listed":3,"syntology":{"n":13,"n_ran":12,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/on-architectural-compression-of-text-to-image","title":"BK-SDM: A Lightweight, Fast, and Cheap Version of Stable Diffusion","date":"2023-05-25","arxiv_id":"2305.15798","repositories_listed":3,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}},{"url":"/paper/training-diffusion-models-with-reinforcement","title":"Training Diffusion Models with Reinforcement Learning","date":"2023-05-22","arxiv_id":"2305.13301","repositories_listed":3,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/imagereward-learning-and-evaluating-human-1","title":"ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation","date":"2023-04-12","arxiv_id":"2304.05977","repositories_listed":3,"syntology":{"n":12,"n_ran":3,"n_unverified":9,"n_pointer_only":2}},{"url":"/paper/glyphdraw-learning-to-draw-chinese-characters","title":"GlyphDraw: Seamlessly Rendering Text with Intricate Spatial Structures in Text-to-Image Generation","date":"2023-03-31","arxiv_id":"2303.17870","repositories_listed":3,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/one-transformer-fits-all-distributions-in","title":"One Transformer Fits All Distributions in Multi-Modal Diffusion at Scale","date":"2023-03-12","arxiv_id":"2303.06555","repositories_listed":3,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/reduce-reuse-recycle-compositional-generation","title":"Reduce, Reuse, Recycle: Compositional Generation with Energy-Based Diffusion Models and MCMC","date":"2023-02-22","arxiv_id":"2302.11552","repositories_listed":3,"syntology":{"n":24,"n_ran":4,"n_unverified":20,"n_pointer_only":0}}],"syntology_records":28,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}