{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/text-to-image-generation/papers/6","list_of":"/task/text-to-image-generation","task":"Text-to-Image Generation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":6,"pages_in_order":11,"rows_per_page":100,"rows":[501,600],"of":1085,"counts":{"archive_papers_tagged":1085,"with_a_code_link":546,"where_syntology_ran_a_sample":246,"not_listed_spam_title":0,"listed":1085,"listed_where_code_ran":246,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":215,"every_run_a_failure_of_syntologys_instrument":31,"listed_with_a_run_with_no_instrument_failure":215,"listed_every_run_a_failure_of_syntologys_instrument":31,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/text-to-image-generation","prev":"/task/text-to-image-generation/papers/5","next":"/task/text-to-image-generation/papers/7","papers":[{"url":"/paper/shifted-diffusion-for-text-to-image","slug":"shifted-diffusion-for-text-to-image","title":"Shifted Diffusion for Text-to-image Generation","date":"2022-11-24","arxiv_id":"2211.15388","repositories_listed":1,"syntology":{"n":17,"n_ran":13,"n_constructed":0,"n_ran_checked":10,"n_instrument":3,"n_unverified":4,"n_honours":2,"n_violates":1,"n_no_contract":7,"n_pointer_only":6,"phrase":"13 ran (of which 0 constructed an object rather than computing a result; 10 with no instrument failure: 2 honoured, 1 violated, 7 with no contract checked; 3 where Syntology's instrument failed) · 4 unverified","sample_list":"/paper/shifted-diffusion-for-text-to-image#ran","syntology_url":"https://syntology.ai/paper/2211.15388","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2211.15388"}},"official":{"repos":["drboog/Shifted_Diffusion"],"state":"official (archive's flag): 13 ran","n_ran":13,"n_constructed":0,"n_ran_no_instrument_failure":10,"n_unverified":4,"ran_from_kinds":["official"]}}},{"url":"/paper/inversion-based-creativity-transfer-with","slug":"inversion-based-creativity-transfer-with","title":"Inversion-Based Style Transfer with Diffusion Models","date":"2022-11-23","arxiv_id":"2211.13203","repositories_listed":1,"syntology":null},{"url":"/paper/easily-accessible-text-to-image-generation","slug":"easily-accessible-text-to-image-generation","title":"Easily Accessible Text-to-Image Generation Amplifies Demographic Stereotypes at Large Scale","date":"2022-11-07","arxiv_id":"2211.03759","repositories_listed":1,"syntology":null},{"url":"/paper/how-well-can-text-to-image-generative-models","slug":"how-well-can-text-to-image-generative-models","title":"How well can Text-to-Image Generative Models understand Ethical Natural Language Interventions?","date":"2022-10-27","arxiv_id":"2210.15230","repositories_listed":1,"syntology":{"n":7,"n_ran":5,"n_constructed":0,"n_ran_checked":5,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":5,"n_pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/how-well-can-text-to-image-generative-models#ran","syntology_url":"https://syntology.ai/paper/2210.15230","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2210.15230"}},"official":{"repos":["hritikbansal/entigen_emnlp"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":5,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/towards-better-text-image-consistency-in-text","slug":"towards-better-text-image-consistency-in-text","title":"SSD: Towards Better Text-Image Consistency Metric in Text-to-Image Generation","date":"2022-10-27","arxiv_id":"2210.15235","repositories_listed":1,"syntology":null},{"url":"/paper/z-lavi-zero-shot-language-solver-fueled-by","slug":"z-lavi-zero-shot-language-solver-fueled-by","title":"Z-LaVI: Zero-Shot Language Solver Fueled by Visual Imagination","date":"2022-10-21","arxiv_id":"2210.12261","repositories_listed":1,"syntology":null},{"url":"/paper/is-synthetic-data-from-generative-models","slug":"is-synthetic-data-from-generative-models","title":"Is synthetic data from generative models ready for image recognition?","date":"2022-10-14","arxiv_id":"2210.07574","repositories_listed":1,"syntology":{"n":9,"n_ran":5,"n_constructed":0,"n_ran_checked":4,"n_instrument":1,"n_unverified":4,"n_honours":1,"n_violates":0,"n_no_contract":3,"n_pointer_only":1,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 1 honoured, 0 violated, 3 with no contract checked; 1 where Syntology's instrument failed) · 4 unverified","sample_list":"/paper/is-synthetic-data-from-generative-models#ran","syntology_url":"https://syntology.ai/paper/2210.07574","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2210.07574"}},"official":{"repos":["cvmi-lab/syntheticdata"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":4,"ran_from_kinds":["official"]}}},{"url":"/paper/personalizing-text-to-image-generation-via","slug":"personalizing-text-to-image-generation-via","title":"Personalizing Text-to-Image Generation via Aesthetic Gradients","date":"2022-09-25","arxiv_id":"2209.12330","repositories_listed":1,"syntology":{"n":6,"n_ran":5,"n_constructed":1,"n_ran_checked":3,"n_instrument":2,"n_unverified":1,"n_honours":0,"n_violates":2,"n_no_contract":1,"n_pointer_only":6,"phrase":"5 ran (of which 1 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 2 violated, 1 with no contract checked; 2 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/personalizing-text-to-image-generation-via#ran","syntology_url":"https://syntology.ai/paper/2209.12330","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2209.12330"}},"official":{"repos":["vicgalle/stable-diffusion-aesthetic-gradients"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":1,"n_ran_no_instrument_failure":2,"n_unverified":1,"ran_from_kinds":["community","official"]}}},{"url":"/paper/implementing-and-experimenting-with-diffusion","slug":"implementing-and-experimenting-with-diffusion","title":"Implementing and Experimenting with Diffusion Models for Text-to-Image Generation","date":"2022-09-22","arxiv_id":"2209.10948","repositories_listed":1,"syntology":null},{"url":"/paper/t-person-gan-text-to-person-image-generation","slug":"t-person-gan-text-to-person-image-generation","title":"T-Person-GAN: Text-to-Person Image Generation with Identity-Consistency and Manifold Mix-Up","date":"2022-08-18","arxiv_id":"2208.12752","repositories_listed":1,"syntology":null},{"url":"/paper/understanding-attention-for-vision-and-1","slug":"understanding-attention-for-vision-and-1","title":"Understanding Attention for Vision-and-Language Tasks","date":"2022-08-17","arxiv_id":"2208.08104","repositories_listed":1,"syntology":null},{"url":"/paper/txt2img-mhn-remote-sensing-image-generation","slug":"txt2img-mhn-remote-sensing-image-generation","title":"Txt2Img-MHN: Remote Sensing Image Generation from Text Using Modern Hopfield Networks","date":"2022-08-08","arxiv_id":"2208.04441","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":1,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/txt2img-mhn-remote-sensing-image-generation#ran","syntology_url":"https://syntology.ai/paper/2208.04441","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2208.04441"}},"official":{"repos":["yonghaoxu/txt2img-mhn"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/nuwa-infinity-autoregressive-over","slug":"nuwa-infinity-autoregressive-over","title":"NUWA-Infinity: Autoregressive over Autoregressive Generation for Infinite Visual Synthesis","date":"2022-07-20","arxiv_id":"2207.09814","repositories_listed":1,"syntology":null},{"url":"/paper/exploring-generative-adversarial-networks-for-1","slug":"exploring-generative-adversarial-networks-for-1","title":"Exploring Generative Adversarial Networks for Text-to-Image Generation with Evolution Strategies","date":"2022-07-06","arxiv_id":"2207.02907","repositories_listed":1,"syntology":null},{"url":"/paper/prefix-language-models-are-unified-modal","slug":"prefix-language-models-are-unified-modal","title":"Write and Paint: Generative Vision-Language Models are Unified Modal Learners","date":"2022-06-15","arxiv_id":"2206.07699","repositories_listed":1,"syntology":{"n":9,"n_ran":8,"n_constructed":0,"n_ran_checked":7,"n_instrument":1,"n_unverified":1,"n_honours":1,"n_violates":0,"n_no_contract":6,"n_pointer_only":9,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 1 honoured, 0 violated, 6 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/prefix-language-models-are-unified-modal#ran","syntology_url":"https://syntology.ai/paper/2206.07699","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2206.07699"}},"official":{"repos":["shizhediao/davinci"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":0,"n_ran_no_instrument_failure":7,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/blended-latent-diffusion","slug":"blended-latent-diffusion","title":"Blended Latent Diffusion","date":"2022-06-06","arxiv_id":"2206.02779","repositories_listed":1,"syntology":{"n":13,"n_ran":12,"n_constructed":0,"n_ran_checked":8,"n_instrument":4,"n_unverified":1,"n_honours":0,"n_violates":3,"n_no_contract":5,"n_pointer_only":3,"phrase":"12 ran (of which 0 constructed an object rather than computing a result; 8 with no instrument failure: 0 honoured, 3 violated, 5 with no contract checked; 4 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/blended-latent-diffusion#ran","syntology_url":"https://syntology.ai/paper/2206.02779","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2206.02779"}},"official":{"repos":["omriav/blended-latent-diffusion"],"state":"official (archive's flag): 11 ran","n_ran":11,"n_constructed":0,"n_ran_no_instrument_failure":8,"n_unverified":1,"ran_from_kinds":["official","unlocated"]}}},{"url":"/paper/modular-storygan-with-background-and-theme","slug":"modular-storygan-with-background-and-theme","title":"Modular StoryGAN with Background and Theme Awareness for Story Visualization","date":"2022-06-02","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/mutual-information-divergence-a-unified","slug":"mutual-information-divergence-a-unified","title":"Mutual Information Divergence: A Unified Metric for Multimodal Generative Models","date":"2022-05-25","arxiv_id":"2205.13445","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":1,"n_instrument":2,"n_unverified":0,"n_honours":0,"n_violates":1,"n_no_contract":0,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 1 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/mutual-information-divergence-a-unified#ran","syntology_url":"https://syntology.ai/paper/2205.13445","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2205.13445"}},"official":{"repos":["naver-ai/mid.metric"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/gr-gan-gradual-refinement-text-to-image","slug":"gr-gan-gradual-refinement-text-to-image","title":"GR-GAN: Gradual Refinement Text-to-image Generation","date":"2022-05-23","arxiv_id":"2205.11273","repositories_listed":1,"syntology":null},{"url":"/paper/conditional-vector-graphics-generation-for","slug":"conditional-vector-graphics-generation-for","title":"Conditional Vector Graphics Generation for Music Cover Images","date":"2022-05-15","arxiv_id":"2205.07301","repositories_listed":1,"syntology":null},{"url":"/paper/zero-and-r2d2-a-large-scale-chinese-cross","slug":"zero-and-r2d2-a-large-scale-chinese-cross","title":"CCMB: A Large-scale Chinese Cross-modal Benchmark","date":"2022-05-08","arxiv_id":"2205.03860","repositories_listed":1,"syntology":{"n":9,"n_ran":8,"n_constructed":0,"n_ran_checked":8,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":8,"n_pointer_only":0,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 8 with no instrument failure: 0 honoured, 0 violated, 8 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/zero-and-r2d2-a-large-scale-chinese-cross#ran","syntology_url":"https://syntology.ai/paper/2205.03860","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2205.03860"}},"official":{"repos":["yuxie11/R2D2"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":0,"n_ran_no_instrument_failure":8,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/cogview2-faster-and-better-text-to-image","slug":"cogview2-faster-and-better-text-to-image","title":"CogView2: Faster and Better Text-to-Image Generation via Hierarchical Transformers","date":"2022-04-28","arxiv_id":"2204.14217","repositories_listed":1,"syntology":{"n":8,"n_ran":8,"n_constructed":0,"n_ran_checked":8,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":8,"n_pointer_only":0,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 8 with no instrument failure: 0 honoured, 0 violated, 8 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/cogview2-faster-and-better-text-to-image#ran","syntology_url":"https://syntology.ai/paper/2204.14217","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2204.14217"}},"official":{"repos":["thudm/cogview2"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":0,"n_ran_no_instrument_failure":8,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/dr-gan-distribution-regularization-for-text","slug":"dr-gan-distribution-regularization-for-text","title":"DR-GAN: Distribution Regularization for Text-to-Image Generation","date":"2022-04-17","arxiv_id":"2204.07945","repositories_listed":1,"syntology":null},{"url":"/paper/make-a-scene-scene-based-text-to-image","slug":"make-a-scene-scene-based-text-to-image","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","date":"2022-03-24","arxiv_id":"2203.13131","repositories_listed":1,"syntology":{"n":6,"n_ran":4,"n_constructed":2,"n_ran_checked":3,"n_instrument":1,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":0,"phrase":"4 ran (of which 2 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 1 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/make-a-scene-scene-based-text-to-image#ran","syntology_url":"https://syntology.ai/paper/2203.13131","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2203.13131"}},"official":null}},{"url":"/paper/truncated-diffusion-probabilistic-models","slug":"truncated-diffusion-probabilistic-models","title":"Truncated Diffusion Probabilistic Models and Diffusion-based Adversarial Auto-Encoders","date":"2022-02-19","arxiv_id":"2202.09671","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":1,"n_instrument":2,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/truncated-diffusion-probabilistic-models#ran","syntology_url":"https://syntology.ai/paper/2202.09671","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2202.09671"}},"official":{"repos":["jegzheng/truncated-diffusion-probabilistic-models"],"state":"community repositories only","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["community"]}}},{"url":"/paper/gan-based-matrix-factorization-for","slug":"gan-based-matrix-factorization-for","title":"GAN-based Matrix Factorization for Recommender Systems","date":"2022-01-20","arxiv_id":"2201.08042","repositories_listed":1,"syntology":null},{"url":"/paper/lattegan-visually-guided-language-attention","slug":"lattegan-visually-guided-language-attention","title":"LatteGAN: Visually Guided Language Attention for Multi-Turn Text-Conditioned Image Manipulation","date":"2021-12-28","arxiv_id":"2112.13985","repositories_listed":1,"syntology":null},{"url":"/paper/fusedream-training-free-text-to-image","slug":"fusedream-training-free-text-to-image","title":"FuseDream: Training-Free Text-to-Image Generation with Improved CLIP+GAN Space Optimization","date":"2021-12-02","arxiv_id":"2112.01573","repositories_listed":1,"syntology":null},{"url":"/paper/blended-diffusion-for-text-driven-editing-of","slug":"blended-diffusion-for-text-driven-editing-of","title":"Blended Diffusion for Text-driven Editing of Natural Images","date":"2021-11-29","arxiv_id":"2111.14818","repositories_listed":1,"syntology":{"n":22,"n_ran":16,"n_constructed":0,"n_ran_checked":10,"n_instrument":6,"n_unverified":6,"n_honours":4,"n_violates":0,"n_no_contract":6,"n_pointer_only":13,"phrase":"16 ran (of which 0 constructed an object rather than computing a result; 10 with no instrument failure: 4 honoured, 0 violated, 6 with no contract checked; 6 where Syntology's instrument failed) · 6 unverified","sample_list":"/paper/blended-diffusion-for-text-driven-editing-of#ran","syntology_url":"https://syntology.ai/paper/2111.14818","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2111.14818"}},"official":{"repos":["omriav/blended-diffusion"],"state":"official (archive's flag): 15 ran","n_ran":15,"n_constructed":0,"n_ran_no_instrument_failure":9,"n_unverified":6,"ran_from_kinds":["official","unlocated"]}}},{"url":"/paper/nuwa-visual-synthesis-pre-training-for-neural","slug":"nuwa-visual-synthesis-pre-training-for-neural","title":"NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion","date":"2021-11-24","arxiv_id":"2111.12417","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":3,"n_no_contract":0,"n_pointer_only":2,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 3 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/nuwa-visual-synthesis-pre-training-for-neural#ran","syntology_url":"https://syntology.ai/paper/2111.12417","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2111.12417"}},"official":null}},{"url":"/paper/l-verse-bidirectional-generation-between","slug":"l-verse-bidirectional-generation-between","title":"L-Verse: Bidirectional Generation Between Image and Text","date":"2021-11-22","arxiv_id":"2111.11133","repositories_listed":1,"syntology":null},{"url":"/paper/unifying-multimodal-transformer-for-bi","slug":"unifying-multimodal-transformer-for-bi","title":"Unifying Multimodal Transformer for Bi-directional Image and Text Generation","date":"2021-10-19","arxiv_id":"2110.09753","repositories_listed":1,"syntology":{"n":8,"n_ran":6,"n_constructed":0,"n_ran_checked":6,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":6,"n_pointer_only":0,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/unifying-multimodal-transformer-for-bi#ran","syntology_url":"https://syntology.ai/paper/2110.09753","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2110.09753"}},"official":{"repos":["researchmm/generate-it"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":6,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/clip-forge-towards-zero-shot-text-to-shape","slug":"clip-forge-towards-zero-shot-text-to-shape","title":"CLIP-Forge: Towards Zero-Shot Text-to-Shape Generation","date":"2021-10-06","arxiv_id":"2110.02624","repositories_listed":1,"syntology":null},{"url":"/paper/fine-grained-image-generation-from-bangla","slug":"fine-grained-image-generation-from-bangla","title":"Fine-Grained Image Generation from Bangla Text Description using Attentional Generative Adversarial Network","date":"2021-09-24","arxiv_id":"2109.11749","repositories_listed":1,"syntology":null},{"url":"/paper/paint4poem-a-dataset-for-artistic","slug":"paint4poem-a-dataset-for-artistic","title":"Paint4Poem: A Dataset for Artistic Visualization of Classical Chinese Poems","date":"2021-09-23","arxiv_id":"2109.11682","repositories_listed":1,"syntology":null},{"url":"/paper/imagebart-bidirectional-context-with","slug":"imagebart-bidirectional-context-with","title":"ImageBART: Bidirectional Context with Multinomial Diffusion for Autoregressive Image Synthesis","date":"2021-08-19","arxiv_id":"2108.08827","repositories_listed":1,"syntology":null},{"url":"/paper/improving-text-to-image-synthesis-using","slug":"improving-text-to-image-synthesis-using","title":"Improving Text-to-Image Synthesis Using Contrastive Learning","date":"2021-07-06","arxiv_id":"2107.02423","repositories_listed":1,"syntology":null},{"url":"/paper/scalable-computation-of-monge-maps-with","slug":"scalable-computation-of-monge-maps-with","title":"Neural Monge Map estimation and its applications","date":"2021-06-07","arxiv_id":"2106.03812","repositories_listed":1,"syntology":null},{"url":"/paper/text-to-image-generation-with-semantic","slug":"text-to-image-generation-with-semantic","title":"Text to Image Generation with Semantic-Spatial Aware GAN","date":"2021-04-01","arxiv_id":"2104.00567","repositories_listed":1,"syntology":null},{"url":"/paper/cross-modal-contrastive-learning-for-text-to","slug":"cross-modal-contrastive-learning-for-text-to","title":"Cross-Modal Contrastive Learning for Text-to-Image Generation","date":"2021-01-12","arxiv_id":"2101.04702","repositories_listed":1,"syntology":{"n":4,"n_ran":4,"n_constructed":0,"n_ran_checked":1,"n_instrument":3,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":4,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/cross-modal-contrastive-learning-for-text-to#ran","syntology_url":"https://syntology.ai/paper/2101.04702","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2101.04702"}},"official":{"repos":["google-research/xmcgan_image_generation"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/text-to-image-generation-grounded-by-fine","slug":"text-to-image-generation-grounded-by-fine","title":"Text-to-Image Generation Grounded by Fine-Grained User Attention","date":"2020-11-07","arxiv_id":"2011.03775","repositories_listed":1,"syntology":null},{"url":"/paper/lightweight-generative-adversarial-networks","slug":"lightweight-generative-adversarial-networks","title":"Lightweight Generative Adversarial Networks for Text-Guided Image Manipulation","date":"2020-10-23","arxiv_id":"2010.12136","repositories_listed":1,"syntology":{"n":13,"n_ran":8,"n_constructed":2,"n_ran_checked":3,"n_instrument":5,"n_unverified":5,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":13,"phrase":"8 ran (of which 2 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 5 where Syntology's instrument failed) · 5 unverified","sample_list":"/paper/lightweight-generative-adversarial-networks#ran","syntology_url":"https://syntology.ai/paper/2010.12136","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2010.12136"}},"official":null}},{"url":"/paper/victr-visual-information-captured-text","slug":"victr-visual-information-captured-text","title":"VICTR: Visual Information Captured Text Representation for Text-to-Image Multimodal Tasks","date":"2020-10-07","arxiv_id":"2010.03182","repositories_listed":1,"syntology":null},{"url":"/paper/network-fusion-for-content-creation-with","slug":"network-fusion-for-content-creation-with","title":"Network-to-Network Translation with Conditional Invertible Neural Networks","date":"2020-05-27","arxiv_id":"2005.13580","repositories_listed":1,"syntology":null},{"url":"/paper/learn-imagine-and-create-text-to-image","slug":"learn-imagine-and-create-text-to-image","title":"Learn, Imagine and Create: Text-to-Image Generation from Prior Knowledge","date":"2019-12-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/generating-multiple-objects-at-spatially","slug":"generating-multiple-objects-at-spatially","title":"Generating Multiple Objects at Spatially Distinct Locations","date":"2019-01-03","arxiv_id":"1901.00686","repositories_listed":1,"syntology":null},{"url":null,"slug":"evaluating-attribute-confusion-in-fashion","title":"Evaluating Attribute Confusion in Fashion Text-to-Image Generation","date":"2025-07-09","arxiv_id":"2507.07079","repositories_listed":0,"syntology":null},{"url":null,"slug":"dc-ar-efficient-masked-autoregressive-image","title":"DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer","date":"2025-07-07","arxiv_id":"2507.04947","repositories_listed":0,"syntology":null},{"url":null,"slug":"uniglyph-unified-segmentation-conditioned","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","date":"2025-07-01","arxiv_id":"2507.00992","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-tree-sampling-scalable-inference","title":"Diffusion Tree Sampling: Scalable inference-time alignment of diffusion models","date":"2025-06-25","arxiv_id":"2506.20701","repositories_listed":0,"syntology":null},{"url":null,"slug":"med-art-diffusion-transformer-for-2d-medical","title":"Med-Art: Diffusion Transformer for 2D Medical Text-to-Image Generation","date":"2025-06-25","arxiv_id":"2506.20449","repositories_listed":0,"syntology":null},{"url":null,"slug":"cost-aware-routing-for-efficient-text-to","title":"Cost-Aware Routing for Efficient Text-To-Image Generation","date":"2025-06-17","arxiv_id":"2506.14753","repositories_listed":0,"syntology":null},{"url":null,"slug":"fair-generation-without-unfair-distortions","title":"Fair Generation without Unfair Distortions: Debiasing Text-to-Image Generation with Entanglement-Free Attention","date":"2025-06-16","arxiv_id":"2506.13298","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmmg-a-massive-multidisciplinary-multi-tier","title":"MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning","date":"2025-06-12","arxiv_id":"2506.10963","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-to-image-for-multi-label-image","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","date":"2025-06-12","arxiv_id":"2506.10575","repositories_listed":0,"syntology":null},{"url":null,"slug":"re-thinking-the-automatic-evaluation-of-image","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","date":"2025-06-10","arxiv_id":"2506.08480","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comprehensive-study-of-decoder-only-llms-1","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","date":"2025-06-09","arxiv_id":"2506.08210","repositories_listed":0,"syntology":null},{"url":null,"slug":"vivat-virtuous-improving-vae-training-through","title":"VIVAT: Virtuous Improving VAE Training through Artifact Mitigation","date":"2025-06-09","arxiv_id":"2506.07863","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-inverse-problems-with-flair","title":"Solving Inverse Problems with FLAIR","date":"2025-06-03","arxiv_id":"2506.02680","repositories_listed":0,"syntology":null},{"url":null,"slug":"pointt2i-llm-based-text-to-image-generation","title":"PointT2I: LLM-based text-to-image generation via keypoints","date":"2025-06-02","arxiv_id":"2506.01370","repositories_listed":0,"syntology":null},{"url":null,"slug":"unlocking-aha-moments-via-reinforcement","title":"Unlocking Aha Moments via Reinforcement Learning: Advancing Collaborative Visual Comprehension and Generation","date":"2025-06-02","arxiv_id":"2506.01480","repositories_listed":0,"syntology":null},{"url":null,"slug":"artiscene-language-driven-artistic-3d-scene-1","title":"ArtiScene: Language-Driven Artistic 3D Scene Generation Through Image Intermediary","date":"2025-05-31","arxiv_id":"2506.00742","repositories_listed":0,"syntology":null},{"url":null,"slug":"composeanything-composite-object-priors-for","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","date":"2025-05-30","arxiv_id":"2505.24086","repositories_listed":0,"syntology":null},{"url":null,"slug":"r2i-bench-benchmarking-reasoning-driven-text","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","date":"2025-05-29","arxiv_id":"2505.23493","repositories_listed":0,"syntology":null},{"url":null,"slug":"rhetorical-text-to-image-generation-via-two","title":"Rhetorical Text-to-Image Generation via Two-layer Diffusion Policy Optimization","date":"2025-05-28","arxiv_id":"2505.22792","repositories_listed":0,"syntology":null},{"url":null,"slug":"stylear-customizing-multimodal-autoregressive","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","date":"2025-05-26","arxiv_id":"2505.19874","repositories_listed":0,"syntology":null},{"url":null,"slug":"textdiffuser-rl-efficient-and-robust-text","title":"TextDiffuser-RL: Efficient and Robust Text Layout Optimization for High-Fidelity Text-to-Image Synthesis","date":"2025-05-25","arxiv_id":"2505.19291","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-free-stylized-text-to-image","title":"Training-free Stylized Text-to-Image Generation with Fast Inference","date":"2025-05-25","arxiv_id":"2505.19063","repositories_listed":0,"syntology":null},{"url":null,"slug":"mod-adapter-tuning-free-and-versatile-multi","title":"Mod-Adapter: Tuning-Free and Versatile Multi-concept Personalization via Modulation Adapter","date":"2025-05-24","arxiv_id":"2505.18612","repositories_listed":0,"syntology":null},{"url":null,"slug":"tng-clip-training-time-negation-data","title":"TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP","date":"2025-05-24","arxiv_id":"2505.18434","repositories_listed":0,"syntology":null},{"url":null,"slug":"conditional-panoramic-image-generation-via","title":"Conditional Panoramic Image Generation via Masked Autoregressive Modeling","date":"2025-05-22","arxiv_id":"2505.16862","repositories_listed":0,"syntology":null},{"url":null,"slug":"creatively-upscaling-images-with-global","title":"Creatively Upscaling Images with Global-Regional Priors","date":"2025-05-22","arxiv_id":"2505.16976","repositories_listed":0,"syntology":null},{"url":null,"slug":"ntire-2025-challenge-on-text-to-image","title":"NTIRE 2025 challenge on Text to Image Generation Model Quality Assessment","date":"2025-05-22","arxiv_id":"2505.16314","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-rewarding-large-vision-language-models","title":"Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation","date":"2025-05-22","arxiv_id":"2505.16763","repositories_listed":0,"syntology":null},{"url":null,"slug":"harnessing-caption-detailness-for-data","title":"Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation","date":"2025-05-21","arxiv_id":"2505.15172","repositories_listed":0,"syntology":null},{"url":null,"slug":"ia-t2i-internet-augmented-text-to-image","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","date":"2025-05-21","arxiv_id":"2505.15779","repositories_listed":0,"syntology":null},{"url":null,"slug":"hunyuan-game-industrial-grade-intelligent","title":"Hunyuan-Game: Industrial-grade Intelligent Game Creation Model","date":"2025-05-20","arxiv_id":"2505.14135","repositories_listed":0,"syntology":null},{"url":null,"slug":"diff-mm-exploring-pre-trained-text-to-image","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","date":"2025-05-19","arxiv_id":"2505.12606","repositories_listed":0,"syntology":null},{"url":null,"slug":"guiding-diffusion-with-deep-geometric-moments","title":"Guiding Diffusion with Deep Geometric Moments: Balancing Fidelity and Variation","date":"2025-05-18","arxiv_id":"2505.12486","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-11178","title":"CompAlign: Improving Compositional Text-to-Image Generation with a Complex Benchmark and Fine-Grained Feedback","date":"2025-05-16","arxiv_id":"2505.11178","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-11468","title":"PSDiffusion: Harmonized Multi-Layer Image Generation via Layout and Appearance Alignment","date":"2025-05-16","arxiv_id":"2505.11468","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-10743","title":"IMAGE-ALCHEMY: Advancing subject fidelity in personalised text-to-image generation","date":"2025-05-15","arxiv_id":"2505.10743","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-initial-exploration-of-default-images-in","title":"An Initial Exploration of Default Images in Text-to-Image Generation","date":"2025-05-14","arxiv_id":"2505.09166","repositories_listed":0,"syntology":null},{"url":null,"slug":"don-t-forget-your-inverse-ddim-for-image","title":"Don't Forget your Inverse DDIM for Image Editing","date":"2025-05-14","arxiv_id":"2505.09571","repositories_listed":0,"syntology":null},{"url":null,"slug":"replay-based-continual-learning-with-dual","title":"Replay-Based Continual Learning with Dual-Layered Distillation and a Streamlined U-Net for Efficient Text-to-Image Generation","date":"2025-05-11","arxiv_id":"2505.06995","repositories_listed":0,"syntology":null},{"url":null,"slug":"mogao-an-omni-foundation-model-for","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","date":"2025-05-08","arxiv_id":"2505.05472","repositories_listed":0,"syntology":null},{"url":null,"slug":"pidiff-image-customization-for-personalized","title":"PIDiff: Image Customization for Personalized Identities with Diffusion Models","date":"2025-05-08","arxiv_id":"2505.05081","repositories_listed":0,"syntology":null},{"url":null,"slug":"craft-cultural-russian-oriented-dataset","title":"CRAFT: Cultural Russian-Oriented Dataset Adaptation for Focused Text-to-Image Generation","date":"2025-05-07","arxiv_id":"2505.04851","repositories_listed":0,"syntology":null},{"url":null,"slug":"preliminary-explorations-with-gpt-4o-mni","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","date":"2025-05-06","arxiv_id":"2505.05501","repositories_listed":0,"syntology":null},{"url":null,"slug":"mccd-multi-agent-collaboration-based","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","date":"2025-05-05","arxiv_id":"2505.02648","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-to-image-generation-and-editing-a-survey","title":"Text to Image Generation and Editing: A Survey","date":"2025-05-05","arxiv_id":"2505.02527","repositories_listed":0,"syntology":null},{"url":null,"slug":"worldgenbench-a-world-knowledge-integrated","title":"WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation","date":"2025-05-02","arxiv_id":"2505.01490","repositories_listed":0,"syntology":null},{"url":null,"slug":"inception-jailbreak-the-memory-mechanism-of","title":"Inception: Jailbreak the Memory Mechanism of Text-to-Image Generation Systems","date":"2025-04-29","arxiv_id":"2504.20376","repositories_listed":0,"syntology":null},{"url":null,"slug":"refvnli-towards-scalable-evaluation-of","title":"RefVNLI: Towards Scalable Evaluation of Subject-driven Text-to-image Generation","date":"2025-04-24","arxiv_id":"2504.17502","repositories_listed":0,"syntology":null},{"url":null,"slug":"token-shuffle-towards-high-resolution-image","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","date":"2025-04-24","arxiv_id":"2504.17789","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilling-semantically-aware-orders-for","title":"Distilling semantically aware orders for autoregressive image generation","date":"2025-04-23","arxiv_id":"2504.17069","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergence-and-evolution-of-interpretable","title":"Emergence and Evolution of Interpretable Concepts in Diffusion Models","date":"2025-04-21","arxiv_id":"2504.15473","repositories_listed":0,"syntology":null},{"url":null,"slug":"twin-co-adaptive-dialogue-for-progressive","title":"Twin Co-Adaptive Dialogue for Progressive Image Generation","date":"2025-04-21","arxiv_id":"2504.14868","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-lurks-within-concept-auditing-for-shared","title":"What Lurks Within? Concept Auditing for Shared Diffusion Models at Scale","date":"2025-04-21","arxiv_id":"2504.14815","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-language-patterns-of-prompts-in","title":"Exploring Language Patterns of Prompts in Text-to-Image Generation and Their Impact on Visual Diversity","date":"2025-04-19","arxiv_id":"2504.14125","repositories_listed":0,"syntology":null}],"record_sha256":"3909ddd6e9083b1e54a5792592010ec4f7750cc3243c21324718563d42e5db73","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}