{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/text-to-image-generation/papers/10","list_of":"/task/text-to-image-generation","task":"Text-to-Image Generation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":10,"pages_in_order":11,"rows_per_page":100,"rows":[901,1000],"of":1085,"counts":{"archive_papers_tagged":1085,"with_a_code_link":546,"where_syntology_ran_a_sample":246,"not_listed_spam_title":0,"listed":1085,"listed_where_code_ran":246,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":215,"every_run_a_failure_of_syntologys_instrument":31,"listed_with_a_run_with_no_instrument_failure":215,"listed_every_run_a_failure_of_syntologys_instrument":31,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/text-to-image-generation","prev":"/task/text-to-image-generation/papers/9","next":"/task/text-to-image-generation/papers/11","papers":[{"url":null,"slug":"semantic-draw-engineering-for-text-to-image","title":"Semantic Draw Engineering for Text-to-Image Creation","date":"2023-12-23","arxiv_id":"2401.04116","repositories_listed":0,"syntology":null},{"url":null,"slug":"emage-non-autoregressive-text-to-image","title":"Emage: Non-Autoregressive Text-to-Image Generation","date":"2023-12-22","arxiv_id":"2312.14988","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamtuner-single-image-is-enough-for-subject","title":"DreamTuner: Single Image is Enough for Subject-Driven Generation","date":"2023-12-21","arxiv_id":"2312.13691","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-right-losses-for-the-right-gains","title":"The Right Losses for the Right Gains: Improving the Semantic Consistency of Deep Text-to-Image Generation with Distribution-Sensitive Losses","date":"2023-12-18","arxiv_id":"2312.10854","repositories_listed":0,"syntology":null},{"url":null,"slug":"lime-localized-image-editing-via-attention","title":"LIME: Localized Image Editing via Attention Regularization in Diffusion Models","date":"2023-12-14","arxiv_id":"2312.09256","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffuseraw-end-to-end-generative-raw-image","title":"DiffuseRAW: End-to-End Generative RAW Image Processing for Low-Light Images","date":"2023-12-13","arxiv_id":"2402.18575","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-aware-artifact-image-synthesis-with","title":"Knowledge-Aware Artifact Image Synthesis with LLM-Enhanced Prompting and Multi-Source Supervision","date":"2023-12-13","arxiv_id":"2312.08056","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeavatar-photorealistic-text-to-3d-avatar","title":"SEEAvatar: Photorealistic Text-to-3D Avatar Generation with Constrained Geometry and Appearance","date":"2023-12-13","arxiv_id":"2312.08889","repositories_listed":0,"syntology":null},{"url":null,"slug":"portraitbooth-a-versatile-portrait-model-for","title":"PortraitBooth: A Versatile Portrait Model for Fast Identity-preserved Personalization","date":"2023-12-11","arxiv_id":"2312.06354","repositories_listed":0,"syntology":null},{"url":null,"slug":"stellar-systematic-evaluation-of-human","title":"Stellar: Systematic Evaluation of Human-Centric Personalized Text-to-Image Methods","date":"2023-12-11","arxiv_id":"2312.06116","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-quantization-strategies-for-latent","title":"Efficient Quantization Strategies for Latent Diffusion Models","date":"2023-12-09","arxiv_id":"2312.05431","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-caching-for-efficiently-serving","title":"Approximate Caching for Efficiently Serving Diffusion Models","date":"2023-12-07","arxiv_id":"2312.04429","repositories_listed":0,"syntology":null},{"url":null,"slug":"diversify-don-t-fine-tune-scaling-up-visual","title":"Diversify, Don't Fine-Tune: Scaling Up Visual Recognition Training with Synthetic Images","date":"2023-12-04","arxiv_id":"2312.02253","repositories_listed":0,"syntology":null},{"url":null,"slug":"instructbooth-instruction-following","title":"InstructBooth: Instruction-following Personalized Text-to-Image Generation","date":"2023-12-04","arxiv_id":"2312.03011","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-rendering-controllable-4d-guided","title":"Generative Rendering: Controllable 4D-Guided Video Generation with 2D Diffusion Models","date":"2023-12-03","arxiv_id":"2312.01409","repositories_listed":0,"syntology":null},{"url":null,"slug":"hipa-enabling-one-step-text-to-image","title":"HiPA: Enabling One-Step Text-to-Image Diffusion Models via High-Frequency-Promoting Adaptation","date":"2023-11-30","arxiv_id":"2311.18158","repositories_listed":0,"syntology":null},{"url":null,"slug":"microcinema-a-divide-and-conquer-approach-for","title":"MicroCinema: A Divide-and-Conquer Approach for Text-to-Video Generation","date":"2023-11-30","arxiv_id":"2311.18829","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamsync-aligning-text-to-image-generation","title":"DreamSync: Aligning Text-to-Image Generation with Image Understanding Feedback","date":"2023-11-29","arxiv_id":"2311.17946","repositories_listed":0,"syntology":null},{"url":null,"slug":"fair-text-to-image-diffusion-via-fair-mapping","title":"Fair Text-to-Image Diffusion via Fair Mapping","date":"2023-11-29","arxiv_id":"2311.17695","repositories_listed":0,"syntology":null},{"url":null,"slug":"mobilediffusion-subsecond-text-to-image","title":"MobileDiffusion: Instant Text-to-Image Generation on Mobile Devices","date":"2023-11-28","arxiv_id":"2311.16567","repositories_listed":0,"syntology":null},{"url":null,"slug":"check-locate-rectify-a-training-free-layout","title":"Check, Locate, Rectify: A Training-Free Layout Calibration System for Text-to-Image Generation","date":"2023-11-27","arxiv_id":"2311.15773","repositories_listed":0,"syntology":null},{"url":null,"slug":"et3d-efficient-text-to-3d-generation-via","title":"ET3D: Efficient Text-to-3D Generation via Multi-View Distillation","date":"2023-11-27","arxiv_id":"2311.15561","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-disentangled-identifiers-for-action","title":"Learning Disentangled Identifiers for Action-Customized Text-to-Image Generation","date":"2023-11-27","arxiv_id":"2311.15841","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-trained-language-models-do-not-help-auto","title":"Pre-trained Language Models Do Not Help Auto-regressive Text-to-Image Generation","date":"2023-11-27","arxiv_id":"2311.16201","repositories_listed":0,"syntology":null},{"url":null,"slug":"beautifulprompt-towards-automatic-prompt","title":"BeautifulPrompt: Towards Automatic Prompt Engineering for Text-to-Image Synthesis","date":"2023-11-12","arxiv_id":"2311.06752","repositories_listed":0,"syntology":null},{"url":null,"slug":"chatanything-facetime-chat-with-llm-enhanced","title":"ChatAnything: Facetime Chat with LLM-Enhanced Personas","date":"2023-11-12","arxiv_id":"2311.06772","repositories_listed":0,"syntology":null},{"url":null,"slug":"controlstyle-text-driven-stylized-image","title":"ControlStyle: Text-Driven Stylized Image Generation Using Diffusion Priors","date":"2023-11-09","arxiv_id":"2311.05463","repositories_listed":0,"syntology":null},{"url":null,"slug":"llm-as-an-art-director-ladi-using-llms-to","title":"LLM as an Art Director (LaDi): Using LLMs to improve Text-to-Media Generators","date":"2023-11-07","arxiv_id":"2311.03716","repositories_listed":0,"syntology":null},{"url":null,"slug":"customnet-zero-shot-object-customization-with","title":"CustomNet: Zero-shot Object Customization with Variable-Viewpoints in Text-to-Image Diffusion Models","date":"2023-10-30","arxiv_id":"2310.19784","repositories_listed":0,"syntology":null},{"url":null,"slug":"davidsonian-scene-graph-improving-reliability","title":"Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation","date":"2023-10-27","arxiv_id":"2310.18235","repositories_listed":0,"syntology":null},{"url":null,"slug":"diverse-diffusion-enhancing-image-diversity","title":"Diverse Diffusion: Enhancing Image Diversity in Text-to-Image Generation","date":"2023-10-19","arxiv_id":"2310.12583","repositories_listed":0,"syntology":null},{"url":null,"slug":"r-b-region-and-boundary-aware-zero-shot","title":"R&B: Region and Boundary Aware Zero-shot Grounded Text-to-image Generation","date":"2023-10-13","arxiv_id":"2310.08872","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-concept-t2i-zero-tweaking-only-the-text","title":"Multi-Concept T2I-Zero: Tweaking Only The Text Embeddings and Nothing Else","date":"2023-10-11","arxiv_id":"2310.07419","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-compositional-text-to-image","title":"Improving Compositional Text-to-image Generation with Large Vision-Language Models","date":"2023-10-10","arxiv_id":"2310.06311","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-unpaired-data-for-vision-language","title":"Leveraging Unpaired Data for Vision-Language Generative Models via Cycle Consistency","date":"2023-10-05","arxiv_id":"2310.03734","repositories_listed":0,"syntology":null},{"url":null,"slug":"amazing-combinatorial-creation-acceptable","title":"TP2O: Creative Text Pair-to-Object Generation using Balance Swap-Sampling","date":"2023-10-03","arxiv_id":"2310.01819","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamcom-finetuning-text-guided-inpainting","title":"DreamCom: Finetuning Text-guided Inpainting Model for Image Composition","date":"2023-09-27","arxiv_id":"2309.15508","repositories_listed":0,"syntology":null},{"url":null,"slug":"teaching-text-to-image-models-to-communicate","title":"Teaching Text-to-Image Models to Communicate in Dialog","date":"2023-09-27","arxiv_id":"2309.15516","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-to-image-generation-for-abstract","title":"Text-to-Image Generation for Abstract Concepts","date":"2023-09-26","arxiv_id":"2309.14623","repositories_listed":0,"syntology":null},{"url":"/paper/language-oriented-communication-with-semantic","slug":"language-oriented-communication-with-semantic","title":"Language-Oriented Communication with Semantic Coding and Knowledge Distillation for Text-to-Image Generation","date":"2023-09-20","arxiv_id":"2309.11127","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-semantic-generative-communication","title":"Sequential Semantic Generative Communication for Progressive Text-to-Image Generation","date":"2023-09-08","arxiv_id":"2309.04287","repositories_listed":0,"syntology":null},{"url":null,"slug":"text2control3d-controllable-3d-avatar","title":"Text2Control3D: Controllable 3D Avatar Generation in Neural Radiance Fields using Geometry-Guided Text-to-Image Diffusion Model","date":"2023-09-07","arxiv_id":"2309.03550","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridge-diffusion-model-bridge-non-english","title":"Bridge Diffusion Model: bridge non-English language-native text-to-image diffusion model with English communities","date":"2023-09-02","arxiv_id":"2309.00952","repositories_listed":0,"syntology":null},{"url":null,"slug":"renaissance-a-survey-into-ai-text-to-image","title":"RenAIssance: A Survey into AI Text-to-Image Generation in the Era of Large Model","date":"2023-09-02","arxiv_id":"2309.00810","repositories_listed":0,"syntology":null},{"url":null,"slug":"videogen-a-reference-guided-latent-diffusion","title":"VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation","date":"2023-09-01","arxiv_id":"2309.00398","repositories_listed":0,"syntology":null},{"url":null,"slug":"identifying-and-mitigating-the-security-risks","title":"Identifying and Mitigating the Security Risks of Generative AI","date":"2023-08-28","arxiv_id":"2308.14840","repositories_listed":0,"syntology":null},{"url":null,"slug":"controlretriever-harnessing-the-power-of","title":"I3: Intent-Introspective Retrieval Conditioned on Instructions","date":"2023-08-19","arxiv_id":"2308.10025","repositories_listed":0,"syntology":null},{"url":null,"slug":"guide3d-create-3d-avatars-from-text-and-image","title":"Guide3D: Create 3D Avatars from Text and Image Guidance","date":"2023-08-18","arxiv_id":"2308.09705","repositories_listed":0,"syntology":null},{"url":"/paper/scire-solver-efficient-sampling-of-diffusion","slug":"scire-solver-efficient-sampling-of-diffusion","title":"SciRE-Solver: Accelerating Diffusion Models Sampling by Score-integrand Solver with Recursive Difference","date":"2023-08-15","arxiv_id":"2308.07896","repositories_listed":0,"syntology":null},{"url":null,"slug":"spegti-structured-prediction-for-efficient","title":"MarkovGen: Structured Prediction for Efficient Text-to-Image Generation","date":"2023-08-14","arxiv_id":"2308.10997","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-data-protection-with-compositional","title":"Training Data Protection with Compositional Diffusion Models","date":"2023-08-02","arxiv_id":"2308.01937","repositories_listed":0,"syntology":null},{"url":null,"slug":"promptcrafter-crafting-text-to-image-prompt","title":"PromptCrafter: Crafting Text-to-Image Prompt through Mixed-Initiative Dialogue with LLM","date":"2023-07-18","arxiv_id":"2307.08985","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusegae-controllable-and-high-fidelity","title":"DiffuseGAE: Controllable and High-fidelity Image Manipulation from Disentangled Representation","date":"2023-07-12","arxiv_id":"2307.05899","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-cultural-gap-in-text-to-image","title":"On the Cultural Gap in Text-to-Image Generation","date":"2023-07-06","arxiv_id":"2307.02971","repositories_listed":0,"syntology":null},{"url":null,"slug":"counting-guidance-for-high-fidelity-text-to","title":"Counting Guidance for High Fidelity Text-to-Image Synthesis","date":"2023-06-30","arxiv_id":"2306.17567","repositories_listed":0,"syntology":null},{"url":"/paper/stay-on-topic-with-classifier-free-guidance","slug":"stay-on-topic-with-classifier-free-guidance","title":"Stay on topic with Classifier-Free Guidance","date":"2023-06-30","arxiv_id":"2306.17806","repositories_listed":0,"syntology":null},{"url":null,"slug":"clipag-towards-generator-free-text-to-image","title":"CLIPAG: Towards Generator-Free Text-to-Image Generation","date":"2023-06-29","arxiv_id":"2306.16805","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximated-prompt-tuning-for-vision","title":"Approximated Prompt Tuning for Vision-Language Pre-trained Models","date":"2023-06-27","arxiv_id":"2306.15706","repositories_listed":0,"syntology":null},{"url":null,"slug":"localized-text-to-image-generation-for-free","title":"Localized Text-to-Image Generation for Free via Cross Attention Control","date":"2023-06-26","arxiv_id":"2306.14636","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-cultivated-practices-of-text-to-image","title":"The Cultivated Practices of Text-to-Image Generation","date":"2023-06-20","arxiv_id":"2306.11393","repositories_listed":0,"syntology":null},{"url":null,"slug":"perceptions-and-realities-of-text-to-image","title":"Perceptions and Realities of Text-to-Image Generation","date":"2023-06-14","arxiv_id":"2306.08363","repositories_listed":0,"syntology":null},{"url":null,"slug":"face0-instantaneously-conditioning-a-text-to","title":"Face0: Instantaneously Conditioning a Text-to-Image Model on a Face","date":"2023-06-11","arxiv_id":"2306.06638","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-the-capabilities-of-multi-modal","title":"Evaluating the Capabilities of Multi-modal Reasoning Models with Synthetic Task Data","date":"2023-06-01","arxiv_id":"2306.01144","repositories_listed":0,"syntology":null},{"url":null,"slug":"t2iat-measuring-valence-and-stereotypical","title":"T2IAT: Measuring Valence and Stereotypical Biases in Text-to-Image Generation","date":"2023-06-01","arxiv_id":"2306.00905","repositories_listed":0,"syntology":null},{"url":null,"slug":"unidiff-advancing-vision-language-models-with","title":"UniDiff: Advancing Vision-Language Models with Generative and Discriminative Learning","date":"2023-06-01","arxiv_id":"2306.00813","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-imagery-and-the-overton-window","title":"AI Imagery and the Overton Window","date":"2023-05-31","arxiv_id":"2306.00080","repositories_listed":0,"syntology":null},{"url":null,"slug":"cones-concept-embedding-search-for-parameter","title":"ConES: Concept Embedding Search for Parameter Efficient Tuning Large Vision Language Models","date":"2023-05-30","arxiv_id":"2305.18993","repositories_listed":0,"syntology":null},{"url":null,"slug":"translation-enhanced-multilingual-text-to","title":"Translation-Enhanced Multilingual Text-to-Image Generation","date":"2023-05-30","arxiv_id":"2305.19216","repositories_listed":0,"syntology":null},{"url":null,"slug":"controllable-text-to-image-generation-with","title":"Controllable Text-to-Image Generation with GPT-4","date":"2023-05-29","arxiv_id":"2305.18583","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-fidelity-image-compression-with-score","title":"High-Fidelity Image Compression with Score-based Generative Models","date":"2023-05-26","arxiv_id":"2305.18231","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-visual-story-generation-with","title":"Improved Visual Story Generation with Adaptive Context Modeling","date":"2023-05-26","arxiv_id":"2305.16811","repositories_listed":0,"syntology":null},{"url":null,"slug":"zeroavatar-zero-shot-3d-avatar-generation","title":"ZeroAvatar: Zero-shot 3D Avatar Generation from a Single Image","date":"2023-05-25","arxiv_id":"2305.16411","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-visual-attributes-from-natural","title":"Transferring Visual Attributes from Natural Language to Verified Image Generation","date":"2023-05-24","arxiv_id":"2305.15026","repositories_listed":0,"syntology":null},{"url":"/paper/visual-programming-for-text-to-image","slug":"visual-programming-for-text-to-image","title":"Visual Programming for Text-to-Image Generation and Evaluation","date":"2023-05-24","arxiv_id":"2305.15328","repositories_listed":0,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":3,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/visual-programming-for-text-to-image#ran","syntology_url":"https://syntology.ai/paper/2305.15328","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2305.15328"}},"official":null}},{"url":null,"slug":"the-clip-model-is-secretly-an-image-to-prompt","title":"The CLIP Model is Secretly an Image-to-Prompt Converter","date":"2023-05-22","arxiv_id":"2305.12716","repositories_listed":0,"syntology":null},{"url":null,"slug":"constructing-dreams-using-generative-ai","title":"Constructing Dreams using Generative AI","date":"2023-05-19","arxiv_id":"2305.12013","repositories_listed":0,"syntology":null},{"url":null,"slug":"aiwriting-relations-between-image-generation","title":"AIwriting: Relations Between Image Generation and Digital Writing","date":"2023-05-18","arxiv_id":"2305.10834","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-generative-ai-integrating-gpt-k","title":"Collaborative Generative AI: Integrating GPT-k for Efficient Editing in Text-to-Image Generation","date":"2023-05-18","arxiv_id":"2305.11317","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-fashion-content-generation-using","title":"Interactive Fashion Content Generation Using LLMs and Latent Diffusion Models","date":"2023-05-15","arxiv_id":"2306.05182","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-efficient-fine-tuning-for-medical","title":"Parameter-Efficient Fine-Tuning for Medical Image Analysis: The Missed Opportunity","date":"2023-05-14","arxiv_id":"2305.08252","repositories_listed":0,"syntology":null},{"url":null,"slug":"beware-of-diffusion-models-for-synthesizing","title":"Beware of diffusion models for synthesizing medical images -- A comparison with GANs in terms of memorizing brain MRI and chest x-ray images","date":"2023-05-12","arxiv_id":"2305.07644","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-the-visualness-of-text-using-large","title":"Learning the Visualness of Text Using Large Vision-Language Models","date":"2023-05-11","arxiv_id":"2305.10434","repositories_listed":0,"syntology":null},{"url":null,"slug":"scenegenie-scene-graph-guided-diffusion","title":"SceneGenie: Scene Graph Guided Diffusion Models for Image Synthesis","date":"2023-04-28","arxiv_id":"2304.14573","repositories_listed":0,"syntology":null},{"url":null,"slug":"iconshop-text-based-vector-icon-synthesis","title":"IconShop: Text-Guided Vector Icon Synthesis with Autoregressive Transformers","date":"2023-04-27","arxiv_id":"2304.14400","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-text-to-image-generation-for","title":"Using Text-to-Image Generation for Architectural Design Ideation","date":"2023-04-20","arxiv_id":"2304.10182","repositories_listed":0,"syntology":null},{"url":null,"slug":"promptify-text-to-image-generation-through","title":"Promptify: Text-to-Image Generation through Interactive Prompt Exploration with Large Language Models","date":"2023-04-18","arxiv_id":"2304.09337","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-shift-latent-diffusion-with-temporal","title":"Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation","date":"2023-04-17","arxiv_id":"2304.08477","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-conditional-contextualized-avatars-for","title":"Text-Conditional Contextualized Avatars For Zero-Shot Personalization","date":"2023-04-14","arxiv_id":"2304.07410","repositories_listed":0,"syntology":null},{"url":null,"slug":"alr-gan-adaptive-layout-refinement-for-text","title":"ALR-GAN: Adaptive Layout Refinement for Text-to-Image Synthesis","date":"2023-04-13","arxiv_id":"2304.06297","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-does-clip-know-about-a-red-circle-visual","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","date":"2023-04-13","arxiv_id":"2304.06712","repositories_listed":0,"syntology":null},{"url":null,"slug":"gradient-free-textual-inversion","title":"Gradient-Free Textual Inversion","date":"2023-04-12","arxiv_id":"2304.05818","repositories_listed":0,"syntology":null},{"url":null,"slug":"instantbooth-personalized-text-to-image","title":"InstantBooth: Personalized Text-to-Image Generation without Test-Time Finetuning","date":"2023-04-06","arxiv_id":"2304.03411","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-conditioned-sampling-framework-for-text","title":"Text-Conditioned Sampling Framework for Text-to-Image Generation with Masked Generative Models","date":"2023-04-04","arxiv_id":"2304.01515","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-verifiable-and-reproducible-human","title":"Toward Verifiable and Reproducible Human Evaluation for Text-to-Image Generation","date":"2023-04-04","arxiv_id":"2304.01816","repositories_listed":0,"syntology":null},{"url":null,"slug":"subject-driven-text-to-image-generation-via","title":"Subject-driven Text-to-Image Generation via Apprenticeship Learning","date":"2023-04-01","arxiv_id":"2304.00186","repositories_listed":0,"syntology":null},{"url":null,"slug":"social-biases-through-the-text-to-image","title":"Social Biases through the Text-to-Image Generation Lens","date":"2023-03-30","arxiv_id":"2304.06034","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-distribution-learning-for","title":"Variational Distribution Learning for Unsupervised Text-to-Image Generation","date":"2023-03-28","arxiv_id":"2303.16105","repositories_listed":0,"syntology":null},{"url":null,"slug":"cobit-a-contrastive-bi-directional-image-text","title":"CoBIT: A Contrastive Bi-directional Image-Text Generation Model","date":"2023-03-23","arxiv_id":"2303.13455","repositories_listed":0,"syntology":null},{"url":null,"slug":"explore-the-power-of-synthetic-data-on-few","title":"Explore the Power of Synthetic Data on Few-shot Object Detection","date":"2023-03-23","arxiv_id":"2303.13221","repositories_listed":0,"syntology":null},{"url":null,"slug":"magicfusion-boosting-text-to-image-generation","title":"MagicFusion: Boosting Text-to-Image Generation Performance by Fusing Diffusion Models","date":"2023-03-23","arxiv_id":"2303.13126","repositories_listed":0,"syntology":null}],"record_sha256":"a56a557cad7640db7f52aadae8f56f516b0c3290231a987105dedb74025eb990","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}