{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/text-to-image-generation/papers/9","list_of":"/task/text-to-image-generation","task":"Text-to-Image Generation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":9,"pages_in_order":11,"rows_per_page":100,"rows":[801,900],"of":1085,"counts":{"archive_papers_tagged":1085,"with_a_code_link":546,"where_syntology_ran_a_sample":246,"not_listed_spam_title":0,"listed":1085,"listed_where_code_ran":246,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":215,"every_run_a_failure_of_syntologys_instrument":31,"listed_with_a_run_with_no_instrument_failure":215,"listed_every_run_a_failure_of_syntologys_instrument":31,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/text-to-image-generation","prev":"/task/text-to-image-generation/papers/8","next":"/task/text-to-image-generation/papers/10","papers":[{"url":null,"slug":"can-prompt-modifiers-control-bias-a","title":"Can Prompt Modifiers Control Bias? A Comparative Analysis of Text-to-Image Generative Models","date":"2024-06-09","arxiv_id":"2406.05602","repositories_listed":0,"syntology":null},{"url":null,"slug":"omnicontrolnet-dual-stage-integration-for","title":"OmniControlNet: Dual-stage Integration for Conditional Image Generation","date":"2024-06-09","arxiv_id":"2406.05871","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-text-to-image-generation-and","title":"TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models","date":"2024-06-09","arxiv_id":"2406.05814","repositories_listed":0,"syntology":null},{"url":null,"slug":"attndreambooth-towards-text-aligned","title":"AttnDreamBooth: Towards Text-Aligned Personalized Text-to-Image Generation","date":"2024-06-07","arxiv_id":"2406.05000","repositories_listed":0,"syntology":null},{"url":null,"slug":"inv-adapter-id-customization-generation-via","title":"Inv-Adapter: ID Customization Generation via Image Inversion and Lightweight Adapter","date":"2024-06-05","arxiv_id":"2406.02881","repositories_listed":0,"syntology":null},{"url":null,"slug":"i4vgen-image-as-stepping-stone-for-text-to","title":"I4VGen: Image as Free Stepping Stone for Text-to-Video Generation","date":"2024-06-04","arxiv_id":"2406.02230","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-crystal-ball-hypothesis-in-diffusion","title":"The Crystal Ball Hypothesis in diffusion models: Anticipating object positions from initial noise","date":"2024-06-04","arxiv_id":"2406.01970","repositories_listed":0,"syntology":null},{"url":null,"slug":"dimba-transformer-mamba-diffusion-models","title":"Dimba: Transformer-Mamba Diffusion Models","date":"2024-06-03","arxiv_id":"2406.01159","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-text-generation-on-images-with","title":"Improving Text Generation on Images with Synthetic Captions","date":"2024-06-01","arxiv_id":"2406.00505","repositories_listed":0,"syntology":null},{"url":null,"slug":"boost-your-own-human-image-generation-model","title":"Boost Your Human Image Generation Model via Direct Preference Optimization","date":"2024-05-30","arxiv_id":"2405.20216","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-3d-robotics-perception-using","title":"Learning 3D Robotics Perception using Inductive Priors","date":"2024-05-30","arxiv_id":"2405.20364","repositories_listed":0,"syntology":null},{"url":null,"slug":"topological-perspectives-on-optimal","title":"Topological Perspectives on Optimal Multimodal Embedding Spaces","date":"2024-05-29","arxiv_id":"2405.18867","repositories_listed":0,"syntology":null},{"url":null,"slug":"anonymization-prompt-learning-for-facial","title":"Anonymization Prompt Learning for Facial Privacy-Preserving Text-to-Image Generation","date":"2024-05-27","arxiv_id":"2405.16895","repositories_listed":0,"syntology":null},{"url":null,"slug":"sg-adapter-enhancing-text-to-image-generation","title":"SG-Adapter: Enhancing Text-to-Image Generation with Scene Graph Guidance","date":"2024-05-24","arxiv_id":"2405.15321","repositories_listed":0,"syntology":null},{"url":null,"slug":"stylemaster-towards-flexible-stylized-image","title":"ArtWeaver: Advanced Dynamic Style Integration via Diffusion Model","date":"2024-05-24","arxiv_id":"2405.15287","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-residuals-for-concept-driven","title":"Personalized Residuals for Concept-Driven Text-to-Image Generation","date":"2024-05-21","arxiv_id":"2405.12978","repositories_listed":0,"syntology":null},{"url":null,"slug":"trilora-integrating-svd-for-advanced-style","title":"TriLoRA: Integrating SVD for Advanced Style Personalization in Text-to-Image Generation","date":"2024-05-18","arxiv_id":"2405.11236","repositories_listed":0,"syntology":null},{"url":null,"slug":"upam-unified-prompt-attack-in-text-to-image","title":"UPAM: Unified Prompt Attack in Text-to-Image Generation Models Against Both Textual Filters and Visual Checkers","date":"2024-05-18","arxiv_id":"2405.11336","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-face-generation-quality-and-prompt","title":"Improving face generation quality and prompt following with synthetic captions","date":"2024-05-17","arxiv_id":"2405.10864","repositories_listed":0,"syntology":null},{"url":null,"slug":"virtualmodel-generating-object-id-retentive","title":"VirtualModel: Generating Object-ID-retentive Human-object Interaction Image by Diffusion Model for E-commerce Marketing","date":"2024-05-16","arxiv_id":"2405.09985","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-text-to-image-generation-with","title":"Compositional Text-to-Image Generation with Dense Blob Representations","date":"2024-05-14","arxiv_id":"2405.08246","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-free-subject-enhanced-attention","title":"Training-free Subject-Enhanced Attention Guidance for Compositional Text-to-image Generation","date":"2024-05-11","arxiv_id":"2405.06948","repositories_listed":0,"syntology":null},{"url":null,"slug":"controllable-image-generation-with-composed","title":"Controllable Image Generation With Composed Parallel Token Prediction","date":"2024-05-10","arxiv_id":"2405.06535","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-personalized-content-synthesis","title":"A Survey on Personalized Content Synthesis with Diffusion Models","date":"2024-05-09","arxiv_id":"2405.05538","repositories_listed":0,"syntology":null},{"url":null,"slug":"flexecontrol-flexible-and-efficient","title":"FlexEControl: Flexible and Efficient Multimodal Control for Text-to-Image Generation","date":"2024-05-08","arxiv_id":"2405.04834","repositories_listed":0,"syntology":null},{"url":null,"slug":"sonicdiffusion-audio-driven-image-generation","title":"SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models","date":"2024-05-01","arxiv_id":"2405.00878","repositories_listed":0,"syntology":null},{"url":null,"slug":"docci-descriptions-of-connected-and","title":"DOCCI: Descriptions of Connected and Contrasting Images","date":"2024-04-30","arxiv_id":"2404.19753","repositories_listed":0,"syntology":null},{"url":null,"slug":"trinity-detector-text-assisted-and-attention","title":"Trinity Detector:text-assisted and attention mechanisms based spectral fusion for diffusion generation image detection","date":"2024-04-26","arxiv_id":"2404.17254","repositories_listed":0,"syntology":null},{"url":null,"slug":"finematch-aspect-based-fine-grained-image-and","title":"FINEMATCH: Aspect-based Fine-grained Image and Text Mismatch Detection and Correction","date":"2024-04-23","arxiv_id":"2404.14715","repositories_listed":0,"syntology":null},{"url":null,"slug":"glod-composing-global-contexts-and-local","title":"GLoD: Composing Global Contexts and Local Details in Image Generation","date":"2024-04-23","arxiv_id":"2404.15447","repositories_listed":0,"syntology":null},{"url":null,"slug":"id-aligner-enhancing-identity-preserving-text","title":"ID-Aligner: Enhancing Identity-Preserving Text-to-Image Generation with Reward Feedback Learning","date":"2024-04-23","arxiv_id":"2404.15449","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-large-language-model-is-a-human","title":"Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation","date":"2024-04-23","arxiv_id":"2404.15100","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-better-text-to-image-generation","title":"Towards Better Text-to-Image Generation Alignment via Attention Modulation","date":"2024-04-22","arxiv_id":"2404.13899","repositories_listed":0,"syntology":null},{"url":null,"slug":"ltos-layout-controllable-text-object","title":"LTOS: Layout-controllable Text-Object Synthesis via Adaptive Cross-attention Fusions","date":"2024-04-21","arxiv_id":"2404.13579","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-attribute-binding-in-text-to-image","title":"Object-Attribute Binding in Text-to-Image Generation: Evaluation and Control","date":"2024-04-21","arxiv_id":"2404.13766","repositories_listed":0,"syntology":null},{"url":null,"slug":"edgefusion-on-device-text-to-image-generation","title":"EdgeFusion: On-Device Text-to-Image Generation","date":"2024-04-18","arxiv_id":"2404.11925","repositories_listed":0,"syntology":null},{"url":null,"slug":"maxfusion-plug-play-multi-modal-generation-in","title":"MaxFusion: Plug&Play Multi-Modal Generation in Text-to-Image Diffusion Models","date":"2024-04-15","arxiv_id":"2404.09977","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamscape-3d-scene-creation-via-gaussian","title":"DreamScape: 3D Scene Creation via Gaussian Splatting joint Correlation Modeling","date":"2024-04-14","arxiv_id":"2404.09227","repositories_listed":0,"syntology":null},{"url":null,"slug":"mask-controlnet-higher-quality-image","title":"Mask-ControlNet: Higher-Quality Image Generation with An Additional Mask Prompt","date":"2024-04-08","arxiv_id":"2404.05331","repositories_listed":0,"syntology":null},{"url":null,"slug":"unifl-improve-stable-diffusion-via-unified","title":"UniFL: Improve Latent Diffusion Model via Unified Feedback Learning","date":"2024-04-08","arxiv_id":"2404.05595","repositories_listed":0,"syntology":null},{"url":null,"slug":"concept-weaver-enabling-multi-concept-fusion","title":"Concept Weaver: Enabling Multi-Concept Fusion in Text-to-Image Models","date":"2024-04-05","arxiv_id":"2404.03913","repositories_listed":0,"syntology":null},{"url":null,"slug":"diverse-and-tailored-image-generation-for","title":"Diverse and Tailored Image Generation for Zero-shot Multi-label Classification","date":"2024-04-04","arxiv_id":"2404.03144","repositories_listed":0,"syntology":null},{"url":null,"slug":"matatlas-text-driven-consistent-geometry","title":"MatAtlas: Text-driven Consistent Geometry Texturing and Material Assignment","date":"2024-04-03","arxiv_id":"2404.02899","repositories_listed":0,"syntology":null},{"url":null,"slug":"mulan-a-multi-layer-annotated-dataset-for","title":"MULAN: A Multi Layer Annotated Dataset for Controllable Text-to-Image Generation","date":"2024-04-03","arxiv_id":"2404.02790","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-scalability-of-diffusion-based-text-to","title":"On the Scalability of Diffusion-based Text-to-Image Generation","date":"2024-04-03","arxiv_id":"2404.02883","repositories_listed":0,"syntology":null},{"url":null,"slug":"jailbreaking-prompt-attack-a-controllable","title":"Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models","date":"2024-04-02","arxiv_id":"2404.02928","repositories_listed":0,"syntology":null},{"url":null,"slug":"condition-aware-neural-network-for-controlled","title":"Condition-Aware Neural Network for Controlled Image Generation","date":"2024-04-01","arxiv_id":"2404.01143","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-agnostic-human-preference-inversion-in","title":"Model-Agnostic Human Preference Inversion in Diffusion Models","date":"2024-04-01","arxiv_id":"2404.00879","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-bias-in-text-to-image-generation","title":"Survey of Bias In Text-to-Image Generation: Definition, Evaluation, and Mitigation","date":"2024-04-01","arxiv_id":"2404.01030","repositories_listed":0,"syntology":null},{"url":"/paper/grid-diffusion-models-for-text-to-video-1","slug":"grid-diffusion-models-for-text-to-video-1","title":"Grid Diffusion Models for Text-to-Video Generation","date":"2024-03-30","arxiv_id":"2404.00234","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-black-box-prompt-engineering-for","title":"Automated Black-box Prompt Engineering for Personalized Text-to-Image Generation","date":"2024-03-28","arxiv_id":"2403.19103","repositories_listed":0,"syntology":null},{"url":null,"slug":"ecnet-effective-controllable-text-to-image","title":"ECNet: Effective Controllable Text-to-Image Diffusion Models","date":"2024-03-27","arxiv_id":"2403.18417","repositories_listed":0,"syntology":null},{"url":null,"slug":"tutorial-on-diffusion-models-for-imaging-and","title":"Tutorial on Diffusion Models for Imaging and Vision","date":"2024-03-26","arxiv_id":"2403.18103","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-intermediate-fusion-vit-enables-efficient","title":"An Intermediate Fusion ViT Enables Efficient Text-Image Alignment in Diffusion Models","date":"2024-03-25","arxiv_id":"2403.16530","repositories_listed":0,"syntology":null},{"url":null,"slug":"isolated-diffusion-optimizing-multi-concept","title":"Isolated Diffusion: Optimizing Multi-Concept Text-to-Image Generation Training-Freely with Isolated Diffusion Guidance","date":"2024-03-25","arxiv_id":"2403.16954","repositories_listed":0,"syntology":null},{"url":null,"slug":"refining-text-to-image-generation-towards","title":"Refining Text-to-Image Generation: Towards Accurate Training-Free Glyph-Enhanced Image Generation","date":"2024-03-25","arxiv_id":"2403.16422","repositories_listed":0,"syntology":null},{"url":null,"slug":"r3cd-scene-graph-to-image-generation-with","title":"R3CD: Scene Graph to Image Generation with Relation-aware Compositional Contrastive Control Diffusion","date":"2024-03-24","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"agfsync-leveraging-ai-generated-feedback-for","title":"AGFSync: Leveraging AI-Generated Feedback for Preference Optimization in Text-to-Image Generation","date":"2024-03-20","arxiv_id":"2403.13352","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-text-to-image-synthesis-survey-and","title":"A Survey on Quality Metrics for Text-to-Image Generation","date":"2024-03-18","arxiv_id":"2403.11821","repositories_listed":0,"syntology":null},{"url":null,"slug":"infinite-id-identity-preserved","title":"Infinite-ID: Identity-preserved Personalization via ID-semantics Decoupling Paradigm","date":"2024-03-18","arxiv_id":"2403.11781","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-personalized-text-to-image-syntheses","title":"Fast Personalized Text-to-Image Syntheses With Attention Injection","date":"2024-03-17","arxiv_id":"2403.11284","repositories_listed":0,"syntology":null},{"url":null,"slug":"denoising-task-difficulty-based-curriculum","title":"Denoising Task Difficulty-based Curriculum for Training Diffusion Models","date":"2024-03-15","arxiv_id":"2403.10348","repositories_listed":0,"syntology":null},{"url":null,"slug":"glyph-byt5-a-customized-text-encoder-for","title":"Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering","date":"2024-03-14","arxiv_id":"2403.09622","repositories_listed":0,"syntology":null},{"url":null,"slug":"block-wise-lora-revisiting-fine-grained-lora","title":"Block-wise LoRA: Revisiting Fine-grained LoRA for Effective Personalization and Stylization in Text-to-Image Generation","date":"2024-03-12","arxiv_id":"2403.07500","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-negative-prompts-for-enhanced","title":"Optimizing Negative Prompts for Enhanced Aesthetics and Fidelity in Text-To-Image Generation","date":"2024-03-12","arxiv_id":"2403.07605","repositories_listed":0,"syntology":null},{"url":null,"slug":"divcon-divide-and-conquer-for-progressive","title":"DivCon: Divide and Conquer for Progressive Text-to-Image Generation","date":"2024-03-11","arxiv_id":"2403.06400","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-finite-data-towards-data-free-out-of","title":"Beyond Finite Data: Towards Data-free Out-of-distribution Generalization via Extrapolation","date":"2024-03-08","arxiv_id":"2403.05523","repositories_listed":0,"syntology":null},{"url":null,"slug":"sora-as-an-agi-world-model-a-complete-survey","title":"Sora as an AGI World Model? A Complete Survey on Text-to-Video Generation","date":"2024-03-08","arxiv_id":"2403.05131","repositories_listed":0,"syntology":null},{"url":null,"slug":"discriminative-probing-and-tuning-for-text-to","title":"Discriminative Probing and Tuning for Text-to-Image Generation","date":"2024-03-07","arxiv_id":"2403.04321","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-understanding-cross-and-self","title":"Towards Understanding Cross and Self-Attention in Stable Diffusion for Text-Guided Image Editing","date":"2024-03-06","arxiv_id":"2403.03431","repositories_listed":0,"syntology":null},{"url":null,"slug":"atomovideo-high-fidelity-image-to-video","title":"AtomoVideo: High Fidelity Image-to-Video Generation","date":"2024-03-04","arxiv_id":"2403.01800","repositories_listed":0,"syntology":null},{"url":null,"slug":"handiffuser-text-to-image-generation-with","title":"HanDiffuser: Text-to-Image Generation With Realistic Hand Appearances","date":"2024-03-04","arxiv_id":"2403.01693","repositories_listed":0,"syntology":null},{"url":null,"slug":"scott-accelerating-diffusion-models-with","title":"SCott: Accelerating Diffusion Models with Stochastic Consistency Distillation","date":"2024-03-03","arxiv_id":"2403.01505","repositories_listed":0,"syntology":null},{"url":null,"slug":"bespoke-non-stationary-solvers-for-fast","title":"Bespoke Non-Stationary Solvers for Fast Sampling of Diffusion and Flow Models","date":"2024-03-02","arxiv_id":"2403.01329","repositories_listed":0,"syntology":null},{"url":null,"slug":"tcig-two-stage-controlled-image-generation","title":"TCIG: Two-Stage Controlled Image Generation with Quality Enhancement through Diffusion","date":"2024-03-02","arxiv_id":"2403.01212","repositories_listed":0,"syntology":null},{"url":"/paper/playground-v2-5-three-insights-towards","slug":"playground-v2-5-three-insights-towards","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","date":"2024-02-27","arxiv_id":"2402.17245","repositories_listed":0,"syntology":null},{"url":null,"slug":"referee-can-play-an-alternative-approach-to","title":"Referee Can Play: An Alternative Approach to Conditional Generation via Model Inversion","date":"2024-02-26","arxiv_id":"2402.16305","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-prompts-improve-disentanglement","title":"Contrastive Prompts Improve Disentanglement in Text-to-Image Diffusion Models","date":"2024-02-21","arxiv_id":"2402.13490","repositories_listed":0,"syntology":null},{"url":null,"slug":"sdxl-lightning-progressive-adversarial","title":"SDXL-Lightning: Progressive Adversarial Diffusion Distillation","date":"2024-02-21","arxiv_id":"2402.13929","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-male-ceo-and-the-female-assistant-probing","title":"The Male CEO and the Female Assistant: Evaluation and Mitigation of Gender Biases in Text-To-Image Generation of Dual Subjects","date":"2024-02-16","arxiv_id":"2402.11089","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-play-fine-tuning-of-diffusion-models-for","title":"Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation","date":"2024-02-15","arxiv_id":"2402.10210","repositories_listed":0,"syntology":null},{"url":"/paper/0-1-laws-for-pattern-occurrences-in","slug":"0-1-laws-for-pattern-occurrences-in","title":"0-1 laws for pattern occurrences in phylogenetic trees and networks","date":"2024-02-07","arxiv_id":"2402.04499","repositories_listed":0,"syntology":null},{"url":null,"slug":"text2street-controllable-text-to-image","title":"Text2Street: Controllable Text-to-image Generation for Street Views","date":"2024-02-07","arxiv_id":"2402.04504","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-shape-infused-joint-embeddings-improve","title":"Can Shape-Infused Joint Embeddings Improve Image-Conditioned 3D Diffusion?","date":"2024-02-02","arxiv_id":"2402.01241","repositories_listed":0,"syntology":null},{"url":null,"slug":"frechet-distance-for-offline-evaluation-of","title":"Fréchet Distance for Offline Evaluation of Information Retrieval Systems with Sparse Labels","date":"2024-01-31","arxiv_id":"2401.17543","repositories_listed":0,"syntology":null},{"url":null,"slug":"divide-and-conquer-language-models-can-plan","title":"Divide and Conquer: Language Models can Plan and Self-Correct for Compositional Text-to-Image Generation","date":"2024-01-28","arxiv_id":"2401.15688","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-driven-one-shot-fine-tuning-of-text-to","title":"Object-Driven One-Shot Fine-tuning of Text-to-Image Diffusion with Prototypical Embedding","date":"2024-01-28","arxiv_id":"2401.15708","repositories_listed":0,"syntology":null},{"url":null,"slug":"styleinject-parameter-efficient-tuning-of","title":"StyleInject: Parameter Efficient Tuning of Text-to-Image Diffusion Models","date":"2024-01-25","arxiv_id":"2401.13942","repositories_listed":0,"syntology":null},{"url":null,"slug":"urbangenai-reconstructing-urban-landscapes","title":"UrbanGenAI: Reconstructing Urban Landscapes using Panoptic Segmentation and Diffusion Models","date":"2024-01-25","arxiv_id":"2401.14379","repositories_listed":0,"syntology":null},{"url":null,"slug":"unimo-g-unified-image-generation-through","title":"UNIMO-G: Unified Image Generation through Multimodal Conditional Diffusion","date":"2024-01-24","arxiv_id":"2401.13388","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-to-image-cross-modal-generation-a","title":"Text-to-Image Cross-Modal Generation: A Systematic Review","date":"2024-01-21","arxiv_id":"2401.11631","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusiongpt-llm-driven-text-to-image","title":"DiffusionGPT: LLM-Driven Text-to-Image Generation System","date":"2024-01-18","arxiv_id":"2401.10061","repositories_listed":0,"syntology":null},{"url":null,"slug":"parrot-pareto-optimal-multi-reward","title":"Parrot: Pareto-optimal Multi-Reward Reinforcement Learning Framework for Text-to-Image Generation","date":"2024-01-11","arxiv_id":"2401.05675","repositories_listed":0,"syntology":null},{"url":null,"slug":"let-s-go-shopping-lgs-web-scale-image-text","title":"Let's Go Shopping (LGS) -- Web-Scale Image-Text Dataset for Visual Concept Understanding","date":"2024-01-09","arxiv_id":"2401.04575","repositories_listed":0,"syntology":null},{"url":"/paper/improving-diffusion-based-image-synthesis-1","slug":"improving-diffusion-based-image-synthesis-1","title":"Improving Diffusion-Based Image Synthesis with Context Prediction","date":"2024-01-04","arxiv_id":"2401.02015","repositories_listed":0,"syntology":null},{"url":null,"slug":"check-locate-rectify-a-training-free-layout-1","title":"Check Locate Rectify: A Training-Free Layout Calibration System for Text-to-Image Generation","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"countering-personalized-text-to-image","title":"Countering Personalized Text-to-Image Generation with Influence Watermarks","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"magick-a-large-scale-captioned-dataset-from","title":"MAGICK: A Large-scale Captioned Dataset from Matting Generated Images using Chroma Keying","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"one-dimensional-adapter-to-rule-them-all-1","title":"One-dimensional Adapter to Rule Them All: Concepts Diffusion Models and Erasing Applications","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-expansion-for-adaptive-text-to-image","title":"Prompt Expansion for Adaptive Text-to-Image Generation","date":"2023-12-27","arxiv_id":"2312.16720","repositories_listed":0,"syntology":null}],"record_sha256":"7d7fc9e7fdde83b5aed81f0345c6e9aa75d43ebc83944935ba92030de3e002eb","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}