{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/text-to-image-generation/papers/8","list_of":"/task/text-to-image-generation","task":"Text-to-Image Generation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":8,"pages_in_order":11,"rows_per_page":100,"rows":[701,800],"of":1085,"counts":{"archive_papers_tagged":1085,"with_a_code_link":546,"where_syntology_ran_a_sample":246,"not_listed_spam_title":0,"listed":1085,"listed_where_code_ran":246,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":215,"every_run_a_failure_of_syntologys_instrument":31,"listed_with_a_run_with_no_instrument_failure":215,"listed_every_run_a_failure_of_syntologys_instrument":31,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/text-to-image-generation","prev":"/task/text-to-image-generation/papers/7","next":"/task/text-to-image-generation/papers/9","papers":[{"url":null,"slug":"safetydpo-scalable-safety-alignment-for-text","title":"SafetyDPO: Scalable Safety Alignment for Text-to-Image Generation","date":"2024-12-13","arxiv_id":"2412.10493","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-conditional-latent-diffusion-models","title":"Are Conditional Latent Diffusion Models Effective for Image Restoration?","date":"2024-12-12","arxiv_id":"2412.09324","repositories_listed":0,"syntology":null},{"url":"/paper/snapgen-taming-high-resolution-text-to-image","slug":"snapgen-taming-high-resolution-text-to-image","title":"SnapGen: Taming High-Resolution Text-to-Image Models for Mobile Devices with Efficient Architectures and Training","date":"2024-12-12","arxiv_id":"2412.09619","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-models-represent-darker","title":"Vision-Language Models Represent Darker-Skinned Black Individuals as More Homogeneous than Lighter-Skinned Black Individuals","date":"2024-12-12","arxiv_id":"2412.09668","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-syntax-uncovering-syntactic-learning","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","date":"2024-12-11","arxiv_id":"2412.08111","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffsensei-bridging-multi-modal-llms-and","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","date":"2024-12-10","arxiv_id":"2412.07589","repositories_listed":0,"syntology":null},{"url":null,"slug":"fiva-fine-grained-visual-attribute-dataset","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","date":"2024-12-10","arxiv_id":"2412.07674","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-and-sequential-text-to-image","title":"Preference Adaptive and Sequential Text-to-Image Generation","date":"2024-12-10","arxiv_id":"2412.10419","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficiency-meets-fidelity-a-novel","title":"Efficiency Meets Fidelity: A Novel Quantization Framework for Stable Diffusion","date":"2024-12-09","arxiv_id":"2412.06661","repositories_listed":0,"syntology":null},{"url":null,"slug":"budgetfusion-perceptually-guided-adaptive","title":"BudgetFusion: Perceptually-Guided Adaptive Diffusion Models","date":"2024-12-08","arxiv_id":"2412.05780","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-guided-image-tokenization-for","title":"Language-Guided Image Tokenization for Generation","date":"2024-12-08","arxiv_id":"2412.05796","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-guidance-boosting-flow-and-diffusion","title":"Self-Guidance: Boosting Flow and Diffusion Generation on Their Own","date":"2024-12-08","arxiv_id":"2412.05827","repositories_listed":0,"syntology":null},{"url":null,"slug":"silmm-self-improving-large-multimodal-models","title":"SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation","date":"2024-12-08","arxiv_id":"2412.05818","repositories_listed":0,"syntology":null},{"url":null,"slug":"bodymetric-evaluating-the-realism-of","title":"BodyMetric: Evaluating the Realism of Human Bodies in Text-to-Image Generation","date":"2024-12-05","arxiv_id":"2412.04086","repositories_listed":0,"syntology":null},{"url":null,"slug":"layerfusion-harmonized-multi-layer-text-to","title":"LayerFusion: Harmonized Multi-Layer Text-to-Image Generation with Generative Priors","date":"2024-12-05","arxiv_id":"2412.04460","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-communication-round-is-all-it-needs-for","title":"One Communication Round is All It Needs for Federated Fine-Tuning Foundation Models","date":"2024-12-05","arxiv_id":"2412.04650","repositories_listed":0,"syntology":null},{"url":null,"slug":"t2i-factualbench-benchmarking-the-factuality","title":"T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts","date":"2024-12-05","arxiv_id":"2412.04300","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamiccontrol-adaptive-condition-selection","title":"DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation","date":"2024-12-04","arxiv_id":"2412.03255","repositories_listed":0,"syntology":null},{"url":null,"slug":"implicit-priors-editing-in-stable-diffusion","title":"Implicit Priors Editing in Stable Diffusion via Targeted Token Adjustment","date":"2024-12-04","arxiv_id":"2412.03400","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-view-image-diffusion-via-coordinate","title":"Multi-view Image Diffusion via Coordinate Noise and Fourier Attention","date":"2024-12-04","arxiv_id":"2412.03756","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-understanding-and-quantifying","title":"Towards Understanding and Quantifying Uncertainty for Text-to-Image Generation","date":"2024-12-04","arxiv_id":"2412.03178","repositories_listed":0,"syntology":null},{"url":null,"slug":"schedule-on-the-fly-diffusion-time-prediction","title":"Schedule On the Fly: Diffusion Time Prediction for Faster and Better Image Generation","date":"2024-12-02","arxiv_id":"2412.01243","repositories_listed":0,"syntology":null},{"url":null,"slug":"switti-designing-scale-wise-transformers-for","title":"Switti: Designing Scale-Wise Transformers for Text-to-Image Synthesis","date":"2024-12-02","arxiv_id":"2412.01819","repositories_listed":0,"syntology":null},{"url":null,"slug":"memories-of-forgotten-concepts","title":"Memories of Forgotten Concepts","date":"2024-12-01","arxiv_id":"2412.00782","repositories_listed":0,"syntology":null},{"url":null,"slug":"art-free-generative-models-art-creation","title":"Opt-In Art: Learning Art Styles Only from Few Examples","date":"2024-11-29","arxiv_id":"2412.00176","repositories_listed":0,"syntology":null},{"url":null,"slug":"quota-quantifying-objects-with-text-to-image","title":"QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain","date":"2024-11-29","arxiv_id":"2411.19534","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-compositional-text-to-image","title":"Enhancing Compositional Text-to-Image Generation with Reliable Random Seeds","date":"2024-11-27","arxiv_id":"2411.18810","repositories_listed":0,"syntology":null},{"url":null,"slug":"type-r-automatically-retouching-typos-for","title":"Type-R: Automatically Retouching Typos for Text-to-Image Generation","date":"2024-11-27","arxiv_id":"2411.18159","repositories_listed":0,"syntology":null},{"url":null,"slug":"chatgen-automatic-text-to-image-generation","title":"ChatGen: Automatic Text-to-Image Generation From FreeStyle Chatting","date":"2024-11-26","arxiv_id":"2411.17176","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-incremental-learning-in-text-to-image","title":"Reward Incremental Learning in Text-to-Image Generation","date":"2024-11-26","arxiv_id":"2411.17310","repositories_listed":0,"syntology":null},{"url":null,"slug":"debiasing-classifiers-by-amplifying-bias-with","title":"Debiasing Classifiers by Amplifying Bias with Latent Diffusion and Large Language Models","date":"2024-11-25","arxiv_id":"2411.16079","repositories_listed":0,"syntology":null},{"url":"/paper/gradient-free-classifier-guidance-for","slug":"gradient-free-classifier-guidance-for","title":"Gradient-Free Classifier Guidance for Diffusion Model Sampling","date":"2024-11-23","arxiv_id":"2411.15393","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-visual-assessment-for-text-to","title":"Interactive Visual Assessment for Text-to-Image Generation Models","date":"2024-11-23","arxiv_id":"2411.15509","repositories_listed":0,"syntology":null},{"url":null,"slug":"foundation-cures-personalization-recovering","title":"Foundation Cures Personalization: Recovering Facial Personalized Models' Prompt Consistency","date":"2024-11-22","arxiv_id":"2411.15277","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-resolution-image-synthesis-via-next","title":"High-Resolution Image Synthesis via Next-Token Prediction","date":"2024-11-22","arxiv_id":"2411.14808","repositories_listed":0,"syntology":null},{"url":null,"slug":"prioritize-denoising-steps-on-diffusion-model","title":"Prioritize Denoising Steps on Diffusion Model Preference Alignment via Explicit Denoised Distribution Estimation","date":"2024-11-22","arxiv_id":"2411.14871","repositories_listed":0,"syntology":null},{"url":null,"slug":"copyrightmeter-revisiting-copyright","title":"CopyrightMeter: Revisiting Copyright Protection in Text-to-image Models","date":"2024-11-20","arxiv_id":"2411.13144","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-text-to-image-generation-simply-sanitize","title":"Safe Text-to-Image Generation: Simply Sanitize the Prompt Embedding","date":"2024-11-15","arxiv_id":"2411.10329","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-based-evaluation","title":"Visual question answering based evaluation metrics for text-to-image generation","date":"2024-11-15","arxiv_id":"2411.10183","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-previous-steps-a-training-free","title":"Leveraging Previous Steps: A Training-free Fast Solver for Flow Diffusion","date":"2024-11-12","arxiv_id":"2411.07627","repositories_listed":0,"syntology":null},{"url":null,"slug":"image2text2image-a-novel-framework-for-label","title":"Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models","date":"2024-11-08","arxiv_id":"2411.05706","repositories_listed":0,"syntology":null},{"url":null,"slug":"controlling-human-shape-and-pose-in-text-to","title":"Controlling Human Shape and Pose in Text-to-Image Diffusion Models via Domain Adaptation","date":"2024-11-07","arxiv_id":"2411.04724","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-improved-conditioning-mechanisms-and-pre","title":"On Improved Conditioning Mechanisms and Pre-training Strategies for Diffusion Models","date":"2024-11-05","arxiv_id":"2411.03177","repositories_listed":0,"syntology":null},{"url":null,"slug":"mole-enhancing-human-centric-text-to-image","title":"MoLE: Enhancing Human-centric Text-to-image Diffusion via Mixture of Low-rank Experts","date":"2024-10-30","arxiv_id":"2410.23332","repositories_listed":0,"syntology":null},{"url":null,"slug":"fairqueue-rethinking-prompt-learning-for-fair","title":"FairQueue: Rethinking Prompt Learning for Fair Text-to-Image Generation","date":"2024-10-24","arxiv_id":"2410.18615","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-wavelet-diffusion-gan-for-image-super","title":"A Wavelet Diffusion GAN for Image Super-Resolution","date":"2024-10-23","arxiv_id":"2410.17966","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-ranked-preference-optimization-for","title":"Scalable Ranked Preference Optimization for Text-to-Image Generation","date":"2024-10-23","arxiv_id":"2410.18013","repositories_listed":0,"syntology":null},{"url":null,"slug":"mpds-a-movie-posters-dataset-for-image","title":"MPDS: A Movie Posters Dataset for Image Generation with Diffusion Model","date":"2024-10-22","arxiv_id":"2410.16840","repositories_listed":0,"syntology":null},{"url":null,"slug":"kitten-a-knowledge-intensive-evaluation-of","title":"KITTEN: A Knowledge-Intensive Evaluation of Image Generation on Visual Entities","date":"2024-10-15","arxiv_id":"2410.11824","repositories_listed":0,"syntology":null},{"url":null,"slug":"saliency-guided-optimization-of-diffusion","title":"Saliency Guided Optimization of Diffusion Latents","date":"2024-10-14","arxiv_id":"2410.10257","repositories_listed":0,"syntology":null},{"url":null,"slug":"realera-semantic-level-concept-erasure-via","title":"RealEra: Semantic-level Concept Erasure via Neighbor-Concept Mining","date":"2024-10-11","arxiv_id":"2410.09140","repositories_listed":0,"syntology":null},{"url":null,"slug":"dart-denoising-autoregressive-transformer-for","title":"DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation","date":"2024-10-10","arxiv_id":"2410.08159","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-laws-for-diffusion-transformers","title":"Scaling Laws For Diffusion Transformers","date":"2024-10-10","arxiv_id":"2410.08184","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-repellency-for-shielded-generation-in","title":"Sparse Repellency for Shielded Generation in Text-to-image Diffusion Models","date":"2024-10-08","arxiv_id":"2410.06025","repositories_listed":0,"syntology":null},{"url":null,"slug":"omnibooth-learning-latent-control-for-image","title":"OmniBooth: Learning Latent Control for Image Synthesis with Multi-modal Instruction","date":"2024-10-07","arxiv_id":"2410.04932","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncovering-regional-defaults-from","title":"Uncovering Regional Defaults from Photorealistic Forests in Text-to-Image Generation with DALL-E 2","date":"2024-10-03","arxiv_id":"2410.17255","repositories_listed":0,"syntology":null},{"url":null,"slug":"comfygen-prompt-adaptive-workflows-for-text","title":"ComfyGen: Prompt-Adaptive Workflows for Text-to-Image Generation","date":"2024-10-02","arxiv_id":"2410.01731","repositories_listed":0,"syntology":null},{"url":null,"slug":"illustrious-an-open-advanced-illustration","title":"Illustrious: an Open Advanced Illustration Model","date":"2024-09-30","arxiv_id":"2409.19946","repositories_listed":0,"syntology":null},{"url":null,"slug":"maskmamba-a-hybrid-mamba-transformer-model","title":"MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation","date":"2024-09-30","arxiv_id":"2409.19937","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalizing-alignment-paradigm-of-text-to","title":"Generalizing Alignment Paradigm of Text-to-Image Generation with Preferences through $f$-divergence Minimization","date":"2024-09-15","arxiv_id":"2409.09774","repositories_listed":0,"syntology":null},{"url":null,"slug":"ifadapter-instance-feature-control-for","title":"IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation","date":"2024-09-12","arxiv_id":"2409.08240","repositories_listed":0,"syntology":null},{"url":null,"slug":"freeenhance-tuning-free-image-enhancement-via","title":"FreeEnhance: Tuning-Free Image Enhancement via Content-Consistent Noising-and-Denoising Process","date":"2024-09-11","arxiv_id":"2409.07451","repositories_listed":0,"syntology":null},{"url":null,"slug":"poseembroider-towards-a-3d-visual-semantic","title":"PoseEmbroider: Towards a 3D, Visual, Semantic-aware Human Pose Representation","date":"2024-09-10","arxiv_id":"2409.06535","repositories_listed":0,"syntology":null},{"url":null,"slug":"svfit-parameter-efficient-fine-tuning-of","title":"SVFit: Parameter-Efficient Fine-Tuning of Large Pre-Trained Models Using Singular Values","date":"2024-09-09","arxiv_id":"2409.05926","repositories_listed":0,"syntology":null},{"url":null,"slug":"artifade-learning-to-generate-high-quality","title":"ArtiFade: Learning to Generate High-quality Subject from Blemished Images","date":"2024-09-05","arxiv_id":"2409.03745","repositories_listed":0,"syntology":null},{"url":null,"slug":"blended-latent-diffusion-under-attention","title":"Blended Latent Diffusion under Attention Control for Real-World Video Editing","date":"2024-09-05","arxiv_id":"2409.03514","repositories_listed":0,"syntology":null},{"url":null,"slug":"spdiffusion-semantic-protection-diffusion-for","title":"SPDiffusion: Semantic Protection Diffusion for Multi-concept Text-to-image Generation","date":"2024-09-02","arxiv_id":"2409.01327","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-free-sketch-guided-diffusion-with","title":"Training-Free Sketch-Guided Diffusion with Latent Optimization","date":"2024-08-31","arxiv_id":"2409.00313","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-to-image-generation-via-energy-based","title":"Text-to-Image Generation Via Energy-Based CLIP","date":"2024-08-30","arxiv_id":"2408.17046","repositories_listed":0,"syntology":null},{"url":null,"slug":"csgo-content-style-composition-in-text-to","title":"CSGO: Content-Style Composition in Text-to-Image Generation","date":"2024-08-29","arxiv_id":"2408.16766","repositories_listed":0,"syntology":null},{"url":null,"slug":"hand1000-generating-realistic-hands-from-text","title":"Hand1000: Generating Realistic Hands from Text with Only 1,000 Images","date":"2024-08-28","arxiv_id":"2408.15461","repositories_listed":0,"syntology":null},{"url":null,"slug":"reflective-human-machine-co-adaptation-for","title":"Reflective Human-Machine Co-adaptation for Enhanced Text-to-Image Generation Dialogue System","date":"2024-08-27","arxiv_id":"2409.07464","repositories_listed":0,"syntology":null},{"url":null,"slug":"unlocking-intrinsic-fairness-in-stable","title":"Rethinking Training for De-biasing Text-to-Image Generation: Unlocking the Potential of Stable Diffusion","date":"2024-08-22","arxiv_id":"2408.12692","repositories_listed":0,"syntology":null},{"url":null,"slug":"frap-faithful-and-realistic-text-to-image","title":"FRAP: Faithful and Realistic Text-to-Image Generation with Adaptive Prompt Weighting","date":"2024-08-21","arxiv_id":"2408.11706","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-object-count-optimization-for-text","title":"Detection-Driven Object Count Optimization for Text-to-Image Diffusion Models","date":"2024-08-21","arxiv_id":"2408.11721","repositories_listed":0,"syntology":null},{"url":null,"slug":"saner-annotation-free-societal-attribute","title":"SANER: Annotation-free Societal Attribute Neutralizer for Debiasing CLIP","date":"2024-08-19","arxiv_id":"2408.10202","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-brittleness-of-ai-generated-image","title":"The Brittleness of AI-Generated Image Watermarking Techniques: Examining Their Robustness Against Visual Paraphrasing Attacks","date":"2024-08-19","arxiv_id":"2408.10446","repositories_listed":0,"syntology":null},{"url":null,"slug":"difflora-generating-personalized-low-rank","title":"DiffLoRA: Generating Personalized Low-Rank Adaptation Weights with Diffusion","date":"2024-08-13","arxiv_id":"2408.06740","repositories_listed":0,"syntology":null},{"url":null,"slug":"artworks-reimagined-exploring-human-ai-co","title":"Artworks Reimagined: Exploring Human-AI Co-Creation through Body Prompting","date":"2024-08-10","arxiv_id":"2408.05476","repositories_listed":0,"syntology":null},{"url":null,"slug":"instruction-tuning-free-visual-token","title":"Instruction Tuning-free Visual Token Complement for Multimodal LLMs","date":"2024-08-09","arxiv_id":"2408.05019","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-uncertainty-quantification-using","title":"Zero-Shot Uncertainty Quantification using Diffusion Probabilistic Models","date":"2024-08-08","arxiv_id":"2408.04718","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-03001","title":"One Framework to Rule Them All: Unifying Multimodal Tasks with LLM Neural-Tuning","date":"2024-08-06","arxiv_id":"2408.03001","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-fabrication-of-reality-and-fantasy-scene","title":"The Fabrication of Reality and Fantasy: Scene Generation with LLM-Assisted Prompt Interpretation","date":"2024-07-17","arxiv_id":"2407.12579","repositories_listed":0,"syntology":null},{"url":null,"slug":"addressing-image-hallucination-in-text-to","title":"Addressing Image Hallucination in Text-to-Image Generation through Factual Image Retrieval","date":"2024-07-15","arxiv_id":"2407.10683","repositories_listed":0,"syntology":null},{"url":null,"slug":"surgical-text-to-image-generation","title":"Surgical Text-to-Image Generation","date":"2024-07-12","arxiv_id":"2407.09230","repositories_listed":0,"syntology":null},{"url":null,"slug":"jedi-joint-image-diffusion-models-for-1","title":"JeDi: Joint-Image Diffusion Models for Finetuning-Free Personalized Text-to-Image Generation","date":"2024-07-08","arxiv_id":"2407.06187","repositories_listed":0,"syntology":null},{"url":null,"slug":"chest-diffusion-a-light-weight-text-to-image","title":"Chest-Diffusion: A Light-Weight Text-to-Image Model for Report-to-CXR Generation","date":"2024-06-30","arxiv_id":"2407.00752","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-stable-is-stable-diffusion-under","title":"How Stable is Stable Diffusion under Recursive InPainting (RIP)?","date":"2024-06-27","arxiv_id":"2407.09549","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-thumbs-up-down-untangling-challenges","title":"Beyond Thumbs Up/Down: Untangling Challenges of Fine-Grained Feedback for Text-to-Image Generation","date":"2024-06-24","arxiv_id":"2406.16807","repositories_listed":0,"syntology":null},{"url":null,"slug":"invertible-consistency-distillation-for-text","title":"Invertible Consistency Distillation for Text-Guided Image Editing in Around 7 Steps","date":"2024-06-20","arxiv_id":"2406.14539","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-role-of-large-language-models","title":"Exploring the Role of Large Language Models in Prompt Encoding for Diffusion Models","date":"2024-06-17","arxiv_id":"2406.11831","repositories_listed":0,"syntology":null},{"url":null,"slug":"poetry2image-an-iterative-correction","title":"Poetry2Image: An Iterative Correction Framework for Images Generated from Chinese Classical Poetry","date":"2024-06-15","arxiv_id":"2407.06196","repositories_listed":0,"syntology":null},{"url":null,"slug":"crafting-parts-for-expressive-object","title":"Crafting Parts for Expressive Object Composition","date":"2024-06-14","arxiv_id":"2406.10197","repositories_listed":0,"syntology":null},{"url":null,"slug":"toffee-efficient-million-scale-dataset","title":"Toffee: Efficient Million-Scale Dataset Construction for Subject-Driven Text-to-Image Generation","date":"2024-06-13","arxiv_id":"2406.09305","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-soup-model-merging-for-text-to","title":"Diffusion Soup: Model Merging for Text-to-Image Diffusion Models","date":"2024-06-12","arxiv_id":"2406.08431","repositories_listed":0,"syntology":null},{"url":null,"slug":"fontstudio-shape-adaptive-diffusion-model-for","title":"FontStudio: Shape-Adaptive Diffusion Model for Coherent and Consistent Font Effect Generation","date":"2024-06-12","arxiv_id":"2406.08392","repositories_listed":0,"syntology":null},{"url":"/paper/what-if-we-recaption-billions-of-web-images","slug":"what-if-we-recaption-billions-of-web-images","title":"What If We Recaption Billions of Web Images with LLaMA-3?","date":"2024-06-12","arxiv_id":"2406.08478","repositories_listed":0,"syntology":null},{"url":null,"slug":"words-worth-a-thousand-pictures-measuring-and","title":"Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation","date":"2024-06-12","arxiv_id":"2406.08482","repositories_listed":0,"syntology":null},{"url":null,"slug":"commonsense-t2i-challenge-can-text-to-image","title":"Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?","date":"2024-06-11","arxiv_id":"2406.07546","repositories_listed":0,"syntology":null},{"url":null,"slug":"ctrl-x-controlling-structure-and-appearance","title":"Ctrl-X: Controlling Structure and Appearance for Text-To-Image Generation Without Guidance","date":"2024-06-11","arxiv_id":"2406.07540","repositories_listed":0,"syntology":null}],"record_sha256":"699352fcae64deede6df806b3ff068f91851b8ae1af179db8c0de2e3f562bd92","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}