{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/text-to-image-generation-1/papers/7","list_of":"/task/text-to-image-generation-1","task":"Text to Image Generation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":7,"pages_in_order":10,"rows_per_page":100,"rows":[601,700],"of":969,"counts":{"archive_papers_tagged":969,"with_a_code_link":461,"where_syntology_ran_a_sample":198,"not_listed_spam_title":0,"listed":969,"listed_where_code_ran":198,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":171,"every_run_a_failure_of_syntologys_instrument":27,"listed_with_a_run_with_no_instrument_failure":171,"listed_every_run_a_failure_of_syntologys_instrument":27,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/text-to-image-generation-1","prev":"/task/text-to-image-generation-1/papers/6","next":"/task/text-to-image-generation-1/papers/8","papers":[{"url":null,"slug":"mc-2-multi-concept-guidance-for-customized-1","title":"MC^2: Multi-concept Guidance for Customized Multi-concept Generation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"patch-matters-training-free-fine-grained","title":"Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ske-layout-spatial-knowledge-enhanced-layout","title":"SKE-Layout: Spatial Knowledge Enhanced Layout Generation with LLMs","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"vodiff-controlling-object-visibility-order-in","title":"VODiff: Controlling Object Visibility Order in Text-to-Image Generation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"prometheus-3d-aware-latent-diffusion-models","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","date":"2024-12-30","arxiv_id":"2412.21117","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-free-group-wise-fully-quantized-winograd","title":"Data-Free Group-Wise Fully Quantized Winograd Convolution via Learnable Scales","date":"2024-12-27","arxiv_id":"2412.19867","repositories_listed":0,"syntology":null},{"url":null,"slug":"unic-adapter-unified-image-instruction","title":"UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation","date":"2024-12-25","arxiv_id":"2412.18928","repositories_listed":0,"syntology":null},{"url":null,"slug":"1-58-bit-flux","title":"1.58-bit FLUX","date":"2024-12-24","arxiv_id":"2412.18653","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-corrected-flow-distillation-for","title":"Self-Corrected Flow Distillation for Consistent One-Step and Few-Step Text-to-Image Generation","date":"2024-12-22","arxiv_id":"2412.16906","repositories_listed":0,"syntology":null},{"url":null,"slug":"flowing-from-words-to-pixels-a-framework-for","title":"Flowing from Words to Pixels: A Framework for Cross-Modality Evolution","date":"2024-12-19","arxiv_id":"2412.15213","repositories_listed":0,"syntology":null},{"url":null,"slug":"galot-generative-active-learning-via","title":"GALOT: Generative Active Learning via Optimizable Zero-shot Text-to-image Generation","date":"2024-12-18","arxiv_id":"2412.16227","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-lora-is-worth-a-thousand-pictures","title":"A LoRA is Worth a Thousand Pictures","date":"2024-12-16","arxiv_id":"2412.12048","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-scaling-of-diffusion-transformers","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","date":"2024-12-16","arxiv_id":"2412.12391","repositories_listed":0,"syntology":null},{"url":null,"slug":"safetydpo-scalable-safety-alignment-for-text","title":"SafetyDPO: Scalable Safety Alignment for Text-to-Image Generation","date":"2024-12-13","arxiv_id":"2412.10493","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-conditional-latent-diffusion-models","title":"Are Conditional Latent Diffusion Models Effective for Image Restoration?","date":"2024-12-12","arxiv_id":"2412.09324","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-models-represent-darker","title":"Vision-Language Models Represent Darker-Skinned Black Individuals as More Homogeneous than Lighter-Skinned Black Individuals","date":"2024-12-12","arxiv_id":"2412.09668","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-syntax-uncovering-syntactic-learning","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","date":"2024-12-11","arxiv_id":"2412.08111","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffsensei-bridging-multi-modal-llms-and","title":"DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation","date":"2024-12-10","arxiv_id":"2412.07589","repositories_listed":0,"syntology":null},{"url":null,"slug":"fiva-fine-grained-visual-attribute-dataset","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","date":"2024-12-10","arxiv_id":"2412.07674","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-and-sequential-text-to-image","title":"Preference Adaptive and Sequential Text-to-Image Generation","date":"2024-12-10","arxiv_id":"2412.10419","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficiency-meets-fidelity-a-novel","title":"Efficiency Meets Fidelity: A Novel Quantization Framework for Stable Diffusion","date":"2024-12-09","arxiv_id":"2412.06661","repositories_listed":0,"syntology":null},{"url":null,"slug":"budgetfusion-perceptually-guided-adaptive","title":"BudgetFusion: Perceptually-Guided Adaptive Diffusion Models","date":"2024-12-08","arxiv_id":"2412.05780","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-guided-image-tokenization-for","title":"Language-Guided Image Tokenization for Generation","date":"2024-12-08","arxiv_id":"2412.05796","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-guidance-boosting-flow-and-diffusion","title":"Self-Guidance: Boosting Flow and Diffusion Generation on Their Own","date":"2024-12-08","arxiv_id":"2412.05827","repositories_listed":0,"syntology":null},{"url":null,"slug":"silmm-self-improving-large-multimodal-models","title":"SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation","date":"2024-12-08","arxiv_id":"2412.05818","repositories_listed":0,"syntology":null},{"url":null,"slug":"bodymetric-evaluating-the-realism-of","title":"BodyMetric: Evaluating the Realism of Human Bodies in Text-to-Image Generation","date":"2024-12-05","arxiv_id":"2412.04086","repositories_listed":0,"syntology":null},{"url":null,"slug":"layerfusion-harmonized-multi-layer-text-to","title":"LayerFusion: Harmonized Multi-Layer Text-to-Image Generation with Generative Priors","date":"2024-12-05","arxiv_id":"2412.04460","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-communication-round-is-all-it-needs-for","title":"One Communication Round is All It Needs for Federated Fine-Tuning Foundation Models","date":"2024-12-05","arxiv_id":"2412.04650","repositories_listed":0,"syntology":null},{"url":null,"slug":"t2i-factualbench-benchmarking-the-factuality","title":"T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts","date":"2024-12-05","arxiv_id":"2412.04300","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamiccontrol-adaptive-condition-selection","title":"DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation","date":"2024-12-04","arxiv_id":"2412.03255","repositories_listed":0,"syntology":null},{"url":null,"slug":"implicit-priors-editing-in-stable-diffusion","title":"Implicit Priors Editing in Stable Diffusion via Targeted Token Adjustment","date":"2024-12-04","arxiv_id":"2412.03400","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-view-image-diffusion-via-coordinate","title":"Multi-view Image Diffusion via Coordinate Noise and Fourier Attention","date":"2024-12-04","arxiv_id":"2412.03756","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-understanding-and-quantifying","title":"Towards Understanding and Quantifying Uncertainty for Text-to-Image Generation","date":"2024-12-04","arxiv_id":"2412.03178","repositories_listed":0,"syntology":null},{"url":null,"slug":"schedule-on-the-fly-diffusion-time-prediction","title":"Schedule On the Fly: Diffusion Time Prediction for Faster and Better Image Generation","date":"2024-12-02","arxiv_id":"2412.01243","repositories_listed":0,"syntology":null},{"url":null,"slug":"switti-designing-scale-wise-transformers-for","title":"Switti: Designing Scale-Wise Transformers for Text-to-Image Synthesis","date":"2024-12-02","arxiv_id":"2412.01819","repositories_listed":0,"syntology":null},{"url":null,"slug":"memories-of-forgotten-concepts","title":"Memories of Forgotten Concepts","date":"2024-12-01","arxiv_id":"2412.00782","repositories_listed":0,"syntology":null},{"url":null,"slug":"quota-quantifying-objects-with-text-to-image","title":"QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain","date":"2024-11-29","arxiv_id":"2411.19534","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-compositional-text-to-image","title":"Enhancing Compositional Text-to-Image Generation with Reliable Random Seeds","date":"2024-11-27","arxiv_id":"2411.18810","repositories_listed":0,"syntology":null},{"url":null,"slug":"type-r-automatically-retouching-typos-for","title":"Type-R: Automatically Retouching Typos for Text-to-Image Generation","date":"2024-11-27","arxiv_id":"2411.18159","repositories_listed":0,"syntology":null},{"url":null,"slug":"chatgen-automatic-text-to-image-generation","title":"ChatGen: Automatic Text-to-Image Generation From FreeStyle Chatting","date":"2024-11-26","arxiv_id":"2411.17176","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-incremental-learning-in-text-to-image","title":"Reward Incremental Learning in Text-to-Image Generation","date":"2024-11-26","arxiv_id":"2411.17310","repositories_listed":0,"syntology":null},{"url":null,"slug":"debiasing-classifiers-by-amplifying-bias-with","title":"Debiasing Classifiers by Amplifying Bias with Latent Diffusion and Large Language Models","date":"2024-11-25","arxiv_id":"2411.16079","repositories_listed":0,"syntology":null},{"url":"/paper/gradient-free-classifier-guidance-for","slug":"gradient-free-classifier-guidance-for","title":"Gradient-Free Classifier Guidance for Diffusion Model Sampling","date":"2024-11-23","arxiv_id":"2411.15393","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-visual-assessment-for-text-to","title":"Interactive Visual Assessment for Text-to-Image Generation Models","date":"2024-11-23","arxiv_id":"2411.15509","repositories_listed":0,"syntology":null},{"url":null,"slug":"foundation-cures-personalization-recovering","title":"Foundation Cures Personalization: Recovering Facial Personalized Models' Prompt Consistency","date":"2024-11-22","arxiv_id":"2411.15277","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-resolution-image-synthesis-via-next","title":"High-Resolution Image Synthesis via Next-Token Prediction","date":"2024-11-22","arxiv_id":"2411.14808","repositories_listed":0,"syntology":null},{"url":null,"slug":"prioritize-denoising-steps-on-diffusion-model","title":"Prioritize Denoising Steps on Diffusion Model Preference Alignment via Explicit Denoised Distribution Estimation","date":"2024-11-22","arxiv_id":"2411.14871","repositories_listed":0,"syntology":null},{"url":null,"slug":"copyrightmeter-revisiting-copyright","title":"CopyrightMeter: Revisiting Copyright Protection in Text-to-image Models","date":"2024-11-20","arxiv_id":"2411.13144","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-text-to-image-generation-simply-sanitize","title":"Safe Text-to-Image Generation: Simply Sanitize the Prompt Embedding","date":"2024-11-15","arxiv_id":"2411.10329","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-based-evaluation","title":"Visual question answering based evaluation metrics for text-to-image generation","date":"2024-11-15","arxiv_id":"2411.10183","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-previous-steps-a-training-free","title":"Leveraging Previous Steps: A Training-free Fast Solver for Flow Diffusion","date":"2024-11-12","arxiv_id":"2411.07627","repositories_listed":0,"syntology":null},{"url":null,"slug":"image2text2image-a-novel-framework-for-label","title":"Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models","date":"2024-11-08","arxiv_id":"2411.05706","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-improved-conditioning-mechanisms-and-pre","title":"On Improved Conditioning Mechanisms and Pre-training Strategies for Diffusion Models","date":"2024-11-05","arxiv_id":"2411.03177","repositories_listed":0,"syntology":null},{"url":null,"slug":"mole-enhancing-human-centric-text-to-image","title":"MoLE: Enhancing Human-centric Text-to-image Diffusion via Mixture of Low-rank Experts","date":"2024-10-30","arxiv_id":"2410.23332","repositories_listed":0,"syntology":null},{"url":null,"slug":"fairqueue-rethinking-prompt-learning-for-fair","title":"FairQueue: Rethinking Prompt Learning for Fair Text-to-Image Generation","date":"2024-10-24","arxiv_id":"2410.18615","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-wavelet-diffusion-gan-for-image-super","title":"A Wavelet Diffusion GAN for Image Super-Resolution","date":"2024-10-23","arxiv_id":"2410.17966","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-ranked-preference-optimization-for","title":"Scalable Ranked Preference Optimization for Text-to-Image Generation","date":"2024-10-23","arxiv_id":"2410.18013","repositories_listed":0,"syntology":null},{"url":null,"slug":"mpds-a-movie-posters-dataset-for-image","title":"MPDS: A Movie Posters Dataset for Image Generation with Diffusion Model","date":"2024-10-22","arxiv_id":"2410.16840","repositories_listed":0,"syntology":null},{"url":null,"slug":"kitten-a-knowledge-intensive-evaluation-of","title":"KITTEN: A Knowledge-Intensive Evaluation of Image Generation on Visual Entities","date":"2024-10-15","arxiv_id":"2410.11824","repositories_listed":0,"syntology":null},{"url":null,"slug":"saliency-guided-optimization-of-diffusion","title":"Saliency Guided Optimization of Diffusion Latents","date":"2024-10-14","arxiv_id":"2410.10257","repositories_listed":0,"syntology":null},{"url":null,"slug":"realera-semantic-level-concept-erasure-via","title":"RealEra: Semantic-level Concept Erasure via Neighbor-Concept Mining","date":"2024-10-11","arxiv_id":"2410.09140","repositories_listed":0,"syntology":null},{"url":null,"slug":"dart-denoising-autoregressive-transformer-for","title":"DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation","date":"2024-10-10","arxiv_id":"2410.08159","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-laws-for-diffusion-transformers","title":"Scaling Laws For Diffusion Transformers","date":"2024-10-10","arxiv_id":"2410.08184","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-repellency-for-shielded-generation-in","title":"Sparse Repellency for Shielded Generation in Text-to-image Diffusion Models","date":"2024-10-08","arxiv_id":"2410.06025","repositories_listed":0,"syntology":null},{"url":null,"slug":"omnibooth-learning-latent-control-for-image","title":"OmniBooth: Learning Latent Control for Image Synthesis with Multi-modal Instruction","date":"2024-10-07","arxiv_id":"2410.04932","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncovering-regional-defaults-from","title":"Uncovering Regional Defaults from Photorealistic Forests in Text-to-Image Generation with DALL-E 2","date":"2024-10-03","arxiv_id":"2410.17255","repositories_listed":0,"syntology":null},{"url":null,"slug":"comfygen-prompt-adaptive-workflows-for-text","title":"ComfyGen: Prompt-Adaptive Workflows for Text-to-Image Generation","date":"2024-10-02","arxiv_id":"2410.01731","repositories_listed":0,"syntology":null},{"url":null,"slug":"maskmamba-a-hybrid-mamba-transformer-model","title":"MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation","date":"2024-09-30","arxiv_id":"2409.19937","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalizing-alignment-paradigm-of-text-to","title":"Generalizing Alignment Paradigm of Text-to-Image Generation with Preferences through $f$-divergence Minimization","date":"2024-09-15","arxiv_id":"2409.09774","repositories_listed":0,"syntology":null},{"url":null,"slug":"ifadapter-instance-feature-control-for","title":"IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation","date":"2024-09-12","arxiv_id":"2409.08240","repositories_listed":0,"syntology":null},{"url":null,"slug":"freeenhance-tuning-free-image-enhancement-via","title":"FreeEnhance: Tuning-Free Image Enhancement via Content-Consistent Noising-and-Denoising Process","date":"2024-09-11","arxiv_id":"2409.07451","repositories_listed":0,"syntology":null},{"url":null,"slug":"poseembroider-towards-a-3d-visual-semantic","title":"PoseEmbroider: Towards a 3D, Visual, Semantic-aware Human Pose Representation","date":"2024-09-10","arxiv_id":"2409.06535","repositories_listed":0,"syntology":null},{"url":null,"slug":"svfit-parameter-efficient-fine-tuning-of","title":"SVFit: Parameter-Efficient Fine-Tuning of Large Pre-Trained Models Using Singular Values","date":"2024-09-09","arxiv_id":"2409.05926","repositories_listed":0,"syntology":null},{"url":null,"slug":"artifade-learning-to-generate-high-quality","title":"ArtiFade: Learning to Generate High-quality Subject from Blemished Images","date":"2024-09-05","arxiv_id":"2409.03745","repositories_listed":0,"syntology":null},{"url":null,"slug":"blended-latent-diffusion-under-attention","title":"Blended Latent Diffusion under Attention Control for Real-World Video Editing","date":"2024-09-05","arxiv_id":"2409.03514","repositories_listed":0,"syntology":null},{"url":null,"slug":"spdiffusion-semantic-protection-diffusion-for","title":"SPDiffusion: Semantic Protection Diffusion for Multi-concept Text-to-image Generation","date":"2024-09-02","arxiv_id":"2409.01327","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-free-sketch-guided-diffusion-with","title":"Training-Free Sketch-Guided Diffusion with Latent Optimization","date":"2024-08-31","arxiv_id":"2409.00313","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-to-image-generation-via-energy-based","title":"Text-to-Image Generation Via Energy-Based CLIP","date":"2024-08-30","arxiv_id":"2408.17046","repositories_listed":0,"syntology":null},{"url":null,"slug":"csgo-content-style-composition-in-text-to","title":"CSGO: Content-Style Composition in Text-to-Image Generation","date":"2024-08-29","arxiv_id":"2408.16766","repositories_listed":0,"syntology":null},{"url":null,"slug":"hand1000-generating-realistic-hands-from-text","title":"Hand1000: Generating Realistic Hands from Text with Only 1,000 Images","date":"2024-08-28","arxiv_id":"2408.15461","repositories_listed":0,"syntology":null},{"url":null,"slug":"reflective-human-machine-co-adaptation-for","title":"Reflective Human-Machine Co-adaptation for Enhanced Text-to-Image Generation Dialogue System","date":"2024-08-27","arxiv_id":"2409.07464","repositories_listed":0,"syntology":null},{"url":null,"slug":"unlocking-intrinsic-fairness-in-stable","title":"Rethinking Training for De-biasing Text-to-Image Generation: Unlocking the Potential of Stable Diffusion","date":"2024-08-22","arxiv_id":"2408.12692","repositories_listed":0,"syntology":null},{"url":null,"slug":"frap-faithful-and-realistic-text-to-image","title":"FRAP: Faithful and Realistic Text-to-Image Generation with Adaptive Prompt Weighting","date":"2024-08-21","arxiv_id":"2408.11706","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-object-count-optimization-for-text","title":"Detection-Driven Object Count Optimization for Text-to-Image Diffusion Models","date":"2024-08-21","arxiv_id":"2408.11721","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-brittleness-of-ai-generated-image","title":"The Brittleness of AI-Generated Image Watermarking Techniques: Examining Their Robustness Against Visual Paraphrasing Attacks","date":"2024-08-19","arxiv_id":"2408.10446","repositories_listed":0,"syntology":null},{"url":null,"slug":"difflora-generating-personalized-low-rank","title":"DiffLoRA: Generating Personalized Low-Rank Adaptation Weights with Diffusion","date":"2024-08-13","arxiv_id":"2408.06740","repositories_listed":0,"syntology":null},{"url":null,"slug":"artworks-reimagined-exploring-human-ai-co","title":"Artworks Reimagined: Exploring Human-AI Co-Creation through Body Prompting","date":"2024-08-10","arxiv_id":"2408.05476","repositories_listed":0,"syntology":null},{"url":null,"slug":"instruction-tuning-free-visual-token","title":"Instruction Tuning-free Visual Token Complement for Multimodal LLMs","date":"2024-08-09","arxiv_id":"2408.05019","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-uncertainty-quantification-using","title":"Zero-Shot Uncertainty Quantification using Diffusion Probabilistic Models","date":"2024-08-08","arxiv_id":"2408.04718","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-03001","title":"One Framework to Rule Them All: Unifying Multimodal Tasks with LLM Neural-Tuning","date":"2024-08-06","arxiv_id":"2408.03001","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-fabrication-of-reality-and-fantasy-scene","title":"The Fabrication of Reality and Fantasy: Scene Generation with LLM-Assisted Prompt Interpretation","date":"2024-07-17","arxiv_id":"2407.12579","repositories_listed":0,"syntology":null},{"url":null,"slug":"addressing-image-hallucination-in-text-to","title":"Addressing Image Hallucination in Text-to-Image Generation through Factual Image Retrieval","date":"2024-07-15","arxiv_id":"2407.10683","repositories_listed":0,"syntology":null},{"url":null,"slug":"surgical-text-to-image-generation","title":"Surgical Text-to-Image Generation","date":"2024-07-12","arxiv_id":"2407.09230","repositories_listed":0,"syntology":null},{"url":null,"slug":"jedi-joint-image-diffusion-models-for-1","title":"JeDi: Joint-Image Diffusion Models for Finetuning-Free Personalized Text-to-Image Generation","date":"2024-07-08","arxiv_id":"2407.06187","repositories_listed":0,"syntology":null},{"url":null,"slug":"chest-diffusion-a-light-weight-text-to-image","title":"Chest-Diffusion: A Light-Weight Text-to-Image Model for Report-to-CXR Generation","date":"2024-06-30","arxiv_id":"2407.00752","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-stable-is-stable-diffusion-under","title":"How Stable is Stable Diffusion under Recursive InPainting (RIP)?","date":"2024-06-27","arxiv_id":"2407.09549","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-thumbs-up-down-untangling-challenges","title":"Beyond Thumbs Up/Down: Untangling Challenges of Fine-Grained Feedback for Text-to-Image Generation","date":"2024-06-24","arxiv_id":"2406.16807","repositories_listed":0,"syntology":null},{"url":null,"slug":"invertible-consistency-distillation-for-text","title":"Invertible Consistency Distillation for Text-Guided Image Editing in Around 7 Steps","date":"2024-06-20","arxiv_id":"2406.14539","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-role-of-large-language-models","title":"Exploring the Role of Large Language Models in Prompt Encoding for Diffusion Models","date":"2024-06-17","arxiv_id":"2406.11831","repositories_listed":0,"syntology":null},{"url":null,"slug":"poetry2image-an-iterative-correction","title":"Poetry2Image: An Iterative Correction Framework for Images Generated from Chinese Classical Poetry","date":"2024-06-15","arxiv_id":"2407.06196","repositories_listed":0,"syntology":null}],"record_sha256":"eebde11eb274bdee57d15796ff282902d67bd7d635879980e74702f5c8050410","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}