{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-generation/papers/33","list_of":"/task/image-generation","task":"Image Generation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":33,"pages_in_order":67,"rows_per_page":100,"rows":[3201,3300],"of":6689,"counts":{"archive_papers_tagged":6689,"with_a_code_link":3102,"where_syntology_ran_a_sample":1223,"not_listed_spam_title":0,"listed":6689,"listed_where_code_ran":1223,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1063,"every_run_a_failure_of_syntologys_instrument":160,"listed_with_a_run_with_no_instrument_failure":1063,"listed_every_run_a_failure_of_syntologys_instrument":160,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-generation","prev":"/task/image-generation/papers/32","next":"/task/image-generation/papers/34","papers":[{"url":null,"slug":"unlocking-aha-moments-via-reinforcement","title":"Unlocking Aha Moments via Reinforcement Learning: Advancing Collaborative Visual Comprehension and Generation","date":"2025-06-02","arxiv_id":"2506.01480","repositories_listed":0,"syntology":null},{"url":null,"slug":"og-vla-3d-aware-vision-language-action-model","title":"OG-VLA: 3D-Aware Vision Language Action Model via Orthographic Image Generation","date":"2025-06-01","arxiv_id":"2506.01196","repositories_listed":0,"syntology":null},{"url":null,"slug":"artiscene-language-driven-artistic-3d-scene-1","title":"ArtiScene: Language-Driven Artistic 3D Scene Generation Through Image Intermediary","date":"2025-05-31","arxiv_id":"2506.00742","repositories_listed":0,"syntology":null},{"url":"/paper/latent-wavelet-diffusion-enabling-4k-image","slug":"latent-wavelet-diffusion-enabling-4k-image","title":"Latent Wavelet Diffusion: Enabling 4K Image Synthesis for Free","date":"2025-05-31","arxiv_id":"2506.00433","repositories_listed":0,"syntology":{"n":10,"n_ran":6,"n_constructed":0,"n_ran_checked":5,"n_instrument":1,"n_unverified":4,"n_honours":0,"n_violates":1,"n_no_contract":4,"n_pointer_only":1,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 1 violated, 4 with no contract checked; 1 where Syntology's instrument failed) · 4 unverified","sample_list":"/paper/latent-wavelet-diffusion-enabling-4k-image#ran","syntology_url":"https://syntology.ai/paper/2506.00433","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2506.00433"}},"official":null}},{"url":null,"slug":"composeanything-composite-object-priors-for","title":"ComposeAnything: Composite Object Priors for Text-to-Image Generation","date":"2025-05-30","arxiv_id":"2505.24086","repositories_listed":0,"syntology":null},{"url":null,"slug":"genspace-benchmarking-spatially-aware-image","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","date":"2025-05-30","arxiv_id":"2505.24870","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-flow-matching-enhancing-image","title":"Graph Flow Matching: Enhancing Image Generation with Neighbor-Aware Flow Fields","date":"2025-05-30","arxiv_id":"2505.24434","repositories_listed":0,"syntology":null},{"url":null,"slug":"dimension-reduction-attack-video-generative","title":"Dimension-Reduction Attack! Video Generative Models are Experts on Controllable Image Synthesis","date":"2025-05-29","arxiv_id":"2505.23325","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-animals-dance-when-you-re-not-looking","title":"How Animals Dance (When You're Not Looking)","date":"2025-05-29","arxiv_id":"2505.23738","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-aesthetic-reasoning-a-new-benchmark-for","title":"Image Aesthetic Reasoning: A New Benchmark for Medical Image Screening with MLLMs","date":"2025-05-29","arxiv_id":"2505.23265","repositories_listed":0,"syntology":null},{"url":null,"slug":"inference-time-scaling-of-diffusion-models","title":"Inference-time Scaling of Diffusion Models through Classical Search","date":"2025-05-29","arxiv_id":"2505.23614","repositories_listed":0,"syntology":null},{"url":null,"slug":"lorashop-training-free-multi-concept-image","title":"LoRAShop: Training-Free Multi-Concept Image Generation and Editing with Rectified Flow Transformers","date":"2025-05-29","arxiv_id":"2505.23758","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-group-proportional-representation-for","title":"Multi-Group Proportional Representation for Text-to-Image Models","date":"2025-05-29","arxiv_id":"2505.24023","repositories_listed":0,"syntology":null},{"url":null,"slug":"r2i-bench-benchmarking-reasoning-driven-text","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","date":"2025-05-29","arxiv_id":"2505.23493","repositories_listed":0,"syntology":null},{"url":null,"slug":"rsfake-1m-a-large-scale-dataset-for-detecting","title":"RSFAKE-1M: A Large-Scale Dataset for Detecting Diffusion-Generated Remote Sensing Forgeries","date":"2025-05-29","arxiv_id":"2505.23283","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualsphinx-large-scale-synthetic-vision","title":"VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL","date":"2025-05-29","arxiv_id":"2505.23977","repositories_listed":0,"syntology":null},{"url":null,"slug":"principled-out-of-distribution-generalization","title":"Principled Out-of-Distribution Generalization via Simplicity","date":"2025-05-28","arxiv_id":"2505.22622","repositories_listed":0,"syntology":null},{"url":null,"slug":"rhetorical-text-to-image-generation-via-two","title":"Rhetorical Text-to-Image Generation via Two-layer Diffusion Policy Optimization","date":"2025-05-28","arxiv_id":"2505.22792","repositories_listed":0,"syntology":null},{"url":null,"slug":"creativity-in-llm-based-multi-agent-systems-a","title":"Creativity in LLM-based Multi-Agent Systems: A Survey","date":"2025-05-27","arxiv_id":"2505.21116","repositories_listed":0,"syntology":null},{"url":"/paper/uni-instruct-one-step-diffusion-model-through","slug":"uni-instruct-one-step-diffusion-model-through","title":"Uni-Instruct: One-step Diffusion Model through Unified Diffusion Divergence Instruction","date":"2025-05-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/unveiling-impact-of-frequency-components-on","slug":"unveiling-impact-of-frequency-components-on","title":"Unveiling Impact of Frequency Components on Membership Inference Attacks for Diffusion Models","date":"2025-05-27","arxiv_id":"2505.20955","repositories_listed":0,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/unveiling-impact-of-frequency-components-on#ran","syntology_url":"https://syntology.ai/paper/2505.20955","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2505.20955"}},"official":null}},{"url":null,"slug":"applications-and-effect-evaluation-of","title":"Applications and Effect Evaluation of Generative Adversarial Networks in Semi-Supervised Learning","date":"2025-05-26","arxiv_id":"2505.19522","repositories_listed":0,"syntology":null},{"url":null,"slug":"fudoki-discrete-flow-based-unified","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","date":"2025-05-26","arxiv_id":"2505.20147","repositories_listed":0,"syntology":null},{"url":null,"slug":"mmig-bench-towards-comprehensive-and","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","date":"2025-05-26","arxiv_id":"2505.19415","repositories_listed":0,"syntology":null},{"url":null,"slug":"stylear-customizing-multimodal-autoregressive","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","date":"2025-05-26","arxiv_id":"2505.19874","repositories_listed":0,"syntology":null},{"url":null,"slug":"drivex-omni-scene-modeling-for-learning","title":"DriveX: Omni Scene Modeling for Learning Generalizable World Knowledge in Autonomous Driving","date":"2025-05-25","arxiv_id":"2505.19239","repositories_listed":0,"syntology":null},{"url":null,"slug":"plug-and-play-context-feature-reuse-for","title":"Plug-and-Play Context Feature Reuse for Efficient Masked Generation","date":"2025-05-25","arxiv_id":"2505.19089","repositories_listed":0,"syntology":null},{"url":null,"slug":"textdiffuser-rl-efficient-and-robust-text","title":"TextDiffuser-RL: Efficient and Robust Text Layout Optimization for High-Fidelity Text-to-Image Synthesis","date":"2025-05-25","arxiv_id":"2505.19291","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-understanding-the-mechanisms-of","title":"Towards Understanding the Mechanisms of Classifier-Free Guidance","date":"2025-05-25","arxiv_id":"2505.19210","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-free-stylized-text-to-image","title":"Training-free Stylized Text-to-Image Generation with Fast Inference","date":"2025-05-25","arxiv_id":"2505.19063","repositories_listed":0,"syntology":null},{"url":"/paper/beyond-masked-and-unmasked-discrete-diffusion","slug":"beyond-masked-and-unmasked-discrete-diffusion","title":"Beyond Masked and Unmasked: Discrete Diffusion Models via Partial Masking","date":"2025-05-24","arxiv_id":"2505.18495","repositories_listed":0,"syntology":null},{"url":"/paper/how-to-build-a-consistency-model-learning","slug":"how-to-build-a-consistency-model-learning","title":"How to build a consistency model: Learning flow maps via self-distillation","date":"2025-05-24","arxiv_id":"2505.18825","repositories_listed":0,"syntology":{"n":14,"n_ran":10,"n_constructed":0,"n_ran_checked":10,"n_instrument":0,"n_unverified":4,"n_honours":0,"n_violates":0,"n_no_contract":10,"n_pointer_only":0,"phrase":"10 ran (of which 0 constructed an object rather than computing a result; 10 with no instrument failure: 0 honoured, 0 violated, 10 with no contract checked; 0 where Syntology's instrument failed) · 4 unverified","sample_list":"/paper/how-to-build-a-consistency-model-learning#ran","syntology_url":"https://syntology.ai/paper/2505.18825","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2505.18825"}},"official":null}},{"url":null,"slug":"mod-adapter-tuning-free-and-versatile-multi","title":"Mod-Adapter: Tuning-Free and Versatile Multi-concept Personalization via Modulation Adapter","date":"2025-05-24","arxiv_id":"2505.18612","repositories_listed":0,"syntology":null},{"url":null,"slug":"tng-clip-training-time-negation-data","title":"TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP","date":"2025-05-24","arxiv_id":"2505.18434","repositories_listed":0,"syntology":null},{"url":null,"slug":"concord-concept-informed-diffusion-for","title":"CONCORD: Concept-Informed Diffusion for Dataset Distillation","date":"2025-05-23","arxiv_id":"2505.18358","repositories_listed":0,"syntology":null},{"url":"/paper/futuresightdrive-thinking-visually-with","slug":"futuresightdrive-thinking-visually-with","title":"FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving","date":"2025-05-23","arxiv_id":"2505.17685","repositories_listed":0,"syntology":{"n":9,"n_ran":6,"n_constructed":5,"n_ran_checked":5,"n_instrument":1,"n_unverified":3,"n_honours":0,"n_violates":0,"n_no_contract":5,"n_pointer_only":9,"phrase":"6 ran (of which 5 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 1 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/futuresightdrive-thinking-visually-with#ran","syntology_url":"https://syntology.ai/paper/2505.17685","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2505.17685"}},"official":null}},{"url":null,"slug":"mmmg-a-comprehensive-and-reliable-evaluation","title":"MMMG: a Comprehensive and Reliable Evaluation Suite for Multitask Multimodal Generation","date":"2025-05-23","arxiv_id":"2505.17613","repositories_listed":0,"syntology":null},{"url":null,"slug":"mri-image-generation-based-on-text-prompts","title":"MRI Image Generation Based on Text Prompts","date":"2025-05-23","arxiv_id":"2505.22682","repositories_listed":0,"syntology":null},{"url":null,"slug":"restorevar-visual-autoregressive-generation","title":"RestoreVAR: Visual Autoregressive Generation for All-in-One Image Restoration","date":"2025-05-23","arxiv_id":"2505.18047","repositories_listed":0,"syntology":null},{"url":null,"slug":"conditional-panoramic-image-generation-via","title":"Conditional Panoramic Image Generation via Masked Autoregressive Modeling","date":"2025-05-22","arxiv_id":"2505.16862","repositories_listed":0,"syntology":null},{"url":null,"slug":"creatively-upscaling-images-with-global","title":"Creatively Upscaling Images with Global-Regional Priors","date":"2025-05-22","arxiv_id":"2505.16976","repositories_listed":0,"syntology":null},{"url":null,"slug":"ntire-2025-challenge-on-text-to-image","title":"NTIRE 2025 challenge on Text to Image Generation Model Quality Assessment","date":"2025-05-22","arxiv_id":"2505.16314","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-rewarding-large-vision-language-models","title":"Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation","date":"2025-05-22","arxiv_id":"2505.16763","repositories_listed":0,"syntology":null},{"url":null,"slug":"tensorar-refinement-is-all-you-need-in","title":"TensorAR: Refinement is All You Need in Autoregressive Image Generation","date":"2025-05-22","arxiv_id":"2505.16324","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-learning-enhanced-trajectory","title":"Contrastive Learning-Enhanced Trajectory Matching for Small-Scale Dataset Distillation","date":"2025-05-21","arxiv_id":"2505.15267","repositories_listed":0,"syntology":null},{"url":null,"slug":"facecrafter-identity-conditional-diffusion","title":"FaceCrafter: Identity-Conditional Diffusion with Disentangled Control over Facial Pose, Expression, and Emotion","date":"2025-05-21","arxiv_id":"2505.15313","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-ai-for-autonomous-driving-a-review","title":"Generative AI for Autonomous Driving: A Review","date":"2025-05-21","arxiv_id":"2505.15863","repositories_listed":0,"syntology":null},{"url":null,"slug":"harnessing-caption-detailness-for-data","title":"Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation","date":"2025-05-21","arxiv_id":"2505.15172","repositories_listed":0,"syntology":null},{"url":null,"slug":"ia-t2i-internet-augmented-text-to-image","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","date":"2025-05-21","arxiv_id":"2505.15779","repositories_listed":0,"syntology":null},{"url":null,"slug":"po-flow-flow-based-generative-models-for","title":"PO-Flow: Flow-based Generative Models for Sampling Potential Outcomes and Counterfactuals","date":"2025-05-21","arxiv_id":"2505.16051","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-cyclic-diffusion-for-inference","title":"Adaptive Cyclic Diffusion for Inference Scaling","date":"2025-05-20","arxiv_id":"2505.14036","repositories_listed":0,"syntology":null},{"url":null,"slug":"haet-bhasha-aur-diskrimineshun-phonetic","title":"\"Haet Bhasha aur Diskrimineshun\": Phonetic Perturbations in Code-Mixed Hinglish to Red-Team LLMs","date":"2025-05-20","arxiv_id":"2505.14226","repositories_listed":0,"syntology":null},{"url":null,"slug":"hunyuan-game-industrial-grade-intelligent","title":"Hunyuan-Game: Industrial-grade Intelligent Game Creation Model","date":"2025-05-20","arxiv_id":"2505.14135","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparc-sparse-representation-and-construction","title":"Sparc3D: Sparse Representation and Construction for High-Resolution 3D Shapes Modeling","date":"2025-05-20","arxiv_id":"2505.14521","repositories_listed":0,"syntology":null},{"url":null,"slug":"unigen-enhanced-training-test-time-strategies","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","date":"2025-05-20","arxiv_id":"2505.14682","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-modeling-meets-remote-sensing","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","date":"2025-05-20","arxiv_id":"2505.14361","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-physics-inspired-optimizer-velocity","title":"A Physics-Inspired Optimizer: Velocity Regularized Adam","date":"2025-05-19","arxiv_id":"2505.13196","repositories_listed":0,"syntology":null},{"url":null,"slug":"diff-mm-exploring-pre-trained-text-to-image","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","date":"2025-05-19","arxiv_id":"2505.12606","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-models-with-double-guidance","title":"Diffusion Models with Double Guidance: Generate with aggregated datasets","date":"2025-05-19","arxiv_id":"2505.13213","repositories_listed":0,"syntology":null},{"url":null,"slug":"frabench-and-geneval-scaling-fine-grained","title":"FRAbench and GenEval: Scaling Fine-Grained Aspect Evaluation across Tasks, Modalities","date":"2025-05-19","arxiv_id":"2505.12795","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-sora-safe-text-to-video-generation-via","title":"Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking","date":"2025-05-19","arxiv_id":"2505.12667","repositories_listed":0,"syntology":null},{"url":null,"slug":"soundit-geo-contextual-soundscape-to","title":"SounDiT: Geo-Contextual Soundscape-to-Landscape Generation","date":"2025-05-19","arxiv_id":"2505.12734","repositories_listed":0,"syntology":null},{"url":null,"slug":"swin-dit-diffusion-transformer-using-pseudo","title":"Swin DiT: Diffusion Transformer using Pseudo Shifted Windows","date":"2025-05-19","arxiv_id":"2505.13219","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-aware-autoregressive-models-for-multi","title":"Context-Aware Autoregressive Models for Multi-Conditional Image Generation","date":"2025-05-18","arxiv_id":"2505.12274","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-concept-unlearning-with-low-rank","title":"Few-Shot Concept Unlearning with Low Rank Adaptation","date":"2025-05-18","arxiv_id":"2505.12395","repositories_listed":0,"syntology":null},{"url":null,"slug":"guiding-diffusion-with-deep-geometric-moments","title":"Guiding Diffusion with Deep Geometric Moments: Balancing Fidelity and Variation","date":"2025-05-18","arxiv_id":"2505.12486","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-alignment-using-inter-modal-bridges","title":"Model alignment using inter-modal bridges","date":"2025-05-18","arxiv_id":"2505.12322","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-10950","title":"Shackled Dancing: A Bit-Locked Diffusion Algorithm for Lossless and Controllable Image Steganography","date":"2025-05-16","arxiv_id":"2505.10950","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-10993","title":"Generative Models in Computational Pathology: A Comprehensive Survey on Methods, Applications, and Challenges","date":"2025-05-16","arxiv_id":"2505.10993","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-10999","title":"DDAE++: Enhancing Diffusion Models Towards Unified Generative and Discriminative Learning","date":"2025-05-16","arxiv_id":"2505.10999","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-11178","title":"CompAlign: Improving Compositional Text-to-Image Generation with a Complex Benchmark and Fine-Grained Feedback","date":"2025-05-16","arxiv_id":"2505.11178","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-11257","title":"DRAGON: A Large-Scale Dataset of Realistic Images Generated by Diffusion Models","date":"2025-05-16","arxiv_id":"2505.11257","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-11468","title":"PSDiffusion: Harmonized Multi-Layer Image Generation via Layout and Appearance Alignment","date":"2025-05-16","arxiv_id":"2505.11468","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-10743","title":"IMAGE-ALCHEMY: Advancing subject fidelity in personalised text-to-image generation","date":"2025-05-15","arxiv_id":"2505.10743","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-vision-tokenizer-tuning","title":"End-to-End Vision Tokenizer Tuning","date":"2025-05-15","arxiv_id":"2505.10562","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-initial-exploration-of-default-images-in","title":"An Initial Exploration of Default Images in Text-to-Image Generation","date":"2025-05-14","arxiv_id":"2505.09166","repositories_listed":0,"syntology":null},{"url":null,"slug":"don-t-forget-your-inverse-ddim-for-image","title":"Don't Forget your Inverse DDIM for Image Editing","date":"2025-05-14","arxiv_id":"2505.09571","repositories_listed":0,"syntology":null},{"url":null,"slug":"enerverse-ac-envisioning-embodied","title":"EnerVerse-AC: Envisioning Embodied Environments with Action Condition","date":"2025-05-14","arxiv_id":"2505.09723","repositories_listed":0,"syntology":null},{"url":null,"slug":"discrete-visual-tokens-of-autoregression-by","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","date":"2025-05-12","arxiv_id":"2505.07538","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-guided-microstructure-optimization","title":"Image-Guided Microstructure Optimization using Diffusion Models: Validated with Li-Mn-rich Cathode Precursors","date":"2025-05-12","arxiv_id":"2505.07906","repositories_listed":0,"syntology":null},{"url":null,"slug":"replay-based-continual-learning-with-dual","title":"Replay-Based Continual Learning with Dual-Layered Distillation and a Streamlined U-Net for Efficient Text-to-Image Generation","date":"2025-05-11","arxiv_id":"2505.06995","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-clip-perceive-art-the-same-way-we-do","title":"Does CLIP perceive art the same way we do?","date":"2025-05-08","arxiv_id":"2505.05229","repositories_listed":0,"syntology":null},{"url":null,"slug":"mogao-an-omni-foundation-model-for","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","date":"2025-05-08","arxiv_id":"2505.05472","repositories_listed":0,"syntology":null},{"url":null,"slug":"normalize-everything-a-preconditioned","title":"Normalize Everything: A Preconditioned Magnitude-Preserving Architecture for Diffusion-Based Speech Enhancement","date":"2025-05-08","arxiv_id":"2505.05216","repositories_listed":0,"syntology":null},{"url":null,"slug":"pidiff-image-customization-for-personalized","title":"PIDiff: Image Customization for Personalized Identities with Diffusion Models","date":"2025-05-08","arxiv_id":"2505.05081","repositories_listed":0,"syntology":null},{"url":null,"slug":"victr-vital-consistency-transfer-for","title":"ViCTr: Vital Consistency Transfer for Pathology Aware Image Synthesis","date":"2025-05-08","arxiv_id":"2505.04963","repositories_listed":0,"syntology":null},{"url":null,"slug":"countdiffusion-text-to-image-synthesis-with","title":"CountDiffusion: Text-to-Image Synthesis with Training-Free Counting-Guidance Diffusion","date":"2025-05-07","arxiv_id":"2505.04347","repositories_listed":0,"syntology":null},{"url":null,"slug":"craft-cultural-russian-oriented-dataset","title":"CRAFT: Cultural Russian-Oriented Dataset Adaptation for Focused Text-to-Image Generation","date":"2025-05-07","arxiv_id":"2505.04851","repositories_listed":0,"syntology":null},{"url":null,"slug":"defining-and-quantifying-creative-behavior-in","title":"Defining and Quantifying Creative Behavior in Popular Image Generators","date":"2025-05-07","arxiv_id":"2505.04497","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-flow-matching-using-latent","title":"Efficient Flow Matching using Latent Variables","date":"2025-05-07","arxiv_id":"2505.04486","repositories_listed":0,"syntology":null},{"url":null,"slug":"lay-your-scene-natural-scene-layout","title":"Lay-Your-Scene: Natural Scene Layout Generation with Diffusion Transformers","date":"2025-05-07","arxiv_id":"2505.04718","repositories_listed":0,"syntology":null},{"url":null,"slug":"maisy-motion-aware-image-synthesis-for","title":"MAISY: Motion-Aware Image SYnthesis for Medical Image Motion Correction","date":"2025-05-07","arxiv_id":"2505.04105","repositories_listed":0,"syntology":null},{"url":null,"slug":"unmasking-the-canvas-a-dynamic-benchmark-for","title":"Unmasking the Canvas: A Dynamic Benchmark for Image Generation Jailbreaking and LLM Content Safety","date":"2025-05-07","arxiv_id":"2505.04146","repositories_listed":0,"syntology":null},{"url":null,"slug":"distribution-conditional-generation-from","title":"Distribution-Conditional Generation: From Class Distribution to Creative Generation","date":"2025-05-06","arxiv_id":"2505.03667","repositories_listed":0,"syntology":null},{"url":null,"slug":"preliminary-explorations-with-gpt-4o-mni","title":"Preliminary Explorations with GPT-4o(mni) Native Image Generation","date":"2025-05-06","arxiv_id":"2505.05501","repositories_listed":0,"syntology":null},{"url":null,"slug":"safer-prompts-reducing-ip-risk-in-visual","title":"Safer Prompts: Reducing IP Risk in Visual Generative AI","date":"2025-05-06","arxiv_id":"2505.03338","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-spaceborn-to-airborn-sar-image-synthesis","title":"From Spaceborne to Airborne: SAR Image Synthesis Using Foundation Models for Multi-Scale Adaptation","date":"2025-05-05","arxiv_id":"2505.03844","repositories_listed":0,"syntology":null},{"url":null,"slug":"mccd-multi-agent-collaboration-based","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","date":"2025-05-05","arxiv_id":"2505.02648","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-to-image-generation-and-editing-a-survey","title":"Text to Image Generation and Editing: A Survey","date":"2025-05-05","arxiv_id":"2505.02527","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-ai-face-realism-cost-efficient","title":"Enhancing AI Face Realism: Cost-Efficient Quality Improvement in Distilled Diffusion Models with a Fully Synthetic Dataset","date":"2025-05-04","arxiv_id":"2505.02255","repositories_listed":0,"syntology":null}],"record_sha256":"4fba23412e42fea3bf8ca891c17d9d2690f6d92a45b550b610843595c085bc80","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}