{"url":"/task/layout-to-image-generation","name":"Layout-to-Image Generation","slug":"layout-to-image-generation","description_markdown":"Layout-to-image generation its the task to generate a scene based on the given layout. The layout describes the location of the objects to be included in the output image.\r\nIn this section, you can find state-of-the-art leaderboards for Layout-to-image generation.","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Medical","url":"/area/medical"},{"name":"Miscellaneous","url":"/area/miscellaneous"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":41,"papers_with_code":24,"benchmarks":11,"benchmark_tables_in_archive":11,"benchmark_tables_shown":11,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":8,"subtasks":0,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/layout-to-image-generation-on-coco-stuff-2","slug":"layout-to-image-generation-on-coco-stuff-2","dataset":"COCO-Stuff 64x64","dataset_url":"/dataset/coco-stuff","rows_in_archive":5,"metrics":["FID","Inception Score"],"first_row_in_archive_order":{"model":"OC-GAN","paper_title":"Object-Centric Image Generation from Layouts","paper_url":"/paper/object-centric-image-generation-from-layouts","paper_date":"2020-03-16","arxiv_id":"2003.07449","code_links":[],"syntology":null}},{"leaderboard":"/sota/layout-to-image-generation-on-coco-stuff-3","slug":"layout-to-image-generation-on-coco-stuff-3","dataset":"COCO-Stuff 128x128","dataset_url":"/dataset/coco-stuff","rows_in_archive":5,"metrics":["FID","Inception Score","SceneFID"],"first_row_in_archive_order":{"model":"CAL2IM","paper_title":"Context-Aware Layout to Image Generation with Enhanced Object Appearance","paper_url":"/paper/context-aware-layout-to-image-generation-with","paper_date":"2021-03-22","arxiv_id":"2103.11897","code_links":[{"title":"wtliao/layout2img","url":"https://github.com/wtliao/layout2img"}],"syntology":null}},{"leaderboard":"/sota/layout-to-image-generation-on-coco-stuff-4","slug":"layout-to-image-generation-on-coco-stuff-4","dataset":"COCO-Stuff 256x256","dataset_url":"/dataset/coco","rows_in_archive":5,"metrics":["FID","Inception Score","LPIPS"],"first_row_in_archive_order":{"model":"LayoutDiffusion (25steps)","paper_title":"LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation","paper_url":"/paper/layoutdiffusion-controllable-diffusion-model","paper_date":"2023-03-30","arxiv_id":"2303.17189","code_links":[{"title":"zgctroy/layoutdiffusion","url":"https://github.com/zgctroy/layoutdiffusion"},{"title":"dcdcvgroup/layout-diffusion-mindspore","url":"https://github.com/dcdcvgroup/layout-diffusion-mindspore"}],"syntology":{"n":19,"n_ran":5,"n_unverified":14,"n_pointer_only":0}}},{"leaderboard":"/sota/layout-to-image-generation-on-visual-genome-3","slug":"layout-to-image-generation-on-visual-genome-3","dataset":"Visual Genome 128x128","dataset_url":"/dataset/visual-genome","rows_in_archive":5,"metrics":["FID","Inception Score","SceneFID"],"first_row_in_archive_order":{"model":"LayoutDiffusion","paper_title":"LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation","paper_url":"/paper/layoutdiffusion-controllable-diffusion-model","paper_date":"2023-03-30","arxiv_id":"2303.17189","code_links":[{"title":"zgctroy/layoutdiffusion","url":"https://github.com/zgctroy/layoutdiffusion"},{"title":"dcdcvgroup/layout-diffusion-mindspore","url":"https://github.com/dcdcvgroup/layout-diffusion-mindspore"}],"syntology":{"n":19,"n_ran":5,"n_unverified":14,"n_pointer_only":0}}},{"leaderboard":"/sota/layout-to-image-generation-on-layoutbench-1","slug":"layout-to-image-generation-on-layoutbench-1","dataset":"LayoutBench-COCO - Number","dataset_url":"/dataset/layoutbench-coco","rows_in_archive":4,"metrics":["AP"],"first_row_in_archive_order":{"model":"IterInpaint","paper_title":"Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation","paper_url":"/paper/diagnostic-benchmark-and-iterative-inpainting","paper_date":"2023-04-13","arxiv_id":"2304.06671","code_links":[{"title":"j-min/IterInpaint","url":"https://github.com/j-min/IterInpaint"},{"title":"j-min/LayoutBench-COCO","url":"https://github.com/j-min/LayoutBench-COCO"}],"syntology":null}},{"leaderboard":"/sota/layout-to-image-generation-on-layoutbench-2","slug":"layout-to-image-generation-on-layoutbench-2","dataset":"LayoutBench-COCO - Position","dataset_url":"/dataset/layoutbench-coco-position","rows_in_archive":4,"metrics":["AP"],"first_row_in_archive_order":{"model":"IterInpaint","paper_title":"Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation","paper_url":"/paper/diagnostic-benchmark-and-iterative-inpainting","paper_date":"2023-04-13","arxiv_id":"2304.06671","code_links":[{"title":"j-min/IterInpaint","url":"https://github.com/j-min/IterInpaint"},{"title":"j-min/LayoutBench-COCO","url":"https://github.com/j-min/LayoutBench-COCO"}],"syntology":null}},{"leaderboard":"/sota/layout-to-image-generation-on-layoutbench-3","slug":"layout-to-image-generation-on-layoutbench-3","dataset":"LayoutBench-COCO - Size","dataset_url":"/dataset/layoutbench-coco-size","rows_in_archive":4,"metrics":["AP"],"first_row_in_archive_order":{"model":"IterInpaint","paper_title":"Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation","paper_url":"/paper/diagnostic-benchmark-and-iterative-inpainting","paper_date":"2023-04-13","arxiv_id":"2304.06671","code_links":[{"title":"j-min/IterInpaint","url":"https://github.com/j-min/IterInpaint"},{"title":"j-min/LayoutBench-COCO","url":"https://github.com/j-min/LayoutBench-COCO"}],"syntology":null}},{"leaderboard":"/sota/layout-to-image-generation-on-layoutbench-4","slug":"layout-to-image-generation-on-layoutbench-4","dataset":"LayoutBench-COCO - Combination","dataset_url":"/dataset/layoutbench-coco-combination","rows_in_archive":4,"metrics":["AP"],"first_row_in_archive_order":{"model":"IterInpaint","paper_title":"Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation","paper_url":"/paper/diagnostic-benchmark-and-iterative-inpainting","paper_date":"2023-04-13","arxiv_id":"2304.06671","code_links":[{"title":"j-min/IterInpaint","url":"https://github.com/j-min/IterInpaint"},{"title":"j-min/LayoutBench-COCO","url":"https://github.com/j-min/LayoutBench-COCO"}],"syntology":null}},{"leaderboard":"/sota/layout-to-image-generation-on-visual-genome-2","slug":"layout-to-image-generation-on-visual-genome-2","dataset":"Visual Genome 64x64","dataset_url":"/dataset/visual-genome","rows_in_archive":4,"metrics":["FID","Inception Score"],"first_row_in_archive_order":{"model":"OC-GAN","paper_title":"Object-Centric Image Generation from Layouts","paper_url":"/paper/object-centric-image-generation-from-layouts","paper_date":"2020-03-16","arxiv_id":"2003.07449","code_links":[],"syntology":null}},{"leaderboard":"/sota/layout-to-image-generation-on-visual-genome-4","slug":"layout-to-image-generation-on-visual-genome-4","dataset":"Visual Genome 256x256","dataset_url":"/dataset/visual-genome","rows_in_archive":4,"metrics":["FID","Inception Score","LPIPS"],"first_row_in_archive_order":{"model":"LayoutDiffusion","paper_title":"LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation","paper_url":"/paper/layoutdiffusion-controllable-diffusion-model","paper_date":"2023-03-30","arxiv_id":"2303.17189","code_links":[{"title":"zgctroy/layoutdiffusion","url":"https://github.com/zgctroy/layoutdiffusion"},{"title":"dcdcvgroup/layout-diffusion-mindspore","url":"https://github.com/dcdcvgroup/layout-diffusion-mindspore"}],"syntology":{"n":19,"n_ran":5,"n_unverified":14,"n_pointer_only":0}}},{"leaderboard":"/sota/layout-to-image-generation-on-layoutbench","slug":"layout-to-image-generation-on-layoutbench","dataset":"LayoutBench","dataset_url":"/dataset/layoutbench","rows_in_archive":3,"metrics":["AP"],"first_row_in_archive_order":{"model":"IterInpaint","paper_title":"Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation","paper_url":"/paper/diagnostic-benchmark-and-iterative-inpainting","paper_date":"2023-04-13","arxiv_id":"2304.06671","code_links":[{"title":"j-min/IterInpaint","url":"https://github.com/j-min/IterInpaint"},{"title":"j-min/LayoutBench-COCO","url":"https://github.com/j-min/LayoutBench-COCO"}],"syntology":null}}],"datasets":[{"url":"/dataset/coco","name":"COCO (Common Objects in Context)","full_name":"Common Objects in Context","num_papers_in_archive":11922},{"url":"/dataset/visual-genome","name":"Visual Genome","full_name":"","num_papers_in_archive":1256},{"url":"/dataset/coco-stuff","name":"COCO-Stuff","full_name":"Common Objects in COntext-stuff","num_papers_in_archive":338},{"url":"/dataset/layoutbench-coco-combination","name":"LayoutBench-COCO - Combination","full_name":"","num_papers_in_archive":4},{"url":"/dataset/layoutbench-coco","name":"LayoutBench-COCO - Number","full_name":"","num_papers_in_archive":4},{"url":"/dataset/layoutbench-coco-position","name":"LayoutBench-COCO - Position","full_name":"","num_papers_in_archive":4},{"url":"/dataset/layoutbench-coco-size","name":"LayoutBench-COCO - Size","full_name":"","num_papers_in_archive":4},{"url":"/dataset/layoutbench","name":"LayoutBench","full_name":"","num_papers_in_archive":3}],"subtasks":[],"parent_tasks":[{"url":"/task/image-generation","name":"Image Generation"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":24,"of":24,"tagged_in_all":41,"items":[{"url":"/paper/high-resolution-image-synthesis-with-latent","title":"High-Resolution Image Synthesis with Latent Diffusion Models","date":"2021-12-20","arxiv_id":"2112.10752","repositories_listed":41,"syntology":{"n":28,"n_ran":19,"n_unverified":9,"n_pointer_only":5}},{"url":"/paper/adding-conditional-control-to-text-to-image","title":"Adding Conditional Control to Text-to-Image Diffusion Models","date":"2023-02-10","arxiv_id":"2302.05543","repositories_listed":12,"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/image-synthesis-from-reconfigurable-layout","title":"Image Synthesis From Reconfigurable Layout and Style","date":"2019-08-20","arxiv_id":"1908.07500","repositories_listed":4,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/image-generation-from-scene-graphs","title":"Image Generation from Scene Graphs","date":"2018-04-04","arxiv_id":"1804.01622","repositories_listed":4,"syntology":{"n":21,"n_ran":0,"n_unverified":21,"n_pointer_only":0}},{"url":"/paper/learning-layout-and-style-reconfigurable-gans","title":"Learning Layout and Style Reconfigurable GANs for Controllable Image Synthesis","date":"2020-03-25","arxiv_id":"2003.11571","repositories_listed":3,"syntology":null},{"url":"/paper/diagnostic-benchmark-and-iterative-inpainting","title":"Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation","date":"2023-04-13","arxiv_id":"2304.06671","repositories_listed":2,"syntology":null},{"url":"/paper/layoutdiffusion-controllable-diffusion-model","title":"LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation","date":"2023-03-30","arxiv_id":"2303.17189","repositories_listed":2,"syntology":{"n":19,"n_ran":5,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/learning-canonical-representations-for-scene","title":"Learning Canonical Representations for Scene Graph to Image Generation","date":"2019-12-16","arxiv_id":"1912.07414","repositories_listed":2,"syntology":{"n":17,"n_ran":2,"n_unverified":15,"n_pointer_only":0}},{"url":"/paper/specifying-object-attributes-and-relations-in","title":"Specifying Object Attributes and Relations in Interactive Scene Generation","date":"2019-09-11","arxiv_id":"1909.05379","repositories_listed":2,"syntology":{"n":16,"n_ran":0,"n_unverified":16,"n_pointer_only":0}},{"url":"/paper/tolo-a-two-stage-training-free-layout-to","title":"ToLo: A Two-Stage, Training-Free Layout-To-Image Generation Framework For High-Overlap Layouts","date":"2025-03-03","arxiv_id":"2503.01667","repositories_listed":1,"syntology":null},{"url":"/paper/hico-hierarchical-controllable-diffusion","title":"HiCo: Hierarchical Controllable Diffusion Model for Layout-to-image Generation","date":"2024-10-18","arxiv_id":"2410.14324","repositories_listed":1,"syntology":{"n":13,"n_ran":13,"n_unverified":0,"n_pointer_only":13}},{"url":"/paper/rethinking-the-training-and-evaluation-of","title":"Rethinking The Training And Evaluation of Rich-Context Layout-to-Image Generation","date":"2024-09-07","arxiv_id":"2409.04847","repositories_listed":1,"syntology":{"n":13,"n_ran":10,"n_unverified":3,"n_pointer_only":13}},{"url":"/paper/training-free-composite-scene-generation-for","title":"Training-free Composite Scene Generation for Layout-to-Image Synthesis","date":"2024-07-18","arxiv_id":"2407.13609","repositories_listed":1,"syntology":null},{"url":"/paper/adversarial-supervision-makes-layout-to-image","title":"Adversarial Supervision Makes Layout-to-Image Diffusion Models Thrive","date":"2024-01-16","arxiv_id":"2401.08815","repositories_listed":1,"syntology":{"n":3,"n_ran":1,"n_unverified":2,"n_pointer_only":3}},{"url":"/paper/llm-blueprint-enabling-text-to-image","title":"LLM Blueprint: Enabling Text-to-Image Generation with Complex and Detailed Prompts","date":"2023-10-16","arxiv_id":"2310.10640","repositories_listed":1,"syntology":{"n":12,"n_ran":10,"n_unverified":2,"n_pointer_only":12}},{"url":"/paper/guided-image-synthesis-via-initial-image","title":"Guided Image Synthesis via Initial Image Editing in Diffusion Model","date":"2023-05-05","arxiv_id":"2305.03382","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/freestyle-layout-to-image-synthesis","title":"Freestyle Layout-to-Image Synthesis","date":"2023-03-25","arxiv_id":"2303.14412","repositories_listed":1,"syntology":{"n":6,"n_ran":3,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/gligen-open-set-grounded-text-to-image","title":"GLIGEN: Open-Set Grounded Text-to-Image Generation","date":"2023-01-17","arxiv_id":"2301.07093","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/modeling-image-composition-for-complex-scene","title":"Modeling Image Composition for Complex Scene Generation","date":"2022-06-02","arxiv_id":"2206.00923","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/interactive-image-synthesis-with-panoptic","title":"Interactive Image Synthesis with Panoptic Layout Generation","date":"2022-03-04","arxiv_id":"2203.02104","repositories_listed":1,"syntology":{"n":11,"n_ran":0,"n_unverified":11,"n_pointer_only":0}},{"url":"/paper/attrlostgan-attribute-controlled-image","title":"AttrLostGAN: Attribute Controlled Image Synthesis from Reconfigurable Layout and Style","date":"2021-03-25","arxiv_id":"2103.13722","repositories_listed":1,"syntology":null},{"url":"/paper/context-aware-layout-to-image-generation-with","title":"Context-Aware Layout to Image Generation with Enhanced Object Appearance","date":"2021-03-22","arxiv_id":"2103.11897","repositories_listed":1,"syntology":null},{"url":"/paper/generating-annotated-high-fidelity-images","title":"Generating Annotated High-Fidelity Images Containing Multiple Coherent Objects","date":"2020-06-22","arxiv_id":"2006.12150","repositories_listed":1,"syntology":null},{"url":"/paper/semantic-image-manipulation-using-scene","title":"Semantic Image Manipulation Using Scene Graphs","date":"2020-04-07","arxiv_id":"2004.03677","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}}],"syntology_records":17,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}