{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/cross-view-image-synthesis-using-conditional","title":"Cross-View Image Synthesis using Conditional GANs","arxiv_id":"1803.03396","date":"2018-03-09","proceeding":"CVPR 2018 6","authors":["Krishna Regmi","Ali Borji"],"abstract":"Learning to generate natural scenes has always been a challenging task in\ncomputer vision. It is even more painstaking when the generation is conditioned\non images with drastically different views. This is mainly because\nunderstanding, corresponding, and transforming appearance and semantic\ninformation across the views is not trivial. In this paper, we attempt to solve\nthe novel problem of cross-view image synthesis, aerial to street-view and vice\nversa, using conditional generative adversarial networks (cGAN). Two new\narchitectures called Crossview Fork (X-Fork) and Crossview Sequential (X-Seq)\nare proposed to generate scenes with resolutions of 64x64 and 256x256 pixels.\nX-Fork architecture has a single discriminator and a single generator. The\ngenerator hallucinates both the image and its semantic segmentation in the\ntarget view. X-Seq architecture utilizes two cGANs. The first one generates the\ntarget image which is subsequently fed to the second cGAN for generating its\ncorresponding semantic segmentation map. The feedback from the second cGAN\nhelps the first cGAN generate sharper images. Both of our proposed\narchitectures learn to generate natural images as well as their semantic\nsegmentation maps. The proposed methods show that they are able to capture and\nmaintain the true semantics of objects in source and target views better than\nthe traditional image-to-image translation method which considers only the\nvisual appearance of the scene. Extensive qualitative and quantitative\nevaluations support the effectiveness of our frameworks, compared to two state\nof the art methods, for natural scene generation across drastically different\nviews.","url_abs":"http://arxiv.org/abs/1803.03396v2","url_pdf":"http://arxiv.org/pdf/1803.03396v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"cross-view-image-synthesis-using-conditional","repo_url":"https://github.com/kregmi/cross-view-image-synthesis","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok"}}],"tasks":[{"task_slug":"cross-view-image-to-image-translation","task_name":"Cross-View Image-to-Image Translation"},{"task_slug":"image-generation","task_name":"Image Generation"},{"task_slug":"image-to-image-translation","task_name":"Image-to-Image Translation"},{"task_slug":"scene-generation","task_name":"Scene Generation"},{"task_slug":"segmentation","task_name":"Segmentation"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/cross-view-image-to-image-translation-on-2","task":"Cross-View Image-to-Image Translation","dataset":"Dayton (256×256) - aerial-to-ground","model":"X-Seq","rank_in_archive_order":3,"of":6,"metrics":{"SSIM":"0.5031"},"uses_additional_data":false},{"leaderboard":"/sota/cross-view-image-to-image-translation-on-2","task":"Cross-View Image-to-Image Translation","dataset":"Dayton (256×256) - aerial-to-ground","model":"X-Fork","rank_in_archive_order":4,"of":6,"metrics":{"SSIM":"0.4963"},"uses_additional_data":false},{"leaderboard":"/sota/cross-view-image-to-image-translation-on-3","task":"Cross-View Image-to-Image Translation","dataset":"Dayton (256×256) - ground-to-aerial","model":"X-Seq","rank_in_archive_order":3,"of":4,"metrics":{"SSIM":"0.2725"},"uses_additional_data":false},{"leaderboard":"/sota/cross-view-image-to-image-translation-on-1","task":"Cross-View Image-to-Image Translation","dataset":"Dayton (64x64) - ground-to-aerial","model":"X-Fork","rank_in_archive_order":2,"of":5,"metrics":{"SSIM":"0.3682"},"uses_additional_data":false},{"leaderboard":"/sota/cross-view-image-to-image-translation-on-1","task":"Cross-View Image-to-Image Translation","dataset":"Dayton (64x64) - ground-to-aerial","model":"X-Seq","rank_in_archive_order":4,"of":5,"metrics":{"SSIM":"0.3663"},"uses_additional_data":false},{"leaderboard":"/sota/cross-view-image-to-image-translation-on","task":"Cross-View Image-to-Image Translation","dataset":"Dayton (64×64) - aerial-to-ground","model":"X-Seq","rank_in_archive_order":2,"of":5,"metrics":{"SSIM":"0.5171"},"uses_additional_data":false},{"leaderboard":"/sota/cross-view-image-to-image-translation-on","task":"Cross-View Image-to-Image Translation","dataset":"Dayton (64×64) - aerial-to-ground","model":"X-Fork","rank_in_archive_order":4,"of":5,"metrics":{"SSIM":"0.4921"},"uses_additional_data":false},{"leaderboard":"/sota/cross-view-image-to-image-translation-on-5","task":"Cross-View Image-to-Image Translation","dataset":"Ego2Top","model":"X-Fork","rank_in_archive_order":2,"of":4,"metrics":{"SSIM":"0.2740"},"uses_additional_data":false},{"leaderboard":"/sota/cross-view-image-to-image-translation-on-5","task":"Cross-View Image-to-Image Translation","dataset":"Ego2Top","model":"X-Seq","rank_in_archive_order":3,"of":4,"metrics":{"SSIM":"0.2738"},"uses_additional_data":false},{"leaderboard":"/sota/cross-view-image-to-image-translation-on-4","task":"Cross-View Image-to-Image Translation","dataset":"cvusa","model":"X-Fork","rank_in_archive_order":4,"of":7,"metrics":{"SSIM":"0.4356"},"uses_additional_data":false},{"leaderboard":"/sota/cross-view-image-to-image-translation-on-4","task":"Cross-View Image-to-Image Translation","dataset":"cvusa","model":"X-Seq","rank_in_archive_order":5,"of":7,"metrics":{"SSIM":"0.4231"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1803.03396","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}