{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/uniworld-v1-high-resolution-semantic-encoders","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","arxiv_id":"2506.03147","date":"2025-06-03","proceeding":null,"authors":["Bin Lin","Zongjian Li","Xinhua Cheng","Yuwei Niu","Yang Ye","Xianyi He","Shenghai Yuan","Wangbo Yu","Shaodong Wang","Yunyang Ge","Yatian Pang","Li Yuan"],"abstract":"Although existing unified models achieve strong performance in vision-language understanding and text-to-image generation, they remain limited in addressing image perception and manipulation -- capabilities increasingly demanded in practical applications. Recently, OpenAI introduced the powerful GPT-4o-Image model, which showcases advanced capabilities in comprehensive image perception and manipulation, sparking widespread interest. Through carefully designed experiments, we observe that GPT-4o-Image likely relies on semantic encoders rather than VAEs for feature extraction, despite VAEs being commonly regarded as crucial for image manipulation tasks. Inspired by this insight, we propose UniWorld-V1, a unified generative framework built upon semantic features extracted from powerful multimodal large language models and contrastive semantic encoders. Using only 2.7M training data, UniWorld-V1 achieves impressive performance across diverse tasks, including image understanding, generation, manipulation, and perception. We fully open-source the UniWorld-V1 framework, including model weights, training and evaluation scripts, and datasets to promote reproducibility and further research.","url_abs":"https://arxiv.org/abs/2506.03147v3","url_pdf":"https://arxiv.org/pdf/2506.03147v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"uniworld-v1-high-resolution-semantic-encoders","repo_url":"https://github.com/PKU-YuanGroup/UniWorld-V1","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok"}},{"paper_slug":"uniworld-v1-high-resolution-semantic-encoders","repo_url":"https://github.com/pku-yuangroup/imgedit","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"image-editing","task_name":"Image Editing"},{"task_slug":"image-generation","task_name":"Image Generation"},{"task_slug":"image-manipulation","task_name":"Image Manipulation"},{"task_slug":"text-to-image-generation-1","task_name":"Text to Image Generation"},{"task_slug":"text-to-image-generation","task_name":"Text-to-Image Generation"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/on-wise","task":"","dataset":"WISE","model":"UniWorld-V1","rank_in_archive_order":1,"of":11,"metrics":{"Biology":"0.45","Chemistry":"0.41","Cultural":"0.53","Overall":"0.55","Physics":"0.59","Space":"0.73","Time":"0.55"},"uses_additional_data":false},{"leaderboard":"/sota/image-editing-on-imgedit-data","task":"Image Editing","dataset":"ImgEdit-Data","model":"UniWorld-V1","rank_in_archive_order":2,"of":9,"metrics":{"Action":"2.74","Add":"3.82","Adjust":"3.64","Background":"2.99","Extract":"2.27","Hybrid":"2.96","Overall":"3.26","Remove":"3.24","Replace":"3.47","Style":"4.21"},"uses_additional_data":false},{"leaderboard":"/sota/image-generation-on-wise","task":"Image Generation","dataset":"WISE","model":"UniWorld-V1","rank_in_archive_order":4,"of":14,"metrics":{"Biology":"0.45","Chemistry":"0.41","Cultural":"0.53","Overall":"0.55","Physics":"0.59","Space":"0.73","Time":"0.55"},"uses_additional_data":false},{"leaderboard":"/sota/text-to-image-generation-on-geneval","task":"Text-to-Image Generation","dataset":"GenEval","model":"UniWorld-V1 (Rewrite)","rank_in_archive_order":2,"of":20,"metrics":{"Color Attri.":"0.71","Colors":"0.90","Counting":"0.81","Overall":"0.84","Position":"0.74","Single Obj.":"0.98","Two Obj.":"0.93"},"uses_additional_data":false},{"leaderboard":"/sota/text-to-image-generation-on-geneval","task":"Text-to-Image Generation","dataset":"GenEval","model":"UniWorld-V1","rank_in_archive_order":4,"of":20,"metrics":{"Color Attri.":"0.70","Colors":"0.89","Counting":"0.79","Overall":"0.80","Position":"0.49","Single Obj.":"0.99","Two Obj.":"0.93"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2506.03147","atlas_url":"https://app.syntology.ai/?focus=2506.03147","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}