{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/transfer-between-modalities-with-metaqueries","title":"Transfer between Modalities with MetaQueries","arxiv_id":"2504.06256","date":"2025-04-08","proceeding":null,"authors":["Xichen Pan","Satya Narayan Shukla","Aashu Singh","Zhuokai Zhao","Shlok Kumar Mishra","Jialiang Wang","Zhiyang Xu","Jiuhai Chen","Kunpeng Li","Felix Juefei-Xu","Ji Hou","Saining Xie"],"abstract":"Unified multimodal models aim to integrate understanding (text output) and generation (pixel output), but aligning these different modalities within a single architecture often demands complex training recipes and careful data balancing. We introduce MetaQueries, a set of learnable queries that act as an efficient interface between autoregressive multimodal LLMs (MLLMs) and diffusion models. MetaQueries connects the MLLM's latents to the diffusion decoder, enabling knowledge-augmented image generation by leveraging the MLLM's deep understanding and reasoning capabilities. Our method simplifies training, requiring only paired image-caption data and standard diffusion objectives. Notably, this transfer is effective even when the MLLM backbone remains frozen, thereby preserving its state-of-the-art multimodal understanding capabilities while achieving strong generative performance. Additionally, our method is flexible and can be easily instruction-tuned for advanced applications such as image editing and subject-driven generation.","url_abs":"https://arxiv.org/abs/2504.06256v1","url_pdf":"https://arxiv.org/pdf/2504.06256v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"decoder","task_name":"Decoder"},{"task_slug":"image-generation","task_name":"Image Generation"},{"task_slug":"text-to-image-generation","task_name":"Text-to-Image Generation"}],"methods":[{"method_slug":"diffusion","method_name":"Diffusion"},{"method_slug":"set","method_name":"SET"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/on-wise","task":"","dataset":"WISE","model":"MetaQuery-XL","rank_in_archive_order":2,"of":11,"metrics":{"Biology":"0.49","Chemistry":"0.41","Cultural":"0.56","Overall":"0.55","Physics":"0.63","Space":"0.62","Time":"0.55"},"uses_additional_data":false},{"leaderboard":"/sota/text-to-image-generation-on-dpg","task":"Text-to-Image Generation","dataset":"DPG","model":"MetaQuery-XL","rank_in_archive_order":2,"of":2,"metrics":{"Overall":"82.05"},"uses_additional_data":false},{"leaderboard":"/sota/text-to-image-generation-on-geneval","task":"Text-to-Image Generation","dataset":"GenEval","model":"MetaQuery-XL (Rewrite)","rank_in_archive_order":7,"of":20,"metrics":{"Overall":"0.80"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2504.06256","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}