{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/composing-ensembles-of-pre-trained-models-via","title":"Composing Ensembles of Pre-trained Models via Iterative Consensus","arxiv_id":"2210.11522","date":"2022-10-20","proceeding":null,"authors":["Shuang Li","Yilun Du","Joshua B. Tenenbaum","Antonio Torralba","Igor Mordatch"],"abstract":"Large pre-trained models exhibit distinct and complementary capabilities dependent on the data they are trained on. Language models such as GPT-3 are capable of textual reasoning but cannot understand visual information, while vision models such as DALL-E can generate photorealistic photos but fail to understand complex language descriptions. In this work, we propose a unified framework for composing ensembles of different pre-trained models -- combining the strengths of each individual model to solve various multimodal problems in a zero-shot manner. We use pre-trained models as \"generators\" or \"scorers\" and compose them via closed-loop iterative consensus optimization. The generator constructs proposals and the scorers iteratively provide feedback to refine the generated result. Such closed-loop communication enables models to correct errors caused by other models, significantly boosting performance on downstream tasks, e.g. improving accuracy on grade school math problems by 7.5%, without requiring any model finetuning. We demonstrate that consensus achieved by an ensemble of scorers outperforms the feedback of a single scorer, by leveraging the strengths of each expert model. Results show that the proposed method can be used as a general purpose framework for a wide range of zero-shot multimodal tasks, such as image generation, video question answering, mathematical reasoning, and robotic manipulation. Project page: https://energy-based-model.github.io/composing-pretrained-models.","url_abs":"https://arxiv.org/abs/2210.11522v1","url_pdf":"https://arxiv.org/pdf/2210.11522v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"arithmetic-reasoning","task_name":"Arithmetic Reasoning"},{"task_slug":"image-generation","task_name":"Image Generation"},{"task_slug":"math","task_name":"Math"},{"task_slug":"mathematical-reasoning","task_name":"Mathematical Reasoning"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"video-question-answering","task_name":"Video Question Answering"}],"methods":[{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"cosine-annealing","method_name":"Cosine Annealing"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"gpt-3","method_name":"GPT-3"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"linear-warmup-with-cosine-annealing","method_name":"Linear Warmup With Cosine Annealing"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"weight-decay","method_name":"Weight Decay"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/arithmetic-reasoning-on-gsm8k","task":"Arithmetic Reasoning","dataset":"GSM8K","model":"GPT-2-Medium 355M + question-solution classifier (BS=5)","rank_in_archive_order":149,"of":164,"metrics":{"Accuracy":"20.8","Parameters (Billion)":"0.355"},"uses_additional_data":false},{"leaderboard":"/sota/arithmetic-reasoning-on-gsm8k","task":"Arithmetic Reasoning","dataset":"GSM8K","model":"GPT-2-Medium 355M (fine-tuned, BS=5)","rank_in_archive_order":151,"of":164,"metrics":{"Accuracy":"18.3","Parameters (Billion)":"0.355"},"uses_additional_data":false},{"leaderboard":"/sota/arithmetic-reasoning-on-gsm8k","task":"Arithmetic Reasoning","dataset":"GSM8K","model":"GPT-2-Medium 355M + question-solution classifier (BS=1)","rank_in_archive_order":156,"of":164,"metrics":{"Accuracy":"16.8","Parameters (Billion)":"0.355"},"uses_additional_data":false},{"leaderboard":"/sota/arithmetic-reasoning-on-gsm8k","task":"Arithmetic Reasoning","dataset":"GSM8K","model":"GPT-2-Medium 355M (BS=5)","rank_in_archive_order":158,"of":164,"metrics":{"Accuracy":"12.2","Parameters (Billion)":"0.355"},"uses_additional_data":false},{"leaderboard":"/sota/image-generation-on-imagenet-64x64","task":"Image Generation","dataset":"ImageNet 64x64","model":"GLIDE + CLIP + CLS + CLS-FREE","rank_in_archive_order":31,"of":65,"metrics":{"FID":"29.184","Inception Score":"34.952","KID":"3.766"},"uses_additional_data":false},{"leaderboard":"/sota/image-generation-on-imagenet-64x64","task":"Image Generation","dataset":"ImageNet 64x64","model":"GLIDE + CLS-FREE","rank_in_archive_order":32,"of":65,"metrics":{"FID":"29.219","Inception Score":"25.926","KID":"5.325"},"uses_additional_data":false},{"leaderboard":"/sota/image-generation-on-imagenet-64x64","task":"Image Generation","dataset":"ImageNet 64x64","model":"GLIDE + CLIP","rank_in_archive_order":33,"of":65,"metrics":{"FID":"30.462","Inception Score":"25.017","KID":"6.174"},"uses_additional_data":false},{"leaderboard":"/sota/image-generation-on-imagenet-64x64","task":"Image Generation","dataset":"ImageNet 64x64","model":"GLIDE + CLS","rank_in_archive_order":34,"of":65,"metrics":{"FID":"30.871","Inception Score":"22.077"},"uses_additional_data":false},{"leaderboard":"/sota/image-generation-on-imagenet-64x64","task":"Image Generation","dataset":"ImageNet 64x64","model":"GLIDE +CLS","rank_in_archive_order":65,"of":65,"metrics":{"KID":"7.952"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-activitynet-qa","task":"Video Question Answering","dataset":"ActivityNet-QA","model":"GPT-2 + CLIP-14 + CLIP-multilingual (Zero-Shot)","rank_in_archive_order":1,"of":36,"metrics":{"Accuracy":"61.2"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-activitynet-qa","task":"Video Question Answering","dataset":"ActivityNet-QA","model":"GPT-2 + CLIP-32 (Zero-Shot)","rank_in_archive_order":2,"of":36,"metrics":{"Accuracy":"58.4"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2210.11522","atlas_url":"https://app.syntology.ai/?focus=2210.11522","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}