{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/mural-multimodal-multitask-retrieval-across","title":"MURAL: Multimodal, Multitask Retrieval Across Languages","arxiv_id":"2109.05125","date":"2021-09-10","proceeding":null,"authors":["Aashi Jain","Mandy Guo","Krishna Srinivasan","Ting Chen","Sneha Kudugunta","Chao Jia","Yinfei Yang","Jason Baldridge"],"abstract":"Both image-caption pairs and translation pairs provide the means to learn deep representations of and connections between languages. We use both types of pairs in MURAL (MUltimodal, MUltitask Representations Across Languages), a dual encoder that solves two tasks: 1) image-text matching and 2) translation pair matching. By incorporating billions of translation pairs, MURAL extends ALIGN (Jia et al. PMLR'21)--a state-of-the-art dual encoder learned from 1.8 billion noisy image-text pairs. When using the same encoders, MURAL's performance matches or exceeds ALIGN's cross-modal retrieval performance on well-resourced languages across several datasets. More importantly, it considerably improves performance on under-resourced languages, showing that text-text learning can overcome a paucity of image-caption examples for these languages. On the Wikipedia Image-Text dataset, for example, MURAL-base improves zero-shot mean recall by 8.1% on average for eight under-resourced languages and by 6.8% on average when fine-tuning. We additionally show that MURAL's text representations cluster not only with respect to genealogical connections but also based on areal linguistics, such as the Balkan Sprachbund.","url_abs":"https://arxiv.org/abs/2109.05125v1","url_pdf":"https://arxiv.org/pdf/2109.05125v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"cross-modal-retrieval","task_name":"Cross-Modal Retrieval"},{"task_slug":"image-text-matching","task_name":"Image-text matching"},{"task_slug":"retrieval","task_name":"Retrieval"},{"task_slug":"semantic-image-similarity","task_name":"Semantic Image Similarity"},{"task_slug":"semantic-image-text-similarity","task_name":"Semantic Image-Text Similarity"},{"task_slug":"semantic-textual-similarity","task_name":"Semantic Textual Similarity"},{"task_slug":"text-matching","task_name":"Text Matching"},{"task_slug":"translation","task_name":"Translation"}],"methods":[{"method_slug":"align","method_name":"ALIGN"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/semantic-textual-similarity-on-cxc","task":"Semantic Textual Similarity","dataset":"CxC","model":"DE-T2T+I2T","rank_in_archive_order":2,"of":4,"metrics":{"avg ± std":"74.5 ± 0.4"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-cxc","task":"Semantic Textual Similarity","dataset":"CxC","model":"MURAL-large","rank_in_archive_order":3,"of":4,"metrics":{"avg ± std":"74.1 ± 0.4"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-cxc","task":"Semantic Textual Similarity","dataset":"CxC","model":"ALIGN-L2","rank_in_archive_order":4,"of":4,"metrics":{"avg ± std":"72.9 ± 0.4"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2109.05125","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}