{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/mail-a-unified-mask-image-language-trimodal","title":"MaIL: A Unified Mask-Image-Language Trimodal Network for Referring Image Segmentation","arxiv_id":"2111.10747","date":"2021-11-21","proceeding":null,"authors":["Zizhang Li","Mengmeng Wang","Jianbiao Mei","Yong liu"],"abstract":"Referring image segmentation is a typical multi-modal task, which aims at generating a binary mask for referent described in given language expressions. Prior arts adopt a bimodal solution, taking images and languages as two modalities within an encoder-fusion-decoder pipeline. However, this pipeline is sub-optimal for the target task for two reasons. First, they only fuse high-level features produced by uni-modal encoders separately, which hinders sufficient cross-modal learning. Second, the uni-modal encoders are pre-trained independently, which brings inconsistency between pre-trained uni-modal tasks and the target multi-modal task. Besides, this pipeline often ignores or makes little use of intuitively beneficial instance-level features. To relieve these problems, we propose MaIL, which is a more concise encoder-decoder pipeline with a Mask-Image-Language trimodal encoder. Specifically, MaIL unifies uni-modal feature extractors and their fusion model into a deep modality interaction encoder, facilitating sufficient feature interaction across different modalities. Meanwhile, MaIL directly avoids the second limitation since no uni-modal encoders are needed anymore. Moreover, for the first time, we propose to introduce instance masks as an additional modality, which explicitly intensifies instance-level features and promotes finer segmentation results. The proposed MaIL set a new state-of-the-art on all frequently-used referring image segmentation datasets, including RefCOCO, RefCOCO+, and G-Ref, with significant gains, 3%-10% against previous best methods. Code will be released soon.","url_abs":"https://arxiv.org/abs/2111.10747v2","url_pdf":"https://arxiv.org/pdf/2111.10747v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"decoder","task_name":"Decoder"},{"task_slug":"image-segmentation","task_name":"Image Segmentation"},{"task_slug":"referring-expression-segmentation","task_name":"Referring Expression Segmentation"},{"task_slug":"segmentation","task_name":"Segmentation"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/referring-expression-segmentation-on-g-ref-1","task":"Referring Expression Segmentation","dataset":"G-Ref test A","model":"MaIL","rank_in_archive_order":1,"of":1,"metrics":{"Overall IoU":"62.87"},"uses_additional_data":false},{"leaderboard":"/sota/referring-expression-segmentation-on-g-ref-2","task":"Referring Expression Segmentation","dataset":"G-Ref test B","model":"MaIL","rank_in_archive_order":1,"of":1,"metrics":{"Overall IoU":"61.81"},"uses_additional_data":false},{"leaderboard":"/sota/referring-expression-segmentation-on-g-ref","task":"Referring Expression Segmentation","dataset":"G-Ref val","model":"MaIL","rank_in_archive_order":1,"of":1,"metrics":{"Overall IoU":"62.45"},"uses_additional_data":false},{"leaderboard":"/sota/referring-expression-segmentation-on-refcoco-5","task":"Referring Expression Segmentation","dataset":"RefCOCO+ test B","model":"MaIL","rank_in_archive_order":18,"of":30,"metrics":{"Overall IoU":"56.06"},"uses_additional_data":false},{"leaderboard":"/sota/referring-expression-segmentation-on-refcoco-4","task":"Referring Expression Segmentation","dataset":"RefCOCO+ testA","model":"MaIL","rank_in_archive_order":21,"of":30,"metrics":{"Overall IoU":"65.92"},"uses_additional_data":false},{"leaderboard":"/sota/referring-expression-segmentation-on-refcoco-3","task":"Referring Expression Segmentation","dataset":"RefCOCO+ val","model":"MaIL","rank_in_archive_order":23,"of":33,"metrics":{"Overall IoU":"62.23"},"uses_additional_data":false},{"leaderboard":"/sota/referring-expression-segmentation-on-refcoco","task":"Referring Expression Segmentation","dataset":"RefCoCo val","model":"MaIL","rank_in_archive_order":26,"of":37,"metrics":{"Overall IoU":"70.13"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2111.10747","atlas_url":"https://app.syntology.ai/?focus=2111.10747","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}