{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/lmfnet-an-efficient-multimodal-fusion","title":"LMFNet: An Efficient Multimodal Fusion Approach for Semantic Segmentation in High-Resolution Remote Sensing","arxiv_id":"2404.13659","date":"2024-04-21","proceeding":null,"authors":["Tong Wang","Guanzhou Chen","Xiaodong Zhang","Chenxi Liu","Xiaoliang Tan","Jiaqi Wang","Chanjuan He","Wenlin Zhou"],"abstract":"Despite the rapid evolution of semantic segmentation for land cover classification in high-resolution remote sensing imagery, integrating multiple data modalities such as Digital Surface Model (DSM), RGB, and Near-infrared (NIR) remains a challenge. Current methods often process only two types of data, missing out on the rich information that additional modalities can provide. Addressing this gap, we propose a novel \\textbf{L}ightweight \\textbf{M}ultimodal data \\textbf{F}usion \\textbf{Net}work (LMFNet) to accomplish the tasks of fusion and semantic segmentation of multimodal remote sensing images. LMFNet uniquely accommodates various data types simultaneously, including RGB, NirRG, and DSM, through a weight-sharing, multi-branch vision transformer that minimizes parameter count while ensuring robust feature extraction. Our proposed multimodal fusion module integrates a \\textit{Multimodal Feature Fusion Reconstruction Layer} and \\textit{Multimodal Feature Self-Attention Fusion Layer}, which can reconstruct and fuse multimodal features. Extensive testing on public datasets such as US3D, ISPRS Potsdam, and ISPRS Vaihingen demonstrates the effectiveness of LMFNet. Specifically, it achieves a mean Intersection over Union ($mIoU$) of 85.09\\% on the US3D dataset, marking a significant improvement over existing methods. Compared to unimodal approaches, LMFNet shows a 10\\% enhancement in $mIoU$ with only a 0.5M increase in parameter count. Furthermore, against bimodal methods, our approach with trilateral inputs enhances $mIoU$ by 0.46 percentage points.","url_abs":"https://arxiv.org/abs/2404.13659v1","url_pdf":"https://arxiv.org/pdf/2404.13659v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"land-cover-classification","task_name":"Land Cover Classification"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"}],"methods":[{"method_slug":"attention","method_name":"Attention"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"vision-transformer","method_name":"Vision Transformer"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/semantic-segmentation-on-potsdam","task":"Semantic Segmentation","dataset":"Potsdam","model":"LMFNet-3","rank_in_archive_order":1,"of":11,"metrics":{"mIoU":"86.39"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-potsdam","task":"Semantic Segmentation","dataset":"Potsdam","model":"LMFNet-2","rank_in_archive_order":3,"of":11,"metrics":{"mIoU":"85.51"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-us3d","task":"Semantic Segmentation","dataset":"US3D","model":"LMFNet-3","rank_in_archive_order":1,"of":11,"metrics":{"mIoU":"85.09"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-us3d","task":"Semantic Segmentation","dataset":"US3D","model":"LMFNet-2","rank_in_archive_order":3,"of":11,"metrics":{"mIoU":"84.50"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-vaihingen","task":"Semantic Segmentation","dataset":"Vaihingen","model":"LMFNet-2 (","rank_in_archive_order":2,"of":13,"metrics":{"mIoU":"82.49"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}