{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/skysense-a-multi-modal-remote-sensing","title":"SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery","arxiv_id":"2312.10115","date":"2023-12-15","proceeding":"CVPR 2024 1","authors":["Xin Guo","Jiangwei Lao","Bo Dang","Yingying Zhang","Lei Yu","Lixiang Ru","Liheng Zhong","Ziyuan Huang","Kang Wu","Dingxiang Hu","Huimei He","Jian Wang","Jingdong Chen","Ming Yang","Yongjun Zhang","Yansheng Li"],"abstract":"Prior studies on Remote Sensing Foundation Model (RSFM) reveal immense potential towards a generic model for Earth Observation. Nevertheless, these works primarily focus on a single modality without temporal and geo-context modeling, hampering their capabilities for diverse tasks. In this study, we present SkySense, a generic billion-scale model, pre-trained on a curated multi-modal Remote Sensing Imagery (RSI) dataset with 21.5 million temporal sequences. SkySense incorporates a factorized multi-modal spatiotemporal encoder taking temporal sequences of optical and Synthetic Aperture Radar (SAR) data as input. This encoder is pre-trained by our proposed Multi-Granularity Contrastive Learning to learn representations across different modal and spatial granularities. To further enhance the RSI representations by the geo-context clue, we introduce Geo-Context Prototype Learning to learn region-aware prototypes upon RSI's multi-modal spatiotemporal features. To our best knowledge, SkySense is the largest Multi-Modal RSFM to date, whose modules can be flexibly combined or used individually to accommodate various tasks. It demonstrates remarkable generalization capabilities on a thorough evaluation encompassing 16 datasets over 7 tasks, from single- to multi-modal, static to temporal, and classification to localization. SkySense surpasses 18 recent RSFMs in all test scenarios. Specifically, it outperforms the latest models such as GFM, SatLas and Scale-MAE by a large margin, i.e., 2.76%, 3.67% and 3.61% on average respectively. We will release the pre-trained weights to facilitate future research and Earth Observation applications.","url_abs":"https://arxiv.org/abs/2312.10115v2","url_pdf":"https://arxiv.org/pdf/2312.10115v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"skysense-a-multi-modal-remote-sensing","repo_url":"https://github.com/jack-bo1220/awesome-remote-sensing-foundation-models","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok"}}],"tasks":[{"task_slug":"contrastive-learning","task_name":"Contrastive Learning"},{"task_slug":"earth-observation","task_name":"Earth Observation"},{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"open-vocabulary-semantic-segmentation","task_name":"Open Vocabulary Semantic Segmentation"},{"task_slug":"temporal-sequences","task_name":"Temporal Sequences"},{"task_slug":"visual-question-answering-1","task_name":"Visual Question Answering"},{"task_slug":"zero-shot-classification-unified-classes","task_name":"Zero-shot Classification (unified classes)"}],"methods":[{"method_slug":"contrastive-learning","method_name":"Contrastive Learning"},{"method_slug":"focus","method_name":"Focus"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/image-classification-on-resisc45","task":"Image Classification","dataset":"RESISC45","model":"SkySense-O","rank_in_archive_order":20,"of":20,"metrics":{"zero-shot Acc":"83.28"},"uses_additional_data":false},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-fast","task":"Open Vocabulary Semantic Segmentation","dataset":"FAST","model":"SkySense-O","rank_in_archive_order":1,"of":1,"metrics":{"mIoU":"8.3"},"uses_additional_data":false},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-16","task":"Open Vocabulary Semantic Segmentation","dataset":"ISPRS Potsdam","model":"SkySense-O","rank_in_archive_order":1,"of":1,"metrics":{"mIoU":"54.1"},"uses_additional_data":false},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-sior","task":"Open Vocabulary Semantic Segmentation","dataset":"SIOR","model":"SkySense-O","rank_in_archive_order":1,"of":1,"metrics":{"mIoU":"30.89"},"uses_additional_data":false},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-sota","task":"Open Vocabulary Semantic Segmentation","dataset":"SOTA","model":"SkySense-O","rank_in_archive_order":1,"of":1,"metrics":{"mIoU":"32.12"},"uses_additional_data":false},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-15","task":"Open Vocabulary Semantic Segmentation","dataset":"iSAID","model":"SkySense-O","rank_in_archive_order":1,"of":2,"metrics":{"mIoU-":"43.9"},"uses_additional_data":false},{"leaderboard":"/sota/visual-question-answering-on-aid-vqa","task":"Visual Question Answering","dataset":"AID-VQA","model":"SkySense-O","rank_in_archive_order":1,"of":1,"metrics":{"Acc. (test)":"94.10"},"uses_additional_data":false},{"leaderboard":"/sota/visual-question-answering-on-rsvqa-hr","task":"Visual Question Answering","dataset":"RSVQA-HR","model":"SkySense-O","rank_in_archive_order":1,"of":1,"metrics":{"zero-shot Acc":"78.09"},"uses_additional_data":false},{"leaderboard":"/sota/visual-question-answering-on-siri-whu","task":"Visual Question Answering","dataset":"SIRI-WHU","model":"SkySense-O","rank_in_archive_order":1,"of":1,"metrics":{"Acc. (test)":"74.79"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2312.10115","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}