{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/harnessing-vision-foundation-models-for-high","title":"Harnessing Vision Foundation Models for High-Performance, Training-Free Open Vocabulary Segmentation","arxiv_id":"2411.09219","date":"2024-11-14","proceeding":null,"authors":["Yuheng Shi","Minjing Dong","Chang Xu"],"abstract":"While Contrastive Language-Image Pre-training (CLIP) has advanced open-vocabulary predictions, its performance on semantic segmentation remains suboptimal. This shortfall primarily stems from its spatial-invariant semantic features and constrained resolution. While previous adaptations addressed spatial invariance semantic by modifying the self-attention in CLIP's image encoder, the issue of limited resolution remains unexplored. Different from previous segment-then-splice methods that segment sub-images via a sliding window and splice the results, we introduce a splice-then-segment paradigm that incorporates Segment-Anything Model (SAM) to tackle the resolution issue since SAM excels at extracting fine-grained semantic correlations from high-resolution images. Specifically, we introduce Trident, a training-free framework that first splices features extracted by CLIP and DINO from sub-images, then leverages SAM's encoder to create a correlation matrix for global aggregation, enabling a broadened receptive field for effective segmentation. Besides, we propose a refinement strategy for CLIP's coarse segmentation outputs by transforming them into prompts for SAM, further enhancing the segmentation performance. Trident achieves a significant improvement in the mIoU across eight benchmarks compared with the current SOTA, increasing from 44.4 to 48.6.Code is available at https://github.com/YuHengsss/Trident.","url_abs":"https://arxiv.org/abs/2411.09219v1","url_pdf":"https://arxiv.org/pdf/2411.09219v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"harnessing-vision-foundation-models-for-high","repo_url":"https://github.com/YuHengsss/Trident","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}}],"tasks":[{"task_slug":"segmentation","task_name":"Segmentation"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"},{"task_slug":"unsupervised-semantic-segmentation-with","task_name":"Unsupervised Semantic Segmentation with Language-image Pre-training"}],"methods":[{"method_slug":"attention","method_name":"Attention"},{"method_slug":"clip","method_name":"CLIP"},{"method_slug":"dino","method_name":"DINO"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"sam","method_name":"SAM"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"vision-transformer","method_name":"Vision Transformer"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/unsupervised-semantic-segmentation-with-4","task":"Unsupervised Semantic Segmentation with Language-image Pre-training","dataset":"ADE20K","model":"Trident","rank_in_archive_order":3,"of":13,"metrics":{"Mean IoU (val)":"26.7"},"uses_additional_data":false},{"leaderboard":"/sota/unsupervised-semantic-segmentation-with-10","task":"Unsupervised Semantic Segmentation with Language-image Pre-training","dataset":"COCO-Object","model":"Trident","rank_in_archive_order":2,"of":12,"metrics":{"mIoU":"42.2"},"uses_additional_data":false},{"leaderboard":"/sota/unsupervised-semantic-segmentation-with-9","task":"Unsupervised Semantic Segmentation with Language-image Pre-training","dataset":"COCO-Stuff-171","model":"Trident","rank_in_archive_order":3,"of":12,"metrics":{"mIoU":"28.6"},"uses_additional_data":false},{"leaderboard":"/sota/unsupervised-semantic-segmentation-with-3","task":"Unsupervised Semantic Segmentation with Language-image Pre-training","dataset":"Cityscapes val","model":"Trident","rank_in_archive_order":2,"of":12,"metrics":{"mIoU":"47.6"},"uses_additional_data":false},{"leaderboard":"/sota/unsupervised-semantic-segmentation-with-8","task":"Unsupervised Semantic Segmentation with Language-image Pre-training","dataset":"PASCAL Context-59","model":"Trident","rank_in_archive_order":3,"of":12,"metrics":{"mIoU":"44.3"},"uses_additional_data":false},{"leaderboard":"/sota/unsupervised-semantic-segmentation-with-12","task":"Unsupervised Semantic Segmentation with Language-image Pre-training","dataset":"PASCAL Context-60","model":"Trident","rank_in_archive_order":3,"of":4,"metrics":{"mIoU":"40.1"},"uses_additional_data":false},{"leaderboard":"/sota/unsupervised-semantic-segmentation-with-11","task":"Unsupervised Semantic Segmentation with Language-image Pre-training","dataset":"PASCAL VOC","model":"Trident","rank_in_archive_order":3,"of":10,"metrics":{"mIoU":"70.8"},"uses_additional_data":false},{"leaderboard":"/sota/unsupervised-semantic-segmentation-with-7","task":"Unsupervised Semantic Segmentation with Language-image Pre-training","dataset":"PascalVOC-20","model":"Trident","rank_in_archive_order":3,"of":10,"metrics":{"mIoU":"88.7"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2411.09219","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}