{"url":"/task/open-vocabulary-semantic-segmentation","name":"Open Vocabulary Semantic Segmentation","slug":"open-vocabulary-semantic-segmentation","description_markdown":"Open-vocabulary semantic segmentation models aim to accurately assign a semantic label to each pixel in an image from a set of arbitrary open-vocabulary texts.","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":113,"papers_with_code":71,"benchmarks":14,"benchmark_tables_in_archive":15,"benchmark_tables_shown":15,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":6,"subtasks":1,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-1","slug":"open-vocabulary-semantic-segmentation-on-1","dataset":"PASCAL Context-59","dataset_url":null,"rows_in_archive":24,"metrics":["mIoU"],"first_row_in_archive_order":{"model":"HyperSeg","paper_title":"HyperSeg: Towards Universal Visual Segmentation with Large Language Model","paper_url":"/paper/hyperseg-towards-universal-visual","paper_date":"2024-11-26","arxiv_id":"2411.17606","code_links":[{"title":"congvvc/HyperSeg","url":"https://github.com/congvvc/HyperSeg"}],"syntology":{"n":17,"n_ran":7,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-2","slug":"open-vocabulary-semantic-segmentation-on-2","dataset":"ADE20K-150","dataset_url":"/dataset/ade20k","rows_in_archive":23,"metrics":["mIoU"],"first_row_in_archive_order":{"model":"Mask-Adapter","paper_title":"Mask-Adapter: The Devil is in the Masks for Open-Vocabulary Segmentation","paper_url":"/paper/mask-adapter-the-devil-is-in-the-masks-for","paper_date":"2024-12-05","arxiv_id":"2412.04533","code_links":[{"title":"hustvl/maskadapter","url":"https://github.com/hustvl/maskadapter"}],"syntology":null}},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-5","slug":"open-vocabulary-semantic-segmentation-on-5","dataset":"PascalVOC-20","dataset_url":"/dataset/pascal-voc","rows_in_archive":20,"metrics":["mIoU","hIoU"],"first_row_in_archive_order":{"model":"UMG-CLIP-L/14","paper_title":"UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding","paper_url":"/paper/umg-clip-a-unified-multi-granularity-vision","paper_date":"2024-01-12","arxiv_id":"2401.06397","code_links":[{"title":"lygsbw/umg-clip","url":"https://github.com/lygsbw/umg-clip"}],"syntology":null}},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-3","slug":"open-vocabulary-semantic-segmentation-on-3","dataset":"ADE20K-847","dataset_url":"/dataset/ade20k","rows_in_archive":19,"metrics":["mIoU"],"first_row_in_archive_order":{"model":"UMG-CLIP-E/14","paper_title":"UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding","paper_url":"/paper/umg-clip-a-unified-multi-granularity-vision","paper_date":"2024-01-12","arxiv_id":"2401.06397","code_links":[{"title":"lygsbw/umg-clip","url":"https://github.com/lygsbw/umg-clip"}],"syntology":null}},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-7","slug":"open-vocabulary-semantic-segmentation-on-7","dataset":"PASCAL Context-459","dataset_url":null,"rows_in_archive":15,"metrics":["mIoU"],"first_row_in_archive_order":{"model":"SILC","paper_title":"SILC: Improving Vision Language Pretraining with Self-Distillation","paper_url":"/paper/silc-improving-vision-language-pretraining","paper_date":"2023-10-20","arxiv_id":"2310.13355","code_links":[],"syntology":null}},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-coco","slug":"open-vocabulary-semantic-segmentation-on-coco","dataset":"COCO-Stuff-171","dataset_url":"/dataset/coco-stuff","rows_in_archive":7,"metrics":["HIoU","mIoU"],"first_row_in_archive_order":{"model":"POMP","paper_title":"Prompt Pre-Training with Twenty-Thousand Classes for Open-Vocabulary Visual Recognition","paper_url":"/paper/prompt-pre-training-with-twenty-thousand-1","paper_date":"2023-04-10","arxiv_id":"2304.04704","code_links":[{"title":"amazon-science/prompt-pretraining","url":"https://github.com/amazon-science/prompt-pretraining"}],"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on","slug":"open-vocabulary-semantic-segmentation-on","dataset":"Cityscapes","dataset_url":"/dataset/cityscapes","rows_in_archive":5,"metrics":["mIoU"],"first_row_in_archive_order":{"model":"FC-CLIP","paper_title":"Convolutions Die Hard: Open-Vocabulary Segmentation with Single Frozen Convolutional CLIP","paper_url":"/paper/convolutions-die-hard-open-vocabulary-1","paper_date":"2023-08-04","arxiv_id":"2308.02487","code_links":[{"title":"bytedance/fc-clip","url":"https://github.com/bytedance/fc-clip"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-9","slug":"open-vocabulary-semantic-segmentation-on-9","dataset":"PascalVOC-20b","dataset_url":"/dataset/pascal-voc","rows_in_archive":4,"metrics":["mIoU"],"first_row_in_archive_order":{"model":"UMG-CLIP-E/14","paper_title":"UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding","paper_url":"/paper/umg-clip-a-unified-multi-granularity-vision","paper_date":"2024-01-12","arxiv_id":"2401.06397","code_links":[{"title":"lygsbw/umg-clip","url":"https://github.com/lygsbw/umg-clip"}],"syntology":null}},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-15","slug":"open-vocabulary-semantic-segmentation-on-15","dataset":"iSAID","dataset_url":"/dataset/isaid","rows_in_archive":2,"metrics":["mIoU-"],"first_row_in_archive_order":{"model":"SkySense-O","paper_title":"SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery","paper_url":"/paper/skysense-a-multi-modal-remote-sensing","paper_date":"2023-12-15","arxiv_id":"2312.10115","code_links":[{"title":"jack-bo1220/awesome-remote-sensing-foundation-models","url":"https://github.com/jack-bo1220/awesome-remote-sensing-foundation-models"}],"syntology":null}},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-16","slug":"open-vocabulary-semantic-segmentation-on-16","dataset":"ISPRS Potsdam","dataset_url":"/dataset/isprs-potsdam","rows_in_archive":1,"metrics":["mIoU"],"first_row_in_archive_order":{"model":"SkySense-O","paper_title":"SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery","paper_url":"/paper/skysense-a-multi-modal-remote-sensing","paper_date":"2023-12-15","arxiv_id":"2312.10115","code_links":[{"title":"jack-bo1220/awesome-remote-sensing-foundation-models","url":"https://github.com/jack-bo1220/awesome-remote-sensing-foundation-models"}],"syntology":null}},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-8","slug":"open-vocabulary-semantic-segmentation-on-8","dataset":"Cityscape-171","dataset_url":null,"rows_in_archive":1,"metrics":["mIoU"],"first_row_in_archive_order":{"model":"PACL","paper_title":"Open Vocabulary Semantic Segmentation with Patch Aligned Contrastive Learning","paper_url":"/paper/open-vocabulary-semantic-segmentation-with-2","paper_date":"2022-12-09","arxiv_id":"2212.04994","code_links":[{"title":"paulcouairon/diffcut","url":"https://github.com/paulcouairon/diffcut"}],"syntology":null}},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-fast","slug":"open-vocabulary-semantic-segmentation-on-fast","dataset":"FAST","dataset_url":null,"rows_in_archive":1,"metrics":["mIoU"],"first_row_in_archive_order":{"model":"SkySense-O","paper_title":"SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery","paper_url":"/paper/skysense-a-multi-modal-remote-sensing","paper_date":"2023-12-15","arxiv_id":"2312.10115","code_links":[{"title":"jack-bo1220/awesome-remote-sensing-foundation-models","url":"https://github.com/jack-bo1220/awesome-remote-sensing-foundation-models"}],"syntology":null}},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-sior","slug":"open-vocabulary-semantic-segmentation-on-sior","dataset":"SIOR","dataset_url":null,"rows_in_archive":1,"metrics":["mIoU"],"first_row_in_archive_order":{"model":"SkySense-O","paper_title":"SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery","paper_url":"/paper/skysense-a-multi-modal-remote-sensing","paper_date":"2023-12-15","arxiv_id":"2312.10115","code_links":[{"title":"jack-bo1220/awesome-remote-sensing-foundation-models","url":"https://github.com/jack-bo1220/awesome-remote-sensing-foundation-models"}],"syntology":null}},{"leaderboard":"/sota/open-vocabulary-semantic-segmentation-on-sota","slug":"open-vocabulary-semantic-segmentation-on-sota","dataset":"SOTA","dataset_url":null,"rows_in_archive":1,"metrics":["mIoU"],"first_row_in_archive_order":{"model":"SkySense-O","paper_title":"SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery","paper_url":"/paper/skysense-a-multi-modal-remote-sensing","paper_date":"2023-12-15","arxiv_id":"2312.10115","code_links":[{"title":"jack-bo1220/awesome-remote-sensing-foundation-models","url":"https://github.com/jack-bo1220/awesome-remote-sensing-foundation-models"}],"syntology":null}},{"leaderboard":null,"slug":"open-vocabulary-semantic-segmentation-on-18","dataset":"ADE20K-150","dataset_url":"/dataset/ade20k","rows_in_archive":0,"metrics":["mIoU"],"first_row_in_archive_order":null}],"datasets":[{"url":"/dataset/cityscapes","name":"Cityscapes","full_name":"","num_papers_in_archive":3702},{"url":"/dataset/ade20k","name":"ADE20K","full_name":"","num_papers_in_archive":1213},{"url":"/dataset/coco-stuff","name":"COCO-Stuff","full_name":"Common Objects in COntext-stuff","num_papers_in_archive":338},{"url":"/dataset/pascal-voc","name":"PASCAL VOC","full_name":"PASCAL Visual Object Classes Challenge","num_papers_in_archive":198},{"url":"/dataset/isaid","name":"iSAID","full_name":"","num_papers_in_archive":81},{"url":"/dataset/isprs-potsdam","name":"ISPRS Potsdam","full_name":"2D Semantic Labeling Contest - Potsdam","num_papers_in_archive":27}],"subtasks":[{"url":"/task/zero-guidance-segmentation","name":"Zero-Guidance Segmentation"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":71,"tagged_in_all":113,"items":[{"url":"/paper/seg-zero-reasoning-chain-guided-segmentation","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","date":"2025-03-09","arxiv_id":"2503.06520","repositories_listed":3,"syntology":null},{"url":"/paper/cat-seg-cost-aggregation-for-open-vocabulary","title":"CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic Segmentation","date":"2023-03-21","arxiv_id":"2303.11797","repositories_listed":3,"syntology":{"n":6,"n_ran":5,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/side-adapter-network-for-open-vocabulary","title":"Side Adapter Network for Open-Vocabulary Semantic Segmentation","date":"2023-02-23","arxiv_id":"2302.12242","repositories_listed":3,"syntology":{"n":9,"n_ran":1,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/segearth-ov-towards-traning-free-open","title":"SegEarth-OV: Towards Training-Free Open-Vocabulary Segmentation for Remote Sensing Images","date":"2024-10-02","arxiv_id":"2410.01768","repositories_listed":2,"syntology":{"n":9,"n_ran":3,"n_unverified":6,"n_pointer_only":9}},{"url":"/paper/understanding-multi-granularity-for-open","title":"Understanding Multi-Granularity for Open-Vocabulary Part Segmentation","date":"2024-06-17","arxiv_id":"2406.11384","repositories_listed":2,"syntology":{"n":15,"n_ran":11,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/open-vocabulary-segmentation-with-semantic","title":"Open-Vocabulary Segmentation with Semantic-Assisted Calibration","date":"2023-12-07","arxiv_id":"2312.04089","repositories_listed":2,"syntology":{"n":10,"n_ran":5,"n_unverified":5,"n_pointer_only":10}},{"url":"/paper/learning-mask-aware-clip-representations-for","title":"Learning Mask-aware CLIP Representations for Zero-Shot Segmentation","date":"2023-09-30","arxiv_id":"2310.00240","repositories_listed":2,"syntology":{"n":7,"n_ran":1,"n_unverified":6,"n_pointer_only":2}},{"url":"/paper/panoptic-vision-language-feature-fields","title":"Panoptic Vision-Language Feature Fields","date":"2023-09-11","arxiv_id":"2309.05448","repositories_listed":2,"syntology":null},{"url":"/paper/clip-surgery-for-better-explainability-with","title":"A Closer Look at the Explainability of Contrastive Language-Image Pre-training","date":"2023-04-12","arxiv_id":"2304.05653","repositories_listed":2,"syntology":null},{"url":"/paper/2112-14757","title":"A Simple Baseline for Open-Vocabulary Semantic Segmentation with Pre-trained Vision-language Model","date":"2021-12-29","arxiv_id":"2112.14757","repositories_listed":2,"syntology":null},{"url":"/paper/reme-a-data-centric-framework-for-training","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","date":"2025-06-26","arxiv_id":"2506.21233","repositories_listed":1,"syntology":null},{"url":"/paper/leveraging-depth-and-language-for-open","title":"Leveraging Depth and Language for Open-Vocabulary Domain-Generalized Semantic Segmentation","date":"2025-06-11","arxiv_id":"2506.09881","repositories_listed":1,"syntology":null},{"url":"/paper/test-time-adaptation-of-vision-language","title":"Test-Time Adaptation of Vision-Language Models for Open-Vocabulary Semantic Segmentation","date":"2025-05-28","arxiv_id":"2505.21844","repositories_listed":1,"syntology":null},{"url":"/paper/openseg-r-improving-open-vocabulary","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","date":"2025-05-22","arxiv_id":"2505.16974","repositories_listed":1,"syntology":null},{"url":"/paper/show-or-tell-a-benchmark-to-evaluate-visual","title":"Show or Tell? A Benchmark To Evaluate Visual and Textual Prompts in Semantic Segmentation","date":"2025-05-06","arxiv_id":"2505.06280","repositories_listed":1,"syntology":null},{"url":"/paper/floss-free-lunch-in-open-vocabulary-semantic","title":"FLOSS: Free Lunch in Open-vocabulary Semantic Segmentation","date":"2025-04-14","arxiv_id":"2504.10487","repositories_listed":1,"syntology":null},{"url":"/paper/semantic-library-adaptation-lora-retrieval","title":"Semantic Library Adaptation: LoRA Retrieval and Fusion for Open-Vocabulary Semantic Segmentation","date":"2025-03-27","arxiv_id":"2503.21780","repositories_listed":1,"syntology":null},{"url":"/paper/lposs-label-propagation-over-patches-and","title":"LPOSS: Label Propagation Over Patches and Pixels for Open-vocabulary Semantic Segmentation","date":"2025-03-25","arxiv_id":"2503.19777","repositories_listed":1,"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/efficient-redundancy-reduction-for-open","title":"Efficient Redundancy Reduction for Open-Vocabulary Semantic Segmentation","date":"2025-01-29","arxiv_id":"2501.17642","repositories_listed":1,"syntology":null},{"url":"/paper/fine-grained-image-text-correspondence-with","title":"Fine-Grained Image-Text Correspondence with Cost Aggregation for Open-Vocabulary Part Segmentation","date":"2025-01-16","arxiv_id":"2501.09688","repositories_listed":1,"syntology":{"n":11,"n_ran":7,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/fgaseg-fine-grained-pixel-text-alignment-for","title":"FGAseg: Fine-Grained Pixel-Text Alignment for Open-Vocabulary Semantic Segmentation","date":"2025-01-01","arxiv_id":"2501.00877","repositories_listed":1,"syntology":null},{"url":"/paper/dinov2-meets-text-a-unified-framework-for","title":"DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment","date":"2024-12-20","arxiv_id":"2412.16334","repositories_listed":1,"syntology":null},{"url":"/paper/maskclip-a-mask-based-clip-fine-tuning","title":"MaskCLIP++: A Mask-Based CLIP Fine-tuning Framework for Open-Vocabulary Image Segmentation","date":"2024-12-16","arxiv_id":"2412.11464","repositories_listed":1,"syntology":null},{"url":"/paper/mask-adapter-the-devil-is-in-the-masks-for","title":"Mask-Adapter: The Devil is in the Masks for Open-Vocabulary Segmentation","date":"2024-12-05","arxiv_id":"2412.04533","repositories_listed":1,"syntology":null},{"url":"/paper/hyperseg-towards-universal-visual","title":"HyperSeg: Towards Universal Visual Segmentation with Large Language Model","date":"2024-11-26","arxiv_id":"2411.17606","repositories_listed":1,"syntology":{"n":17,"n_ran":7,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/cliper-hierarchically-improving-spatial","title":"CLIPer: Hierarchically Improving Spatial Representation of CLIP for Open-Vocabulary Semantic Segmentation","date":"2024-11-21","arxiv_id":"2411.13836","repositories_listed":1,"syntology":null},{"url":"/paper/xmask3d-cross-modal-mask-reasoning-for-open","title":"XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation","date":"2024-11-20","arxiv_id":"2411.13243","repositories_listed":1,"syntology":{"n":11,"n_ran":0,"n_unverified":11,"n_pointer_only":0}},{"url":"/paper/itaclip-boosting-training-free-semantic","title":"ITACLIP: Boosting Training-Free Semantic Segmentation with Image, Text, and Architectural Enhancements","date":"2024-11-18","arxiv_id":"2411.12044","repositories_listed":1,"syntology":null},{"url":"/paper/corrclip-reconstructing-correlations-in-clip","title":"CorrCLIP: Reconstructing Correlations in CLIP with Off-the-Shelf Foundation Models for Open-Vocabulary Semantic Segmentation","date":"2024-11-15","arxiv_id":"2411.10086","repositories_listed":1,"syntology":{"n":9,"n_ran":0,"n_unverified":9,"n_pointer_only":9}},{"url":"/paper/ovose-open-vocabulary-semantic-segmentation","title":"OVOSE: Open-Vocabulary Semantic Segmentation in Event-Based Cameras","date":"2024-08-18","arxiv_id":"2408.09424","repositories_listed":1,"syntology":null}],"syntology_records":11,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}