{"url":"/sota/referring-expression-segmentation-on-refcoco-4","task":{"name":"Referring Expression Segmentation","url":"/task/referring-expression-segmentation","note":null},"dataset":{"name":"RefCOCO+ testA","url":"/dataset/refcoco"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":"The task aims at labeling the pixels of an image or video that represent an object instance referred by a linguistic expression. In particular, the referring expression (RE) must allow the identification of an individual object in a discourse or scene (the referent). REs unambiguously identify the target instance.","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Overall IoU","Mean IoU","mIoU"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Overall IoU":"higher","Mean IoU":"higher","mIoU":null}},"counts":{"rows":30,"rows_with_code":25,"rows_with_paper_page":30,"rows_dated":30,"rows_using_additional_data":9},"rows":[{"rank_in_archive_order":1,"model":"HyperSeg","metrics":{"Overall IoU":"83.5"},"uses_additional_data":true,"paper_date":"2024-11-26","paper":"/paper/hyperseg-towards-universal-visual","paper_url":"https://arxiv.org/abs/2411.17606v2","paper_title":"HyperSeg: Towards Universal Visual Segmentation with Large Language Model","code":"https://github.com/congvvc/HyperSeg","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":10,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"MLCD-Seg-7B","metrics":{"Overall IoU":"82.9"},"uses_additional_data":true,"paper_date":"2024-07-24","paper":"/paper/multi-label-cluster-discrimination-for-visual","paper_url":"https://arxiv.org/abs/2407.17331v2","paper_title":"Multi-label Cluster Discrimination for Visual Representation Learning","code":"https://github.com/deepglint/unicom","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":4,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"DeRIS-L","metrics":{"Mean IoU":"83.74","Overall IoU":"82.34"},"uses_additional_data":false,"paper_date":"2025-07-02","paper":"/paper/deris-decoupling-perception-and-cognition-for","paper_url":"https://arxiv.org/abs/2507.01738v1","paper_title":"DeRIS: Decoupling Perception and Cognition for Enhanced Referring Image Segmentation through Loopback Synergy","code":"https://github.com/Dmmm1997/DeRIS","n_code_links":1,"syntology":null},{"rank_in_archive_order":4,"model":"EVF-SAM","metrics":{"Overall IoU":"80"},"uses_additional_data":true,"paper_date":"2024-06-28","paper":"/paper/evf-sam-early-vision-language-fusion-for-text","paper_url":"https://arxiv.org/abs/2406.20076v4","paper_title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","code":"https://github.com/hustvl/evf-sam","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":5,"model":"DETRIS","metrics":{"Overall IoU":"78.6"},"uses_additional_data":false,"paper_date":"2025-01-15","paper":"/paper/densely-connected-parameter-efficient-tuning","paper_url":"https://arxiv.org/abs/2501.08580v1","paper_title":"Densely Connected Parameter-Efficient Tuning for Referring Image Segmentation","code":"https://github.com/jiaqihuang01/detris","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":10,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":6,"model":"UniLSeg-100","metrics":{"Overall IoU":"78.29"},"uses_additional_data":true,"paper_date":"2023-12-04","paper":"/paper/universal-segmentation-at-arbitrary","paper_url":"https://arxiv.org/abs/2312.01623v4","paper_title":"Universal Segmentation at Arbitrary Granularity with Language Instruction","code":"https://github.com/yongliu20/UniLSeg","n_code_links":2,"syntology":{"n_ran":13,"n_unverified":3,"n_samples":16,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"C3VG","metrics":{"Overall IoU":"77.96"},"uses_additional_data":false,"paper_date":"2025-01-12","paper":"/paper/multi-task-visual-grounding-with-coarse-to","paper_url":"https://arxiv.org/abs/2501.06710v1","paper_title":"Multi-task Visual Grounding with Coarse-to-Fine Consistency Constraints","code":"https://github.com/dmmm1997/c3vg","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"UniLSeg-20","metrics":{"Overall IoU":"77.02"},"uses_additional_data":true,"paper_date":"2023-12-04","paper":"/paper/universal-segmentation-at-arbitrary","paper_url":"https://arxiv.org/abs/2312.01623v4","paper_title":"Universal Segmentation at Arbitrary Granularity with Language Instruction","code":"https://github.com/yongliu20/UniLSeg","n_code_links":2,"syntology":{"n_ran":13,"n_unverified":3,"n_samples":16,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"UNINEXT-H","metrics":{"Overall IoU":"76.42"},"uses_additional_data":true,"paper_date":"2023-03-12","paper":"/paper/universal-instance-perception-as-object","paper_url":"https://arxiv.org/abs/2303.06674v2","paper_title":"Universal Instance Perception as Object Discovery and Retrieval","code":"https://github.com/MasterBin-IIAU/UNINEXT","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"MaskRIS (Swin-B, combined DB)","metrics":{"Overall IoU":"75.15"},"uses_additional_data":false,"paper_date":"2024-11-28","paper":"/paper/maskris-semantic-distortion-aware-data","paper_url":"https://arxiv.org/abs/2411.19067v1","paper_title":"MaskRIS: Semantic Distortion-aware Data Augmentation for Referring Image Segmentation","code":"https://github.com/naver-ai/maskris","n_code_links":1,"syntology":null},{"rank_in_archive_order":11,"model":"GROUNDHOG","metrics":{"Overall IoU":"75.0"},"uses_additional_data":true,"paper_date":"2024-02-26","paper":"/paper/groundhog-grounding-large-language-models-to","paper_url":"https://arxiv.org/abs/2402.16846v2","paper_title":"GROUNDHOG: Grounding Large Language Models to Holistic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":12,"model":"PolyFormer-L","metrics":{"Mean IoU":"75.71","Overall IoU":"74.56"},"uses_additional_data":true,"paper_date":"2023-02-14","paper":"/paper/polyformer-referring-image-segmentation-as","paper_url":"https://arxiv.org/abs/2302.07387v2","paper_title":"PolyFormer: Referring Image Segmentation as Sequential Polygon Generation","code":"https://github.com/amazon-science/polygon-transformer","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":1,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":13,"model":"SafaRi-B","metrics":{"Overall IoU":"74.53"},"uses_additional_data":false,"paper_date":"2024-07-02","paper":"/paper/safari-adaptive-sequence-transformer-for","paper_url":"https://arxiv.org/abs/2407.02389v1","paper_title":"SafaRi:Adaptive Sequence Transformer for Weakly Supervised Referring Expression Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":14,"model":"MaskRIS (Swin-B)","metrics":{"Mean IoU":"76.73","Overall IoU":"74.46"},"uses_additional_data":false,"paper_date":"2024-11-28","paper":"/paper/maskris-semantic-distortion-aware-data","paper_url":"https://arxiv.org/abs/2411.19067v1","paper_title":"MaskRIS: Semantic Distortion-aware Data Augmentation for Referring Image Segmentation","code":"https://github.com/naver-ai/maskris","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"PolyFormer-B","metrics":{"Mean IoU":"74.51","Overall IoU":"72.89"},"uses_additional_data":true,"paper_date":"2023-02-14","paper":"/paper/polyformer-referring-image-segmentation-as","paper_url":"https://arxiv.org/abs/2302.07387v2","paper_title":"PolyFormer: Referring Image Segmentation as Sequential Polygon Generation","code":"https://github.com/amazon-science/polygon-transformer","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":1,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":16,"model":"MagNet","metrics":{"Overall IoU":"71.32"},"uses_additional_data":false,"paper_date":"2023-12-19","paper":"/paper/mask-grounding-for-referring-image","paper_url":"https://arxiv.org/abs/2312.12198v2","paper_title":"Mask Grounding for Referring Image Segmentation","code":"https://github.com/yxchng/mask-grounding","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":3,"n_samples":13,"n_pointer_only_licence":13}},{"rank_in_archive_order":17,"model":"ReLA","metrics":{"Overall IoU":"71.02"},"uses_additional_data":false,"paper_date":"2023-06-01","paper":"/paper/gres-generalized-referring-expression-1","paper_url":"https://arxiv.org/abs/2306.00968v1","paper_title":"GRES: Generalized Referring Expression Segmentation","code":"https://github.com/henghuiding/ReLA","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":18,"model":"VLT","metrics":{"Overall IoU":"68.43"},"uses_additional_data":false,"paper_date":"2022-10-28","paper":"/paper/vlt-vision-language-transformer-and-query","paper_url":"https://arxiv.org/abs/2210.15871v1","paper_title":"VLT: Vision-Language Transformer and Query Generation for Referring Segmentation","code":"https://github.com/henghuiding/Vision-Language-Transformer","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"LAVT","metrics":{"Overall IoU":"68.38"},"uses_additional_data":false,"paper_date":"2021-12-04","paper":"/paper/lavt-language-aware-vision-transformer-for","paper_url":"https://arxiv.org/abs/2112.02244v2","paper_title":"LAVT: Language-Aware Vision Transformer for Referring Image Segmentation","code":"https://github.com/yz93/lavt-ris","n_code_links":1,"syntology":null},{"rank_in_archive_order":20,"model":"CRIS","metrics":{"Overall IoU":"68.08"},"uses_additional_data":false,"paper_date":"2021-11-30","paper":"/paper/cris-clip-driven-referring-image-segmentation","paper_url":"https://arxiv.org/abs/2111.15174v2","paper_title":"CRIS: CLIP-Driven Referring Image Segmentation","code":"https://github.com/DerrickWang005/CRIS.pytorch","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":5,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"MaIL","metrics":{"Overall IoU":"65.92"},"uses_additional_data":false,"paper_date":"2021-11-21","paper":"/paper/mail-a-unified-mask-image-language-trimodal","paper_url":"https://arxiv.org/abs/2111.10747v2","paper_title":"MaIL: A Unified Mask-Image-Language Trimodal Network for Referring Image Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":22,"model":"VLT","metrics":{"Overall IoU":"59.20"},"uses_additional_data":false,"paper_date":"2021-08-12","paper":"/paper/vision-language-transformer-and-query","paper_url":"https://arxiv.org/abs/2108.05565v1","paper_title":"Vision-Language Transformer and Query Generation for Referring Segmentation","code":"https://github.com/henghuiding/Vision-Language-Transformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":23,"model":"SHNet","metrics":{"Overall IoU":"58.46"},"uses_additional_data":false,"paper_date":"2021-04-21","paper":"/paper/comprehensive-multi-modal-interactions-for","paper_url":"https://arxiv.org/abs/2104.10412v4","paper_title":"Comprehensive Multi-Modal Interactions for Referring Image Segmentation","code":"https://github.com/kanji95/SHNET","n_code_links":1,"syntology":null},{"rank_in_archive_order":24,"model":"CPMC","metrics":{"Overall IoU":"53.44"},"uses_additional_data":false,"paper_date":"2020-10-01","paper":"/paper/referring-image-segmentation-via-cross-modal-1","paper_url":"https://arxiv.org/abs/2010.00514v1","paper_title":"Referring Image Segmentation via Cross-Modal Progressive Comprehension","code":"https://github.com/spyflying/CMPC-Refseg","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":25,"model":"BRINet","metrics":{"Overall IoU":"52.87"},"uses_additional_data":false,"paper_date":"2020-06-01","paper":"/paper/bi-directional-relationship-inferring-network","paper_url":"http://openaccess.thecvf.com/content_CVPR_2020/html/Hu_Bi-Directional_Relationship_Inferring_Network_for_Referring_Image_Segmentation_CVPR_2020_paper.html","paper_title":"Bi-Directional Relationship Inferring Network for Referring Image Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":26,"model":"MattNet","metrics":{"Overall IoU":"52.39"},"uses_additional_data":false,"paper_date":"2018-01-24","paper":"/paper/mattnet-modular-attention-network-for","paper_url":"http://arxiv.org/abs/1801.08186v3","paper_title":"MAttNet: Modular Attention Network for Referring Expression Comprehension","code":"https://github.com/lichengunc/MAttNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":27,"model":"STEP (5-fold)","metrics":{"Overall IoU":"52.33"},"uses_additional_data":false,"paper_date":"2019-10-01","paper":"/paper/see-through-text-grouping-for-referring-image","paper_url":"http://openaccess.thecvf.com/content_ICCV_2019/html/Chen_See-Through-Text_Grouping_for_Referring_Image_Segmentation_ICCV_2019_paper.html","paper_title":"See-Through-Text Grouping for Referring Image Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":28,"model":"RefVOS with BERT + MLM Loss","metrics":{"Overall IoU":"49.73"},"uses_additional_data":false,"paper_date":"2020-10-01","paper":"/paper/refvos-a-closer-look-at-referring-expressions","paper_url":"https://arxiv.org/abs/2010.00263v1","paper_title":"RefVOS: A Closer Look at Referring Expressions for Video Object Segmentation","code":"https://github.com/miriambellver/refvos","n_code_links":2,"syntology":null},{"rank_in_archive_order":29,"model":"CMSA","metrics":{"Overall IoU":"47.60"},"uses_additional_data":false,"paper_date":"2019-04-09","paper":"/paper/cross-modal-self-attention-network-for","paper_url":"http://arxiv.org/abs/1904.04745v1","paper_title":"Cross-Modal Self-Attention Network for Referring Image Segmentation","code":"https://github.com/lwye/CMSA-Net","n_code_links":1,"syntology":null},{"rank_in_archive_order":30,"model":"VATEX","metrics":{"mIoU":"74.41"},"uses_additional_data":false,"paper_date":"2024-04-12","paper":"/paper/improving-referring-image-segmentation-using","paper_url":"https://arxiv.org/abs/2404.08590v2","paper_title":"Vision-Aware Text Features in Referring Image Segmentation: From Object Understanding to Context Understanding","code":"https://github.com/nero1342/VATEX","n_code_links":1,"syntology":null}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":15,"rows_with_any_sample_ran":13,"distinct_papers_with_graph_line":13,"distinct_papers_with_any_sample_ran":11,"samples_over_distinct_papers":{"n_ran":69,"n_unverified":61,"n_samples":130,"n_pointer_only_licence":21,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":87,"n_unverified":65,"n_samples":152,"n_pointer_only_licence":27,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}