{"url":"/sota/referring-expression-segmentation-on-refcoco","task":{"name":"Referring Expression Segmentation","url":"/task/referring-expression-segmentation","note":null},"dataset":{"name":"RefCoCo val","url":"/dataset/refcoco"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":"The task aims at labeling the pixels of an image or video that represent an object instance referred by a linguistic expression. In particular, the referring expression (RE) must allow the identification of an individual object in a discourse or scene (the referent). REs unambiguously identify the target instance.","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Overall IoU","mIoU","Precision@0.5","Precision@0.6","Precision@0.7","Precision@0.8","Precision@0.9","Mean IoU"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Overall IoU":"higher","mIoU":null,"Precision@0.5":"higher","Precision@0.6":"higher","Precision@0.7":"higher","Precision@0.8":"higher","Precision@0.9":"higher","Mean IoU":"higher"}},"counts":{"rows":37,"rows_with_code":32,"rows_with_paper_page":37,"rows_dated":37,"rows_using_additional_data":11},"rows":[{"rank_in_archive_order":1,"model":"DeRIS-L","metrics":{"Mean IoU":"85.72","Overall IoU":"85.41"},"uses_additional_data":false,"paper_date":"2025-07-02","paper":"/paper/deris-decoupling-perception-and-cognition-for","paper_url":"https://arxiv.org/abs/2507.01738v1","paper_title":"DeRIS: Decoupling Perception and Cognition for Enhanced Referring Image Segmentation through Loopback Synergy","code":"https://github.com/Dmmm1997/DeRIS","n_code_links":1,"syntology":null},{"rank_in_archive_order":2,"model":"HyperSeg","metrics":{"Overall IoU":"84.8"},"uses_additional_data":true,"paper_date":"2024-11-26","paper":"/paper/hyperseg-towards-universal-visual","paper_url":"https://arxiv.org/abs/2411.17606v2","paper_title":"HyperSeg: Towards Universal Visual Segmentation with Large Language Model","code":"https://github.com/congvvc/HyperSeg","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":10,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"PSALM","metrics":{"Overall IoU":"83.6"},"uses_additional_data":true,"paper_date":"2024-03-21","paper":"/paper/psalm-pixelwise-segmentation-with-large-multi","paper_url":"https://arxiv.org/abs/2403.14598v1","paper_title":"PSALM: Pixelwise SegmentAtion with Large Multi-Modal Model","code":"https://github.com/zamling/psalm","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"MLCD-Seg-7B","metrics":{"Overall IoU":"83.6"},"uses_additional_data":true,"paper_date":"2024-07-24","paper":"/paper/multi-label-cluster-discrimination-for-visual","paper_url":"https://arxiv.org/abs/2407.17331v2","paper_title":"Multi-label Cluster Discrimination for Visual Representation Learning","code":"https://github.com/deepglint/unicom","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":4,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"HIPIE","metrics":{"Overall IoU":"82.8"},"uses_additional_data":true,"paper_date":"2023-07-03","paper":"/paper/hierarchical-open-vocabulary-universal-image-1","paper_url":"https://arxiv.org/abs/2307.00764v2","paper_title":"Hierarchical Open-vocabulary Universal Image Segmentation","code":"https://github.com/berkeley-hipie/hipie","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":6,"model":"EVF-SAM","metrics":{"Overall IoU":"82.4"},"uses_additional_data":true,"paper_date":"2024-06-28","paper":"/paper/evf-sam-early-vision-language-fusion-for-text","paper_url":"https://arxiv.org/abs/2406.20076v4","paper_title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","code":"https://github.com/hustvl/evf-sam","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":7,"model":"UNINEXT-H","metrics":{"Overall IoU":"82.19"},"uses_additional_data":true,"paper_date":"2023-03-12","paper":"/paper/universal-instance-perception-as-object","paper_url":"https://arxiv.org/abs/2303.06674v2","paper_title":"Universal Instance Perception as Object Discovery and Retrieval","code":"https://github.com/MasterBin-IIAU/UNINEXT","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"UniLSeg-100","metrics":{"Overall IoU":"81.74"},"uses_additional_data":true,"paper_date":"2023-12-04","paper":"/paper/universal-segmentation-at-arbitrary","paper_url":"https://arxiv.org/abs/2312.01623v4","paper_title":"Universal Segmentation at Arbitrary Granularity with Language Instruction","code":"https://github.com/yongliu20/UniLSeg","n_code_links":2,"syntology":{"n_ran":13,"n_unverified":3,"n_samples":16,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"DETRIS","metrics":{"Overall IoU":"81.0"},"uses_additional_data":false,"paper_date":"2025-01-15","paper":"/paper/densely-connected-parameter-efficient-tuning","paper_url":"https://arxiv.org/abs/2501.08580v1","paper_title":"Densely Connected Parameter-Efficient Tuning for Referring Image Segmentation","code":"https://github.com/jiaqihuang01/detris","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":10,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"C3VG","metrics":{"Overall IoU":"80.89"},"uses_additional_data":false,"paper_date":"2025-01-12","paper":"/paper/multi-task-visual-grounding-with-coarse-to","paper_url":"https://arxiv.org/abs/2501.06710v1","paper_title":"Multi-task Visual Grounding with Coarse-to-Fine Consistency Constraints","code":"https://github.com/dmmm1997/c3vg","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"GLEE-Pro","metrics":{"Overall IoU":"80.0"},"uses_additional_data":true,"paper_date":"2023-12-14","paper":"/paper/general-object-foundation-model-for-images","paper_url":"https://arxiv.org/abs/2312.09158v1","paper_title":"General Object Foundation Model for Images and Videos at Scale","code":"https://github.com/FoundationVision/GLEE","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":12,"model":"SegAgent","metrics":{"Overall IoU":"79.7"},"uses_additional_data":false,"paper_date":"2025-03-11","paper":"/paper/segagent-exploring-pixel-understanding","paper_url":"https://arxiv.org/abs/2503.08625","paper_title":"SegAgent: Exploring Pixel Understanding Capabilities in MLLMs by Imitating Human Annotator Trajectories","code":"https://github.com/aim-uofa/SegAgent","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":13,"model":"MaskRIS (Swin-B, combined DB)","metrics":{"Overall IoU":"78.71"},"uses_additional_data":false,"paper_date":"2024-11-28","paper":"/paper/maskris-semantic-distortion-aware-data","paper_url":"https://arxiv.org/abs/2411.19067v1","paper_title":"MaskRIS: Semantic Distortion-aware Data Augmentation for Referring Image Segmentation","code":"https://github.com/naver-ai/maskris","n_code_links":1,"syntology":null},{"rank_in_archive_order":14,"model":"GROUNDHOG","metrics":{"Overall IoU":"78.5"},"uses_additional_data":true,"paper_date":"2024-02-26","paper":"/paper/groundhog-grounding-large-language-models-to","paper_url":"https://arxiv.org/abs/2402.16846v2","paper_title":"GROUNDHOG: Grounding Large Language Models to Holistic Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":15,"model":"SafaRi-B","metrics":{"Overall IoU":"77.21"},"uses_additional_data":false,"paper_date":"2024-07-02","paper":"/paper/safari-adaptive-sequence-transformer-for","paper_url":"https://arxiv.org/abs/2407.02389v1","paper_title":"SafaRi:Adaptive Sequence Transformer for Weakly Supervised Referring Expression Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":16,"model":"MaskRIS (Swin-B)","metrics":{"Mean IoU":"78.35","Overall IoU":"76.49"},"uses_additional_data":false,"paper_date":"2024-11-28","paper":"/paper/maskris-semantic-distortion-aware-data","paper_url":"https://arxiv.org/abs/2411.19067v1","paper_title":"MaskRIS: Semantic Distortion-aware Data Augmentation for Referring Image Segmentation","code":"https://github.com/naver-ai/maskris","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"PolyFormer-L","metrics":{"Mean IoU":"76.94","Overall IoU":"75.96"},"uses_additional_data":true,"paper_date":"2023-02-14","paper":"/paper/polyformer-referring-image-segmentation-as","paper_url":"https://arxiv.org/abs/2302.07387v2","paper_title":"PolyFormer: Referring Image Segmentation as Sequential Polygon Generation","code":"https://github.com/amazon-science/polygon-transformer","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":1,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":18,"model":"MagNet","metrics":{"Overall IoU":"75.24"},"uses_additional_data":false,"paper_date":"2023-12-19","paper":"/paper/mask-grounding-for-referring-image","paper_url":"https://arxiv.org/abs/2312.12198v2","paper_title":"Mask Grounding for Referring Image Segmentation","code":"https://github.com/yxchng/mask-grounding","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":3,"n_samples":13,"n_pointer_only_licence":13}},{"rank_in_archive_order":19,"model":"PolyFormer-B","metrics":{"Overall IoU":"74.82"},"uses_additional_data":true,"paper_date":"2023-02-14","paper":"/paper/polyformer-referring-image-segmentation-as","paper_url":"https://arxiv.org/abs/2302.07387v2","paper_title":"PolyFormer: Referring Image Segmentation as Sequential Polygon Generation","code":"https://github.com/amazon-science/polygon-transformer","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":1,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":20,"model":"ReLA","metrics":{"Overall IoU":"73.82"},"uses_additional_data":false,"paper_date":"2023-06-01","paper":"/paper/gres-generalized-referring-expression-1","paper_url":"https://arxiv.org/abs/2306.00968v1","paper_title":"GRES: Generalized Referring Expression Segmentation","code":"https://github.com/henghuiding/ReLA","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"VPD","metrics":{"Overall IoU":"73.25"},"uses_additional_data":false,"paper_date":"2023-03-03","paper":"/paper/unleashing-text-to-image-diffusion-models-for-1","paper_url":"https://arxiv.org/abs/2303.02153v1","paper_title":"Unleashing Text-to-Image Diffusion Models for Visual Perception","code":"https://github.com/open-mmlab/mmsegmentation/tree/main/configs/vpd","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":22,"model":"VLT","metrics":{"Overall IoU":"72.96"},"uses_additional_data":false,"paper_date":"2022-10-28","paper":"/paper/vlt-vision-language-transformer-and-query","paper_url":"https://arxiv.org/abs/2210.15871v1","paper_title":"VLT: Vision-Language Transformer and Query Generation for Referring Segmentation","code":"https://github.com/henghuiding/Vision-Language-Transformer","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":23,"model":"ETRIS","metrics":{"Overall IoU":"71.06"},"uses_additional_data":false,"paper_date":"2023-07-21","paper":"/paper/bridging-vision-and-language-encoders","paper_url":"https://arxiv.org/abs/2307.11545v1","paper_title":"Bridging Vision and Language Encoders: Parameter-Efficient Tuning for Referring Image Segmentation","code":"https://github.com/kkakkkka/etris","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":8,"n_samples":16,"n_pointer_only_licence":0}},{"rank_in_archive_order":24,"model":"RefTR","metrics":{"Overall IoU":"70.56"},"uses_additional_data":false,"paper_date":"2021-06-06","paper":"/paper/referring-transformer-a-one-step-approach-to","paper_url":"https://arxiv.org/abs/2106.03089v2","paper_title":"Referring Transformer: A One-step Approach to Multi-task Visual Grounding","code":"https://github.com/ubc-vision/RefTR","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":25,"model":"CRIS","metrics":{"Overall IoU":"70.47"},"uses_additional_data":false,"paper_date":"2021-11-30","paper":"/paper/cris-clip-driven-referring-image-segmentation","paper_url":"https://arxiv.org/abs/2111.15174v2","paper_title":"CRIS: CLIP-Driven Referring Image Segmentation","code":"https://github.com/DerrickWang005/CRIS.pytorch","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":5,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":26,"model":"MaIL","metrics":{"Overall IoU":"70.13"},"uses_additional_data":false,"paper_date":"2021-11-21","paper":"/paper/mail-a-unified-mask-image-language-trimodal","paper_url":"https://arxiv.org/abs/2111.10747v2","paper_title":"MaIL: A Unified Mask-Image-Language Trimodal Network for Referring Image Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":27,"model":"VLT","metrics":{"Overall IoU":"65.65"},"uses_additional_data":false,"paper_date":"2021-08-12","paper":"/paper/vision-language-transformer-and-query","paper_url":"https://arxiv.org/abs/2108.05565v1","paper_title":"Vision-Language Transformer and Query Generation for Referring Segmentation","code":"https://github.com/henghuiding/Vision-Language-Transformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":28,"model":"SHNet","metrics":{"Overall IoU":"65.32","Precision@0.5":"75.18","Precision@0.6":"69.36","Precision@0.7":"61.21","Precision@0.8":"46.16","Precision@0.9":"16.23"},"uses_additional_data":false,"paper_date":"2021-04-21","paper":"/paper/comprehensive-multi-modal-interactions-for","paper_url":"https://arxiv.org/abs/2104.10412v4","paper_title":"Comprehensive Multi-Modal Interactions for Referring Image Segmentation","code":"https://github.com/kanji95/SHNET","n_code_links":1,"syntology":null},{"rank_in_archive_order":29,"model":"CPMC","metrics":{"Overall IoU":"61.36"},"uses_additional_data":false,"paper_date":"2020-10-01","paper":"/paper/referring-image-segmentation-via-cross-modal-1","paper_url":"https://arxiv.org/abs/2010.00514v1","paper_title":"Referring Image Segmentation via Cross-Modal Progressive Comprehension","code":"https://github.com/spyflying/CMPC-Refseg","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":30,"model":"BRINet","metrics":{"Overall IoU":"61.35"},"uses_additional_data":false,"paper_date":"2020-06-01","paper":"/paper/bi-directional-relationship-inferring-network","paper_url":"http://openaccess.thecvf.com/content_CVPR_2020/html/Hu_Bi-Directional_Relationship_Inferring_Network_for_Referring_Image_Segmentation_CVPR_2020_paper.html","paper_title":"Bi-Directional Relationship Inferring Network for Referring Image Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":31,"model":"RefVOS with BERT + MLM loss","metrics":{"Overall IoU":"59.45"},"uses_additional_data":false,"paper_date":"2020-10-01","paper":"/paper/refvos-a-closer-look-at-referring-expressions","paper_url":"https://arxiv.org/abs/2010.00263v1","paper_title":"RefVOS: A Closer Look at Referring Expressions for Video Object Segmentation","code":"https://github.com/miriambellver/refvos","n_code_links":2,"syntology":null},{"rank_in_archive_order":32,"model":"LANG2SEG","metrics":{"Overall IoU":"58.90"},"uses_additional_data":false,"paper_date":"2019-10-10","paper":"/paper/referring-expression-object-segmentation-with","paper_url":"https://arxiv.org/abs/1910.04748v1","paper_title":"Referring Expression Object Segmentation with Caption-Aware Consistency","code":"https://github.com/wenz116/lang2seg","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":33,"model":"RefVOS with BERT Pre-train","metrics":{"Overall IoU":"58.65"},"uses_additional_data":false,"paper_date":"2020-10-01","paper":"/paper/refvos-a-closer-look-at-referring-expressions","paper_url":"https://arxiv.org/abs/2010.00263v1","paper_title":"RefVOS: A Closer Look at Referring Expressions for Video Object Segmentation","code":"https://github.com/miriambellver/refvos","n_code_links":2,"syntology":null},{"rank_in_archive_order":34,"model":"CMSA","metrics":{"Overall IoU":"58.32"},"uses_additional_data":false,"paper_date":"2019-04-09","paper":"/paper/cross-modal-self-attention-network-for","paper_url":"http://arxiv.org/abs/1904.04745v1","paper_title":"Cross-Modal Self-Attention Network for Referring Image Segmentation","code":"https://github.com/lwye/CMSA-Net","n_code_links":1,"syntology":null},{"rank_in_archive_order":35,"model":"STEP (1-fold)","metrics":{"Overall IoU":"56.58"},"uses_additional_data":false,"paper_date":"2019-10-01","paper":"/paper/see-through-text-grouping-for-referring-image","paper_url":"http://openaccess.thecvf.com/content_ICCV_2019/html/Chen_See-Through-Text_Grouping_for_Referring_Image_Segmentation_ICCV_2019_paper.html","paper_title":"See-Through-Text Grouping for Referring Image Segmentation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":36,"model":"MattNet","metrics":{"Overall IoU":"56.51"},"uses_additional_data":false,"paper_date":"2018-01-24","paper":"/paper/mattnet-modular-attention-network-for","paper_url":"http://arxiv.org/abs/1801.08186v3","paper_title":"MAttNet: Modular Attention Network for Referring Expression Comprehension","code":"https://github.com/lichengunc/MAttNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":37,"model":"VATEX","metrics":{"mIoU":"78.16"},"uses_additional_data":false,"paper_date":"2024-04-12","paper":"/paper/improving-referring-image-segmentation-using","paper_url":"https://arxiv.org/abs/2404.08590v2","paper_title":"Vision-Aware Text Features in Referring Image Segmentation: From Object Understanding to Context Understanding","code":"https://github.com/nero1342/VATEX","n_code_links":1,"syntology":null}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":22,"rows_with_any_sample_ran":18,"distinct_papers_with_graph_line":21,"distinct_papers_with_any_sample_ran":17,"samples_over_distinct_papers":{"n_ran":94,"n_unverified":90,"n_samples":184,"n_pointer_only_licence":21,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":99,"n_unverified":91,"n_samples":190,"n_pointer_only_licence":27,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}