{"url":"/task/referring-expression-segmentation","name":"Referring Expression Segmentation","slug":"referring-expression-segmentation","description_markdown":"The task aims at labeling the pixels of an image or video that represent an object instance referred by a linguistic expression. In particular, the referring expression (RE) must allow the identification of an individual object in a discourse or scene (the referent). REs unambiguously identify the target instance.","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":145,"papers_with_code":97,"benchmarks":22,"benchmark_tables_in_archive":22,"benchmark_tables_shown":22,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":11,"subtasks":2,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/referring-expression-segmentation-on-refcoco","slug":"referring-expression-segmentation-on-refcoco","dataset":"RefCoCo val","dataset_url":"/dataset/refcoco","rows_in_archive":37,"metrics":["Overall IoU","mIoU","Precision@0.5","Precision@0.6","Precision@0.7","Precision@0.8","Precision@0.9","Mean IoU"],"first_row_in_archive_order":{"model":"DeRIS-L","paper_title":"DeRIS: Decoupling Perception and Cognition for Enhanced Referring Image Segmentation through Loopback Synergy","paper_url":"/paper/deris-decoupling-perception-and-cognition-for","paper_date":"2025-07-02","arxiv_id":"2507.01738","code_links":[{"title":"Dmmm1997/DeRIS","url":"https://github.com/Dmmm1997/DeRIS"}],"syntology":null}},{"leaderboard":"/sota/referring-expression-segmentation-on-refcoco-3","slug":"referring-expression-segmentation-on-refcoco-3","dataset":"RefCOCO+ val","dataset_url":"/dataset/refcoco","rows_in_archive":33,"metrics":["Overall IoU","Mean IoU"],"first_row_in_archive_order":{"model":"MLCD-Seg-7B","paper_title":"Multi-label Cluster Discrimination for Visual Representation Learning","paper_url":"/paper/multi-label-cluster-discrimination-for-visual","paper_date":"2024-07-24","arxiv_id":"2407.17331","code_links":[{"title":"deepglint/unicom","url":"https://github.com/deepglint/unicom"}],"syntology":{"n":11,"n_ran":7,"n_unverified":4,"n_pointer_only":0}}},{"leaderboard":"/sota/referring-expression-segmentation-on-refer-1","slug":"referring-expression-segmentation-on-refer-1","dataset":"Refer-YouTube-VOS (2021 public validation)","dataset_url":"/dataset/refer-youtube-vos","rows_in_archive":33,"metrics":["J&F","J","F"],"first_row_in_archive_order":{"model":"MPG-SAM 2","paper_title":"MPG-SAM 2: Adapting SAM 2 with Mask Priors and Global Context for Referring Video Object Segmentation","paper_url":"/paper/mpg-sam-2-adapting-sam-2-with-mask-priors-and","paper_date":"2025-01-23","arxiv_id":"2501.13667","code_links":[{"title":"rongfu-dsb/MPG-SAM2","url":"https://github.com/rongfu-dsb/MPG-SAM2"}],"syntology":{"n":16,"n_ran":9,"n_unverified":7,"n_pointer_only":0}}},{"leaderboard":"/sota/referring-expression-segmentation-on-refcoco-4","slug":"referring-expression-segmentation-on-refcoco-4","dataset":"RefCOCO+ testA","dataset_url":"/dataset/refcoco","rows_in_archive":30,"metrics":["Overall IoU","Mean IoU","mIoU"],"first_row_in_archive_order":{"model":"HyperSeg","paper_title":"HyperSeg: Towards Universal Visual Segmentation with Large Language Model","paper_url":"/paper/hyperseg-towards-universal-visual","paper_date":"2024-11-26","arxiv_id":"2411.17606","code_links":[{"title":"congvvc/HyperSeg","url":"https://github.com/congvvc/HyperSeg"}],"syntology":{"n":17,"n_ran":7,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/referring-expression-segmentation-on-refcoco-5","slug":"referring-expression-segmentation-on-refcoco-5","dataset":"RefCOCO+ test B","dataset_url":"/dataset/refcoco","rows_in_archive":30,"metrics":["Overall IoU","Mean IoU","mIoU"],"first_row_in_archive_order":{"model":"MLCD-Seg-7B","paper_title":"Multi-label Cluster Discrimination for Visual Representation Learning","paper_url":"/paper/multi-label-cluster-discrimination-for-visual","paper_date":"2024-07-24","arxiv_id":"2407.17331","code_links":[{"title":"deepglint/unicom","url":"https://github.com/deepglint/unicom"}],"syntology":{"n":11,"n_ran":7,"n_unverified":4,"n_pointer_only":0}}},{"leaderboard":"/sota/referring-expression-segmentation-on-a2d","slug":"referring-expression-segmentation-on-a2d","dataset":"A2D Sentences","dataset_url":"/dataset/a2d-sentences","rows_in_archive":27,"metrics":["AP","IoU overall","IoU mean","Precision@0.5","Precision@0.6","Precision@0.7","Precision@0.8","Precision@0.9"],"first_row_in_archive_order":{"model":"SgMg (Video-Swin-B)","paper_title":"Spectrum-guided Multi-granularity Referring Video Object Segmentation","paper_url":"/paper/spectrum-guided-multi-granularity-referring","paper_date":"2023-07-25","arxiv_id":"2307.13537","code_links":[{"title":"bo-miao/sgmg","url":"https://github.com/bo-miao/sgmg"}],"syntology":{"n":9,"n_ran":6,"n_unverified":3,"n_pointer_only":9}}},{"leaderboard":"/sota/referring-expression-segmentation-on-refcocog","slug":"referring-expression-segmentation-on-refcocog","dataset":"RefCOCOg-val","dataset_url":"/dataset/google-refexp","rows_in_archive":23,"metrics":["Overall IoU","Mean IoU","IoU","mIoU"],"first_row_in_archive_order":{"model":"MLCD-Seg-7B","paper_title":"Multi-label Cluster Discrimination for Visual Representation Learning","paper_url":"/paper/multi-label-cluster-discrimination-for-visual","paper_date":"2024-07-24","arxiv_id":"2407.17331","code_links":[{"title":"deepglint/unicom","url":"https://github.com/deepglint/unicom"}],"syntology":{"n":11,"n_ran":7,"n_unverified":4,"n_pointer_only":0}}},{"leaderboard":"/sota/referring-expression-segmentation-on-j-hmdb","slug":"referring-expression-segmentation-on-j-hmdb","dataset":"J-HMDB","dataset_url":"/dataset/jhmdb","rows_in_archive":21,"metrics":["AP","IoU overall","IoU mean","Precision@0.5","Precision@0.6","Precision@0.7","Precision@0.8","Precision@0.9"],"first_row_in_archive_order":{"model":"SgMg (Video-Swin-B)","paper_title":"Spectrum-guided Multi-granularity Referring Video Object Segmentation","paper_url":"/paper/spectrum-guided-multi-granularity-referring","paper_date":"2023-07-25","arxiv_id":"2307.13537","code_links":[{"title":"bo-miao/sgmg","url":"https://github.com/bo-miao/sgmg"}],"syntology":{"n":9,"n_ran":6,"n_unverified":3,"n_pointer_only":9}}},{"leaderboard":"/sota/referring-expression-segmentation-on-davis","slug":"referring-expression-segmentation-on-davis","dataset":"DAVIS 2017 (val)","dataset_url":"/dataset/davis-2017","rows_in_archive":18,"metrics":["J&F 1st frame","J&F Full video","Zero-Shot Transfer","J&F score"],"first_row_in_archive_order":{"model":"UNINEXT-H","paper_title":"Universal Instance Perception as Object Discovery and Retrieval","paper_url":"/paper/universal-instance-perception-as-object","paper_date":"2023-03-12","arxiv_id":"2303.06674","code_links":[{"title":"MasterBin-IIAU/UNINEXT","url":"https://github.com/MasterBin-IIAU/UNINEXT"}],"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/referring-expression-segmentation-on-refcocog-1","slug":"referring-expression-segmentation-on-refcocog-1","dataset":"RefCOCOg-test","dataset_url":"/dataset/google-refexp","rows_in_archive":18,"metrics":["Overall IoU","Mean IoU","mIoU"],"first_row_in_archive_order":{"model":"UniLSeg-100","paper_title":"Universal Segmentation at Arbitrary Granularity with Language Instruction","paper_url":"/paper/universal-segmentation-at-arbitrary","paper_date":"2023-12-04","arxiv_id":"2312.01623","code_links":[{"title":"yongliu20/UniLSeg","url":"https://github.com/yongliu20/UniLSeg"},{"title":"workforai/UniLSeg","url":"https://github.com/workforai/UniLSeg"}],"syntology":{"n":16,"n_ran":13,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/referring-expression-segmentation-on-refcoco-8","slug":"referring-expression-segmentation-on-refcoco-8","dataset":"RefCOCO testA","dataset_url":"/dataset/refcoco","rows_in_archive":13,"metrics":["Overall IoU","mIoU","Mean IoU"],"first_row_in_archive_order":{"model":"DeRIS-L","paper_title":"DeRIS: Decoupling Perception and Cognition for Enhanced Referring Image Segmentation through Loopback Synergy","paper_url":"/paper/deris-decoupling-perception-and-cognition-for","paper_date":"2025-07-02","arxiv_id":"2507.01738","code_links":[{"title":"Dmmm1997/DeRIS","url":"https://github.com/Dmmm1997/DeRIS"}],"syntology":null}},{"leaderboard":"/sota/referring-expression-segmentation-on-refcoco-9","slug":"referring-expression-segmentation-on-refcoco-9","dataset":"RefCOCO testB","dataset_url":"/dataset/refcoco","rows_in_archive":13,"metrics":["Overall IoU","mIoU","Mean IoU"],"first_row_in_archive_order":{"model":"HyperSeg","paper_title":"HyperSeg: Towards Universal Visual Segmentation with Large Language Model","paper_url":"/paper/hyperseg-towards-universal-visual","paper_date":"2024-11-26","arxiv_id":"2411.17606","code_links":[{"title":"congvvc/HyperSeg","url":"https://github.com/congvvc/HyperSeg"}],"syntology":{"n":17,"n_ran":7,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/referring-expression-segmentation-on","slug":"referring-expression-segmentation-on","dataset":"PhraseCut","dataset_url":"/dataset/phrasecut","rows_in_archive":6,"metrics":["Mean IoU","Pr@0.5","Pr@0.7","Pr@0.9"],"first_row_in_archive_order":{"model":"GLIPv2","paper_title":"GLIPv2: Unifying Localization and Vision-Language Understanding","paper_url":"/paper/glipv2-unifying-localization-and-vision","paper_date":"2022-06-12","arxiv_id":"2206.05836","code_links":[{"title":"microsoft/GLIP","url":"https://github.com/microsoft/GLIP"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/referring-expression-segmentation-on-refcoco-6","slug":"referring-expression-segmentation-on-refcoco-6","dataset":"RefCOCO","dataset_url":"/dataset/refcoco","rows_in_archive":4,"metrics":["IoU","IoU (%)"],"first_row_in_archive_order":{"model":"DETRIS","paper_title":"Densely Connected Parameter-Efficient Tuning for Referring Image Segmentation","paper_url":"/paper/densely-connected-parameter-efficient-tuning","paper_date":"2025-01-15","arxiv_id":"2501.08580","code_links":[{"title":"jiaqihuang01/detris","url":"https://github.com/jiaqihuang01/detris"}],"syntology":{"n":17,"n_ran":7,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/referring-expression-segmentation-on-referit","slug":"referring-expression-segmentation-on-referit","dataset":"ReferIt","dataset_url":null,"rows_in_archive":3,"metrics":["Overall IoU","Mean IoU"],"first_row_in_archive_order":{"model":"PolyFormer-L","paper_title":"PolyFormer: Referring Image Segmentation as Sequential Polygon Generation","paper_url":"/paper/polyformer-referring-image-segmentation-as","paper_date":"2023-02-14","arxiv_id":"2302.07387","code_links":[{"title":"amazon-science/polygon-transformer","url":"https://github.com/amazon-science/polygon-transformer"}],"syntology":{"n":6,"n_ran":5,"n_unverified":1,"n_pointer_only":6}}},{"leaderboard":"/sota/referring-expression-segmentation-on-refer","slug":"referring-expression-segmentation-on-refer","dataset":"Refer-YouTube-VOS","dataset_url":"/dataset/refer-youtube-vos","rows_in_archive":2,"metrics":["Mean IoU","Precision@0.5","Precision@0.9"],"first_row_in_archive_order":{"model":"RefVOS-Human REs","paper_title":"SynthRef: Generation of Synthetic Referring Expressions for Object Segmentation","paper_url":"/paper/synthref-generation-of-synthetic-referring","paper_date":"2021-06-08","arxiv_id":"2106.04403","code_links":[{"title":"miriambellver/refvos","url":"https://github.com/miriambellver/refvos"},{"title":"imatge-upc/synthref","url":"https://github.com/imatge-upc/synthref"}],"syntology":null}},{"leaderboard":"/sota/referring-expression-segmentation-on-1","slug":"referring-expression-segmentation-on-1","dataset":"Referring Expressions for DAVIS 2016 & 2017","dataset_url":"/dataset/referring-expressions-for-davis-2016-2017","rows_in_archive":1,"metrics":["F","J","J&F 1st frame"],"first_row_in_archive_order":{"model":"MUTR","paper_title":"Referred by Multi-Modality: A Unified Temporal Transformer for Video Object Segmentation","paper_url":"/paper/referred-by-multi-modality-a-unified-temporal","paper_date":"2023-05-25","arxiv_id":"2305.16318","code_links":[{"title":"opengvlab/mutr","url":"https://github.com/opengvlab/mutr"}],"syntology":null}},{"leaderboard":"/sota/referring-expression-segmentation-on-a2dre","slug":"referring-expression-segmentation-on-a2dre","dataset":"A2Dre test","dataset_url":"/dataset/a2d-referring-expressions","rows_in_archive":1,"metrics":["Overall IoU","Mean IoU"],"first_row_in_archive_order":{"model":"RefVos","paper_title":"RefVOS: A Closer Look at Referring Expressions for Video Object Segmentation","paper_url":"/paper/refvos-a-closer-look-at-referring-expressions","paper_date":"2020-10-01","arxiv_id":"2010.00263","code_links":[{"title":"miriambellver/refvos","url":"https://github.com/miriambellver/refvos"},{"title":"imatge-upc/refvos","url":"https://github.com/imatge-upc/refvos"}],"syntology":null}},{"leaderboard":"/sota/referring-expression-segmentation-on-clevr","slug":"referring-expression-segmentation-on-clevr","dataset":"CLEVR-Ref+","dataset_url":"/dataset/clevr-ref","rows_in_archive":1,"metrics":["IoU"],"first_row_in_archive_order":{"model":"IEP-Ref (700K prog.)","paper_title":"CLEVR-Ref+: Diagnosing Visual Reasoning with Referring Expressions","paper_url":"/paper/clevr-ref-diagnosing-visual-reasoning-with","paper_date":"2019-01-03","arxiv_id":"1901.00850","code_links":[{"title":"ruotianluo/iep-ref","url":"https://github.com/ruotianluo/iep-ref"},{"title":"arjunakula/neurips2021","url":"https://github.com/arjunakula/neurips2021"},{"title":"byahn2/clevr_ref","url":"https://github.com/byahn2/clevr_ref"}],"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":5}}},{"leaderboard":"/sota/referring-expression-segmentation-on-g-ref","slug":"referring-expression-segmentation-on-g-ref","dataset":"G-Ref val","dataset_url":null,"rows_in_archive":1,"metrics":["Overall IoU"],"first_row_in_archive_order":{"model":"MaIL","paper_title":"MaIL: A Unified Mask-Image-Language Trimodal Network for Referring Image Segmentation","paper_url":"/paper/mail-a-unified-mask-image-language-trimodal","paper_date":"2021-11-21","arxiv_id":"2111.10747","code_links":[],"syntology":null}},{"leaderboard":"/sota/referring-expression-segmentation-on-g-ref-1","slug":"referring-expression-segmentation-on-g-ref-1","dataset":"G-Ref test A","dataset_url":null,"rows_in_archive":1,"metrics":["Overall IoU"],"first_row_in_archive_order":{"model":"MaIL","paper_title":"MaIL: A Unified Mask-Image-Language Trimodal Network for Referring Image Segmentation","paper_url":"/paper/mail-a-unified-mask-image-language-trimodal","paper_date":"2021-11-21","arxiv_id":"2111.10747","code_links":[],"syntology":null}},{"leaderboard":"/sota/referring-expression-segmentation-on-g-ref-2","slug":"referring-expression-segmentation-on-g-ref-2","dataset":"G-Ref test B","dataset_url":null,"rows_in_archive":1,"metrics":["Overall IoU"],"first_row_in_archive_order":{"model":"MaIL","paper_title":"MaIL: A Unified Mask-Image-Language Trimodal Network for Referring Image Segmentation","paper_url":"/paper/mail-a-unified-mask-image-language-trimodal","paper_date":"2021-11-21","arxiv_id":"2111.10747","code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/refcoco","name":"RefCOCO","full_name":"","num_papers_in_archive":439},{"url":"/dataset/davis-2017","name":"DAVIS 2017","full_name":"DAVIS 2017","num_papers_in_archive":308},{"url":"/dataset/jhmdb","name":"JHMDB","full_name":"Joint-annotated Human Motion Data Base","num_papers_in_archive":249},{"url":"/dataset/referring-expressions-for-davis-2016-2017","name":"Referring Expressions for DAVIS 2016 & 2017","full_name":"","num_papers_in_archive":82},{"url":"/dataset/refer-youtube-vos","name":"Refer-YouTube-VOS","full_name":"","num_papers_in_archive":52},{"url":"/dataset/google-refexp","name":"Google Refexp","full_name":"","num_papers_in_archive":46},{"url":"/dataset/a2d-sentences","name":"A2D Sentences","full_name":"Sentences for the Actor-Action Dataset (A2D)","num_papers_in_archive":31},{"url":"/dataset/phrasecut","name":"PhraseCut","full_name":"","num_papers_in_archive":31},{"url":"/dataset/clevr-ref","name":"CLEVR-Ref+","full_name":"","num_papers_in_archive":17},{"url":"/dataset/a2d-referring-expressions","name":"A2Dre","full_name":"Subset of A2D Sentences which are not trivial","num_papers_in_archive":1},{"url":"/dataset/a2dre","name":"A2Dre+","full_name":"Extension of A2D sentences where trivial cases where filtered","num_papers_in_archive":1}],"subtasks":[{"url":"/task/generalized-referring-expression-segmentation","name":"Generalized Referring Expression Segmentation"},{"url":"/task/weakly-supervised-referring-expression","name":"Weakly Supervised Referring Expression Segmentation"}],"parent_tasks":[{"url":"/task/instance-segmentation","name":"Instance Segmentation"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":97,"tagged_in_all":145,"items":[{"url":"/paper/prompt-based-multi-modal-image-segmentation","title":"Image Segmentation Using Text and Image Prompts","date":"2021-12-18","arxiv_id":"2112.10003","repositories_listed":6,"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":2}},{"url":"/paper/mdetr-modulated-detection-for-end-to-end","title":"MDETR -- Modulated Detection for End-to-End Multi-Modal Understanding","date":"2021-04-26","arxiv_id":"2104.12763","repositories_listed":5,"syntology":{"n":11,"n_ran":7,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/segmentation-from-natural-language","title":"Segmentation from Natural Language Expressions","date":"2016-03-20","arxiv_id":"1603.06180","repositories_listed":4,"syntology":null},{"url":"/paper/visionreasoner-unified-visual-perception-and","title":"VisionReasoner: Unified Visual Perception and Reasoning via Reinforcement Learning","date":"2025-05-17","arxiv_id":"2505.12081","repositories_listed":3,"syntology":{"n":15,"n_ran":14,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/seg-zero-reasoning-chain-guided-segmentation","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","date":"2025-03-09","arxiv_id":"2503.06520","repositories_listed":3,"syntology":null},{"url":"/paper/seqtr-a-simple-yet-universal-network-for","title":"SeqTR: A Simple yet Universal Network for Visual Grounding","date":"2022-03-30","arxiv_id":"2203.16265","repositories_listed":3,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/clevr-ref-diagnosing-visual-reasoning-with","title":"CLEVR-Ref+: Diagnosing Visual Reasoning with Referring Expressions","date":"2019-01-03","arxiv_id":"1901.00850","repositories_listed":3,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":5}},{"url":"/paper/3d-gres-generalized-3d-referring-expression","title":"3D-GRES: Generalized 3D Referring Expression Segmentation","date":"2024-07-30","arxiv_id":"2407.20664","repositories_listed":2,"syntology":{"n":9,"n_ran":4,"n_unverified":5,"n_pointer_only":9}},{"url":"/paper/f-lmm-grounding-frozen-large-multimodal","title":"F-LMM: Grounding Frozen Large Multimodal Models","date":"2024-06-09","arxiv_id":"2406.05821","repositories_listed":2,"syntology":null},{"url":"/paper/hdc-hierarchical-semantic-decoding-with-1","title":"CoHD: A Counting-Aware Hierarchical Decoding Framework for Generalized Referring Expression Segmentation","date":"2024-05-24","arxiv_id":"2405.15658","repositories_listed":2,"syntology":null},{"url":"/paper/uniref-segment-every-reference-object-in","title":"UniRef++: Segment Every Reference Object in Spatial and Temporal Spaces","date":"2023-12-25","arxiv_id":"2312.15715","repositories_listed":2,"syntology":{"n":9,"n_ran":9,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/universal-segmentation-at-arbitrary","title":"Universal Segmentation at Arbitrary Granularity with Language Instruction","date":"2023-12-04","arxiv_id":"2312.01623","repositories_listed":2,"syntology":{"n":16,"n_ran":13,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/qwen-vl-a-frontier-large-vision-language","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","date":"2023-08-24","arxiv_id":"2308.12966","repositories_listed":2,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":2}},{"url":"/paper/gres-generalized-referring-expression-1","title":"GRES: Generalized Referring Expression Segmentation","date":"2023-06-01","arxiv_id":"2306.00968","repositories_listed":2,"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/unleashing-text-to-image-diffusion-models-for-1","title":"Unleashing Text-to-Image Diffusion Models for Visual Perception","date":"2023-03-03","arxiv_id":"2303.02153","repositories_listed":2,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/end-to-end-referring-video-object","title":"End-to-End Referring Video Object Segmentation with Multimodal Transformers","date":"2021-11-29","arxiv_id":"2111.14821","repositories_listed":2,"syntology":{"n":11,"n_ran":8,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/synthref-generation-of-synthetic-referring","title":"SynthRef: Generation of Synthetic Referring Expressions for Object Segmentation","date":"2021-06-08","arxiv_id":"2106.04403","repositories_listed":2,"syntology":null},{"url":"/paper/refvos-a-closer-look-at-referring-expressions","title":"RefVOS: A Closer Look at Referring Expressions for Video Object Segmentation","date":"2020-10-01","arxiv_id":"2010.00263","repositories_listed":2,"syntology":null},{"url":"/paper/multi-task-collaborative-network-for-joint","title":"Multi-task Collaborative Network for Joint Referring Expression Comprehension and Segmentation","date":"2020-03-19","arxiv_id":"2003.08813","repositories_listed":2,"syntology":{"n":13,"n_ran":3,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/deris-decoupling-perception-and-cognition-for","title":"DeRIS: Decoupling Perception and Cognition for Enhanced Referring Image Segmentation through Loopback Synergy","date":"2025-07-02","arxiv_id":"2507.01738","repositories_listed":1,"syntology":null},{"url":"/paper/remotesam-towards-segment-anything-for-earth","title":"RemoteSAM: Towards Segment Anything for Earth Observation","date":"2025-05-23","arxiv_id":"2505.18022","repositories_listed":1,"syntology":null},{"url":"/paper/groundingsuite-measuring-complex-multi","title":"GroundingSuite: Measuring Complex Multi-Granular Pixel Grounding","date":"2025-03-13","arxiv_id":"2503.10596","repositories_listed":1,"syntology":null},{"url":"/paper/segagent-exploring-pixel-understanding","title":"SegAgent: Exploring Pixel Understanding Capabilities in MLLMs by Imitating Human Annotator Trajectories","date":"2025-03-11","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/pixfoundation-are-we-heading-in-the-right","title":"PixFoundation: Are We Heading in the Right Direction with Pixel-level Vision Foundation Models?","date":"2025-02-06","arxiv_id":"2502.04192","repositories_listed":1,"syntology":null},{"url":"/paper/mpg-sam-2-adapting-sam-2-with-mask-priors-and","title":"MPG-SAM 2: Adapting SAM 2 with Mask Priors and Global Context for Referring Video Object Segmentation","date":"2025-01-23","arxiv_id":"2501.13667","repositories_listed":1,"syntology":{"n":16,"n_ran":9,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/internvideo2-5-empowering-video-mllms-with","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","date":"2025-01-21","arxiv_id":"2501.12386","repositories_listed":1,"syntology":null},{"url":"/paper/the-devil-is-in-temporal-token-high-quality","title":"The Devil is in Temporal Token: High Quality Video Reasoning Segmentation","date":"2025-01-15","arxiv_id":"2501.08549","repositories_listed":1,"syntology":null},{"url":"/paper/densely-connected-parameter-efficient-tuning","title":"Densely Connected Parameter-Efficient Tuning for Referring Image Segmentation","date":"2025-01-15","arxiv_id":"2501.08580","repositories_listed":1,"syntology":{"n":17,"n_ran":7,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/multi-task-visual-grounding-with-coarse-to","title":"Multi-task Visual Grounding with Coarse-to-Fine Consistency Constraints","date":"2025-01-12","arxiv_id":"2501.06710","repositories_listed":1,"syntology":{"n":13,"n_ran":5,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/ipdn-image-enhanced-prompt-decoding-network","title":"IPDN: Image-enhanced Prompt Decoding Network for 3D Referring Expression Segmentation","date":"2025-01-09","arxiv_id":"2501.04995","repositories_listed":1,"syntology":null}],"syntology_records":16,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}