{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/k-means-for-unsupervised-instance","title":"K-means for unsupervised instance segmentation using a self-supervised transformer","arxiv_id":null,"date":"2022-10-04","proceeding":"Pattern Recognition 2022 10","authors":["Lim SeongTaek","Park JaeEon","Lee MinYoung","Lee HongChul"],"abstract":"Instance segmentation is a fundamental task in computer vision that assigns every pixel to an\r\nappropriate class and localizes objects into bounding boxes. However, collecting pixel-level segmentation labels is more resource- and time-consuming than collecting classification and detection\r\nlabels. Herein, we present a novel approach, iterative mask refinement using a self-supervised\r\ntransformer (IMST), which performs class agnostic unsupervised instance segmentation using simple K-means clustering and a self-supervised vision transformer. IMST generates pseudo-ground-truth labels that can be used to train an off-the-shelf instance segmentation model. The pseudo labels\r\ndemonstrate improved performance on multiple datasets. The instance segmentation model trained\r\non the pseudo labels outperforms state-of-the-art unsupervised instance segmentation methods on\r\nCOCO20k (+4.0 average precision (AP)) and COCO val2017(+2.6 AP) without modifications to\r\nthe training loss or architecture. We demonstrate that our method can be extended to tasks such as\r\nsingle/multiple object discovery and supervised fine-tuning instance segmentation while outperforming previous methods.","url_abs":"https://papers.ssrn.com/sol3/papers.cfm?abstract_id=4251338","url_pdf":"https://papers.ssrn.com/sol3/Delivery.cfm/456a55bb-5b72-49b6-be69-b5f39b85c44c-MECA.pdf?abstractid=4251338&mirid=1","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"instance-segmentation","task_name":"Instance Segmentation"},{"task_slug":"object-detection","task_name":"Object Detection"},{"task_slug":"object-discovery","task_name":"Object Discovery"},{"task_slug":"segmentation","task_name":"Segmentation"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"},{"task_slug":"single-object-discovery","task_name":"Single-object discovery"},{"task_slug":"unsupervised-instance-segmentation","task_name":"Unsupervised Instance Segmentation"}],"methods":[{"method_slug":"attention","method_name":"Attention"},{"method_slug":"dino","method_name":"DINO"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"vision-transformer","method_name":"Vision Transformer"},{"method_slug":"k-means-clustering","method_name":"k-Means Clustering"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/single-object-discovery-on-coco-20k","task":"Single-object discovery","dataset":"COCO_20k","model":"IMST","rank_in_archive_order":1,"of":10,"metrics":{"CorLoc":"72.2"},"uses_additional_data":false}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}