{"url":"/method/vos","slug":"vos","name":"VOS","full_name":"VOS","full_name_withheld":false,"description_markdown":"**VOS** is a type of video object segmentation model consisting of two network components. The target appearance model consists of a light-weight module, which is learned during the inference stage using fast optimization techniques to predict a coarse but robust target segmentation. The segmentation model is exclusively trained offline, designed to process the coarse scores into high quality segmentation masks.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Learning Fast and Robust Target Models for Video Object Segmentation","paper":"/paper/learning-fast-and-robust-target-models-for","first_author":"Andreas Robinson","n_authors":5,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/learning-fast-and-robust-target-models-for"},"source":{"url":"https://arxiv.org/abs/2003.00908v2","title":"Learning Fast and Robust Target Models for Video Object Segmentation","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Video Object Segmentation Models","url":"/methods/category/video-object-segmentation-models","pwc_aliases":[]}],"n_papers_tagged":117,"archive_num_papers":117,"papers_newest_first":[{"paper":"/paper/videomolmo-spatio-temporal-grounding-meets","title":"VideoMolmo: Spatio-Temporal Grounding Meets Pointing","date":"2025-06-05","arxiv_id":"2506.05336","n_code_links":1,"syntology":null},{"paper":null,"title":"Foundations of Unknown-aware Machine Learning","date":"2025-05-20","arxiv_id":"2505.14933","n_code_links":0,"syntology":null},{"paper":null,"title":"RGB-D Video Object Segmentation via Enhanced Multi-store Feature Memory","date":"2025-04-23","arxiv_id":"2504.16471","n_code_links":0,"syntology":null},{"paper":null,"title":"FVOS for MOSE Track of 4th PVUW Challenge: 3rd Place Solution","date":"2025-04-13","arxiv_id":"2504.09507","n_code_links":0,"syntology":null},{"paper":"/paper/glus-global-local-reasoning-unified-into-a","title":"GLUS: Global-Local Reasoning Unified into A Single Large Language Model for Video Segmentation","date":"2025-04-10","arxiv_id":"2504.07962","n_code_links":1,"syntology":{"ran":3,"of":12,"unverified":9,"pointer_only":12}},{"paper":null,"title":"Zero-Shot 4D Lidar Panoptic Segmentation","date":"2025-04-01","arxiv_id":"2504.00848","n_code_links":0,"syntology":null},{"paper":null,"title":"An Analysis of Data Transformation Effects on Segment Anything 2","date":"2025-02-25","arxiv_id":"2503.00042","n_code_links":0,"syntology":null},{"paper":"/paper/efficient-track-anything","title":"Efficient Track Anything","date":"2024-11-28","arxiv_id":"2411.18933","n_code_links":1,"syntology":{"ran":0,"of":1,"unverified":1,"pointer_only":0}},{"paper":null,"title":"Addressing Issues with Working Memory in Video Object Segmentation","date":"2024-10-29","arxiv_id":"2410.22451","n_code_links":0,"syntology":null},{"paper":"/paper/x-prompt-multi-modal-visual-prompt-for-video","title":"X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation","date":"2024-09-28","arxiv_id":"2409.19342","n_code_links":1,"syntology":{"ran":3,"of":3,"unverified":0,"pointer_only":3}},{"paper":null,"title":"LSVOS Challenge Report: Large-scale Complex and Long Video Object Segmentation","date":"2024-09-09","arxiv_id":"2409.05847","n_code_links":0,"syntology":null},{"paper":null,"title":"Discriminative Spatial-Semantic VOS Solution: 1st Place Solution for 6th LSVOS","date":"2024-08-29","arxiv_id":"2408.16431","n_code_links":0,"syntology":null},{"paper":null,"title":"CSS-Segment: 2nd Place Report of LSVOS Challenge VOS Track","date":"2024-08-24","arxiv_id":"2408.13582","n_code_links":0,"syntology":null},{"paper":null,"title":"LSVOS Challenge 3rd Place Report: SAM2 and Cutie based VOS","date":"2024-08-20","arxiv_id":"2408.10469","n_code_links":0,"syntology":null},{"paper":null,"title":"UNINEXT-Cutie: The 1st Solution for LSVOS Challenge RVOS Track","date":"2024-08-19","arxiv_id":"2408.10129","n_code_links":0,"syntology":null},{"paper":null,"title":"Video Object Segmentation via SAM 2: The 4th Solution for LSVOS Challenge VOS Track","date":"2024-08-19","arxiv_id":"2408.10125","n_code_links":0,"syntology":null},{"paper":"/paper/improving-unsupervised-video-object-1","title":"Improving Unsupervised Video Object Segmentation via Fake Flow Generation","date":"2024-07-16","arxiv_id":"2407.11714","n_code_links":0,"syntology":null},{"paper":null,"title":"RMem: Restricted Memory Banks Improve Video Object Segmentation","date":"2024-06-12","arxiv_id":"2406.08476","n_code_links":0,"syntology":null},{"paper":null,"title":"Training-Free Robust Interactive Video Object Segmentation","date":"2024-06-08","arxiv_id":"2406.05485","n_code_links":0,"syntology":null},{"paper":null,"title":"A Semi-Self-Supervised Approach for Dense-Pattern Video Object Segmentation","date":"2024-06-07","arxiv_id":"2406.05131","n_code_links":0,"syntology":null},{"paper":null,"title":"3rd Place Solution for MOSE Track in CVPR 2024 PVUW workshop: Complex Video Object Segmentation","date":"2024-06-06","arxiv_id":"2406.03668","n_code_links":0,"syntology":null},{"paper":null,"title":"One-shot Training for Video Object Segmentation","date":"2024-05-22","arxiv_id":"2405.14010","n_code_links":0,"syntology":null},{"paper":null,"title":"Global Motion Understanding in Large-Scale Video Object Segmentation","date":"2024-05-11","arxiv_id":"2405.07031","n_code_links":0,"syntology":null},{"paper":null,"title":"Space-time Reinforcement Network for Video Object Segmentation","date":"2024-05-07","arxiv_id":"2405.04042","n_code_links":0,"syntology":null},{"paper":"/paper/lvos-a-benchmark-for-large-scale-long-term","title":"LVOS: A Benchmark for Large-scale Long-term Video Object Segmentation","date":"2024-04-30","arxiv_id":"2404.19326","n_code_links":1,"syntology":null},{"paper":null,"title":"PM-VIS: High-Performance Box-Supervised Video Instance Segmentation","date":"2024-04-22","arxiv_id":"2404.13863","n_code_links":0,"syntology":null},{"paper":"/paper/dynamic-in-static-hybrid-visual","title":"Dynamic in Static: Hybrid Visual Correspondence for Self-Supervised Video Object Segmentation","date":"2024-04-21","arxiv_id":"2404.13505","n_code_links":1,"syntology":null},{"paper":"/paper/event-assisted-low-light-video-object","title":"Event-assisted Low-Light Video Object Segmentation","date":"2024-04-02","arxiv_id":"2404.01945","n_code_links":1,"syntology":null},{"paper":"/paper/rethinking-low-quality-optical-flow-in","title":"Motion-Boundary-Driven Unsupervised Surgical Instrument Segmentation in Low-Quality Optical Flow","date":"2024-03-15","arxiv_id":"2403.10039","n_code_links":1,"syntology":null},{"paper":null,"title":"OneVOS: Unifying Video Object Segmentation with All-in-One Transformer Framework","date":"2024-03-13","arxiv_id":"2403.08682","n_code_links":0,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/video-object-segmentation","name":"Video Object Segmentation","papers":104},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":103},{"task":"/task/video-semantic-segmentation","name":"Video Semantic Segmentation","papers":102},{"task":"/task/object","name":"Object","papers":67},{"task":"/task/segmentation","name":"Segmentation","papers":58},{"task":"/task/semi-supervised-video-object-segmentation","name":"Semi-Supervised Video Object Segmentation","papers":33},{"task":"/task/video-segmentation","name":"Video Segmentation","papers":15},{"task":"/task/optical-flow-estimation","name":"Optical Flow Estimation","papers":13},{"task":"/task/unsupervised-video-object-segmentation","name":"Unsupervised Video Object Segmentation","papers":8},{"task":"/task/visual-object-tracking","name":"Visual Object Tracking","papers":8},{"task":"/task/object-detection","name":"Object Detection","papers":7},{"task":"/task/one-shot-visual-object-segmentation","name":"One-shot visual object segmentation","papers":7},{"task":"/task/referring-video-object-segmentation","name":"Referring Video Object Segmentation","papers":7},{"task":"/task/object-detection-1","name":"object-detection","papers":6},{"task":"/task/instance-segmentation","name":"Instance Segmentation","papers":5},{"task":"/task/object-tracking","name":"Object Tracking","papers":5},{"task":"/task/autonomous-driving","name":"Autonomous Driving","papers":4},{"task":"/task/image-segmentation","name":"Image Segmentation","papers":4},{"task":"/task/referring-expression-segmentation","name":"Referring Expression Segmentation","papers":4},{"task":"/task/salient-object-detection-1","name":"Salient Object Detection","papers":4}],"tasks_shown":20,"n_tasks":76,"usage_by_year":[{"year":"2020","papers":7},{"year":"2021","papers":22},{"year":"2022","papers":19},{"year":"2023","papers":37},{"year":"2024","papers":25},{"year":"2025","papers":7}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/vos"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}