{"url":"/task/video-instance-segmentation","name":"Video Instance Segmentation","slug":"video-instance-segmentation","description_markdown":"The goal of video instance segmentation is simultaneous detection, segmentation and tracking of instances in videos. In words, it is the first time that the image instance segmentation problem is extended to the video domain.\r\n\r\nTo facilitate research on this new task, a large-scale benchmark called YouTube-VIS, which consists of 2,883 high-resolution YouTube videos, a 40-category label set and 131k high-quality instance masks is built.","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":148,"papers_with_code":94,"benchmarks":8,"benchmark_tables_in_archive":8,"benchmark_tables_shown":8,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":8,"subtasks":0,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/video-instance-segmentation-on-ovis-1","slug":"video-instance-segmentation-on-ovis-1","dataset":"OVIS validation","dataset_url":"/dataset/ovis","rows_in_archive":44,"metrics":["mask AP","AP50","AP75","APho","APmo","AR1","APso","AR10"],"first_row_in_archive_order":{"model":"DVIS-DAQ(VIT-L, Offline)","paper_title":"DVIS-DAQ: Improving Video Segmentation via Dynamic Anchor Queries","paper_url":"/paper/dvis-daq-improving-video-segmentation-via","paper_date":"2024-03-29","arxiv_id":"2404.00086","code_links":[{"title":"zhang-tao-whu/DVIS","url":"https://github.com/zhang-tao-whu/DVIS"},{"title":"zhang-tao-whu/DVIS_Plus","url":"https://github.com/zhang-tao-whu/DVIS_Plus"},{"title":"skyworkai/daq-vs","url":"https://github.com/skyworkai/daq-vs"}],"syntology":{"n":5,"n_ran":1,"n_unverified":4,"n_pointer_only":3}}},{"leaderboard":"/sota/video-instance-segmentation-on-youtube-vis-1","slug":"video-instance-segmentation-on-youtube-vis-1","dataset":"YouTube-VIS validation","dataset_url":"/dataset/youtubevis","rows_in_archive":44,"metrics":["mask AP","AP50","AP75","AR1","AR10"],"first_row_in_archive_order":{"model":"CAVIS(ViT-L, Online)","paper_title":"Context-Aware Video Instance Segmentation","paper_url":"/paper/context-aware-video-instance-segmentation","paper_date":"2024-07-03","arxiv_id":"2407.03010","code_links":[{"title":"Seung-Hun-Lee/CAVIS","url":"https://github.com/Seung-Hun-Lee/CAVIS"}],"syntology":null}},{"leaderboard":"/sota/video-instance-segmentation-on-youtube-vis-2","slug":"video-instance-segmentation-on-youtube-vis-2","dataset":"YouTube-VIS 2021","dataset_url":"/dataset/youtube-vis-2021-validation","rows_in_archive":26,"metrics":["mask AP","AP50","AP75","AR1","AR10"],"first_row_in_archive_order":{"model":"CAVIS(VIT-L, Offline)","paper_title":"Context-Aware Video Instance Segmentation","paper_url":"/paper/context-aware-video-instance-segmentation","paper_date":"2024-07-03","arxiv_id":"2407.03010","code_links":[{"title":"Seung-Hun-Lee/CAVIS","url":"https://github.com/Seung-Hun-Lee/CAVIS"}],"syntology":null}},{"leaderboard":"/sota/video-instance-segmentation-on-youtube-vis-3","slug":"video-instance-segmentation-on-youtube-vis-3","dataset":"Youtube-VIS 2022 Validation","dataset_url":"/dataset/youtube-vis-2022-validation","rows_in_archive":7,"metrics":["mAP_L","AP50_L","AP75_L","AR1_L","AR10_L"],"first_row_in_archive_order":{"model":"DVIS++(VIT-L)","paper_title":"DVIS++: Improved Decoupled Framework for Universal Video Segmentation","paper_url":"/paper/dvis-improved-decoupled-framework-for","paper_date":"2023-12-20","arxiv_id":"2312.13305","code_links":[{"title":"zhang-tao-whu/DVIS_Plus","url":"https://github.com/zhang-tao-whu/DVIS_Plus"}],"syntology":null}},{"leaderboard":"/sota/video-instance-segmentation-on-bdd100k-val","slug":"video-instance-segmentation-on-bdd100k-val","dataset":"BDD100K val","dataset_url":"/dataset/bdd100k","rows_in_archive":6,"metrics":["mMOTSA"],"first_row_in_archive_order":{"model":"PCAN","paper_title":"Prototypical Cross-Attention Networks for Multiple Object Tracking and Segmentation","paper_url":"/paper/prototypical-cross-attention-networks-for","paper_date":"2021-06-22","arxiv_id":"2106.11958","code_links":[{"title":"SysCV/pcan","url":"https://github.com/SysCV/pcan"}],"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/video-instance-segmentation-on-hq-ytvis","slug":"video-instance-segmentation-on-hq-ytvis","dataset":"HQ-YTVIS","dataset_url":"/dataset/hq-ytvis","rows_in_archive":4,"metrics":["Tube-Boundary AP"],"first_row_in_archive_order":{"model":"VMT (Swin-L)","paper_title":"Video Mask Transfiner for High-Quality Video Instance Segmentation","paper_url":"/paper/video-mask-transfiner-for-high-quality-video","paper_date":"2022-07-28","arxiv_id":"2207.14012","code_links":[{"title":"SysCV/vmt","url":"https://github.com/SysCV/vmt"}],"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/video-instance-segmentation-on-youtube-vis","slug":"video-instance-segmentation-on-youtube-vis","dataset":"YouTube-VIS","dataset_url":"/dataset/youtubevis","rows_in_archive":1,"metrics":["mask AP"],"first_row_in_archive_order":{"model":"Temporal ROI Align","paper_title":"Temporal RoI Align for Video Object Recognition","paper_url":"/paper/temporal-roi-align-for-video-object","paper_date":"2021-09-08","arxiv_id":"2109.03495","code_links":[{"title":"open-mmlab/mmtracking","url":"https://github.com/open-mmlab/mmtracking"}],"syntology":null}},{"leaderboard":"/sota/video-instance-segmentation-on-youtube-vis-4","slug":"video-instance-segmentation-on-youtube-vis-4","dataset":"Youtube-VIS (trained with no video masks)","dataset_url":null,"rows_in_archive":1,"metrics":["AP"],"first_row_in_archive_order":{"model":"MaskFreeVIS","paper_title":"Mask-Free Video Instance Segmentation","paper_url":"/paper/mask-free-video-instance-segmentation","paper_date":"2023-03-28","arxiv_id":"2303.15904","code_links":[{"title":"syscv/maskfreevis","url":"https://github.com/syscv/maskfreevis"}],"syntology":{"n":8,"n_ran":0,"n_unverified":8,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/bdd100k","name":"BDD100K","full_name":"","num_papers_in_archive":469},{"url":"/dataset/youtubevis","name":"YouTube-VIS 2019","full_name":"","num_papers_in_archive":163},{"url":"/dataset/ovis","name":"OVIS","full_name":"Occluded Video Instance Segmentation","num_papers_in_archive":75},{"url":"/dataset/youtube-vis-2021-validation","name":"YouTube-VIS 2021","full_name":"Video Instance Segmentation on YouTube-VIS 2021 validation","num_papers_in_archive":52},{"url":"/dataset/uvo","name":"UVO","full_name":"Unidentified Video Objects: A Benchmark for Dense, Open-World Segmentation","num_papers_in_archive":27},{"url":"/dataset/burst","name":"BURST","full_name":"","num_papers_in_archive":18},{"url":"/dataset/youtube-vis-2022-validation","name":"Youtube-VIS 2022 Validation","full_name":"","num_papers_in_archive":6},{"url":"/dataset/hq-ytvis","name":"HQ-YTVIS","full_name":"","num_papers_in_archive":5}],"subtasks":[],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":94,"tagged_in_all":148,"items":[{"url":"/paper/simple-online-and-realtime-tracking-with-a","title":"Simple Online and Realtime Tracking with a Deep Association Metric","date":"2017-03-21","arxiv_id":"1703.07402","repositories_listed":75,"syntology":{"n":40,"n_ran":12,"n_unverified":28,"n_pointer_only":7}},{"url":"/paper/mask2former-for-video-instance-segmentation","title":"Mask2Former for Video Instance Segmentation","date":"2021-12-20","arxiv_id":"2112.10764","repositories_listed":6,"syntology":{"n":7,"n_ran":2,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/video-instance-segmentation","title":"Video Instance Segmentation","date":"2019-05-12","arxiv_id":"1905.04804","repositories_listed":6,"syntology":{"n":11,"n_ran":3,"n_unverified":8,"n_pointer_only":1}},{"url":"/paper/queryinst-parallelly-supervised-mask-query","title":"Instances as Queries","date":"2021-05-05","arxiv_id":"2105.01928","repositories_listed":5,"syntology":{"n":3,"n_ran":1,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/dvis-daq-improving-video-segmentation-via","title":"DVIS-DAQ: Improving Video Segmentation via Dynamic Anchor Queries","date":"2024-03-29","arxiv_id":"2404.00086","repositories_listed":3,"syntology":{"n":5,"n_ran":1,"n_unverified":4,"n_pointer_only":3}},{"url":"/paper/temporally-efficient-vision-transformer-for","title":"Temporally Efficient Vision Transformer for Video Instance Segmentation","date":"2022-04-18","arxiv_id":"2204.08412","repositories_listed":3,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/internvideo2-scaling-video-foundation-models","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","date":"2024-03-22","arxiv_id":"2403.15377","repositories_listed":2,"syntology":null},{"url":"/paper/spatio-temporal-prompting-network-for-robust-1","title":"Spatio-temporal Prompting Network for Robust Video Feature Extraction","date":"2024-02-04","arxiv_id":"2402.02574","repositories_listed":2,"syntology":null},{"url":"/paper/minvis-a-minimal-video-instance-segmentation","title":"MinVIS: A Minimal Video Instance Segmentation Framework without Video-based Training","date":"2022-08-03","arxiv_id":"2208.02245","repositories_listed":2,"syntology":null},{"url":"/paper/in-defense-of-online-models-for-video","title":"In Defense of Online Models for Video Instance Segmentation","date":"2022-07-21","arxiv_id":"2207.10661","repositories_listed":2,"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/mlseg-image-and-video-segmentation-as-multi","title":"RankSeg: Adaptive Pixel Classification with Image Category Ranking for Segmentation","date":"2022-03-08","arxiv_id":"2203.04187","repositories_listed":2,"syntology":{"n":11,"n_ran":2,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/seqformer-a-frustratingly-simple-model-for","title":"SeqFormer: Sequential Transformer for Video Instance Segmentation","date":"2021-12-15","arxiv_id":"2112.08275","repositories_listed":2,"syntology":null},{"url":"/paper/d2conv3d-dynamic-dilated-convolutions-for","title":"D2Conv3D: Dynamic Dilated Convolutions for Object Segmentation in Videos","date":"2021-11-15","arxiv_id":null,"repositories_listed":2,"syntology":null},{"url":"/paper/1st-place-solution-for-the-uvo-challenge-on-1","title":"UVO Challenge on Video-based Open-World Segmentation 2021: 1st Place Solution","date":"2021-10-22","arxiv_id":"2110.11661","repositories_listed":2,"syntology":null},{"url":"/paper/revisiting-contrastive-methods-for","title":"Revisiting Contrastive Methods for Unsupervised Learning of Visual Representations","date":"2021-06-10","arxiv_id":"2106.05967","repositories_listed":2,"syntology":null},{"url":"/paper/occluded-video-instance-segmentation","title":"Occluded Video Instance Segmentation: A Benchmark","date":"2021-02-02","arxiv_id":"2102.01558","repositories_listed":2,"syntology":null},{"url":"/paper/end-to-end-video-instance-segmentation-with","title":"End-to-End Video Instance Segmentation with Transformers","date":"2020-11-30","arxiv_id":"2011.14503","repositories_listed":2,"syntology":null},{"url":"/paper/thinkvideo-high-quality-reasoning-video","title":"ThinkVideo: High-Quality Reasoning Video Segmentation with Chain of Thoughts","date":"2025-05-24","arxiv_id":"2505.18561","repositories_listed":1,"syntology":null},{"url":"/paper/syncvis-synchronized-video-instance","title":"SyncVIS: Synchronized Video Instance Segmentation","date":"2024-12-01","arxiv_id":"2412.00882","repositories_listed":1,"syntology":null},{"url":"/paper/foundation-models-for-amodal-video-instance","title":"Foundation Models for Amodal Video Instance Segmentation in Automated Driving","date":"2024-09-21","arxiv_id":"2409.14095","repositories_listed":1,"syntology":null},{"url":"/paper/mousesis-a-frames-and-events-dataset-for","title":"MouseSIS: A Frames-and-Events Dataset for Space-Time Instance Segmentation of Mice","date":"2024-09-05","arxiv_id":"2409.03358","repositories_listed":1,"syntology":null},{"url":"/paper/eigen-cluster-vis-improving-weakly-supervised","title":"Improving Weakly-supervised Video Instance Segmentation by Leveraging Spatio-temporal Consistency","date":"2024-08-29","arxiv_id":"2408.16661","repositories_listed":1,"syntology":null},{"url":"/paper/unified-embedding-alignment-for-open","title":"Unified Embedding Alignment for Open-Vocabulary Video Instance Segmentation","date":"2024-07-10","arxiv_id":"2407.07427","repositories_listed":1,"syntology":null},{"url":"/paper/context-aware-video-instance-segmentation","title":"Context-Aware Video Instance Segmentation","date":"2024-07-03","arxiv_id":"2407.03010","repositories_listed":1,"syntology":null},{"url":"/paper/pm-vis-high-performance-video-instance","title":"PM-VIS+: High-Performance Video Instance Segmentation without Video Annotation","date":"2024-06-28","arxiv_id":"2406.19665","repositories_listed":1,"syntology":null},{"url":"/paper/clip-vis-adapting-clip-for-open-vocabulary","title":"CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance Segmentation","date":"2024-03-19","arxiv_id":"2403.12455","repositories_listed":1,"syntology":null},{"url":"/paper/univs-unified-and-universal-video","title":"UniVS: Unified and Universal Video Segmentation with Prompts as Queries","date":"2024-02-28","arxiv_id":"2402.18115","repositories_listed":1,"syntology":{"n":14,"n_ran":12,"n_unverified":2,"n_pointer_only":14}},{"url":"/paper/tdvit-temporal-dilated-video-transformer-for","title":"TDViT: Temporal Dilated Video Transformer for Dense Video Tasks","date":"2024-02-14","arxiv_id":"2402.09257","repositories_listed":1,"syntology":null},{"url":"/paper/instance-brownian-bridge-as-texts-for-open","title":"Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation","date":"2024-01-18","arxiv_id":"2401.09732","repositories_listed":1,"syntology":null},{"url":"/paper/dvis-improved-decoupled-framework-for","title":"DVIS++: Improved Decoupled Framework for Universal Video Segmentation","date":"2023-12-20","arxiv_id":"2312.13305","repositories_listed":1,"syntology":null}],"syntology_records":9,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}