{"url":"/dataset/youtube-vis-2021-validation","name":"YouTube-VIS 2021","full_name":"Video Instance Segmentation on YouTube-VIS 2021 validation","description_markdown":"3,859 high-resolution YouTube videos, 2,985 training videos, 421 validation videos and 453 test videos.\r\nAn improved 40-category label set by merging eagle and owl into bird, ape into monkey, deleting hands, and adding flying disc, squirrel and whale\r\n8,171 unique video instances\r\n232k high-quality manual annotations","description_withheld":null,"homepage":"https://youtube-vos.org/dataset/vis/","introduced_date":"2019-05-12","introduced_date_note":null,"introduced_by":{"paper":"/paper/video-instance-segmentation","title":"Video Instance Segmentation","first_author":"Linjie Yang","url":null},"license":{"name":"Creative Commons Attribution 4.0 License","url":"https://creativecommons.org/licenses/by/4.0/"},"modalities":[{"name":"Videos","url":"/datasets/modality/videos"}],"tasks":[{"name":"Video Instance Segmentation","url":"/task/video-instance-segmentation","datasets_with_task":"/datasets/task/video-instance-segmentation"}],"languages":[],"variants":["YouTube-VIS 2021"],"data_loaders":[],"num_papers_in_archive":52,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/video-instance-segmentation-on-youtube-vis-2","task":"Video Instance Segmentation","dataset_variant":"YouTube-VIS 2021","rows":26,"metrics":["mask AP","AP50","AP75","AR1","AR10"],"first_row_in_archive_order":{"model":"CAVIS(VIT-L, Offline)","paper":"/paper/context-aware-video-instance-segmentation","metrics":{"AP50":"87.3","AP75":"73.2","AR1":"49.7","AR10":"70.3","mask AP":"65.3"},"code_links":[{"title":"Seung-Hun-Lee/CAVIS","url":"https://github.com/Seung-Hun-Lee/CAVIS"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/context-aware-video-instance-segmentation","title":"Context-Aware Video Instance Segmentation","date":"2024-07-03","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/dvis-daq-improving-video-segmentation-via","title":"DVIS-DAQ: Improving Video Segmentation via Dynamic Anchor Queries","date":"2024-03-29","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":1,"samples_unverified":4,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/univs-unified-and-universal-video","title":"UniVS: Unified and Universal Video Segmentation with Prompts as Queries","date":"2024-02-28","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":14,"samples_ran":12,"samples_unverified":2,"pointer_only_for_licence":14,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/dvis-improved-decoupled-framework-for","title":"DVIS++: Improved Decoupled Framework for Universal Video Segmentation","date":"2023-12-20","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/novis-a-case-for-end-to-end-near-online-video","title":"NOVIS: A Case for End-to-End Near-Online Video Instance Segmentation","date":"2023-08-29","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/refinevis-video-instance-segmentation-with","title":"RefineVIS: Video Instance Segmentation with Temporal Attention Refinement","date":"2023-06-07","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/dvis-decoupled-video-instance-segmentation","title":"DVIS: Decoupled Video Instance Segmentation Framework","date":"2023-06-06","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/gratt-vis-gated-residual-attention-for-auto","title":"GRAtt-VIS: Gated Residual Attention for Auto Rectifying Video Instance Segmentation","date":"2023-05-26","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/boxvis-video-instance-segmentation-with-box","title":"BoxVIS: Video Instance Segmentation with Box Annotations","date":"2023-03-26","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/mdqe-mining-discriminative-query-embeddings","title":"MDQE: Mining Discriminative Query Embeddings to Segment Occluded Instances on Challenging Videos","date":"2023-03-25","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":3,"samples_unverified":1,"pointer_only_for_licence":4,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/tube-link-a-flexible-cross-tube-baseline-for","title":"Tube-Link: A Flexible Cross Tube Framework for Universal Video Segmentation","date":"2023-03-22","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/tarvis-a-unified-approach-for-target-based","title":"TarViS: A Unified Approach for Target-based Video Segmentation","date":"2023-01-06","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":0,"samples_unverified":6,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/a-generalized-framework-for-video-instance","title":"A Generalized Framework for Video Instance Segmentation","date":"2022-11-16","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/instanceformer-an-online-video-instance","title":"InstanceFormer: An Online Video Instance Segmentation Framework","date":"2022-08-22","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/minvis-a-minimal-video-instance-segmentation","title":"MinVIS: A Minimal Video Instance Segmentation Framework without Video-based Training","date":"2022-08-03","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/devis-making-deformable-transformers-work-for","title":"DeVIS: Making Deformable Transformers Work for Video Instance Segmentation","date":"2022-07-22","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":11,"samples_ran":2,"samples_unverified":9,"pointer_only_for_licence":11,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/in-defense-of-online-models-for-video","title":"In Defense of Online Models for Video Instance Segmentation","date":"2022-07-21","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":3,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/vita-video-instance-segmentation-via-object","title":"VITA: Video Instance Segmentation via Object Token Association","date":"2022-06-09","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":0,"samples_unverified":7,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/spatial-feature-calibration-and-temporal","title":"Spatial Feature Calibration and Temporal Fusion for Effective One-stage Video Instance Segmentation","date":"2021-04-06","rows_on_this_dataset":1,"code_links":1,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":7,"samples_harvested":52,"samples_ran":21,"samples_unverified":31,"pointer_only_for_licence":32,"papers_with_no_sample_that_ran":2,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}